业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律

学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。

老板指着一个候选模型问:“这模型能不能上我们的客服业务?“你回答:“MMLU 88.7。“——这是答非所问。学术分数量的是模型强不强,业务要问的是这套系统接进我的流量之后,会以哪些方式翻车、翻车了我知不知道。业务评测的覆盖范围,就是把所有翻车方式提前枚举,每种配一个可观测的信号。

这篇是评测系列的「覆盖范围」篇。此前的评测路由篇回答”评测信号怎么用”,施工图数据规格书实操教程平台产品化回答”评测系统怎么搭”。但有个更上游的问题一直没正面回答:评测到底要测什么?测到什么程度算覆盖住了?这篇补上这一格。

先立坐标系:HELM 教的不是分数,是画格子

回答”覆盖哪些范围”之前,先偷一个方法论。斯坦福 HELM(Holistic Evaluation of Language Models, arXiv 2211.09110)最大的贡献不是那张榜单,而是一个动作:先自顶向下画出「场景 × 指标」的分类格子图,再往格子里填数——没填的空格显式地留在图上

这个动作解决的根本问题是:在 HELM 之前,评测是”数据集的堆积”——你手上有什么 benchmark 就跑什么,测没测全没人知道。论文给了个扎心的数字:HELM 之前,主流模型平均只在 17.9% 的核心场景上被评测过,有些知名模型之间没有任何一个共同场景,根本没法比;HELM 把这个覆盖率拉到 96.0%。同一篇论文还证明了为什么”单指标跑榜”危险:准确率最高的模型不是最鲁棒的——530B 的 TNLG v2 在 NarrativeQA 上标准准确率 72.6%,加上扰动后跌到 38.9%。

业务评测继承这个动作,但要换掉两样东西:格子的(HELM 的 16 个学术场景换成你的业务场景切片)和格子的(7 个学术指标换成业务关心的翻车方式)。我把”列”整理成三族十格——这是我基于文献的整理框架,不是哪篇论文的原文分类。每格沿用本系列的四段式:根本问题 → 源头论文 → 业务动作 → 收敛度判断(✅ 方法已收敛可直接抄 / ⚠️ 有工具但质量定义未收敛,需自己兜底)。

A 族·答案层:模型说出来的东西对不对

① 任务能力对齐:把”强不强”换成”在我的分布上行不行”

根本问题:通用榜单的题目分布和你的业务分布几乎不相交。客服业务不考奥数,风控业务不考写诗。

源头论文:HELM(2211.09110)的场景分类法——场景 =(任务, 领域, 语言)三元组。这个定义直接可抄:把你的业务拆成”退款咨询 × 中文 × 老年用户”这样的三元组切片,每个切片配一份 golden set。判定标准能形式化的任务收敛最快——SWE-bench 用测试用例判代码、IFEval 用可验证指令判服从性,都是”让判定跑程序而不是跑感觉”。

业务动作:自建 golden set,来源是真实流量脱敏采样(怎么从网关 Trace 变成评测集,见数据规格书篇)。切片粒度对齐业务 SLA 的粒度:SLA 按业务线签,切片就按业务线分。

收敛度:✅(方法)/ 永久自建(数据)。分类法、采样、判分工具全部成熟;但 golden set 本身没有任何供应商能替你做——你的任务分布就是你的私有资产,这半格永远不会收敛成外包品。

② 事实性与忠实度:说得对,还是说得像?

根本问题:语言模型的训练目标是”像人写的”,不是”是真的”。TruthfulQA(arXiv 2109.07958)用 817 道、38 类人类常见误解题证明:最好的模型只有 58% 的回答真实(人类 94%),而且模型越大越会复读人类的误解——规模不解决事实性,这是逆缩放的经典证据。

源头论文:业务上更常见的形态是 RAG——模型答案必须忠实于检索到的证据。RAGAS(arXiv 2309.15217)把 RAG 评测拆成三个免人工标注的维度:忠实度(答案是否被上下文支撑)、答案相关性(答没答到点上)、上下文相关性(检索回来的东西干不干净)。这三元组已经成为 RAG 评测的事实标准。

业务动作:凡是有知识库的业务,评测报告必须有独立的忠实度列——它和”答得好不好”是两个正交的翻车方式:答案流畅优美但引用了不存在的条款,是客服业务最贵的事故类型。

收敛度:⚠️。三维度框架收敛,但忠实度的自动判定本身依赖 LLM 判官(见第⑧格),判官的坑会传染到这里。

③ 校准与拒答:错了不可怕,错得自信才可怕

根本问题:业务系统需要模型”知道自己不知道”,才能把低置信度请求转人工。Anthropic 的 Kadavath 等人(Language Models (Mostly) Know What They Know, arXiv 2207.05221)给了乐观的一半:大模型在选择题/判断题上校准良好,可以让模型输出 P(True)(自评答案正确的概率)和 P(IK)(“我知道这题”的概率);也给了悲观的一半:这种校准跨任务泛化会打折——在 A 任务上校准好的模型,换到 B 任务上置信度就不可信了。

业务动作:把校准曲线(置信度 vs 实际正确率)画进评测报告;用它标定”低于多少置信度转人工”的阈值。注意悲观的那一半:阈值必须按业务切片分别标定,不能全局一个数。

收敛度:⚠️。测量方法成熟(HELM 七指标里就有 calibration),跨任务泛化未解,阈值标定是持续性工作而非一次性动作。

B 族·行为层:系统在真实世界的压力下怎么动

④ 可靠性与一致性:单次成功 ≠ 可交付

根本问题:演示跑通一次就上线,是业务评测最经典的翻车。τ-bench(arXiv 2406.12045)用零售/航司两个域的模拟用户对话测工具型 Agent(判定标准极硬核:对话结束后数据库终态是否等于标注的目标终态),并提出了业务评测里最值得抄的指标:pass^k——同一任务独立跑 k 次全部成功的概率。论文实测:gpt-4o 在零售域单次成功率(pass^1)约 61%,但 pass^8 掉到 25% 以下。

这里有个值得亲手算的细节。如果每次试验独立同质(每个任务成功率都是 p=0.61),那么:

pass8=0.6181.9%\text{pass}^8 = 0.61^8 \approx 1.9\%

但实测是 ~25%,远高于 1.9%。这个偏差本身就是诊断信号(数学上是 Jensen 不等式:E[pk](E[p])kE[p^k] \ge (E[p])^k)。用一个两成分混合分布就能复现实测量级:假设 25% 的任务模型稳定做对(p=1),剩下 75% 的任务 p=0.48,则 pass^1 = 0.25 + 0.75×0.48 = 0.61,而 pass^8 = 0.25 + 0.75×0.48⁸ ≈ 25.2%(以上数字我用脚本验算过)。业务解读:pass^k 曲线衰减比指数慢,说明失败不是均匀的骰子,而是聚集在固定的任务子集上——是系统性的、可修的;反过来若衰减贴着指数走,失败是随机的,得从温度、流程约束下手。曲线形状告诉你该修任务还是该修流程。

业务动作:核心业务场景的评测一律 n 次采样(n≥3),报告按任务聚合的 pass^k,不报单次。Agent 类业务参照 τ-bench 把判定挂在终态上而不是对话内容上(为什么”只看回答”不够,另见 AgentBench 学习笔记)。

收敛度:✅。pass^k 已被后续基准广泛采纳,成本是采样次数的线性倍数,买的是”可靠性”这个业务最在乎的量。

⑤ 鲁棒性:用户不会好好说话

根本问题:golden set 里的题目语法正确、表述清晰;真实用户带错别字、方言、情绪和火星文。PromptRobust(arXiv 2306.04528,原名 PromptBench)在字符/词/句/语义四个层级构造了 4,788 条模拟真实用户错误(错别字、同义替换等)的对抗提示,结论:当代 LLM 对这类扰动普遍不鲁棒,且被扰动的提示会把模型注意力拽向扰动本身。配合前面 HELM 那个 72.6%→38.9% 的跌幅,这格不测等于裸奔。

业务动作:给 golden set 做扰动增广——每条原始 query 生成错别字版、口语版、情绪版,鲁棒性分数 = 扰动集分数 / 原始集分数。这个比值比绝对分数更有信息量。

收敛度:⚠️。扰动工具成熟,但”哪些扰动代表你的用户”没有通用答案——扰动分布和任务分布一样是私有知识。

⑥ 安全与对抗:恶意用户也在你的分布里

根本问题:上一格的用户是无意的,这一格的用户是故意的。HarmBench(arXiv 2402.04249)把 18 种自动红队攻击方法对 33 个模型/防御做了大规模对撞,两个对业务最重要的结论:没有任何攻击或防御是普遍有效的鲁棒性和模型大小无关——换更大的模型不解决安全问题。

业务动作:维护业务专属红队集(通用越狱 + 你的领域禁区,如金融业务的投资建议诱导),并把安全评测挂进发布门禁——安全格子的分数是 go/no-go 信号而不是参考信息。网关层怎么放置安全分类器,见AI 网关解剖篇的防护层。

收敛度:⚠️。评测框架收敛(HarmBench 本身就是标准化产物),但攻防是军备竞赛,红队集需要持续更新,“测过”的有效期很短。

⑦ 成本与延迟:每个分数都要带价签

根本问题:没有价签的评测报告会系统性地把你推向最贵的模型。FrugalGPT(arXiv 2305.05176)指出商用 API 价差达两个数量级,并证明用级联策略能在保持 GPT-4 水平准确率的同时砍掉最多 98% 成本——这个结论成立的前提,恰恰是评测数据里有成本列,否则级联的路由决策无从谈起。

业务动作:评测报告加三列:$/query、P50/P95 延迟、tokens。质量分数相同的两个模型,这三列决定选谁;质量差 2 分但便宜 30 倍的模型,值得为它单开一个业务切片验证(这正是评测路由篇”路由器是评测器的蒸馏”的输入原料)。

收敛度:✅。美元和毫秒是物理量,测量方法零争议;HELM 七指标里的 efficiency 也早已把它标准化。

C 族·元层:评测本身可信吗

⑧ 评判者效度:谁来给分,分可信吗

根本问题:①②⑤格的主观质量判定大规模依赖 LLM-as-a-Judge,那判官自己就成了被测对象。MT-Bench(arXiv 2306.05685)用 3K 专家投票验证:GPT-4 判官与人类一致率超过 80%——和人与人之间的一致率相当,这是”LLM 当判官”可行性的奠基证据;但同一篇论文也点名了三种系统性偏差:位置偏差(偏爱先出现的答案)、冗长偏差(偏爱长答案)、自我增强偏差(偏爱自家输出)。G-Eval(arXiv 2303.16634)用思维链+表单填空把摘要任务的人机相关性做到 Spearman 0.514(当时的最好水平),但作者自己警告:LLM 判官偏爱 LLM 生成的文本——用判官分数去优化模型,可能在优化”更像 LLM”而不是”更好”。

业务动作:判官必须配”对齐率监控”——每期评测抽样 5–10% 由人复核,人机一致率低于阈值就触发判官 prompt/模型的重新校准;成对比较时交换位置跑两遍。这是评测平台该内建的机制,不是评测人员的自觉。

收敛度:⚠️。“判官可用”收敛,“判官可信的维护成本”不收敛——偏差清单已知但没有根治方案。

⑨ 可复现性与污染:分数是测出来的,还是配置出来的?

根本问题:EleutherAI 的 lm-eval 团队用三年评测基础设施经验写成的 Lessons from the Trenches(arXiv 2405.14782)证词:模型分数对评测设置(prompt 模板、few-shot 数目、解码参数、答案抽取正则)高度敏感,同一模型换一套设置分数可以差出一截——不锁设置的两次评测没有可比性。另一个坑是污染:公开 benchmark 大概率进过训练集,分数是背诵不是能力。

业务动作:评测配置全部版本化(这正是 lm-eval 作为”编排层”的设计动机);golden set 定期换血,用真实流量的新样本做”污染免疫”的对照组——自建集的一个隐藏红利是天然不在任何训练集里,但前提是你别把它发到公网。

收敛度:⚠️。工程纪律部分收敛(harness 工具成熟),污染检测本身仍是开放问题。

⑩ 离线—在线一致性:榜单分数 ≠ 线上口碑

根本问题:离线评测的题目是死的,线上用户的需求是活的。Chatbot Arena(arXiv 2403.04132)是这格的方法论范本:真实用户盲测成对比较投票,Bradley–Terry 模型(Elo 的推广)把 24 万+票聚合成带置信区间的排名。它证明的不只是”哪个模型好”,而是偏好信号可以从真实使用中低成本地持续采集——这个机制业务完全可以内化:你的”竞技场”就是 A/B 分流,你的”投票”就是用户的采纳/重试/差评。

业务动作:新模型/新 prompt 上线走 A/B,把线上信号(采纳率、人工接管率、差评率)和离线分数放同一张看板对照——长期背离就说明离线格子图缺了一格,把背离样本回流成新的评测切片。发布流程怎么分级放量,见门禁篇ADR 解剖篇的金丝雀状态机。

收敛度:⚠️。A/B 方法论来自互联网工业、完全成熟;不收敛的是”用户偏好 ≈ 业务价值”这个假设——用户可能偏爱嘴甜的错误答案(冗长偏差在人类身上同样存在,MT-Bench 已证)。

十格怎么沿生命周期安置

十个格子不是同时测、测一次的。按”离线开发 → 发布门禁 → 在线运行”三阶段安置,元层垫底、失败样本回流闭环:

flowchart TD
    subgraph OFF["离线开发期"]
        direction LR
        A1["① 任务能力·golden set"] ~~~ A2["② 事实性与忠实度"] ~~~ A4["④ 可靠性 pass^k"]
        A5["⑤ 鲁棒性扰动集"] ~~~ A6["⑥ 安全红队集"]
    end
    subgraph GATE["发布门禁期"]
        direction LR
        G1["版本回归对比"] ~~~ G2["⑦ 成本延迟预算检查"] ~~~ G3["⑥ 安全分数 go/no-go"]
    end
    subgraph ON["在线运行期"]
        direction LR
        O1["⑩ A/B 与偏好信号"] ~~~ O2["③ 校准阈值→拒答/转人工"] ~~~ O3["漂移监控"]
    end
    LOOP["背离样本回流:变成 ① 的新评测切片"]
    META["⑧ 评判者效度 + ⑨ 可复现性<br>元层地基·三阶段共用"]
    OFF --> GATE
    GATE --> ON
    ON -. "离线在线长期背离" .-> LOOP
    OFF -.-> META
    GATE -.-> META
    ON -.-> META

注意那条虚线回流边:它是整张图里唯一让评测集自我生长的机制。离线格子图永远落后于线上分布,追平的办法不是一次画对,而是让背离样本持续回流。

总表:十格覆盖清单

#格子根本问题一句话锚论文业务动作收敛度
任务能力对齐学术分布 ≠ 业务分布HELM 2211.09110业务切片 × 自建 golden set✅ 方法 / 数据永久自建
事实性与忠实度说得像 ≠ 说得对TruthfulQA 2109.07958、RAGAS 2309.15217独立的忠实度列⚠️
校准与拒答错得自信最贵Kadavath et al. 2207.05221校准曲线 → 转人工阈值⚠️
可靠性一致性单次成功 ≠ 可交付τ-bench 2406.12045n 次采样报 pass^k
鲁棒性用户不好好说话PromptRobust 2306.04528扰动增广 + 比值分数⚠️
安全对抗恶意用户在分布里HarmBench 2402.04249红队集挂发布门禁⚠️
成本延迟没价签必选最贵FrugalGPT 2305.05176报告加 $/query、P95 列
评判者效度判官也要被评测MT-Bench 2306.05685、G-Eval 2303.16634人工抽检对齐率监控⚠️
可复现与污染分数可能是配置出来的Trenches 2405.14782配置版本化 + 集子换血⚠️
离线在线一致性榜单 ≠ 口碑Chatbot Arena 2403.04132A/B 对照 + 背离回流⚠️

总表读出一个二阶规律,和测试篇的 Oracle 梯度定律严丝合缝:三个 ✅(任务判定、pass^k、成本延迟)全部是判定标准可形式化的格子——数据库终态、全对与否、美元毫秒;七个 ⚠️ 全部卡在质量真值无法形式化——什么算忠实、什么算安全、判官信不信得过。收敛度沿着 Oracle 梯度分布,评测覆盖图就是 Oracle 梯度的等高线图。

元规律:显式空格定律

把 HELM 的方法论动作推广成一条定律(这是我的读法,不是文献共识):

业务评测的第一产出不是分数,而是一张空格显式的格子图。未测的格子不等于没风险,等于未定价的风险。

呼应 ADR 解剖篇的保险类比:评测覆盖图就是你给模型系统签的承保范围清单——十个格子是十种险种,测了的格子是定过价的保单,空着的格子是你在裸险。裸险不一定错(低风险业务可以理性地不买鲁棒性险),错的是不知道自己在裸险。所以格子图的价值排序是:显式的空格 > 填了数的格子 > 隐形的空格。

这也是指标向量化定律在评测域的镜像:外行给模型一个分数(“这模型 88 分”),内行给每种翻车方式一个独立的格子——成熟度 = “模型好不好”这个标量被分解为按翻车方式索引的向量的程度。而SLO 全家福篇说过”评测是 Agent 云缺失的 SLO 等价物”——这张十格图,就是给那个缺失等价物拟的承保条款草稿。

诚实的提醒

  • 本文所有论文数字(HELM 的 17.9%→96.0% 与 72.6%→38.9%、TruthfulQA 的 58% vs 94%、τ-bench 的 61% 与 pass^8<25%、MT-Bench 的 80% 一致率、G-Eval 的 0.514、FrugalGPT 的 98%、PromptRobust 的 4,788 条)都来自当日核实的论文原文/摘要,均未亲手复现
  • pass^k 的混合分布手算(0.61⁸≈1.9%、25%+75%×0.48 混合给出 pass⁸≈25.2%)是我用脚本验算过的示例,用于说明机制;τ-bench 论文并未给出这个分解,真实的任务难度分布比两成分混合复杂。
  • 三族十格的分类框架、显式空格定律、“Oracle 梯度等高线”的读法,是我的整理与推断,不是文献共识。
  • 成本最低的亲手验证实验:取 20 条你的真实业务 query(脱敏),用 Inspect AI 实操篇的脚手架对任一便宜模型每题采样 3 次:(a)按任务聚合算 pass^3,看失败是聚集还是随机——这点亮第④格;(b)同时让一个 LLM 判官给 60 个回答打分,人工复核其中 10 条算人机一致率——这点亮第⑧格。一次实验、两格覆盖,成本不到一杯咖啡。

参考来源

arXiv 论文(均于 2026-08-11 检索核实):

本站相关文章