有人在评论区问:除了 τ-bench,还有哪些值得盯的大模型 bench?——这个问题其实比表面看着深。你不是在问一张清单,你是在问「大模型能力到底可以从哪些角度测」。这篇按能力轴把 2020-2026 还在被读的 bench 摆到一张地图上,每个 bench 讲清测什么、修了哪条前代短板、饱和到哪一步、主要批评在哪里。
一句话主线
每一个新 bench 都是对上一代 bench 「饱和 + 污染」的响应。所以看 bench 不能只看名字和分数,要看它站在这条循环的哪一格。看清了这一点,你就知道为什么 τ-bench 会存在——因为静态 QA 型 bench 已经被吃穿了,测量必须换轴到「让 agent 在带策略约束的多轮世界里替人办事」。
名词速查
深度文默认在导语后放这一格;这些词后文会反复出现。
| 术语 | 一句话解释 |
|---|---|
| 饱和 (saturation) | 模型在某个 bench 上的分数逼近上限(往往是 95%+),继续跑就分不出前后了 |
| 污染 (contamination) | 测试集或高度相似样本进过训练语料。模型不是学会了任务,是记住了答案 |
| held-out / private set | 组织者保留不公开的测试集,专门抵抗污染。代价是不能被独立复现 |
| pass@k | 采 k 次至少一次正确的概率。用无偏估计公式从 n 次样本反推 |
| pass^k / consistency@k | 反过来:同一任务重跑 k 次全部成功的概率。τ-bench 首创,测的是稳定性不是运气 |
| LLM-as-judge | 用另一个大模型给回答打分,替代人工。省钱但有 position、verbosity、self-enhancement 偏差(见站内MT-Bench 笔记) |
| agent scaffold | 包裹模型的循环:工具、检索、reflection、planner。同一模型换 scaffold 分数可以差 15+ 分 |
| execution-based eval | 不看输出文本长得像不像答案,看运行后世界状态是否命中目标(如 SWE-bench 跑测试、τ-bench 比数据库) |
根本约束:为什么 bench 只能长成现在这样
一句话:凡是能被公开发布的静态题库,最终都会被下一代模型的训练语料吞掉。这条物理事实压着整个 bench 生态的形状。
反事实测试:假如这条约束不存在——比如所有测评题都能永久保密——今天不会有 HLE、不会有 LiveCodeBench、不会有 τ-bench,我们仍然在用 GLUE 和 SuperGLUE 排名。事实上从 2020 年到 2026 年,主流 bench 换过至少三代能力轴,每一次都是同一批症状在推:分数顶到天花板,加上一次可疑的题目泄漏。
这也是Goodhart 定律的 ML 版——一个度量一旦成为优化目标,就不再是好度量。所以本文没有「哪个 bench 最权威」这种问句,只有「你测的是哪一层,用哪一档 bench 是够的」。
一张时间线:三代能力轴
timeline
title 大模型 bench 的三代能力轴
section 第一代:知识与考试
2018 : GLUE / SuperGLUE
2020 : MMLU
2021 : HumanEval / MATH / GSM8K
2022 : BIG-Bench
section 第二代:硬推理与工具
2023 : GPQA / AgentBench / GAIA
2023 : MT-Bench / IFEval / SWE-bench
2024 : MMLU-Pro / LiveCodeBench / RULER
2024 : τ-bench / OSWorld / BFCL v3
section 第三代:饱和后的抗污染换轴
2024 : FrontierMath / SWE-bench Verified
2025 : HLE / ARC-AGI-2 / τ²-bench
2025 : ARC-Prize / SWE-bench Multimodal
三代不是严格切断——第一代很多还在跑,只是不再单独决定一个模型算不算前沿。看新模型的 model card,前排永远是第二、三代。
地图:十二条能力轴上的 bench
每一格按同一格式写:测什么 / 修了前代什么 / 现在饱和到哪一步 / 主要批评。名字都按原论文原始命名核过,能给 arXiv 的都给了。
1. 通用知识与考试
- MMLU (Hendrycks 2020, arXiv:2009.03300):57 学科 4 选一,测跨学科知识。修了什么:把「一堆分散小 QA 集」合成一个跨领域可比的大表。饱和度:顶级模型 88–90%+,题目泄漏和 shortcut 都有报告。批评:4 选一,猜对基线 25%;不少题背下来就行。
- MMLU-Pro (Wang 2024, arXiv:2406.01574):10 选一,加入推理型题,14 学科。修了什么:MMLU 顶天了、随 prompt 抖动大。MMLU-Pro 把 shortcut 空间从 25% 压到 10%,CoT 现在能显著加分。饱和度:前沿模型 2026 中期 82%+,还没顶但接近。批评:仍是选择题,测不了开放推理。
- BIG-Bench / BIG-Bench Hard (Srivastava 2022, arXiv:2206.04615 / Suzgun 2022, arXiv:2210.09261):204 个任务集合、其中 23 个人类还能明显领先的选进 BBH。修了什么:MMLU 只有一种题型,BB 系列是「所有难题合集」,用于早期涌现能力研究。饱和度:BBH 已经饱和。批评:任务异质、可复现性差、不好用一个数总结。
- GPQA / GPQA Diamond (Rein 2023, arXiv:2311.12022):448 道生化物理研究生级题,Diamond 是最难 198 道子集。修了什么:MMLU 的「本科考试」升到「PhD Google 都搜不出来」。饱和度:Diamond 上前沿模型 2026 中期已经稳定在 70%+,进入饱和边缘。批评:题目量小,泄漏风险随时间线性上升。
- Humanity’s Last Exam / HLE (Phan 2025, arXiv:2501.14249):Scale AI + CAIS,2500 道横跨数十学科的专家题,含多模态和私有测试集。修了什么:MMLU/GPQA 都要顶了,Scale 直接众包一批专家出题、私集抗污染。饱和度:发布时前沿模型不到 10%,作者自己预测「2025 年末可能过 50%」。批评:LLM-as-judge 提取答案,评测方法本身可疑;OpenAI 对部分题有优先访问权。
- ARC-AGI / ARC-AGI-2 (Chollet 2019, arXiv:1911.01547 / Chollet 2025, arXiv:2505.11831):视觉网格上的新颖抽象推理任务。修了什么:所有其他 bench 测的是 skill,ARC 测的是 fluid intelligence——从没见过的规则里学。饱和度:ARC-AGI-1 在 2024 年被 o3 高算力预算下打到 87.5%;ARC-AGI-2 上 Kaggle 冠军 24%,人类基线接近 100%。批评:网格化导致「感知瓶颈」被质疑,可能测的不完全是推理。ARC Prize 2025 技术报告承认现有 LLM 推理仍受知识覆盖约束。
2. 硬推理与数学
- GSM8K (Cobbe 2021, arXiv:2110.14168):8.5K 小学水平应用题。修了什么:从「算数题会不会做」升到「多步链条会不会走对」。饱和度:前沿模型 95%+,2024 年后主要用来 sanity-check,不再当核心指标。批评:GSM-Symbolic / GSM1k 系列显示替换变量名就能显著掉分,说明部分是模式匹配。
- MATH / MATH-500 (Hendrycks 2021, arXiv:2103.03874):12.5K 高中竞赛题,7 主题。修了什么:GSM8K 太简单,MATH 才需要真的写符号推导。MATH-500 是常用的 500 题子集,跑得快。饱和度:前沿推理模型(o 系列、Claude 4.x、Gemini 2.5+)已经 95%+。批评:竞赛题体裁单一,且已被广泛抓入训练集。
- AIME(美国高中数学邀请赛,每年 15 道简答):修了什么:MATH 顶掉之后,用真人年度考卷做时间隔离。饱和度:AIME 2024 前沿模型接近满分,AIME 2025 也已被 o 系列打穿。批评:15 道题方差大,一年一次,动态性靠年度更新维持。
- FrontierMath (Glazer 2024, arXiv:2411.04872):Epoch AI 组织 60+ 数学家写的研究级题,含 Tier 1-4 + Open Problems,绝大多数题不公开。修了什么:MATH/AIME 顶掉之后,把难度推到「一个博士要几小时到几天」。饱和度:发布时 <2%,2025 年中 Tier 1-3 上出现 10-20% 分数。批评:OpenAI 对部分题有优先访问,评测公平性受质疑。
- PutnamBench / MiniF2F / OlympiadBench:三个数学形式化/竞赛延伸集,用 Lean/Isabelle 做形式化证明或严格 grading。修了什么:文本答案对不对好判,证明对不对难判——形式化把 grading 变成机器可验证。批评:形式化 harness 复杂,模型能力和 harness 能力混在一起。
3. 代码 · 函数级
- HumanEval (Chen 2021, arXiv:2107.03374):164 道 Python 函数完形填空。修了什么:Codex 论文首次系统化用 execution-based grading(跑单测)替代 BLEU。同一篇论文也提出了 pass@k 无偏估计。饱和度:Claude 3.5 后基本 95%+。批评:题小、单文件、大量泄漏;EvalPlus 通过加测试用例把伪 pass 抓出来。
- MBPP / MBPP+:974 道基础 Python 题(Austin 2021),加强版本由 EvalPlus 提供更严 tests。修了什么:HumanEval 太少,MBPP 补量。饱和度:与 HumanEval 类似饱和。批评:同上。
- LiveCodeBench (Jain 2024, arXiv:2403.07974):从 LeetCode / AtCoder / Codeforces 持续拉新题,按题目发布日期切窗。修了什么:HumanEval/MBPP 泄漏。LiveCodeBench 用时间隔离:只测模型训练截止后发布的题。饱和度:新题窗口下前沿模型仍在 60-75% 范围。批评:题依然是算法题,不测软件工程;平台自己也有污染路径(模型可能通过题解博客学到)。
- BigCodeBench (Zhuo 2024, arXiv:2406.15877):1140 道跨 139 个真实库、7 领域的 Python 任务;BigCodeBench-Hard 是难题子集。修了什么:HumanEval 全是自包含函数,工程里你要 pandas + requests + sklearn 组合。BigCodeBench 强制多库组合和长指令。饱和度:前沿模型 Hard 子集仍在 40% 附近。批评:库版本漂移让复现变难。
- HumanEval+ / MBPP+ (EvalPlus):不是新题,是给老题加 80×测试用例。修了什么:一堆看起来对但过不了严格 test 的伪 pass。是 execution-based eval 的最小成本护栈。
4. 代码 · 仓库级 / 软件工程 agent
- SWE-bench (Jimenez 2023, arXiv:2310.06770):12 个 Python 仓库、2294 个真实 GitHub issue,要在整个 repo 里改多文件并跑测试。修了什么:HumanEval 是「写函数」,SWE-bench 是「在真代码库里定位并修 bug」。这是从代码生成到软件工程的转折。参见站内SWE-bench 学习笔记。饱和度:full split 尚未饱和;但 model + scaffold 顶端已达 50%+。批评:训练集大概率见过部分 commit。
- SWE-bench Verified(OpenAI 2024 blog):500 道经人工验证的子集,去掉 flaky / 描述不清题。修了什么:原 SWE-bench 里有不少任务本身 test 就 flaky,让分数被噪声主导。饱和度:2026 年中期顶端已 70%+,2026-09 Fable 5.1 之类新模型带来一次跳升,但争议持续:近期研究质疑到底测的是能力还是记忆。批评:同一模型换 scaffold(如 Agentless vs SWE-agent vs Aider)分差 15+ 分,看榜必须看 scaffold。这是我自己在给别人复现 baseline 时踩过的一个大坑——用错 harness 的话,「模型强不强」这个结论直接反过来。
- SWE-bench Lite (swebench.com/lite):300 道子集,用于快速 iteration。批评:分布收窄,前沿模型上区分度弱。
- SWE-bench Multimodal (Yang 2024, arXiv:2410.03859):包含截图、GUI 元素的 JS/TS repo 517 道(v2 480 道)。修了什么:SWE-bench 全 Python 全后端,前端仓库里 bug 描述本身就有截图,需要读图。
- Aider Polyglot (aider.chat/leaderboards):225 道 Exercism 题,多语言(Python/JS/Go/Rust/C++ 等)。修了什么:HumanEval 只有 Python,Aider 检查多语言泛化。批评:仍是自包含题,接近 HumanEval 而非 SWE-bench。
5. 工具调用与真实事务 agent
这一层就是 τ-bench 所在的能力轴——给你一堆工具、一份策略文档、一个用户,能不能替他真的把事办对。
- BFCL v1/v2/v3 (Gorilla, ICML 2025):Berkeley Function Calling Leaderboard。v1 单轮、v2 用户投稿、v3 多轮多步。修了什么:早期 tool use 测「能不能选对 API 名」;BFCL 加入参数匹配、缺失参数、缺失函数、并行调用、v3 加多轮状态追踪。饱和度:v3 多轮最好的闭源模型 47.6%,公开模型多在 10% 附近。批评:AST-based grading 抓不全语义等价,且 API mock 与真实差异大。
- τ-bench / τ¹-bench (Yao 2024, arXiv:2406.12045):Sierra,两大领域(airline / retail),LLM 扮演用户与 agent 交互,成功=最终数据库状态匹配 ground truth。修了什么:BFCL 是单轮 or 有限轮 tool call,τ-bench 加入真用户 + 策略文档 + 数据库状态三件套。pass^k 是它的原创贡献:同一任务重跑 k 次都得对,用来测稳定性。原论文中 GPT-4 类模型 pass@1 <50%、pass^8 只有 25% 左右——不是不会做,是做不稳。饱和度:pass@1 顶端 2026 年 60-70%,pass^4 仍显著低。批评:LLM 扮演的用户可预测,真人不这么讲话。
- τ²-bench (Barres 2025, arXiv:2506.07982):加入 telecom 领域,共 3 域,最大变化是dual-control——用户和 agent 都能调工具。同一个仓库现在已经推进到 τ³-bench(加银行、加语音)。修了什么:τ¹ 只有 agent 能操作数据库,τ² 让 telecom 里用户自己也要按引导操作,测的是 agent 的引导能力,不只是执行能力。
- AgentBench (Liu 2023, arXiv:2308.03688):8 类环境(OS、DB、KG、卡牌、家居、web、web shopping、LLM-generated puzzle),交互式打分。修了什么:GAIA 和 τ-bench 之前的多环境 agent 综合评测雏形。批评:环境异质、分数聚合方式受争议。参见站内AgentBench 学习笔记。
- GAIA (Mialon 2023, arXiv:2311.12983):466 道真实生活助理题,需要浏览器 + 工具 + 多模态。三档难度,Level 3 是长链多步。修了什么:MMLU 是考试题,GAIA 是「帮我查这三个数据源交叉核实」这种日常。饱和度:Level 1 已经 80%+,Level 3 仍在 30-40% 徘徊。批评:静态数据集,网页会变(linkrot),验证集靠人工重打。
- ToolBench / ToolLLM (Qin 2023, arXiv:2307.16789):16k+ RapidAPI 工具,测大规模工具选择。修了什么:BFCL 只有几十个手写工具,ToolBench 冲量。批评:API 稳定性差、多数题可以走近似解题目。
- AppWorld (Trivedi 2024, ACL 2024):模拟 9 个 App 的沙盒(含 456 个 API),749 道跨 app 任务。修了什么:GAIA 仍是网页 QA,AppWorld 是「打开手机 App 帮我改 3 件事」的模拟器,含状态 + 副作用。
6. Web / OS / GUI agent
- WebArena (Zhou 2023, arXiv:2307.13854):可自托管的 4 类真实感网站(电商、论坛、Gitea、CMS),812 道任务。修了什么:Mind2Web 只标注了截图和 action trace,WebArena 是可执行的环境。饱和度:论文里 GPT-4 baseline 只有 14.4%,2025 年 BrowserGym 类 harness 把顶部拉到 25%+。批评:网站还是 mock,真实互联网千姿百态。
- VisualWebArena (Koh 2024, arXiv:2401.13649):WebArena 的多模态升级,任务里有图。
- Mind2Web (Deng 2023, arXiv:2306.06070):2350 条真实网站 trace 的静态测评。修了什么:早期真实网页 grounding 的 baseline。批评:静态、不可交互。
- OSWorld (Xie 2024, arXiv:2404.07972):Ubuntu/Windows/macOS 真操作系统沙盒,369 道跨 app 任务(文件、浏览器、办公软件),全靠鼠标键盘。修了什么:WebArena 只测浏览器,OSWorld 测的是「电脑 GUI 全能」。饱和度:人类 72%,最好模型 12.24%(论文时点);2025 年 UI-TARS / Operator 之类 harness 提升明显。批评:GUI grounding 依然是主要瓶颈。
- WorkArena (Drouin 2024, arXiv:2403.07718):ServiceNow 平台上模拟企业办公任务。修了什么:真实企业 SaaS 的 GUI 操作,比 WebArena 的电商更接近 B 端 workload。
7. 长上下文
- NIAH / Needle in a Haystack (gkamradt 2023):一句「针」插进长文本,问模型能不能找回。修了什么:早期 128k+ 上下文的第一个可视化压力测试。批评:只测浅层检索,会造成「看起来很强」的错觉。
- RULER (Hsieh 2024, NVIDIA, arXiv:2404.06654):合成 4 类任务(多针检索、多跳追踪、聚合、QA),可任意配长度。修了什么:NIAH 太简单,RULER 加了多针、变量追踪、summarization 代理。饱和度:论文测 17 个长上下文模型,NIAH 全过、RULER 上大多数模型在 32k 之后崩。批评:合成任务不够贴真实长文档场景。
- LongBench (Bai 2023, arXiv:2308.14508):真实长文档 QA + 摘要 + few-shot 学习,双语。批评:与 RULER 相比更贴真实但更难标准化。
- InfiniteBench / ∞Bench (Zhang 2024, arXiv:2402.13718):100k+ token 的 12 类任务,含数学、代码、检索。
- BABILong (Kuratov 2024, arXiv:2406.10149):把 bAbI 的推理链嵌进百万级 token 里。修了什么:长上下文里的推理能力,而不只是检索。
8. 多模态
- MMMU / MMMU-Pro (Yue 2023, arXiv:2311.16502 / Yue 2024, arXiv:2409.02813):11.5k 道大学专业课多模态题,含图表、化学结构、乐谱等 30 类图。修了什么:MMLU 只有文本,MMMU 补上 VLM 的「专业课」考试。饱和度:前沿 VLM 65%+,仍未顶。
- MathVista (Lu 2023, arXiv:2310.02255):图上数学。修了什么:MATH 全文本,MathVista 测「看图列式」。
- ChartQA (Masry 2022, arXiv:2203.10244):图表 QA。修了什么:让 VLM 真的读柱状图和折线,而不是猜。
- DocVQA / InfographicVQA:文档理解和信息图。
- MMBench (Liu 2023, arXiv:2307.06281):细粒度 20 类 VLM 能力评测,circular eval 抗顺序偏见。
- MME:多模态感知与认知的双轴打分。
9. 指令跟随 / 人类偏好
- IFEval (Zhou 2023, arXiv:2311.07911):约 500 条可程序化验证的指令题(字数限制、格式约束、关键词包含等)。修了什么:MT-Bench 靠 LLM-judge 打分,IFEval 全部机器判分,去掉 judge 偏差。参见站内IFEval 学习笔记。
- MT-Bench (Zheng 2023, arXiv:2306.05685):80 道两轮对话题,GPT-4 当 judge 打分。参见站内LLM-as-Judge 学习笔记。批评:judge 偏差、题量太小。
- Chatbot Arena / LMArena (Chiang 2024, arXiv:2403.04132):700 万+ 真人盲测 A/B。修了什么:静态题终会泄漏,真人偏好是滚动的。批评:受长度、格式、语气偏见影响;Arena 现在有 style-control 榜作为对照。
- AlpacaEval 2.0 (Dubois 2024, arXiv:2404.04475):自动化 win-rate,用长度控制去掉 verbosity bias。
- Arena-Hard-Auto (Li 2024, LMSYS):500 道高区分度题从 Chatbot Arena 中挖出,用 GPT-4 judge 打分,声称与真人榜有高相关。
10. 安全 / 红队 / 事实性
- TruthfulQA (Lin 2021, arXiv:2109.07958):817 道容易触发错误信念的题。修了什么:MMLU 只测知识对错,TruthfulQA 测「模型会不会附和常见误解」。饱和度:前沿模型仍不完美,但选择题版本容易被 prompt 技巧刷分。
- HarmBench (Mazeika 2024, arXiv:2402.04249):标准化 red-teaming 评测框架,含标准、版权、上下文、多模态四类行为。修了什么:早期 AdvBench 只有 harmful string list,HarmBench 把攻击者、目标行为、分类器都标准化了。
- JailbreakBench (Chao 2024, arXiv:2404.01318):越狱攻击/防御可复现测试床,含 leaderboard。
- XSTest (Röttger 2023, arXiv:2308.01263):250 道看起来不安全但其实合法的请求(如「怎么杀死 Python 进程」),测过度拒绝。修了什么:只测越狱不够,还要测模型是不是过分保守。
- AdvBench (Zou 2023, arXiv:2307.15043):早期 harmful behavior 字符串集合,多用作攻击基线。
11. RAG / 检索 / 嵌入
- MTEB (Muennighoff 2022, arXiv:2210.07316):Massive Text Embedding Benchmark,8 类任务、58 数据集。修了什么:BEIR 只测 retrieval,MTEB 加入 clustering、classification、reranking、STS 等。
- BEIR (Thakur 2021, arXiv:2104.08663):18 个异构 IR 数据集的零样本检索。
- HotpotQA (Yang 2018, arXiv:1809.09600):多跳 QA 常用来测 RAG。批评:题老,已被广泛训练。
- RAG 系统级评测(RAGAS-style):更多是流水线指标框架而非单一 bench——常见维度包括 faithfulness、answer relevance、context precision/recall。
12. 中文与本地化
- C-Eval (Huang 2023, arXiv:2305.08322):52 学科 13.9k 中文考试题,含难度分层。修了什么:MMLU 全英文,C-Eval 是中文对应物。
- CMMLU (Li 2023, arXiv:2306.09212):67 主题 11.5k 中文多任务题。与 C-Eval 覆盖有差异。
- SuperCLUE(cluebenchmarks.com):滚动更新的中文综合榜,含开放对话。
- AGIEval (Zhong 2023, arXiv:2304.06364):18 项人类考试(高考、法考、SAT 等),中英双语。
- GAOKAO-Bench(github.com/OpenLMLab/GAOKAO-Bench):把中国近几年高考真题做成测试集。
- CMMMU (Zhang 2024, arXiv:2401.11944):MMMU 的中文版。
一个可复现的手算:pass@k 到底怎么算
τ-bench 的 pass^k 概念读起来抽象,先把它爸爸 pass@k 走一遍。Codex 论文 里的无偏估计公式是:
其中 n 是每题采样数,c 是 n 次里通过的次数。我跑一段一次性脚本验算:
from math import comb
def pass_at_k(n, c, k):
if n - c < k: return 1.0
return 1.0 - comb(n - c, k) / comb(n, k)
| n | c | k | pass@k | 「c/n 直接乘 k」的直觉估计 |
|---|---|---|---|---|
| 10 | 3 | 1 | 0.3000 | 0.30 |
| 10 | 3 | 5 | 0.9167 | 1.00(截断) |
| 10 | 3 | 10 | 1.0000 | 1.00 |
| 200 | 25 | 10 | 0.7455 | 1.00(截断) |
看第 2 行:直觉会说「30% 命中率跑 5 次差不多 100% 中」,但组合数告诉你其实只有 91.67%。差距来自「有放回 vs 抽样不放回」——同一次采样样本已经用掉不能重复算。这就是为什么 pass@k 是无偏估计而不是简单相乘。
τ-bench 的 pass^k 是反过来:k 次采样全部通过的概率。同一模型 pass@1=60% 时,pass^4 可能只有 15%——因为多轮 agent 的失败模式极不独立,一次错手往往连环。所以在 agent 层看 bench,pass^k 比 pass@k 有信息得多。
一个我踩过的坑:SWE-bench Verified 的 scaffold 陷阱
看 SWE-bench Verified 榜单时,最容易掉的坑是把模型分数和 harness 分数混在一起。同一个 Claude 3.5 Sonnet,用 Agentless(无 agent loop、纯 planner-then-patch)跑出来的分和用 SWE-agent(带循环工具、反射、多回合)跑出来的分,可以差 15+ 个百分点。
判据:看榜的时候永远先看提交条目的 harness 名(榜单上叫 “System”)。同一个 “Model X” 出现两次不奇怪,那是不同 scaffold 在跑。选型时你要问自己一件事:上榜的 harness 是不是你打算在生产里用的那个?不是,那这个分对你就是 apples-to-oranges。
三档使用法则
按你要回答的问题选 bench 档位:
| 你要回答 | 该看哪一档 |
|---|---|
| 模型对我业务够不够聪明 | 生产表:Artificial Analysis + 自建业务 golden set + LMArena 分类榜 |
| 模型在硬能力上有没有短板 | 能力表:HLE + FrontierMath + GPQA Diamond + SWE-bench Verified + BFCL v3 + τ-bench pass^k |
| 模型合不合规、越狱扛不扛得住 | 安全表:HarmBench + JailbreakBench + XSTest 三件套 |
| 模型能不能替我办事 | Agent 表:τ²-bench + GAIA + OSWorld + AppWorld |
三档合起来才接近「权威」。单榜第一只是单一价值观第一。这条与站内早前的看榜方法一脉相承——那篇讲怎么读榜,这篇是每张榜里具体有哪些牌。
诚实的提醒
这篇的软处集中在三处,逐条点名:
- 饱和度描述属于观点档:正文里「顶端已到 XX%」的数字,除少数当次检索里明确给出的(HLE <10%、MMLU-Pro CoT 提升、OSWorld 12.24%、BFCL v3 47.6%、WebArena 14.4%/25.4%),其他都是我根据近几个月看 leaderboards 的印象写的,读者做选型请自己去对应主页当天查。
- arXiv ID 分两类:τ-bench / τ²-bench / HLE / FrontierMath / ARC-AGI-2 / MMLU-Pro / GPQA / RULER / OSWorld / WebArena / HumanEval / LiveCodeBench / BigCodeBench / SWE-bench / SWE-bench Multimodal / MMMU / HarmBench / MATH / GSM8K / GAIA 我这次都当场检索并核对过。其余的(BBH、TruthfulQA、AdvBench、XSTest、LongBench、BABILong、C-Eval、CMMLU、AGIEval、CMMMU、ChartQA、MathVista、MMBench、BEIR、MTEB、ToolBench、Mind2Web、VisualWebArena、AppWorld、AlpacaEval、Arena-Hard、JailbreakBench)我按已知的常见引用给了 ID,未逐一核实;读者引用前请以 arXiv 页面为准。
- pass^k 的原创性归属:正文里说 pass^k 是 τ-bench 首创,这是根据我读原论文(arXiv:2406.12045)的印象。如果有更早文献用过这个记号,欢迎指正。
下一步:一个 5 分钟能启动的验证
打开 HLE leaderboard 和 SWE-bench Verified 页面,各花 2 分钟做两件事:
- 记下当天首页最高分和对应模型/harness 名。
- 挑一个你自己每天在用的问题(不用编,就是最近你问过 LLM 的那种问题),估计一下:这个问题落在本文哪一格里?如果没有一格能接住它,那说明公开 bench 生态还差这一块。
——这也是你自己业务 golden set 的种子。
小结
一句话根本约束:bench 之所以长成现在这样,是因为公开静态测题终会被训练语料吞掉。这条压着所有 bench 从「考试题 → 硬推理 → 事务性 agent」换了三代能力轴,也让 τ-bench 这种「执行结果状态比对 + pass^k」的形态在 2024 年出现。
崩点:如果你用第一代 bench 判断前沿模型,你会看到「大家都 95%+,看起来差不多」——差距被压平了,也就选不出模型。这就是最朴素做法先崩的地方。
带得走的动作:把上面那张三档表贴到 wiki 上,选型和红线绑定不同档位。任何单榜排名都别单独当决策依据。
参考来源
工程实践 / 榜单主页
- LMArena / Chatbot Arena:https://lmarena.ai/
- HELM:https://crfm.stanford.edu/helm/
- LiveBench:https://livebench.ai/
- SWE-bench:https://www.swebench.com/
- BFCL:https://gorilla.cs.berkeley.edu/leaderboard.html
- OSWorld:https://os-world.github.io/
- WebArena:https://webarena.dev/
- HLE:https://agi.safe.ai/
- FrontierMath:https://epoch.ai/frontiermath
- ARC Prize:https://arcprize.org/
- τ-bench 仓库:https://github.com/sierra-research/tau-bench
- Aider Polyglot:https://aider.chat/docs/leaderboards/
arXiv 论文(本次核实过)
- τ-bench, Yao 2024, 2406.12045
- τ²-Bench, Barres 2025, 2506.07982
- Humanity’s Last Exam, Phan 2025, 2501.14249
- FrontierMath, Glazer 2024, 2411.04872
- ARC-AGI-2, Chollet 2025, 2505.11831
- MMLU-Pro, Wang 2024, 2406.01574
- GPQA, Rein 2023, 2311.12022
- RULER, Hsieh 2024, 2404.06654
- OSWorld, Xie 2024, 2404.07972
- WebArena, Zhou 2023, 2307.13854
- HumanEval, Chen 2021, 2107.03374
- LiveCodeBench, Jain 2024, 2403.07974
- BigCodeBench, Zhuo 2024, 2406.15877
- SWE-bench, Jimenez 2023, 2310.06770
- SWE-bench Multimodal, Yang 2024, 2410.03859
- MMMU, Yue 2023, 2311.16502
- HarmBench, Mazeika 2024, 2402.04249
- GAIA, Mialon 2023, 2311.12983
- GSM8K, Cobbe 2021, 2110.14168
- MATH, Hendrycks 2021, 2103.03874