别再问谁第一:大模型 Benchmark 榜单的正确打开方式

梳理 2026 年仍值得看的大模型榜单和数据源:LMArena、HELM、LiveBench、Artificial Analysis、SEAL/HLE、SWE-bench、BFCL、OpenCompass 与 Hugging Face Open LLM Leaderboard,并给出一套按场景读榜的方法。

如果只问「哪个大模型榜最权威」,答案很容易误导。大模型已经不是一张期末卷子能测完的东西。今天的榜单更像一组不同的仪表:有的测人类是否喜欢,有的测静态知识,有的测代码修复,有的测工具调用,有的测价格和延迟。

一句话主线

如果只能说一个最有行业共识的综合榜,我会选 LMArena / Arena.ai,因为它有大规模真人盲测偏好数据,最接近「普通用户实际喜欢哪个回答」。但它不是能力真值。

更严谨的答案是:

  • 看真实聊天偏好:LMArena。
  • 看学术化、可复现、维度完整:Stanford HELM
  • 看抗污染的客观能力压力测试:LiveBench、HLE、FrontierMath。
  • 看代码与 agent 工程能力:SWE-bench、Terminal-Bench、BFCL、tau-bench 一类。
  • 看采购和生产部署:Artificial Analysis、MLPerf,再叠加自己的业务集。

所以我更愿意把问题改成:你到底想证明模型在哪种世界里好用?

先把主流权威榜单放到一张地图上

榜单或数据源主要测什么我怎么看
LMArena / Arena.ai真人盲测 A/B 偏好。Text Arena 覆盖数学、编码、创作、指令跟随、多轮、hard prompts 等类别。2026-07-21 的 Text Arena 页面显示已有 700 多万票、300 多个模型。最适合回答「用户更喜欢哪个模型」。但偏好会被表达风格、长度、格式影响,所以要看分类榜、置信区间和 style control。
Stanford HELM标准化、可复现的多维评测框架。覆盖能力、安全、多模态、医学、金融、多语言等方向;指标不仅是准确率,也包括效率、偏见、毒性等。学术上很重要,方法论地位高。注意 HELM 在 2026-06-01 进入 maintenance mode,它更像评测框架和历史基准,不一定最快反映最新模型。
LiveBench抗污染的客观题。当前站点 release 到 2026-06-25,显示 23 个客观任务、7 类:Reasoning、Coding、Agentic Coding、Mathematics、Data Analysis、Language、Instruction Following。很适合看「不是背题,而是真的会不会」。它的优势是新题、客观答案、少依赖 LLM judge;局限是仍不能覆盖开放式产品体验。
Artificial Analysis独立商业数据站。测模型能力、价格、速度、延迟、上下文等。Intelligence Index v4.1 把 agent、coding、scientific reasoning、general 四类加权。工程选型非常有用,因为它把「聪明」和「贵不贵、快不快」放在一起。但 composite score 会隐藏任务权重,不能当作唯一真相。
Scale SEAL Leaderboards / HLE私有或专家构造的数据集,覆盖 coding、instruction following、math、multilinguality。HLE 用 2500 道专家题测试数学、科学、人文等深知识和校准。价值在于私有题和专家审阅,能抵抗公开题污染。代价是透明度和可复验性弱一些。
SWE-bench Verified500 个真人验证过的真实 GitHub issue,模型要在代码库里改补丁,并通过测试。这是看 coding agent 的核心榜之一。它测的是「能不能在仓库里解决问题」,不是单文件写题。读榜时要区分裸模型、agent scaffold、工具、rollout 次数。
Berkeley Function Calling Leaderboard, BFCL工具调用和函数调用:选对工具、填对参数、遵守 schema、多轮调用。对 agent 产品很关键。很多模型聊天很顺,但一到 API 参数、缺失字段、并行调用就露馅。
OpenCompass开源评测平台与中文语境常用榜单,支持大量模型和数据集,覆盖知识、推理、计算、科学、语言、代码等。对中文模型、开源模型、本地复现实验很有价值。它不是全球唯一裁判,但很适合作为中文和开源生态的对照表。
Hugging Face Open LLM Leaderboard曾经是开源模型最重要的自动评测榜,使用 IFEval、BBH、MATH、GPQA、MuSR、MMLU-Pro 等。现在主要看作历史资产。官方在 2025-03-13 宣布 Open LLM Leaderboard 退休,原因正是模型形态和 benchmark 方向变化太快。
MLPerf / MLCommons系统性能,不是模型智力。看吞吐、TTFT、TPOT、硬件和推理系统效率。如果你关心自建推理、GPU 集群、成本曲线,它很权威;如果你问「哪个模型更聪明」,它不是答案。

这些 benchmark 到底测了哪些能力

可以把大模型能力拆成七层。

第一层:知识和考试能力。
MMLU、MMLU-Pro、GPQA、HLE、部分 HELM 榜单都在这里。它们看模型是否掌握跨学科知识,是否能在选择题或短答案题上稳定作答。问题是,越老越公开的题越容易被训练集、刷榜和提示工程污染。Scale 的 HLE 页面也明确提到,MMLU、GPQA 这类曾经的 frontier benchmark 已经不再足以单独证明前沿能力。

第二层:数学和硬推理。
AIME、MATH、FrontierMath、LiveBench Mathematics、CritPt 这类榜单测的是长链条推理、符号计算、证明感、答案校验。FrontierMath 的意义在于把难度推到研究级数学,但它也提醒我们:越难的数据集越依赖专家质量控制,题目本身也可能需要迭代审计。

第三层:代码生成。
HumanEval、MBPP、LiveCodeBench、SciCode 等测「从题面写出可运行代码」。但今天只看这种题已经不够,因为真实工程不是刷算法题。

第四层:软件工程 agent。
SWE-bench、Terminal-Bench、SWE-bench Multimodal 等测的是能不能读 repo、定位 bug、改多文件、跑测试、修失败。这一层会混合模型能力、agent loop、工具权限、检索策略和预算,所以读榜时不能只看模型名。

第五层:工具调用与事务执行。
BFCL、tau-bench、GDPval-AA、EnterpriseOps-Gym 这类榜单更接近「让模型替你办事」。它们测 schema 遵守、参数抽取、状态更新、多步任务、是否把外部世界弄对。未来 agent 产品真正拉开差距,大概率在这一层。

第六层:人类偏好和开放式表达。
LMArena 的价值在这里。它不追求一个唯一 ground truth,而是让真人在开放问题里投票。这对聊天、写作、解释、产品体验很有参考意义。它的问题也在这里:人类喜欢的东西不总等于正确,漂亮、长、格式好,经常会加分。Arena 自己也做了 style control 来拆分风格和内容。

第七层:生产可用性。
Artificial Analysis、MLPerf、各云厂商压测看的是速度、价格、上下文、稳定性、吞吐和延迟。很多 demo 里最强的模型,在真实业务里可能因为太慢、太贵、限流、不可控而不是最优解。

我心里的「权威」排序,不是一个榜,而是一套读法

如果只是面向大众说「谁第一」,LMArena 最有传播力,也最有现实解释力。它的优势是活数据、真人偏好、开放任务、模型覆盖广。它的分数不是模型在某张卷子上的分数,而是模型在真实用户眼里的相对吸引力。

但如果我是给一个团队选模型,我不会只看 LMArena。我会用三张表:

  1. 偏好表:LMArena 分类榜,看用户是否喜欢它的输出。
  2. 能力表:LiveBench、HLE、GPQA、FrontierMath、SWE-bench、BFCL,看它在关键硬任务上有没有短板。
  3. 生产表:Artificial Analysis、MLPerf、自己的压测,看价格、速度、上下文、失败率和供应稳定性。

这三张表合起来,才接近「权威」。单榜第一通常只是单一价值观第一。

为什么不要迷信榜单第一

Benchmark 不是自然事实,它是一个激励系统。

你把 MMLU 当北极星,模型就会变成考试机器。你把 HumanEval 当北极星,模型就会变成刷题机器。你把 Arena 当北极星,模型就会学会更讨人喜欢。你把 SWE-bench 当北极星,agent 框架、工具和多次尝试会一起被优化。你把成本指标纳入榜单,模型供应商才会认真优化推理价格。

所以榜单真正有深意的地方,不是告诉我们「谁最强」,而是告诉我们「行业正在奖励什么」。评测指标一变,研发方向就会跟着变。

实用结论

如果你只是想知道今天哪个通用聊天模型口碑最好,先看 LMArena,但务必看分类榜和置信区间。

如果你要写论文或做严肃横评,先看 HELM、LiveBench、SWE-bench、BFCL 这类有公开方法论或可执行 harness 的榜,不要只抄厂商发布会表格。

如果你要给产品选模型,先列自己的业务任务,再把公开榜单当外部先验。最后必须用自己的数据集做小样本回归测试:准确率、拒答率、幻觉率、工具调用成功率、延迟、成本,都要一起看。

我的最终判断是:2026 年以后,最权威的 benchmark 不会是一张总榜,而是一套能持续更新、能抵抗污染、能贴近真实任务、还能暴露成本的评测组合。

谁第一会变。怎么读榜,才是更长期的能力。

参考来源