如果只问「哪个大模型榜最权威」,答案很容易误导。大模型已经不是一张期末卷子能测完的东西。今天的榜单更像一组不同的仪表:有的测人类是否喜欢,有的测静态知识,有的测代码修复,有的测工具调用,有的测价格和延迟。
一句话主线
如果只能说一个最有行业共识的综合榜,我会选 LMArena / Arena.ai,因为它有大规模真人盲测偏好数据,最接近「普通用户实际喜欢哪个回答」。但它不是能力真值。
更严谨的答案是:
- 看真实聊天偏好:LMArena。
- 看学术化、可复现、维度完整:Stanford HELM。
- 看抗污染的客观能力压力测试:LiveBench、HLE、FrontierMath。
- 看代码与 agent 工程能力:SWE-bench、Terminal-Bench、BFCL、tau-bench 一类。
- 看采购和生产部署:Artificial Analysis、MLPerf,再叠加自己的业务集。
所以我更愿意把问题改成:你到底想证明模型在哪种世界里好用?
先把主流权威榜单放到一张地图上
| 榜单或数据源 | 主要测什么 | 我怎么看 |
|---|---|---|
| LMArena / Arena.ai | 真人盲测 A/B 偏好。Text Arena 覆盖数学、编码、创作、指令跟随、多轮、hard prompts 等类别。2026-07-21 的 Text Arena 页面显示已有 700 多万票、300 多个模型。 | 最适合回答「用户更喜欢哪个模型」。但偏好会被表达风格、长度、格式影响,所以要看分类榜、置信区间和 style control。 |
| Stanford HELM | 标准化、可复现的多维评测框架。覆盖能力、安全、多模态、医学、金融、多语言等方向;指标不仅是准确率,也包括效率、偏见、毒性等。 | 学术上很重要,方法论地位高。注意 HELM 在 2026-06-01 进入 maintenance mode,它更像评测框架和历史基准,不一定最快反映最新模型。 |
| LiveBench | 抗污染的客观题。当前站点 release 到 2026-06-25,显示 23 个客观任务、7 类:Reasoning、Coding、Agentic Coding、Mathematics、Data Analysis、Language、Instruction Following。 | 很适合看「不是背题,而是真的会不会」。它的优势是新题、客观答案、少依赖 LLM judge;局限是仍不能覆盖开放式产品体验。 |
| Artificial Analysis | 独立商业数据站。测模型能力、价格、速度、延迟、上下文等。Intelligence Index v4.1 把 agent、coding、scientific reasoning、general 四类加权。 | 工程选型非常有用,因为它把「聪明」和「贵不贵、快不快」放在一起。但 composite score 会隐藏任务权重,不能当作唯一真相。 |
| Scale SEAL Leaderboards / HLE | 私有或专家构造的数据集,覆盖 coding、instruction following、math、multilinguality。HLE 用 2500 道专家题测试数学、科学、人文等深知识和校准。 | 价值在于私有题和专家审阅,能抵抗公开题污染。代价是透明度和可复验性弱一些。 |
| SWE-bench Verified | 500 个真人验证过的真实 GitHub issue,模型要在代码库里改补丁,并通过测试。 | 这是看 coding agent 的核心榜之一。它测的是「能不能在仓库里解决问题」,不是单文件写题。读榜时要区分裸模型、agent scaffold、工具、rollout 次数。 |
| Berkeley Function Calling Leaderboard, BFCL | 工具调用和函数调用:选对工具、填对参数、遵守 schema、多轮调用。 | 对 agent 产品很关键。很多模型聊天很顺,但一到 API 参数、缺失字段、并行调用就露馅。 |
| OpenCompass | 开源评测平台与中文语境常用榜单,支持大量模型和数据集,覆盖知识、推理、计算、科学、语言、代码等。 | 对中文模型、开源模型、本地复现实验很有价值。它不是全球唯一裁判,但很适合作为中文和开源生态的对照表。 |
| Hugging Face Open LLM Leaderboard | 曾经是开源模型最重要的自动评测榜,使用 IFEval、BBH、MATH、GPQA、MuSR、MMLU-Pro 等。 | 现在主要看作历史资产。官方在 2025-03-13 宣布 Open LLM Leaderboard 退休,原因正是模型形态和 benchmark 方向变化太快。 |
| MLPerf / MLCommons | 系统性能,不是模型智力。看吞吐、TTFT、TPOT、硬件和推理系统效率。 | 如果你关心自建推理、GPU 集群、成本曲线,它很权威;如果你问「哪个模型更聪明」,它不是答案。 |
这些 benchmark 到底测了哪些能力
可以把大模型能力拆成七层。
第一层:知识和考试能力。
MMLU、MMLU-Pro、GPQA、HLE、部分 HELM 榜单都在这里。它们看模型是否掌握跨学科知识,是否能在选择题或短答案题上稳定作答。问题是,越老越公开的题越容易被训练集、刷榜和提示工程污染。Scale 的 HLE 页面也明确提到,MMLU、GPQA 这类曾经的 frontier benchmark 已经不再足以单独证明前沿能力。
第二层:数学和硬推理。
AIME、MATH、FrontierMath、LiveBench Mathematics、CritPt 这类榜单测的是长链条推理、符号计算、证明感、答案校验。FrontierMath 的意义在于把难度推到研究级数学,但它也提醒我们:越难的数据集越依赖专家质量控制,题目本身也可能需要迭代审计。
第三层:代码生成。
HumanEval、MBPP、LiveCodeBench、SciCode 等测「从题面写出可运行代码」。但今天只看这种题已经不够,因为真实工程不是刷算法题。
第四层:软件工程 agent。
SWE-bench、Terminal-Bench、SWE-bench Multimodal 等测的是能不能读 repo、定位 bug、改多文件、跑测试、修失败。这一层会混合模型能力、agent loop、工具权限、检索策略和预算,所以读榜时不能只看模型名。
第五层:工具调用与事务执行。
BFCL、tau-bench、GDPval-AA、EnterpriseOps-Gym 这类榜单更接近「让模型替你办事」。它们测 schema 遵守、参数抽取、状态更新、多步任务、是否把外部世界弄对。未来 agent 产品真正拉开差距,大概率在这一层。
第六层:人类偏好和开放式表达。
LMArena 的价值在这里。它不追求一个唯一 ground truth,而是让真人在开放问题里投票。这对聊天、写作、解释、产品体验很有参考意义。它的问题也在这里:人类喜欢的东西不总等于正确,漂亮、长、格式好,经常会加分。Arena 自己也做了 style control 来拆分风格和内容。
第七层:生产可用性。
Artificial Analysis、MLPerf、各云厂商压测看的是速度、价格、上下文、稳定性、吞吐和延迟。很多 demo 里最强的模型,在真实业务里可能因为太慢、太贵、限流、不可控而不是最优解。
我心里的「权威」排序,不是一个榜,而是一套读法
如果只是面向大众说「谁第一」,LMArena 最有传播力,也最有现实解释力。它的优势是活数据、真人偏好、开放任务、模型覆盖广。它的分数不是模型在某张卷子上的分数,而是模型在真实用户眼里的相对吸引力。
但如果我是给一个团队选模型,我不会只看 LMArena。我会用三张表:
- 偏好表:LMArena 分类榜,看用户是否喜欢它的输出。
- 能力表:LiveBench、HLE、GPQA、FrontierMath、SWE-bench、BFCL,看它在关键硬任务上有没有短板。
- 生产表:Artificial Analysis、MLPerf、自己的压测,看价格、速度、上下文、失败率和供应稳定性。
这三张表合起来,才接近「权威」。单榜第一通常只是单一价值观第一。
为什么不要迷信榜单第一
Benchmark 不是自然事实,它是一个激励系统。
你把 MMLU 当北极星,模型就会变成考试机器。你把 HumanEval 当北极星,模型就会变成刷题机器。你把 Arena 当北极星,模型就会学会更讨人喜欢。你把 SWE-bench 当北极星,agent 框架、工具和多次尝试会一起被优化。你把成本指标纳入榜单,模型供应商才会认真优化推理价格。
所以榜单真正有深意的地方,不是告诉我们「谁最强」,而是告诉我们「行业正在奖励什么」。评测指标一变,研发方向就会跟着变。
实用结论
如果你只是想知道今天哪个通用聊天模型口碑最好,先看 LMArena,但务必看分类榜和置信区间。
如果你要写论文或做严肃横评,先看 HELM、LiveBench、SWE-bench、BFCL 这类有公开方法论或可执行 harness 的榜,不要只抄厂商发布会表格。
如果你要给产品选模型,先列自己的业务任务,再把公开榜单当外部先验。最后必须用自己的数据集做小样本回归测试:准确率、拒答率、幻觉率、工具调用成功率、延迟、成本,都要一起看。
我的最终判断是:2026 年以后,最权威的 benchmark 不会是一张总榜,而是一套能持续更新、能抵抗污染、能贴近真实任务、还能暴露成本的评测组合。
谁第一会变。怎么读榜,才是更长期的能力。
参考来源
- Arena.ai Text Arena Leaderboard
- Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference
- Arena Style Control: Does Style Matter?
- Stanford CRFM HELM
- LiveBench 与 LiveBench GitHub
- Artificial Analysis Methodology
- Scale SEAL Leaderboards
- Humanity’s Last Exam Leaderboard
- SWE-bench 与 SWE-bench Verified
- Berkeley Function Calling Leaderboard
- OpenCompass
- Hugging Face Leaderboards Documentation 与 Open LLM Leaderboard 退休说明
- MLCommons Benchmarks
- Epoch AI FrontierMath