Anthropic 在 9 月 1 日发布了新旗舰 Claude Fable 5.1,媒体标题几乎都是”跑分屠榜”。但如果只读总分,就会错过这次发布最有信息量的部分——增长分布。Fable 5.1 在不同方向上的提升幅度差异极大:有的基准直接翻倍,有的几乎原地踏步。这个”增长差”本身就是大模型最新趋势的方向标。本文把 Fable 5.1 的分方向数据摆出来,再配上 arxiv 上 2024–2026 的评测与推理论文,拼出四条主线。
名词速查
| 术语 | 一句话解释 |
|---|---|
| Terminal-Bench-Science | 在真实终端环境里跑”科研 agent”的基准:读论文、写代码、跑实验、验证结果 |
| Terminal-Bench 4.0 | 终端环境里长程编码 agent 基准(Anthropic 参与维护) |
| OSWorld 2.0 | 在真实 OS(Windows/macOS/Linux)里操作 GUI 的 computer-use 基准,2.0 版专挑长程任务 |
| AutomationBench | 企业业务工作流自动化基准(跑发票、改配置这类跨系统流程) |
| HLE (Humanity’s Last Exam) | 单轮最难知识问答基准 |
| effort | Fable 5.1 的思考深度参数(low→max),本次新增可中途切换 |
| cache read | 模型重读已处理过的上下文。Fable 5.1 的 cache read 降价 75% |
数字账本:增长分布是信号,不是总分
先看官方基准表(Anthropic 发布页,Fable 5.1 用生产护栏跑分):
| 基准(得分 %) | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| 终端科研 Terminal-Bench-Science 0.1 | 52.6 | 24.7 | 29.0 | 22.4 |
| 终端编码 Terminal-Bench 4.0 | 55.8 | 42.0 | 52.3 | 37.3 |
| 计算机使用 OSWorld 2.0(strict) | 41.7 | 36.1 | 39.6 | — |
| 业务工作流 AutomationBench | 31.4 | 17.1 | 26.9 | 19.6 |
| 智能体编码 CursorBench 3.2 | 73.4 | 70.5 | 70.0 | 67.2 |
| 多学科推理 HLE(无工具) | 60.9 | 57.8 | 56.6 | — |
把它转成”相对上一代 Fable 5 的提升幅度”,分布极其不均匀:
| 方向 | 提升(相对 Fable 5) | 性质 |
|---|---|---|
| 终端科研 | +113%(翻倍多) | 长程 agent |
| 业务工作流 AutomationBench | +84% | 长程 agent |
| 终端编码 T-Bench 4.0 | +33% | 长程 agent |
| 计算机使用 OSWorld 2.0 | +16% | 长程 agent |
| 多学科推理 HLE | +5% | 单轮推理 |
| 智能体编码 CursorBench | +4% | 单轮/短程 |
定价端的信息同样关键:输入 10 美元/百万 token、输出 50 美元/百万 token 不变,但 cache read 从 1 美元降到 0.25 美元/百万 token(-75%)。官方口径:典型工作负载整体省约 25%,高度 agentic 工作负载(长会话反复读上下文)最多省约 45%。客户 Every 的评语把这种定位说得很直白:“Fable 级智能、Opus 级价格、Sonnet 级速度”。
趋势一:单轮推理见顶,能力增长迁移到”长程 agent”
最扎眼的对比是 HLE 只涨了 5%,而科研和业务工作流翻倍。HLE 是单轮问答的极限,它接近饱和说明:把”一道题答对”这件事继续做强的边际收益已经很小。真正拉开代差的,是那些需要连续操作几小时、跨多个工具、还要自己验证结果的任务。
这个判断不是 Fable 5.1 独有的,arxiv 上评测界已经在用脚投票——新一代基准集体把重心从”单轮问答”搬到”多步交互、真实环境、长程任务”:
- OSWorld 2.0(2606.29537)把 computer use 从”30 次工具调用的短任务”拉长到平均 318 次工具调用、人类中位数耗时约 1.6 小时的真实工作流,结论是当前最强模型仍只完成 20.6%——失败点不在 GUI 控制,而在”丢约束、错过中途信息、跳过验证”。
- NL2Repo-Bench(2512.12730)让 agent 从一份自然语言需求文档+空工作区,自主设计架构、管理依赖、实现多模块并交付一个可安装的库。最强 agent 的平均测试通过率仍低于 40%,核心失败模式是”过早终止、跨文件依赖脆弱、全局一致性丢失”。
- LoCoBench-Agent(2511.13998)评测 10K–1M token 上下文里的交互式编码 agent,发现”理解深度”和”效率”存在负相关(r=-0.42)——想得越全走得越慢,最好的 agent 也只是挤在帕累托前沿上。
- Terminal-Bench 2.0(2601.11868)在真实 CLI 里做 89 个硬任务,前沿模型仍低于 65%,并专门做了错误归因。
- Survey on Evaluation of LLM-based Agents(2025)总结的趋势正是”评测转向更真实、更持续更新的场景”。
一句话:跑分增长的分布,就是评测界用脚投票的结果——单轮推理已经卷到头,“能持续干活几小时不出错”才是新差距所在。
趋势二:推理成本成为新的竞争轴
Fable 5.1 的定价没变,但官方明确说”低/中 effort 的 Fable 5.1 表现已基本相当于前代在极高 effort 下的水平”。换句话说,Anthropic 这次卖的不只是更强的模型,还有”同样智能更便宜”的选项——能力-成本的帕累托前沿正在成为旗舰的胜负手。
这与 test-time compute 研究从”越多越好”转向”预算自适应”是同一件事的工业落地:
- Don’t Overthink It(2025)发现同一道题,短思考链比最长链准确率高最多 34.5%,“想得多不等于想得对”;用短-多数投票还能省 40% thinking token。
- AnytimeReasoner / BRPO 把”任意预算截断下都给出当前最优答案”作为训练目标,在预算约束下全面优于 GRPO。
- ST-BoN 把采样式 test-time scaling 的显存开销降 90%、延迟降 50%。
- Revisiting Test-Time Scaling 指出推理模型输出多样性下降会限制 test-time scaling 的效果——多样性本身也是效率。
这条主线和我昨天读的《合成前沿的八次替换》完全接得上:那条”10% 更差、100x 更便宜”的曲线,第一次在同一个旗舰模型内部被模型厂商主动复刻出来(低 effort ≈ 上代高 effort)。结合 Ramp 数据里用户给”工程投入积累过的老模型”投票的现象,Fable 5.1 的 cache read 降价 75% + effort 中途可切,本质是在降低用户换模型的摩擦——让 agent 长会话的重复读上下文成本直接打四分之一折。
趋势三:从”回答问题”到”科学/工程产出者”
Fable 5.1 发布页没有只给跑分,而是放了一组科研产出:设计出实验室确认可结合的蛋白结合剂、把七个开源模型的 GPU 推理速度最高提升 2.5x(并让全基因组分析的 GPU 成本降 30–60%)、基于 NASA 三十多年前的雷达数据绘制出精度翻倍的金星高程图。
这组展示在 arxiv 上有一条清晰的演进线可对照:
- The AI Scientist(Sakana, 2024)提出端到端科研 agent,每篇论文成本不到 15 美元,从选题到写稿全自动。
- The AI Scientist-v2(2025)产出了第一篇 AI 生成、通过 ICLR workshop 评审的论文。
- Towards an AI co-scientist(Google, 2025)用多 agent + 锦标赛进化提出新假设,并给出经实验验证的候选靶点。
但更有对照价值的是一篇反方论文:AI Scientists Fail Without Strong Implementation Capability(2025)。它系统评估了 5 套 AI Scientist 系统生成的 28 篇论文,结论是:AI 科研的瓶颈不在”会不会想”(选题、写论文),而在”能不能执行严格的验证流程”(跑出可信实验、正确配置环境、复现结果)。
这正好解释了为什么 Fable 5.1 把最大提升(+113%)给到了 Terminal-Bench-Science——那个基准测的不是”写一页研究计划”,而是在终端里把实验真正跑通并验证。AI 从”知识工作者”变成”操作验证闭环的执行者”,瓶颈从推理迁移到了”长时间把事做完并验证”。
趋势四:agent 化需要新的评测与治理
能力越接近”自主干活”,评测和治理就越不能只看”答得对不对”。Fable 5.1 在治理侧的动作很明确:同一模型拆成 Fable(通用版)与 Mythos(受信研究版) 双版本、推出 Enterprise Frontier Safeguards(EFS)让数据存在客户自控的云基础设施(等效零数据留存)、文本加统计水印 + 图片视频加 C2PA 内容凭证,同时把护栏误报大幅下调(网络安全假阳性 -60%、生物学 -85%)。
arxiv 侧同样在补”自主 agent 的成本与安全”这块评估空白:
- Survey on Evaluation of LLM-based Agents 明确把 cost-efficiency、safety、robustness 列为 agent 评测的三大缺口。
- OSWorld-Human(2025)给 369 个 OSWorld 任务配了人工轨迹,发现 computer-use agent 的 planning/reflection 占整体延迟的 75%–94%,最强 agent 仍比必要步骤多走 1.4–2.7x——“能干成”和”用得起”是两件事。
- 开源侧也在快速逼近:EvoCUA 等通过合成经验进化,把 OSWorld 成功率推到 56.7% 的 SOTA。
一句话:当模型开始替你连续操作电脑、跑业务流、做实验,“能不能管住它、它花多少钱、它会不会越界”就成了评测的前置条件,而不是事后补丁。
与本站主线接起来
三天前我在《合成前沿的八次替换》里写”10% 更差、100x 更便宜”,在《Ramp 数据》里写”用户给累积过工程投入的模型投票”。Fable 5.1 是这条主线的第三个数据点,而且这次是在模型自己的能力分布内部复刻了那条取舍曲线(低 effort 换低成本)。把三条拼起来:
- 合成前沿(模型侧):验证机制的便宜化,让 100x 便宜的能力档变得可用。
- 市场端:用户更愿意为”调透的老模型”付费,因为换模型的沉没成本很高。
- 本次(产品侧):厂商主动把”更便宜档”做成产品卖点(cache read -75% + effort 可切),试图压低用户的迁移成本。
三个视角指向同一个结论:大模型竞争的重心,正在从”谁能答得更难”转向”谁能以更低的成本、更可靠地把长程任务做完”。
反方意见与未验证清单
第一:官方跑分是”自报成绩”,且口径有变更。 OSWorld 2.0 官方用了 2026 年 8 月的新任务文件,Anthropic 自己注明”与历史版本不可直接比较”。所以 41.7% 这个数字要和上一代比,但要和更早的公开成绩比就失真了。
第二:科研产出是”精选展示”,不是平均能力。 蛋白结合剂、GPU kernel 优化、金星地图都是早期案例,不代表模型平均科研水平。反方论文 AI Scientists Fail Without Strong Implementation Capability 已经指出:AI 科研系统的实现/验证能力仍是硬瓶颈,能写论文 ≠ 能跑出可信实验。
第三:HLE 只涨 5% 可能是”天花板效应”。 单轮问答的基准本身接近饱和,未必代表模型推理没进步;更准确的读法是”单轮基准已经测不出旗舰之间的差距了”。
第四:cache read 降价只对”长会话 agent”真便宜。 对短查询用户,cache 命中少,25% 的整体节省是平均口径;只有上下文重、工具多的负载才能吃到 45%。
第五:第三方数字未独立复现。 网传”AI 分析指数 66 分""2 万亿 IPO 前夕”等表述来自媒体转述,我未回访原始来源,本文不采信为事实依据。
参考来源
官方
- Anthropic, Introducing Claude Fable 5.1 and Claude Mythos 5.1
- Anthropic Platform, What’s new in Claude Fable 5.1
论文(arXiv)
- OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks
- OSWorld-Human: Benchmarking the Efficiency of Computer-Use Agents
- NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
- LoCoBench-Agent: An Interactive Benchmark for LLM Agents in Long-Context Software Engineering
- Terminal-Bench 2.0: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces
- Survey on Evaluation of LLM-based Agents
- Don’t Overthink It: Preferring Shorter Thinking Chains for Improved LLM Reasoning
- Optimizing Anytime Reasoning via Budget Relative Policy Optimization
- Sampling-Efficient Test-Time Scaling: Self-Estimating the Best-of-N Sampling in Early Decoding
- Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning
- The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery
- The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search
- Towards an AI co-scientist
- AI Scientists Fail Without Strong Implementation Capability
- EvoCUA: Evolving Computer Use Agents via Learning from Scalable Synthetic Experience
本站相关