Fable 5.1 的数据增长在说什么:单轮推理见顶,长程智能体接棒

从 Fable 5.1 各基准的提升分布看大模型最新趋势:单轮推理接近饱和、长程智能体接棒、推理成本成为竞争轴,结合 arxiv 论文佐证四条主线。

Anthropic 在 9 月 1 日发布了新旗舰 Claude Fable 5.1,媒体标题几乎都是”跑分屠榜”。但如果只读总分,就会错过这次发布最有信息量的部分——增长分布。Fable 5.1 在不同方向上的提升幅度差异极大:有的基准直接翻倍,有的几乎原地踏步。这个”增长差”本身就是大模型最新趋势的方向标。本文把 Fable 5.1 的分方向数据摆出来,再配上 arxiv 上 2024–2026 的评测与推理论文,拼出四条主线。

名词速查

术语一句话解释
Terminal-Bench-Science在真实终端环境里跑”科研 agent”的基准:读论文、写代码、跑实验、验证结果
Terminal-Bench 4.0终端环境里长程编码 agent 基准(Anthropic 参与维护)
OSWorld 2.0在真实 OS(Windows/macOS/Linux)里操作 GUI 的 computer-use 基准,2.0 版专挑长程任务
AutomationBench企业业务工作流自动化基准(跑发票、改配置这类跨系统流程)
HLE (Humanity’s Last Exam)单轮最难知识问答基准
effortFable 5.1 的思考深度参数(low→max),本次新增可中途切换
cache read模型重读已处理过的上下文。Fable 5.1 的 cache read 降价 75%

数字账本:增长分布是信号,不是总分

先看官方基准表(Anthropic 发布页,Fable 5.1 用生产护栏跑分):

基准(得分 %)Fable 5.1Fable 5Opus 5GPT-5.6 Sol
终端科研 Terminal-Bench-Science 0.152.624.729.022.4
终端编码 Terminal-Bench 4.055.842.052.337.3
计算机使用 OSWorld 2.0(strict)41.736.139.6
业务工作流 AutomationBench31.417.126.919.6
智能体编码 CursorBench 3.273.470.570.067.2
多学科推理 HLE(无工具)60.957.856.6

把它转成”相对上一代 Fable 5 的提升幅度”,分布极其不均匀:

方向提升(相对 Fable 5)性质
终端科研+113%(翻倍多)长程 agent
业务工作流 AutomationBench+84%长程 agent
终端编码 T-Bench 4.0+33%长程 agent
计算机使用 OSWorld 2.0+16%长程 agent
多学科推理 HLE+5%单轮推理
智能体编码 CursorBench+4%单轮/短程

定价端的信息同样关键:输入 10 美元/百万 token、输出 50 美元/百万 token 不变,但 cache read 从 1 美元降到 0.25 美元/百万 token(-75%)。官方口径:典型工作负载整体省约 25%,高度 agentic 工作负载(长会话反复读上下文)最多省约 45%。客户 Every 的评语把这种定位说得很直白:“Fable 级智能、Opus 级价格、Sonnet 级速度”。

趋势一:单轮推理见顶,能力增长迁移到”长程 agent”

最扎眼的对比是 HLE 只涨了 5%,而科研和业务工作流翻倍。HLE 是单轮问答的极限,它接近饱和说明:把”一道题答对”这件事继续做强的边际收益已经很小。真正拉开代差的,是那些需要连续操作几小时、跨多个工具、还要自己验证结果的任务。

这个判断不是 Fable 5.1 独有的,arxiv 上评测界已经在用脚投票——新一代基准集体把重心从”单轮问答”搬到”多步交互、真实环境、长程任务”:

  • OSWorld 2.02606.29537)把 computer use 从”30 次工具调用的短任务”拉长到平均 318 次工具调用、人类中位数耗时约 1.6 小时的真实工作流,结论是当前最强模型仍只完成 20.6%——失败点不在 GUI 控制,而在”丢约束、错过中途信息、跳过验证”。
  • NL2Repo-Bench2512.12730)让 agent 从一份自然语言需求文档+空工作区,自主设计架构、管理依赖、实现多模块并交付一个可安装的库。最强 agent 的平均测试通过率仍低于 40%,核心失败模式是”过早终止、跨文件依赖脆弱、全局一致性丢失”。
  • LoCoBench-Agent2511.13998)评测 10K–1M token 上下文里的交互式编码 agent,发现”理解深度”和”效率”存在负相关(r=-0.42)——想得越全走得越慢,最好的 agent 也只是挤在帕累托前沿上。
  • Terminal-Bench 2.02601.11868)在真实 CLI 里做 89 个硬任务,前沿模型仍低于 65%,并专门做了错误归因。
  • Survey on Evaluation of LLM-based Agents(2025)总结的趋势正是”评测转向更真实、更持续更新的场景”。

一句话:跑分增长的分布,就是评测界用脚投票的结果——单轮推理已经卷到头,“能持续干活几小时不出错”才是新差距所在。

趋势二:推理成本成为新的竞争轴

Fable 5.1 的定价没变,但官方明确说”低/中 effort 的 Fable 5.1 表现已基本相当于前代在极高 effort 下的水平”。换句话说,Anthropic 这次卖的不只是更强的模型,还有”同样智能更便宜”的选项——能力-成本的帕累托前沿正在成为旗舰的胜负手。

这与 test-time compute 研究从”越多越好”转向”预算自适应”是同一件事的工业落地:

  • Don’t Overthink It(2025)发现同一道题,短思考链比最长链准确率高最多 34.5%,“想得多不等于想得对”;用短-多数投票还能省 40% thinking token。
  • AnytimeReasoner / BRPO 把”任意预算截断下都给出当前最优答案”作为训练目标,在预算约束下全面优于 GRPO。
  • ST-BoN 把采样式 test-time scaling 的显存开销降 90%、延迟降 50%。
  • Revisiting Test-Time Scaling 指出推理模型输出多样性下降会限制 test-time scaling 的效果——多样性本身也是效率。

这条主线和我昨天读的《合成前沿的八次替换》完全接得上:那条”10% 更差、100x 更便宜”的曲线,第一次在同一个旗舰模型内部被模型厂商主动复刻出来(低 effort ≈ 上代高 effort)。结合 Ramp 数据里用户给”工程投入积累过的老模型”投票的现象,Fable 5.1 的 cache read 降价 75% + effort 中途可切,本质是在降低用户换模型的摩擦——让 agent 长会话的重复读上下文成本直接打四分之一折。

趋势三:从”回答问题”到”科学/工程产出者”

Fable 5.1 发布页没有只给跑分,而是放了一组科研产出:设计出实验室确认可结合的蛋白结合剂、把七个开源模型的 GPU 推理速度最高提升 2.5x(并让全基因组分析的 GPU 成本降 30–60%)、基于 NASA 三十多年前的雷达数据绘制出精度翻倍的金星高程图。

这组展示在 arxiv 上有一条清晰的演进线可对照:

  • The AI Scientist(Sakana, 2024)提出端到端科研 agent,每篇论文成本不到 15 美元,从选题到写稿全自动。
  • The AI Scientist-v2(2025)产出了第一篇 AI 生成、通过 ICLR workshop 评审的论文
  • Towards an AI co-scientist(Google, 2025)用多 agent + 锦标赛进化提出新假设,并给出经实验验证的候选靶点。

但更有对照价值的是一篇反方论文:AI Scientists Fail Without Strong Implementation Capability(2025)。它系统评估了 5 套 AI Scientist 系统生成的 28 篇论文,结论是:AI 科研的瓶颈不在”会不会想”(选题、写论文),而在”能不能执行严格的验证流程”(跑出可信实验、正确配置环境、复现结果)

这正好解释了为什么 Fable 5.1 把最大提升(+113%)给到了 Terminal-Bench-Science——那个基准测的不是”写一页研究计划”,而是在终端里把实验真正跑通并验证AI 从”知识工作者”变成”操作验证闭环的执行者”,瓶颈从推理迁移到了”长时间把事做完并验证”。

趋势四:agent 化需要新的评测与治理

能力越接近”自主干活”,评测和治理就越不能只看”答得对不对”。Fable 5.1 在治理侧的动作很明确:同一模型拆成 Fable(通用版)与 Mythos(受信研究版) 双版本、推出 Enterprise Frontier Safeguards(EFS)让数据存在客户自控的云基础设施(等效零数据留存)、文本加统计水印 + 图片视频加 C2PA 内容凭证,同时把护栏误报大幅下调(网络安全假阳性 -60%、生物学 -85%)。

arxiv 侧同样在补”自主 agent 的成本与安全”这块评估空白:

  • Survey on Evaluation of LLM-based Agents 明确把 cost-efficiency、safety、robustness 列为 agent 评测的三大缺口。
  • OSWorld-Human(2025)给 369 个 OSWorld 任务配了人工轨迹,发现 computer-use agent 的 planning/reflection 占整体延迟的 75%–94%,最强 agent 仍比必要步骤多走 1.4–2.7x——“能干成”和”用得起”是两件事。
  • 开源侧也在快速逼近:EvoCUA 等通过合成经验进化,把 OSWorld 成功率推到 56.7% 的 SOTA。

一句话:当模型开始替你连续操作电脑、跑业务流、做实验,“能不能管住它、它花多少钱、它会不会越界”就成了评测的前置条件,而不是事后补丁。

与本站主线接起来

三天前我在《合成前沿的八次替换》里写”10% 更差、100x 更便宜”,在《Ramp 数据》里写”用户给累积过工程投入的模型投票”。Fable 5.1 是这条主线的第三个数据点,而且这次是在模型自己的能力分布内部复刻了那条取舍曲线(低 effort 换低成本)。把三条拼起来:

  • 合成前沿(模型侧):验证机制的便宜化,让 100x 便宜的能力档变得可用。
  • 市场端:用户更愿意为”调透的老模型”付费,因为换模型的沉没成本很高。
  • 本次(产品侧):厂商主动把”更便宜档”做成产品卖点(cache read -75% + effort 可切),试图压低用户的迁移成本。

三个视角指向同一个结论:大模型竞争的重心,正在从”谁能答得更难”转向”谁能以更低的成本、更可靠地把长程任务做完”

反方意见与未验证清单

第一:官方跑分是”自报成绩”,且口径有变更。 OSWorld 2.0 官方用了 2026 年 8 月的新任务文件,Anthropic 自己注明”与历史版本不可直接比较”。所以 41.7% 这个数字要和上一代比,但要和更早的公开成绩比就失真了。

第二:科研产出是”精选展示”,不是平均能力。 蛋白结合剂、GPU kernel 优化、金星地图都是早期案例,不代表模型平均科研水平。反方论文 AI Scientists Fail Without Strong Implementation Capability 已经指出:AI 科研系统的实现/验证能力仍是硬瓶颈,能写论文 ≠ 能跑出可信实验。

第三:HLE 只涨 5% 可能是”天花板效应”。 单轮问答的基准本身接近饱和,未必代表模型推理没进步;更准确的读法是”单轮基准已经测不出旗舰之间的差距了”。

第四:cache read 降价只对”长会话 agent”真便宜。 对短查询用户,cache 命中少,25% 的整体节省是平均口径;只有上下文重、工具多的负载才能吃到 45%。

第五:第三方数字未独立复现。 网传”AI 分析指数 66 分""2 万亿 IPO 前夕”等表述来自媒体转述,我未回访原始来源,本文不采信为事实依据。

参考来源

官方

论文(arXiv)

本站相关