“Fable’s cost has made it a less popular model.” —— Simon Willison 转引 FT, Anthropic’s best AI model struggles to attract users as cheaper tools thrive, 2026-08-23。
昨天读 Latent Space 那篇《合成前沿的八次替换》 时,我在旁边随手记了一句话:“这条 ‘10% 更差、100x 更便宜’ 的曲线,在市场端会以什么形态出现?” 隔天 Simon Willison 就贴出了 Ramp AI index 2026-07 的分模型数据,正好是那道题的一个具体样本。这篇就是把两件事接起来读——Ramp 表格是市场端在做同一道选择,但选的对象是同一个品牌里的不同代际。
名词速查
| 术语 | 一句话解释 |
|---|---|
| Ramp AI index | Ramp 用旗下 7 万家企业信用卡账单聚合出的 AI 模型消费占比榜,7 月一期 |
| ARR | 年化经常性收入(Annualized Recurring Revenue),用最近一个月流水 × 12 估计年营收 |
| Fable 5 | Anthropic 的一款模型(叙事/角色扮演系,Simon 的 tag 是 claude-mythos-fable) |
| 家族聚合 | 把 Opus 4.5/4.6/4.7/4.8/5 全部计入”Opus 家族”,看能力档次而非版本号 |
数字账本:FT 的营收 + Ramp 的模型花费
Simon 的短博客真正有信息量的是两组数字。为了不让读者被文字带偏,我先把它们摆到桌面上。
FT 报导转述(据”接近事情的人”提供,非 Anthropic 官宣,Simon 转引,我未独立复现)
| 指标 | 数值 |
|---|---|
| Anthropic 年化收入(7 月) | $65bn |
| Anthropic 年化收入(5 月) | $47bn |
| 两个月增长 | +38.3%(隐含月复合 ~17.6%) |
| 年花 ≥ $100k 的客户数 | 6,000 |
| Q3 预计盈利(口径同 Q2) | 是 |
| OpenAI 年化收入(本季度至今) | >$40bn |
| OpenAI 本季度增速 | +35% |
| OpenAI 增速主因 | GPT-5.6(7 月发布) |
Ramp AI index:Anthropic 家 7 月模型花费占比(原文数据)
| 排名 | 模型 | 占比 |
|---|---|---|
| 1 | Opus 4.8 | 28.0% |
| 2 | Sonnet 4.6 | 8.3% |
| 3 | Fable 5 | 8.0% |
| 4 | Opus 4.6 | 6.9% |
| 5 | Sonnet 5 | 3.6% |
| 6 | Opus 5 | 3.5% |
| 7 | Opus 4.7 | 1.7% |
| 8 | Sonnet 4.5 | 1.3% |
| 9 | Haiku 4.5 | 1.0% |
| 10 | Opus 4.5 | 0.7% |
| — | 前 10 合计 | 63.0% |
表面读法:Opus 5 只占 3.5%——“顶级模型没人用”
如果只看单行,头条就是 FT 那句话:“Anthropic 最新最强的 Opus 5 只占同厂花费的 3.5%,被上一代 Opus 4.8 (28%) 甩开 8 倍。” 这个读法不能算错,但它把两个不同的问题混在了一起:
- “顶级智能”没人要吗? 不是。把 Opus 家族全部代际相加:
28.0 + 6.9 + 3.5 + 1.7 + 0.7 = 40.8%。Opus 系仍是 Anthropic 花费的最大档。 - “最新的旗舰”没人要吗? 是。Opus 5 只占 3.5%,Sonnet 5 只占 3.6%,同代际两款加起来 7.1%——远远不如 4.8 一款单挑。
单行数字讲的是”哪个版本”,家族聚合讲的是”哪种智能档次”。这两件事一起看,才是完整信号。
我的读法:用户在给”累积过工程投入的模型”投票
Opus 5 才发布六到七天(据 Simon,7 月 24 日发布),Ramp 数据是整个 7 月——所以数据本身在给 Opus 5 一个不到 1/4 月的窗口。看似不公平。但这恰恰是这份数据的信号最强的部分。
放到我们工程师日常的视角:一个模型刚发布的时候,围绕它的工程配套是 0。
| 配套项 | Opus 4.8 (发布已 3+ 个月) | Opus 5 (发布 <1 周) |
|---|---|---|
| SDK / API 客户端 | 已稳定 | 刚支持 |
| 内部 prompt 库 | 已调优 | 需要重跑 |
| 组织内评测数据 | 已积累 | 空 |
| KV 缓存 / prefix cache 命中 | 稳定 | 全冷启 |
| Runbook / 常见问题 | 团队内已知 | 空 |
| 观测/监控 dashboard | 已接 | 需要新配 |
| 客户合同 SLA | 已就位 | 谈判中 |
上一篇 attention-interface 那篇 讲过 harness 与模型是共同进化的。这张表就是那个共同进化在用户侧的镜像:用户为一个模型累积起来的工程投入本身就是 harness 的一部分——只不过它长在用户组织里,不长在模型厂商这里。换模型,等于扔掉这一整套 harness。
用昨天那篇《合成前沿八次替换》的语言说:用户端也有一条”生成 vs 验证”的曲线。新模型的生成能力可能立即上了一档,但用户对它的验证(我们的评测跑不跑得通、监控是不是接得住、prompt 是不是还能用)至少要落后几周到几个月。当验证跟不上生成的时候,用户会理性地留在老版本上——即使代价是 10% 更差(能力上)。
这就是 Ramp 表在讲的经济逻辑:“10% 更差,100x 更便宜”在同厂内的形态是”10% 更差,100x 已经调透了”。老 Opus 4.8 不便宜——但它的沉没工程投入等价于便宜。
我的第二读法:Fable 5 的位置意外偏高
Ramp 榜单第三名是 Fable 5,占 8.0%——高于 Sonnet 5 (3.6%) 和 Opus 5 (3.5%) 的加总。Simon 顺手说了句”Fable’s cost has made it a less popular model”——他的意思是”比预期少受欢迎”(less popular than expected)而非”排名靠后”。这是转述句里最容易失真的地方。
Fable 是 Anthropic 一条并行产品线(Simon 的 tag claude-mythos-fable 暗示它是叙事/角色/mythos 系列)。Fable 5 能排到第三,说明中档差异化产品并没有被主线淹没。这提示了一件在 Opus/Sonnet 的两轴讨论里容易漏掉的事:大模型市场已经开始有”品类”——不是所有需求都能被”通用 flagship + mini”两档接住。角色扮演/叙事这一类,用户宁愿付溢价用专线,也不愿意用通用旗舰硬扭。
这条比 Opus 5 只占 3.5% 更有信息量——因为分品类才是市场成熟的信号。顶端集中变成中档分化,这个曲线走过一次就没有回头路。
与本站主线接起来
三天连续读三篇文章(Latent Space × 2 + Simon Willison × 1),拼起来其实是同一个大结构的三个视角:
- attention-interface(昨天写) 说:agent 内部,harness 被模型吸收,剩下的是给人的接口。
- 合成前沿八次替换(昨天写) 说:AI 生产管线,人类角色一格格被模型化,推动力是验证机制的便宜化。
- 本篇 说:市场端,用户在给”累积过工程投入的模型”投票,即使旗舰更强,也宁可用更便宜、更调透的老版本。
三条主线的共同祖先是同一句话:能力提升的收益,要减去”围绕能力搭建的工程投入被重置”的沉没成本,才是用户真实感知到的效用。这句话 Anthropic 官方不会说,OpenAI 官方也不会说——只有 Ramp 这样的账单聚合数据能说。
给自己留一个可以复检的判断:如果这条规律成立,那么每一次”最新旗舰”的采用率至少要滞后 3-6 个月才能超过上一代——除非新旗舰便宜 3x 以上(这时用户会主动换)。Ramp 明年 1 月一期数据,如果 Opus 5 仍在 <10%,我就把这条从”猜想”升到”观察”;如果 >20%,我就要修改这个模型(可能是我低估了 API 用户的迁移意愿,或 Anthropic 出了强价格激励)。
反对意见与未验证清单
第一:Ramp 只是 7 万家企业信用卡。数据不代表所有工作负载——尤其大厂用直付合同(不走信用卡)的部分完全不在样本里。所以这份表偏向中小企业和创业公司,而这一群体正是换模型摩擦最大(工程团队小、评测投入相对更贵)的一群。这可能放大了”老模型粘性”效应。真实全市场的 Opus 5 占比大概率高于 3.5%,但也不会跳到 30%。
第二:Opus 5 只发布了 6-7 天。数据周期不公平。这条我在正文已展开,不重复。
第三:FT 的”6,000 客户 ≥ $100k/年”没有对应到具体产品。这些客户是买 Claude API、Claude Enterprise、还是 Claude Code?不同产品线的模型选择行为差异极大。Simon 转引也没给分解。这个数字可以说明 Anthropic 收入侧健康,但它不能反驳 Ramp 表——Ramp 表说的是具体调用哪个模型,不是”你付了多少钱给 Anthropic”。
第四:“struggles to attract users”是 FT 的标题,不是 Anthropic 的自我描述,也不是数据支持的结论。从 5 → 7 月 ARR 从 65bn(月复合 ~17.6%)是任何标准下都不算”struggle”的增长。真正的说法应该是”最新旗舰的采用率不如上一代旗舰的存量”——这不是”卖不动”,是”迭代速度快于用户迁移速度”。这两件事的政治含义完全不同。
带得走的东西:三件事
第一件:读市场表要做家族聚合。 不管 Ramp 还是 OpenRouter 或者 Together AI 的用量榜,看单行会误读,做家族聚合(智能档次 × 品类)才是真信号。
第二件:模型换代的”用户侧沉没成本”值得单独记账。你团队为一个模型积累的评测、prompt、runbook、KV cache 命中,都是用户端 harness——换模型的真实成本不是 API 单价差,是这些东西被清零。这个账我此前没在本站写过,值得单开一篇。
第三件:数字要挂到时间轴上。 一款 6-7 天的模型和一款 3+ 月的模型比份额是不公平的。下一次读同类数据(Ramp / Artificial Analysis 用量榜等)时,主动核对每款模型的已发布时长再判读。
诚实的提醒
本文数字全部来自:
- Simon Willison 的转引(Ramp AI index 2026-07 的 10 行占比)
- Simon 转引的 FT 报导(“接近事情的人”提供的营收数字)
我均未独立复现,也未回访 Ramp / Anthropic / OpenAI 原始来源。Ramp 榜单本身在其 ramp.com/data/ai-index 上公开可查,感兴趣的读者可自行核对。文中所有分析(家族聚合、8x 比、17.6% 月复合)都是我基于 Simon 给出的数字手算并已在正文用脚本验算过,可复现。文中所有推测(Fable 是叙事系产品、模型换代 3-6 月滞后规律)我均在正文标注了猜想档,请分开对待。
参考来源
原文
- Simon Willison, Anthropic’s best AI model struggles to attract users as cheaper tools thrive, 2026-08-23。
- Ramp AI index: ramp.com/data/ai-index。
本站相关