10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次

深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。

“10% worse, 100x cheaper, 10000x faster… and improving on ALL three dimensions fast.” —— Latent Space AINews, 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over, 2026-08-22。

昨天写完 attention-interface 那篇,Latent Space 同一天还发了另一篇更宏大的思考——它把”harness 被模型吸收”这个现象一路推到了整条 AI 生产管线。作者用一句话把八年史缩成一张网格:

每年,都有一格 AI 管线从”人做的”翻成”模型做的”;每格翻转之前都伴随同一句反对(“model collapse / GIGO”),每格翻转都发生在一个便宜的验证机制到位的那一刻。

这条主线值得单开一篇,因为它是本站已有几个片段的共同祖先——评测→路由决策图里的”评测器决定路由器”、subterranean-agent 那篇里的”流程编译进权重”、attention-interface里的”harness 吸进权重”——都是这条大曲线的分支。

名词速查

术语一句话解释
合成前沿 (synthetic frontier)ML 管线里”人做”和”模型做”的分界线,每年往下推一格
patient zero每一格翻转的第一篇论文/产品——不是全民采用,是”在前沿实验室里第一次成为承重结构”
RLAIFReinforcement Learning from AI Feedback,用模型代替人给出偏好信号
LLM-as-judge用模型给模型打分,最早通过 MT-Bench / AlpacaEval 成为默认评测方法
蒸馏 (distillation)用一个强模型的输出作为弱模型的训练数据,把能力从”教师”迁到”学生”
环境合成不再让人写 RL 训练环境,而是让 agent 从真实工作模式里挖出环境,再让另一个 agent 验证它可解
Simile文章提到的一家”人类样本合成”公司——用真实访谈+行为数据 post-train,让模型模拟真人偏好而不是当 agent

主线:不是”生成变强了”,是”验证变便宜了”

正常人读到”AI 系统的教师也变成 AI 了”,第一反应是model collapse——垃圾进垃圾出。这个反对在 2022-2026 每年都被提出,但每一年那格还是翻了。为什么?作者在文末只点了一句:

“The synthetic frontier doesn’t advance when generation gets better. It advances when verification does.”

合成前沿不是被”能生成什么”推动的,是被”能便宜地验证什么”推动的。这句话是全文的钥匙——如果只带走一句,就是这句。下面每一阶段我把它对应的验证机制都单独抽出来(作者只在段落里散着写,我把它们抽成一张对照表)。

八阶段网格:每一格的 patient zero 与验证机制

按作者给的时间顺序,先看编年,再挑其中三格拆细。这里的 patient zero 与”广泛采用”是两回事——patient zero 是第一次成为承重结构的时刻,通常提前 1-2 年出现。

timeline
    title AI 生产线被自己吃掉的八次
    2022 · 奖励信号 : InstructGPT / Constitutional AI<br>LLM-as-judge 成为默认评测<br>验证:judge-vs-judge 一致率研究
    2023 · 训练数据 : Phi 系列 Textbooks Are All You Need<br>Apple WRAP 让预训练效率提升 3 倍<br>验证:aggressive filtering
    2023 · 教师 : Alpaca 600 美元克隆 GPT / Vicuna / Orca<br>DeepSeek-R1 让"教师是模型"成默认<br>验证:on-policy 分布匹配
    2024 · 课程 : Self-Rewarding LM / SPIN<br>模型给自己出题+自己判分<br>验证:自对弈的一致收敛检查
    2025 · 研究员 : AlphaEvolve / AI Scientist<br>Karpathy 2026-03 autoresearch 700 次实验 20 次留存<br>验证:单元测试 + 验证损失
    2026 · 环境 : Z.ai GLM-5.3 端到端合成环境<br>Ornith-1.5 自出题+自采 rollout<br>验证:oracle / no-op / unsolved 三重检查
    2025 · 人的样本 : Generative Agent Simulations of 1000 People<br>Simile 模拟真人偏好<br>验证:registered RCTs
    2026 · 物理世界 : Poolside 反向招聘赌"实验环路"<br>CZ Biohub 虚拟细胞 in silico<br>验证:湿实验室循环(慢且贵)

网格看起来是一条线性时间轴,其实并行推进——stage 6 (2026) 和 stage 7 (2025) 编号相反,因为它们是同时被不同实验室推向前的两个正交格。这也是作者叙事里的第一个软处:把八件平行的事讲成一条链,是修辞选择,不是历史事实。

拆一格:Stage 1 (2022) 的验证机制怎么”够用”

回到 2022 年,为什么第一格”人变模型”要选奖励信号?听起来最反直觉——评判难道不比生成难吗?

作者给的关键是:InstructGPT 只需要”一次性收集人类偏好,然后训一个奖励模型”——之后 policy 优化对着模型跑,永远不用再见人。判断一次是死成本,生成千百万次是新增成本;如果判断能被压成一个可以本地跑的小模型,那”人的判断被 amortize 掉”就是最先能做的事。

验证机制在这一格是 judge-vs-judge agreement study:Zheng et al. 的 MT-Bench 论文 后来正式证明了 GPT-4 裁判和人类偏好一致率 ~85%(人和人之间一致率是 81%)——模型判官不完美,但它和人的偏差和人跟人之间的偏差同量级。这就是”够用”的判据。我在 评测→路由决策图 里提过:这个数字给”模型判官替代人类标注”发了准生证;它也解释了为什么第一格翻的是判官而不是生成器。

拆一格:Stage 5 (2026) 的 Karpathy 循环

Stage 5 “研究员”是 patient zero 与验证机制同时诞生的一格。看清这一格最好的样本是作者引的 Karpathy 2026-03 autoresearch 实验(据原文所述,我未独立复现):一个 coding agent 修改真实 LLM 训练脚本,跑 5 分钟实验,只保留 validation loss 有改善的修改,重复过夜。

作者只报了几个原始数字,我把它算了一遍:

数字直觉
尝试实验数700一夜
留存改动数202.86% 留存率
GPT-2 训练时间从 → 到2.02 h → 1.80 h10.89% 提速

这里”验证机制”是训练脚本自带 validation split——不需要新发明什么,只是把标准的模型评估复用为”决定要不要保留代码变更”的门槛。验证是免费的。这就是为什么”研究员”这一格能翻——不是因为 AI 变会做研究了,是因为决定一次修改值不值得留下这件事,被单元测试 + validation loss 便宜地解了。

拆一格:Stage 8 (2026 · in progress) 的两句自相矛盾

作者对 Stage 8”物理世界”引了两句话,值得盯着看:

  • Poolside CEO:“no amount of intelligence substitutes for real-world experimental feedback — 100,000 brilliant minds won’t cure cancer without a wet lab”——即物理世界是不可合成边界
  • 同一篇文章下段又说:CZ Biohub 用图像把 Human Cell Atlas 压缩成 virtual cell,因为 “in silico is roughly 1000x cheaper and faster than in vivo”——即物理世界正在被压缩进模型

两句话说的其实不同的物理可反复采样的物理(细胞成像、化学、蛋白折叠)正在被压缩进模型;不可反复的物理(临床试验、社会实验)不能。作者没有把这条边界画清楚。我认为清楚地划开这两类,会让 Stage 8 的预测明显更保守——不会全格翻,只会翻其中”可复采”的那一半。

元规律:验证机制的进步表

把每格的验证机制单独列一张表,你会发现它比”什么被合成了”更能预测下一格:

阶段被合成的东西支撑它的验证机制验证机制的属性
1奖励信号judge-vs-judge 一致率研究可离线一次性做完
2训练数据aggressive filtering + 蒸馏损失每条数据 O(1) 打分
3教师on-policy 分布匹配训练时天然产生
4课程自对弈一致收敛无需外部标注
5研究员单元测试 + validation loss复用现有测试基础设施
6环境oracle / no-op / unsolved-state 三重检查环境本身可自省
7人的样本registered RCTs(预注册实验)因果结构可外部认证
8物理世界湿实验室循环慢、贵、不可平行化

盯着最后一列看——验证机制的成本从”离线一次性”逐层升到”物理不可平行”。这就是为什么第八格短期内不会全翻:不是模型不够聪明,是验证太贵。前七格都是”验证便宜到能规模化跑”那一刻才动的。

我的补充判断:下一格翻的会是”临床试验的中间产物”——不是真的临床试验(不可平行),而是能替代它的中间信号(生物标记物预测、in silico 模拟的靶点筛选)。它们的验证成本是wet-lab 的 1/1000,同时保留了因果结构。这是我的猜测,不是原文观点。

把这条主线接回本站

八阶段是我个人观察角度的上位框架,我一直在写的几件事其实都在这张网格的某一格里:

  • attention-interface 那篇(昨天)agent harness → 权重,是 stage 5 “研究员”格在 agent 层的投影——被”吃”的是编排代码,验证是 end-to-end 任务成败。
  • subterranean-agent业务流程 → 权重,是 stage 3 “教师”格的产品化——用 Claude Sonnet 4.5 生成 3000-6000 条对话去蒸馏 Qwen3-8B,验证是流程节点覆盖。
  • 评测→路由决策图 里的”路由器是评测器的蒸馏”:评测信号 → 路由预测器,是 stage 1 “判官”格向下游的传递——判官便宜下来之后,它的输出被再蒸馏成一个更便宜的预测器。
  • evals-as-the-new-prd产品需求的表达 → 评测集,是这张网格里尚未被作者写进的第九格,是我自己的补充猜测。

看清楚一件事:Latent Space 这篇把”合成”讲成一条时间轴,我觉得它其实是一张 3×N 的表——每一格都在同时被推进,只是各家实验室各点其中一格**。它更像 tech tree,不是线性剧情。

反对意见与软肋

按本站的绿灯思维纪律,主张要接住反对意见。这套叙事至少三处不放心:

第一处:作者的”翻转”标准。 什么叫一格”翻了”?作者用 patient zero(前沿实验室里第一次成为承重结构)。但这是一个回溯性判定——2022 年的 InstructGPT 当时没有人说它”翻了奖励信号”,是几年后回头才这么叫。所以按同样的标准,今天可能已经有一格翻了但我们还没意识到。这就是为什么这类文章 3 年后重读会一直发现”作者当时漏了一格”。这不是错,是模型本身的时间粒度限制。

第二处:stage 7 (2025) 和 stage 6 (2026) 编号倒置。 作者把 “人的样本”(Simile 类)标在 2025,把”环境合成”标在 2026——但正文里的 Simile 数据(Generative Agent Simulations of 1000 People 那篇)其实是 2024 年下半年到 2025 年铺开的,而”环境合成”的 patient zero (Self-Instruct + STaR 都是 2022 年,或者更早的 program synthesis 传统)远早于 2026。所以 stage 编号不是严格的时序,是用叙事把八件平行的事排成一条链。读者要有意识地打散它、按验证机制分组。

第三处:数字不完全可查。 文章报了很多具体数字(Karpathy 700→20、GLM-5.3 的 743B、Nature 收录 AI Scientist),有些我可以核实(Karpathy 的实验有公开博客),有些只能”据原文所述”。我在正文中已经就地标注。如果你把这篇当作史料用,请分开对待”论文有 arXiv 号可查”的和”作者转述的产品事件”——前者可拷问,后者要打折。

带得走的东西:三张表 + 一个自检

第一张:八阶段与验证机制(前文已给,是本文核心)

第二张:判断一件”人类专属”事被合成的成本临界

问题判据
生成方是否已经存在?至少一个前沿模型能生成同类样本
验证机制是否可离线做完?O(n) 打分,不依赖新的人参与
验证的假阳性率能否被拷问?用旁路(unit test / oracle / RCT)能否再验证
是否有一个 patient zero 论文/产品?前沿实验室里已经”承重”运行

四个都为是,那一格就要翻了;缺任何一个,先不要押注它明年翻。

第三张:本站相关谱系

网格里的格本站已写
stage 1 判官评测→路由决策图
stage 3 教师subterranean-agent
stage 5 研究员(agent 层投影)attention-interface
stage 5 研究员(harness 层投影)Lilian Weng harness engineering
stage “第九格”猜想evals-as-the-new-prd

自检实验(成本最低):拿你现在维护的任何一个 AI 系统,回答这三个问题:

  1. 系统里最贵、最慢、最需要人做判断的一步是什么?
  2. 那一步的判断标准能不能被写成一个可自动跑的检查(测试/oracle/统计一致率)?
  3. 如果能,你还有必要让人来做那一步吗?

三个答案的合力就是你自己家系统里”下一格翻”的候选。你不必相信 Latent Space 那句 10-100-10000 的口号,你只需要每季度回头看一次自己家的这三个问题——你的组织越答”是”,你就越贴近合成前沿的下一格

诚实的提醒

本文以下数字/事实来自原文,我未独立复现:

  • Karpathy 2026-03 autoresearch:700 次实验、20 次留存、GPT-2 训练时间 2.02 → 1.80 h
  • Z.ai GLM-5.3:743B 底座、端到端合成环境+判官+验证器
  • Simile:post-train 覆盖访谈+交易数据+registered RCTs
  • CZ Biohub Human Cell Atlas → virtual cell 项目
  • Generative Agent Simulations of 1000 People: 85% self-reproduction 一致率(该论文可查,我知道有此结果,但没现场跑复现)

预测型判断(“下一格会翻在临床试验中间产物”)完全属于猜想档,写在正文里就是给未来的自己留一个回来复检的钩子——12 个月后如果它已发生,那就把这条移到主线;如果没发生,就诚实降级。

参考来源

原文

arXiv 论文(每一格 patient zero 至少一篇)

本站相关