“10% worse, 100x cheaper, 10000x faster… and improving on ALL three dimensions fast.” —— Latent Space AINews, 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over, 2026-08-22。
昨天写完 attention-interface 那篇,Latent Space 同一天还发了另一篇更宏大的思考——它把”harness 被模型吸收”这个现象一路推到了整条 AI 生产管线。作者用一句话把八年史缩成一张网格:
每年,都有一格 AI 管线从”人做的”翻成”模型做的”;每格翻转之前都伴随同一句反对(“model collapse / GIGO”),每格翻转都发生在一个便宜的验证机制到位的那一刻。
这条主线值得单开一篇,因为它是本站已有几个片段的共同祖先——评测→路由决策图里的”评测器决定路由器”、subterranean-agent 那篇里的”流程编译进权重”、attention-interface里的”harness 吸进权重”——都是这条大曲线的分支。
名词速查
| 术语 | 一句话解释 |
|---|---|
| 合成前沿 (synthetic frontier) | ML 管线里”人做”和”模型做”的分界线,每年往下推一格 |
| patient zero | 每一格翻转的第一篇论文/产品——不是全民采用,是”在前沿实验室里第一次成为承重结构” |
| RLAIF | Reinforcement Learning from AI Feedback,用模型代替人给出偏好信号 |
| LLM-as-judge | 用模型给模型打分,最早通过 MT-Bench / AlpacaEval 成为默认评测方法 |
| 蒸馏 (distillation) | 用一个强模型的输出作为弱模型的训练数据,把能力从”教师”迁到”学生” |
| 环境合成 | 不再让人写 RL 训练环境,而是让 agent 从真实工作模式里挖出环境,再让另一个 agent 验证它可解 |
| Simile | 文章提到的一家”人类样本合成”公司——用真实访谈+行为数据 post-train,让模型模拟真人偏好而不是当 agent |
主线:不是”生成变强了”,是”验证变便宜了”
正常人读到”AI 系统的教师也变成 AI 了”,第一反应是model collapse——垃圾进垃圾出。这个反对在 2022-2026 每年都被提出,但每一年那格还是翻了。为什么?作者在文末只点了一句:
“The synthetic frontier doesn’t advance when generation gets better. It advances when verification does.”
合成前沿不是被”能生成什么”推动的,是被”能便宜地验证什么”推动的。这句话是全文的钥匙——如果只带走一句,就是这句。下面每一阶段我把它对应的验证机制都单独抽出来(作者只在段落里散着写,我把它们抽成一张对照表)。
八阶段网格:每一格的 patient zero 与验证机制
按作者给的时间顺序,先看编年,再挑其中三格拆细。这里的 patient zero 与”广泛采用”是两回事——patient zero 是第一次成为承重结构的时刻,通常提前 1-2 年出现。
timeline
title AI 生产线被自己吃掉的八次
2022 · 奖励信号 : InstructGPT / Constitutional AI<br>LLM-as-judge 成为默认评测<br>验证:judge-vs-judge 一致率研究
2023 · 训练数据 : Phi 系列 Textbooks Are All You Need<br>Apple WRAP 让预训练效率提升 3 倍<br>验证:aggressive filtering
2023 · 教师 : Alpaca 600 美元克隆 GPT / Vicuna / Orca<br>DeepSeek-R1 让"教师是模型"成默认<br>验证:on-policy 分布匹配
2024 · 课程 : Self-Rewarding LM / SPIN<br>模型给自己出题+自己判分<br>验证:自对弈的一致收敛检查
2025 · 研究员 : AlphaEvolve / AI Scientist<br>Karpathy 2026-03 autoresearch 700 次实验 20 次留存<br>验证:单元测试 + 验证损失
2026 · 环境 : Z.ai GLM-5.3 端到端合成环境<br>Ornith-1.5 自出题+自采 rollout<br>验证:oracle / no-op / unsolved 三重检查
2025 · 人的样本 : Generative Agent Simulations of 1000 People<br>Simile 模拟真人偏好<br>验证:registered RCTs
2026 · 物理世界 : Poolside 反向招聘赌"实验环路"<br>CZ Biohub 虚拟细胞 in silico<br>验证:湿实验室循环(慢且贵)
网格看起来是一条线性时间轴,其实并行推进——stage 6 (2026) 和 stage 7 (2025) 编号相反,因为它们是同时被不同实验室推向前的两个正交格。这也是作者叙事里的第一个软处:把八件平行的事讲成一条链,是修辞选择,不是历史事实。
拆一格:Stage 1 (2022) 的验证机制怎么”够用”
回到 2022 年,为什么第一格”人变模型”要选奖励信号?听起来最反直觉——评判难道不比生成难吗?
作者给的关键是:InstructGPT 只需要”一次性收集人类偏好,然后训一个奖励模型”——之后 policy 优化对着模型跑,永远不用再见人。判断一次是死成本,生成千百万次是新增成本;如果判断能被压成一个可以本地跑的小模型,那”人的判断被 amortize 掉”就是最先能做的事。
验证机制在这一格是 judge-vs-judge agreement study:Zheng et al. 的 MT-Bench 论文 后来正式证明了 GPT-4 裁判和人类偏好一致率 ~85%(人和人之间一致率是 81%)——模型判官不完美,但它和人的偏差和人跟人之间的偏差同量级。这就是”够用”的判据。我在 评测→路由决策图 里提过:这个数字给”模型判官替代人类标注”发了准生证;它也解释了为什么第一格翻的是判官而不是生成器。
拆一格:Stage 5 (2026) 的 Karpathy 循环
Stage 5 “研究员”是 patient zero 与验证机制同时诞生的一格。看清这一格最好的样本是作者引的 Karpathy 2026-03 autoresearch 实验(据原文所述,我未独立复现):一个 coding agent 修改真实 LLM 训练脚本,跑 5 分钟实验,只保留 validation loss 有改善的修改,重复过夜。
作者只报了几个原始数字,我把它算了一遍:
| 数字 | 值 | 直觉 |
|---|---|---|
| 尝试实验数 | 700 | 一夜 |
| 留存改动数 | 20 | 2.86% 留存率 |
| GPT-2 训练时间从 → 到 | 2.02 h → 1.80 h | 10.89% 提速 |
这里”验证机制”是训练脚本自带 validation split——不需要新发明什么,只是把标准的模型评估复用为”决定要不要保留代码变更”的门槛。验证是免费的。这就是为什么”研究员”这一格能翻——不是因为 AI 变会做研究了,是因为决定一次修改值不值得留下这件事,被单元测试 + validation loss 便宜地解了。
拆一格:Stage 8 (2026 · in progress) 的两句自相矛盾
作者对 Stage 8”物理世界”引了两句话,值得盯着看:
- Poolside CEO:“no amount of intelligence substitutes for real-world experimental feedback — 100,000 brilliant minds won’t cure cancer without a wet lab”——即物理世界是不可合成边界。
- 同一篇文章下段又说:CZ Biohub 用图像把 Human Cell Atlas 压缩成 virtual cell,因为 “in silico is roughly 1000x cheaper and faster than in vivo”——即物理世界正在被压缩进模型。
两句话说的其实不同的物理:可反复采样的物理(细胞成像、化学、蛋白折叠)正在被压缩进模型;不可反复的物理(临床试验、社会实验)不能。作者没有把这条边界画清楚。我认为清楚地划开这两类,会让 Stage 8 的预测明显更保守——不会全格翻,只会翻其中”可复采”的那一半。
元规律:验证机制的进步表
把每格的验证机制单独列一张表,你会发现它比”什么被合成了”更能预测下一格:
| 阶段 | 被合成的东西 | 支撑它的验证机制 | 验证机制的属性 |
|---|---|---|---|
| 1 | 奖励信号 | judge-vs-judge 一致率研究 | 可离线一次性做完 |
| 2 | 训练数据 | aggressive filtering + 蒸馏损失 | 每条数据 O(1) 打分 |
| 3 | 教师 | on-policy 分布匹配 | 训练时天然产生 |
| 4 | 课程 | 自对弈一致收敛 | 无需外部标注 |
| 5 | 研究员 | 单元测试 + validation loss | 复用现有测试基础设施 |
| 6 | 环境 | oracle / no-op / unsolved-state 三重检查 | 环境本身可自省 |
| 7 | 人的样本 | registered RCTs(预注册实验) | 因果结构可外部认证 |
| 8 | 物理世界 | 湿实验室循环 | 慢、贵、不可平行化 |
盯着最后一列看——验证机制的成本从”离线一次性”逐层升到”物理不可平行”。这就是为什么第八格短期内不会全翻:不是模型不够聪明,是验证太贵。前七格都是”验证便宜到能规模化跑”那一刻才动的。
我的补充判断:下一格翻的会是”临床试验的中间产物”——不是真的临床试验(不可平行),而是能替代它的中间信号(生物标记物预测、in silico 模拟的靶点筛选)。它们的验证成本是wet-lab 的 1/1000,同时保留了因果结构。这是我的猜测,不是原文观点。
把这条主线接回本站
八阶段是我个人观察角度的上位框架,我一直在写的几件事其实都在这张网格的某一格里:
- attention-interface 那篇(昨天):agent harness → 权重,是 stage 5 “研究员”格在 agent 层的投影——被”吃”的是编排代码,验证是 end-to-end 任务成败。
- subterranean-agent:业务流程 → 权重,是 stage 3 “教师”格的产品化——用 Claude Sonnet 4.5 生成 3000-6000 条对话去蒸馏 Qwen3-8B,验证是流程节点覆盖。
- 评测→路由决策图 里的”路由器是评测器的蒸馏”:评测信号 → 路由预测器,是 stage 1 “判官”格向下游的传递——判官便宜下来之后,它的输出被再蒸馏成一个更便宜的预测器。
- evals-as-the-new-prd:产品需求的表达 → 评测集,是这张网格里尚未被作者写进的第九格,是我自己的补充猜测。
看清楚一件事:Latent Space 这篇把”合成”讲成一条时间轴,我觉得它其实是一张 3×N 的表——每一格都在同时被推进,只是各家实验室各点其中一格**。它更像 tech tree,不是线性剧情。
反对意见与软肋
按本站的绿灯思维纪律,主张要接住反对意见。这套叙事至少三处不放心:
第一处:作者的”翻转”标准。 什么叫一格”翻了”?作者用 patient zero(前沿实验室里第一次成为承重结构)。但这是一个回溯性判定——2022 年的 InstructGPT 当时没有人说它”翻了奖励信号”,是几年后回头才这么叫。所以按同样的标准,今天可能已经有一格翻了但我们还没意识到。这就是为什么这类文章 3 年后重读会一直发现”作者当时漏了一格”。这不是错,是模型本身的时间粒度限制。
第二处:stage 7 (2025) 和 stage 6 (2026) 编号倒置。 作者把 “人的样本”(Simile 类)标在 2025,把”环境合成”标在 2026——但正文里的 Simile 数据(Generative Agent Simulations of 1000 People 那篇)其实是 2024 年下半年到 2025 年铺开的,而”环境合成”的 patient zero (Self-Instruct + STaR 都是 2022 年,或者更早的 program synthesis 传统)远早于 2026。所以 stage 编号不是严格的时序,是用叙事把八件平行的事排成一条链。读者要有意识地打散它、按验证机制分组。
第三处:数字不完全可查。 文章报了很多具体数字(Karpathy 700→20、GLM-5.3 的 743B、Nature 收录 AI Scientist),有些我可以核实(Karpathy 的实验有公开博客),有些只能”据原文所述”。我在正文中已经就地标注。如果你把这篇当作史料用,请分开对待”论文有 arXiv 号可查”的和”作者转述的产品事件”——前者可拷问,后者要打折。
带得走的东西:三张表 + 一个自检
第一张:八阶段与验证机制(前文已给,是本文核心)
第二张:判断一件”人类专属”事被合成的成本临界
| 问题 | 判据 |
|---|---|
| 生成方是否已经存在? | 至少一个前沿模型能生成同类样本 |
| 验证机制是否可离线做完? | O(n) 打分,不依赖新的人参与 |
| 验证的假阳性率能否被拷问? | 用旁路(unit test / oracle / RCT)能否再验证 |
| 是否有一个 patient zero 论文/产品? | 前沿实验室里已经”承重”运行 |
四个都为是,那一格就要翻了;缺任何一个,先不要押注它明年翻。
第三张:本站相关谱系
| 网格里的格 | 本站已写 |
|---|---|
| stage 1 判官 | 评测→路由决策图 |
| stage 3 教师 | subterranean-agent |
| stage 5 研究员(agent 层投影) | attention-interface |
| stage 5 研究员(harness 层投影) | Lilian Weng harness engineering |
| stage “第九格”猜想 | evals-as-the-new-prd |
自检实验(成本最低):拿你现在维护的任何一个 AI 系统,回答这三个问题:
- 系统里最贵、最慢、最需要人做判断的一步是什么?
- 那一步的判断标准能不能被写成一个可自动跑的检查(测试/oracle/统计一致率)?
- 如果能,你还有必要让人来做那一步吗?
三个答案的合力就是你自己家系统里”下一格翻”的候选。你不必相信 Latent Space 那句 10-100-10000 的口号,你只需要每季度回头看一次自己家的这三个问题——你的组织越答”是”,你就越贴近合成前沿的下一格。
诚实的提醒
本文以下数字/事实来自原文,我未独立复现:
- Karpathy 2026-03 autoresearch:700 次实验、20 次留存、GPT-2 训练时间 2.02 → 1.80 h
- Z.ai GLM-5.3:743B 底座、端到端合成环境+判官+验证器
- Simile:post-train 覆盖访谈+交易数据+registered RCTs
- CZ Biohub Human Cell Atlas → virtual cell 项目
- Generative Agent Simulations of 1000 People: 85% self-reproduction 一致率(该论文可查,我知道有此结果,但没现场跑复现)
预测型判断(“下一格会翻在临床试验中间产物”)完全属于猜想档,写在正文里就是给未来的自己留一个回来复检的钩子——12 个月后如果它已发生,那就把这条移到主线;如果没发生,就诚实降级。
参考来源
原文
- Latent Space AINews, 10% worse, 100x cheaper, 10000x faster: Why Simulation is taking over, 2026-08-22。
arXiv 论文(每一格 patient zero 至少一篇)
- InstructGPT: Ouyang et al., arXiv 2203.02155(Stage 1)
- Constitutional AI: Bai et al., arXiv 2212.08073(Stage 1)
- MT-Bench + Chatbot Arena / LLM-as-judge: Zheng et al., arXiv 2306.05685(Stage 1 的验证机制)
- Textbooks Are All You Need (Phi): Gunasekar et al., arXiv 2306.11644(Stage 2)
- Self-Instruct: Wang et al., arXiv 2212.10560(Stage 4 的种子)
- STaR: Zelikman et al., arXiv 2203.14465(Stage 4 的种子)
- Self-Rewarding LM: Yuan et al., arXiv 2401.10020(Stage 4)
- Generative Agents (Smallville): Park et al., arXiv 2304.03442(Stage 7)
本站相关