2022 年前后,研究者们反复撞见同一个诡异现象:让一系列不同大小的语言模型做三位数加法、单词还原、波斯语问答这类任务,中小模型的得分几乎贴着”随机乱猜”的地板走——模型扩大十倍,还是零分;再扩大十倍,还是零分;然后在某个规模上,得分毫无预兆地垂直起跳。没有人往训练数据里专门塞过这些任务,没有人改过训练目标,唯一变的只有”大小”。这让人兴奋(继续变大还会冒出什么?),也让人害怕(下一个冒出来的能力,会不会是我们不想要的?)。四年过去,围绕”这到底是什么”的论文接力赛已经跑完了好几棒——这篇文章把整场辩论讲给你听,并给出一个今天来看最站得住的答案。
先给全文的一句话主线:
模型内部的进步几乎总是连续的;所谓”涌现”,是连续的进步穿过一层非线性的”读出面”——苛刻的评分方式、多步任务的乘法闸门、损失与能力之间的阈值映射——投影到我们眼里的阶跃阴影。它一部分是测量的幻觉,一部分是组合与阈值的真实数学,但没有哪部分是魔法。
flowchart TB
S["底层:连续量<br/>预训练损失下降 / 表征质量爬升 / 技能覆盖扩大"]
R1["读出面 1 · 评分非线性<br/>精确匹配:错一个 token 就零分"]
R2["读出面 2 · 组合乘法闸门<br/>k 步任务 ≈ 单步成功率的 k 次方"]
R3["读出面 3 · 损失-能力阈值<br/>损失降过某条线,能力才启动"]
O["表象:涌现<br/>得分曲线垂直起跳,'突然开窍'"]
S --> R1 --> O
S --> R2 --> O
S --> R3 --> O
我们按辩论的时间线走:定名 → 质疑 → 反转 → 显微镜 → 组合数学 → 综合。每一棒都是一篇可查证的论文。
第一幕 · 定名:什么叫”涌现能力”
2022 年 6 月,Google、Stanford、DeepMind 等机构的十几位研究者(Jason Wei 领衔)发表了《Emergent Abilities of Large Language Models》(TMLR 2022),给这个现象下了定义:
一个能力是”涌现的”,如果它不出现在小模型里、却出现在大模型里——因此无法通过外推小模型的表现来预测。
“涌现”这个词借自复杂系统科学。物理学家 Philip Anderson 在 1972 年的著名短文《More is Different》里说:数量的变化会引起质的变化——单个水分子没有”湿”这个属性,一杯水有。Wei 等人的主张是:语言模型也如此,规模本身会带来质变。
论文在 BIG-Bench、MMLU 等基准上整理了大量这样的任务:多位数算术、国际音标转写、单词还原、多步推理、指令理解……它们共享同一个曲线形状——长期贴地,某点起跳。这个形状有两个让人不安的特征:
- 陡峭(sharpness):从”没有”到”有”几乎是瞬间完成的,不是缓坡;
- 不可预测(unpredictability):起跳点出现在哪个规模,事先算不出来。
对照我们在《Scaling Law 深读》里讲过的故事,这就非常奇怪了:模型的预训练损失(预测下一个词的平均错误程度)是全宇宙最平滑、最可预测的曲线之一,平滑到实验室敢拿它当商业计划书。可是下游能力却像开盲盒。同一个模型,一边是丝滑的幂律,一边是垂直的跳变——矛盾就在这里。
第二幕 · 泼冷水:涌现是”海市蜃楼”?
2023 年,Stanford 的 Schaeffer、Miranda 和 Koyejo 发表了《Are Emergent Abilities of Large Language Models a Mirage?》,拿下 NeurIPS 2023 杰出论文奖。他们的主张尖锐得多:
涌现可能不是模型的属性,而是”研究者选了什么评分指标”的属性。非线性、不连续的指标制造出涌现的表象;换成线性、连续的指标,同一批模型输出立刻变回平滑可预测的曲线。
一个能手算的例子:及格线的魔术
想象一个学生在学十位数的算术题,评分规则是精确匹配:十个数字全对才得分,错一个就是零分。设他写对每一位数字的概率是 ,那么整题全对的概率是 。现在看他”连续进步”时发生了什么:
| 单个数字正确率 | 整题全对率 |
|---|---|
| 50% | 约 0.1% |
| 90% | 约 35% |
| 99% | 约 90% |
注意这组数字有多欺骗性:从 50% 到 99%,学生的真实水平连一倍都没提高;但按”整题全对”打分,他的得分从千分之一冲到了九成——一条完美的”涌现”曲线。底层是平缓的爬坡,读出来的是垂直的悬崖。指数放大了尾部,及格线砍掉了中间。
语言模型正是这个学生:它一个 token 一个 token 地输出答案,“精确匹配”要求每个 token 都对。Schaeffer 等人用 GPT-3 系列做了验证:在号称涌现的算术任务上,把评分从”精确匹配”换成连续的”编辑距离”(答案和正确答案差几个字符),涌现消失了,曲线变回平滑爬升——模型的输出一个字没变,变的只是尺子。
他们还做了两件补刀的事:
- 元分析 BIG-Bench:号称涌现的能力几乎全部集中在”多选题打分”和”精确串匹配”这类不连续指标之下;换连续指标的任务,几乎没有涌现。
- 反向制造涌现:在图像任务上,故意给普通深度网络换上不连续指标——从没人报告过涌现的视觉模型,当场”涌现”了。
这一幕的结论听起来像终审判决:涌现是海市蜃楼,是测量的伪影。媒体也大都这么报道了。但辩论没有结束——因为这个解释有一个没堵上的洞。
第三幕 · 反转:换个横轴,涌现还在
Schaeffer 的模型有个前提:底层的 per-token 能力是随规模平滑增长的,涌现只是读出层的放大。但这个前提本身没人验证过——直到 2024 年,清华的 Du、Zeng、Dong、Tang 发表《Understanding Emergent Abilities of Language Models from the Loss Perspective》(NeurIPS 2024),做了一个笨功夫实验:固定语料、分词器和架构,从头训练 30 多个不同大小、不同数据量的模型,然后不看”模型多大”,只看”预训练损失多低”。
两个发现:
- 损失相同,能力相同。 一个小模型多训点数据、一个大模型少训点数据,只要最终预训练损失一样,它们在各种下游任务上的表现就一样。换句话说,“模型大小”根本不是那个决定性变量,损失才是——大小只是降低损失的手段之一。这与我们在 Scaling Law 那篇讲的”计算最优”故事严丝合缝。
- 存在损失阈值,而且连续指标也救不了它。 把下游表现对预训练损失作图,会看到:损失高于某条线时,模型在一批任务上就是随机猜——哪怕用连续指标测,也是随机猜;损失降过那条线,表现才开始爬升。
第二条直接打在 Schaeffer 论证的软肋上:如果涌现纯粹是指标伪影,那换成连续指标后应该处处平滑;可实验显示,在一批需要推理的任务上,连续指标下依然存在”先躺平、后启动”的拐点。于是他们给出了修正版定义:
一个能力是涌现的,如果高损失的模型不具备它、低损失的模型具备它——它无法通过外推高损失模型的表现来预测。
用烧水做类比:Schaeffer 说”你觉得水突变了,是因为你用’开没开’这个二值问题去测温度”;Du 等人回应”就算用温度计连续地测,100°C 那里也真的有一个相变”。指标伪影是真的,但阈值也是真的。两者不矛盾——这正是灰度所在:涌现既不全是幻觉,也不全是魔法。
第四幕 · 显微镜:突变的表象,连续的内里
好,就算承认”真涌现”存在——能力为什么会有阈值?想看清这个,得把模型放到显微镜下。有两路证据,结论指向同一处。
证据一:grokking——一场被拍到全程的”顿悟”
OpenAI 的 Power 等人在 2022 年报告了 grokking 现象:小 Transformer 学模加法(比如 ),训练集早就背得滚瓜烂熟,测试集却长期是随机猜的水平;继续训练很久之后,测试准确率突然从地板跳到接近满分。这是涌现的迷你标本——不用换模型大小,一次训练内部就能看到”突然开窍”。(我们有一篇零基础的 grokking 详解,此处只取结论。)
关键的一棒是 Nanda 等人 2023 年的《Progress measures for grokking via mechanistic interpretability》(ICLR 2023)。他们把那个”顿悟”了的小模型完整逆向工程了:模型内部学出的算法是把加法转成圆周上的旋转(用离散傅里叶变换和三角恒等式实现)。更重要的是,他们据此构造出内部进度条——直接度量”傅里叶电路成形了多少”。结果:
在测试准确率纹丝不动的整个”平台期”,内部电路一直在连续地、稳定地成形。所谓顿悟的瞬间,只是电路质量越过了”能用”的线、模型随即清理掉记忆残余的时刻。
行为上的阶跃,机制上是渐变。就像拼图:你一片一片地拼(连续),但”看出画面是什么”发生在某一片落下的瞬间(阶跃)。突变在观察者眼里,不在过程里。
证据二:量子模型——平滑曲线是无数小台阶的平均
MIT 的 Michaud、Liu、Girit、Tegmark 在《The Quantization Model of Neural Scaling》(NeurIPS 2023)里提出了一个统一两边的图景,他们称之为量子化假说:
模型的知识和技能是一颗一颗离散的”量子”(quanta)——一颗量子对应一个小技能。模型按使用频率从高到低的顺序习得它们;如果技能频率服从幂律分布(语言里到处是幂律),那么把所有技能的习得叠加平均,总损失恰好呈现出我们熟悉的平滑幂律下降。
这一下把第一幕的矛盾解开了:
- 总损失为什么平滑? 因为它是海量小台阶的平均——每颗量子习得时损失掉一小块,叠起来宏观上就是缓坡。就像国家 GDP 曲线平滑,不代表没有任何一家公司突然倒闭。
- 单项能力为什么跳变? 因为一个具体任务可能主要依赖某一颗(或某几颗)量子——那颗量子习得的前后,就是这项任务从不会到会的前后。你测的越”窄”,看到的越像台阶;测的越”宽”,看到的越像缓坡。
他们还真的用梯度聚类从语言模型里自动挖出了这样的技能颗粒,比如”续写递增数列""在限宽文本里预测换行”这类具体的小本事。涌现的”阈值”,在这个图景里就是轮到这颗量子被学会的时刻——排在幂律队列的哪个位置,就在哪个规模上被点亮。
第五幕 · 组合的乘法闸门:为什么偏偏是”大”模型
还剩最后一块拼图。很多涌现能力——多步推理、按复杂指令办事——并不是”一颗量子”,而是多个基本技能的组合。Princeton 的 Arora 和 DeepMind 的 Goyal 在《A Theory for Emergence of Complex Skills in Language Models》里给了一个统计框架:把每段文本看作若干”基本技能”的组合,用缩放律推导技能习得的速度,得到一个乍看违反泛化理论的结论(他们叫它”弹弓泛化”):
当模型对基本技能的掌握随损失下降而普遍提高时,“同时用对 个技能”的复合能力,会在基本技能达标后不久、以更陡峭的方式集体解锁。
数学骨架和第二幕的及格线是同一个:单个技能可靠度 连续爬升, 技能组合的成功率 陡峭起跳。但含义完全反过来了——Schaeffer 用这个式子说”涌现是指标的伪影”,Arora & Goyal 用同一个式子说”涌现是复合任务的真实数学”。差别在于乘法发生在哪里:前者发生在评分器里(可以换掉),后者发生在任务本身的结构里(换不掉——一道需要五步推理的题,本来就要求五步全对)。
这也解释了”为什么偏偏是大模型”:小模型不是”没有”这些基本技能,而是每一项都不够可靠。,看起来什么都不会;,看起来突然全会了。组合任务是一道乘法闸门,把”各项都及格”和”各项都优秀”之间的连续地带,压缩成了一道肉眼可见的门槛。
插曲:还有一种更釜底抽薪的质疑
为完整起见得提一句:Darmstadt 与 Bath 的 Lu 等人在 ACL 2024 的论文里做了一千多组实验,主张许多所谓涌现能力其实可以归结为上下文学习 + 记忆 + 语言知识的组合——尤其是指令微调后的模型,很多”新能力”只是模型学会了更好地利用提示里的示例(上下文学习本身怎么运作,可看这篇)。这提醒我们:讨论涌现时要小心混淆变量——你看到的能力跳变,可能来自提示技巧和微调管线,而不是预训练规模本身。
终幕 · 综合:涌现的本质是什么
四年辩论打完,各家其实并不真的矛盾——他们在回答同一个问题的不同层。把主线展开成三句话:
- 底层是连续的。 预训练损失平滑下降;grokking 的内部电路连续成形;量子按频率队列一颗颗点亮。显微镜下没有魔法时刻。
- 读出是非线性的。 三道非线性把连续变成阶跃:评分器的及格线(精确匹配、多选题——Schaeffer,可以换掉的部分,“幻”的部分);任务的乘法闸门( 步组合 ——Arora & Goyal,换不掉的部分);损失到能力的阈值映射(降过那条线才启动——Du 等人,也换不掉)。
- 我们只看得见读出。 所以宏观叙事永远是”突然开窍”,哪怕过程从来是渐变。
| 论文 | 一句话立场 | 回答哪一层 |
|---|---|---|
| Wei et al. 2022 | 大模型有小模型没有的、无法外推的能力 | 命名现象 |
| Schaeffer et al. 2023 | 相当一部分涌现是不连续指标的伪影 | 读出层(评分器) |
| Du et al. 2024 | 换连续指标后仍有损失阈值,涌现应以损失为横轴重新定义 | 读出层(阈值映射) |
| Michaud et al. 2023 | 知识是离散量子,平滑损失是无数小台阶的平均 | 底层结构 |
| Power 2022 / Nanda 2023 | 行为跳变之下有连续的内部进度条 | 底层动力学 |
| Arora & Goyal 2023 | 技能组合的乘法结构让复合能力集体解锁 | 读出层(任务结构) |
| Lu et al. 2023 | 许多”涌现”可归结为上下文学习+记忆,注意混淆变量 | 测量方法论 |
带走的心智模型一句话就够:连续的地下水位,非线性的泉眼。水位(损失、表征质量、技能覆盖)天天在涨,但你站在地面上,只在水位漫过某个泉眼时看见喷涌。争论”涌现是真是幻”的双方,一方在说”水位是连续的”(对),另一方在说”喷涌是突然的”(也对)——本质是别把泉眼当成水位。
一个怀疑的读者读到这里应该反问:既然底层连续,为什么涌现还是没法预测?诚实的回答分两半。原则上,可预测性正在恢复:UC Berkeley 的 Snell 等人在《Predicting Emergent Capabilities by Finetuning》(COLM 2024)里发现,在目标任务上做微调会把涌现点”提前”到更小的模型上——于是可以用一排小模型加不同量的微调数据,拟合出”涌现定律”,在某些任务上提前预测 4 倍算力之外的模型会不会解锁该能力。实践上,坑还很多:你得事先知道要测哪个任务(对没想到的能力无从预测)、得有基本技能清单(多数任务没有)、而且泉眼的位置依赖数据分布——换个语料,量子的幂律队列就重排了。“原则上连续”和”实践中可预测”之间,隔着我们对任务结构的无知。这也是为什么安全研究者仍然把能力涌现当作真实风险对待:对观察者而言,没被预测到的渐变,和突变没有区别。
延伸阅读(本站)
- Grokking 零基础详解:为什么模型先死记硬背,后来突然真懂了 —— 本文第四幕的完整展开
- Scaling Law 不是物理定律,是一次高杠杆的赌注 —— 平滑的那半边世界
- 零基础陪读 Scaling Laws —— 幂律与 log-log 直线的手算入门
- In-Context Learning 是贝叶斯推断吗 —— 插曲部分的背景
参考文献
- Wei et al., Emergent Abilities of Large Language Models, TMLR 2022 — arXiv:2206.07682
- Schaeffer, Miranda & Koyejo, Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023(杰出论文奖)— arXiv:2304.15004
- Du, Zeng, Dong & Tang, Understanding Emergent Abilities of Language Models from the Loss Perspective, NeurIPS 2024 — arXiv:2403.15796
- Michaud, Liu, Girit & Tegmark, The Quantization Model of Neural Scaling, NeurIPS 2023 — arXiv:2303.13506
- Power et al., Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets, 2022 — arXiv:2201.02177
- Nanda et al., Progress Measures for Grokking via Mechanistic Interpretability, ICLR 2023 — arXiv:2301.05217
- Arora & Goyal, A Theory for Emergence of Complex Skills in Language Models, 2023 — arXiv:2307.15936
- Lu et al., Are Emergent Abilities in Large Language Models just In-Context Learning?, ACL 2024 — arXiv:2309.01809
- Snell, Wallace, Klein & Levine, Predicting Emergent Capabilities by Finetuning, COLM 2024 — arXiv:2411.16035
- Anderson, More is Different, Science 177(4047), 1972