知识不全是线性的,大部分是网状的,知识点之间不一定有绝对的先后关系;前面内容看不懂,跳过去,并不影响学后面的;后面的学会了,有时候更容易看懂前面的。
刷抖音刷到这张截图:雷军站在星空背景的舞台上,讲他的学习方法。点赞几千,评论区一片”受教了”。它听起来像一碗温和的鸡汤——“看不懂就跳过去”,多么宽慰人心。
但我读到第二遍时意识到一件事:这段话精确描述了世界上最成功的一类”学习者”——大语言模型——的学习方式。 乱序输入、允许暂时不懂、靠反复覆盖让理解迟到但抵达。这三件事,恰好各有一批论文在研究。
这篇文章做两件事:先考据这段话从哪来,再用论文逐句审计它——三个分句,三场审计。
一、考据:出自 2023 年度演讲「成长」
这段话出自雷军 2023 年 8 月 14 日的年度演讲,那年的主题是「成长」。上下文是他讲大学自学的经历:自学经常遇到看不懂的地方,一卡就卡很久,特别痛苦。后来他开窍了——实在看不懂的先跳过去,咬着牙往下读,像看小说一样从头读到尾,一本书反复多读几遍,基本就能搞懂。这段方法论的总结,就是截图里那三句话(演讲全文)。
注意一个细节,后面审计时会反复用到:他的原始方法不是”跳过去就算了”,而是”跳过去 + 读完全书 + 反复多遍”。截图只截了前半句,传播中丢掉的后半句,恰恰是整个方法成立的前提。
二、审计第一句:「知识点之间不一定有绝对的先后关系」
这句话有一个天然的对手盘:课程学习(Curriculum Learning)。Bengio 等人在 ICML 2009 提出这个概念时,出发点和雷军完全相反——人类和动物按”由易到难”的顺序学习效果更好,机器也应该如此。这是深度学习里最符合直觉的假设之一,引用数以千计。
但十几年后,在大模型这个尺度上,工程实践给出的答案是:默认乱序。今天所有主流 LLM 的预训练,都是把万亿级 token 打散随机采样喂进去的——莎士比亚的下一个批次可能是 Python 代码,微积分教材紧挨着菜谱。没有人给 GPT 排课程表。
那课程学习到底还有没有用?近两年的系统研究给出了一个灰度答案:
- Beyond Random Sampling(arXiv 2506.11300)训练了 200 多个模型(最多 100B token)做第一次系统对照:课程学习确实能在训练早中期加速收敛,达到基线性能少花 18–45% 的步数;当作”热身”用(先易后难地开头,之后回到随机采样)还有最高 3.5% 的持续增益。顺序不是完全没用。
- 但 Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics(arXiv 2601.21698)用 Pythia 系列模型跑了 300B token 后发现:无论按什么顺序喂数据,模型都会经历同一个先后固定的”潜在学习阶段”序列——课程只是改变每个阶段内部见到什么数据;课程带来的收益集中在小模型上,规模越大,收益越小。
- 更微妙的是,另一项研究(arXiv 2511.18903)发现课程学习的收益还会被标准的学习率衰减吃掉——把好数据排在训练后期,恰好赶上学习率最低、模型”学不动”的阶段。精心设计的顺序,可能败给一个不相干的超参数。
合起来读,第一句话的审计结论是:“先后关系”对学习速度有影响,但不构成硬约束,而且系统规模越大、越不重要。 最强的学习系统用的策略接近”乱序、全量、多遍”——这正是雷军描述的读书方式。他说”不一定有绝对的先后关系”,用词精准:“不一定""绝对”,留了余地。这不是二元对立,是一条随规模移动的曲线。
三、审计第二句:「后面的学会了,更容易看懂前面的」
这句话在大模型研究里有一个几乎逐字对应的现象:grokking(开窍)。
OpenAI 的研究者在 2022 年(arXiv 2201.02177)训练小型 Transformer 做模运算(比如 mod 97 的除法)时观察到一件怪事:模型早早就把训练集背得滚瓜烂熟(训练精度 100%),但在验证集上长期表现为随机瞎猜——按经典机器学习的剧本,这就是过拟合,该停了。可如果你不停,继续训练下去,在十万步之后毫无征兆地,验证精度突然从随机水平跳到接近完美。模型”开窍”了,而且开窍发生在”背下来”之后很久。
把这个曲线翻译成读书体验,就是雷军说的:第一遍读,你只是”背下来了”(知道书上有这句话,但不懂);继续往下读、反复读,某一刻突然全通了——而且通了之后回头看前面卡住的地方,发现不过如此。开窍不是没在发生,只是迟到。
规模维度上还有一个平行现象:Emergent Abilities of Large Language Models(arXiv 2206.07682,TMLR 2022)记录了一批”小模型完全不会、大模型突然就会”的能力——多步推理、代码理解——它们无法从小模型的表现外推预测。学得够多之后,会的不只是”更多”,还有”以前完全不会的”。
但这里必须放一个反方证词:Are Emergent Abilities a Mirage?(arXiv 2304.15004,NeurIPS 2023)指出,很多”能力突变”是度量方式造成的假象——如果你用”完全答对才算分”这种不连续的指标,平滑的底层进步就会呈现为突然的跳变;换成连续指标,涌现曲线大多变回平缓的斜坡。
有意思的是,这个反方证词非但没有削弱雷军的话,反而把它解释得更深了一层:“突然看懂”很可能也是人类版的度量假象。 “能不能读懂这一页”是个不连续的度量——差一点就是读不懂,够了就全懂。你主观体验到的顿悟,底层可能是一直在平滑上涨的积累,只是”懂/不懂”这个二值判断把它渲染成了跳变。所以别用”这一页我还是没懂”来评估自己有没有进步——那个指标本来就是不连续的,它测不出你正在逼近阈值。
四、审计第三句:「知识不全是线性的,大部分是网状的」
前两句讲的是学习的顺序和节奏,这句讲的是知识本身的结构。它恰好是近两年大模型知识机制研究的核心议题,有一正一反两个证据。
正面证据来自 Physics of Language Models: Part 3.1(arXiv 2309.14316,ICML 2024)。Allen-Zhu 和 Li 用可控的合成传记数据做了一个干净的实验:如果一条知识(某人的生日、出生地)在预训练数据里只以单一表述出现一次,模型能把它背下来(续写原文没问题),但提取不出来(问答的时候答不上)。要让知识变得可提取,必须在预训练时做多样化增强——同一条知识换措辞、换句序、换语言反复出现。知识的可提取性和训练数据的多样性度量强相关。
翻译一下:只沿一条线遇见一次的知识,是死知识——存进去了,但用不了。 同一个知识点要从多个方向被反复遇见,它才在网络里”成网”,才能从任意方向被走到。这为”一本书反复多读几遍”提供了机制解释:重读不是简单重复,第二遍时你带着后文的理解回来,同一个知识点被从新的方向访问了一次——这次访问长出来的连接,第一遍给不了。
反面证据更锋利:The Reversal Curse(arXiv 2309.12288,ICLR 2024)。模型在训练数据里学了”瓦莲京娜·捷列什科娃是第一位进入太空的女性”,问它”谁是第一位进入太空的女性”,答对的概率不比随机猜一个名字高。“A 是 B”学会了,“B 是 A”学不会——除非反向表述也在训练数据里出现过。这是纯线性学习失败的最干净证据:知识只沿一个方向压进去,连最简单的反向连接都不会自己长出来。
一正一反放在一起,第三句话的审计结论是:网状不是知识的可选属性,而是知识能被使用的前提。线性学习制造的是单行道,看起来记住了,换个方向问就撞墙。
graph LR
subgraph 线性学习["线性学习:单行道"]
A1[概念 A] --> B1[概念 B] --> C1[概念 C]
end
subgraph 网状学习["网状学习:多向可达"]
A2[概念 A] <--> B2[概念 B]
B2 <--> C2[概念 C]
A2 <--> C2
C2 <--> A2
end
五、三个被截图丢掉的前提
审计到这里,这段话的成色已经很清楚:三句全部有据,而且不是弱相关——它几乎就是预训练工程实践的白话版。但正因为它是对的,更要讲清楚它成立的前提。截图传播时丢掉的,恰恰是这三条:
前提一:跳过 ≠ 不覆盖。 模型”跳过”了暂时学不会的模式,但每个 token 都真实地流过了网络——覆盖率是 100%。雷军的原始方法也是”像看小说一样从头读到尾”,跳的是”卡住死磕”,不是”这章不看了”。只挑看得懂的看,等于主动把训练数据裁剪成舒适区,那不是网状学习,是采样偏差。
前提二:跳过 ≠ 不回来。 Reversal Curse 已经演示了单向读一遍的下场。雷军的方法是”反复多读几遍”,Physics of LM 3.1 证明了为什么必须如此:知识要被多角度重访才可提取。跳过去然后永不回读,留下的就是一堆”A 是 B”式的单行道知识。
前提三:网状适用于知识,不适用于所有技能链。 课程学习研究留下的 18–45% 加速提醒我们:顺序的价值没有归零,尤其在基础技能上。概念性、陈述性的知识大多成网——读不懂反向传播的动机,可以先去学优化器,回头再看;但严格依赖的技能链没有商量余地——不会求导,反向传播的每一行推导对你都是乱码,跳到天边也绕不过去。分辨你面前的东西是”网状知识”还是”线性技能链”,是使用这条建议的前置判断。
六、重写:把自己当成一个正在预训练的模型
按审计结果,把这段话重写成一个可操作的版本:
学一个新领域时,把自己当成一个正在预训练的模型:优先保证覆盖,其次才是顺序——快速通读全量材料,胜过在第三章死磕出的完美理解;同一个知识点,安排自己从多个方向反复遇见它——换一本书、换一个讲法、换一个应用场景,单一来源读十遍不如三个来源各读三遍;给开窍留够步数——“这一页还是看不懂”是个不连续的坏指标,它测不出你正在逼近阈值,别用它判定自己学不会。
雷军在演讲里说,这个方法是他大学自学时被痛苦逼出来的。三十多年后,一批研究者用几百个模型、几千亿 token 的对照实验,把同样的结论一条条重新发现了一遍。这大概是对”知识是网状的”最好的注脚:同一个知识点,人和机器从两个完全不同的方向走到了它面前。
参考来源
演讲出处
课程学习与数据顺序
- Bengio et al., Curriculum Learning, ICML 2009
- Beyond Random Sampling: Efficient Language Model Pretraining via Curriculum Learning, arXiv 2506.11300
- Curriculum Learning for LLM Pretraining: An Analysis of Learning Dynamics, arXiv 2601.21698
- How Learning Rate Decay Wastes Your Best Data in Curriculum-Based LLM Pretraining, arXiv 2511.18903
延迟泛化与涌现
- Power et al., Grokking: Generalization Beyond Overfitting on Small Algorithmic Datasets, arXiv 2201.02177
- Wei et al., Emergent Abilities of Large Language Models, TMLR 2022
- Schaeffer et al., Are Emergent Abilities of Large Language Models a Mirage?, NeurIPS 2023
知识的网状结构
- Allen-Zhu & Li, Physics of Language Models: Part 3.1, Knowledge Storage and Extraction, ICML 2024
- Berglund et al., The Reversal Curse: LLMs trained on “A is B” fail to learn “B is A”, ICLR 2024