38 天发了 206 篇 AI 博客,一个问题把我问倒了:哪个论断背后有我自己跑出来的数字?

一篇自我纠正。我曾以为"不断用 AI 读写博客,似懂非懂也能读成专家"——直到发现自己陷入了 AI 时代特有的新型流畅错觉:写作曾是检验理解的可靠手段,但当 AI 替你把半懂写成全懂的样子,"能产出一篇讲清 X 的文章"就不再是懂 X 的证据。这篇给出病因解剖(三层错觉)、实干型专家的操作性定义(论断-数字账本)、三条纠正规则(评分外置、AI 角色反转)和一个最小实干阶梯。

从 6 月底到今天的 38 天里,我在这个博客发了 206 篇文章:attention 的矩阵推导、KV-Cache 的显存账、vLLM 的源码六连、GRPO 的手算、R1 的解剖、MCTS 的零基础拆解。按”输入量”算,我该是半个专家了。然后一个问题把我问倒了:这两百多篇文章里的论断,哪一个背后有一个我自己跑出来的数字?我翻了一遍,答案接近零——绝大多数是读与转述的产物,少数几篇跑过 demo,没有一篇的核心论断是我亲手测出来的。这不是努力不够,是我掉进了一个 AI 时代特有的新陷阱,而且这个陷阱恰好长在旧解药的位置上。这篇文章是自我纠正,也写给所有正在”用 AI 高效学习”的人。

一句话主线

读和写只能生产”理解”,而实干型专家的操作性定义是:关键论断背后有亲手测出的数字。从似懂非懂到实干,缺的不是更多输入,是把评分权从自己(和 AI)手里,交给编译器、loss 曲线和评测集——它们不会被说服,只会被满足。

病因解剖:错觉有三层,最新一层长在解药上

第一层:读的错觉(经典款)

认知科学里叫”解释深度错觉”(Illusion of Explanatory Depth):Rozenblit & Keil (2002) 让受试者给自己对拉链、抽水马桶这类日常装置的理解打分,然后要求他们写出详细的工作原理,再重新打分——分数显著下降。人普遍高估自己的理解,直到被要求把它完整展开。读得越流畅,这个错觉越强。这一层是老问题,我在上一篇里已经写过:重读制造流畅感,检索才是真信号。

第二层:写,曾经是可靠的解药

正因为”展开它”会戳破错觉,写作长期是检验理解的黄金手段——费曼技巧的全部内容就是”讲不清等于不懂”。费曼去世时,他办公室黑板上留着那句话:“What I cannot create, I do not understand.”(我不能创造的,我就不理解。)写一篇讲清 X 的文章,过去确实是懂 X 的强证据,因为写作强迫你自己完成那次”详细展开”。

第三层:AI 把解药变成了新毒药

现在的问题是:详细展开这一步,AI 可以替你完成。

我给 AI 一个似懂非懂的理解,它还给我一篇结构完整、推导顺滑、连反对意见都替我回应好了的文章。文章是真的好,论断也多半是真的对——但”这篇文章存在”不再证明”我懂了”,它只证明 AI 懂。旧世界里,产出讲清 X 的文章需要以懂 X 为前提;AI 拆掉了这个前提,却保留了产出带来的成就感。评委和考生成了同谋:考生半懂,评委(AI)替他答题,然后两人一起给这场考试打了高分。

于是出现一种新型学习者画像——我自己:输入海量、产出海量、术语齐全、能把 GRPO 和 PPO 的区别讲得头头是道,但从没见过一条自己训出来的 loss 曲线,没测过一次 best-of-n 到底提升几个点,没被一次真实的 OOM 打断过。用 MCTS 的话说:我的树长得枝繁叶茂,但每个节点上的统计值,都是从别人的树上抄来的。

实干型专家的操作性定义

“实干型专家”听起来像态度,其实可以定义得非常硬:你的每一条关键工程论断,能不能在自己的账本里找到一个对应的、亲手测出的数字。

我拿自己写过的论断对照一下,差距立刻具体了:

我写过(且写得头头是道)的论断实干型账本里应该有的数字
KV-Cache 是长上下文解码的显存大头7B 模型跑 32k 上下文时,我自己打印出的 KV 张量实际占了多少 GB
best-of-n 加多数投票能显著提升数学题正确率20 道题、n=8,正确率从百分之几到百分之几——两个数都是我测的
上下文膨胀是长任务 Agent 的第一杀手我的 agent 在第几轮超出窗口,token 消耗曲线长什么样
LoRA 能低成本定制模型我那次微调:几千条数据、几分钟、显存峰值多少、效果前后对比

左列我全部”懂”,右列我一格都填不出来。左右两列的差,就是理解层专家和实干型专家的差。而工程判断力的大半,恰恰藏在右列的量级感里:知道”KV-Cache 很占显存”是常识,知道”大概占几个 GB、什么时候会把你逼到量化”才是判断力——前者读一篇文章就有,后者只能测。

纠正方案:三条规则

纠正不是”别读别写了”。206 篇的理解层是资产不是负债——没有它,上手就是盲人摸象。要改的是给读写加一个硬约束,把评分权交出去。

规则一:每个关键论断,配一个亲手数字

给自己立一个”论断-数字账本”。读写获得的每个信念,入账时标记为未验证;只有配上自己测出的数字,才转正。账本不用大——一年填满二十行,右列那种数字,你就已经甩开绝大多数”读成的专家”了。

规则二:评分外置,三级评委

理解的评分不能由理解者自己(更不能由帮他写作的 AI)来打。三级评委,一级比一级严:

  1. 编译器与运行时:能不能跑通。拦住”根本不成立”的理解——你以为的调用方式可能压根不存在。
  2. 度量:数字是多少。拦住”方向对但量级错”的理解——错一个数量级,工程决策就是灾难。
  3. 交付:评测集或真实用户买不买账。拦住自嗨——你的 agent 在自己设计的三个 case 上完美,在 eval 上通过率可能惨不忍睹。

这三级评委的共同点:不会被流畅的语言说服。你讲得再好,OOM 就是 OOM。

规则三:反转 AI 的角色——从代笔人变成陪练

问题从来不是”用 AI”,是用 AI 干什么。三个角色反转:

  • 出题官,不是答题人:学完一个主题,让 AI 出五道刁钻的问题,合上资料自己答——把 AI 从”替我展开”变成”逼我展开”。
  • 审稿人,不是实验员:实验设计可以让 AI 挑毛病,但数字必须自己跑出来。AI 审方案,世界出成绩。
  • 陪练,不是替身:卡住时问”我哪一步理解错了”,而不是”帮我写完”。前者留下能力,后者留下文章。

一条禁令:不再让 AI 直接产出结论性文章、然后署名为”我懂了”。文章可以照写,但核心论断必须挂着账本里的数字,或者老老实实标注”未验证,转述自 XX”。

最小实干阶梯:三级,每级一个数字

从我的现状出发(理解层充分、动手层接近零),不需要宏大计划,需要一个能立刻开始的阶梯:

第一级·复现一个数字(一个下午) 拿任意开源小模型,对 20 道 GSM8K 题跑 best-of-8 多数投票,统计正确率变化。这是门槛最低的完整实验:有假设(投票能提分)、有对照(n=1 vs n=8)、有一个自己测出的数字。账本开张。

第二级·亲手训一次(一到两周) nanoGPT 完整跑通,盯着自己的 val loss 曲线下降;然后用 LoRA 微调一个小模型做一件具体的小事。目标不是训出好模型,是拿到第二列数字:训练时长、显存峰值、曲线拐点、效果前后对比——以及第一次亲眼看到”教科书曲线”和”我的曲线”哪里不一样。

第三级·从零建一个(一个月) 不用框架,100 行手写 agent loop,接一个真实小任务,再给它配一个自己的 eval(理论我早写过——评测就是新的 PRD,现在轮到实践赎回它)。产出是通过率数字和失败模式清单。到这一级,之前 30 多篇 agent 文章会集体”重新估值”:哪些论断在真实世界站得住,哪些只是转述得流畅。

每一级的交付物相同:一篇必须包含亲手数字的博客。写作照旧,但从”理解的展示”变成”实验的报告”——这是同一个博客的两种完全不同的用法。

边界:别把纠正做过头

灰度地带说清楚,防止从一个坑跳进另一个坑:

  • 读写没有错,顺序也没有错。理解层是必要条件——没读过 KV-Cache 原理就去跑显存实验,测出数字也不知道在看什么。错的只是把必要条件当成了充分条件。
  • 不是每个论断都值得验证。账本只收”关键工程论断”——那些会影响你技术选型的。验证”transformer 有多少层”没有意义,验证”长上下文的真实成本”有。预算依然稀缺,MCTS 的选择规则依然适用。
  • AI 代笔在有些场景完全正当。整理资料、翻译、格式化、给已验证的结论配上更好的表达——都没问题。红线只有一条:不把 AI 的理解误记成自己的理解。

收束:一年后的检验标准

一年后,面对一个真实需求——“我们该不该自己微调""这个 agent 为什么完不成任务""长上下文方案选哪个”——看你给出的技术选型意见里,引用的是自己账本里的数字,还是别人博客里的数字

前者是实干型专家。后者是我过去 38 天的样子:一棵枝繁叶茂、但每个节点的统计值都抄自别人的树。

树的形状可以抄,统计值必须自己跑。


参考文献

  • Rozenblit, L., & Keil, F. (2002). The misunderstood limits of folk science: An illusion of explanatory depth. Cognitive Science, 26(5), 521–562.(解释深度错觉的原始实验)
  • Feynman 办公室黑板遗言(1988):“What I cannot create, I do not understand.”
  • 本站前篇:别抄 AlphaGo 的 490 万局,抄它花预算的方式(四个零件与流畅错觉)
  • 本站前篇:评测就是新的 PRD(第三级阶梯的理论基础)