在 AI 时代胜人一筹:杠杆不在模型多强,而在你和模型之间那道界面

2005 年一对业余棋手加三台普通电脑,打败了大师加超算——卡斯帕罗夫由此提炼出"弱人类+机器+更好的流程"能赢。结合 Kasparov 定律、Bainbridge《自动化的反讽》、METR 实测 -19% 的 RCT,用一个能手算的 Amdahl 式杠杆公式说清:人机协作的胜负不在谁强,而在两者之间那道界面的质量。

2005 年,一个叫 Playchess 的网站办了场”自由式”(freestyle)国际象棋赛——你可以带电脑、带队友、带任何东西上场。所有人都以为冠军会是”大师 + 顶级引擎”。结果夺冠的是一对美国业余棋手,操着三台普通 PC。卡斯帕罗夫复盘后写下一句话,后来被称为卡斯帕罗夫定律

“弱人类 + 机器 + 更好的流程,胜过单独的强计算机;更惊人的是,也胜过强人类 + 机器 + 差流程。“Kasparov, NYRB 2010

这句话是这篇文章的全部。它把”如何在 AI 时代胜人一筹”从一个励志问题,变成了一个可以拆解、可以计算、可以刻意练习的工程问题。

如果你只带走一句话,就带走这个:

人机协作的产出,不由人的强弱、也不由模型的强弱单独决定,而由两者之间那道「界面 / 流程」的质量决定。模型是放大器,但放大器放大的是流程——流程好,弱手也能赢;流程烂,强手加超算也会输。你能拉开差距、能随时间复利的,从来不是”我用的模型更强”,而是”我和模型之间那道界面更好”。

这正是「杠杆思维」在 AI 时代的具体形态:杠杆 = 撬动的产出 ÷ 投入的力气,而支点就是那道界面。下面我们把这条主线拆成五问:杠杆到底放大了什么、为什么它可以是负的、负的时候是什么机制在作祟、天花板能不能手算出来、以及怎么把杠杆做正。

名词速查

术语一句话解释
卡斯帕罗夫定律人机对局里,决定胜负的是”流程”,不是人的棋力或机器的算力
界面 / 流程(process)人和模型之间怎么来回:你问什么、它看到什么、你怎么核验它、错了怎么退回来
harness包着模型的那段有状态程序——决定模型每步看见什么、输出能对世界做什么(见旧文
工作流 / Agent前者按预定代码轨道跑,后者让模型自己决定下一步(Anthropic 的分界
Amdahl 定律只加速一部分工作时,整体加速有上限;没被加速的那部分决定天花板
deskilling(去技能化)把活长期交给自动化,人自己那点手艺会退化,需要接管时反而接不住

一、杠杆放大的是流程,不是人

先厘清一个最常见的误解:很多人把”用 AI”理解成”我 + 一个更聪明的助手”,于是把注意力全放在”助手够不够聪明”(模型够不够强)上。

但杠杆的数学不是这样的。杠杆是个乘法:产出 = 你的输入 × 放大倍数。放大器忠实地放大喂给它的东西——喂进去的是好流程,它放大好流程;喂进去的是烂流程,它同样忠实地把烂流程放大。这就是为什么 2005 年那对业余选手能赢:他们不比大师懂棋,但他们更懂怎么问、怎么让三台机器互相印证、怎么在机器给出的候选里做取舍。他们的支点更好,于是同样一份力气撬起了更大的产出。

这也解释了一个反直觉现象:换个更强的模型,往往没有换个更好的流程效果大。本站《什么才是好的 Harness》里有个实测数字——同一个模型,harness 不同,端到端性能可以差 6 倍。模型是分子,流程是杠杆,而杠杆是乘上去的。

二、拆解卡斯帕罗夫定律:四种配置,谁赢

把那句话摊开成一张表,主线立刻清楚了。“棋力”是人的原始能力,“算力”是机器的原始能力,“流程”是两者之间那道界面的质量:

配置机器流程结果
强人类单打输给带机器的
强计算机单打输给”弱人+机+好流程”
强人类 + 机器 + 差流程
弱人类 + 机器 + 好流程

最后两行是全部的重点:在人和机器都不弱的一方,输给了流程更好的一方。卡斯帕罗夫自己的解释是——那对业余选手”擅长指挥和’教练’他们的电脑去深入分析局面,这种能力抵消了对手更强的棋感和更大的算力”。

注意这里的”弱人类”不是”外行”。卡斯帕罗夫说得很明确:弱人类懂机器的规则,知道怎么把问题问对。这一点对 AI 时代格外重要:胜出的不是”会敲提示词的人”,而是”懂模型在哪强、在哪必然出错,从而知道该把什么交给它、什么必须自己兜”的人。这道认知,就是流程的核心。

三、灰度提醒:杠杆可以是负的

到这里你可能觉得”那我多用 AI 就是了”。但真实数据给了一记响亮的耳光。

2025 年 7 月,METR 做了一个随机对照试验(RCT,临床药物试验那种金标准):16 位资深开源开发者,在自己平均干了 5 年、烂熟于心的成熟项目上完成 246 个任务,每个任务随机分配”允许/不允许用 AI”。用的是当时前沿的 Cursor Pro + Claude 3.5/3.7 Sonnet(METR, arXiv:2507.09089)。

结果是三层反直觉的错位:

  • 开工前,开发者预测 AI 能让他们快 24%
  • 干完后,他们感觉 AI 让自己快了 20%
  • 而客观测量:允许用 AI 反而让完成时间增加了 19%——AI 把他们拖慢了。

(以上数字均来自 METR 论文,属”核实来源”档,非我亲手复现。)

最刺眼的不是那 19%,是那个感知—现实的鸿沟:人被拖慢了 19%,却坚信自己快了 20%。放大器确实在放大,只不过这次放大的是一个负流程,而当事人浑然不觉。

这是典型的灰度问题,不能简化成”AI 好 / AI 坏”的二元对立。METR 自己也强调边界:样本只有 16 人、都是在极其熟悉的成熟大项目上、用的是早期 2025 的工具。他们明确指出,换成陌生代码库或全新的小项目,结论很可能反过来变成大幅提速。所以正确的问法不是”AI 快不快”,而是——在什么条件下杠杆为正,在什么条件下为负?

四、为什么会负:Bainbridge 1983 的铁律

杠杆为负的机制,一位认知心理学家在 1983 年就写清楚了——那时还没有 LLM,她讲的是自动化工厂和飞机驾驶舱。Lisanne Bainbridge 的《自动化的反讽》(Ironies of Automation, Automatica 19(6):775–779)至今被引用超过一千八百次,且还在涨。

它的核心反讽是:你把越多的活交给自动化,剩下那点必须由人干的活,就越难。 有三个机制:

  1. 剩余任务是最难的那些。 能自动化的都自动化了,留给人的恰恰是机器搞不定的疑难杂症——而人平时又不练手,真遇上时反而更吃力。
  2. 接管总发生在最糟的时刻。 需要人工介入,通常正是系统出问题的时候,此时需要的是更强而非更弱的人、更闲而非更忙的人。
  3. 技能会因闲置而退化(deskilling)。 长期不用的手艺会生疏,等你需要接管时,你已经不是当年那个你了。

把这三条翻译到 AI 编程:模型替你写了 80% 的代码,剩下 20% 是它反复搞不定的边界情况、诡异的集成、需要全局判断的架构决策——恰恰是最难的部分。与此同时,你花在”读懂并核验模型输出”上的认知负荷不降反升;你自己徒手写代码的手感,在慢慢退化。METR 那 19%,本质就是 Bainbridge 铁律在 2025 年的一次精确复现。

Bainbridge 还点破了一个设计者的谬误:工程师总把人当成”系统里最不可靠的一环”,想把人设计掉;但结果不是消灭了人类的易错性,而是把它从车间挪到了设计室。这句话今天听格外扎心——把判断全塞进提示词、指望模型全自动兜底的人,只是把自己的错误挪到了更看不见的地方。

五、把天花板算出来:一个能手算的杠杆公式

Bainbridge 是定性的,我们能不能把它变成一个能手算的式子?能——借 Amdahl 定律。它原本讲”只并行化一部分程序时,整体能快多少”,换成人机协作恰好合身:

整体加速比=1(1p)k+ps\text{整体加速比} = \frac{1}{(1-p)\cdot k + \dfrac{p}{s}}

  • pp:你的工作里 AI 能实际接手的比例;
  • ss:AI 在那部分上的加速倍数;
  • kk剩余工作(那 1p1-p)的”税率”——核验、上下文切换、去技能化带来的额外负担,Bainbridge 说的就是这个 k>1k>1

拿几个数字过一遍(以下均用一次性脚本 python3 -c 验算过,属”亲手测”档):

场景ppsskk整体加速
A 一半工作、AI 提速 5×、无额外税0.551.01.67×
B 同上,但剩余工作 +20% 核验税0.551.21.43×
C AI 在它那半反而变 0.77×(摩擦),剩余不变0.50.771.00.87×(慢 13%)
D 八成可外包、5× 提速、剩余 +50% 税0.851.52.17×

三个能带走的结论:

  • 天花板由 1p1-p 决定,不由 ss 决定。 场景 A 里就算把 AI 那半调成”无限快”(ss\to\infty),整体也只能到 1/0.5=2×1/0.5 = 2×你没交出去的那部分,才是你的天花板。 想再高,得想办法把更多工作变得”可安全外包”——这是流程设计,不是换模型。
  • 杠杆真的会翻负。 场景 C 只要 AI 那部分因为来回摩擦反而更慢,整体立刻从加速变成 慢 13%——方向和 METR 的 −19% 完全一致。同一个公式,既解释了提速也解释了拖慢。
  • kk 是隐形杀手。 场景 B 和 D 告诉你,核验税每涨一点,收益就被吃掉一大块。流程优化的主战场,就是把 kk 压回接近 1——让核验变便宜、让错误早暴露。

六、把杠杆做正:三个支点

流程不是玄学,它落在三个可操作的支点上,每一个本站都有专文,这里给你接口:

支点一:把界面做对——判断归模型,物理归代码。 好流程的第一件事,是分清哪些该由模型判断、哪些该由代码保证。写进提示词的规则是”恳求”(请不要删库),写进 harness 的规则是”物理法则”(你无法删库)。把确定性的活从模型手里拿走、让错误变便宜,这是压低上面那个 kk 的主力。展开见《什么才是好的 Harness》

支点二:让它伸对手——工具是目标函数的影子。 模型会不会调工具、会不会滥用,不取决于它”懂不懂”,而取决于目标函数怎么塑造。理解这一点,你才知道什么时候能信它自己调工具、什么时候得由流程兜住。展开见《模型为什么会伸手》

支点三:先上工作流,再谈 Agent。 Anthropic 在《构建高效 Agent》里划了条线:工作流是模型和工具跑在预定代码轨道上,Agent 是模型自己决定下一步。他们的建议朴素但反潮流——从最简单的方案开始,只在任务真的需要动态决策时才升级到 Agent。多数生产系统其实是工作流,因为工作流可预测。对照 Amdahl:工作流是在用代码固定住流程、把 kk 摁在低位;盲目上全自动 Agent,往往是在给自己加 kk

这三条不是三个技巧,是同一件事的三个切面:你和模型之间那道界面的质量

结尾:一张自检表 + 一个最低成本实验

下次在决定”要不要、以及怎么让 AI 介入一件事”时,对着这张表过一遍:

问题对应原理如果答案不妙
这件事我熟到什么程度?越熟,AI 提速空间越小METR 边界条件熟悉的成熟代码,谨慎;陌生/全新场景,放心用
1p1-p(我必须自己干的部分)有多大?Amdahl 天花板太大就先想怎么把工作拆得可外包,别急着换模型
核验它的输出,比我自己做还累吗?kk 税率 / Bainbridge是,就先把核验做便宜(测试、类型、diff 门)
出错时我还接得住吗?我的手艺退化了吗?deskilling接不住,就保留一部分自己动手,别全托管
这一步该模型判断,还是该代码保证?判断归模型物理归代码该物理的别写进提示词恳求

诚实的提醒:本文的 METR 数字(−19%、24%、20%)、卡斯帕罗夫原话、Bainbridge 三机制,均来自公开来源并当场核实,但我没有亲手复现 METR 的 RCT;Amdahl 那几个数字是我用脚本算的,可复现但只是模型化的示意,真实工作里 p/s/kp/s/k 都难精确测量。

一个人人都能跑的最低成本实验:挑一个你熟悉的小任务和一个你陌生的小任务,各做两遍——一遍纯手工、一遍配合 AI,掐表记录真实耗时(不是感觉)。你大概率会看到:陌生任务上 AI 是正杠杆,熟悉任务上可能是负的,而你的体感在两种情况下都偏乐观。这个 15 分钟的实验,比读十篇方法论更能校准你对自己那道界面的认识——而校准这道界面,就是在 AI 时代持续胜人一筹的复利本身。


参考来源

思想源头与工程实践

论文

本站相关