每个开发者其实都在跑一个搜索算法,只是大多数人跑的是裸贪心:哪个方向眼下最顺就一直走,直到某天发现脚下的山头塌了。2025 年 7 月,METR 用随机对照实验测出”AI 工具让资深开发者完成任务慢了 19%“;仅仅七个月后,METR 自己把这个结论标注为历史快照——不再反映当前工具和工作流(METR, 2026-02)。一个花了大力气测出来的地形数据,半年出头就过期。这就是你正在搜索的地图:它在动。上一篇把”学会一个领域”建模成 MCTS 的预算分配,那套零件默认地图不动;这一篇处理更难的题——当搜索空间本身在漂移时,开发者怎么给”自我革新”找到最优解。答案依然不用发明:搜索领域早就为”会动的地图”造好了升级件,一共四个,逐个装。
一句话主线
“成为 AI 时代的佼佼者”是一个非平稳搜索问题:奖励分布在漂移、只有一条不可重置的轨迹、能观测的全是代理指标、几百万人在同一张图上搜索。静态搜索的四个默认假设各断了一条,搜索领域各有一个现成的修复件:给战绩打折(D-UCB)、受控降温(模拟退火)、生态位精英(MAP-Elites)、防奖励作弊(reward hacking 防御)。“佼佼者”的正确定义随之改变:不是全局最优,是质量-多样性地图上你那一格的精英。
本文不重复推导 MCTS 和 UCB,那是零基础篇干的活;也不重复”预算分配四零件”,那是学习法篇的内容。这篇只讲静态框架之外的四个新零件。
名词速查
| 术语 | 一句话解释 |
|---|---|
| 非平稳(non-stationary) | 各选项的奖励分布随时间变化——今天的好选择,明天可能不再好 |
| 多臂老虎机 | 在多个收益未知的选项之间反复分配预算的标准模型(零基础篇第三节) |
| UCB | ”平均战绩 + 探索加成”的选择公式,探索加成偏袒被冷落的选项(同上,有手算) |
| D-UCB / SW-UCB | 非平稳版 UCB:旧战绩按折扣因子衰减 / 只统计最近一段窗口 |
| 局部最优 | 邻域之内最好、全局并不是的解;贪心算法会停在这里不动 |
| 模拟退火 | 以一个随时间降低的概率接受”变差的一步”,换取跳出局部最优的能力 |
| 质量-多样性 / MAP-Elites | 不找单一最优解,按特征维度把空间分格、每格只保留最强解的搜索算法家族 |
| 代理奖励 | 真实目标难以测量时,拿来替代优化的可测指标 |
| 奖励作弊(reward hacking) | 优化器找到抬高代理指标、却偏离真实目标的路径 |
一、先把题目建模清楚:三个断掉的假设
按搜索问题的标准格式写下来:状态是你此刻的技能组合、作品集和行业位置;动作是把下一段注意力投给哪个方向——深耕现有栈、转向 agent 工程、做开源、换领域;奖励是市场的回报信号——offer、加薪、影响力、复利资产。
这个建模和上一篇的”学习即搜索”看起来只差一层,实际上断了三个假设:
| 静态搜索的默认假设 | 学习问题(上一篇) | 自我革新问题(这一篇) |
|---|---|---|
| 奖励分布平稳 | 基本成立:微积分的价值十年不变 | 断了:AI 正在重新给所有技能定价 |
| 可以多次 rollout、可以 reset | 勉强成立:一个概念学错了可以重学 | 断了:职业只有一条轨迹,三年投错回不了档 |
| 奖励即时、真实 | 成立:自测当场出分 | 断了:回报延迟数年,且你能看到的全是代理指标 |
第一个假设断得最彻底,值得给证据。DORA 2025 年对近 5,000 名技术从业者的调查显示:90% 的受访者已在工作中使用 AI,中位使用时长约每天两小时(DORA 2025 报告、Google 官方摘要);报告的核心结论是 AI 是放大器——放大高效组织的优势,也放大挣扎团队的功能失调,吞吐量上升的同时交付不稳定性也在上升。也就是说:地图不只在动,而且不是对所有人朝同一个方向动。
漂移的速度呢?开头那个 METR 实验就是测速仪:16 名资深开源开发者、246 个真实任务的随机对照实验,测出”允许用 AI 反而慢 19%“(arXiv:2507.09089)——而作者在 2026 年 2 月宣布此结果为历史快照,因为 agentic 工具在 2025 年下半年普及,实验环境本身变了。一条关于”AI 有没有用”的高质量测量,保质期约半年。你三年前对”什么技能值钱”的判断,保质期只会更短。(这个实验与”执行塌价”的完整分析见《执行塌价,判断涨价》,此处不重复。)
三个断掉的假设,就是四个升级件的安装位。
二、升级件一:给战绩打折——非平稳老虎机
标准 UCB 有一个隐含前提:一次胜利永远是一次胜利,五年前的成功和昨天的成功在”平均战绩”里权重相同。地图不动时这是美德(样本越多越准),地图会动时这是毒药——旧数据在替一个已经不存在的世界投票。
Garivier & Moulines 给出了两个修复,思想都是一句话:
- D-UCB(折扣 UCB):算平均战绩时,每条旧记录按年龄乘一个折扣因子 ;
- SW-UCB(滑动窗 UCB):更狠,只统计最近一个窗口内的记录,更早的直接归零。
折扣平均的简化形式(对照论文记号有简化,只保留骨架):
分子分母都按记录年龄打折:越老的回报,话语权越小。两个算法都被证明在”分布会突变”的环境里,后悔值匹配理论下界(至对数因子)。这不是纸面玩具——DeepMind 的 Agent57 在 Atari 上就是用滑动窗 UCB 在一组探索策略之间做在线选择的,引的正是这篇论文。
手算一遍感受差别(数字已用脚本验算)。给”技能 A”记六年的年度回报——市场为它付过钱记 1,没有记 0——从旧到新是 [1, 1, 1, 1, 0, 0]:前四年它一直换来回报,最近两年没有。
- 普通平均:,看起来这条分支还有三分之二的胜率;
- 折扣平均(,一年折一次):四个 1 的权重分别衰减到 ,分子 ,分母(六年权重之和),得 。
同一份数据,普通平均说”还行”,折扣平均说”正在失效”。D-UCB 并不比你多知道任何事实,它只是拒绝让四年前的胜利替今天投票。
翻译成操作,两条:
- 技能盘点表加一列”最近一次被付钱是什么时候”。不是”我会不会”,是”市场上一次为它付钱是何时”——按这一列打折排序,你对自己组合的估值会立刻变化。
- 探索预算永不清零,且比静态环境下更大。非平稳老虎机理论里有个反直觉结论:环境会漂移时,“已经确认的最优臂”也必须持续被质疑,因为它随时可能不再最优。上一篇说”三成时间碰新东西”是静态环境的参考值;地图动得越快,这个比例的下限越高。
三、升级件二:受控降温——接受暂时更差的一步
打折解决”往哪看”,还没解决”敢不敢动”。贪心策略在静态地形上至少能爬到局部山顶;在会动的地形上,它会把你钉死在一个正在下沉的旧山头——每一步横向移动眼下都是亏的(薪资、头衔、熟练度全要回撤),于是永远不动。
模拟退火(Kirkpatrick, Gelatt & Vecchi, Science, 1983)对付局部最优的机制只有一句话:以一定概率接受变差的移动,且这个概率随”温度”降低而收紧。高温期什么烂移动都可能接受(大范围乱跳),低温期几乎只接受改进(精细爬坡)。温度调度是灵魂:降得太快,被冻在局部最优;降得太慢,浪费预算乱撞。
人的对应关系几乎是逐项的:
- “变差的移动” = 转向的过渡成本:换方向后头两年,你从资深变回新手,产出、薪资、自信全回撤。贪心视角这是负收益,退火视角这是跳出局部最优的必要成本;
- “温度” = 你能承受多大的回撤:存款、家庭负担、行业周期共同决定。职业早期温度天然高(没什么可失去的,理应大步跳);后期温度低,但不应降到零——温度为零的退火就是贪心,会被钉在旧山头上;
- “降温调度” = 把大跳拆成受控的小跳:不是裸辞三年赌一个方向,而是用业余项目、内部转岗、开源贡献做低成本试探——每次试探都是一次温度可控的移动。
这个类比有一处必须点破的失效:模拟退火可以重启无数次,人不能。所以人的退火要加一条算法里没有的纪律——跳之前先把”变差的下界”锁住(现金流够撑多久、退路是什么),锁不住下界的跳跃不是探索,是赌博。
四、升级件三:重定义”最优”——你要的不是全局第一,是你那格的精英
前两个升级件都默认目标不变:找到全图最高点。第三个升级件质疑目标本身。
传统搜索返回一个解:全局最优。MAP-Elites(Mouret & Clune, 2015)改了问题的定义:由用户挑几个特征维度把搜索空间划成网格,算法不找全图第一,而是给每个格子保留一个该格内的最强解——论文的说法是”照亮”(illuminate)整个搜索空间,展示不同特征组合各自能达到的性能上限。这个思路后来长成了”质量-多样性”(Quality-Diversity)这一整个算法家族。
为什么这是 AI 时代”佼佼者”的正确定义?两个论据:
- 全局 argmax 是几百万人的独木桥。“最强全栈工程师""最懂 AI 的开发者”这种全局目标上挤满了搜索者,而你的探索预算(第一节算过)只有一条轨迹。在被反复搜索过的地形上,你找到全局最优的先验概率约等于零。
- AI 恰好在抬高每一格的地板、拉大格内的方差。90% 的开发者都有 AI(上文 DORA 数据),意味着”每格的平均水平”变得便宜——AI 让所有人都能在任何格子达到及格线,平庸的全能贬值了。DORA”放大器”结论的另一面是:格内强者被放大得更强。地板抬高 + 天花板拉高 = 格内精英的溢价变大,格间的平庸组合贬值。
所以”佼佼者”的操作性定义是:挑一个格子,做那格的精英。格子由特征维度的组合定义,对开发者而言至少三个轴:
- 领域上下文:金融风控、医疗合规、工业协议……AI 没有你的领域隐性知识;
- 技术纵深:推理系统、eval 工程、agent 编排、数据管线……(十个工种的能力矩阵见《大模型行业工种全景图》,这里不重复展开);
- 工作方式:你和 AI 的分工形态——是把 AI 用成放大器的人,还是被 AI 追平的人。
还有一条 MAP-Elites 送的宽慰,和地图会动这个坏消息正好对冲:漂移不只毁灭旧格子,也在批量生成新格子。eval 工程、agent 编排、上下文工程——这些格子五年前不存在,现在每个格子里的”精英”都只有两三年积累。新格子里,先到者和你的差距最小。
五、升级件四:防奖励作弊——你优化的可能是代理指标
前三个升级件都假设你收到的奖励信号是真的。最后一个升级件处理信号本身造假的情况。
强化学习里这叫 reward hacking:优化器找到抬高奖励数值、却偏离设计者真实意图的路径——扫地机器人学会把垃圾藏起来而不是扫掉(Concrete Problems in AI Safety, Amodei et al., 2016,把它列为五大安全问题之一)。它的社会学版本是 Goodhart 的观察:指标一旦成为目标,就不再是好指标。
开发者的自我革新里,代理指标无处不在,而且 AI 把作弊成本降到了历史最低:
- 产出量:AI 让”看起来很多产出”几乎免费——博客篇数、代码行数、项目数量全部可以刷;
- 流畅感:METR 实验里最扎眼的不是慢 19%,是感知与现实的反向——开发者事前预测 AI 让自己快 24%,事后仍然估计快了 20%,实测慢 19%。“感觉更强了”这个信号,在 AI 辅助下与真实变化可以整整反一个方向;
- 社交信号:点赞、星标、转发度量的是传播性,不是你那格的精英度。
这三个坑里第二个最危险,因为它作弊的对象是你自己。我在《38 天 206 篇博客》里踩过完整的一遍:AI 代笔的流畅产出让”能写清 X”不再是”懂 X”的证据。防御手段那篇也给过,放进本文的框架里就一句话:把奖励函数外置给作弊不了的裁判——能跑通的代码、真实用户的采用、亲手测出的数字。它们相当于围棋里”终局胜负机械可判”:搜索算法一切的理论保证,都建立在奖励信号不说谎之上。
六、装回一台机器:每周操作循环
四个升级件装回一个可以每周跑一轮的循环:
flowchart LR
A["① 选格<br/>确认或调整自己在<br/>质量-多样性地图上的格子"] --> B["② 投预算<br/>本周注意力分配<br/>主线爬坡为主、小额探索不清零"]
B --> C["③ 让世界打分<br/>产出可被外部验证的东西<br/>代码跑通、用户采用、亲手测数"]
C --> D["④ 打折更新<br/>新信号计入折扣战绩<br/>旧战绩权重按年龄衰减"]
D --> E["⑤ 控温决策<br/>是否接受一次暂时更差的跳格<br/>跳前先锁住回撤下界"]
E --> A
对应的自检表,每列一个升级件:
| 升级件 | 修复的断裂假设 | 每周问自己 |
|---|---|---|
| 折扣战绩(D-UCB/SW-UCB) | 奖励分布平稳 | 我最看重的技能,市场最近一次为它付钱是什么时候? |
| 受控降温(模拟退火) | 贪心可达最优 | 我上一次接受”暂时变差的移动”是多久前?温度是不是降到零了? |
| 生态位精英(MAP-Elites) | 目标 = 全局最优 | 我在争一个几百万人的全局榜,还是在一个明确的格子里爬坡? |
| 防奖励作弊 | 奖励信号真实 | 本周的”进步感”里,有多少来自作弊不了的外部裁判? |
这个类比在哪里失效
三处,不讲清楚就是自欺。
一、算法的保证是期望意义的,你的人生 n = 1。D-UCB 的后悔值上界是对大量轮次的期望,单条轨迹的方差可以大到淹没一切策略差异——同样的策略,有人赶上格子爆发,有人赶上格子塌缩。借它的结构,不借它的保证;能做的是用可逆小实验代替不可逆大赌注,把 n = 1 的人生尽量拆成 n = 20 的小样本。
二、你不是唯一的搜索者,格子会被挤爆。MAP-Elites 里每格只有算法自己在填;现实里一个格子被证明值钱后会涌入大量竞争者,格子本身的回报被稀释。所以”选格”不是一次性决策,它自己也要进折扣循环——这正是循环图里 ⑤ 连回 ① 的原因。
三、温度不能真正自由调。模拟退火的温度是超参数,随便设;人的温度被现金流、家庭、签证、行业周期硬约束。假装自己温度很高的人不是在退火,是在赌博。算法能借的只有纪律:跳之前,先算清变差的下界。
诚实的提醒
- 本文的实验数字(METR 的 19%/24%/20%、DORA 的 90% 与每天两小时)来自核实过的公开报告与论文,我没有亲手复现;D-UCB/SW-UCB 的后悔值结论来自论文陈述,我没有逐行验证证明。
- 折扣平均的手算示例已用一次性脚本验算(γ=0.7,普通平均 0.667 vs 折扣平均 0.422)。
- “格内精英溢价变大”是我基于 DORA 放大器结论的推断,不是报告原文的直接陈述,读者应当作观点而非事实对待。
- 成本最低的亲手验证实验:拿你自己过去 24 个月的时间投入,按方向分臂、按季度记回报(有外部付费/采用记 1,无记 0),分别算普通平均和 γ=0.8 的折扣平均,看排序有没有变化。一张表、十分钟,你会立刻知道自己有没有在用四年前的胜利给今天投票。
参考来源
论文:
- On Upper-Confidence Bound Policies for Non-Stationary Bandit Problems — Garivier & Moulines,D-UCB 与 SW-UCB 的出处与后悔值分析
- Agent57: Outperforming the Atari Human Benchmark — 滑动窗 UCB 在生产级 RL 系统中做策略选择的实例
- Optimization by Simulated Annealing — Kirkpatrick, Gelatt & Vecchi, Science, 1983
- Illuminating search spaces by mapping elites — Mouret & Clune, 2015,MAP-Elites 与质量-多样性
- Concrete Problems in AI Safety — Amodei et al., 2016,reward hacking 的正式提出
- Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity — METR 随机对照实验
工程实践 / 行业报告:
- DORA 2025: State of AI-assisted Software Development — 近 5,000 名从业者调查,“AI 是放大器”
- Google 官方摘要:How are developers using AI? — 90% 采用率、中位每天两小时
- METR: We are Changing our Developer Productivity Experiment Design — 将 2025 年结果标注为历史快照的后续说明
站内相关:
- 零基础读懂蒙特卡洛树搜索(MCTS) — UCB 公式与四步循环的完整推导
- 一套人类版 MCTS 学习法 — 静态环境下的学习预算分配,本文的前篇
- 执行塌价,判断涨价 — METR 等四组实验与互补品经济学的完整分析
- 38 天发了 206 篇 AI 博客,一个问题把我问倒了 — 流畅错觉与评分外置的第一手教训
- 大模型行业工种全景图 — 格子的具体清单:十个工种的能力矩阵与最小验证项目