最优解长在一张会动的地图上:把开发者的自我革新当成非平稳搜索问题

MCTS 系列续作。上一篇把"学会一个领域"建模成搜索预算分配,这一篇处理更难的题:"成为 AI 时代的佼佼者"是在一张会动的地图上搜索——奖励分布在漂移(METR 的实验结论七个月后被作者自己标为历史快照)、你只有一条不可重置的轨迹、能观测到的全是代理指标。四个搜索领域的现成升级件——折扣战绩(D-UCB/SW-UCB)、受控降温(模拟退火)、生态位精英(MAP-Elites)、防奖励作弊——各修复一个失效假设,最后装回一个每周可跑的操作循环。

每个开发者其实都在跑一个搜索算法,只是大多数人跑的是裸贪心:哪个方向眼下最顺就一直走,直到某天发现脚下的山头塌了。2025 年 7 月,METR 用随机对照实验测出”AI 工具让资深开发者完成任务慢了 19%“;仅仅七个月后,METR 自己把这个结论标注为历史快照——不再反映当前工具和工作流(METR, 2026-02)。一个花了大力气测出来的地形数据,半年出头就过期。这就是你正在搜索的地图:它在动上一篇把”学会一个领域”建模成 MCTS 的预算分配,那套零件默认地图不动;这一篇处理更难的题——当搜索空间本身在漂移时,开发者怎么给”自我革新”找到最优解。答案依然不用发明:搜索领域早就为”会动的地图”造好了升级件,一共四个,逐个装。

一句话主线

“成为 AI 时代的佼佼者”是一个非平稳搜索问题:奖励分布在漂移、只有一条不可重置的轨迹、能观测的全是代理指标、几百万人在同一张图上搜索。静态搜索的四个默认假设各断了一条,搜索领域各有一个现成的修复件:给战绩打折(D-UCB)、受控降温(模拟退火)、生态位精英(MAP-Elites)、防奖励作弊(reward hacking 防御)。“佼佼者”的正确定义随之改变:不是全局最优,是质量-多样性地图上你那一格的精英。

本文不重复推导 MCTS 和 UCB,那是零基础篇干的活;也不重复”预算分配四零件”,那是学习法篇的内容。这篇只讲静态框架之外的四个新零件。

名词速查

术语一句话解释
非平稳(non-stationary)各选项的奖励分布随时间变化——今天的好选择,明天可能不再好
多臂老虎机在多个收益未知的选项之间反复分配预算的标准模型(零基础篇第三节)
UCB”平均战绩 + 探索加成”的选择公式,探索加成偏袒被冷落的选项(同上,有手算)
D-UCB / SW-UCB非平稳版 UCB:旧战绩按折扣因子衰减 / 只统计最近一段窗口
局部最优邻域之内最好、全局并不是的解;贪心算法会停在这里不动
模拟退火以一个随时间降低的概率接受”变差的一步”,换取跳出局部最优的能力
质量-多样性 / MAP-Elites不找单一最优解,按特征维度把空间分格、每格只保留最强解的搜索算法家族
代理奖励真实目标难以测量时,拿来替代优化的可测指标
奖励作弊(reward hacking)优化器找到抬高代理指标、却偏离真实目标的路径

一、先把题目建模清楚:三个断掉的假设

按搜索问题的标准格式写下来:状态是你此刻的技能组合、作品集和行业位置;动作是把下一段注意力投给哪个方向——深耕现有栈、转向 agent 工程、做开源、换领域;奖励是市场的回报信号——offer、加薪、影响力、复利资产。

这个建模和上一篇的”学习即搜索”看起来只差一层,实际上断了三个假设:

静态搜索的默认假设学习问题(上一篇)自我革新问题(这一篇)
奖励分布平稳基本成立:微积分的价值十年不变断了:AI 正在重新给所有技能定价
可以多次 rollout、可以 reset勉强成立:一个概念学错了可以重学断了:职业只有一条轨迹,三年投错回不了档
奖励即时、真实成立:自测当场出分断了:回报延迟数年,且你能看到的全是代理指标

第一个假设断得最彻底,值得给证据。DORA 2025 年对近 5,000 名技术从业者的调查显示:90% 的受访者已在工作中使用 AI,中位使用时长约每天两小时(DORA 2025 报告Google 官方摘要);报告的核心结论是 AI 是放大器——放大高效组织的优势,也放大挣扎团队的功能失调,吞吐量上升的同时交付不稳定性也在上升。也就是说:地图不只在动,而且不是对所有人朝同一个方向动。

漂移的速度呢?开头那个 METR 实验就是测速仪:16 名资深开源开发者、246 个真实任务的随机对照实验,测出”允许用 AI 反而慢 19%“(arXiv:2507.09089)——而作者在 2026 年 2 月宣布此结果为历史快照,因为 agentic 工具在 2025 年下半年普及,实验环境本身变了。一条关于”AI 有没有用”的高质量测量,保质期约半年。你三年前对”什么技能值钱”的判断,保质期只会更短。(这个实验与”执行塌价”的完整分析见《执行塌价,判断涨价》,此处不重复。)

三个断掉的假设,就是四个升级件的安装位。

二、升级件一:给战绩打折——非平稳老虎机

标准 UCB 有一个隐含前提:一次胜利永远是一次胜利,五年前的成功和昨天的成功在”平均战绩”里权重相同。地图不动时这是美德(样本越多越准),地图会动时这是毒药——旧数据在替一个已经不存在的世界投票

Garivier & Moulines 给出了两个修复,思想都是一句话:

  • D-UCB(折扣 UCB):算平均战绩时,每条旧记录按年龄乘一个折扣因子 γ<1\gamma < 1
  • SW-UCB(滑动窗 UCB):更狠,只统计最近一个窗口内的记录,更早的直接归零。

折扣平均的简化形式(对照论文记号有简化,只保留骨架):

xˉj(γ)=sγage(s)rssγage(s)\bar{x}_j^{(\gamma)} = \frac{\sum_s \gamma^{\,\text{age}(s)} \cdot r_s}{\sum_s \gamma^{\,\text{age}(s)}}

分子分母都按记录年龄打折:越老的回报,话语权越小。两个算法都被证明在”分布会突变”的环境里,后悔值匹配理论下界(至对数因子)。这不是纸面玩具——DeepMind 的 Agent57 在 Atari 上就是用滑动窗 UCB 在一组探索策略之间做在线选择的,引的正是这篇论文。

手算一遍感受差别(数字已用脚本验算)。给”技能 A”记六年的年度回报——市场为它付过钱记 1,没有记 0——从旧到新是 [1, 1, 1, 1, 0, 0]:前四年它一直换来回报,最近两年没有。

  • 普通平均4/60.674/6 \approx 0.67,看起来这条分支还有三分之二的胜率;
  • 折扣平均γ=0.7\gamma = 0.7,一年折一次):四个 1 的权重分别衰减到 0.49,0.343,0.240,0.1680.49, 0.343, 0.240, 0.168,分子 =1.241= 1.241,分母(六年权重之和)=2.941= 2.941,得 0.42\approx \mathbf{0.42}

同一份数据,普通平均说”还行”,折扣平均说”正在失效”。D-UCB 并不比你多知道任何事实,它只是拒绝让四年前的胜利替今天投票

翻译成操作,两条:

  1. 技能盘点表加一列”最近一次被付钱是什么时候”。不是”我会不会”,是”市场上一次为它付钱是何时”——按这一列打折排序,你对自己组合的估值会立刻变化。
  2. 探索预算永不清零,且比静态环境下更大。非平稳老虎机理论里有个反直觉结论:环境会漂移时,“已经确认的最优臂”也必须持续被质疑,因为它随时可能不再最优。上一篇说”三成时间碰新东西”是静态环境的参考值;地图动得越快,这个比例的下限越高。

三、升级件二:受控降温——接受暂时更差的一步

打折解决”往哪看”,还没解决”敢不敢动”。贪心策略在静态地形上至少能爬到局部山顶;在会动的地形上,它会把你钉死在一个正在下沉的旧山头——每一步横向移动眼下都是亏的(薪资、头衔、熟练度全要回撤),于是永远不动。

模拟退火(Kirkpatrick, Gelatt & Vecchi, Science, 1983)对付局部最优的机制只有一句话:以一定概率接受变差的移动,且这个概率随”温度”降低而收紧。高温期什么烂移动都可能接受(大范围乱跳),低温期几乎只接受改进(精细爬坡)。温度调度是灵魂:降得太快,被冻在局部最优;降得太慢,浪费预算乱撞。

人的对应关系几乎是逐项的:

  • “变差的移动” = 转向的过渡成本:换方向后头两年,你从资深变回新手,产出、薪资、自信全回撤。贪心视角这是负收益,退火视角这是跳出局部最优的必要成本
  • “温度” = 你能承受多大的回撤:存款、家庭负担、行业周期共同决定。职业早期温度天然高(没什么可失去的,理应大步跳);后期温度低,但不应降到零——温度为零的退火就是贪心,会被钉在旧山头上;
  • “降温调度” = 把大跳拆成受控的小跳:不是裸辞三年赌一个方向,而是用业余项目、内部转岗、开源贡献做低成本试探——每次试探都是一次温度可控的移动。

这个类比有一处必须点破的失效:模拟退火可以重启无数次,人不能。所以人的退火要加一条算法里没有的纪律——跳之前先把”变差的下界”锁住(现金流够撑多久、退路是什么),锁不住下界的跳跃不是探索,是赌博。

四、升级件三:重定义”最优”——你要的不是全局第一,是你那格的精英

前两个升级件都默认目标不变:找到全图最高点。第三个升级件质疑目标本身。

传统搜索返回一个解:全局最优。MAP-Elites(Mouret & Clune, 2015)改了问题的定义:由用户挑几个特征维度把搜索空间划成网格,算法不找全图第一,而是给每个格子保留一个该格内的最强解——论文的说法是”照亮”(illuminate)整个搜索空间,展示不同特征组合各自能达到的性能上限。这个思路后来长成了”质量-多样性”(Quality-Diversity)这一整个算法家族。

为什么这是 AI 时代”佼佼者”的正确定义?两个论据:

  1. 全局 argmax 是几百万人的独木桥。“最强全栈工程师""最懂 AI 的开发者”这种全局目标上挤满了搜索者,而你的探索预算(第一节算过)只有一条轨迹。在被反复搜索过的地形上,你找到全局最优的先验概率约等于零。
  2. AI 恰好在抬高每一格的地板、拉大格内的方差。90% 的开发者都有 AI(上文 DORA 数据),意味着”每格的平均水平”变得便宜——AI 让所有人都能在任何格子达到及格线,平庸的全能贬值了。DORA”放大器”结论的另一面是:格内强者被放大得更强。地板抬高 + 天花板拉高 = 格内精英的溢价变大,格间的平庸组合贬值

所以”佼佼者”的操作性定义是:挑一个格子,做那格的精英。格子由特征维度的组合定义,对开发者而言至少三个轴:

  • 领域上下文:金融风控、医疗合规、工业协议……AI 没有你的领域隐性知识;
  • 技术纵深:推理系统、eval 工程、agent 编排、数据管线……(十个工种的能力矩阵见《大模型行业工种全景图》,这里不重复展开);
  • 工作方式:你和 AI 的分工形态——是把 AI 用成放大器的人,还是被 AI 追平的人。

还有一条 MAP-Elites 送的宽慰,和地图会动这个坏消息正好对冲:漂移不只毁灭旧格子,也在批量生成新格子。eval 工程、agent 编排、上下文工程——这些格子五年前不存在,现在每个格子里的”精英”都只有两三年积累。新格子里,先到者和你的差距最小。

五、升级件四:防奖励作弊——你优化的可能是代理指标

前三个升级件都假设你收到的奖励信号是真的。最后一个升级件处理信号本身造假的情况。

强化学习里这叫 reward hacking:优化器找到抬高奖励数值、却偏离设计者真实意图的路径——扫地机器人学会把垃圾藏起来而不是扫掉(Concrete Problems in AI Safety, Amodei et al., 2016,把它列为五大安全问题之一)。它的社会学版本是 Goodhart 的观察:指标一旦成为目标,就不再是好指标。

开发者的自我革新里,代理指标无处不在,而且 AI 把作弊成本降到了历史最低:

  • 产出量:AI 让”看起来很多产出”几乎免费——博客篇数、代码行数、项目数量全部可以刷;
  • 流畅感:METR 实验里最扎眼的不是慢 19%,是感知与现实的反向——开发者事前预测 AI 让自己快 24%,事后仍然估计快了 20%,实测慢 19%。“感觉更强了”这个信号,在 AI 辅助下与真实变化可以整整反一个方向;
  • 社交信号:点赞、星标、转发度量的是传播性,不是你那格的精英度。

这三个坑里第二个最危险,因为它作弊的对象是你自己。我在《38 天 206 篇博客》里踩过完整的一遍:AI 代笔的流畅产出让”能写清 X”不再是”懂 X”的证据。防御手段那篇也给过,放进本文的框架里就一句话:把奖励函数外置给作弊不了的裁判——能跑通的代码、真实用户的采用、亲手测出的数字。它们相当于围棋里”终局胜负机械可判”:搜索算法一切的理论保证,都建立在奖励信号不说谎之上。

六、装回一台机器:每周操作循环

四个升级件装回一个可以每周跑一轮的循环:

flowchart LR
    A["① 选格<br/>确认或调整自己在<br/>质量-多样性地图上的格子"] --> B["② 投预算<br/>本周注意力分配<br/>主线爬坡为主、小额探索不清零"]
    B --> C["③ 让世界打分<br/>产出可被外部验证的东西<br/>代码跑通、用户采用、亲手测数"]
    C --> D["④ 打折更新<br/>新信号计入折扣战绩<br/>旧战绩权重按年龄衰减"]
    D --> E["⑤ 控温决策<br/>是否接受一次暂时更差的跳格<br/>跳前先锁住回撤下界"]
    E --> A

对应的自检表,每列一个升级件:

升级件修复的断裂假设每周问自己
折扣战绩(D-UCB/SW-UCB)奖励分布平稳我最看重的技能,市场最近一次为它付钱是什么时候?
受控降温(模拟退火)贪心可达最优我上一次接受”暂时变差的移动”是多久前?温度是不是降到零了?
生态位精英(MAP-Elites)目标 = 全局最优我在争一个几百万人的全局榜,还是在一个明确的格子里爬坡?
防奖励作弊奖励信号真实本周的”进步感”里,有多少来自作弊不了的外部裁判?

这个类比在哪里失效

三处,不讲清楚就是自欺。

一、算法的保证是期望意义的,你的人生 n = 1。D-UCB 的后悔值上界是对大量轮次的期望,单条轨迹的方差可以大到淹没一切策略差异——同样的策略,有人赶上格子爆发,有人赶上格子塌缩。借它的结构,不借它的保证;能做的是用可逆小实验代替不可逆大赌注,把 n = 1 的人生尽量拆成 n = 20 的小样本。

二、你不是唯一的搜索者,格子会被挤爆。MAP-Elites 里每格只有算法自己在填;现实里一个格子被证明值钱后会涌入大量竞争者,格子本身的回报被稀释。所以”选格”不是一次性决策,它自己也要进折扣循环——这正是循环图里 ⑤ 连回 ① 的原因。

三、温度不能真正自由调。模拟退火的温度是超参数,随便设;人的温度被现金流、家庭、签证、行业周期硬约束。假装自己温度很高的人不是在退火,是在赌博。算法能借的只有纪律:跳之前,先算清变差的下界。

诚实的提醒

  • 本文的实验数字(METR 的 19%/24%/20%、DORA 的 90% 与每天两小时)来自核实过的公开报告与论文,我没有亲手复现;D-UCB/SW-UCB 的后悔值结论来自论文陈述,我没有逐行验证证明。
  • 折扣平均的手算示例已用一次性脚本验算(γ=0.7,普通平均 0.667 vs 折扣平均 0.422)。
  • “格内精英溢价变大”是我基于 DORA 放大器结论的推断,不是报告原文的直接陈述,读者应当作观点而非事实对待。
  • 成本最低的亲手验证实验:拿你自己过去 24 个月的时间投入,按方向分臂、按季度记回报(有外部付费/采用记 1,无记 0),分别算普通平均和 γ=0.8 的折扣平均,看排序有没有变化。一张表、十分钟,你会立刻知道自己有没有在用四年前的胜利给今天投票。

参考来源

论文:

工程实践 / 行业报告:

站内相关: