最近刷到一条很多工程师都在转的帖子,标题只有一句话:“用 AI 写代码越来越顺了,但’做什么’这个问题反而越来越难。“评论区没有人反驳,只有一排”我也是”。这篇文章想认真回答它——不是用鸡汤,而是用四组可以核实的实验和一条经济学早就写清楚的定律。
先把结论放在最前面:
“做什么”变难不是你的问题,而是一次结构性的价格变动。AI 把”怎么做”的价格打了下来,而经济学的基本定律是:一样东西降价,它的互补品就涨价。执行的互补品是判断——决定做什么、验证做得对不对。你感受到的”难”,就是判断力涨价时的价格信号。定位自己的方法不是想出一个更好的答案,而是把自己从”实现者”的位置,迁移到”拥有问题、拥有验证回路”的位置上去。
下面分五步展开:先用数据确认这个感受是真的;再拆它背后的三个机制;然后回答”你的价值搬去了哪里”;接着给出找方向的五个可操作动作;最后收束成三个可以今晚就问自己的问题。
一、先确认:塌价是真的,但塌得极不均匀
焦虑最怕的是含混。所以先把”AI 让写代码变顺”这件事钉死在数据上——它是真的,但比多数人以为的更有形状。
第一组证据:标准化任务上,执行确实塌价了。 GitHub 与微软研究院 2023 年的受控实验(Peng et al., arXiv:2302.06590)招募了 70 名开发者,任务是用 JavaScript 实现一个 HTTP server。用 Copilot 的实验组比对照组快 55.8%,而且经验越浅的开发者提升越大。注意这个任务的特征:目标清晰、从零开始、无历史包袱——一个被完美定义的”怎么做”问题。
第二组证据:真实的复杂系统里,塌价没有发生,甚至倒挂。 METR 2025 年的随机对照实验找了 16 位资深开源开发者,在他们平均维护了 5 年的成熟仓库(平均 2.3 万 star)里完成 246 个真实任务,随机分配允许或禁止使用 AI 工具(主要是 Cursor + Claude 3.5/3.7 Sonnet)。结果:允许 AI 的组反而慢了 19%。更扎心的是感知落差——开始前开发者预测 AI 能让自己快 24%,做完之后仍然相信自己快了 20%。实际上他们变慢了。
第三组证据:能力边界是锯齿状的,而且从外面看不见。 哈佛商学院与 BCG 的现场实验(Dell’Acqua et al.,HBS 工作论文 24-013,后发表于 Organization Science)让 758 名咨询顾问做 18 个真实任务。在 AI 能力边界之内的任务上,用 AI 的组产出质量高约 40%;在边界之外的任务上,用 AI 的组比不用的差 19 个百分点——AI 不是没帮上忙,是把人带沟里了,而且失败是无声的:产出看起来很像对的。论文给这个现象起的名字后来广为流传:锯齿状技术边界(jagged technological frontier)。
三组实验拼在一起,塌价的形状就出来了:
| 场景 | 任务特征 | AI 的效果 |
|---|---|---|
| Copilot RCT | 清晰定义、从零开始、无上下文 | +55.8% 速度 |
| BCG 边界内 | 有模板可循的知识工作 | +40% 质量 |
| BCG 边界外 | 看似相近、实则超出能力 | −19 个百分点,无声失败 |
| METR | 复杂真实系统、深度隐性上下文 | −19% 速度,且感知相反 |
真正塌价的不是”写代码”,而是”上下文无关的、被清晰定义的执行”。 任务越标准化,价格掉得越狠;而依赖隐性上下文的工作、以及”判断此刻是否在边界之内”这件事本身,一分钱都没降。这个形状,就是后面所有定位问题的地图。
二、为什么”做什么”反而更难了:三个机制
感受确认了,形状看清了,现在拆机制。“做什么变难”不是一种情绪,它有三个彼此独立、可以分别验证的成因。
机制一:互补品涨价——这是价格信号,不是心理问题
Agrawal、Gans 和 Goldfarb 在《Prediction Machines》(2018)里给 AI 经济学定了一个基调:别把 AI 当魔法,把它当降价。机器学习的本质是让”预测”这种商品大幅降价,而降价的经济后果永远是两条:替代品贬值,互补品升值。预测的互补品是什么?是判断——书里给它的定义很精确:判断是对不同结果赋予回报的能力,是关于我们到底要什么的陈述。预测机器可以告诉你每条路通向哪里,但”想去哪”没法外包。
把这个框架平移到今天的编程:塌价的商品从”预测”换成了”执行”,结论原样成立。执行的替代品(照着清晰规格写代码的能力)在贬值,执行的互补品在升值——问题选择(做什么才值得)和结果验证(做出来的对不对)。你觉得”做什么”越来越难,恰恰说明你对市场价格变动的感知是灵敏的。难,是稀缺的表现形式。
机制二:过滤器失效——以前替你做决定的,是实现成本
回想 AI 之前你是怎么决定”做什么”的。诚实的答案是:大部分时候不是你在决定,是成本在决定。一个想法冒出来,脑子里自动跑一遍估算——要改三个服务、要两周、要碰那个没人敢动的模块——绝大多数选项在这一步就被剪掉了,你只需要在幸存的三五个选项里挑。实现成本是一台一直在后台运行的剪枝器,它剪得太久了,久到你以为那是你自己的”方向感”。
现在剪枝器坏了。什么都”也就一个下午的事”,于是决策树在你面前完整展开。选项从五个变成五十个,难度不是线性增加的——心理学里这叫选择过载,工程里这叫搜索空间爆炸。你没有变笨,是你第一次直面未经剪枝的问题空间。
这个机制还有一层更隐蔽的推论:以前”我做不了”是一个体面的、自动的挡箭牌,它同时也替你挡掉了”我该不该做”的责任。执行塌价之后,每一个没做的选项都变成了你的选择。方向的重量第一次完整地压到了判断上。
机制三:反馈断流——动手曾经是思考的一部分
第三个机制最反直觉:写代码慢,曾经是想清楚的方式。
实现一个想法的过程充满摩擦——写到一半发现数据模型撑不住这个需求、接口设计逼你想清楚边界情况、debug 时发现”用户根本不会这么用”。这些摩擦不是浪费,它们是想法和现实之间的碰撞测试。执行慢的年代,一个想法走到成品,中途已经被现实修正过几十次。现在执行快了,想法可以不经碰撞直接变成成品——验证没有消失,只是被推迟到了更晚、更贵的阶段。
这一点有一组设计得近乎完美的实验来背书。斯坦福的 Si、Yang 和 Hashimoto 先在 2024 年发现(arXiv:2409.04109,100+ NLP 研究者盲评):LLM 生成的研究想法在”读起来”这个阶段被评为比人类专家的想法更新颖。然后他们做了残忍的后半场(The Ideation-Execution Gap, arXiv:2506.20803,ICLR 2026):招募 43 位研究者,每人花 100+ 小时把随机分配的想法(人类的或 LLM 的)真正执行出来,再盲评。结果:LLM 想法的得分在执行后全面大幅下跌,把构想阶段的领先全部跌完。
这两篇论文合起来说的是一件事:想法的真实价值,只有执行反馈才能揭示;而执行变便宜,并没有让”分辨好想法”变便宜。“听起来很好”和”做出来真好”之间的落差,正是判断力的栖身之地。
三、定位:你的价值在栈里上移了一层
三个机制指向同一个结论——瓶颈没有消失,它上移了。把一个工程师的工作粗暴地分成三层:
flowchart TB
L3["第三层:问题选择 × 验证<br/>决定什么值得做,判断做出来的对不对<br/>【涨价区】"]
L2["第二层:方案设计<br/>把模糊的需求变成清晰的规格<br/>【缓冲区】"]
L1["第一层:执行<br/>把清晰的规格变成能跑的代码<br/>【塌价区】"]
L3 --> L2 --> L1
AI["AI 从底层向上蚕食:<br/>先吃掉标准化执行,再吃掉模板化方案"] -.-> L1
AI -.-> L2
“代码越写越顺”翻译过来就是:你在第一层的稀缺性正在流失,不管你多资深。这是坏消息。但三个好消息藏在数据的细节里,它们共同构成你的定位地图。
好消息一:第一层没有整体消失,消失的只是它的标准化部分。 METR 的结果说明,在复杂真实系统里,资深执行不但没塌价,还是 AI 目前学不会的。塌价的是”上下文无关的执行”——恰好是外包、模板、CRUD 早就侵蚀过一遍的那部分。如果你的执行价值来自对某个具体系统、具体领域、具体客户的深度纠缠,这部分没有被降价。
好消息二:边界感知本身成了新技能。 锯齿边界实验里表现最好的顾问,不是把任务全部丢给 AI 的人,而是清楚知道哪些子任务在边界内、哪些必须自己来的人。“知道什么时候不能信 AI”是一项只能从真实使用和真实翻车里长出来的能力——而你过去半年”越写越顺”的经历,正在悄悄积累它。它值钱,因为它没法从帖子里学到。
好消息三:验证是新瓶颈,而验证是可以拥有的。 构想—执行落差实验的另一面是:那 43 位研究者之所以能给想法定生死,是因为他们有能力执行并评审。谁离验证近,谁就掌握价值分配权。我在《Eval 是新的 PRD》里写过同一个逻辑的产品版:当实现变成机器的事,“定义什么叫做对了”就变成了人最值钱的输出。
把三条合起来,得到一个可以随身携带的定位公式:
你的不可替代性 ≈ 你拥有的问题 × 你拥有的验证回路 × 你没被降价的隐性上下文。
三个因子是相乘不是相加——任何一项为零,整体就为零。只有上下文没有问题,你是活字典;只有问题没有验证回路,你是点子王;只有验证回路没有上下文,你是外包评委。
四、行动:从供给侧转向需求侧的五个动作
定位清楚了,“做什么”就从玄学变成了工程。五个动作,按依赖顺序排列。
1. 停止从工具出发,开始从问题清单出发
“我 AI 用得这么顺,该做点什么呢?“——这个问法本身就是困境的一部分。它是供给侧思维:从自己拥有的能力出发找出口。问题在于,AI 带来的执行能力是无差别的,人人都有,从无差别的能力推不出差异化的方向,所以这条路越想越空。
反过来,需求侧思维从你独家接触到的问题出发。Paul Graham 在 How to Get Startup Ideas 里的判断今天更成立:最好的想法是”创始人自己想要、自己能做、而很少有人意识到值得做”的东西——第一条保证问题真实存在,他自己就为此赔过六个月(做了一个画廊网站,而画廊根本不想上网)。具体动作:开一个问题清单,只记录你亲身撞上的、让你烦躁超过两次的问题,以及你在工作里旁观到的、别人反复用笨办法解决的问题。两周之后再看这个清单,方向感的原材料就在里面。
2. 只挑你拥有反馈回路的问题
既然验证是新瓶颈,选题的第一过滤器就不是”我能不能做出来”(几乎都能),而是”做出来之后,我能不能廉价地知道它对不对”。三种拥有回路的形态,成本从低到高:你自己就是重度用户(自用即验证);你能直接触达一小群真实用户(比如你的同事、你的客户);这个领域有客观的对错标准(跑分、成交、报错率)。反过来,那些”做出来了但没人能告诉你好不好”的项目——没有用户的框架、没有场景的 demo——正是执行塌价时代最容易量产的垃圾,因为它们只消耗便宜的执行,不消耗昂贵的判断,做完只有幻觉性的进度感。
3. 优先选”错了会疼”的领域
锯齿边界的启示是:边界感知只能从真实后果里学。在没有 stakes 的玩具项目里,AI 的无声失败不会暴露,你的判断力得不到训练数据。所以同样是练手,修一个真实用户会骂你的 bug,好过做十个没人用的 side project;在生产系统里让 AI 干活并为结果负责,好过在沙盒里刷”我用 AI 做了个 X”。疼痛是判断力唯一的监督信号。
4. 用便宜的执行去买昂贵的信息
执行塌价最正确的用法,不是生产更多成品,而是把执行当探针:以前验证一个方向要两周,现在一个下午——那就把原来”想清楚再做”的流程,改成”做出来帮自己想清楚”,用最小实现去证伪方向,而不是证明自己。关键纪律是:每次探针打完,收割的必须是判断(这个方向为什么不行/行),而不是成品(又一个躺在那的 repo)。构想—执行落差实验说想法的价值只有执行反馈才能揭示——那么执行降价等于验证降价,这是整场变局里你能白拿的最大红利。多数人拿它量产成品,少数人拿它量产判断。
5. 把判断写下来,让它复利
执行的产出(代码)在贬值,判断的产出(为什么做 A 不做 B、哪里翻了车、边界在哪)在升值——但判断如果只留在脑子里,既不能复用也不能被看见。写下来有三重收益:写作强迫你把模糊的直觉压成明确的主张(写不清楚 = 还没想清楚);公开的判断记录是新时代的作品集——成品人人都能量产,判断轨迹伪造不了;而且它复利,今天的结论是明天文章的支点。你现在读的这篇文章,就是这个动作本身。
五、收束:三个今晚就能问自己的问题
如果只带走一件事:“不知道做什么”的解法不是更多思考,而是更快地让真实世界给你打分。方向感不是想出来的,是从反馈里长出来的——而执行塌价恰恰把”获得反馈”的成本打到了历史最低。这是这个困境里最讽刺也最仁慈的部分:让你迷路的那个东西,同时是走出去最快的交通工具。
三个自查问题,对应定位公式的三个因子:
- 我最近一次因为”知道内情”而做对的决定是什么?——答案指向你没被降价的隐性上下文。它可能是某个系统的坑、某个行业的潜规则、某群用户的真实习惯。那里是你的根据地。
- 有哪个问题,是我不需要问任何人就能判断答案好坏的?——答案指向你拥有的验证回路。在那个问题上,你就是那 43 位能给想法定生死的评审之一。
- 过去一个月我用 AI 做出来的东西里,哪一个被真实地使用了?——如果答案是零,说明你在用便宜的执行量产成品,而不是购买判断。下一个项目,先找到会使用它的那个人,再动手。
以前,写代码是成本,所以”做什么”被成本替你决定;现在,写代码是提问的方式,“做什么”变成了你自己的责任——也第一次完整地变成了你自己的机会。
参考文献
- Peng, S., Kalliamvakou, E., Cihon, P., & Demirer, M. (2023). The Impact of AI on Developer Productivity: Evidence from GitHub Copilot. arXiv:2302.06590.
- Becker, J., Rush, N., Barnes, E., & Rein, D. (2025). Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity. arXiv:2507.09089. 另见 METR 博客。
- Dell’Acqua, F., McFowland III, E., Mollick, E., et al. (2023). Navigating the Jagged Technological Frontier. HBS Working Paper 24-013;刊于 Organization Science。
- Si, C., Yang, D., & Hashimoto, T. (2024). Can LLMs Generate Novel Research Ideas? arXiv:2409.04109.
- Si, C., Hashimoto, T., & Yang, D. (2025). The Ideation-Execution Gap: Execution Outcomes of LLM-Generated versus Human Research Ideas. arXiv:2506.20803.
- Agrawal, A., Gans, J., & Goldfarb, A. (2018). Prediction Machines: The Simple Economics of Artificial Intelligence. Harvard Business Review Press.
- Graham, P. (2012). How to Get Startup Ideas.