harness 会被模型吃掉:attention-interface 与 agent 演化的两条曲线

深读 Latent Space 2026-08-22 那篇《The Evolution of the Agent Harness》。Dan McAteer 用一张"模型能力曲线 × harness 需求曲线"的几何图,把 2022 年 ReAct 到 2025 年 Claude Code 的四段演化串起来,并给出一个我认为值得记住的赌注:随着 harness 能力被 RL 吸收进权重、被工程师从提示词里删除,剩下的会是一层「模型给人套上的挽具」——attention-interface。这篇不做摘要,做消化:把文章的核心几何、数字锚点、可疑点、以及和本站已有 harness 谱系的对接,全部拆到能被下一篇引用的粒度。

“The change last winter, last Christmas — it’s a little hard to pin down. I mean, the harness changed and a little post-training changed and then new pre-trained models came… but it felt like a big jump which is not that easy to pin down what did it.” —— Lukasz Kaiser(Transformer 共同作者),转引自 Dan McAteer, The Evolution of the Agent Harness, Latent Space, 2026-08-22。

Kaiser 讲的这次「不容易指认」的跳变,是 2025 年圣诞节前后 agent 突然开始好用的那一刻。文章把这个”讲不清”翻译成一个几何问题:不是单条曲线跳了,是两条曲线交叉了——模型能力曲线,与 harness 对模型的要求曲线。

一句话把整篇文章的赌注收拢:

harness 正在翻转:过去它是”人给模型套上的挽具”,未来它是”模型给人套上的挽具”——因为真正稀缺的东西正从算力变成人的注意力。

这也是我读完之后决定单开一篇的原因。它给了本站 harness 系列一个新的抽象层:《什么才是好的 Harness》当下这一版 harness 的分工(判断归模型,物理归代码),Lilian Weng 那篇讲被优化对象沿着 prompt → context → workflow → harness code → optimizer code 一路向上爬——Dan McAteer 这篇给了这条爬升的终点:所有能爬进权重的都会爬进权重,剩下的会翻转成”跟人打交道”的接口。

名词速查

术语一句话解释
harness模型权重之外让 agent 能干活的所有东西:工具、控制循环、上下文、权限、护栏。定义在这里
ReAct2022 年提出的 Thought → Action → Observation 循环,纯用 prompt 让模型逐步推理与行动
RL-in-the-environment把模型放进 harness/真实环境里,用工具调用、多步任务的成败作为奖励信号做强化学习
co-training / 共同进化模型和 harness 不再各改各的,而是一起被同一个 RL 循环塑形
attention-interface文章造的词:等 harness 的机器侧能力被模型吸收之后,剩下的那层”跟人的注意力打交道”的接口——什么时候打断你、哪些决策要你审批、如何汇报进度
AGENTS.md已在生态里流行的一种约定文件,告诉 agent 怎么读你的代码库;attention-interface 是这个概念的对称姊妹——告诉 agent 怎么读你(这个人)

两条曲线:文章的核心几何

文章不用公式,用两条曲线:

  • 模型能力曲线:模型在真实工具环境里可靠完成 N 步任务的成功率。
  • harness 需求曲线:harness 让模型去干的任务复杂度(loop 长度、autonomy 大小、可用工具数)。

两条曲线之间的 gap,就是这一代 agent 的”卡壳量”。gap 有正负、宽窄、方向,它是理解 agent 演化的第一变量。

timeline
    title Agent Harness 四段演化 · 两条曲线的 gap 变化
    2022.10 ReAct : harness 只是提示词<br>两条曲线双低,gap 小
    2023春 AutoGPT/BabyAGI : harness 抢跑,让模型去当自主员工<br>gap 达到最大,loop 只放大错误
    2023-24 Cursor / Copilot : IDE 主动把 harness 降到人在环中<br>先补上模型的可靠性缺口
    2024末 o1 : 首个推理模型,模型曲线首次反超 harness<br>capability overhang 出现
    2025.02 Claude Code : harness 押注下一代模型<br>autonomy 归还给模型,曲线交叉
    2025- Co-training : harness 能力被 RL 吸收进权重<br>工程师"删除即进化"

(图里所有阶段的名字、时间、判断都来自原文;日期我按原文所给年份精度标注。)

复利算术:为什么 AutoGPT 阶段的 gap 那么难堪

文章开出了一道极简算术来解释 AutoGPT/BabyAGI 时期的失败——loop 不制造能力,loop 只放大能力。每步 95% 靠谱的模型跑 20 步,端到端只剩 0.952035.85%0.95^{20} \approx 35.85\%。我先跑了一次 python3 -c 验算,把这个曲面展开:

每步可靠性 pp5 步10 步20 步
0.8032.77%10.74%1.15%
0.9059.05%34.87%12.16%
0.9577.38%59.87%35.85%
0.9995.10%90.44%81.79%

盯着这张表看十秒能得出的直觉:loop 长度是可靠性的放大镜。AutoGPT 时代的 harness 把模型丢进 20+ 步的自主任务,而 2023 年模型每步顶到天 90% 出头——12% 的端到端成功率不是模型笨,是 harness 押错了曲线阶段。文章把 Cursor/Copilot “先把 harness 拉回人在环里”重新定性为正确的判断,而不是保守:他们不是错过了 autonomy,他们是读对了曲线

Harness 2.0:吸收的三个具体证据

文章把当下这一代(2025 年至今)命名为 co-training era:两条曲线不再各改各的,而是被同一个 RL 循环一起塑形。原文给了三条互相独立的证据链,我把每条按证据档次分栏拆一下。

证据 1:工具调用Toolformer(Meta, arXiv 2302.04761, 2023.02)提出的原理是”工具使用可以被训练出来,而不是被提示出来”。当时这只是一个假设。真正把它工程化的是 OpenAI 2025 年 5 月的 codex-1 发布:文章直接引原文,“codex-1 was trained using reinforcement learning on real-world coding tasks in a variety of environments.”。从 ReAct(Yao et al., arXiv 2210.03629, 2022.10)靠 prompt 拼出的循环,到 codex-1 靠 RL 在环境里训出的循环,正好是「harness 里的技巧被吸进权重」的样本。

证据 2:上下文压缩(compaction)。文章转引 GPT-5.1-Codex-Max 发布材料的一句原话:

“the first model natively trained to operate across multiple context windows through compaction.”

harness 时代 compaction 是一个由外部代码执行的动作:把历史摘要成总结、腾出窗口空间。「原生跨多窗口」的说法(据原文所述)等于把这个动作压进了模型。这条证据只是厂商声明,我未见独立复现——写在这里是因为它是模式匹配的关键节点,不因为它已被验证。

证据 3:整体的 harness 缩水。文章引 Anthropic 的 Thariq Shihipar:团队最近删掉了 Claude Code system prompt 的 ~80%。这个数字是关键锚点——演化的度量正是”你能删掉多少 harness 而不损失能力”(据原文所述,我未独立复现)。

这三条组合出的模式是:train(在 harness 里训模型)→ absorb(能力沉进权重)→ shed(工程师从 harness 里删掉冗余)→ repeat。文章用一个数据做同侪佐证:Harness-Bench 106 个任务,同一个模型换 harness,得分 52.4 → 76.223.8 分的差(据原文所述,我未独立复现)。原文的注脚:agent 的一半是 harness

以我读完之后能提炼的收敛度判断,每条给一个可复核判据(呼应本站评测→路由那篇的表达纪律):

论断收敛度判据
harness 是 agent 效果的另一半(同模型换 harness 差 ≥ 10 分)已收敛至少两家独立基准可复现
工具调用能力从 prompt 吸进权重已收敛codex-1 / Claude 4+ / Gemini 2+ 均带 tool-use RL
长上下文/compaction 被吸进权重收敛中目前仅厂商声明,缺少独立 benchmark 把「原生 compaction」和「harness compaction」拆开测
autonomy loop 由模型驱动 vs 人在环中的胜负已收敛头部产品(Claude Code、Codex CLI)已切到模型驱动

Harness 3.0:文章的赌注和它的软肋

文章的第二段主张是预测:如果按 train → absorb → shed 一直演化,最后能剩下什么?答案是留下人本位的能力——permissions、identity、trust、legibility。它们不是模型能力,它们是人和模型之间的合同,本质上不能被吸进模型自己的权重。

这就是 attention-interface:harness 从「人给模型打交道用的接口」翻转成「模型给人打交道用的接口」。文章的类比很干净——AGENTS.md 告诉 agent 怎么用你的代码库,attention-interface 告诉 agent 怎么用你:什么时候允许打断、什么时候接着自己干、哪些决策自己拍板、哪些要等你审批。而且它会像其它 harness 组件一样,成为可学习的:每一次人类的纠正都是训练数据。

我加一个我自己的接线(本站视角):这个词命中的其实是路由问题的对称另一半。此前我在 评测→路由决策图 里把”路由 = 预测问题 × 优化问题”拆过,那讲的是「用户 query 该路由到哪个模型」;attention-interface 是那道题的镜像——「模型产生的中断/请求,该路由到人的哪个注意力槽」。今天路由公司做前一半(LLM Router),三年后可能做后一半(Human-Router)。同一个数学,换了个方向。

我的软肋清单:这套叙事有什么可疑

按本站的绿灯思维纪律,写完主张要主动接住反对意见。这个模型至少三个地方我不放心:

  1. 后见之明偏误。任何”两条曲线在这里交叉”的故事,事后画都会画得整齐。真正能证伪的检验点是预测:如果 attention-interface 真是下一波,未来 12 个月应当能看到——(a) 三家以上独立公司发布类似 AGENTS.md 的、给 agent 读的人类偏好/审批规约文件;(b) 企业侧开始为”允许何种打断”制定政策;(c) 头部 agent 产品把 “notification policy” 做成一等设置。这三条一个也拿不出,模型就该降级。

  2. 样本偏向 Anthropic。文章大量以 Claude Code 为主角($1B ARR、80% 系统提示词删除、Boris Cherny 团队”为下一代模型设计”),叙事很紧,但样本偏。反例救场的是 OpenAI 的 codex-1 和 GPT-5.6 Sol 的 ARC-AGI-3 提升(据原文所述,从 13.3% 到 38.3%,靠 retained reasoning + compaction 的 harness 变化拿到)——这些证据不是 Anthropic 家的,路径却同构。所以”co-training era”这句结论比”Anthropic 打了漂亮仗”这句更耐拷问。

  3. 证据不齐。 Harness 2.0 部分的证据有基准数字(Harness-Bench 的 23.8 分差、ARC-AGI-3 的三倍提升),可拷问;Harness 3.0 部分的证据是类比 + 预测(“就像 AGENTS.md”),没法拷问。文章把两段并列读起来同样有力,其实第二段弱一档。作为读者需要把它们分开评分

和 Kaiser 那句话对齐一次

回到最开头:Kaiser 为什么讲不清 2025 年圣诞节前后到底发生了什么?文章给的答案是——这次跳变没有单一 changelog。预训练的跃迁能写进 model card,后训练的跃迁能贴到发布博客,模型 × harness 的共同进化没有 changelog。它发生在两条曲线之间,而不是发生在任何一条曲线上。

这句话回到本站的 harness 系列,能凑出一个一致的宏观运动:

  • Lilian Weng被优化对象的角度说:prompt → context → workflow → harness code → optimizer code 一路往上爬。
  • 《什么才是好的 harness》当下工程分工的角度说:判断归模型,物理归代码;harness 是 prompt 规则的物理化。
  • Prime Agent 源码那篇单次运行不重置的角度说:harness 状态形式化为 (ρ,G,K,M)(\rho, G, K, M),让 agent 从自己的轨迹里更新 harness 自身。
  • Dan McAteer 这篇从演化终点的角度说:能爬进权重的都会爬进权重,剩下的会翻转成人机接口。

四篇合起来是同一件事:agent 的进化正在从”堆 harness”转向”删 harness 并让模型接管”,最后不能被接管的那一层,会重新长成给人用的接口

带得走的东西:三张表 + 一个自检实验

第一张:四段演化的坐标系

阶段时间harness 定位与模型曲线的关系代表
1 · ReAct2022.10提示词里的循环双低,gap 小ReAct 原论文
2 · AutoGPT2023 春全自主员工harness 抢跑,gap 最大AutoGPT、BabyAGI
3 · IDE 时代2023-24人在环里,harness 放低主动降到模型之下Cursor、Copilot
4 · Claude Code2025.02押注下一代模型的 autonomy曲线交叉Claude Code
5 · Co-training2025-模型 × harness 共同进化曲线开始编织codex-1、GPT-5.x 家族
6 · Attention-interface未来模型给人的接口曲线跨越人机边界尚无公开代表

第二张:Harness 2.0 的三条吸收证据(按证据档次分级)

证据说的是什么证据类型我的态度
Harness-Bench 23.8 分差同模型不同 harness → 差距 52.4 → 76.2基准数据(原文引用)采信,未独立复现
GPT-5.6 Sol ARC-AGI-3 从 13.3% 到 38.3%只加 retained reasoning + compaction官方数据(原文引用)采信,未独立复现
Anthropic 删 Claude Code 系统提示词 ~80%内部工程动作内部人士口述(原文引用)采信,未独立复现

第三张:Harness 3.0 主张的可证伪清单

主张12 个月内可观察的证伪信号
attention-interface 会像 AGENTS.md 一样标准化至少 3 家独立厂商发布 agent 侧「人类偏好/审批规约」文件
打断权成为可学习组件至少 1 家把「打断策略」做成模型的原生能力(不只是外部规则)
人的注意力是真正的稀缺资源头部 agent 产品把”通知/汇报策略”做成一等设置项

自检实验(成本最低的一次亲手验证):翻你自己维护过的 agent 项目,统计过去 3 个月 system prompt 字符数 + tool 数量的净变化。若净减少而端到端成功率不降甚至上升,那么”harness 被吸进模型 → 可以删”这条主线在你自家的仓库里也成立——你不用相信 Latent Space 的那 80% 数字,你只需要看自己家的 diff。

诚实的提醒

本文对下列数字的态度都是”采信原文、未独立复现”,写作时已在正文里就地标注,这里再集中一次以便读者审阅:

  • Harness-Bench 106 任务、同模型 52.4 → 76.2、23.8 分差
  • GPT-5.6 Sol 在 ARC-AGI-3 上从 13.3% 到 38.3%
  • Claude Code 6 个月约 $1B ARR
  • Anthropic 团队最近删除 Claude Code system prompt ~80%
  • Devin 首版在 Answer.AI 复测 ~15% 成功率

以上任一条如果被独立数据推翻,“co-training era”这个宏观叙事本身不倒,但相关段落需要重新加权。文章的 Harness 3.0 部分(attention-interface)目前完全属于预测档,我在正文的可证伪清单里已经写清楚需要哪些信号来验证或推翻它——不是给读者压力,是给未来的自己留一个回来复检的钩子。

参考来源

原文

arXiv 论文(本文正文引用)

本站相关