“The change last winter, last Christmas — it’s a little hard to pin down. I mean, the harness changed and a little post-training changed and then new pre-trained models came… but it felt like a big jump which is not that easy to pin down what did it.” —— Lukasz Kaiser(Transformer 共同作者),转引自 Dan McAteer, The Evolution of the Agent Harness, Latent Space, 2026-08-22。
Kaiser 讲的这次「不容易指认」的跳变,是 2025 年圣诞节前后 agent 突然开始好用的那一刻。文章把这个”讲不清”翻译成一个几何问题:不是单条曲线跳了,是两条曲线交叉了——模型能力曲线,与 harness 对模型的要求曲线。
一句话把整篇文章的赌注收拢:
harness 正在翻转:过去它是”人给模型套上的挽具”,未来它是”模型给人套上的挽具”——因为真正稀缺的东西正从算力变成人的注意力。
这也是我读完之后决定单开一篇的原因。它给了本站 harness 系列一个新的抽象层:《什么才是好的 Harness》讲当下这一版 harness 的分工(判断归模型,物理归代码),Lilian Weng 那篇讲被优化对象沿着 prompt → context → workflow → harness code → optimizer code 一路向上爬——Dan McAteer 这篇给了这条爬升的终点:所有能爬进权重的都会爬进权重,剩下的会翻转成”跟人打交道”的接口。
名词速查
| 术语 | 一句话解释 |
|---|---|
| harness | 模型权重之外让 agent 能干活的所有东西:工具、控制循环、上下文、权限、护栏。定义在这里 |
| ReAct | 2022 年提出的 Thought → Action → Observation 循环,纯用 prompt 让模型逐步推理与行动 |
| RL-in-the-environment | 把模型放进 harness/真实环境里,用工具调用、多步任务的成败作为奖励信号做强化学习 |
| co-training / 共同进化 | 模型和 harness 不再各改各的,而是一起被同一个 RL 循环塑形 |
| attention-interface | 文章造的词:等 harness 的机器侧能力被模型吸收之后,剩下的那层”跟人的注意力打交道”的接口——什么时候打断你、哪些决策要你审批、如何汇报进度 |
| AGENTS.md | 已在生态里流行的一种约定文件,告诉 agent 怎么读你的代码库;attention-interface 是这个概念的对称姊妹——告诉 agent 怎么读你(这个人) |
两条曲线:文章的核心几何
文章不用公式,用两条曲线:
- 模型能力曲线:模型在真实工具环境里可靠完成 N 步任务的成功率。
- harness 需求曲线:harness 让模型去干的任务复杂度(loop 长度、autonomy 大小、可用工具数)。
两条曲线之间的 gap,就是这一代 agent 的”卡壳量”。gap 有正负、宽窄、方向,它是理解 agent 演化的第一变量。
timeline
title Agent Harness 四段演化 · 两条曲线的 gap 变化
2022.10 ReAct : harness 只是提示词<br>两条曲线双低,gap 小
2023春 AutoGPT/BabyAGI : harness 抢跑,让模型去当自主员工<br>gap 达到最大,loop 只放大错误
2023-24 Cursor / Copilot : IDE 主动把 harness 降到人在环中<br>先补上模型的可靠性缺口
2024末 o1 : 首个推理模型,模型曲线首次反超 harness<br>capability overhang 出现
2025.02 Claude Code : harness 押注下一代模型<br>autonomy 归还给模型,曲线交叉
2025- Co-training : harness 能力被 RL 吸收进权重<br>工程师"删除即进化"
(图里所有阶段的名字、时间、判断都来自原文;日期我按原文所给年份精度标注。)
复利算术:为什么 AutoGPT 阶段的 gap 那么难堪
文章开出了一道极简算术来解释 AutoGPT/BabyAGI 时期的失败——loop 不制造能力,loop 只放大能力。每步 95% 靠谱的模型跑 20 步,端到端只剩 。我先跑了一次 python3 -c 验算,把这个曲面展开:
| 每步可靠性 | 5 步 | 10 步 | 20 步 |
|---|---|---|---|
| 0.80 | 32.77% | 10.74% | 1.15% |
| 0.90 | 59.05% | 34.87% | 12.16% |
| 0.95 | 77.38% | 59.87% | 35.85% |
| 0.99 | 95.10% | 90.44% | 81.79% |
盯着这张表看十秒能得出的直觉:loop 长度是可靠性的放大镜。AutoGPT 时代的 harness 把模型丢进 20+ 步的自主任务,而 2023 年模型每步顶到天 90% 出头——12% 的端到端成功率不是模型笨,是 harness 押错了曲线阶段。文章把 Cursor/Copilot “先把 harness 拉回人在环里”重新定性为正确的判断,而不是保守:他们不是错过了 autonomy,他们是读对了曲线。
Harness 2.0:吸收的三个具体证据
文章把当下这一代(2025 年至今)命名为 co-training era:两条曲线不再各改各的,而是被同一个 RL 循环一起塑形。原文给了三条互相独立的证据链,我把每条按证据档次分栏拆一下。
证据 1:工具调用。Toolformer(Meta, arXiv 2302.04761, 2023.02)提出的原理是”工具使用可以被训练出来,而不是被提示出来”。当时这只是一个假设。真正把它工程化的是 OpenAI 2025 年 5 月的 codex-1 发布:文章直接引原文,“codex-1 was trained using reinforcement learning on real-world coding tasks in a variety of environments.”。从 ReAct(Yao et al., arXiv 2210.03629, 2022.10)靠 prompt 拼出的循环,到 codex-1 靠 RL 在环境里训出的循环,正好是「harness 里的技巧被吸进权重」的样本。
证据 2:上下文压缩(compaction)。文章转引 GPT-5.1-Codex-Max 发布材料的一句原话:
“the first model natively trained to operate across multiple context windows through compaction.”
harness 时代 compaction 是一个由外部代码执行的动作:把历史摘要成总结、腾出窗口空间。「原生跨多窗口」的说法(据原文所述)等于把这个动作压进了模型。这条证据只是厂商声明,我未见独立复现——写在这里是因为它是模式匹配的关键节点,不因为它已被验证。
证据 3:整体的 harness 缩水。文章引 Anthropic 的 Thariq Shihipar:团队最近删掉了 Claude Code system prompt 的 ~80%。这个数字是关键锚点——演化的度量正是”你能删掉多少 harness 而不损失能力”(据原文所述,我未独立复现)。
这三条组合出的模式是:train(在 harness 里训模型)→ absorb(能力沉进权重)→ shed(工程师从 harness 里删掉冗余)→ repeat。文章用一个数据做同侪佐证:Harness-Bench 106 个任务,同一个模型换 harness,得分 52.4 → 76.2,23.8 分的差(据原文所述,我未独立复现)。原文的注脚:agent 的一半是 harness。
以我读完之后能提炼的收敛度判断,每条给一个可复核判据(呼应本站评测→路由那篇的表达纪律):
| 论断 | 收敛度 | 判据 |
|---|---|---|
| harness 是 agent 效果的另一半(同模型换 harness 差 ≥ 10 分) | 已收敛 | 至少两家独立基准可复现 |
| 工具调用能力从 prompt 吸进权重 | 已收敛 | codex-1 / Claude 4+ / Gemini 2+ 均带 tool-use RL |
| 长上下文/compaction 被吸进权重 | 收敛中 | 目前仅厂商声明,缺少独立 benchmark 把「原生 compaction」和「harness compaction」拆开测 |
| autonomy loop 由模型驱动 vs 人在环中的胜负 | 已收敛 | 头部产品(Claude Code、Codex CLI)已切到模型驱动 |
Harness 3.0:文章的赌注和它的软肋
文章的第二段主张是预测:如果按 train → absorb → shed 一直演化,最后能剩下什么?答案是留下人本位的能力——permissions、identity、trust、legibility。它们不是模型能力,它们是人和模型之间的合同,本质上不能被吸进模型自己的权重。
这就是 attention-interface:harness 从「人给模型打交道用的接口」翻转成「模型给人打交道用的接口」。文章的类比很干净——AGENTS.md 告诉 agent 怎么用你的代码库,attention-interface 告诉 agent 怎么用你:什么时候允许打断、什么时候接着自己干、哪些决策自己拍板、哪些要等你审批。而且它会像其它 harness 组件一样,成为可学习的:每一次人类的纠正都是训练数据。
我加一个我自己的接线(本站视角):这个词命中的其实是路由问题的对称另一半。此前我在 评测→路由决策图 里把”路由 = 预测问题 × 优化问题”拆过,那讲的是「用户 query 该路由到哪个模型」;attention-interface 是那道题的镜像——「模型产生的中断/请求,该路由到人的哪个注意力槽」。今天路由公司做前一半(LLM Router),三年后可能做后一半(Human-Router)。同一个数学,换了个方向。
我的软肋清单:这套叙事有什么可疑
按本站的绿灯思维纪律,写完主张要主动接住反对意见。这个模型至少三个地方我不放心:
-
后见之明偏误。任何”两条曲线在这里交叉”的故事,事后画都会画得整齐。真正能证伪的检验点是预测:如果 attention-interface 真是下一波,未来 12 个月应当能看到——(a) 三家以上独立公司发布类似
AGENTS.md的、给 agent 读的人类偏好/审批规约文件;(b) 企业侧开始为”允许何种打断”制定政策;(c) 头部 agent 产品把 “notification policy” 做成一等设置。这三条一个也拿不出,模型就该降级。 -
样本偏向 Anthropic。文章大量以 Claude Code 为主角($1B ARR、80% 系统提示词删除、Boris Cherny 团队”为下一代模型设计”),叙事很紧,但样本偏。反例救场的是 OpenAI 的 codex-1 和 GPT-5.6 Sol 的 ARC-AGI-3 提升(据原文所述,从 13.3% 到 38.3%,靠 retained reasoning + compaction 的 harness 变化拿到)——这些证据不是 Anthropic 家的,路径却同构。所以”co-training era”这句结论比”Anthropic 打了漂亮仗”这句更耐拷问。
-
证据不齐。 Harness 2.0 部分的证据有基准数字(Harness-Bench 的 23.8 分差、ARC-AGI-3 的三倍提升),可拷问;Harness 3.0 部分的证据是类比 + 预测(“就像 AGENTS.md”),没法拷问。文章把两段并列读起来同样有力,其实第二段弱一档。作为读者需要把它们分开评分。
和 Kaiser 那句话对齐一次
回到最开头:Kaiser 为什么讲不清 2025 年圣诞节前后到底发生了什么?文章给的答案是——这次跳变没有单一 changelog。预训练的跃迁能写进 model card,后训练的跃迁能贴到发布博客,模型 × harness 的共同进化没有 changelog。它发生在两条曲线之间,而不是发生在任何一条曲线上。
这句话回到本站的 harness 系列,能凑出一个一致的宏观运动:
- Lilian Weng 从被优化对象的角度说:
prompt → context → workflow → harness code → optimizer code一路往上爬。 - 《什么才是好的 harness》 从当下工程分工的角度说:判断归模型,物理归代码;harness 是 prompt 规则的物理化。
- Prime Agent 源码那篇 从单次运行不重置的角度说:harness 状态形式化为 ,让 agent 从自己的轨迹里更新 harness 自身。
- Dan McAteer 这篇从演化终点的角度说:能爬进权重的都会爬进权重,剩下的会翻转成人机接口。
四篇合起来是同一件事:agent 的进化正在从”堆 harness”转向”删 harness 并让模型接管”,最后不能被接管的那一层,会重新长成给人用的接口。
带得走的东西:三张表 + 一个自检实验
第一张:四段演化的坐标系
| 阶段 | 时间 | harness 定位 | 与模型曲线的关系 | 代表 |
|---|---|---|---|---|
| 1 · ReAct | 2022.10 | 提示词里的循环 | 双低,gap 小 | ReAct 原论文 |
| 2 · AutoGPT | 2023 春 | 全自主员工 | harness 抢跑,gap 最大 | AutoGPT、BabyAGI |
| 3 · IDE 时代 | 2023-24 | 人在环里,harness 放低 | 主动降到模型之下 | Cursor、Copilot |
| 4 · Claude Code | 2025.02 | 押注下一代模型的 autonomy | 曲线交叉 | Claude Code |
| 5 · Co-training | 2025- | 模型 × harness 共同进化 | 曲线开始编织 | codex-1、GPT-5.x 家族 |
| 6 · Attention-interface | 未来 | 模型给人的接口 | 曲线跨越人机边界 | 尚无公开代表 |
第二张:Harness 2.0 的三条吸收证据(按证据档次分级)
| 证据 | 说的是什么 | 证据类型 | 我的态度 |
|---|---|---|---|
| Harness-Bench 23.8 分差 | 同模型不同 harness → 差距 52.4 → 76.2 | 基准数据(原文引用) | 采信,未独立复现 |
| GPT-5.6 Sol ARC-AGI-3 从 13.3% 到 38.3% | 只加 retained reasoning + compaction | 官方数据(原文引用) | 采信,未独立复现 |
| Anthropic 删 Claude Code 系统提示词 ~80% | 内部工程动作 | 内部人士口述(原文引用) | 采信,未独立复现 |
第三张:Harness 3.0 主张的可证伪清单
| 主张 | 12 个月内可观察的证伪信号 |
|---|---|
| attention-interface 会像 AGENTS.md 一样标准化 | 至少 3 家独立厂商发布 agent 侧「人类偏好/审批规约」文件 |
| 打断权成为可学习组件 | 至少 1 家把「打断策略」做成模型的原生能力(不只是外部规则) |
| 人的注意力是真正的稀缺资源 | 头部 agent 产品把”通知/汇报策略”做成一等设置项 |
自检实验(成本最低的一次亲手验证):翻你自己维护过的 agent 项目,统计过去 3 个月 system prompt 字符数 + tool 数量的净变化。若净减少而端到端成功率不降甚至上升,那么”harness 被吸进模型 → 可以删”这条主线在你自家的仓库里也成立——你不用相信 Latent Space 的那 80% 数字,你只需要看自己家的 diff。
诚实的提醒
本文对下列数字的态度都是”采信原文、未独立复现”,写作时已在正文里就地标注,这里再集中一次以便读者审阅:
- Harness-Bench 106 任务、同模型 52.4 → 76.2、23.8 分差
- GPT-5.6 Sol 在 ARC-AGI-3 上从 13.3% 到 38.3%
- Claude Code 6 个月约 $1B ARR
- Anthropic 团队最近删除 Claude Code system prompt ~80%
- Devin 首版在 Answer.AI 复测 ~15% 成功率
以上任一条如果被独立数据推翻,“co-training era”这个宏观叙事本身不倒,但相关段落需要重新加权。文章的 Harness 3.0 部分(attention-interface)目前完全属于预测档,我在正文的可证伪清单里已经写清楚需要哪些信号来验证或推翻它——不是给读者压力,是给未来的自己留一个回来复检的钩子。
参考来源
原文
- Dan McAteer, The Evolution of the Agent Harness, Latent Space, 2026-08-22。
arXiv 论文(本文正文引用)
- Yao et al., ReAct: Synergizing Reasoning and Acting in Language Models, arXiv 2210.03629, 2022。
- Schick et al., Toolformer: Language Models Can Teach Themselves to Use Tools, arXiv 2302.04761, 2023。
本站相关