全部专题

Reading path

Agent 工程

记录 agent loop、工具调用、上下文工程、MCP、检索和长任务控制,把抽象能力落到工程边界。

164 篇文章

Archive

专题归档

第 1 / 7 页

Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级

把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。

把"判断"从模型手里再拿走一次:2026 年前沿在 Harness 上玩出的三条物理化战线

从 Anthropic 用 Dynamic Workflows 把 Bun 从 53 万行 Zig 重写成 75 万行 Rust(11 天、64 个 Agent 并行、$165,000)说起,拆解 2026 年下半年前沿 harness 玩法收敛到的三条战线:控制流从模型决定变成脚本决定(Claude Code Dynamic Workflows / LangGraph / CrewAI)、隔离从约定变成文件系统原语(Cursor、Codex 生态的 worktrunk/oh-my-codex、Zed、Grok Build 各自的取舍)、验证从自评变成角色对立的对抗式复核(Bun 的三角色分工、Qodo 与 Greptile 的多 Agent 复核产品化)。每条战线都附一张可核实的代表产品表。这是《什么才是好的 Harness》一文半年后的实践坐实。

交付门禁 vs 评测系统:一对被反复混淆的角色,和一条「传感器/执行器」定律

业界经常把「大模型评测系统」和「大模型交付门禁」当成一回事,结果就是评测跑通了却拦不住线上翻车,或者门禁很严却测不到关键翻车方式。本文把两者按角色分开:评测系统是传感器(持续量),交付门禁是执行器(一次决策)。用五篇 2026 年的 arXiv 论文(Automated Self-Testing 2603.15676、LLM Readiness Harness 2603.27355、Test Before You Deploy 2604.27789、Predicting LLM Safety Before Release 2607.07184、含 HELM 2211.09110 的坐标系)+ Google SRE 错误预算+决策地图系列前作,给出七维度对照表、四种失配病理、以及一条把两者接起来的「传感器/执行器阻抗匹配」定律。