2026年8月24日过程知识住在哪里?——Agent 编排的第四把交椅:编译进 8B 权重既有的 Agent 工程决策地图有六个决策点,但都没回答一个问题:一条业务流程该住在哪里?代码里(LangGraph/CrewAI,29 万 star)、前沿模型的 system prompt 里(Anthropic Building Effective Agents 推荐)、外部技能库里(Voyager 风格)——都是把 procedure 摆在模型外面。arXiv 2605.22502 补上第四把椅子:用 Claude Sonnet 4.5 遍历流程图生成 3000–6000 条合成对话,对 Qwen3-8B 做全量微调(LoRA 明确失败),把流程编译进权重变成 subterranean agent。三个实测领域:旅游预订 14 节点、Zoom 支持 14 节点、保险理赔 55 节点 6 决策枢纽。结果:单次会话比 in-context 便宜 128–462×,比 LangGraph 便宜 77–249×;质量达 in-context 前沿的 87–98%;保险和旅游任务失败率反而比 LangGraph orchestrator 更低(9% vs 17%、5.5% vs 24%);重新编译 30–50 分钟就是一次 CI/CD。这篇把它接进 Agent 决策地图的第七个位置,解释为什么 8B 能打赢 Claude 4.5 + LangGraph,以及这条路为什么不是在反苦涩教训,反而是苦涩教训吃掉 orchestrator。AILLMAgentAgent 工程论文深读
2026年8月24日手把手把 5 节点流程编译进 0.5B 权重——Subterranean Agent 实操陪读篇主篇给了 arXiv 2605.22502 的整套数字(128–462× 便宜、8B 打过 Claude 4.5 + LangGraph),但真正在 A100 上复现 8B 版本对读者门槛太高。这篇把管线缩到 8GB 消费级显存能跑的版本:5 节点日报归档流程 → 用 Claude Sonnet 4.5 合成 200 条对话(约 $1.70)→ Qwen2.5-0.5B 全量微调(bfloat16,~7GB 显存,M2 Pro 15 分钟)→ 对照 Claude API in-context。每一步给完整可跑代码、显存/时间/成本手算数字、以及一份 12 项自检清单。诚实标注:我没有实机跑完全流程,给出的数字是官方规格+手算估计,读者跑通请回来纠正。AILLMAgentAgent 工程学习笔记
2026年8月19日读 OpenViking 源码:把 Agent 上下文从「检索问题」改写成「数据库问题」克隆火山引擎开源的 OpenViking(Self-evolving Context Database),对照文档精读核心源码。它的全部设计可以压成三次「换表示」:把记忆/知识/技能统一成一个 viking:// 文件系统、把内容压成 L0/L1/L2 三层分辨率、把经验目录当成可优化的策略集并用「语义梯度」更新。这篇按写入、检索、进化三条路径逐一对照代码,最后用官方 benchmark 数字划清「已验证」和「未复现」的边界。Agent 工程记忆源码阅读上下文工程
2026年8月17日多 Agent 的内存问题,其实是分布式系统的老问题换了张脸一篇 2026 年 3 月的计算机体系结构立场论文,把多 Agent 系统的记忆管理拆成 I/O / Cache / Memory 三层,指出两个协议缺口(跨 Agent 缓存共享、结构化访问控制),并把核心难题钉在"内存一致性"上——这篇把它和本站已有的三篇"Agent=操作系统"文章接起来,看这个类比在哪里站得住、在哪里第一次真正碰壁。Agent 工程记忆系统设计论文深读
2026年8月17日推理转 Program 了吗?从「只给 Agent 一个 IPython」说起一位读者看完 Prime Agent「唯一工具是 Python 解释器」的设计后问:这是不是意味着推理转向程序?回查四年论文链(PAL/PoT → CodeAct → RLM)后我的答案是:对了一半。转成程序的不是推理,而是「算、做、记」三件事的执行权;语言仍然负责想。这篇给出谱系、边界和五个可证伪的推演。AgentLLMAgent 工程工具调用
2026年8月6日Agent 写码、Agent 测码:「人力真空」的真名,叫「独立验证真空」如果代码由 agent 写、测试也由 agent 生成,人退出验证环节会不会导致线上故障?本文用九个可核实的来源回答:会,但根因不是「人少了」,而是「独立验证信号少了」。写与测同源时,测试从独立证据退化为自我确认;对冲方案不是把人塞回原位,而是重构验证信号图——这个问题 1983 年就被预言过一次。AILLMAgentAgent 工程论文深读
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月6日Agent 时代的工程学·Infra 篇:六个决策点,和一条从显存到信任的收敛度梯度应用层的六个决策点全部站在 Infra 兑现的承诺上:token 流得出来、动作有地方跑、状态死不掉、身份说得清。本文用同一套「论文→产品」传导链方法,把 Agent Infra 拆成六个决策点逐个判收敛,并合成一条规律:离物理越近的层越收敛,离社会越近的层越不收敛。AILLMAgentAI InfraAgent 工程论文深读
2026年8月5日38 天发了 206 篇 AI 博客,一个问题把我问倒了:哪个论断背后有我自己跑出来的数字?一篇自我纠正。我曾以为"不断用 AI 读写博客,似懂非懂也能读成专家"——直到发现自己陷入了 AI 时代特有的新型流畅错觉:写作曾是检验理解的可靠手段,但当 AI 替你把半懂写成全懂的样子,"能产出一篇讲清 X 的文章"就不再是懂 X 的证据。这篇给出病因解剖(三层错觉)、实干型专家的操作性定义(论断-数字账本)、三条纠正规则(评分外置、AI 角色反转)和一个最小实干阶梯。LLMAgent 工程
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日当 Agent 开始说“物化”:一张大模型工程术语地图从物化、编排、轨迹、检查点到 Harness 和 Verifier,按任务闭环梳理 60 多个 Agent 工程术语,并追问哪些是真问题的新名字、哪些只是旧概念迁移,以及模型为何偏爱这种语言。AILLMAgentAgent 工程论文深读