2026年9月22日ASPIRE 深读:NVIDIA 教机器人的那套技能库,交付物是一个 CLAUDE.mdNVIDIA GEAR 的 ASPIRE 用 Claude Code 写机器人程序,把调试经验攒成技能库,长程任务零样本从 4% 提到 31%。但论文标题盖住了它自己的消融结论:拿走技能库不是最痛的,拿走执行轨迹才是(14%→62%)。这篇顺着「技能该存成什么」这条线,把 Voyager 到 ASPIRE 的表示切换拆开,并拿我自己的两个知识库跑了一遍论文的 Limitation 4——我的一条 skill 确实过期了。AIAgentAgent 工程论文深读Skills记忆
2026年9月16日Gavel 深读:别把技能目录塞进上下文,让模型从自己的中间层路由深读 Gavel 的 glance、verdict 与 product of experts:为什么技能路由既不该挤占任务上下文,也不该完全外包给检索器;并复算索引显存与路由成本。AIAgent 工程论文深读Skills
2026年9月15日X 上值得长期关注的 20 个大模型与 Agent 英文账号从 Avi Chawla 出发,实看 25 个 X 账号后留下 20 个英文一手信息源,按教程、Agent 工程、研究与行业反方四层整理;附只关注 6 人的精简版和四张可直接照抄的 X Lists。AILLMAgentAgent 工程学习笔记
2026年9月10日AFlow 到底在搜什么:读一遍 FoundationAgents 的自动 workflow 发现AFlow 的名字里挂着 MCTS,但真读源码,它不是一棵树;它是「LLM 当搜索算子 + 数值验收当奖励 + softmax 混合选父」的三件套。本文从根本约束、崩点、代码定位到手算 selection 概率,把这套结构拆到能自己复刻的分辨率。AILLMAgentAgent 工程论文深读
2026年9月10日Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日那张「AI 这十年」的成长图画反了:2026 栏的 22 个词,19 个不在模型里一张三代身高对比图把十年画成「模型长大了」。我数了一遍 2026 栏的 22 个词,只有 3 个动模型权重。再用自己这个 337 篇的博客仓库算一笔账:把全部内容塞进上下文,连最宽松的估法都装不下 1M 窗口——那 19 个词是这道算术题的产物,不是模型的成长纹。AI Infra上下文工程Agent 工程系统设计
2026年9月10日GiGPO 到底靠什么工作:Agent 训练里的 credit assignment 廉价补丁GiGPO 把 GRPO 从"一整条轨迹一个 advantage"升级为"episode 组 + step 组 相加",在 ALFWorld/WebShop 上比 GRPO 高 12/9 个百分点。但它的核心机制既不是嵌套树,也不是嵌入相似度——就是 hash(str(observation))。这一切建立在一个物理假设上:多条 rollout 会撞到同一个中间状态。撞不到,方法退化。AILLMAgentAgent 工程论文深读模型训练
2026年9月9日大模型热词地图 2026-09:把 63 个关键词按「谁是当下的瓶颈」排成一条链从可验证奖励、环境工程、test-time scaling,到 MoE 与混合线性注意力、PD 分离、MCP/A2A、致命三要素与评测饱和——按瓶颈迁移的顺序枚举当下热词,每个词给一句人话解释、为什么现在热,以及它是新瓶颈、旧词回温还是营销词。AILLMAgentAgent 工程
2026年9月9日一个模型的一生:从受孕定形到夕阳反哺,一张横图看完八格流水线把大模型从架构定形、预训练、后训练、评测、部署、Agent 产品一路到退役反哺画成一张横向的生命线,再顺着这张图立一个主线:这八格是一条单向压缩管道,每格都在把上游更大的东西压成更小的表示且丢弃不可逆,而整条链上只有最后一格会产出新信息——这解释了 2026 年的热点为什么全挤在末端。AILLM模型训练Agent 工程系统设计
2026年9月8日多轮 Agent 信用分配深读:奖励「给谁」是二阶问题,「覆盖多广」才是一阶深读 arXiv:2609.02417《Coverage, Not Targeting》:终态验证的多轮 Agent 里,验证器只暴露 k=1 步、成功却要 C=5–8 步硬前置链(V_d≈0.15);这时把奖励「对准关键步」是二阶的,把固定预算铺到覆盖全链才是一阶——shuffled 对照证明定向本身不带来收益,相位边界在 V_d*≈0.8。附我用 numpy 按附录 C 复现的两条扫描,和两笔能拿笔算完的账。AgentAgent 工程论文深读LLM模型训练
2026年9月8日面向 Agent 封装业务流程:把状态、约束和判据搬进 schema92% 的官方 MCP 服务器只是端点的薄壳,而写在散文里的参数约束会让 Agent 静默失败、41% 直接对用户说“没有数据”。本文给出一套封装方法:把状态、约束、判据从人脑和界面搬进 schema,按“可回滚的最小承诺单元”重切刀口,并说明新能力具体开在哪四处。AILLMAgentAgent 工程MCP工具调用系统设计
2026年9月8日先测判据,再测 Agent:业务评测样本的构造方法与一次作弊下界实测我按六轴坐标亲手造了 12 条电商售后样本和三代判据,让 5 个不理解业务的确定性作弊脚本去跑:第一版判据被拿到 9/12(75%),12 条样本全部被攻破,加固后降到 1/12。剩下那条是任务效度问题——题面漏了答案,改判据无解。附可复跑代码与判据体检清单。AILLMAgent评测Agent 工程工程实践
2026年9月7日把"判断"从模型手里再拿走一次:2026 年前沿在 Harness 上玩出的三条物理化战线从 Anthropic 用 Dynamic Workflows 把 Bun 从 53 万行 Zig 重写成 75 万行 Rust(11 天、64 个 Agent 并行、$165,000)说起,拆解 2026 年下半年前沿 harness 玩法收敛到的三条战线:控制流从模型决定变成脚本决定(Claude Code Dynamic Workflows / LangGraph / CrewAI)、隔离从约定变成文件系统原语(Cursor、Codex 生态的 worktrunk/oh-my-codex、Zed、Grok Build 各自的取舍)、验证从自评变成角色对立的对抗式复核(Bun 的三角色分工、Qodo 与 Greptile 的多 Agent 复核产品化)。每条战线都附一张可核实的代表产品表。这是《什么才是好的 Harness》一文半年后的实践坐实。AILLMAgentAgent 工程工程实践
2026年9月4日给 Agent 用的浏览器地图:Playwright、browser-use、ego-lite 到 Computer Use 之间的六个决策点从一次 Playwright MCP 的锁冲突翻车讲起,用「浏览器的第二用户是谁」这条约束把 11 款产品串成五代演进:传统开发者工具、LLM 决策层、像素级 GUI Agent、云端浏览器基础设施、双用户浏览器;辅以 arXiv 论文与本机字节实测。AgentAgent 工程AI Infra自动化
2026年9月1日别再把 harness 当实现细节:2026 年它被扶正成了一个必须申报的变量ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。AILLMAgentAgent 工程论文深读评测
2026年9月1日ENPIRE 深读:把自我改进循环搬上真机后,第一个坏掉的是 agent 自己ENPIRE 让 Codex / Claude Code / Kimi Code 无人监督地把八台机器人训到 99% 成功率。但论文里最值钱的不是这个数字,而是一处失败:三个 agent 都在仿真里解出了 Push-T,真机上两个失败了。退化发生在 agent 的科研能力上,不在策略上——这意味着所有在确定性基底上测出的「自我改进能力」都可能被高估。AILLMAgentAgent 工程论文深读
2026年8月31日Agent 最难的不是开始,而是知道什么时候结束模型很容易开始行动,却常把“做过了”误判成“做完了”。本文把 Agent 的完成条件拆成目标、世界状态、证据和边界,解释如何用终态协议区分继续、完成与受阻。AILLMAgentAgent 工程
2026年8月31日每次醒来都是陌生人:Agent 的“自我”到底存在哪里?一次模型调用结束后,刚才那个“它”已经消失。本文从记忆、权限、承诺和审计四本账出发,解释 Agent 如何跨会话、模型升级与子任务分叉维持可验证的身份连续性。AILLMAgentAgent 工程系统设计
2026年8月31日pi 的系统提示词有一半以上在教模型改造 pi 自己:一次极简 harness 的开箱实测把 pi.dev 的发布包(0.84.4)拆开量了三个数字:默认系统提示词约两千字符、其中 53%–59% 是「pi 自己的文档在哪」、官方声称「没做」的权限弹窗在示例目录里是一个 34 行的扩展。极简不是审美,是预算腾挪——腾出的位置用来让 harness 变成 agent 可读可改的对象。AILLMAgentAgent 工程工程实践
2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月25日会用 Coding Agent,不等于会做 AI Engineering:四项差距能力与训练法用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。AIAgent 工程评测工程实践系统设计
2026年8月25日读 ECC:一个仓库把 Claude Code 的 harness 意见装箱发货ECC(Everything Claude Code)是 MIT 协议的 Claude Code 插件仓库。它把 plan → test → implement → review → verify → remember → improve 这条工作流固化成 68 个 agent、286 个 skill、94 个命令和一套 hook。读这个仓库不是读框架源码,是读一份被具体化到文件的 harness 意见:每一种日用 agent 编程会踩到的失败模式,都对应一件可 install 的东西。AILLMAgentAgent 工程上下文工程
2026年8月25日在 AI 时代胜人一筹:杠杆不在模型多强,而在你和模型之间那道界面2005 年一对业余棋手加三台普通电脑,打败了大师加超算——卡斯帕罗夫由此提炼出"弱人类+机器+更好的流程"能赢。结合 Kasparov 定律、Bainbridge《自动化的反讽》、METR 实测 -19% 的 RCT,用一个能手算的 Amdahl 式杠杆公式说清:人机协作的胜负不在谁强,而在两者之间那道界面的质量。AIAgent 工程上下文工程工程实践自动化
2026年8月24日harness 会被模型吃掉:attention-interface 与 agent 演化的两条曲线深读 Latent Space 2026-08-22 那篇《The Evolution of the Agent Harness》。Dan McAteer 用一张"模型能力曲线 × harness 需求曲线"的几何图,把 2022 年 ReAct 到 2025 年 Claude Code 的四段演化串起来,并给出一个我认为值得记住的赌注:随着 harness 能力被 RL 吸收进权重、被工程师从提示词里删除,剩下的会是一层「模型给人套上的挽具」——attention-interface。这篇不做摘要,做消化:把文章的核心几何、数字锚点、可疑点、以及和本站已有 harness 谱系的对接,全部拆到能被下一篇引用的粒度。AILLMAgentAgent 工程论文深读