2026年9月22日ASPIRE 深读:NVIDIA 教机器人的那套技能库,交付物是一个 CLAUDE.mdNVIDIA GEAR 的 ASPIRE 用 Claude Code 写机器人程序,把调试经验攒成技能库,长程任务零样本从 4% 提到 31%。但论文标题盖住了它自己的消融结论:拿走技能库不是最痛的,拿走执行轨迹才是(14%→62%)。这篇顺着「技能该存成什么」这条线,把 Voyager 到 ASPIRE 的表示切换拆开,并拿我自己的两个知识库跑了一遍论文的 Limitation 4——我的一条 skill 确实过期了。AIAgentAgent 工程论文深读Skills记忆
2026年9月18日Shiplight 全栈拆解:Agent 原生测试平台如何把意图变成可持续回归我实际走查 Shiplight 官网、67 个文档入口、公开 Agent Skill、npm 包与 Trust Center,拆开它的 MCP 浏览器、YAML 意图层、Playwright 执行层、Action Cache、自愈、CI 归因和云端商业飞轮,并给出一条不照抄产品表面的 clean-room 自研路线。AIAgent自动化AI Infra评测
2026年9月15日现代 AI 工具生态勾勒:11 层 82 款产品与它们的官方链接按 Rathnakumar Udayakumar 的《Modern AI Ecosystem – Tools》一图,逐层拆解 11 个能力层里的 82 款产品;每条给一句话定位与官方链接。附本机跑过的 46 家 GitHub star 数、5 处 org 迁移与 4 处跨层重复的观察。AIAI InfraAgentMCPRAG自动化
2026年9月15日X 上值得长期关注的 20 个大模型与 Agent 英文账号从 Avi Chawla 出发,实看 25 个 X 账号后留下 20 个英文一手信息源,按教程、Agent 工程、研究与行业反方四层整理;附只关注 6 人的精简版和四张可直接照抄的 X Lists。AILLMAgentAgent 工程学习笔记
2026年9月10日AFlow 到底在搜什么:读一遍 FoundationAgents 的自动 workflow 发现AFlow 的名字里挂着 MCTS,但真读源码,它不是一棵树;它是「LLM 当搜索算子 + 数值验收当奖励 + softmax 混合选父」的三件套。本文从根本约束、崩点、代码定位到手算 selection 概率,把这套结构拆到能自己复刻的分辨率。AILLMAgentAgent 工程论文深读
2026年9月10日Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日GiGPO 到底靠什么工作:Agent 训练里的 credit assignment 廉价补丁GiGPO 把 GRPO 从"一整条轨迹一个 advantage"升级为"episode 组 + step 组 相加",在 ALFWorld/WebShop 上比 GRPO 高 12/9 个百分点。但它的核心机制既不是嵌套树,也不是嵌入相似度——就是 hash(str(observation))。这一切建立在一个物理假设上:多条 rollout 会撞到同一个中间状态。撞不到,方法退化。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日一次 finish_reason=length 翻车:LLM 评测的静默失败分几层Veral 跑 Kimi K2 多选评测翻车:reasoning 吃光 4096 token、content 为空、finish_reason=length,评分器抓不到答案。以这次为锚点,把 LLM 评测里的静默失败排成五层——生成层、评分层、统计层、数据层、链路层——每层给症状、根因、探测方法与 arXiv 出处。AILLM评测Agent论文深读工程实践
2026年9月9日BFCL v3 深读:多轮函数调用的评测口径,从「对答案」换成「diff 状态」Berkeley 那篇 BFCL v3 博客表面在讲 1000 条新多轮题目,底下真正换掉的是评测口径:从 AST 匹配一条正确轨迹,变成让代码跑进沙盒后比对对象属性。附源码定位、条数核对、四类多轮任务的判据分工,以及一处被注释掉的更严判据留下的证据。AILLMAgent评测工具调用源码阅读
2026年9月9日什么是大模型的环境工程:一道题只有「不全对也不全错」才算数从 GRPO 组内优势的手算出发:8 次 rollout 全对或全错,优势严格为 0,算力白花。由此推出难度有效带 p∈[0.25,0.75],并结合 SWE-bench 字段清单、DAPO 动态采样与 rollout 吞吐工程,说清环境工程到底在工程什么。AILLMAgent论文深读
2026年9月9日大模型热词地图 2026-09:把 63 个关键词按「谁是当下的瓶颈」排成一条链从可验证奖励、环境工程、test-time scaling,到 MoE 与混合线性注意力、PD 分离、MCP/A2A、致命三要素与评测饱和——按瓶颈迁移的顺序枚举当下热词,每个词给一句人话解释、为什么现在热,以及它是新瓶颈、旧词回温还是营销词。AILLMAgentAgent 工程
2026年9月8日多轮 Agent 信用分配深读:奖励「给谁」是二阶问题,「覆盖多广」才是一阶深读 arXiv:2609.02417《Coverage, Not Targeting》:终态验证的多轮 Agent 里,验证器只暴露 k=1 步、成功却要 C=5–8 步硬前置链(V_d≈0.15);这时把奖励「对准关键步」是二阶的,把固定预算铺到覆盖全链才是一阶——shuffled 对照证明定向本身不带来收益,相位边界在 V_d*≈0.8。附我用 numpy 按附录 C 复现的两条扫描,和两笔能拿笔算完的账。AgentAgent 工程论文深读LLM模型训练
2026年9月8日Agent 记忆的前沿玩法:从存聊天记录,到主动寻找可用证据结合 Hindsight、EviMem、RLM、MemSkill、AgeMem 与最新隐式记忆评测,拆解有效的记忆和知识获取路线,附版本冲突小实验、成本复算与落地顺序。AILLMAgent记忆RAG论文深读评测
2026年9月8日面向 Agent 封装业务流程:把状态、约束和判据搬进 schema92% 的官方 MCP 服务器只是端点的薄壳,而写在散文里的参数约束会让 Agent 静默失败、41% 直接对用户说“没有数据”。本文给出一套封装方法:把状态、约束、判据从人脑和界面搬进 schema,按“可回滚的最小承诺单元”重切刀口,并说明新能力具体开在哪四处。AILLMAgentAgent 工程MCP工具调用系统设计
2026年9月8日先测判据,再测 Agent:业务评测样本的构造方法与一次作弊下界实测我按六轴坐标亲手造了 12 条电商售后样本和三代判据,让 5 个不理解业务的确定性作弊脚本去跑:第一版判据被拿到 9/12(75%),12 条样本全部被攻破,加固后降到 1/12。剩下那条是任务效度问题——题面漏了答案,改判据无解。附可复跑代码与判据体检清单。AILLMAgent评测Agent 工程工程实践
2026年9月8日CrewAI、LangGraph、AutoGen 怎么选:从角色分工到可恢复执行深读 Pickaxe 的框架对比,结合 ReAct、AutoGen、MetaGPT 与 MAST 论文,重新理解角色、状态图和对话协议。附 LangGraph 真实进程崩溃实验与上下文成本手算,解释检查点为什么不能单独保证外部动作只执行一次。AIAgent论文深读工程实践
2026年9月8日前沿大模型十家公司在押注什么:2026 年 9 月榜单与技术路线深挖按 Artificial Analysis v4.3 非估算成绩筛出十家模型开发者,核对正式文档、论文与开源交付,拆解长程 Agent、推理经济性、开放基础设施和世界模型四条路线,并附排名复核与成本复算。AILLMAgent论文深读评测
2026年9月8日369 个 skill 上架,0 次调用:我拉出调用日志后重画的「盘活」三道闸装了一个 286 skill 的 marketplace,开 6 天、每会话往上下文注入 30 KB 货架,hub skill 调用 0 次。用本机 27 个会话的日志拆出「盘活」三道闸:描述预算在字母 b 处用尽、写了中文触发语的只有 1/286、通用能力零增量。附可复现度量脚本。AgentSkills工程实践
2026年9月8日大模型多试几次,为什么反而选错了?从可验证奖励到环境工程在一个可复现的排序实验里,把候选数从 8 增到 32,验收通过率升到 99.99%,真正交付正确答案的概率却从 56.33% 跌到 19.36%。结合 SWE-smith、EnvHarness 与环境演化研究,拆开生成、验证和选择之间的关系。AILLMAgent评测
2026年9月7日把"判断"从模型手里再拿走一次:2026 年前沿在 Harness 上玩出的三条物理化战线从 Anthropic 用 Dynamic Workflows 把 Bun 从 53 万行 Zig 重写成 75 万行 Rust(11 天、64 个 Agent 并行、$165,000)说起,拆解 2026 年下半年前沿 harness 玩法收敛到的三条战线:控制流从模型决定变成脚本决定(Claude Code Dynamic Workflows / LangGraph / CrewAI)、隔离从约定变成文件系统原语(Cursor、Codex 生态的 worktrunk/oh-my-codex、Zed、Grok Build 各自的取舍)、验证从自评变成角色对立的对抗式复核(Bun 的三角色分工、Qodo 与 Greptile 的多 Agent 复核产品化)。每条战线都附一张可核实的代表产品表。这是《什么才是好的 Harness》一文半年后的实践坐实。AILLMAgentAgent 工程工程实践
2026年9月7日Magnitude 源码深读:它不是又一个 Ollama,而是一台本地 Agent 推理控制器从源码、实测与论文出发,拆解 Magnitude 如何完成硬件探测、模型选型、投机解码、驻留管理与 Agent 接入。AI InfraLLMAgent源码阅读
2026年9月7日Ruflo 源码深读:它不是一群 Agent,而是套在 Agent 外面的控制面沿 Ruflo 3.38.21 的真实执行链,拆解配置注入、MCP 工具面、Swarm 控制状态、执行后端与记忆学习闭环,并区分已接线能力和产品叙事。AILLMAgent源码阅读工程实践MCP
2026年9月6日面向 Agent 的门禁产品设计:当提交变更、执行检查、读判决的都是 Agent,人只在 HOLD 时出现门禁的一等用户正从人变成 Agent。本文从产品与链路视角给出面向 Agent 的门禁体系:变更全生命周期时序图、六层架构、七个领域对象、判决 schema 与状态机、三条防 Agent 钻空子的规则,并以 Shiplight 为参照指出它做对与缺失之处。AILLMAgent评测AI Infra自动化
2026年9月4日给 Agent 用的浏览器地图:Playwright、browser-use、ego-lite 到 Computer Use 之间的六个决策点从一次 Playwright MCP 的锁冲突翻车讲起,用「浏览器的第二用户是谁」这条约束把 11 款产品串成五代演进:传统开发者工具、LLM 决策层、像素级 GUI Agent、云端浏览器基础设施、双用户浏览器;辅以 arXiv 论文与本机字节实测。AgentAgent 工程AI Infra自动化