2026年9月22日ASPIRE 深读:NVIDIA 教机器人的那套技能库,交付物是一个 CLAUDE.mdNVIDIA GEAR 的 ASPIRE 用 Claude Code 写机器人程序,把调试经验攒成技能库,长程任务零样本从 4% 提到 31%。但论文标题盖住了它自己的消融结论:拿走技能库不是最痛的,拿走执行轨迹才是(14%→62%)。这篇顺着「技能该存成什么」这条线,把 Voyager 到 ASPIRE 的表示切换拆开,并拿我自己的两个知识库跑了一遍论文的 Limitation 4——我的一条 skill 确实过期了。AIAgentAgent 工程论文深读Skills记忆
2026年9月21日RLCD 拆解:Jev 训练招牌里,多少是新的?TypeSafe 把 Jev 的训练招牌叫 RLCD。arXiv 上有个近亲 2025-07 就交了叫 RLCR,Brier 直接进奖励;Kadavath 2022 甚至一个 T=2.5 就能事后修一半。本机 Qwen3-4B 跑 30 个是非题:平均自信 99.9%、准确率 90%。AI InfraLLM论文深读模型训练
2026年9月18日SLSA 和 in-toto 是两栈叠加,不是二选一SLSA 和 in-toto 都在回答'这件软件是不是按声称的流程走出来的',但切在不同关节——in-toto 是可以在图上跑的验证算法,SLSA 是对签发方的等级承诺。手算 MATCH 规则看清算法本体。工程实践系统设计论文深读
2026年9月16日Gavel 深读:别把技能目录塞进上下文,让模型从自己的中间层路由深读 Gavel 的 glance、verdict 与 product of experts:为什么技能路由既不该挤占任务上下文,也不该完全外包给检索器;并复算索引显存与路由成本。AIAgent 工程论文深读Skills
2026年9月15日Parasma 深读:把 Friston 的自由能原理装进 Y Combinator 的湿件赌注一家 YC S26 湿件公司拿人脑细胞做 next-token prediction,网站上那句「Biological compute with living neurons」背后是四条被压缩的决策链——基质、训练算法、读出、经济学,每一条都能挂到一篇 20 世纪或 21 世纪初的老论文上。AIAI Infra论文深读系统设计
2026年9月14日11 种 LLM 评估方法,其实只在回答一个问题:参照物从哪来三句话喂给三代指标:真实排序 A>C>B,ROUGE-L 给 C>B>A,BERTScore 给 B>A>C,没一个排对。附本地 Qwen2.5-7B 的分数 token 概率分布、30 次采样的裁判方差,以及 DeepEval DAG 源码究竟把什么变确定了。AILLM评测论文深读工程实践
2026年9月14日六种位置编码,其实只在争两个插入点同一个 Qwen2.5-7B、同一段文本、同样是把窗口放大 4 倍:线性插值让 PPL 从 8.18 崩到 173.57,YaRN 只涨到 8.90。差别全在一张波长表——我手算出 YaRN 放过了 64 个维度对里转得最快的 30 对。附 llama.cpp 源码定位与三个 token 的置换等变手算。AILLMTransformer论文深读源码阅读
2026年9月14日把工具调用数据反着造:ToolGrad 用 500 条样本追平闭源大模型的那件事ToolBench 用 12.6 万条 SFT 数据把开源模型教会 tool-use,方式是「先给用户问题、DFS 搜工具链」。ToolGrad 反着来:先造链、再回头写用户 query。500 条样本训练出的 Gemma-3-12B 在 BFCL 上 83.1 分,等于 gemini-2.5-pro、高于 GPT-5。这篇把它的四模块管线拆到源码位置,把「textual gradient」追溯到 TextGrad,并和 APIGen、ToolACE 拉一张四家决策矩阵。AILLM工具调用论文深读模型训练
2026年9月10日AFlow 到底在搜什么:读一遍 FoundationAgents 的自动 workflow 发现AFlow 的名字里挂着 MCTS,但真读源码,它不是一棵树;它是「LLM 当搜索算子 + 数值验收当奖励 + softmax 混合选父」的三件套。本文从根本约束、崩点、代码定位到手算 selection 概率,把这套结构拆到能自己复刻的分辨率。AILLMAgentAgent 工程论文深读
2026年9月10日Agent 自进化不是一张全景图,是一架四层可回滚阶梯——每往下一层 credit 就贵一个数量级把 9 篇「Agent 自进化」论文挂进一架四层可回滚阶梯:L1 Skill 文档(分钟级、git diff)、L2 Skill Bank(小时级、可 prune)、L3 Harness / 元进化(会话级、Pareto 归档)、L4 模型权重(不可逆)。每下一层,回滚成本 × 传导广度跳一个数量级,credit assignment 门槛也跳——L1 靠「≥2 条轨迹独立提议同一编辑」的投票几何就够(K=8 时假/真比 1:72),L4 必须靠 GiGPO 的 anchor state、LLM 语义自归因或 privileged teacher(OPSD)。附三笔 Python 手算:Trace2Skill 的投票几何、GiGPO 在不同状态空间下的 anchor 复用率、AgentEvolver 55% 步数节省背后的信号密度倍率。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日GiGPO 到底靠什么工作:Agent 训练里的 credit assignment 廉价补丁GiGPO 把 GRPO 从"一整条轨迹一个 advantage"升级为"episode 组 + step 组 相加",在 ALFWorld/WebShop 上比 GRPO 高 12/9 个百分点。但它的核心机制既不是嵌套树,也不是嵌入相似度——就是 hash(str(observation))。这一切建立在一个物理假设上:多条 rollout 会撞到同一个中间状态。撞不到,方法退化。AILLMAgentAgent 工程论文深读模型训练
2026年9月10日LLM 评测的 25 个坑:一张五层管线地图与论文索引上一篇从一次 finish_reason=length 翻车讲了静默失败。这篇把视野拉满:按评测管线把 LLM 评测的坑切成数据、生成、评分、统计、链路五层共 25 个,每个坑给症状、论文证据(带具体数字)和防线;末尾收三条跨层主线和一份评测前中后防坑清单。AILLM评测论文深读工程实践
2026年9月10日一次 finish_reason=length 翻车:LLM 评测的静默失败分几层Veral 跑 Kimi K2 多选评测翻车:reasoning 吃光 4096 token、content 为空、finish_reason=length,评分器抓不到答案。以这次为锚点,把 LLM 评测里的静默失败排成五层——生成层、评分层、统计层、数据层、链路层——每层给症状、根因、探测方法与 arXiv 出处。AILLM评测Agent论文深读工程实践
2026年9月9日什么是大模型的环境工程:一道题只有「不全对也不全错」才算数从 GRPO 组内优势的手算出发:8 次 rollout 全对或全错,优势严格为 0,算力白花。由此推出难度有效带 p∈[0.25,0.75],并结合 SWE-bench 字段清单、DAPO 动态采样与 rollout 吞吐工程,说清环境工程到底在工程什么。AILLMAgent论文深读
2026年9月9日图像识别做得更好,卡点不在「看清」而在「定位」——三因子拆解与 2026 年的三记反手把图像识别拆成采样、定位、表征三道闸门:我亲手跑的脚本量出 resize 在模型看到图之前就丢掉 99% 像素的物理边界,再用 NaViT 到 FAVE 十余篇论文定位每条路线在修哪一道;重点是 2026 年的三篇论文如何反手拆掉「用图思考」的一半叙事——承重的是坐标文本,不是回传的像素。AILLM论文深读Transformer工程实践
2026年9月8日多轮 Agent 信用分配深读:奖励「给谁」是二阶问题,「覆盖多广」才是一阶深读 arXiv:2609.02417《Coverage, Not Targeting》:终态验证的多轮 Agent 里,验证器只暴露 k=1 步、成功却要 C=5–8 步硬前置链(V_d≈0.15);这时把奖励「对准关键步」是二阶的,把固定预算铺到覆盖全链才是一阶——shuffled 对照证明定向本身不带来收益,相位边界在 V_d*≈0.8。附我用 numpy 按附录 C 复现的两条扫描,和两笔能拿笔算完的账。AgentAgent 工程论文深读LLM模型训练
2026年9月8日Agent 记忆的前沿玩法:从存聊天记录,到主动寻找可用证据结合 Hindsight、EviMem、RLM、MemSkill、AgeMem 与最新隐式记忆评测,拆解有效的记忆和知识获取路线,附版本冲突小实验、成本复算与落地顺序。AILLMAgent记忆RAG论文深读评测
2026年9月8日CrewAI、LangGraph、AutoGen 怎么选:从角色分工到可恢复执行深读 Pickaxe 的框架对比,结合 ReAct、AutoGen、MetaGPT 与 MAST 论文,重新理解角色、状态图和对话协议。附 LangGraph 真实进程崩溃实验与上下文成本手算,解释检查点为什么不能单独保证外部动作只执行一次。AIAgent论文深读工程实践
2026年9月8日前沿大模型十家公司在押注什么:2026 年 9 月榜单与技术路线深挖按 Artificial Analysis v4.3 非估算成绩筛出十家模型开发者,核对正式文档、论文与开源交付,拆解长程 Agent、推理经济性、开放基础设施和世界模型四条路线,并附排名复核与成本复算。AILLMAgent论文深读评测
2026年9月8日两个模型之间只差一个旋转:把「隐藏状态直连」拆到根本本机实测:Qwen2.5-7B 读进一个 token 比写出一个便宜 26 倍,而它每个 token 的 KV cache 有 56 KiB,吐出的那个 token 只有 2.15 字节。这两个数字就是「让模型跳过文本、直接传隐藏状态」的全部动机。本文把这条路拆到根本:为什么表示空间的坐标系是任意的、为什么两个独立训练的模型之间的映射恰好是一个正交变换(附本机 Procrustes 实验:d 维旋转需要且只需要 d 对锚点)、桥能装在哪三个位置、以及连续通道会把人名和数字弄丢这个真实代价。顺带核实了 Mostik 那条 GLM→Qwen 新闻里哪几句站得住。AILLMAI Infra论文深读系统设计
2026年9月4日交付门禁 vs 评测系统:一对被反复混淆的角色,和一条「传感器/执行器」定律业界经常把「大模型评测系统」和「大模型交付门禁」当成一回事,结果就是评测跑通了却拦不住线上翻车,或者门禁很严却测不到关键翻车方式。本文把两者按角色分开:评测系统是传感器(持续量),交付门禁是执行器(一次决策)。用五篇 2026 年的 arXiv 论文(Automated Self-Testing 2603.15676、LLM Readiness Harness 2603.27355、Test Before You Deploy 2604.27789、Predicting LLM Safety Before Release 2607.07184、含 HELM 2211.09110 的坐标系)+ Google SRE 错误预算+决策地图系列前作,给出七维度对照表、四种失配病理、以及一条把两者接起来的「传感器/执行器阻抗匹配」定律。AILLM评测门禁AI Infra论文深读
2026年9月3日约束解码深读:把 mask 做到零开销之前,我们跨过了四道坎沿一条主线拆 constrained decoding / grammar-based sampling:所有算法都在实现同一个「可延伸性 oracle」,四代论文(Outlines / DOMINO / XGrammar / SGLang / GAD)各推进一关——token-字符错位、mask 成本、确定性片段的浪费、分布扭曲。附伪代码骨架、亲手实测 96.4% 的确定性 token 占比、以及一个手算完的分布扭曲例子。AILLMAI InfraLLM Serving论文深读
2026年9月3日Hermes 4 深读:一个把「拒绝率」当成产品规格来打的开源模型Nous Research 的 Hermes 4 在自家 RefusalBench 上打 57.1,同一张表 GPT-4o 17.67、Sonnet 4 是 17、GPT-5 是 11.34——这不是能力差,是产品哲学差。本文按 arXiv 2508.18255 技术报告逐节拆:base model 拼装(405B/70B 是 Llama 3.1、14B 是 Qwen3)、DataForge 图式合成数据、Atropos 千验证器拒绝采样、30K token 强制截断这一手漂亮的 length control、192 张 B200 训一次要多少钱。结尾接回昨天那篇 OpenRouter:Hermes 4 405B 全网只 1 家 provider——「意见型微调」不进入商品市场。AILLMAI Infra论文深读模型训练
2026年9月3日深读 OpenRouter:它不是一个聪明路由器,是一个开源模型推理的现货市场同一个 Llama 3.3 70B,OpenRouter 上挂着 13 家供应方,prompt 报价差 10.4×、量化精度混着 fp8/bf16/fp16。这不是路由问题,是市场问题。本文用亲手跑的 API 数据 + 7 篇 arXiv 论文把 OpenRouter 拆到根本约束:开源权重让推理商品化,边际买家要的是发现与切换、不是智能。围绕这条主线看 provider preference(拍卖)、Auto Router(Hayek 价格系统聚合)、BYOK 5% 抽成、per-provider sticky 缓存怎么各自落成市场机制,以及在闭源模型面前先崩在哪里。AILLMAI Infra论文深读系统设计