2026年9月2日Fable 5.1 的数据增长在说什么:单轮推理见顶,长程智能体接棒从 Fable 5.1 各基准的提升分布看大模型最新趋势:单轮推理接近饱和、长程智能体接棒、推理成本成为竞争轴,结合 arxiv 论文佐证四条主线。AILLMAgent论文深读评测
2026年9月2日RouteLLM 深读:把「谁来做这题」压缩成一个胜率,就是所有 LLM 路由的钥匙RouteLLM 论文最漂亮的一个数字:只需 14% 的 GPT-4 调用就能保住 95% 的 GPT-4 质量。这个数字背后是一整套可测量、可校准的路由体系。本文从「胜率预测」这条主线拆解四种路由器的算法差异、Chatbot Arena 偏好数据的稀疏性处理、PGR/APGR/CPT 三个校准指标,以及一次 completion 请求进入 openai_server 到最终转发给 strong/weak backend 的完整调用链。AILLM论文深读LLM Serving系统设计
2026年9月1日别再把 harness 当实现细节:2026 年它被扶正成了一个必须申报的变量ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。AILLMAgentAgent 工程论文深读评测
2026年9月1日会话内 RSI 深读:Agent 把哪个对象定义成可变的,决定它变强还是变废ACE 论文的 AppWorld 日志里有一处最该被记住的数字:第 60 步上下文 18,282 token、准确率 66.7;第 61 步模型重写了一次自己的经验手册,上下文只剩 122 token,准确率掉到 57.1——比完全不自我改进的 63.7 还低。不重载、不动权重、人不介入的自我提升不是一个开关,它有三个决定生死的设计选择:可变对象的粒度、写入权归谁、验证信号从哪来。这篇结合 ACE、ReasoningBank、Gödel Agent、Darwin Gödel Machine、Training-Free GRPO 等论文的原文数字,把这三个选择拆开。AILLMAgent上下文工程论文深读
2026年9月1日ENPIRE 深读:把自我改进循环搬上真机后,第一个坏掉的是 agent 自己ENPIRE 让 Codex / Claude Code / Kimi Code 无人监督地把八台机器人训到 99% 成功率。但论文里最值钱的不是这个数字,而是一处失败:三个 agent 都在仿真里解出了 Push-T,真机上两个失败了。退化发生在 agent 的科研能力上,不在策略上——这意味着所有在确定性基底上测出的「自我改进能力」都可能被高估。AILLMAgentAgent 工程论文深读
2026年8月27日自回归不是物理定律:扩散语言模型买到了什么,亏在哪里从左往右生成不是语言的性质,而是一个可以被换掉的建模选择。这篇把投机解码与扩散语言模型放进同一个框架,手算清楚扩散省下的步数是从哪儿借的,再用 Gemini Diffusion 官方评测表验证这笔账。AILLM论文深读
2026年8月26日什么是一个好的评测样本?不是一道难题,而是一份决策证据结合 ECBD、CheckList、Dynabench、SWE-bench 与 LiveBench,建立一套判断 LLM/Agent 评测样本是否有效、可判、可复现、能区分且不过期的工程框架。AILLM评测AgentAI Infra论文深读
2026年8月24日harness 会被模型吃掉:attention-interface 与 agent 演化的两条曲线深读 Latent Space 2026-08-22 那篇《The Evolution of the Agent Harness》。Dan McAteer 用一张"模型能力曲线 × harness 需求曲线"的几何图,把 2022 年 ReAct 到 2025 年 Claude Code 的四段演化串起来,并给出一个我认为值得记住的赌注:随着 harness 能力被 RL 吸收进权重、被工程师从提示词里删除,剩下的会是一层「模型给人套上的挽具」——attention-interface。这篇不做摘要,做消化:把文章的核心几何、数字锚点、可疑点、以及和本站已有 harness 谱系的对接,全部拆到能被下一篇引用的粒度。AILLMAgentAgent 工程论文深读
2026年8月24日过程知识住在哪里?——Agent 编排的第四把交椅:编译进 8B 权重既有的 Agent 工程决策地图有六个决策点,但都没回答一个问题:一条业务流程该住在哪里?代码里(LangGraph/CrewAI,29 万 star)、前沿模型的 system prompt 里(Anthropic Building Effective Agents 推荐)、外部技能库里(Voyager 风格)——都是把 procedure 摆在模型外面。arXiv 2605.22502 补上第四把椅子:用 Claude Sonnet 4.5 遍历流程图生成 3000–6000 条合成对话,对 Qwen3-8B 做全量微调(LoRA 明确失败),把流程编译进权重变成 subterranean agent。三个实测领域:旅游预订 14 节点、Zoom 支持 14 节点、保险理赔 55 节点 6 决策枢纽。结果:单次会话比 in-context 便宜 128–462×,比 LangGraph 便宜 77–249×;质量达 in-context 前沿的 87–98%;保险和旅游任务失败率反而比 LangGraph orchestrator 更低(9% vs 17%、5.5% vs 24%);重新编译 30–50 分钟就是一次 CI/CD。这篇把它接进 Agent 决策地图的第七个位置,解释为什么 8B 能打赢 Claude 4.5 + LangGraph,以及这条路为什么不是在反苦涩教训,反而是苦涩教训吃掉 orchestrator。AILLMAgentAgent 工程论文深读
2026年8月24日10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。AILLMAI Infra评测论文深读
2026年8月17日多 Agent 的内存问题,其实是分布式系统的老问题换了张脸一篇 2026 年 3 月的计算机体系结构立场论文,把多 Agent 系统的记忆管理拆成 I/O / Cache / Memory 三层,指出两个协议缺口(跨 Agent 缓存共享、结构化访问控制),并把核心难题钉在"内存一致性"上——这篇把它和本站已有的三篇"Agent=操作系统"文章接起来,看这个类比在哪里站得住、在哪里第一次真正碰壁。Agent 工程记忆系统设计论文深读
2026年8月17日Physics of Language Models Part 4.1: Canon Layers 的本质是什么Zeyuan Allen-Zhu 证明了什么被错误地留给了注意力机制,以及如何用轻量级的局部混合打败看似更强大的全局机制论文深读TransformerAI InfraLLM
2026年8月14日DeepSeek Harness 开源了什么:连 Agent Loop 都能拔的插件系统,和给它撑腰的一篇论文DeepSeek 于 2026-08-13 以 MIT 协议开源 agent harness「dsh」。深读其架构(turn/step 事件模型、会话日志唯一事实源、能力接缝、profile 配置分层)与理论底座 Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》:可撤销效应 + 反应式余效应 + 合流定理,把「热替换插件不炸」从工程纪律升格为数学性质。附与 SWE-agent、Claude Code、Prime Agent 的谱系对照。AILLMAgent论文深读
2026年8月12日Agent 不是黑箱,只是少了一台行车记录仪:从 AgentOps 到可诊断智能体结合 AgentOps、Agent 设计模式、MAST、GRADE 与 AgentDebugX 五项研究,解释为什么 Agent 可观测性不能停在 Token、延迟和调用日志,以及如何把目标、计划、工具、依赖、评估和护栏组织成可诊断、可恢复的证据链。AILLMAgent论文深读
2026年8月12日安全策略不是一串 if:Llama Guard 如何把政策变成可编程门卫深读 Llama Guard:它如何把自然语言安全政策、对话角色和生成式分类统一成输入输出双向门禁;拆解 13,997 条数据、反事实式增强、AUPRC 实验、策略迁移,以及生产落地时不能忽略的阈值、注入和权限边界。AILLMAI 安全论文深读
2026年8月11日把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。AILLM评测AI Infra论文深读
2026年8月11日Wilson 下界和它的全家:评测分数的统计地基——分数不是数,是分布评测报告里"5/5 全对"的 95% 置信下界只有 56.6%。以 Wilson 下界为入口,把评测分数背后的整套统计生词(置信区间、配对检验、多重比较、判分者一致性、pass@k 无偏估计、功效分析)钉成四道关卡和一张生词总表,让你以后见到这类词不再发怵。AILLM评测论文深读
2026年8月11日业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。AILLM评测AI Infra论文深读
2026年8月11日读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。AILLMAI Infra论文深读
2026年8月11日把指标写成条款:解剖一份单机高可用 ADR 的八个可靠性决定上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。AI InfraLLM论文深读
2026年8月10日Agent 正在长成一朵云:从八个岗位地图到未来架构的压缩重演预测姊妹篇:上一篇把主 Agent 推理循环拆成八个被专训小模型接管的岗位,这一篇把岗位表贴到云架构图上,发现 Agent 架构正在压缩重演云计算二十年的演化史。四层证据链逐层判收敛:组件层(BAIR 复合 AI 系统宣言→NVIDIA 异构编制)、内核层(AIOS 的 agent syscall、Parrot 的 Semantic Variable、Mooncake 的 P/D 分离)、运行时层(AWS AgentCore/Azure Foundry/Google Agent Engine 六个月内先后 GA,microVM 隔离 + serverless 计费)、协议层(MCP 管南北向、A2A 捐入 Linux 基金会管东西向)。给出三条置信度分级预测(控制面/数据面成为 Agent 默认词汇;模型从架构图中消失变成实例类型;评测成为 Agent 云的类型系统),并收束成一条元规律:抽象复用使演化压缩——后发领域直接借用先行领域付清过发明成本的抽象词汇表,把二十年走成三年。AILLMAgentAI InfraMCP论文深读
2026年8月10日主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。AILLMAgentAI 安全论文深读
2026年8月10日一把 Key 背后:AI 网关到底替你收编了后端栈的哪几层LiteLLM 首页说 "Put your full AI stack behind one key"——这句广告词里的 AI stack 到底指什么?本篇按一次请求的生命周期把网关解剖成六层:协议归一(沙漏模型的窄腰)、身份与预算(virtual key 的凭证间接层)、路由与回退(FrugalGPT 级联 + RouteLLM 偏好路由 + Tail at Scale 对冲)、缓存(GPTCache 语义缓存 vs Prompt Cache 的 KV 缓存分界)、可观测(AgentOps taxonomy + OTel GenAI 语义约定)、防护与治理(Llama Guard + NeMo Guardrails)。每层四段式:根本问题→源头论文→网关落地→收敛度。收束成一条元规律:元数据分界定律——决策输入只需请求级元数据的横切层被网关吸收,需要碰权重/logits/KV 的能力沉入推理引擎;一把 key 买到的只是上半栈。AILLMAI Infra论文深读
2026年8月8日刷到的微软论文是真的吗?——FastContext:AI 写代码最贵的一步,和一篇只活了 18 天的论文从一条短视频出发的事实核查与论文深读:微软 FastContext(arXiv 2606.14066)确有其文——用 4B 小模型专管代码库探索,主代理省 26–60% token、难题解决率 +5.5 分——但它 6 月 12 日提交、6 月 30 日就以「产品 IP」为由撤稿删库。结合 CodeScout、SWE-grep、SWE-Pruner、Agentless、LocAgent,把「代码库探索该由谁来做」这个决策点的四条路线摆上桌:撤稿本身,就是这个方向商业价值最响亮的注脚。AILLM上下文工程论文深读