全部专题

Reading path

大模型论文精读

沿论文原文拆解模型结构、训练方法、评测与工程权衡,不追热点标题,追可复用的理解框架。

171 篇文章

Archive

专题归档

第 2 / 7 页

深读 OpenRouter:它不是一个聪明路由器,是一个开源模型推理的现货市场

同一个 Llama 3.3 70B,OpenRouter 上挂着 13 家供应方,prompt 报价差 10.4×、量化精度混着 fp8/bf16/fp16。这不是路由问题,是市场问题。本文用亲手跑的 API 数据 + 7 篇 arXiv 论文把 OpenRouter 拆到根本约束:开源权重让推理商品化,边际买家要的是发现与切换、不是智能。围绕这条主线看 provider preference(拍卖)、Auto Router(Hayek 价格系统聚合)、BYOK 5% 抽成、per-provider sticky 缓存怎么各自落成市场机制,以及在闭源模型面前先崩在哪里。

RouteLLM 深读:把「谁来做这题」压缩成一个胜率,就是所有 LLM 路由的钥匙

RouteLLM 论文最漂亮的一个数字:只需 14% 的 GPT-4 调用就能保住 95% 的 GPT-4 质量。这个数字背后是一整套可测量、可校准的路由体系。本文从「胜率预测」这条主线拆解四种路由器的算法差异、Chatbot Arena 偏好数据的稀疏性处理、PGR/APGR/CPT 三个校准指标,以及一次 completion 请求进入 openai_server 到最终转发给 strong/weak backend 的完整调用链。

别再把 harness 当实现细节:2026 年它被扶正成了一个必须申报的变量

ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。

会话内 RSI 深读:Agent 把哪个对象定义成可变的,决定它变强还是变废

ACE 论文的 AppWorld 日志里有一处最该被记住的数字:第 60 步上下文 18,282 token、准确率 66.7;第 61 步模型重写了一次自己的经验手册,上下文只剩 122 token,准确率掉到 57.1——比完全不自我改进的 63.7 还低。不重载、不动权重、人不介入的自我提升不是一个开关,它有三个决定生死的设计选择:可变对象的粒度、写入权归谁、验证信号从哪来。这篇结合 ACE、ReasoningBank、Gödel Agent、Darwin Gödel Machine、Training-Free GRPO 等论文的原文数字,把这三个选择拆开。

ENPIRE 深读:把自我改进循环搬上真机后,第一个坏掉的是 agent 自己

ENPIRE 让 Codex / Claude Code / Kimi Code 无人监督地把八台机器人训到 99% 成功率。但论文里最值钱的不是这个数字,而是一处失败:三个 agent 都在仿真里解出了 Push-T,真机上两个失败了。退化发生在 agent 的科研能力上,不在策略上——这意味着所有在确定性基底上测出的「自我改进能力」都可能被高估。

顶级模型"卖不动"是误读:Ramp 数据里同厂之间的信任积攒

深读 Simon Willison 2026-08-23 那篇转引 FT 报导 + Ramp AI index 的短博客。表面结论是"Anthropic 最贵的 Opus 5 只占同厂花费 3.5%,Opus 4.8 占 28%",但把家族聚合起来看,Opus 系仍占 40.8%——只是集中在上一代旗舰上。真正的信号不是"贵的没人要",是**用户在给"累积过工程投入的模型"投票**:老模型有 SDK、prompt 库、评测、KV 缓存、组织 runbook,新模型这一切都是 0。这是昨天那篇《合成前沿》里"10% 更差、100x 便宜"在市场端的第二个投影:同厂内也在验证同一条经济逻辑。

过程知识住在哪里?——Agent 编排的第四把交椅:编译进 8B 权重

既有的 Agent 工程决策地图有六个决策点,但都没回答一个问题:一条业务流程该住在哪里?代码里(LangGraph/CrewAI,29 万 star)、前沿模型的 system prompt 里(Anthropic Building Effective Agents 推荐)、外部技能库里(Voyager 风格)——都是把 procedure 摆在模型外面。arXiv 2605.22502 补上第四把椅子:用 Claude Sonnet 4.5 遍历流程图生成 3000–6000 条合成对话,对 Qwen3-8B 做全量微调(LoRA 明确失败),把流程编译进权重变成 subterranean agent。三个实测领域:旅游预订 14 节点、Zoom 支持 14 节点、保险理赔 55 节点 6 决策枢纽。结果:单次会话比 in-context 便宜 128–462×,比 LangGraph 便宜 77–249×;质量达 in-context 前沿的 87–98%;保险和旅游任务失败率反而比 LangGraph orchestrator 更低(9% vs 17%、5.5% vs 24%);重新编译 30–50 分钟就是一次 CI/CD。这篇把它接进 Agent 决策地图的第七个位置,解释为什么 8B 能打赢 Claude 4.5 + LangGraph,以及这条路为什么不是在反苦涩教训,反而是苦涩教训吃掉 orchestrator。

手把手把 5 节点流程编译进 0.5B 权重——Subterranean Agent 实操陪读篇

主篇给了 arXiv 2605.22502 的整套数字(128–462× 便宜、8B 打过 Claude 4.5 + LangGraph),但真正在 A100 上复现 8B 版本对读者门槛太高。这篇把管线缩到 8GB 消费级显存能跑的版本:5 节点日报归档流程 → 用 Claude Sonnet 4.5 合成 200 条对话(约 $1.70)→ Qwen2.5-0.5B 全量微调(bfloat16,~7GB 显存,M2 Pro 15 分钟)→ 对照 Claude API in-context。每一步给完整可跑代码、显存/时间/成本手算数字、以及一份 12 项自检清单。诚实标注:我没有实机跑完全流程,给出的数字是官方规格+手算估计,读者跑通请回来纠正。

10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次

深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。

多 Agent 的内存问题,其实是分布式系统的老问题换了张脸

一篇 2026 年 3 月的计算机体系结构立场论文,把多 Agent 系统的记忆管理拆成 I/O / Cache / Memory 三层,指出两个协议缺口(跨 Agent 缓存共享、结构化访问控制),并把核心难题钉在"内存一致性"上——这篇把它和本站已有的三篇"Agent=操作系统"文章接起来,看这个类比在哪里站得住、在哪里第一次真正碰壁。

Prime Agent 内幕:当 Agent 的唯一工具是一个 Python 解释器

基于 Prime Agent 主干源码 commit 965941c 的深读:默认工具列表里只有 ["ipython"]——读文件、改代码、开子代理、管记忆全是 Python 表达式。结合 RLM 论文(arXiv 2512.24601)与 Continual Harness 论文(arXiv 2605.09998),看"上下文变成变量、经验变成账本"这两步棋怎么在源码里落地:dill 快照、控制信道防死锁、只许 CRUD 的自我改进、以及 Factorio 里当场翻车的 reward hacking。

SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读

基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。

把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律

一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。

读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲

从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。

把指标写成条款:解剖一份单机高可用 ADR 的八个可靠性决定

上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。

SLO、RTO、RPO 到底在量什么:一条故障时间轴串起可靠性指标全家

读 LLM serving 论文撞见 SLO attainment,翻云合同撞见 99.9%,过容灾评审被问 RTO/RPO——三套黑话其实是同一条故障时间轴上的三族刻度。本篇按权威出处(Google SRE 书第 4 章、SRE Workbook 第 5 章、NIST SP 800-34 Rev.1、AWS 容灾白皮书)把指标全家理成三层:承诺层(SLI→SLO→SLA→错误预算→燃烧率,几个 9 换算表亲手验算)、事故层(MTTD/MTTA/MTTR/MTBF/MTTF,含 MTTR 四义歧义警告)、灾难层(RPO 往回量数据、RTO 往前量停机、MTD=RTO+WRT,AWS 四档 DR 策略即公开价目表);再给三族的咬合关系:可用性=MTBF/(MTBF+MTTR) 把事故层折算成承诺层,错误预算是承诺层发给事故层的月度零花钱,BIA 从业务侧倒推 MTD/RTO。LLM 工程挂靠:DistServe 的 goodput 把 SLO 从事后验收变成调度器输入(TTFT/TPOT 双 SLO),训练 checkpoint 间隔就是训练作业的 RPO。元规律「指标即定价」:可靠性指标不是测量工具是谈判工具——SLO 每加一个 9 预算缩十倍,RTO/RPO 每压一个数量级架构贵一档,所有刻度都是业务给不可靠性开出的价格标签。

澄清正在长出界面:当 Agent 递给你一张网页

用 superpowers 工作流时,Claude Code 会起一个本地页面让你点选确认细节——这不是插件作者的小聪明。同一个动作正在四层同时发生:工具层(AskUserQuestion)、协议层(MCP elicitation → MCP Apps → AG-UI)、生成层(Google Generative UI)、研究层(五篇澄清策略 arXiv)。本文给出第一性解释(界面化打的是人的应答成本,不是 agent 的提问能力)、收敛度判断和三个预见,收束成一条「确认带宽定律」。

Agent 正在长成一朵云:从八个岗位地图到未来架构的压缩重演预测

姊妹篇:上一篇把主 Agent 推理循环拆成八个被专训小模型接管的岗位,这一篇把岗位表贴到云架构图上,发现 Agent 架构正在压缩重演云计算二十年的演化史。四层证据链逐层判收敛:组件层(BAIR 复合 AI 系统宣言→NVIDIA 异构编制)、内核层(AIOS 的 agent syscall、Parrot 的 Semantic Variable、Mooncake 的 P/D 分离)、运行时层(AWS AgentCore/Azure Foundry/Google Agent Engine 六个月内先后 GA,microVM 隔离 + serverless 计费)、协议层(MCP 管南北向、A2A 捐入 Linux 基金会管东西向)。给出三条置信度分级预测(控制面/数据面成为 Agent 默认词汇;模型从架构图中消失变成实例类型;评测成为 Agent 云的类型系统),并收束成一条元规律:抽象复用使演化压缩——后发领域直接借用先行领域付清过发明成本的抽象词汇表,把二十年走成三年。