全部专题

Reading path

大模型论文精读

沿论文原文拆解模型结构、训练方法、评测与工程权衡,不追热点标题,追可复用的理解框架。

171 篇文章

Archive

专题归档

第 3 / 7 页

主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位

把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。

一把 Key 背后:AI 网关到底替你收编了后端栈的哪几层

LiteLLM 首页说 "Put your full AI stack behind one key"——这句广告词里的 AI stack 到底指什么?本篇按一次请求的生命周期把网关解剖成六层:协议归一(沙漏模型的窄腰)、身份与预算(virtual key 的凭证间接层)、路由与回退(FrugalGPT 级联 + RouteLLM 偏好路由 + Tail at Scale 对冲)、缓存(GPTCache 语义缓存 vs Prompt Cache 的 KV 缓存分界)、可观测(AgentOps taxonomy + OTel GenAI 语义约定)、防护与治理(Llama Guard + NeMo Guardrails)。每层四段式:根本问题→源头论文→网关落地→收敛度。收束成一条元规律:元数据分界定律——决策输入只需请求级元数据的横切层被网关吸收,需要碰权重/logits/KV 的能力沉入推理引擎;一把 key 买到的只是上半栈。

刷到的微软论文是真的吗?——FastContext:AI 写代码最贵的一步,和一篇只活了 18 天的论文

从一条短视频出发的事实核查与论文深读:微软 FastContext(arXiv 2606.14066)确有其文——用 4B 小模型专管代码库探索,主代理省 26–60% token、难题解决率 +5.5 分——但它 6 月 12 日提交、6 月 30 日就以「产品 IP」为由撤稿删库。结合 CodeScout、SWE-grep、SWE-Pruner、Agentless、LocAgent,把「代码库探索该由谁来做」这个决策点的四条路线摆上桌:撤稿本身,就是这个方向商业价值最响亮的注脚。

SFT 是解锁器,不是灌装机:从 FLAN 到 LIMO,重新认识监督微调

把 2021–2025 年关于监督微调的十一篇关键论文串成一条线索:SFT 用的还是预训练那个交叉熵,它几乎教不会模型新知识——1000 条样本就能对齐(LIMA)、改变的主要是风格 token(URIAL)、硬灌新知识反而教出幻觉(EMNLP 2024)。SFT 的真正身份是解锁器:把预训练已有的能力接上开关。文末给出工程速查表和一个本地就能跑的验证实验。

Agent 时代的工程学·门禁篇:六道闸门,和一条「不可逆边界」定律

决策地图系列第六篇:体系化地做 AI Gates 门禁。先给出第一性分解——门禁 = 判定器 × 执法点,判定器全是评测的蒸馏、执法点应设在不可逆性跃迁的边界上;再沿 AI 系统生命周期排出六道闸门(输入、输出、行动、合入、发布、熔断),每道闸配源头论文与技术代表:Llama Guard、Constitutional Classifiers、NeMo Guardrails、ToolEmu、Progent、Meta TestGen-LLM、promptfoo/Braintrust、Preparedness Framework/RSP、Circuit Breakers。附一张可复用的门禁设计表和四步落地路线。

Agent 时代的工程学·评测路由篇:六个决策点,和一条「路由器是评测器的蒸馏」定律

决策地图系列第五篇:做 AI Eval 的团队怎么把评测策略下发给 LLM Router?把这条链路拆成六个决策点(信号源、学习目标、路由时机、成本旋钮、路由器验收、闭环与泛化),用「论文→产品」传导链判收敛:Chatbot Arena→RouteLLM→P2L 的 Berkeley 系、MSR Hybrid LLM→Azure Model Router 的微软系、eval 数据→定制路由器的 Not Diamond 系。得到一条新定律:路由器是评测器的在线蒸馏——评测信号有多保真、多便宜,路由就有多强、收敛多快。附四阶段落地路线图。

帕累托的两副面孔:LLM 工程里的 80/20 杠杆,和「无法白嫖」的取舍前沿

一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。

Agent 写码、Agent 测码:「人力真空」的真名,叫「独立验证真空」

如果代码由 agent 写、测试也由 agent 生成,人退出验证环节会不会导致线上故障?本文用九个可核实的来源回答:会,但根因不是「人少了」,而是「独立验证信号少了」。写与测同源时,测试从独立证据退化为自我确认;对冲方案不是把人塞回原位,而是重构验证信号图——这个问题 1983 年就被预言过一次。

Agent 时代的工程学·测试篇:六个决策点,和一条「Oracle 梯度」定律

决策地图系列第四篇:测试团队被 Agent 时代冲击两次——工具 agent 化、被测对象也 agent 化。把测试拆成六个决策点(测试生成、杀伤力度量、E2E agent 化、fuzzing 算力化、确定性模拟、agent evals),用同一套「论文→产品」传导链判收敛,得到一条新定律:一个测试环节被机器接管的速度,等于它的判定标准(oracle)能被形式化的程度。测试团队的转变,就是沿这条梯度上移。

Agent 时代的工程学·计算层篇:六个决策点,和一条「接口冻结」定律

决策地图系列第三篇,钻到最底层:kernel、数值精度、并行策略、解码加速、稀疏架构、RL 训练系统。用同一套「论文→产品」传导链判收敛,并用一个反例修正上一篇的物理-社会梯度:计算层全是物理问题,却仍有不收敛的角落——因为收敛的真正前提不是"离物理近",而是"上游接口已冻结"。

Agent 部署架构全景:五种宿主形态、两条横切层,和背后同一个冲突

云基础设施默认计算是短时、无状态、可信、调用图静态的——Agent 把四个假设同时打破。本文结合 AIOS、Parrot、Autellix、部署综述(arXiv:2412.13437)等论文,把当前 Agent 部署方式整理成"五种宿主形态 + 两条横切层"的分层地图:进程内嵌入、沙箱化执行、托管运行时、Agent OS、端侧协同,以及 serving 调度层与 MCP/A2A 互联层,并给出选型决策表。

深度解读 Anthropic 内容安全策略:一份宪法的五次编译

从 Usage Policy 到 Claude 宪法、Constitutional AI 训练、Constitutional Classifiers 运行时防御、RSP/ASL 升级协议,再到 Clio 遥测闭环——Anthropic 的内容安全不是一份禁止清单,而是把同一份自然语言规约"编译"到系统五个层次的纵深栈。这篇结合官方文档与四篇 arXiv 论文拆它的第一性原理:为什么规则要写给模型自己读、安全如何被标上价格(拒答率 + 推理开销)、以及"让 AI 监督 AI"这个赌注的收益与脆弱处。

一页 API 文档的考古学:八个"进阶功能",三条论文谱系

某大模型平台的"进阶使用"页列了八个功能:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。看起来是产品经理排的功能清单,其实是一张考古地图——每个卡片下面都埋着一条"论文→系统→产品"的谱系。本文把八个功能归并成三条:给稀缺资源定价(KV Cache 经济学)、把世界变成 token(表示的进出口)、闭合反馈环(从会说到会做),每条配已核实的 arXiv 论文链,结尾给一套看任何 API 新功能都能用的三问。

听懂了 R1 却不踏实?陪读篇:把"思考"兑换成代码、张量形状和手算数字

上一篇 R1 解剖文的实现层陪读。R1 的全部"神秘"只由两个循环构成:推理时的采样循环和训练时的 GRPO 循环。这篇把每个抽象名词兑换成具体的东西:chat template 的真实字符串、温度 0.6 改的是哪个数组、一条 32k 思考链的 2.3GB 显存账单、奖励函数的十几行正则、G=4 的优势手算、KL 惩罚的两个数值——读完你能用纸笔把一次推理和一次训练更新走一遍。

思考深度参数解剖:你调的不是智力,是串行计算的租借额度

reasoning_effort、budget_tokens、thinkingBudget——每家大模型 API 都有一个"思考深度"旋钮,但它到底控制内核的什么?结合表达力理论(CoT 扩展固定深度 Transformer 的计算类)、s1 预算强制、L1 长度条件 RL、gpt-oss 的一行提示词实现和激活空间的"思考速度"方向,把这个参数从外壳拆到内核:它不改权重不加层,只控制模型租借多少串行计算步数。