你以为付钱雇的是一位全能大师傅,实际到场的是一支施工队。上次我们在《主模型明明是 Fable 5,账单里为什么冒出 Haiku 4.5?》里从账单倒查出三层「小模型替大模型干活」的机制——应用层分派、服务层路由、解码层投机。这篇把镜头拉远:沿着主 Agent 一次推理循环的完整时间轴,把每一个正在被专向训练小模型接管的岗位逐站点名,每个岗位配上源头论文和生产落地证据。看完你会得到一张岗位地图,和一条判断「哪些岗位守得住、哪些迟早被大模型收回」的定律。
先接住那个最大的反问:这不是在跟苦涩教训对着干吗?
Sutton 的苦涩教训说通用方法加算力终将碾压人工巧劲。那给每个子任务训一个专用小模型,不正是苦涩教训点名要淘汰的「巧劲」吗?
NVIDIA 2025 年的立场论文《Small Language Models are the Future of Agentic AI》(arXiv 2506.02153)给了这个问题一个经济学答案。它观察到:Agent 工作负载的本质不是开放对话,而是少数几种专门任务的高频重复——格式受限、输入分布窄、变化很小。用一个为「任何问题」训练的通用大模型去跑「同一个问题的第一万次变体」,通用性本身就成了纯开销。论文估算 SLM(他们的工作定义:能跑在消费级设备上、单用户延迟可接受的模型)在这类调用上比 LLM 便宜 10–30 倍,并主张异构 Agent 系统——一个 Agent 内部调用多个不同量级的模型——是自然终局。
但注意两件事,它们让「专岗小模型」和苦涩教训不矛盾:
- 这些小模型自己就是大模型的产物。训练数据靠大模型合成(下文 Cursor 用 GPT-4 造数据、xLAM 用 APIGen 管线、Math-Shepherd 用补全采样自动标注),能力靠从大模型蒸馏——我在《训练小模型的三条路》里数过:2026 年每个能打的小模型身后,都站着一个大模型。专岗化不是对抗 scaling,是 scaling 的下游分发形态。
- 岗位是流动的。大模型通用能力每上一个台阶,就会「收回」一批只靠能力差立足的岗位(文末誊写员就是被收回的实例)。所以这张地图不是静态编制表,是一场拉锯战的即时战况。
NVIDIA 论文还给出了岗位化的操作路径,他们叫数据飞轮:记录 Agent 的真实调用 → 按工具/任务聚类 → 对每个聚类微调一个专岗 SLM → 替换该岗位的大模型调用 → 继续记录。这个飞轮能不能转起来,就是判断一个岗位会不会被小模型拿走的第一判据(文末展开)。
一次推理循环的岗位地图
先上图。主模型(图中菱形)仍然负责「想」,但一条请求从进门到出门,两侧站满了专岗小模型:
flowchart TB
Q[用户请求] --> R["路由员<br>这题谁来答"]
R --> G1["安检员·入口<br>提示能不能进"]
G1 --> C["精简师<br>上下文先减肥"]
C --> M{{"主模型推理"}}
D["打字员<br>投机草稿"] -.逐 token 加速.- M
M --> V["质检员<br>过程逐步打分"]
V -->|不合格重采样| M
V --> A{行动类型}
A -->|调 API| T["翻译员<br>意图到函数调用"]
A -->|操作屏幕| U["指路员<br>指令到像素坐标"]
A -->|改代码| P["誊写员<br>意图 diff 落盘"]
A -->|直接作答| O[候选输出]
T --> O
U --> O
P --> O
O --> G2["安检员·出口<br>输出能不能出"]
G2 --> J["裁判员<br>质量评分回流"]
J --> Ans["交付用户 + 喂数据飞轮"]
在逐站展开前,先致敬一个史前岗位:检索员。向量召回和交叉编码重排从来就不是主模型亲自干的——BERT 量级的双塔编码器和 reranker 接管这个岗位太久了,久到没人记得这也算「小模型替大模型干活」。它证明这个趋势不是新鲜事,只是正在从检索一个点蔓延到整条流水线。
下面每个岗位按验证过的四段式走:根本问题 → 源头论文 → 产品落地 → 收敛度。
岗位一 · 路由员:这道题配谁答
根本问题:请求还没碰到主模型之前,就得有人决定「这题值不值得动用旗舰」。这个决定发生在主模型运行之前——主模型没法参与一个「它还没被选中」的决策,所以这个岗位天然属于一个前置的轻量预测器。
源头论文:RouteLLM(arXiv 2406.18665,ICLR 2025)。用 Chatbot Arena 的 8 万场人类偏好对战训练路由器,预测「强模型赢过弱模型的概率」,配成本阈值转成路由决定。关键是看它的路由器本体:matrix factorization、BERT 分类器这个量级——相对被路由的模型近乎免费。结果:质量不降、成本降超过 2 倍(最高 3.66 倍),且换掉强弱模型对之后路由器依然工作。我之前逐节拆过这篇论文。
产品落地:GPT-5 的实时路由器、Azure Model Router、Not Diamond——评测路由篇里已经排过这三家的证据链,此处不重复。
收敛度:✅ 已收敛。「请求前一跳、轻量预测器」是各家共同答案;那篇文章的定律在这里复述一遍就够——路由器是评测器的在线蒸馏。
岗位二 · 安检员:入口出口各站一个
根本问题:主模型的输入和输出都要过安检,而安检员不能是主模型自己——被越狱的模型不能负责判定自己有没有被越狱。裁判必须独立于运动员,这是结构性要求,不是能力问题。外加一条经济约束:每条消息都要过检,安检必须便宜。
源头论文:Llama Guard(arXiv 2312.06674,Meta)是这个岗位的定岗文件:拿 Llama2-7B 指令微调成一个输入/输出双向的安全分类器,带可定制的风险分类法。它的演化方向就是「岗位越来越小」:Llama Guard 3 随 Llama 3.1 发布(14 类风险、8 语言),后续甚至出了 1B-INT4 的压缩版(arXiv 2411.17713),专为端侧部署。Google 的 ShieldGemma(arXiv 2407.21772)同理:基于 Gemma 2 的 2B/9B/27B 分类器,按请求附带的安全准则做判定。
产品落地:Meta 和 Google 都把安检员做成了随主模型发布的配套件——旗舰模型发布时附赠同代护栏小模型,这个发布惯例本身就是收敛的证据。
收敛度:✅ 已收敛。独立小分类器做双向安检是行业默认架构。这个岗位与门禁篇的「不可逆边界」定律咬合:安检站的位置恰好设在 token 流出/流入系统边界这两个不可逆跃迁点上。
岗位三 · 精简师:喂进去之前先减肥
根本问题:上下文按 token 计费、按 token 变慢,但上下文里大部分 token 对答案没贡献。谁来在主模型看到之前把水分挤掉?
源头论文:LLMLingua(arXiv 2310.05736,EMNLP 2023,微软)用一个小语言模型(GPT-2 或 LLaMA-7B 量级)逐 token 算困惑度,删掉低信息量 token,最高 20 倍压缩下任务性能只降约 1.5 个点。LLMLingua-2(arXiv 2403.12968,ACL 2024 Findings)把岗位工资进一步砍到编码器量级:从 GPT-4 蒸馏出「该 token 留不留」的标注数据,训一个 XLM-RoBERTa-large 的 token 二分类器做压缩,比初代快 3–6 倍,端到端延迟在 2–5 倍压缩率下降低 1.6–2.9 倍。
产品落地:微软开源了全套 LLMLingua 工具链,LangChain/LlamaIndex 生态有集成。但没有哪家主流推理服务把它做成默认开关。
收敛度:⚠️ 方法成立,岗位护城河在变薄。原因是两股回收力:长上下文越来越便宜,前缀缓存让重复上下文几乎免费。压缩省下的钱在缩水,而压缩引入的信息损失风险不变。我的判断(观点):这个岗位会退守到「上下文超长且不可缓存」的窄场景。
岗位四 · 打字员:主模型思考,小模型打字
根本问题:自回归生成一次只出一个 token,大模型每个 token 都要过一遍全部权重。能不能让便宜的手先打字、贵的脑子只做批改?
源头论文:Leviathan 等的投机解码(arXiv 2211.17192,ICML 2023 Oral)给出数学保证:小草稿模型先猜若干 token,大模型一次并行验证,接受规则保证输出分布与大模型独立生成完全一致——无损加速,T5-XXL 上 2–3 倍。这个岗位后来发生了有趣的「编制改革」:EAGLE 系列(arXiv 2401.15077 / 2406.16858 / 2503.01840)发现草稿不需要一个独立小模型,一层挂在主模型隐状态上的草稿头就够——岗位还在,独立员工没了,变成了主模型的一只「快手」。
产品落地:vLLM 内建 EAGLE 草稿模型支持,2026 年 5 月 EAGLE 团队与 vLLM 联合发布了 EAGLE 3.1。这是全地图上唯一对用户完全隐形的岗位——你感知不到它存在,只感知到快。
收敛度:✅ 已收敛,且永远不会被回收。原因是数学结构:草稿的意义就在于比验证者便宜,主模型不可能收回这个岗位——收回等于没有加速。这个岗位的第二本账(长上下文下瓶颈从权重转移到 KV Cache)我在投机解码的第二本账里算过。
岗位五 · 质检员:过程打分与结果评审两个工位
根本问题:主模型推理多步时,错一步就全错。谁来给每一步打分(过程质检),谁来给最终答案评级(结果评审)?让主模型自查有系统性偏差——自我评估偏爱自己的输出,所以这个岗位同样有独立性的结构要求。
源头论文(过程工位):Math-Shepherd(arXiv 2312.08935,ACL 2024,北大 + DeepSeek)解决了这个岗位的招工难题——过程标注太贵。它的办法:从每个中间步骤出发采样多条补全,用「这一步最终走到正确答案的比例」自动生成步骤分——不用人标。训出的过程奖励模型(PRM)做 Best-of-N 重排,帮 DeepSeek-67B 把 GSM8K 推到 93.3%、MATH 48.1%。Qwen2.5-Math-PRM(arXiv 2501.07301)把工位能力钉得更死:7B 的专岗 PRM 在 ProcessBench 找错任务上超过 GPT-4o-0806(与 o1-mini 仍有差距)——质检这个单项上,专训 7B 赢了通用旗舰。
源头论文(结果工位):Prometheus 2(arXiv 2405.01535,EMNLP 2024),动机直白:拿 GPT-4 当裁判太贵、不透明、不可控。基于 Mistral-7B/Mixtral-8x7B 训专职评审模型,统一直接打分和成对比较两种裁决形式,支持自定义评分准则,与人类及 GPT-4 判决高度一致。
产品落地:Qwen 公开发布了 PRM 权重(7B/72B);评审工位上,多数生产评测管线仍默认用旗舰模型当裁判(LLM-as-judge 的三种偏差照单全收)。
收敛度:⚠️ 数学域已验证,通用域未定。过程打分在可自动验证的域(数学、代码)收敛,开放域的过程标签从哪来仍是开放问题——这正是测试篇「Oracle 梯度定律」的又一次显形:判定标准能形式化的地方,岗位先被小模型拿走。
岗位六 · 翻译员:把意图翻译成函数调用
根本问题:Agent 的「手」是工具调用——把自然语言意图翻译成严格 schema 的 JSON。这是全流水线上分布最窄、格式最受限的任务,恰好是 NVIDIA 论文点名「用通用大模型是浪费」的典型岗位。
源头论文:Gorilla(arXiv 2305.15334,NeurIPS 2024,Berkeley)是定岗文件:检索感知微调的 LLaMA-7B,在 API 调用生成上超过 GPT-4,显著减少参数幻觉。Salesforce 的 xLAM(arXiv 2409.03215)配合 APIGen 合成数据管线(arXiv 2406.18518)把量级推到极限:xLAM-1b-fc-r 以 1.3B 的身板在 Berkeley Function-Calling Leaderboard 拿到 78.94%,按模型卡说法超过 GPT-3.5-Turbo 和一众更大的模型;7B 版 88.24%,当时榜上第三。2026 年的 Terminus-4B(arXiv 2605.03195)把这个岗位扩展到「子代理」编制:SFT+RL 后训练的 Qwen3-4B 专职承担终端执行子任务,服务于「主 Agent 保持上下文干净、窄职责外包给小模型子代理」的架构。
产品落地:矛盾的证据。开源专岗模型在榜单上确实能打;但生产 Agent 的工具调用大多仍由主模型顺手完成——因为 function calling 已经被旗舰模型内化成了 API 原生能力。专岗翻译员的现实买家是私有化部署和端侧场景。
收敛度:⚠️ 能力已证明,岗位归属未定。这是「能力位岗位」的典型:小模型赢在成本,但主模型顺手做的够好时,多雇一个人的架构复杂度就成了负资产。它最终守住的可能不是「翻译得更好」,而是「在你的机房里翻译」。
岗位七 · 指路员:屏幕上哪个点是那个按钮
根本问题:GUI Agent 要把「点击提交按钮」翻译成像素坐标。规划(下一步做什么)和落点(坐标在哪)是两种能力:前者要世界知识,后者要的是对截图的密集视觉对齐——后者恰好是通用大模型的弱项、专训小模型的主场。
源头论文:UGround(arXiv 2410.05243,ICLR 2025 Oral,OSU)提出「规划-落点解耦」:大模型只负责说「点哪个语义元素」,专训的视觉落点模型(基于 Qwen2-VL 的 2B/7B/72B)输出像素坐标,比既有落点模型最高提升 20 个百分点(绝对值)。OS-Atlas(arXiv 2410.23218,ICLR 2025,上海 AI Lab 等)用 1300 万 GUI 元素的跨平台语料训 4B/7B 落点基座,作为可插拔模块:OSWorld 上 GPT-4o 换上 OS-Atlas 做落点,显著超过 SeeClick 和 Set-of-Mark 方案。
产品落地:开源 GUI Agent 框架普遍采用「大模型规划 + 小模型落点」双件套;反例同样重要——Anthropic 的 computer use 走端到端路线,主模型直接输出坐标。两条路线还在对赌。
收敛度:⚠️ 学术侧已收敛,工业侧两条路线并行。这也是能力位岗位:多模态主模型的坐标能力每提升一次,解耦架构的必要性就下降一分。我猜测(标注:猜想)它的终局类似翻译员——公有云被主模型内化,开源和端侧长期保留专岗。
岗位八 · 誊写员:一个已经被回收的岗位
根本问题:编程 Agent 的主模型输出「改动意图」,谁来把意图准确写进几百行的原文件?让旗舰全文重写太慢太贵,于是出现了专职誊写员。
源头证据(这个岗位没有论文,是纯产品驱动):Cursor 的工程博客 Editing Files at 1000 Tokens per Second 记录了岗位的巅峰:微调 Llama-3-70B 做「fast apply」,配合投机编辑(speculative edits——代码编辑场景连草稿模型都不用,原文件本身就是草稿),达到约 1000 token/s,比其原 GPT-4 方案快 9 倍。当时还计划把能力蒸馏进 8B。
岗位的消亡:随着旗舰模型原生 diff/搜索替换编辑能力越过够用线,独立 apply 模型的必要性塌了。社区留下一篇标题就是判词的复盘——Fast Apply Models are Already Dead,文中注意到 Cursor 已删除了那篇博客原文(现存网页存档)。
收敛度:❌ 岗位被回收。这是全地图最重要的一站,因为它示范了拉锯战的另一个方向:靠「主模型暂时做不好」立足的岗位,寿命等于主模型补齐短板的时间。把它放进地图,是为了防止把前七个岗位读成单向的历史必然。
总表:八个岗位一览
| 岗位 | 根本问题 | 源头论文/证据 | 专岗量级 | 生产落地 | 立足点 | 收敛度 |
|---|---|---|---|---|---|---|
| 路由员 | 这题谁来答 | RouteLLM (2406.18665) | BERT 级 | GPT-5 router、Azure Model Router | 结构位(时序) | ✅ |
| 安检员 | 能不能进/出 | Llama Guard (2312.06674)、ShieldGemma (2407.21772) | 1B–9B | 随旗舰配套发布 | 结构位(独立性) | ✅ |
| 精简师 | 上下文减肥 | LLMLingua (2310.05736)、-2 (2403.12968) | 编码器级 | 开源工具链,非默认 | 部署位(成本) | ⚠️ 护城河变薄 |
| 打字员 | 替主模型打字 | Leviathan (2211.17192)、EAGLE (2401.15077) | 单层草稿头 | vLLM 内建 | 结构位(数学) | ✅ 永久岗 |
| 质检员 | 每步对不对/答案好不好 | Math-Shepherd (2312.08935)、Qwen PRM (2501.07301)、Prometheus 2 (2405.01535) | 7B | Qwen 开源 PRM;裁判仍多用旗舰 | 结构位(独立性)+能力位 | ⚠️ |
| 翻译员 | 意图→函数调用 | Gorilla (2305.15334)、xLAM (2409.03215) | 1B–7B | 榜单能打,生产多被主模型内化 | 能力位→部署位 | ⚠️ |
| 指路员 | 指令→像素坐标 | UGround (2410.05243)、OS-Atlas (2410.23218) | 2B–7B | 开源双件套 vs 端到端对赌 | 能力位 | ⚠️ |
| 誊写员 | 意图 diff→落盘 | Cursor instant apply(产品博客) | 70B 微调→拟蒸 8B | 已退场 | 能力位 | ❌ 被回收 |
元规律:岗位寿命 = 结构位 > 部署位 > 能力位
把八站的收敛度和立足点对齐,规律自己浮出来。一个子任务会被专训小模型拿走,需要三个判据同时成立(这就是 NVIDIA 数据飞轮能转的条件):
- 分布窄而稳——任务输入可聚类,聚类出的数据够训一个专岗模型;
- 调用频次高——每次省下的钱乘以频次,付得起训练和维护成本;
- 标签可自动生产——Math-Shepherd 的补全采样标注、APIGen 的可验证合成管线、Cursor 拿 GPT-4 造数据,全都在解决同一件事:没有便宜标签就没有专岗模型。
而一个岗位能不能被主模型收回,取决于它靠什么立足:
- 结构位(最耐久):岗位存在的理由是时序、独立性或数学不等式,与能力差无关。路由员必须在主模型运行前做决定;安检员必须独立于被检者;打字员必须比验证者便宜否则加速不成立。能力 scaling 侵蚀不了结构,这三个岗位是永久编制。
- 部署位(中等):岗位理由是隐私、端侧、成本约束——「必须在我的机房里跑」。主模型再强也进不了你的内网,但约束本身可能松动(价格战、合规方案演化)。
- 能力位(最短命):岗位理由只是「主模型暂时做不好」。誊写员已经示范了结局,指路员和翻译员的公有云席位正在路上。
一句话带走:苦涩教训淘汰的是能力位岗位,淘汰不了结构位岗位;专岗小模型的可持续生态位,不在「比大模型做得好」,而在「大模型在结构上不能做」的地方。
顺手把系列旧定律接上:评测路由篇说「路由器是评测器的在线蒸馏」——现在可以推广:每个专岗小模型,都是主模型某个能力切片在窄分布上的蒸馏;而蒸馏值不值得做,由本篇的三判据定;蒸馏出的岗位守不守得住,由结构位/能力位定。
诚实的提醒
本文所有数字(10–30 倍成本比、3.66 倍路由节省、20 倍压缩、93.3% GSM8K、78.94% BFCL、20 个百分点落点提升、1000 token/s 等)均来自论文原文或官方博客,写作当天逐一检索核实过链接,但我没有亲手复现其中任何一个。各家论文的测试条件差异很大,横向比较时只能当量级参考。
成本最低的亲手验证实验:精简师岗位可以在笔记本上直接开工——pip install llmlingua,加载 LLMLingua-2 的编码器权重(XLM-RoBERTa 量级,CPU 可跑),拿你自己最长的一段 prompt 压缩 3 倍,前后各问一次同一个模型,对比答案质量。半小时内你就能对「压缩省下的 token vs 丢掉的信息」建立亲手手感——顺便验证岗位三的护城河到底还剩多宽。
参考来源
arXiv 论文
- Small Language Models are the Future of Agentic AI(2506.02153,NVIDIA)
- RouteLLM: Learning to Route LLMs with Preference Data(2406.18665,ICLR 2025)
- Llama Guard: LLM-based Input-Output Safeguard(2312.06674,Meta);Llama Guard 3-1B-INT4(2411.17713)
- ShieldGemma: Generative AI Content Moderation Based on Gemma(2407.21772,Google)
- LLMLingua(2310.05736,EMNLP 2023);LLMLingua-2(2403.12968,ACL 2024 Findings)
- Fast Inference from Transformers via Speculative Decoding(2211.17192,ICML 2023);EAGLE(2401.15077);EAGLE-3(2503.01840)
- Math-Shepherd(2312.08935,ACL 2024);The Lessons of Developing Process Reward Models in Mathematical Reasoning(2501.07301,Qwen)
- Prometheus 2(2405.01535,EMNLP 2024)
- Gorilla(2305.15334,NeurIPS 2024);xLAM(2409.03215,Salesforce);APIGen(2406.18518)
- Terminus-4B: Can a Smaller Model Replace Frontier LLMs at Agentic Execution Tasks?(2605.03195)
- UGround(2410.05243,ICLR 2025 Oral);OS-Atlas(2410.23218,ICLR 2025)
工程实践
- Cursor: Editing Files at 1000 Tokens per Second(原文已被 Cursor 删除,可查网页存档);Fireworks 的配套工程博客;Fast Apply Models are Already Dead(复盘)
- vLLM 的 EAGLE 草稿模型文档;EAGLE 3.1 联合发布博客
- microsoft/LLMLingua;lm-sys/RouteLLM
- ShieldGemma 官方文档;Qwen2.5-Math-PRM-7B 模型卡;xLAM-1b-fc-r 模型卡
- NVIDIA SLM 立场论文的公开回应页
本站相关旧文