主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位

把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。

你以为付钱雇的是一位全能大师傅,实际到场的是一支施工队。上次我们在《主模型明明是 Fable 5,账单里为什么冒出 Haiku 4.5?》里从账单倒查出三层「小模型替大模型干活」的机制——应用层分派、服务层路由、解码层投机。这篇把镜头拉远:沿着主 Agent 一次推理循环的完整时间轴,把每一个正在被专向训练小模型接管的岗位逐站点名,每个岗位配上源头论文和生产落地证据。看完你会得到一张岗位地图,和一条判断「哪些岗位守得住、哪些迟早被大模型收回」的定律。

先接住那个最大的反问:这不是在跟苦涩教训对着干吗?

Sutton 的苦涩教训说通用方法加算力终将碾压人工巧劲。那给每个子任务训一个专用小模型,不正是苦涩教训点名要淘汰的「巧劲」吗?

NVIDIA 2025 年的立场论文《Small Language Models are the Future of Agentic AI》(arXiv 2506.02153)给了这个问题一个经济学答案。它观察到:Agent 工作负载的本质不是开放对话,而是少数几种专门任务的高频重复——格式受限、输入分布窄、变化很小。用一个为「任何问题」训练的通用大模型去跑「同一个问题的第一万次变体」,通用性本身就成了纯开销。论文估算 SLM(他们的工作定义:能跑在消费级设备上、单用户延迟可接受的模型)在这类调用上比 LLM 便宜 10–30 倍,并主张异构 Agent 系统——一个 Agent 内部调用多个不同量级的模型——是自然终局。

但注意两件事,它们让「专岗小模型」和苦涩教训不矛盾:

  1. 这些小模型自己就是大模型的产物。训练数据靠大模型合成(下文 Cursor 用 GPT-4 造数据、xLAM 用 APIGen 管线、Math-Shepherd 用补全采样自动标注),能力靠从大模型蒸馏——我在《训练小模型的三条路》里数过:2026 年每个能打的小模型身后,都站着一个大模型。专岗化不是对抗 scaling,是 scaling 的下游分发形态
  2. 岗位是流动的。大模型通用能力每上一个台阶,就会「收回」一批只靠能力差立足的岗位(文末誊写员就是被收回的实例)。所以这张地图不是静态编制表,是一场拉锯战的即时战况。

NVIDIA 论文还给出了岗位化的操作路径,他们叫数据飞轮:记录 Agent 的真实调用 → 按工具/任务聚类 → 对每个聚类微调一个专岗 SLM → 替换该岗位的大模型调用 → 继续记录。这个飞轮能不能转起来,就是判断一个岗位会不会被小模型拿走的第一判据(文末展开)。

一次推理循环的岗位地图

先上图。主模型(图中菱形)仍然负责「想」,但一条请求从进门到出门,两侧站满了专岗小模型:

flowchart TB
    Q[用户请求] --> R["路由员<br>这题谁来答"]
    R --> G1["安检员·入口<br>提示能不能进"]
    G1 --> C["精简师<br>上下文先减肥"]
    C --> M{{"主模型推理"}}
    D["打字员<br>投机草稿"] -.逐 token 加速.- M
    M --> V["质检员<br>过程逐步打分"]
    V -->|不合格重采样| M
    V --> A{行动类型}
    A -->|调 API| T["翻译员<br>意图到函数调用"]
    A -->|操作屏幕| U["指路员<br>指令到像素坐标"]
    A -->|改代码| P["誊写员<br>意图 diff 落盘"]
    A -->|直接作答| O[候选输出]
    T --> O
    U --> O
    P --> O
    O --> G2["安检员·出口<br>输出能不能出"]
    G2 --> J["裁判员<br>质量评分回流"]
    J --> Ans["交付用户 + 喂数据飞轮"]

在逐站展开前,先致敬一个史前岗位:检索员。向量召回和交叉编码重排从来就不是主模型亲自干的——BERT 量级的双塔编码器和 reranker 接管这个岗位太久了,久到没人记得这也算「小模型替大模型干活」。它证明这个趋势不是新鲜事,只是正在从检索一个点蔓延到整条流水线。

下面每个岗位按验证过的四段式走:根本问题 → 源头论文 → 产品落地 → 收敛度

岗位一 · 路由员:这道题配谁答

根本问题:请求还没碰到主模型之前,就得有人决定「这题值不值得动用旗舰」。这个决定发生在主模型运行之前——主模型没法参与一个「它还没被选中」的决策,所以这个岗位天然属于一个前置的轻量预测器。

源头论文RouteLLM(arXiv 2406.18665,ICLR 2025)。用 Chatbot Arena 的 8 万场人类偏好对战训练路由器,预测「强模型赢过弱模型的概率」,配成本阈值转成路由决定。关键是看它的路由器本体:matrix factorization、BERT 分类器这个量级——相对被路由的模型近乎免费。结果:质量不降、成本降超过 2 倍(最高 3.66 倍),且换掉强弱模型对之后路由器依然工作。我之前逐节拆过这篇论文

产品落地:GPT-5 的实时路由器、Azure Model Router、Not Diamond——评测路由篇里已经排过这三家的证据链,此处不重复。

收敛度:✅ 已收敛。「请求前一跳、轻量预测器」是各家共同答案;那篇文章的定律在这里复述一遍就够——路由器是评测器的在线蒸馏

岗位二 · 安检员:入口出口各站一个

根本问题:主模型的输入和输出都要过安检,而安检员不能是主模型自己——被越狱的模型不能负责判定自己有没有被越狱。裁判必须独立于运动员,这是结构性要求,不是能力问题。外加一条经济约束:每条消息都要过检,安检必须便宜。

源头论文Llama Guard(arXiv 2312.06674,Meta)是这个岗位的定岗文件:拿 Llama2-7B 指令微调成一个输入/输出双向的安全分类器,带可定制的风险分类法。它的演化方向就是「岗位越来越小」:Llama Guard 3 随 Llama 3.1 发布(14 类风险、8 语言),后续甚至出了 1B-INT4 的压缩版(arXiv 2411.17713),专为端侧部署。Google 的 ShieldGemma(arXiv 2407.21772)同理:基于 Gemma 2 的 2B/9B/27B 分类器,按请求附带的安全准则做判定。

产品落地:Meta 和 Google 都把安检员做成了随主模型发布的配套件——旗舰模型发布时附赠同代护栏小模型,这个发布惯例本身就是收敛的证据。

收敛度:✅ 已收敛。独立小分类器做双向安检是行业默认架构。这个岗位与门禁篇的「不可逆边界」定律咬合:安检站的位置恰好设在 token 流出/流入系统边界这两个不可逆跃迁点上。

岗位三 · 精简师:喂进去之前先减肥

根本问题:上下文按 token 计费、按 token 变慢,但上下文里大部分 token 对答案没贡献。谁来在主模型看到之前把水分挤掉?

源头论文LLMLingua(arXiv 2310.05736,EMNLP 2023,微软)用一个小语言模型(GPT-2 或 LLaMA-7B 量级)逐 token 算困惑度,删掉低信息量 token,最高 20 倍压缩下任务性能只降约 1.5 个点。LLMLingua-2(arXiv 2403.12968,ACL 2024 Findings)把岗位工资进一步砍到编码器量级:从 GPT-4 蒸馏出「该 token 留不留」的标注数据,训一个 XLM-RoBERTa-large 的 token 二分类器做压缩,比初代快 3–6 倍,端到端延迟在 2–5 倍压缩率下降低 1.6–2.9 倍。

产品落地:微软开源了全套 LLMLingua 工具链,LangChain/LlamaIndex 生态有集成。但没有哪家主流推理服务把它做成默认开关。

收敛度:⚠️ 方法成立,岗位护城河在变薄。原因是两股回收力:长上下文越来越便宜,前缀缓存让重复上下文几乎免费。压缩省下的钱在缩水,而压缩引入的信息损失风险不变。我的判断(观点):这个岗位会退守到「上下文超长且不可缓存」的窄场景。

岗位四 · 打字员:主模型思考,小模型打字

根本问题:自回归生成一次只出一个 token,大模型每个 token 都要过一遍全部权重。能不能让便宜的手先打字、贵的脑子只做批改?

源头论文Leviathan 等的投机解码(arXiv 2211.17192,ICML 2023 Oral)给出数学保证:小草稿模型先猜若干 token,大模型一次并行验证,接受规则保证输出分布与大模型独立生成完全一致——无损加速,T5-XXL 上 2–3 倍。这个岗位后来发生了有趣的「编制改革」:EAGLE 系列(arXiv 2401.15077 / 2406.16858 / 2503.01840)发现草稿不需要一个独立小模型,一层挂在主模型隐状态上的草稿头就够——岗位还在,独立员工没了,变成了主模型的一只「快手」。

产品落地:vLLM 内建 EAGLE 草稿模型支持,2026 年 5 月 EAGLE 团队与 vLLM 联合发布了 EAGLE 3.1。这是全地图上唯一对用户完全隐形的岗位——你感知不到它存在,只感知到快。

收敛度:✅ 已收敛,且永远不会被回收。原因是数学结构:草稿的意义就在于比验证者便宜,主模型不可能收回这个岗位——收回等于没有加速。这个岗位的第二本账(长上下文下瓶颈从权重转移到 KV Cache)我在投机解码的第二本账里算过。

岗位五 · 质检员:过程打分与结果评审两个工位

根本问题:主模型推理多步时,错一步就全错。谁来给每一步打分(过程质检),谁来给最终答案评级(结果评审)?让主模型自查有系统性偏差——自我评估偏爱自己的输出,所以这个岗位同样有独立性的结构要求。

源头论文(过程工位)Math-Shepherd(arXiv 2312.08935,ACL 2024,北大 + DeepSeek)解决了这个岗位的招工难题——过程标注太贵。它的办法:从每个中间步骤出发采样多条补全,用「这一步最终走到正确答案的比例」自动生成步骤分——不用人标。训出的过程奖励模型(PRM)做 Best-of-N 重排,帮 DeepSeek-67B 把 GSM8K 推到 93.3%、MATH 48.1%。Qwen2.5-Math-PRM(arXiv 2501.07301)把工位能力钉得更死:7B 的专岗 PRM 在 ProcessBench 找错任务上超过 GPT-4o-0806(与 o1-mini 仍有差距)——质检这个单项上,专训 7B 赢了通用旗舰。

源头论文(结果工位)Prometheus 2(arXiv 2405.01535,EMNLP 2024),动机直白:拿 GPT-4 当裁判太贵、不透明、不可控。基于 Mistral-7B/Mixtral-8x7B 训专职评审模型,统一直接打分和成对比较两种裁决形式,支持自定义评分准则,与人类及 GPT-4 判决高度一致。

产品落地:Qwen 公开发布了 PRM 权重(7B/72B);评审工位上,多数生产评测管线仍默认用旗舰模型当裁判(LLM-as-judge 的三种偏差照单全收)。

收敛度:⚠️ 数学域已验证,通用域未定。过程打分在可自动验证的域(数学、代码)收敛,开放域的过程标签从哪来仍是开放问题——这正是测试篇「Oracle 梯度定律」的又一次显形:判定标准能形式化的地方,岗位先被小模型拿走。

岗位六 · 翻译员:把意图翻译成函数调用

根本问题:Agent 的「手」是工具调用——把自然语言意图翻译成严格 schema 的 JSON。这是全流水线上分布最窄、格式最受限的任务,恰好是 NVIDIA 论文点名「用通用大模型是浪费」的典型岗位。

源头论文Gorilla(arXiv 2305.15334,NeurIPS 2024,Berkeley)是定岗文件:检索感知微调的 LLaMA-7B,在 API 调用生成上超过 GPT-4,显著减少参数幻觉。Salesforce 的 xLAM(arXiv 2409.03215)配合 APIGen 合成数据管线(arXiv 2406.18518)把量级推到极限:xLAM-1b-fc-r 以 1.3B 的身板在 Berkeley Function-Calling Leaderboard 拿到 78.94%,按模型卡说法超过 GPT-3.5-Turbo 和一众更大的模型;7B 版 88.24%,当时榜上第三。2026 年的 Terminus-4B(arXiv 2605.03195)把这个岗位扩展到「子代理」编制:SFT+RL 后训练的 Qwen3-4B 专职承担终端执行子任务,服务于「主 Agent 保持上下文干净、窄职责外包给小模型子代理」的架构。

产品落地:矛盾的证据。开源专岗模型在榜单上确实能打;但生产 Agent 的工具调用大多仍由主模型顺手完成——因为 function calling 已经被旗舰模型内化成了 API 原生能力。专岗翻译员的现实买家是私有化部署和端侧场景。

收敛度:⚠️ 能力已证明,岗位归属未定。这是「能力位岗位」的典型:小模型赢在成本,但主模型顺手做的够好时,多雇一个人的架构复杂度就成了负资产。它最终守住的可能不是「翻译得更好」,而是「在你的机房里翻译」。

岗位七 · 指路员:屏幕上哪个点是那个按钮

根本问题:GUI Agent 要把「点击提交按钮」翻译成像素坐标。规划(下一步做什么)和落点(坐标在哪)是两种能力:前者要世界知识,后者要的是对截图的密集视觉对齐——后者恰好是通用大模型的弱项、专训小模型的主场。

源头论文UGround(arXiv 2410.05243,ICLR 2025 Oral,OSU)提出「规划-落点解耦」:大模型只负责说「点哪个语义元素」,专训的视觉落点模型(基于 Qwen2-VL 的 2B/7B/72B)输出像素坐标,比既有落点模型最高提升 20 个百分点(绝对值)。OS-Atlas(arXiv 2410.23218,ICLR 2025,上海 AI Lab 等)用 1300 万 GUI 元素的跨平台语料训 4B/7B 落点基座,作为可插拔模块:OSWorld 上 GPT-4o 换上 OS-Atlas 做落点,显著超过 SeeClick 和 Set-of-Mark 方案。

产品落地:开源 GUI Agent 框架普遍采用「大模型规划 + 小模型落点」双件套;反例同样重要——Anthropic 的 computer use 走端到端路线,主模型直接输出坐标。两条路线还在对赌。

收敛度:⚠️ 学术侧已收敛,工业侧两条路线并行。这也是能力位岗位:多模态主模型的坐标能力每提升一次,解耦架构的必要性就下降一分。我猜测(标注:猜想)它的终局类似翻译员——公有云被主模型内化,开源和端侧长期保留专岗。

岗位八 · 誊写员:一个已经被回收的岗位

根本问题:编程 Agent 的主模型输出「改动意图」,谁来把意图准确写进几百行的原文件?让旗舰全文重写太慢太贵,于是出现了专职誊写员。

源头证据(这个岗位没有论文,是纯产品驱动):Cursor 的工程博客 Editing Files at 1000 Tokens per Second 记录了岗位的巅峰:微调 Llama-3-70B 做「fast apply」,配合投机编辑(speculative edits——代码编辑场景连草稿模型都不用,原文件本身就是草稿),达到约 1000 token/s,比其原 GPT-4 方案快 9 倍。当时还计划把能力蒸馏进 8B。

岗位的消亡:随着旗舰模型原生 diff/搜索替换编辑能力越过够用线,独立 apply 模型的必要性塌了。社区留下一篇标题就是判词的复盘——Fast Apply Models are Already Dead,文中注意到 Cursor 已删除了那篇博客原文(现存网页存档)。

收敛度:❌ 岗位被回收。这是全地图最重要的一站,因为它示范了拉锯战的另一个方向:靠「主模型暂时做不好」立足的岗位,寿命等于主模型补齐短板的时间。把它放进地图,是为了防止把前七个岗位读成单向的历史必然。

总表:八个岗位一览

岗位根本问题源头论文/证据专岗量级生产落地立足点收敛度
路由员这题谁来答RouteLLM (2406.18665)BERT 级GPT-5 router、Azure Model Router结构位(时序)
安检员能不能进/出Llama Guard (2312.06674)、ShieldGemma (2407.21772)1B–9B随旗舰配套发布结构位(独立性)
精简师上下文减肥LLMLingua (2310.05736)、-2 (2403.12968)编码器级开源工具链,非默认部署位(成本)⚠️ 护城河变薄
打字员替主模型打字Leviathan (2211.17192)、EAGLE (2401.15077)单层草稿头vLLM 内建结构位(数学)✅ 永久岗
质检员每步对不对/答案好不好Math-Shepherd (2312.08935)、Qwen PRM (2501.07301)、Prometheus 2 (2405.01535)7BQwen 开源 PRM;裁判仍多用旗舰结构位(独立性)+能力位⚠️
翻译员意图→函数调用Gorilla (2305.15334)、xLAM (2409.03215)1B–7B榜单能打,生产多被主模型内化能力位→部署位⚠️
指路员指令→像素坐标UGround (2410.05243)、OS-Atlas (2410.23218)2B–7B开源双件套 vs 端到端对赌能力位⚠️
誊写员意图 diff→落盘Cursor instant apply(产品博客)70B 微调→拟蒸 8B已退场能力位❌ 被回收

元规律:岗位寿命 = 结构位 > 部署位 > 能力位

把八站的收敛度和立足点对齐,规律自己浮出来。一个子任务会被专训小模型拿走,需要三个判据同时成立(这就是 NVIDIA 数据飞轮能转的条件):

  1. 分布窄而稳——任务输入可聚类,聚类出的数据够训一个专岗模型;
  2. 调用频次高——每次省下的钱乘以频次,付得起训练和维护成本;
  3. 标签可自动生产——Math-Shepherd 的补全采样标注、APIGen 的可验证合成管线、Cursor 拿 GPT-4 造数据,全都在解决同一件事:没有便宜标签就没有专岗模型。

而一个岗位能不能被主模型收回,取决于它靠什么立足:

  • 结构位(最耐久):岗位存在的理由是时序、独立性或数学不等式,与能力差无关。路由员必须在主模型运行前做决定;安检员必须独立于被检者;打字员必须比验证者便宜否则加速不成立。能力 scaling 侵蚀不了结构,这三个岗位是永久编制。
  • 部署位(中等):岗位理由是隐私、端侧、成本约束——「必须在我的机房里跑」。主模型再强也进不了你的内网,但约束本身可能松动(价格战、合规方案演化)。
  • 能力位(最短命):岗位理由只是「主模型暂时做不好」。誊写员已经示范了结局,指路员和翻译员的公有云席位正在路上。

一句话带走:苦涩教训淘汰的是能力位岗位,淘汰不了结构位岗位;专岗小模型的可持续生态位,不在「比大模型做得好」,而在「大模型在结构上不能做」的地方。

顺手把系列旧定律接上:评测路由篇说「路由器是评测器的在线蒸馏」——现在可以推广:每个专岗小模型,都是主模型某个能力切片在窄分布上的蒸馏;而蒸馏值不值得做,由本篇的三判据定;蒸馏出的岗位守不守得住,由结构位/能力位定。

诚实的提醒

本文所有数字(10–30 倍成本比、3.66 倍路由节省、20 倍压缩、93.3% GSM8K、78.94% BFCL、20 个百分点落点提升、1000 token/s 等)均来自论文原文或官方博客,写作当天逐一检索核实过链接,但我没有亲手复现其中任何一个。各家论文的测试条件差异很大,横向比较时只能当量级参考。

成本最低的亲手验证实验:精简师岗位可以在笔记本上直接开工——pip install llmlingua,加载 LLMLingua-2 的编码器权重(XLM-RoBERTa 量级,CPU 可跑),拿你自己最长的一段 prompt 压缩 3 倍,前后各问一次同一个模型,对比答案质量。半小时内你就能对「压缩省下的 token vs 丢掉的信息」建立亲手手感——顺便验证岗位三的护城河到底还剩多宽。

参考来源

arXiv 论文

工程实践

本站相关旧文