「做 AI Eval 的,把 Eval 策略下发给 LLM Router」——这句工程黑话在业界有一个准确的学名:把离线、慢、贵的判定信号,蒸馏成在线、快、便宜的路由预测器。这条链路 2023 年还是论文里的原型,2025 年已经同时出现在三个量级的产品里:ChatGPT 给每条消息实时选模型(GPT-5 router)、Azure 把路由器当成一个可部署的模型卖(Model Router)、创业公司拿你的评测数据给你训专属路由器(Not Diamond)。这篇是决策地图系列第五篇,照旧把领域拆成六个决策点、用「论文→产品」传导链判收敛。先把第一性的分解摆在最前面:路由 = 预测问题 × 约束优化问题,而预测问题的训练标签,只能来自评测。
先换一个表示:路由到底是什么
模型池里有强弱不等、价差可达两个数量级的模型(FrugalGPT 2023 年就统计过:主流 LLM API 的定价差异高达百倍)。路由器要做的事拆开是两半:
优化那一半是成熟数学——约束优化、阈值、帕累托前沿,没有悬念。全部难度都在预测那一半:训练标签从哪来? 「答好」不是一个客观物理量,它是评测的输出——ground truth 比对、模型裁判打分、人类偏好投票。所以整条 Eval→Router 链路的本质一句话可以说清:
路由器是评测器的蒸馏:把评测管线产出的判定信号(离线、慢、贵),压缩进一个每次请求前都要跑的轻量预测器(在线、快、便宜)。
用我读 AI 设计的十二条透镜看:这是第 ③ 条「目标函数即命运」的直接推论——评测信号就是路由器的目标函数,评测有什么偏差,路由器就继承什么偏差;也是上一篇测试篇「Oracle 梯度定律」的续集——评测信号就是路由器的 oracle,oracle 能被规模化采集的程度,决定这一层收敛的速度。下面六个决策点按管线顺序展开,判收敛的标准与系列前四篇相同:存在论文讲清原理 + 多家生产系统落成默认组件。
决策点一:评测信号选什么?——路由器的训练标签从哪来
根本问题:蒸馏的第一步是决定蒸什么。四种候选信号,保真度和采集成本呈反比:ground truth 比对(最保真,但只覆盖有标准答案的任务)、LLM-as-judge(模型当裁判,便宜可规模化,但带偏差)、人类偏好投票(最贴近真实体验,但慢且贵)、生产隐式反馈(用户重新生成、切换模型、点踩——免费但噪声大)。
源头论文:Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(arXiv 2306.05685,NeurIPS 2023)是这一格的地基(我在 LLM-as-judge 学习笔记里逐节拆过):GPT-4 裁判与人类偏好的一致率约 85%,超过人与人之间的 81%——这个数字给「用模型裁判替代人类标注」发了准生证,也让评测信号第一次变得可规模化采集。但同一篇论文同时钉死了三种偏差:位置偏差、冗长偏差、自我增强偏差(裁判偏爱自家模型的输出)。记住这三个词,它们会在蒸馏后原样出现在路由器里。
落地技术代表:LMArena(Chatbot Arena)。注意它的双重身份:它既是评测平台,又是全行业最大的偏好数据工厂——这个副产品直接喂出了决策点二的两篇论文。
收敛度:✅ 分层组合已成默认。有标准答案的任务用 ground truth,开放任务用 judge + 偏好数据,上线后补生产信号——没有哪一路信号单独够用,分层混合是各家的共同答案。
决策点二:路由器学什么目标?——从难度分类到逐条 prompt 的排行榜
根本问题:拿到评测信号后,把它压缩成什么形状的预测目标?这一格有一条清晰的演化谱系,粒度一代比一代细。
源头论文(三代谱系):
- 第一代,难度二分类:Hybrid LLM(arXiv 2404.14618,ICLR 2024,微软研究院)用一个 BERT 量级的预测器判「这条 query 难不难」,难的给大模型、简单的给小模型,质量档位在推理时可调。结果:大模型调用量减少 40%,质量不降。
- 第二代,胜率预测:RouteLLM(arXiv 2406.18665,ICLR 2025,Berkeley)不再判抽象的「难度」,改为直接预测「强模型赢过弱模型的概率」,训练数据是 Chatbot Arena 的 8 万场人类偏好对战,配一个成本阈值把胜率转成路由决定。结果:质量不降的前提下成本降超过 2 倍,且换掉强弱模型对后路由器仍然工作(迁移性)。
- 第三代,逐 prompt 排行榜:Prompt-to-Leaderboard(P2L,arXiv 2502.14855,LMArena)把粒度推到极限——训练一个 LLM,输入任意 prompt,输出整个模型池的 Bradley-Terry 系数向量(),相当于为每一条 prompt 现算一张专属排行榜。用它做路由,2025 年 1 月在 Chatbot Arena 真实流量上拿了总榜第一,比当时最强单模型高 25 分。
落地技术代表:Berkeley 系一条线贯穿——MT-Bench、RouteLLM、P2L 三篇论文的作者名单里都有 Ion Stoica。评测平台(Arena)产出偏好数据,偏好数据训出路由器(RouteLLM),路由器进化成逐 prompt 评测器(P2L),评测和路由在这条线上完成了字面意义的合流。
收敛度:⚠️ 谱系收敛,粒度未定。「学偏好胜率而非抽象难度」已是共识;但学到什么粒度(二分类够用还是要全池 BT 向量)取决于模型池大小,行业仍在分化。
决策点三:什么时机做路由决定?——生成前预测 vs 生成后级联
根本问题:预测器在 query 进来时一次定终身(预测式),还是让便宜模型先答、验证不过关再升级(级联式)?这是信息量与延迟的正面交换:级联看到了真实输出、信息多,但失败时延迟叠加;预测式一跳到位,但赌的是预测器够准。
源头论文:级联一侧,FrugalGPT(arXiv 2305.05176,2023)是开山——按顺序调用模型链,配一个打分函数判「这个答案可以交付吗」,不行就升级;结果是匹配 GPT-4 质量最多省 98% 成本,或同成本提 4 个点准确率。AutoMix(arXiv 2310.12963,NeurIPS 2024)把打分函数换成小模型的少样本自我验证 + 元验证器(验证信号有噪声,再训一层来校准它),单位成本的增量收益最多提升 89%。预测式一侧就是决策点二的全部论文。
落地技术代表:生产在线服务几乎全体选了预测式——GPT-5 的 real-time router、Azure Model Router、Not Diamond 都是生成前一跳决定,因为对话场景无法接受「答一次、验一次、再答一次」的延迟叠加。级联式退守离线批处理和对延迟不敏感的管线。
收敛度:⚠️ 场景分裂后各自收敛。在线=预测式、离线=级联式的分界已经清楚;真正未定的是混合形态(预测式为主、低置信时降级为级联)还没有标准做法。
决策点四:成本-质量旋钮怎么参数化?——这一格已经冻结
根本问题:老板问「能不能再省点钱、质量别掉太多」,这句话怎么变成一个可调参数?
源头论文:三种等价表述已经合流。RouteLLM 用成本阈值:胜率预测超过 才路由到强模型,调 就是调成本;P2L 给出更完整的形式化——带预算约束的最优路由策略 (prompt 映射到模型池上的分布),在平均成本不超预算的约束下最大化预期胜率,论文里在 o1-mini、gpt-4o、claude-3-5-sonnet 等七个模型之间做了不同预算档位的实测;RouterBench(arXiv 2403.12031)则把任意路由器画在成本-质量平面上与线性插值基线比较,给了这场对话一个公共坐标系。
落地技术代表:Azure Model Router 把整套东西收敛成一个部署参数——路由器本身就是一个可部署的「模型」,Microsoft 自己的测试给出对比 GPT-4.1 单模型最多省 60% 成本、准确率相当。
收敛度:✅ 冻结。数学上全部归结为「预测的质量差 × 价格差」的约束优化,产品上收敛为一个旋钮。用系列第三篇「接口冻结」定律看:这一格的上游接口(约束优化的数学)几十年前就冻结了,所以它最先收敛——和计算层里离物理最近的格子最先收敛,是同一个道理。
决策点五:路由器自己怎么验收?——评测者的递归考题
根本问题:评测策略下发给路由器之后,评测团队多了一个新的被测对象:路由器本身。而路由器的评测有个天然的贵法——评一个路由器,理论上要把每条 query 在池子里所有模型上都跑一遍才知道它选得对不对。
源头论文:RouterBench(arXiv 2403.12031,Martian + Berkeley)的核心贡献正是把这笔钱预付了:40.5 万条预生成的推理结果(8 个数据集 × 11 个模型,回答和质量分全部离线备好),任何路由算法可以在上面免推理回放——路由器评测从「烧 API 钱」变成「查表」。后续 RouterArena(arXiv 2510.00202)在往「路由器的公共排行榜」方向推。
落地技术代表:Martian(RouterBench 的出品方,本身就是卖路由的公司——先造尺子再卖货);以及 Microsoft 的生产建议,官方文档明确写着:把生产流量交给 Model Router 之前,先在自己的质量/成本/延迟基线上跑对比——平台方亲口承认路由器不是免检产品。
收敛度:⚠️ 方法确立,普及未至。预生成回放已是标准方法论,但大多数团队还没有把「路由器回归测试」纳入 CI——这一格的成熟度大概相当于单元测试覆盖率指标出现之前的软件业。
决策点六:新模型怎么接入、闭环怎么转?——蒸馏的保鲜问题
根本问题:蒸馏是按下快门的动作——路由器学到的是评测那一刻的模型池。可模型池每个月都在变:新模型发布、旧模型下线、价格调整。每次都全量重评+重训,蒸馏的成本优势就没了。
源头论文:Universal Model Routing(UniRoute,arXiv 2502.08773,Google,ICLR 2026)正面回答「没见过的模型怎么路由」:把每个 LLM 表示成它在一组代表性 prompt 上的预测误差特征向量——新模型进池,不用重训路由器,跑一遍代表性 prompt 拿到向量即可;论文给了超额风险界,并在 30+ 个训练时未见过的模型上验证。Router-R1(arXiv 2506.09033)走另一条路:用文本描述子(价格、能力描述)让路由器在推理时理解新模型。
落地技术代表(闭环侧):这一格论文管「泛化」,产品管「闭环」,两者拼起来才完整。GPT-5 的 real-time router(OpenAI 系统卡)是闭环的教科书样本:路由器持续用真实信号训练——用户何时手动切换模型、对回复的偏好率、测得的正确性;也就是说决策点一里最便宜的那路信号(生产隐式反馈)在这里成了主粮。Not Diamond 则是「Eval 策略下发给 Router」最字面的产品化:拿客户自己的评测数据训专属路由器,再从生产流量持续学习——它驱动着 OpenRouter 的智能路由,客户 Rootly 报告 SRE 基准平均准确率提升 39%,路由开销 100–200ms。
收敛度:❌ 未收敛——整张地图上最该投人的 explore 区。新模型表征、在线信号的去噪、重训节奏,全在演化中。但方向已经清楚:评测不再是发版前的一次动作,而是一条常开的流水线,路由器只是它的在线缓存。
合成:地图、定律,和一条四阶段落地路线
| 决策点 | 默认答案 | 技术代表 | 源头论文/来源 | 收敛度 |
|---|---|---|---|---|
| 评测信号源 | ground truth / judge / 偏好 / 生产反馈分层混合 | LMArena | 2306.05685 | ✅ 组合收敛 |
| 学习目标 | 偏好胜率(难度→胜率→逐 prompt BT 向量) | RouteLLM / P2L | 2406.18665;2502.14855 | ⚠️ 谱系收敛,粒度未定 |
| 路由时机 | 在线预测式、离线级联式 | GPT-5 router / FrugalGPT 系 | 2305.05176;2310.12963 | ⚠️ 场景分裂后各自收敛 |
| 成本-质量旋钮 | 胜率阈值 / 预算约束优化 | Azure Model Router | 2404.14618 + 官方文档 | ✅ 冻结 |
| 路由器验收 | 预生成结果免推理回放 | Martian RouterBench | 2403.12031 | ⚠️ 方法确立,普及未至 |
| 闭环与泛化 | 模型表征化 + 生产信号回流重训 | Not Diamond / GPT-5 router | 2502.08773 + 系统卡 | ❌ 未收敛 |
三条「论文→产品」传导链,各自验证了同一个方向:Berkeley 系(Arena 评测平台 → 偏好数据 → RouteLLM → P2L 上生产流量),评测平台自己长出了路由器;微软系(MSR Hybrid LLM → BEST-Route → Azure Model Router),研究院论文三年变成云产品;Not Diamond 系(客户 eval 数据 → 定制路由器 → OpenRouter),把「评测策略下发」本身做成了商业模式。三条链的共同前提,就是本篇的定律:
蒸馏定律:路由器的质量上限由评测信号的保真度决定,路由层的收敛速度由评测信号的采集成本决定。
这是测试篇 Oracle 梯度定律在路由层的直接投影——评测信号就是路由器的 oracle。五篇的元规律连成一串:抄收敛的、探未收敛的(应用层)→ 离物理越近越收敛(Infra)→ 收敛速度=接口冻结速度(计算层)→ 判定标准即接口(测试层)→ 判定信号可蒸馏,评测者即路由者(本篇)。这也把《Evals 是新的 PRD》的结论往前推了一步:evals 不只是验收标准,它是唯一能训练路由器的原料——做评测的团队手里握着的不是质检章,是整个推理成本结构的方向盘。
最后兑现标题里「可实践」的承诺——四阶段路线,每一阶段只依赖前一阶段的产出:
- v0 规则路由(一天):按任务类型/输入长度写 if-else,简单 query 走便宜模型。零 ML,目的只有一个:把「按 query 分流」的管道先打通。
- v1 离线评测 + 阈值路由(一到两周):攒几百条真实 query 做 golden set,强弱两档模型各跑一遍,用第三方模型当裁判做 pairwise 比较(务必交换位置跑两次以消位置偏差——决策点一的三种偏差在这里第一次咬人)。标签就是「弱模型是否足够」,拿它训一个轻量分类器,或直接用 RouteLLM 的开源实现。旋钮=胜率阈值。
- v2 定制蒸馏(一到两月):评测数据积累到几千条后,走 Not Diamond 式的定制路由器或基于 P2L 开源 checkpoint 微调;同时照 RouterBench 的方法把所有候选模型在 golden set 上的回答预生成存表,让每一版路由器都能免推理回放验收。
- v3 在线闭环(长期):采集生产隐式信号(重新生成、切换模型、点踩、任务完成率)回流重训;灰度上线,与固定基线持续 A/B。三个来自生产事故与官方文档的护栏:路由器是单点——GPT-5 上线首日 autoswitcher 故障半天,Altman 承认「GPT-5 显得笨得多」,fallback 到默认模型的逻辑必须先于路由器上线;多模态盲区——Azure 文档明说路由决定只看文本输入,图片进来也按文字判;上下文木桶——路由池的有效上下文长度等于池里最小那个模型的上下文。
照例的诚实提醒 + 亲手实验:本文所有数字(85%、80k、25 分、98%、89%、40%、60%、405k、39%、100–200ms)都有来源,无一亲手复现。这一篇的最小实验大约半天:取 50 条自己业务的真实 query,强弱两档模型各答一遍,用第三方模型做 pairwise 裁判(交换位置跑两次),数「弱模型足够」的比例。 这个比例就是你的可路由空间——它直接就是成本节省的上限估计,也是决定要不要投入 v1 的那个数。排进实验队列。
参考来源
arXiv 论文
- Zheng et al., Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena(2306.05685,NeurIPS 2023)
- Chen, Zaharia, Zou, FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance(2305.05176)
- Aggarwal, Madaan et al., AutoMix: Automatically Mixing Language Models(2310.12963,NeurIPS 2024)
- Ding, Mallick et al., Hybrid LLM: Cost-Efficient and Quality-Aware Query Routing(2404.14618,ICLR 2024)
- Hu et al. (Martian), RouterBench: A Benchmark for Multi-LLM Routing System(2403.12031)
- Ong et al., RouteLLM: Learning to Route LLMs with Preference Data(2406.18665,ICLR 2025)
- Frick et al. (LMArena), Prompt-to-Leaderboard(2502.14855)
- Jitkrittum et al. (Google), Universal Model Routing for Efficient LLM Inference(2502.08773,ICLR 2026)
- Router-R1: Teaching LLMs Multi-Round Routing and Aggregation via Reinforcement Learning(2506.09033)
- RouterArena: An Open Platform for Comprehensive Comparison of LLM Routers(2510.00202)
产品与工程实录
- OpenAI, GPT-5 System Card(real-time router 与训练信号)
- Microsoft Learn, Model router for Microsoft Foundry(概念与生产建议)
- Not Diamond 官方文档(用评测数据训定制路由器)
- LMArena, P2L 开源仓库(含路由 checkpoint 与 OpenAI 兼容 router server)
- Martian, RouterBench 开源仓库
系列前篇与本站相关文章