2026年8月11日Wilson 下界和它的全家:评测分数的统计地基——分数不是数,是分布评测报告里"5/5 全对"的 95% 置信下界只有 56.6%。以 Wilson 下界为入口,把评测分数背后的整套统计生词(置信区间、配对检验、多重比较、判分者一致性、pass@k 无偏估计、功效分析)钉成四道关卡和一张生词总表,让你以后见到这类词不再发怵。AILLM评测论文深读
2026年8月11日业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。AILLM评测AI Infra论文深读
2026年8月11日Veral:把一次模型调用变成可回滚的路由策略一张图读懂公司级 LLM 评测与智能路由平台的理想全貌:在线路由与离线评测如何隔离,Trace 如何变成冻结数据、能力标签和策略版本,以及为什么真正的产品单位是一次可追溯、可灰度、可回滚的策略变化。AILLM评测AI Infra系统设计
2026年8月9日评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。AILLM评测AI Infra系统设计
2026年8月9日从空目录到第一份评测报告:用 Inspect AI 把评测系统真的搭出来(实操陪读篇)评测路由系列的动手篇:30 分钟、七步、每步给完整代码和我本机跑出的真实输出——建 4 条金集 mini 版(字段对齐数据规格书)、用免 API key 的 mockllm 跑通管道、一行参数换真模型/接公司网关、写自定义规则评分器、双模型对比拿到 1.00 vs 0.00、从日志读出请求级标签、CI 门禁脚本。文末给「你刚搭的文件 ↔ 施工图模块」对照表和七问自检清单。全部代码在 inspect-ai 0.3.254 上亲手验证。AILLM评测AI Infra
2026年8月9日数据规格书:把「网关产 Trace,Trace 产评测集,评测产标签」落到字段级施工图篇的下一层细化:四段数据链每段一份可直接建表的规格——五块式 Trace schema(贴 OTel GenAI 属性名 + 路由决策扩展 + 三级采样)、评测集生产漏斗(八类挖掘信号、样本封闭化、审核状态机、版本化)、两种标签的生产口径(Wilson 区间 + 最小样本量 + 失效规则)、路由器偏好对的 SQL 导出与冷启动,以及贯穿全链的「字段三问」数据契约定律。AILLM评测AI Infra系统设计
2026年8月8日从 JD 到施工图:公司级大模型路由与评测系统的完整落地方案把米哈游「大模型路由与评测工程师」JD 的六条工作内容翻译成可施工的系统方案:十个模块的职责与接口、六层架构图、三张关键时序图(在线路由、策略灰度、评测闭环)、每个模块的开源选型与自研分界(LiteLLM/semantic-router/RouteLLM/Langfuse/Inspect AI/EvalScope/Promptfoo/GrowthBook),以及一条「先评测后路由」的施工顺序定律和四阶段路线图。决策地图系列「评测路由篇」的施工图姊妹篇。AILLM评测AI Infra系统设计
2026年8月7日Agent 时代的工程学·评测路由篇:六个决策点,和一条「路由器是评测器的蒸馏」定律决策地图系列第五篇:做 AI Eval 的团队怎么把评测策略下发给 LLM Router?把这条链路拆成六个决策点(信号源、学习目标、路由时机、成本旋钮、路由器验收、闭环与泛化),用「论文→产品」传导链判收敛:Chatbot Arena→RouteLLM→P2L 的 Berkeley 系、MSR Hybrid LLM→Azure Model Router 的微软系、eval 数据→定制路由器的 Not Diamond 系。得到一条新定律:路由器是评测器的在线蒸馏——评测信号有多保真、多便宜,路由就有多强、收敛多快。附四阶段落地路线图。AILLM评测论文深读
2026年8月4日Eval 是新的 PRD?是的,但规格的缝隙只是搬了家从 VB Transform 2026 的一句口号出发,用三篇论文拆解「Eval 取代 PRD」的真实含义:当产品规格从给人读的散文变成给机器跑的目标函数,Goodhart 定律开始起作用——真正的交付物不是 eval 套件,而是让 eval 与意图持续对齐的闭环。评测工程实践AgentLLM
2026年8月4日概率内核,确定性外壳:五个「可」的伪代码实践承接《Agent 应用工程师的六层》的分水岭判断,把「可观测、可恢复、可验证、可治理、可持续进化」逐个拆成最小工程实现:每个「可」一段伪代码,共享同一个设计原则——状态放内核外面,决策穿过内核,副作用经过关卡。Agent工程实践评测LLM
2026年7月27日别再问谁第一:大模型 Benchmark 榜单的正确打开方式梳理 2026 年仍值得看的大模型榜单和数据源:LMArena、HELM、LiveBench、Artificial Analysis、SEAL/HLE、SWE-bench、BFCL、OpenCompass 与 Hugging Face Open LLM Leaderboard,并给出一套按场景读榜的方法。AILLM评测
2026年7月23日评测不是打榜:怎样用真实 Session 找到最便宜够用的模型系统讲解 LLM 评测和模型路由的工程原理:如何把真实 session 做成 eval case,用 rubric、LLM judge、校准集和成本表找出每类任务的最低可用模型。AILLMAI Infra评测
2026年7月23日RouteLLM 深度解读:把模型选择变成成本-质量路由问题从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。AILLMAI Infra评测论文深读
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLM评测llama.cpp
2026年7月10日Agent 做长任务为什么会崩:从时间跨度到失败归因消化 Voyager、METR long tasks、TheAgentCompany、SWE-Bench Pro、Odysseys、WildClawBench 和 HORIZON:长任务能力为什么不能只看成功率。AILLMAgent评测学习笔记
2026年7月10日PPL 是什么:把模型困惑度理解成平均岔路数用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。AIAI InfraLLM评测llama.cpp数学
2026年7月10日为什么交叉熵偏偏要用 log:从模型开发者脑回路理解 PPL从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。AIAI InfraLLM评测数学
2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLM评测llama.cpp数学
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgent评测学习笔记
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLM评测AI Infra学习笔记
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLM评测学习笔记
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLM评测学习笔记
2026年7月8日SWE-bench 学习笔记:代码模型评测,终于从刷题走向真实修 Bug消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。AILLM评测学习笔记