2026年8月11日Veral:把一次模型调用变成可回滚的路由策略一张图读懂公司级 LLM 评测与智能路由平台的理想全貌:在线路由与离线评测如何隔离,Trace 如何变成冻结数据、能力标签和策略版本,以及为什么真正的产品单位是一次可追溯、可灰度、可回滚的策略变化。AILLM评测AI Infra系统设计
2026年8月10日Agent 正在长成一朵云:从八个岗位地图到未来架构的压缩重演预测姊妹篇:上一篇把主 Agent 推理循环拆成八个被专训小模型接管的岗位,这一篇把岗位表贴到云架构图上,发现 Agent 架构正在压缩重演云计算二十年的演化史。四层证据链逐层判收敛:组件层(BAIR 复合 AI 系统宣言→NVIDIA 异构编制)、内核层(AIOS 的 agent syscall、Parrot 的 Semantic Variable、Mooncake 的 P/D 分离)、运行时层(AWS AgentCore/Azure Foundry/Google Agent Engine 六个月内先后 GA,microVM 隔离 + serverless 计费)、协议层(MCP 管南北向、A2A 捐入 Linux 基金会管东西向)。给出三条置信度分级预测(控制面/数据面成为 Agent 默认词汇;模型从架构图中消失变成实例类型;评测成为 Agent 云的类型系统),并收束成一条元规律:抽象复用使演化压缩——后发领域直接借用先行领域付清过发明成本的抽象词汇表,把二十年走成三年。AILLMAgentAI InfraMCP论文深读
2026年8月10日主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。AILLMAgentAI 安全论文深读
2026年8月10日一把 Key 背后:AI 网关到底替你收编了后端栈的哪几层LiteLLM 首页说 "Put your full AI stack behind one key"——这句广告词里的 AI stack 到底指什么?本篇按一次请求的生命周期把网关解剖成六层:协议归一(沙漏模型的窄腰)、身份与预算(virtual key 的凭证间接层)、路由与回退(FrugalGPT 级联 + RouteLLM 偏好路由 + Tail at Scale 对冲)、缓存(GPTCache 语义缓存 vs Prompt Cache 的 KV 缓存分界)、可观测(AgentOps taxonomy + OTel GenAI 语义约定)、防护与治理(Llama Guard + NeMo Guardrails)。每层四段式:根本问题→源头论文→网关落地→收敛度。收束成一条元规律:元数据分界定律——决策输入只需请求级元数据的横切层被网关吸收,需要碰权重/logits/KV 的能力沉入推理引擎;一把 key 买到的只是上半栈。AILLMAI Infra论文深读
2026年8月9日评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。AILLM评测AI Infra系统设计
2026年8月9日从空目录到第一份评测报告:用 Inspect AI 把评测系统真的搭出来(实操陪读篇)评测路由系列的动手篇:30 分钟、七步、每步给完整代码和我本机跑出的真实输出——建 4 条金集 mini 版(字段对齐数据规格书)、用免 API key 的 mockllm 跑通管道、一行参数换真模型/接公司网关、写自定义规则评分器、双模型对比拿到 1.00 vs 0.00、从日志读出请求级标签、CI 门禁脚本。文末给「你刚搭的文件 ↔ 施工图模块」对照表和七问自检清单。全部代码在 inspect-ai 0.3.254 上亲手验证。AILLM评测AI Infra
2026年8月9日数据规格书:把「网关产 Trace,Trace 产评测集,评测产标签」落到字段级施工图篇的下一层细化:四段数据链每段一份可直接建表的规格——五块式 Trace schema(贴 OTel GenAI 属性名 + 路由决策扩展 + 三级采样)、评测集生产漏斗(八类挖掘信号、样本封闭化、审核状态机、版本化)、两种标签的生产口径(Wilson 区间 + 最小样本量 + 失效规则)、路由器偏好对的 SQL 导出与冷启动,以及贯穿全链的「字段三问」数据契约定律。AILLM评测AI Infra系统设计
2026年8月8日从国内历练到硅谷 offer:LLM 工程师的可量化成长路径(细化到周,含身份链决策树)把「技术人的硅谷梦」从愿望改写成一个工程问题:P(offer) = 信号质量 × 管道数量 × 面试转化率 × 身份可行性。本文把四个因子全部拆到可执行单元:技术信号链四阶段(基线审计→地基→信号复利→管道冲刺),每阶段带可量化退出条件;身份链五条路线(L-1/国际hub/H-1B/O-1A/留学)带核实过的数据(FY2026 H-1B 中签率 35.3%、FY2027 改工资加权、O-1A 无配额八判据);每周 12 小时的操作系统、信息流追踪清单、8 周面试冲刺计划、领先/滞后指标仪表盘。姊妹篇《大模型行业工种全景图》负责选工种,本篇负责走到面试桌前。AILLM
2026年8月8日刷到的微软论文是真的吗?——FastContext:AI 写代码最贵的一步,和一篇只活了 18 天的论文从一条短视频出发的事实核查与论文深读:微软 FastContext(arXiv 2606.14066)确有其文——用 4B 小模型专管代码库探索,主代理省 26–60% token、难题解决率 +5.5 分——但它 6 月 12 日提交、6 月 30 日就以「产品 IP」为由撤稿删库。结合 CodeScout、SWE-grep、SWE-Pruner、Agentless、LocAgent,把「代码库探索该由谁来做」这个决策点的四条路线摆上桌:撤稿本身,就是这个方向商业价值最响亮的注脚。AILLM上下文工程论文深读
2026年8月8日InfiniBand:把网络做成集群的内存总线——以及以太网的反杀从 RDMA、无损流控、SHARP 三个第一性设计讲清 InfiniBand 为什么统治了 AI 集群网络,再用 Llama 3、MegaScale、Alibaba HPN、TPU v4 四份一手资料看懂 2024 年以太网阵营的反杀和 Google 的第三条路,最后收束成一条元规律:网络架构是对流量画像的最优编码。AIAI InfraLLM论文深读
2026年8月8日大模型行业工种全景图:十个岗位的能力矩阵、细化技能与透明学习路径——从公开 JD 反推把 2026 年大模型行业公开招聘的工种摊开成一张可选择的技能树:按「造模型→跑模型→用模型→管模型」四条产线拆出十个工种,每个工种给出能力矩阵(维度×细化技能×代表技术×学习挂靠点)和一个 2–4 周的最小验证项目。数据来自 OpenAI/Anthropic 官方招聘页、国内猎聘/智联/校招 JD 与多份行业招聘报告,观点与矩阵是我的整理。目标:让每个工种的学习路径对你完全透明,选哪条分支、怎么 rollout,一张图定。AILLM工程实践
2026年8月8日从 JD 到施工图:公司级大模型路由与评测系统的完整落地方案把米哈游「大模型路由与评测工程师」JD 的六条工作内容翻译成可施工的系统方案:十个模块的职责与接口、六层架构图、三张关键时序图(在线路由、策略灰度、评测闭环)、每个模块的开源选型与自研分界(LiteLLM/semantic-router/RouteLLM/Langfuse/Inspect AI/EvalScope/Promptfoo/GrowthBook),以及一条「先评测后路由」的施工顺序定律和四阶段路线图。决策地图系列「评测路由篇」的施工图姊妹篇。AILLM评测AI Infra系统设计
2026年8月7日Agent 时代的工程学·门禁篇:六道闸门,和一条「不可逆边界」定律决策地图系列第六篇:体系化地做 AI Gates 门禁。先给出第一性分解——门禁 = 判定器 × 执法点,判定器全是评测的蒸馏、执法点应设在不可逆性跃迁的边界上;再沿 AI 系统生命周期排出六道闸门(输入、输出、行动、合入、发布、熔断),每道闸配源头论文与技术代表:Llama Guard、Constitutional Classifiers、NeMo Guardrails、ToolEmu、Progent、Meta TestGen-LLM、promptfoo/Braintrust、Preparedness Framework/RSP、Circuit Breakers。附一张可复用的门禁设计表和四步落地路线。AILLMAgentAI 安全论文深读
2026年8月7日Agent 时代的工程学·评测路由篇:六个决策点,和一条「路由器是评测器的蒸馏」定律决策地图系列第五篇:做 AI Eval 的团队怎么把评测策略下发给 LLM Router?把这条链路拆成六个决策点(信号源、学习目标、路由时机、成本旋钮、路由器验收、闭环与泛化),用「论文→产品」传导链判收敛:Chatbot Arena→RouteLLM→P2L 的 Berkeley 系、MSR Hybrid LLM→Azure Model Router 的微软系、eval 数据→定制路由器的 Not Diamond 系。得到一条新定律:路由器是评测器的在线蒸馏——评测信号有多保真、多便宜,路由就有多强、收敛多快。附四阶段落地路线图。AILLM评测论文深读
2026年8月7日帕累托的两副面孔:LLM 工程里的 80/20 杠杆,和「无法白嫖」的取舍前沿一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。AILLM论文深读
2026年8月6日Agent 写码、Agent 测码:「人力真空」的真名,叫「独立验证真空」如果代码由 agent 写、测试也由 agent 生成,人退出验证环节会不会导致线上故障?本文用九个可核实的来源回答:会,但根因不是「人少了」,而是「独立验证信号少了」。写与测同源时,测试从独立证据退化为自我确认;对冲方案不是把人塞回原位,而是重构验证信号图——这个问题 1983 年就被预言过一次。AILLMAgentAgent 工程论文深读
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月6日Agent 时代的工程学·Infra 篇:六个决策点,和一条从显存到信任的收敛度梯度应用层的六个决策点全部站在 Infra 兑现的承诺上:token 流得出来、动作有地方跑、状态死不掉、身份说得清。本文用同一套「论文→产品」传导链方法,把 Agent Infra 拆成六个决策点逐个判收敛,并合成一条规律:离物理越近的层越收敛,离社会越近的层越不收敛。AILLMAgentAI InfraAgent 工程论文深读
2026年8月6日Agent 时代的工程学·测试篇:六个决策点,和一条「Oracle 梯度」定律决策地图系列第四篇:测试团队被 Agent 时代冲击两次——工具 agent 化、被测对象也 agent 化。把测试拆成六个决策点(测试生成、杀伤力度量、E2E agent 化、fuzzing 算力化、确定性模拟、agent evals),用同一套「论文→产品」传导链判收敛,得到一条新定律:一个测试环节被机器接管的速度,等于它的判定标准(oracle)能被形式化的程度。测试团队的转变,就是沿这条梯度上移。AILLMAgent论文深读
2026年8月6日Agent 时代的工程学·计算层篇:六个决策点,和一条「接口冻结」定律决策地图系列第三篇,钻到最底层:kernel、数值精度、并行策略、解码加速、稀疏架构、RL 训练系统。用同一套「论文→产品」传导链判收敛,并用一个反例修正上一篇的物理-社会梯度:计算层全是物理问题,却仍有不收敛的角落——因为收敛的真正前提不是"离物理近",而是"上游接口已冻结"。AILLMAI Infra论文深读
2026年8月5日Agent 部署架构全景:五种宿主形态、两条横切层,和背后同一个冲突云基础设施默认计算是短时、无状态、可信、调用图静态的——Agent 把四个假设同时打破。本文结合 AIOS、Parrot、Autellix、部署综述(arXiv:2412.13437)等论文,把当前 Agent 部署方式整理成"五种宿主形态 + 两条横切层"的分层地图:进程内嵌入、沙箱化执行、托管运行时、Agent OS、端侧协同,以及 serving 调度层与 MCP/A2A 互联层,并给出选型决策表。AIAgentAI Infra论文深读
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日当 Agent 开始说“物化”:一张大模型工程术语地图从物化、编排、轨迹、检查点到 Harness 和 Verifier,按任务闭环梳理 60 多个 Agent 工程术语,并追问哪些是真问题的新名字、哪些只是旧概念迁移,以及模型为何偏爱这种语言。AILLMAgentAgent 工程论文深读
2026年8月3日Agent 的断点续传:任务如何中断、恢复,并且不把效果丢在路上结合分布式快照、Saga、LogAct、Crab、RAC、Plans Don’t Persist 与 τ-bench,解释 Agent 长任务如何用任务契约、事件日志、副作用账本、恢复对账和外部验证器实现可中断、可恢复且效果可验收。AILLMAgent论文深读