2026年8月12日Prime Agent 内幕:当 Agent 的唯一工具是一个 Python 解释器基于 Prime Agent 主干源码 commit 965941c 的深读:默认工具列表里只有 ["ipython"]——读文件、改代码、开子代理、管记忆全是 Python 表达式。结合 RLM 论文(arXiv 2512.24601)与 Continual Harness 论文(arXiv 2605.09998),看"上下文变成变量、经验变成账本"这两步棋怎么在源码里落地:dill 快照、控制信道防死锁、只许 CRUD 的自我改进、以及 Factorio 里当场翻车的 reward hacking。AgentLLM上下文工程源码阅读
2026年8月12日SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。AI InfraLLMLLM Serving源码阅读
2026年8月11日把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。AILLM评测AI Infra论文深读
2026年8月11日Wilson 下界和它的全家:评测分数的统计地基——分数不是数,是分布评测报告里"5/5 全对"的 95% 置信下界只有 56.6%。以 Wilson 下界为入口,把评测分数背后的整套统计生词(置信区间、配对检验、多重比较、判分者一致性、pass@k 无偏估计、功效分析)钉成四道关卡和一张生词总表,让你以后见到这类词不再发怵。AILLM评测论文深读
2026年8月11日LiteLLM 路由内幕:一行 routing_strategy 如何变成一次具体的模型调用基于 LiteLLM v1.97.0 源码逐行解读模型路由的完整链路:策略字符串怎么被识别成选择器、选择器为什么同时是日志回调、候选部署要过哪十一道漏斗、五种策略各自怎么记账怎么打分、失败怎么触发冷却、重试为什么睡 0 秒——把 config 里那一行配置到一次真实模型调用之间的所有代码打开给你看。AILLMAI Infra源码阅读
2026年8月11日业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。AILLM评测AI Infra论文深读
2026年8月11日读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。AILLMAI Infra论文深读
2026年8月11日把指标写成条款:解剖一份单机高可用 ADR 的八个可靠性决定上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。AI InfraLLM论文深读
2026年8月11日SLO、RTO、RPO 到底在量什么:一条故障时间轴串起可靠性指标全家读 LLM serving 论文撞见 SLO attainment,翻云合同撞见 99.9%,过容灾评审被问 RTO/RPO——三套黑话其实是同一条故障时间轴上的三族刻度。本篇按权威出处(Google SRE 书第 4 章、SRE Workbook 第 5 章、NIST SP 800-34 Rev.1、AWS 容灾白皮书)把指标全家理成三层:承诺层(SLI→SLO→SLA→错误预算→燃烧率,几个 9 换算表亲手验算)、事故层(MTTD/MTTA/MTTR/MTBF/MTTF,含 MTTR 四义歧义警告)、灾难层(RPO 往回量数据、RTO 往前量停机、MTD=RTO+WRT,AWS 四档 DR 策略即公开价目表);再给三族的咬合关系:可用性=MTBF/(MTBF+MTTR) 把事故层折算成承诺层,错误预算是承诺层发给事故层的月度零花钱,BIA 从业务侧倒推 MTD/RTO。LLM 工程挂靠:DistServe 的 goodput 把 SLO 从事后验收变成调度器输入(TTFT/TPOT 双 SLO),训练 checkpoint 间隔就是训练作业的 RPO。元规律「指标即定价」:可靠性指标不是测量工具是谈判工具——SLO 每加一个 9 预算缩十倍,RTO/RPO 每压一个数量级架构贵一档,所有刻度都是业务给不可靠性开出的价格标签。AI InfraLLM
2026年8月11日Veral:把一次模型调用变成可回滚的路由策略一张图读懂公司级 LLM 评测与智能路由平台的理想全貌:在线路由与离线评测如何隔离,Trace 如何变成冻结数据、能力标签和策略版本,以及为什么真正的产品单位是一次可追溯、可灰度、可回滚的策略变化。AILLM评测AI Infra系统设计
2026年8月10日澄清正在长出界面:当 Agent 递给你一张网页用 superpowers 工作流时,Claude Code 会起一个本地页面让你点选确认细节——这不是插件作者的小聪明。同一个动作正在四层同时发生:工具层(AskUserQuestion)、协议层(MCP elicitation → MCP Apps → AG-UI)、生成层(Google Generative UI)、研究层(五篇澄清策略 arXiv)。本文给出第一性解释(界面化打的是人的应答成本,不是 agent 的提问能力)、收敛度判断和三个预见,收束成一条「确认带宽定律」。AgentLLMMCP
2026年8月10日Agent 正在长成一朵云:从八个岗位地图到未来架构的压缩重演预测姊妹篇:上一篇把主 Agent 推理循环拆成八个被专训小模型接管的岗位,这一篇把岗位表贴到云架构图上,发现 Agent 架构正在压缩重演云计算二十年的演化史。四层证据链逐层判收敛:组件层(BAIR 复合 AI 系统宣言→NVIDIA 异构编制)、内核层(AIOS 的 agent syscall、Parrot 的 Semantic Variable、Mooncake 的 P/D 分离)、运行时层(AWS AgentCore/Azure Foundry/Google Agent Engine 六个月内先后 GA,microVM 隔离 + serverless 计费)、协议层(MCP 管南北向、A2A 捐入 Linux 基金会管东西向)。给出三条置信度分级预测(控制面/数据面成为 Agent 默认词汇;模型从架构图中消失变成实例类型;评测成为 Agent 云的类型系统),并收束成一条元规律:抽象复用使演化压缩——后发领域直接借用先行领域付清过发明成本的抽象词汇表,把二十年走成三年。AILLMAgentAI InfraMCP论文深读
2026年8月10日主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。AILLMAgentAI 安全论文深读
2026年8月10日一把 Key 背后:AI 网关到底替你收编了后端栈的哪几层LiteLLM 首页说 "Put your full AI stack behind one key"——这句广告词里的 AI stack 到底指什么?本篇按一次请求的生命周期把网关解剖成六层:协议归一(沙漏模型的窄腰)、身份与预算(virtual key 的凭证间接层)、路由与回退(FrugalGPT 级联 + RouteLLM 偏好路由 + Tail at Scale 对冲)、缓存(GPTCache 语义缓存 vs Prompt Cache 的 KV 缓存分界)、可观测(AgentOps taxonomy + OTel GenAI 语义约定)、防护与治理(Llama Guard + NeMo Guardrails)。每层四段式:根本问题→源头论文→网关落地→收敛度。收束成一条元规律:元数据分界定律——决策输入只需请求级元数据的横切层被网关吸收,需要碰权重/logits/KV 的能力沉入推理引擎;一把 key 买到的只是上半栈。AILLMAI Infra论文深读
2026年8月9日评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。AILLM评测AI Infra系统设计
2026年8月9日从空目录到第一份评测报告:用 Inspect AI 把评测系统真的搭出来(实操陪读篇)评测路由系列的动手篇:30 分钟、七步、每步给完整代码和我本机跑出的真实输出——建 4 条金集 mini 版(字段对齐数据规格书)、用免 API key 的 mockllm 跑通管道、一行参数换真模型/接公司网关、写自定义规则评分器、双模型对比拿到 1.00 vs 0.00、从日志读出请求级标签、CI 门禁脚本。文末给「你刚搭的文件 ↔ 施工图模块」对照表和七问自检清单。全部代码在 inspect-ai 0.3.254 上亲手验证。AILLM评测AI Infra
2026年8月9日数据规格书:把「网关产 Trace,Trace 产评测集,评测产标签」落到字段级施工图篇的下一层细化:四段数据链每段一份可直接建表的规格——五块式 Trace schema(贴 OTel GenAI 属性名 + 路由决策扩展 + 三级采样)、评测集生产漏斗(八类挖掘信号、样本封闭化、审核状态机、版本化)、两种标签的生产口径(Wilson 区间 + 最小样本量 + 失效规则)、路由器偏好对的 SQL 导出与冷启动,以及贯穿全链的「字段三问」数据契约定律。AILLM评测AI Infra系统设计
2026年8月8日从国内历练到硅谷 offer:LLM 工程师的可量化成长路径(细化到周,含身份链决策树)把「技术人的硅谷梦」从愿望改写成一个工程问题:P(offer) = 信号质量 × 管道数量 × 面试转化率 × 身份可行性。本文把四个因子全部拆到可执行单元:技术信号链四阶段(基线审计→地基→信号复利→管道冲刺),每阶段带可量化退出条件;身份链五条路线(L-1/国际hub/H-1B/O-1A/留学)带核实过的数据(FY2026 H-1B 中签率 35.3%、FY2027 改工资加权、O-1A 无配额八判据);每周 12 小时的操作系统、信息流追踪清单、8 周面试冲刺计划、领先/滞后指标仪表盘。姊妹篇《大模型行业工种全景图》负责选工种,本篇负责走到面试桌前。AILLM
2026年8月8日刷到的微软论文是真的吗?——FastContext:AI 写代码最贵的一步,和一篇只活了 18 天的论文从一条短视频出发的事实核查与论文深读:微软 FastContext(arXiv 2606.14066)确有其文——用 4B 小模型专管代码库探索,主代理省 26–60% token、难题解决率 +5.5 分——但它 6 月 12 日提交、6 月 30 日就以「产品 IP」为由撤稿删库。结合 CodeScout、SWE-grep、SWE-Pruner、Agentless、LocAgent,把「代码库探索该由谁来做」这个决策点的四条路线摆上桌:撤稿本身,就是这个方向商业价值最响亮的注脚。AILLM上下文工程论文深读
2026年8月8日高中数学就够了:把梯度下降手算篇的每一步拆到初高中知识点《三个词的词表,十二个参数》的数学陪读篇。把原文用到的全部数学拆成七块积木——下标记号、乘加账单、e 和 ln、softmax、斜率、多旋钮下山、链式法则——每块只用初高中知识搭起来,配可按计算器复现的小例子,装完立刻回扣原文对应公式。结尾附逐符号拆解表和自检清单。数学LLM零基础
2026年8月8日InfiniBand:把网络做成集群的内存总线——以及以太网的反杀从 RDMA、无损流控、SHARP 三个第一性设计讲清 InfiniBand 为什么统治了 AI 集群网络,再用 Llama 3、MegaScale、Alibaba HPN、TPU v4 四份一手资料看懂 2024 年以太网阵营的反杀和 Google 的第三条路,最后收束成一条元规律:网络架构是对流量画像的最优编码。AIAI InfraLLM论文深读
2026年8月8日大模型行业工种全景图:十个岗位的能力矩阵、细化技能与透明学习路径——从公开 JD 反推把 2026 年大模型行业公开招聘的工种摊开成一张可选择的技能树:按「造模型→跑模型→用模型→管模型」四条产线拆出十个工种,每个工种给出能力矩阵(维度×细化技能×代表技术×学习挂靠点)和一个 2–4 周的最小验证项目。数据来自 OpenAI/Anthropic 官方招聘页、国内猎聘/智联/校招 JD 与多份行业招聘报告,观点与矩阵是我的整理。目标:让每个工种的学习路径对你完全透明,选哪条分支、怎么 rollout,一张图定。AILLM工程实践
2026年8月8日从 JD 到施工图:公司级大模型路由与评测系统的完整落地方案把米哈游「大模型路由与评测工程师」JD 的六条工作内容翻译成可施工的系统方案:十个模块的职责与接口、六层架构图、三张关键时序图(在线路由、策略灰度、评测闭环)、每个模块的开源选型与自研分界(LiteLLM/semantic-router/RouteLLM/Langfuse/Inspect AI/EvalScope/Promptfoo/GrowthBook),以及一条「先评测后路由」的施工顺序定律和四阶段路线图。决策地图系列「评测路由篇」的施工图姊妹篇。AILLM评测AI Infra系统设计
2026年8月8日大模型三年半技术路线图:算力的三次搬家(2022.11–2026.08)把 ChatGPT 发布至今的三年半压缩成一张可跳转的时间轴:四次范式接力(对齐→效率→推理→智能体)× 五条暗线(对齐方法、稀疏化、算力搬家、开源时差、接口标准化)。全部 17 个 arXiv ID 经 API 逐一核实,2025 下半年之后的产品日期逐条回查过来源,文末附一条可复现的核实命令。LLMAgent论文深读