2026年8月17日模型配置到底在配置什么:从 Megatron 源码读懂 Config、Spec、Builder 三层基于 Megatron 训练侧 GPTModelConfig/GPTModelBuilder 源码,把「模型配置」拆成三个正交问题:模型长什么样(Config)、每层用哪套实现(Spec)、切成几块放在哪张卡上(Builder)。含词表 padding 手算、layer spec 决策树伪代码和 MTP 支线,末尾给一张读任何训练框架配置都能用的三问速查表。AI InfraLLM源码阅读模型训练
2026年8月17日二十行骨架与四本账:Megatron 预训练主循环源码深读基于 Megatron 训练侧 training.py 真实源码,把预训练主循环拆成「二十行理想骨架 + 四本工程账(记账/容错/性能/并行胶水)」。含 FLOPs 公式与 6ND 的手算对照、packed sequence 的 L² 记账、跨 rank 对齐 GC 等细节,末尾给一张读任何训练框架主循环都能用的六问清单。AI InfraLLM源码阅读模型训练
2026年8月17日Physics of Language Models Part 4.1: Canon Layers 的本质是什么Zeyuan Allen-Zhu 证明了什么被错误地留给了注意力机制,以及如何用轻量级的局部混合打败看似更强大的全局机制论文深读TransformerAI InfraLLM
2026年8月12日SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。AI InfraLLMLLM Serving源码阅读
2026年8月11日把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。AILLM评测AI Infra论文深读
2026年8月11日LiteLLM 路由内幕:一行 routing_strategy 如何变成一次具体的模型调用基于 LiteLLM v1.97.0 源码逐行解读模型路由的完整链路:策略字符串怎么被识别成选择器、选择器为什么同时是日志回调、候选部署要过哪十一道漏斗、五种策略各自怎么记账怎么打分、失败怎么触发冷却、重试为什么睡 0 秒——把 config 里那一行配置到一次真实模型调用之间的所有代码打开给你看。AILLMAI Infra源码阅读
2026年8月11日业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。AILLM评测AI Infra论文深读
2026年8月11日读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。AILLMAI Infra论文深读
2026年8月11日把指标写成条款:解剖一份单机高可用 ADR 的八个可靠性决定上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。AI InfraLLM论文深读
2026年8月11日SLO、RTO、RPO 到底在量什么:一条故障时间轴串起可靠性指标全家读 LLM serving 论文撞见 SLO attainment,翻云合同撞见 99.9%,过容灾评审被问 RTO/RPO——三套黑话其实是同一条故障时间轴上的三族刻度。本篇按权威出处(Google SRE 书第 4 章、SRE Workbook 第 5 章、NIST SP 800-34 Rev.1、AWS 容灾白皮书)把指标全家理成三层:承诺层(SLI→SLO→SLA→错误预算→燃烧率,几个 9 换算表亲手验算)、事故层(MTTD/MTTA/MTTR/MTBF/MTTF,含 MTTR 四义歧义警告)、灾难层(RPO 往回量数据、RTO 往前量停机、MTD=RTO+WRT,AWS 四档 DR 策略即公开价目表);再给三族的咬合关系:可用性=MTBF/(MTBF+MTTR) 把事故层折算成承诺层,错误预算是承诺层发给事故层的月度零花钱,BIA 从业务侧倒推 MTD/RTO。LLM 工程挂靠:DistServe 的 goodput 把 SLO 从事后验收变成调度器输入(TTFT/TPOT 双 SLO),训练 checkpoint 间隔就是训练作业的 RPO。元规律「指标即定价」:可靠性指标不是测量工具是谈判工具——SLO 每加一个 9 预算缩十倍,RTO/RPO 每压一个数量级架构贵一档,所有刻度都是业务给不可靠性开出的价格标签。AI InfraLLM
2026年8月11日Veral:把一次模型调用变成可回滚的路由策略一张图读懂公司级 LLM 评测与智能路由平台的理想全貌:在线路由与离线评测如何隔离,Trace 如何变成冻结数据、能力标签和策略版本,以及为什么真正的产品单位是一次可追溯、可灰度、可回滚的策略变化。AILLM评测AI Infra系统设计
2026年8月10日Agent 正在长成一朵云:从八个岗位地图到未来架构的压缩重演预测姊妹篇:上一篇把主 Agent 推理循环拆成八个被专训小模型接管的岗位,这一篇把岗位表贴到云架构图上,发现 Agent 架构正在压缩重演云计算二十年的演化史。四层证据链逐层判收敛:组件层(BAIR 复合 AI 系统宣言→NVIDIA 异构编制)、内核层(AIOS 的 agent syscall、Parrot 的 Semantic Variable、Mooncake 的 P/D 分离)、运行时层(AWS AgentCore/Azure Foundry/Google Agent Engine 六个月内先后 GA,microVM 隔离 + serverless 计费)、协议层(MCP 管南北向、A2A 捐入 Linux 基金会管东西向)。给出三条置信度分级预测(控制面/数据面成为 Agent 默认词汇;模型从架构图中消失变成实例类型;评测成为 Agent 云的类型系统),并收束成一条元规律:抽象复用使演化压缩——后发领域直接借用先行领域付清过发明成本的抽象词汇表,把二十年走成三年。AILLMAgentAI InfraMCP论文深读
2026年8月10日一把 Key 背后:AI 网关到底替你收编了后端栈的哪几层LiteLLM 首页说 "Put your full AI stack behind one key"——这句广告词里的 AI stack 到底指什么?本篇按一次请求的生命周期把网关解剖成六层:协议归一(沙漏模型的窄腰)、身份与预算(virtual key 的凭证间接层)、路由与回退(FrugalGPT 级联 + RouteLLM 偏好路由 + Tail at Scale 对冲)、缓存(GPTCache 语义缓存 vs Prompt Cache 的 KV 缓存分界)、可观测(AgentOps taxonomy + OTel GenAI 语义约定)、防护与治理(Llama Guard + NeMo Guardrails)。每层四段式:根本问题→源头论文→网关落地→收敛度。收束成一条元规律:元数据分界定律——决策输入只需请求级元数据的横切层被网关吸收,需要碰权重/logits/KV 的能力沉入推理引擎;一把 key 买到的只是上半栈。AILLMAI Infra论文深读
2026年8月9日评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。AILLM评测AI Infra系统设计
2026年8月9日从空目录到第一份评测报告:用 Inspect AI 把评测系统真的搭出来(实操陪读篇)评测路由系列的动手篇:30 分钟、七步、每步给完整代码和我本机跑出的真实输出——建 4 条金集 mini 版(字段对齐数据规格书)、用免 API key 的 mockllm 跑通管道、一行参数换真模型/接公司网关、写自定义规则评分器、双模型对比拿到 1.00 vs 0.00、从日志读出请求级标签、CI 门禁脚本。文末给「你刚搭的文件 ↔ 施工图模块」对照表和七问自检清单。全部代码在 inspect-ai 0.3.254 上亲手验证。AILLM评测AI Infra
2026年8月9日数据规格书:把「网关产 Trace,Trace 产评测集,评测产标签」落到字段级施工图篇的下一层细化:四段数据链每段一份可直接建表的规格——五块式 Trace schema(贴 OTel GenAI 属性名 + 路由决策扩展 + 三级采样)、评测集生产漏斗(八类挖掘信号、样本封闭化、审核状态机、版本化)、两种标签的生产口径(Wilson 区间 + 最小样本量 + 失效规则)、路由器偏好对的 SQL 导出与冷启动,以及贯穿全链的「字段三问」数据契约定律。AILLM评测AI Infra系统设计
2026年8月8日InfiniBand:把网络做成集群的内存总线——以及以太网的反杀从 RDMA、无损流控、SHARP 三个第一性设计讲清 InfiniBand 为什么统治了 AI 集群网络,再用 Llama 3、MegaScale、Alibaba HPN、TPU v4 四份一手资料看懂 2024 年以太网阵营的反杀和 Google 的第三条路,最后收束成一条元规律:网络架构是对流量画像的最优编码。AIAI InfraLLM论文深读
2026年8月8日从 JD 到施工图:公司级大模型路由与评测系统的完整落地方案把米哈游「大模型路由与评测工程师」JD 的六条工作内容翻译成可施工的系统方案:十个模块的职责与接口、六层架构图、三张关键时序图(在线路由、策略灰度、评测闭环)、每个模块的开源选型与自研分界(LiteLLM/semantic-router/RouteLLM/Langfuse/Inspect AI/EvalScope/Promptfoo/GrowthBook),以及一条「先评测后路由」的施工顺序定律和四阶段路线图。决策地图系列「评测路由篇」的施工图姊妹篇。AILLM评测AI Infra系统设计
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月6日Agent 时代的工程学·Infra 篇:六个决策点,和一条从显存到信任的收敛度梯度应用层的六个决策点全部站在 Infra 兑现的承诺上:token 流得出来、动作有地方跑、状态死不掉、身份说得清。本文用同一套「论文→产品」传导链方法,把 Agent Infra 拆成六个决策点逐个判收敛,并合成一条规律:离物理越近的层越收敛,离社会越近的层越不收敛。AILLMAgentAI InfraAgent 工程论文深读
2026年8月6日DeepSeek-V4-Flash 为什么这么快:三代论文对同一个分母的围剿结合 DeepSeek-V4 技术报告(arXiv:2606.19348)与它的论文谱系(MLA→NSA→DSA→CSA/HCA),把 V4-Flash 的"快"拆成一个公式:解码速度 ≈ 带宽 ÷ 每 token 要搬的字节数。所有架构创新都是在砍这个分母的五个因子——激活参数、KV 宽度、看多少条、存多少条、每个数占几位。LLMAI Infra论文深读
2026年8月6日Agent 时代的工程学·计算层篇:六个决策点,和一条「接口冻结」定律决策地图系列第三篇,钻到最底层:kernel、数值精度、并行策略、解码加速、稀疏架构、RL 训练系统。用同一套「论文→产品」传导链判收敛,并用一个反例修正上一篇的物理-社会梯度:计算层全是物理问题,却仍有不收敛的角落——因为收敛的真正前提不是"离物理近",而是"上游接口已冻结"。AILLMAI Infra论文深读
2026年8月5日Agent 部署架构全景:五种宿主形态、两条横切层,和背后同一个冲突云基础设施默认计算是短时、无状态、可信、调用图静态的——Agent 把四个假设同时打破。本文结合 AIOS、Parrot、Autellix、部署综述(arXiv:2412.13437)等论文,把当前 Agent 部署方式整理成"五种宿主形态 + 两条横切层"的分层地图:进程内嵌入、沙箱化执行、托管运行时、Agent OS、端侧协同,以及 serving 调度层与 MCP/A2A 互联层,并给出选型决策表。AIAgentAI Infra论文深读
2026年8月5日一页 API 文档的考古学:八个"进阶功能",三条论文谱系某大模型平台的"进阶使用"页列了八个功能:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。看起来是产品经理排的功能清单,其实是一张考古地图——每个卡片下面都埋着一条"论文→系统→产品"的谱系。本文把八个功能归并成三条:给稀缺资源定价(KV Cache 经济学)、把世界变成 token(表示的进出口)、闭合反馈环(从会说到会做),每条配已核实的 arXiv 论文链,结尾给一套看任何 API 新功能都能用的三问。LLMAI InfraAgent论文深读