2026年8月8日InfiniBand:把网络做成集群的内存总线——以及以太网的反杀从 RDMA、无损流控、SHARP 三个第一性设计讲清 InfiniBand 为什么统治了 AI 集群网络,再用 Llama 3、MegaScale、Alibaba HPN、TPU v4 四份一手资料看懂 2024 年以太网阵营的反杀和 Google 的第三条路,最后收束成一条元规律:网络架构是对流量画像的最优编码。AIAI InfraLLM论文深读
2026年8月8日大模型三年半技术路线图:算力的三次搬家(2022.11–2026.08)把 ChatGPT 发布至今的三年半压缩成一张可跳转的时间轴:四次范式接力(对齐→效率→推理→智能体)× 五条暗线(对齐方法、稀疏化、算力搬家、开源时差、接口标准化)。全部 17 个 arXiv ID 经 API 逐一核实,2025 下半年之后的产品日期逐条回查过来源,文末附一条可复现的核实命令。LLMAgent论文深读
2026年8月8日SFT 是解锁器,不是灌装机:从 FLAN 到 LIMO,重新认识监督微调把 2021–2025 年关于监督微调的十一篇关键论文串成一条线索:SFT 用的还是预训练那个交叉熵,它几乎教不会模型新知识——1000 条样本就能对齐(LIMA)、改变的主要是风格 token(URIAL)、硬灌新知识反而教出幻觉(EMNLP 2024)。SFT 的真正身份是解锁器:把预训练已有的能力接上开关。文末给出工程速查表和一个本地就能跑的验证实验。LLM模型训练论文深读
2026年8月7日Agent 时代的工程学·门禁篇:六道闸门,和一条「不可逆边界」定律决策地图系列第六篇:体系化地做 AI Gates 门禁。先给出第一性分解——门禁 = 判定器 × 执法点,判定器全是评测的蒸馏、执法点应设在不可逆性跃迁的边界上;再沿 AI 系统生命周期排出六道闸门(输入、输出、行动、合入、发布、熔断),每道闸配源头论文与技术代表:Llama Guard、Constitutional Classifiers、NeMo Guardrails、ToolEmu、Progent、Meta TestGen-LLM、promptfoo/Braintrust、Preparedness Framework/RSP、Circuit Breakers。附一张可复用的门禁设计表和四步落地路线。AILLMAgentAI 安全论文深读
2026年8月7日Agent 时代的工程学·评测路由篇:六个决策点,和一条「路由器是评测器的蒸馏」定律决策地图系列第五篇:做 AI Eval 的团队怎么把评测策略下发给 LLM Router?把这条链路拆成六个决策点(信号源、学习目标、路由时机、成本旋钮、路由器验收、闭环与泛化),用「论文→产品」传导链判收敛:Chatbot Arena→RouteLLM→P2L 的 Berkeley 系、MSR Hybrid LLM→Azure Model Router 的微软系、eval 数据→定制路由器的 Not Diamond 系。得到一条新定律:路由器是评测器的在线蒸馏——评测信号有多保真、多便宜,路由就有多强、收敛多快。附四阶段落地路线图。AILLM评测论文深读
2026年8月7日帕累托的两副面孔:LLM 工程里的 80/20 杠杆,和「无法白嫖」的取舍前沿一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。AILLM论文深读
2026年8月7日模型里没有一格存着「巴黎」:大模型为什么能学习,学到的东西究竟怎么存两个最根本的问题一次讲清:为什么"预测下一个词+梯度下降"这么笨的办法能学到知识(因为预测即压缩,压缩逼出规则);知识以什么形态存在权重里(不存在任何"格子"里,而是存在高维空间的方向上——MLP 是键值查询台,容量约 2 bit/参数)。附一个亲手可跑的 30 行实验。LLM论文深读
2026年8月6日Agent 写码、Agent 测码:「人力真空」的真名,叫「独立验证真空」如果代码由 agent 写、测试也由 agent 生成,人退出验证环节会不会导致线上故障?本文用九个可核实的来源回答:会,但根因不是「人少了」,而是「独立验证信号少了」。写与测同源时,测试从独立证据退化为自我确认;对冲方案不是把人塞回原位,而是重构验证信号图——这个问题 1983 年就被预言过一次。AILLMAgentAgent 工程论文深读
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月6日Agent 时代的工程学·Infra 篇:六个决策点,和一条从显存到信任的收敛度梯度应用层的六个决策点全部站在 Infra 兑现的承诺上:token 流得出来、动作有地方跑、状态死不掉、身份说得清。本文用同一套「论文→产品」传导链方法,把 Agent Infra 拆成六个决策点逐个判收敛,并合成一条规律:离物理越近的层越收敛,离社会越近的层越不收敛。AILLMAgentAI InfraAgent 工程论文深读
2026年8月6日Agent 时代的工程学·测试篇:六个决策点,和一条「Oracle 梯度」定律决策地图系列第四篇:测试团队被 Agent 时代冲击两次——工具 agent 化、被测对象也 agent 化。把测试拆成六个决策点(测试生成、杀伤力度量、E2E agent 化、fuzzing 算力化、确定性模拟、agent evals),用同一套「论文→产品」传导链判收敛,得到一条新定律:一个测试环节被机器接管的速度,等于它的判定标准(oracle)能被形式化的程度。测试团队的转变,就是沿这条梯度上移。AILLMAgent论文深读
2026年8月6日DeepSeek-V4-Flash 为什么这么快:三代论文对同一个分母的围剿结合 DeepSeek-V4 技术报告(arXiv:2606.19348)与它的论文谱系(MLA→NSA→DSA→CSA/HCA),把 V4-Flash 的"快"拆成一个公式:解码速度 ≈ 带宽 ÷ 每 token 要搬的字节数。所有架构创新都是在砍这个分母的五个因子——激活参数、KV 宽度、看多少条、存多少条、每个数占几位。LLMAI Infra论文深读
2026年8月6日Agent 时代的工程学·计算层篇:六个决策点,和一条「接口冻结」定律决策地图系列第三篇,钻到最底层:kernel、数值精度、并行策略、解码加速、稀疏架构、RL 训练系统。用同一套「论文→产品」传导链判收敛,并用一个反例修正上一篇的物理-社会梯度:计算层全是物理问题,却仍有不收敛的角落——因为收敛的真正前提不是"离物理近",而是"上游接口已冻结"。AILLMAI Infra论文深读
2026年8月5日Agent 部署架构全景:五种宿主形态、两条横切层,和背后同一个冲突云基础设施默认计算是短时、无状态、可信、调用图静态的——Agent 把四个假设同时打破。本文结合 AIOS、Parrot、Autellix、部署综述(arXiv:2412.13437)等论文,把当前 Agent 部署方式整理成"五种宿主形态 + 两条横切层"的分层地图:进程内嵌入、沙箱化执行、托管运行时、Agent OS、端侧协同,以及 serving 调度层与 MCP/A2A 互联层,并给出选型决策表。AIAgentAI Infra论文深读
2026年8月5日一页 API 文档的考古学:八个"进阶功能",三条论文谱系某大模型平台的"进阶使用"页列了八个功能:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。看起来是产品经理排的功能清单,其实是一张考古地图——每个卡片下面都埋着一条"论文→系统→产品"的谱系。本文把八个功能归并成三条:给稀缺资源定价(KV Cache 经济学)、把世界变成 token(表示的进出口)、闭合反馈环(从会说到会做),每条配已核实的 arXiv 论文链,结尾给一套看任何 API 新功能都能用的三问。LLMAI InfraAgent论文深读
2026年8月5日解剖 DeepSeek-R1 的"思考":推理链长什么样、怎么长出来、由什么控制结合 R1 论文(arXiv 与 Nature 版)、GRPO 原始论文和三篇可解释性研究,把 DeepSeek-R1 的内部推理过程拆成一条完整链路:推理时思维链的四段解剖(定义→开花→重构→定案),训练侧 R1-Zero 纯 RL 涌现与 R1 四阶段管线,以及激活空间里可加减的"回溯方向"与锚点句证据。LLM论文深读
2026年8月5日思考深度参数解剖:你调的不是智力,是串行计算的租借额度reasoning_effort、budget_tokens、thinkingBudget——每家大模型 API 都有一个"思考深度"旋钮,但它到底控制内核的什么?结合表达力理论(CoT 扩展固定深度 Transformer 的计算类)、s1 预算强制、L1 长度条件 RL、gpt-oss 的一行提示词实现和激活空间的"思考速度"方向,把这个参数从外壳拆到内核:它不改权重不加层,只控制模型租借多少串行计算步数。LLM论文深读
2026年8月4日记忆的内化:Metis 把 Agent 记忆从提示词搬进前向计算做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。Agent记忆LLM论文深读
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日当 Agent 开始说“物化”:一张大模型工程术语地图从物化、编排、轨迹、检查点到 Harness 和 Verifier,按任务闭环梳理 60 多个 Agent 工程术语,并追问哪些是真问题的新名字、哪些只是旧概念迁移,以及模型为何偏爱这种语言。AILLMAgentAgent 工程论文深读
2026年8月3日Agent 的断点续传:任务如何中断、恢复,并且不把效果丢在路上结合分布式快照、Saga、LogAct、Crab、RAC、Plans Don’t Persist 与 τ-bench,解释 Agent 长任务如何用任务契约、事件日志、副作用账本、恢复对账和外部验证器实现可中断、可恢复且效果可验收。AILLMAgent论文深读
2026年8月3日Agent 如何控制浏览器:从 HTTP、DOM、CDP 到视觉与混合自动化系统拆解 Browser Agent 的控制通道与页面表示:比较 HTTP/API、WebDriver、Playwright、DOM、Accessibility Tree、CDP、浏览器扩展、视觉坐标和 Agent-aware browser runtime,并结合论文讨论评测、安全与选型。AILLMAgent论文深读
2026年8月3日大模型为什么要用 osascript 操作桌面:从可访问性树到视觉 GUI Agent从一条 macOS UI 探测命令出发,解释大模型如何观察、定位、操作并验证桌面软件,比较 Accessibility Tree、视觉坐标、DOM、API/CLI 与混合控制的取舍和局限。AILLMAgent论文深读
2026年8月3日按场景看提示词工程与上下文工程:一个优化问题的两端提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。AILLMPrompt 工程上下文工程Agent论文深读