2026年8月8日SFT 是解锁器,不是灌装机:从 FLAN 到 LIMO,重新认识监督微调把 2021–2025 年关于监督微调的十一篇关键论文串成一条线索:SFT 用的还是预训练那个交叉熵,它几乎教不会模型新知识——1000 条样本就能对齐(LIMA)、改变的主要是风格 token(URIAL)、硬灌新知识反而教出幻觉(EMNLP 2024)。SFT 的真正身份是解锁器:把预训练已有的能力接上开关。文末给出工程速查表和一个本地就能跑的验证实验。LLM模型训练论文深读
2026年8月7日Agent 时代的工程学·门禁篇:六道闸门,和一条「不可逆边界」定律决策地图系列第六篇:体系化地做 AI Gates 门禁。先给出第一性分解——门禁 = 判定器 × 执法点,判定器全是评测的蒸馏、执法点应设在不可逆性跃迁的边界上;再沿 AI 系统生命周期排出六道闸门(输入、输出、行动、合入、发布、熔断),每道闸配源头论文与技术代表:Llama Guard、Constitutional Classifiers、NeMo Guardrails、ToolEmu、Progent、Meta TestGen-LLM、promptfoo/Braintrust、Preparedness Framework/RSP、Circuit Breakers。附一张可复用的门禁设计表和四步落地路线。AILLMAgentAI 安全论文深读
2026年8月7日Agent 时代的工程学·评测路由篇:六个决策点,和一条「路由器是评测器的蒸馏」定律决策地图系列第五篇:做 AI Eval 的团队怎么把评测策略下发给 LLM Router?把这条链路拆成六个决策点(信号源、学习目标、路由时机、成本旋钮、路由器验收、闭环与泛化),用「论文→产品」传导链判收敛:Chatbot Arena→RouteLLM→P2L 的 Berkeley 系、MSR Hybrid LLM→Azure Model Router 的微软系、eval 数据→定制路由器的 Not Diamond 系。得到一条新定律:路由器是评测器的在线蒸馏——评测信号有多保真、多便宜,路由就有多强、收敛多快。附四阶段落地路线图。AILLM评测论文深读
2026年8月7日三个词的词表,十二个参数:把一次真实的梯度下降全程手算一遍用能装进脑子的最小真实模型(3 词词表、12 个参数的 bigram 语言模型),把生产级训练的一整步走通:前向算损失、反向传播分账(从 p−y 起点到每个参数)、数值梯度检验、SGD 与 AdamW 各更新一步。每个数字都先用脚本验算过,结尾附 40 行可跑的验证脚本和自检清单。LLM数学零基础
2026年8月7日帕累托的两副面孔:LLM 工程里的 80/20 杠杆,和「无法白嫖」的取舍前沿一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。AILLM论文深读
2026年8月7日模型里没有一格存着「巴黎」:大模型为什么能学习,学到的东西究竟怎么存两个最根本的问题一次讲清:为什么"预测下一个词+梯度下降"这么笨的办法能学到知识(因为预测即压缩,压缩逼出规则);知识以什么形态存在权重里(不存在任何"格子"里,而是存在高维空间的方向上——MLP 是键值查询台,容量约 2 bit/参数)。附一个亲手可跑的 30 行实验。LLM论文深读
2026年8月6日Agent 写码、Agent 测码:「人力真空」的真名,叫「独立验证真空」如果代码由 agent 写、测试也由 agent 生成,人退出验证环节会不会导致线上故障?本文用九个可核实的来源回答:会,但根因不是「人少了」,而是「独立验证信号少了」。写与测同源时,测试从独立证据退化为自我确认;对冲方案不是把人塞回原位,而是重构验证信号图——这个问题 1983 年就被预言过一次。AILLMAgentAgent 工程论文深读
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月6日Agent 时代的工程学·Infra 篇:六个决策点,和一条从显存到信任的收敛度梯度应用层的六个决策点全部站在 Infra 兑现的承诺上:token 流得出来、动作有地方跑、状态死不掉、身份说得清。本文用同一套「论文→产品」传导链方法,把 Agent Infra 拆成六个决策点逐个判收敛,并合成一条规律:离物理越近的层越收敛,离社会越近的层越不收敛。AILLMAgentAI InfraAgent 工程论文深读
2026年8月6日Agent 时代的工程学·测试篇:六个决策点,和一条「Oracle 梯度」定律决策地图系列第四篇:测试团队被 Agent 时代冲击两次——工具 agent 化、被测对象也 agent 化。把测试拆成六个决策点(测试生成、杀伤力度量、E2E agent 化、fuzzing 算力化、确定性模拟、agent evals),用同一套「论文→产品」传导链判收敛,得到一条新定律:一个测试环节被机器接管的速度,等于它的判定标准(oracle)能被形式化的程度。测试团队的转变,就是沿这条梯度上移。AILLMAgent论文深读
2026年8月6日DeepSeek-V4-Flash 为什么这么快:三代论文对同一个分母的围剿结合 DeepSeek-V4 技术报告(arXiv:2606.19348)与它的论文谱系(MLA→NSA→DSA→CSA/HCA),把 V4-Flash 的"快"拆成一个公式:解码速度 ≈ 带宽 ÷ 每 token 要搬的字节数。所有架构创新都是在砍这个分母的五个因子——激活参数、KV 宽度、看多少条、存多少条、每个数占几位。LLMAI Infra论文深读
2026年8月6日Agent 时代的工程学·计算层篇:六个决策点,和一条「接口冻结」定律决策地图系列第三篇,钻到最底层:kernel、数值精度、并行策略、解码加速、稀疏架构、RL 训练系统。用同一套「论文→产品」传导链判收敛,并用一个反例修正上一篇的物理-社会梯度:计算层全是物理问题,却仍有不收敛的角落——因为收敛的真正前提不是"离物理近",而是"上游接口已冻结"。AILLMAI Infra论文深读
2026年8月5日深度解读 Agent Swarm:第三条 scaling 轴,和它要交的协调税从蚁群算法到 OpenAI Swarm 的 handoffs、Anthropic 的 orchestrator-worker、Claude Code 的 agent teams,再到 Kimi K2.5 用 RL 把编排策略训练出来——agent swarm 的本质是把推理算力从『纵向想更久』扩展成『横向同时想』。这篇按第一性原理拆:为什么稀缺资源是上下文窗口、协调税记在账本哪一行、以及『何时并行』这件事如何正在从人写规则变成数据学出来。Agent工程实践LLM
2026年8月5日深度解读 Anthropic 内容安全策略:一份宪法的五次编译从 Usage Policy 到 Claude 宪法、Constitutional AI 训练、Constitutional Classifiers 运行时防御、RSP/ASL 升级协议,再到 Clio 遥测闭环——Anthropic 的内容安全不是一份禁止清单,而是把同一份自然语言规约"编译"到系统五个层次的纵深栈。这篇结合官方文档与四篇 arXiv 论文拆它的第一性原理:为什么规则要写给模型自己读、安全如何被标上价格(拒答率 + 推理开销)、以及"让 AI 监督 AI"这个赌注的收益与脆弱处。AI 安全LLM
2026年8月5日一页 API 文档的考古学:八个"进阶功能",三条论文谱系某大模型平台的"进阶使用"页列了八个功能:续写模式、批量推理、视觉定位、上下文缓存、文件输入、云部署 MCP、3D 生成、GUI 任务处理。看起来是产品经理排的功能清单,其实是一张考古地图——每个卡片下面都埋着一条"论文→系统→产品"的谱系。本文把八个功能归并成三条:给稀缺资源定价(KV Cache 经济学)、把世界变成 token(表示的进出口)、闭合反馈环(从会说到会做),每条配已核实的 arXiv 论文链,结尾给一套看任何 API 新功能都能用的三问。LLMAI InfraAgent论文深读
2026年8月5日听懂了 R1 却不踏实?陪读篇:把"思考"兑换成代码、张量形状和手算数字上一篇 R1 解剖文的实现层陪读。R1 的全部"神秘"只由两个循环构成:推理时的采样循环和训练时的 GRPO 循环。这篇把每个抽象名词兑换成具体的东西:chat template 的真实字符串、温度 0.6 改的是哪个数组、一条 32k 思考链的 2.3GB 显存账单、奖励函数的十几行正则、G=4 的优势手算、KL 惩罚的两个数值——读完你能用纸笔把一次推理和一次训练更新走一遍。LLM
2026年8月5日解剖 DeepSeek-R1 的"思考":推理链长什么样、怎么长出来、由什么控制结合 R1 论文(arXiv 与 Nature 版)、GRPO 原始论文和三篇可解释性研究,把 DeepSeek-R1 的内部推理过程拆成一条完整链路:推理时思维链的四段解剖(定义→开花→重构→定案),训练侧 R1-Zero 纯 RL 涌现与 R1 四阶段管线,以及激活空间里可加减的"回溯方向"与锚点句证据。LLM论文深读
2026年8月5日38 天发了 206 篇 AI 博客,一个问题把我问倒了:哪个论断背后有我自己跑出来的数字?一篇自我纠正。我曾以为"不断用 AI 读写博客,似懂非懂也能读成专家"——直到发现自己陷入了 AI 时代特有的新型流畅错觉:写作曾是检验理解的可靠手段,但当 AI 替你把半懂写成全懂的样子,"能产出一篇讲清 X 的文章"就不再是懂 X 的证据。这篇给出病因解剖(三层错觉)、实干型专家的操作性定义(论断-数字账本)、三条纠正规则(评分外置、AI 角色反转)和一个最小实干阶梯。LLMAgent 工程
2026年8月5日思考深度参数解剖:你调的不是智力,是串行计算的租借额度reasoning_effort、budget_tokens、thinkingBudget——每家大模型 API 都有一个"思考深度"旋钮,但它到底控制内核的什么?结合表达力理论(CoT 扩展固定深度 Transformer 的计算类)、s1 预算强制、L1 长度条件 RL、gpt-oss 的一行提示词实现和激活空间的"思考速度"方向,把这个参数从外壳拆到内核:它不改权重不加层,只控制模型租借多少串行计算步数。LLM论文深读
2026年8月4日Eval 是新的 PRD?是的,但规格的缝隙只是搬了家从 VB Transform 2026 的一句口号出发,用三篇论文拆解「Eval 取代 PRD」的真实含义:当产品规格从给人读的散文变成给机器跑的目标函数,Goodhart 定律开始起作用——真正的交付物不是 eval 套件,而是让 eval 与意图持续对齐的闭环。评测工程实践AgentLLM
2026年8月4日「前面看不懂,跳过去」:雷军的学习论,恰好是大模型的训练方式考据雷军 2023 年度演讲里「知识是网状的」这段话的出处,再用七篇论文逐句审计它:LLM 预训练默认乱序打散数据、grokking 证明开窍可以迟到、知识必须被多角度反复遇见才提取得出来。结论:这段话不是鸡汤,它几乎就是预训练的工程实践——但它有三个容易被忽略的前提。LLM
2026年8月4日读 MemOS 源码:记忆的三态、相变,与一个诚实的占位符把 MemTensor 的 MemOS(arXiv:2507.03724)克隆下来,对照论文精读约 9 万行 Python 源码。它的精髓可以压成一张相图:记忆有三态——明文(气态)、激活(液态)、参数(固态),'记忆操作系统'的职责是调度相变。审计结果:明文态是生产级,明文→激活这条相变真实且值钱(TTFT 最高降 94.2%),而参数态在源码里是一个 dump() 时写入 b"Placeholder" 的占位符。这篇按'表示—调度—相变—进化—数字'五层,把论文的承诺和代码的现实逐条对齐。记忆AgentLLMAI Infra
2026年8月4日记忆的内化:Metis 把 Agent 记忆从提示词搬进前向计算做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。Agent记忆LLM论文深读
2026年8月4日概率内核,确定性外壳:五个「可」的伪代码实践承接《Agent 应用工程师的六层》的分水岭判断,把「可观测、可恢复、可验证、可治理、可持续进化」逐个拆成最小工程实现:每个「可」一段伪代码,共享同一个设计原则——状态放内核外面,决策穿过内核,副作用经过关卡。Agent工程实践评测LLM