Scaling 没有死,它换了坐标轴:2026 年 LLM 研究与产品的五条主线
推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。
Archive
推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。
从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。
把 SFT、奖励模型、RLHF-PPO、拒绝采样、DPO、KTO、GRPO 全部写成能逐行读懂的伪代码。你会发现它们是同一个训练循环的六种填法,区别只在三个槽位:回答谁生成、信号谁给、信号怎么变成梯度。文末给出全景对比表和三条真实流水线(InstructGPT、Llama 2、DeepSeek-R1)的组装方式。
这不是投机解码。从 Claude Code 官方文档找到 Haiku 后台调用的直接证据,再借 RouteLLM、FrugalGPT 与 Leviathan/Chen 的投机采样论文,把"小模型替大模型干活"拆成应用层分派、服务层路由、解码层投机三层,并给出一条判别原则:看它会不会以自己的名义出现在你的账单里。
前端建立在"界面由人写、给人看"两个隐含假设上,大模型正在同时拆除它们。结合 Design2Code、Agentic Web、Generative UI 等十余篇论文,推演前端各领域与工程化的整改趋势。
为什么三位数加法这种能力会在模型变大时"突然出现"?沿着 Wei 2022 定名、Schaeffer 2023 质疑(海市蜃楼)、Du 2024 反转(损失阈值)、Michaud 量子模型、grokking 显微镜、Arora & Goyal 技能组合的论文接力,把涌现拆成一个可复用的心智模型:底层的进步几乎总是连续的,"涌现"是连续进步穿过非线性读出面时投下的阶跃阴影。
从 DeepSeek-R1、s1、LIMO、Qwen3、Gemini 2.5、Kimi K2、GLM-4.5 到 Kimi Linear 和 Conditional Memory,整理一条 2025-2026 年大模型论文的品读路线:能力、算力、验证器和 Agent 化如何连成一条主线。
为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。
从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。
结合 next-token 预训练、RLHF、DPO、DeepSeek-R1、Goodhart 定律、reward hacking 和目标泛化失败,用通俗例子解释“目标函数即命运”:模型不会按我们的愿望成长,而会按可优化的信号成长。
按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。
用作业、考试、模运算和训练曲线递归拆解 Grokking:模型为什么会先过拟合,再延迟泛化,为什么看起来像相变,以及它和大模型涌现有什么关系。
Codex 真读真写 · 24 篇原文 / 9 个渠道 / 论文、趋势、技能、工具、行动。这是 Codex 深读版。今天先更新三个判断:第一,agent 训练正在从“做 benchmark”转向“把真实 harness 带进 RL”;第二,多模态模型开始从生成内容外溢到动作预测、机器人和浏览器端运行;第三,健康、企业…
一篇从零开始的 In-Context Learning 深度讲解:模型没有更新权重,却能根据 prompt 里的几个例子临时跟上任务。一个有力解释是,它在上下文里推断当前任务是什么。
如果已经了解 embedding、attention、softmax、LoRA 和 SVD,这篇可以继续往下走:训练动力学、权重空间、内部因果、表示几何、对齐与部署里,还有哪些值得追的大模型数学问题。
从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。
上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。
《Scaling Laws, Carefully》深度消化:为什么深度学习最著名的"定律",两篇奠基论文能得出相反的结论(Kaplan 的 0.73 vs Chinchilla 的 0.5);为什么 Chinchilla 自己也有一个求和写成平均的拟合 bug;以及当"数据无限"假设过期之后,scaling law 正在被改写成什么形状。
Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。我先把今天 7 个渠道的 19 篇正文压成三个判断:一是开源大模型竞争已经从“能否追上”转到“谁能稳供给、稳工作流、稳生态”;二是 agent 提效的瓶颈正从写 prompt 转向写循环、设停机条件、少拥有代码;三是下一波高杠杆数据不只…
从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。
《Harness Engineering for Self-Improvement》深度消化:递归自我改进不会从模型改写自己的权重开始,而是从部署层开始。被优化对象的爬升路径(prompt → context → workflow → harness 代码 → 优化器代码),以及为什么评估器必须留在循环之外。
Codex 真读真写 · 深读判断 / 论文雷达 / 工具 / 行动。这是 Codex 深读版。今天最值得形成的判断不是“谁又发了一个更大的模型”,而是前沿竞争正在转向效率栈、数据生产栈和 agent 运行时三条系统能力:Kimi K3 把开源前沿继续往前推,Lila 把实验室当成数据中心来制造可验证训练数据,vLL…
Kimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。