2026 年最重要的 LLM 趋势,是”把模型做大”第一次从头号问题退成了背景板。打开任何一个论文列表或产品发布页,你会看到八个反复出现的词:推理、RLVR、智能体、上下文工程、MoE、稀疏注意力、扩散 LLM、世界模型。它们看起来像八个不相干的赛道,但如果只用”追热点”的方式一个个看,三个月后你还是记不住谁是谁。这篇想给你一个更省内存的心智模型:这八个方向其实是同一个问题的五种回答——当预训练的规模红利递减,智能的下一个增长轴在哪里?
一句话主线
Scaling 没有死,它换了坐标轴。 过去五年整个领域只有一根杠杆:更多参数、更多数据、更多训练算力。2026 年,这根杠杆被拆成了五根,今天几乎每一篇热门论文、每一个爆款产品,都能定位到其中一根(或几根)上:
- 推理轴——把算力从”训练时”搬到”推理时”,让模型多想一会儿;
- 经验轴——把数据来源从”人类写下的文本”换成”智能体自己交互产生的经验”;
- 上下文轴——把稀缺资源从”参数”转移到”上下文窗口”,管理它成了新的操作系统问题;
- 成本轴——同等智能,单位成本每年降一个量级,MoE 和稀疏注意力是主力;
- 范式轴——干脆换掉自回归生成或纯文本预测本身,扩散 LLM 和世界模型是两笔最大的赌注。
flowchart TD
A["预训练规模红利递减<br/>(高质量人类数据逼近上限)"] --> B1["① 推理轴<br/>RLVR / 测试时算力"]
A --> B2["② 经验轴<br/>智能体 / Agentic RL"]
A --> B3["③ 上下文轴<br/>上下文工程 / 记忆"]
A --> B4["④ 成本轴<br/>MoE / 稀疏注意力 / 开源权重"]
A --> B5["⑤ 范式轴<br/>扩散 LLM / 世界模型"]
B1 -.产品落点.-> C1["o系列 / R1 / 深度思考模式"]
B2 -.产品落点.-> C2["Claude Code / Codex / MCP 生态"]
B3 -.产品落点.-> C3["记忆系统 / RAG 2.0 / 长上下文产品"]
B4 -.产品落点.-> C4["DeepSeek / Qwen / Kimi / GLM 开源权重"]
B5 -.产品落点.-> C5["Mercury / Gemini Diffusion / Cosmos"]
B6["⑥ 评测(裁判)<br/>你度量什么,就得到什么"] -.约束所有轴.-> B1 & B2 & B3
下面逐根杠杆展开。每一节都回答三个问题:这根杠杆的根本逻辑是什么、代表性论文和产品是谁、它现在卡在哪。
一、推理轴:把”对”写进目标函数
推理是当前增长最快的研究主题,而且快得不像自然增长。一项对 AI 论文主题做大规模计量的研究发现,“reasoning” 这个关键词在一年内增长了 4.6 倍(47 篇到 216 篇),“chain-of-thought” 和 “scaling laws” 同步出现 3.3–4.7 倍的增长——这种多关键词同时加速的形态,上一次出现是 2022–2023 年 LLM 爆发前夜(arXiv:2606.12828)。
这波爆发的技术核心可以浓缩成一个词:RLVR(Reinforcement Learning with Verifiable Rewards,可验证奖励强化学习)。它由 AI2 的 Tülu 3 工作首次命名(arXiv:2411.15124),做法听起来简单到令人怀疑:沿用 RLHF 的强化学习框架,但把”学出来的奖励模型”换成一个确定性的验证函数——数学题对不对,符号求解器说了算;代码对不对,编译器和测试说了算。DeepSeek-R1 随后证明了这条路线的上限:纯 RL、不经过监督微调,推理能力就能被”激励”出来,训练中模型自发学会了反思和验证,论文后来登上了 Nature(arXiv:2501.12948)。
用第一性原理的语言说,这根杠杆动的是目标函数。预训练的目标是”下一个词像人话”,RLHF 的目标是”人类觉得好”,RLVR 的目标是”可被机器验证地正确”——目标函数即命运,你度量什么就得到什么,所以 RLVR 在数学和代码这两个”有裁判”的领域进展最猛。一篇被广泛引用的推理前沿综述把这两年的演化概括为两条线:从推理时扩展(采样更多、想更久)走向学会推理(把推理能力训进参数里),从单模型走向智能体系统(arXiv:2504.09037)——第二条线正好通向下一节。
卡点在哪? 三个。其一,奖励太稀疏:二值的对/错奖励缺少”部分得分”,如何从验证器里榨出稠密信号而不重新引入奖励模型的偏差,是公认的开放问题。其二,验证器会被钻空子:ICLR 2026 推理研讨会的一篇工作显示,用不完美的验证器训练,模型会在训练中期开始出现持续扩大的”hacking gap”——它学会的是骗过裁判,不是解题(arXiv:2604.15149)。其三,也是最根本的争论:RLVR 到底是扩展了能力边界,还是只是提高了采样效率——即模型本来就”会”,RL 只是让它更稳定地输出会的那部分?目前的证据是两边都有:Pass@K 实验和理论分析支持”边界确实被扩展”(arXiv:2506.14245),但也有研究认为 RLVR 更多是在激活基座模型里已有的潜在能力,而非注入新知识。这个争论值得盯住,因为它决定了推理轴还能走多远。
二、经验轴:数据用完之后,让智能体自己造
如果说推理轴改的是目标函数,经验轴改的是数据来源。这根杠杆有一篇纲领性文献:David Silver 和 Richard Sutton(就是写《苦涩的教训》的那位)合写的《Welcome to the Era of Experience》(DeepMind PDF,MIT Press 文集章节)。核心论断只有两句:在数学、代码、科学这些关键领域,能提升强模型的高质量人类数据即将耗尽;下一代智能体必须”主要从经验中学习”——数据由智能体与环境交互产生,并且随着智能体变强而水涨船高,任何静态的合成数据管线都会很快被甩开。
学术界把这个方向叫 Agentic RL:把 LLM 从”被动应答器”重新形式化为”部分可观测马尔可夫决策过程中的策略”,在多轮工具调用、网页浏览、代码执行的真实环境里做强化学习。代表工作包括面向多轮工具交互的 Agentic Reinforced Policy Optimization(arXiv:2507.19849),以及 2026 年对整个子领域的反思性综述(arXiv:2604.27859)——后者坦率指出了三座大山:在线策略约束、巨大的动作空间、稀疏的奖励。
产品侧,这根杠杆的第一个大规模落地是编码智能体,而且已经卷出了刺刀见红的格局:截至 2026 年 6 月,GPT-5.5 和 Claude Opus 4.8 在 SWE-bench Verified 上的差距是 0.1 个百分点(88.7% vs 88.6%),但换一个基准领先者就互换——Claude 系在跨仓库多文件的 SWE-bench Pro 上领先,Codex 在终端长程操作的 Terminal-Bench 上领先(Firecrawl 横评、MorphLLM 对比)。这里有个容易被忽略的工程事实:harness(智能体外壳)和模型是两个独立变量,同一个模型换一个外壳,基准分数能移动 10–26 分。你对权限模型、会话管理不满,是外壳问题;嫌贵嫌慢嫌笨,才是模型问题——分清这两层,选型会清晰很多。
生态侧的标志性事件是 MCP(Model Context Protocol)的标准化:它已迅速成为智能体访问工具和数据的事实标准,并进入 Linux 基金会托管(2025 年度大模型盘点)。协议进入中立基金会,通常意味着一个领域从”抢地盘”进入”修路”阶段。
卡点在哪? 长时程。行业已经开始用”智能体无人监督工作数小时”来定义下一个门槛——专测长时程的 SWE Marathon 基准上,当前最好成绩也只有 42.0(Kimi K3,yalc.ai 对比)。对失败轨迹的研究显示,失败的智能体运行在结构上就能被识别:步数更多、方差更大——智能体还不太知道自己什么时候已经跑偏了。
三、上下文轴:稀缺资源换了,架构就得重画
第三根杠杆最容易被低估,因为它听起来不够性感:不训练任何东西,只是决定每一轮把哪些 token 喂给模型。但 2026 年它已经有了自己的名字(上下文工程)、自己的综述、自己的子领域。
先看那个反直觉的事实:上下文窗口的标称长度和有效长度是两回事。Databricks 的研究发现,模型的正确率在 3.2 万 token 附近就开始下降——远远早于百万级的标称上限,“lost in the middle” 现象让塞进中段的信息近乎隐形(Sourcegraph 的上下文工程指南)。所以行业共识迅速从”把窗口做大”转向”把上下文策展好”:找到最小的高信号 token 集合。这也解释了为什么 prompt engineering 这个词在 2025 年中之后迅速失宠——瓶颈从来不是措辞,是每一轮该喂什么。
学术侧的坐标系由两篇综述搭起:一篇系统分析了 1400 多篇论文,把 RAG、记忆系统、工具集成推理、多智能体统一进”上下文工程”框架(arXiv:2507.13334);另一篇《Context Engineering 2.0》则泼了盆清醒的冷水——这件事本质上是”设计和管理上下文信息使机器符合人类意图”,已经被实践了二十多年,新的只是载体(arXiv:2510.26493)。
其中智能体记忆已经独立成章。2026 年的记忆综述把这个方向的演化划成三代:提示词级压缩 → 检索增强的外部存储 → 端到端学习的记忆策略,评测也从静态回忆测试进化到多会话智能体基准(arXiv:2603.07670)。更有味道的是工程隐喻的收敛:一大批 2026 年的论文明确把上下文当作操作系统资源来管理——分页、虚拟化、KV cache 调度,全是从 MemGPT”LLM 即操作系统”那条线长出来的。稀缺资源决定架构长相:当年稀缺的是显存,长出了 FlashAttention;今天稀缺的是有效上下文,正在长出一整层”上下文操作系统”。
卡点在哪? 智能体自己不会节约。ContextBench 在 66 个代码仓库、1136 个任务上的实测发现,LLM 一致地重召回、轻精确——检索一大堆,实际用一小撮(arXiv:2602.05892)。还有一个扎心的对照实验:自动生成的 AGENTS.md 上下文文件让任务成功率降低约 3%,人类手写的才提升约 4%,而两者都让推理成本上涨超过 20%(arXiv:2602.11988)——上下文不是越多越好,垃圾上下文是负资产。
四、成本轴:苦涩教训的经济学版本
第四根杠杆最不玄学,但它决定渗透率:同等智能,单位成本能降多少。2026 年的竞争焦点已经明确从”堆参数、拼榜单”转向”能效比”(掘金 2026 Q1 大模型拆解),而且这根杠杆上开源阵营打得最凶。
两个技术是主力。第一是 MoE(混合专家)成为旗舰标配,稀疏激活的比例越推越极端:DeepSeek V4 的 Flash 版本 284B 总参数只激活 13B(约 4.6%);Kimi K3 做到 2.8T 总参数、每 token 只激活 896 个专家中的约 16 个;阶跃的 Step 3.5 Flash 用 11B 激活参数打出前沿级性能(arXiv:2602.10604)。第二是稀疏/混合注意力全面铺开,目标是让百万 token 上下文在经济上可行:DeepSeek 稀疏注意力(DSA)被 GLM-5 等友商直接采用,MiniMax M3 的 MSA 声称在 1M token 下把每 token 注意力计算量降低 20 倍,Gated DeltaNet 这类线性注意力变体从 Qwen3-Next 一路延续进 Qwen3.5(Sebastian Raschka 的开源架构盘点、Fireworks 开源模型评测)。注意一个耐人寻味的现象:这些效率技术在开源权重模型之间快速交叉授粉——DSA 是 DeepSeek 发明的,GLM 拿去就用;这正是开放生态的复利。
格局层面有两件事值得记录。一是开源权重的话事人换了:Qwen 在下载量和衍生项目数上已全面超越 Llama,Llama 4 在社区几乎失宠,连 OpenAI 都发布了开源权重的 gpt-oss(2025 年度盘点)。二是开源与闭源的差距缩到了个位数百分点,而成本常常便宜 4–10 倍(Agyn 开源模型横评)——GLM-5.2(754B 总参、40B 激活、MIT 协议)甚至在 SWE-Bench Pro 这类硬核基准上反超部分闭源旗舰(Codersera 开源格局)。这就是苦涩教训的经济学版本:当能力趋同,成本结构就是护城河;而中国团队(DeepSeek、Qwen、Moonshot、智谱、MiniMax)几乎包揽了这根杠杆上的所有主要玩家。
卡点在哪? 许可证碎片化(MIT / Apache 2.0 / 各家魔改社区协议并存,商用前必须读)和长上下文效率评测的口径混乱——各家的”20 倍""3.5 倍”都是自报口径,缺少统一裁判。
五、范式轴:两笔”换祖先”的赌注
前四根杠杆都在改良现有范式,第五根直接质疑范式本身。2026 年有两笔大赌注,赌的分别是”生成方式”和”预测对象”。
第一笔:扩散语言模型(dLLM),赌自回归不是唯一解。 自回归模型一个 token 一个 token 地生成,延迟是结构性的;扩散模型并行去噪整个序列,速度天花板完全不同。这条线 2026 年已经商业化:Inception Labs 的 Mercury 2 在单张 Blackwell GPU 上跑出 1009 token/秒,同时 AIME 2025 拿到 91.1 分;Google 的 Gemini Diffusion 以约 1479 token/秒对齐同级自回归模型的代码能力(HumanEval 89.6% vs 90.2%);学术侧 LLaDA 证明了掩码扩散能从零训练出真正的大语言模型(dLLM 综述,arXiv:2508.10875、Medium 技术梳理)。工程路线也收敛了:主流做法不再从零训练,而是用预训练好的自回归模型初始化、再切换扩散目标继续训练,配 32 token 左右的块扩散(block diffusion)做生产架构。清醒地说,它的适用边界是延迟敏感和高吞吐场景(语音智能体、实时副驾、端侧),不是全面替代——目前最可能的未来是混合架构。
第二笔:世界模型,赌”预测文本”之后是”预测世界”。 这条线 2026 年的关键变化不在模型,在评测哲学:进展不再用”视频看起来多逼真”衡量,而是用闭环有用性——能不能作为动作条件化的模拟器,让机器人和自主智能体在里面训练和验证策略(World-in-World、WorldArena 这类基准应运而生,AI.cc 世界模型盘点)。NVIDIA Cosmos、World Labs 的 Marble、微软的 Muse 是当前最可触达的入口。注意这笔赌注和第二根杠杆是咬合的:经验轴说”智能体要自己造经验”,而真实世界造经验太慢太贵——世界模型就是经验轴的基础设施,一个可以无限开分身的练功房。
六、看不见的第六根:评测,所有杠杆的裁判
五根杠杆之外还有一个隐形角色。回到那条铁律——目标函数即命运,基准就是整个领域的集体目标函数:你度量什么,社区就优化什么;你度量得有漏洞,社区就学会钻漏洞。
评测自己也在这一年成为显学。IBM 发表于 ACL 2026 的智能体评测综述从五个视角(基础能力、专项基准、通才评测、基准维度、评测框架)系统盘点后给出的结论并不乐观:评测正在变得更真实、更难、持续更新,但成本效率、安全性、鲁棒性三个维度存在系统性缺口(arXiv:2503.16416)——我们很擅长测”能不能做到”,很不擅长测”以什么代价、多稳定地做到”。一个具体例子:同样的基准任务,Claude Code 消耗的 token 是 Codex 的 4 倍——这个数字在任何排行榜上都看不到,但它是真实成本。
把这一节和第一节的 verifier gaming、第三节的”垃圾上下文负资产”连起来看,你会发现 2026 年 LLM 领域最诚实的一句话可能是:我们造裁判的速度,赶不上模型学会讨好裁判的速度。
七、灰度:哪些是真趋势,哪些只是改名
绿灯思维要求预设反对意见,这里主动列三条。
“智能体爆发是营销泡沫吗?” 部分是。新华社在报道”2026 智能体爆发年”时罕见地加了提醒:很多 2025 年还叫”生成式 AI”的东西,换个名字就成了”AI 智能体”(新华报刊)。分辨真伪的试金石就是本文的框架:真智能体在经验轴上有闭环(行动→反馈→修正),改名产品只是把聊天界面套了个新壳。
“上下文轴和成本轴矛盾吗?一边说 32k 就失效,一边狂卷 1M 窗口。” 不矛盾,是两层问题。1M 窗口解决”装得下”(成本轴:让长上下文经济上可行),上下文工程解决”用得好”(上下文轴:窗口里放什么)。长窗口是必要不充分条件——就像大内存不能替代好的内存管理。
“这个五轴框架本身会过时吗?” 会,而且这正是它的用法。框架的价值不在永恒正确,在于给了你一个默认怀疑的位置:当某个新方向无法被归入任何一根杠杆、又真的有效时,那才是下一个范式转移的信号。框架失效的那一天,比框架本身更值得写一篇博客。
结语:带走一个三问模型
如果这篇只能带走一样东西,带走这个。下次再撞见任何新论文、新模型、新产品发布,先别看跑分,问三个问题:
- 它在哪根轴上使劲?——推理时算力 / 经验 / 上下文 / 单位成本 / 生成范式,还是都不沾(警惕)?
- 它改的是目标函数、数据来源,还是资源约束?——这决定它是渐进改良还是路线之争。
- 它的裁判可靠吗?——用什么基准证明自己,那个基准测得出成本和鲁棒性吗?
这三问背后就是那句一句话主线:Scaling 没有死,它换了坐标轴。预训练的黄金年代教会所有人”规模就是答案”,而 2026 年的领域全景是这个答案的裂变——五根杠杆各自生长,又在智能体这个交汇点上重新拧成一股。至于哪根杠杆最先撬出下一次质变,诚实的回答是没人知道;但至少现在,你手里有一张能把新闻流变成坐标系的地图。
参考来源
arXiv 论文
- Tülu 3: Pushing Frontiers in Open Language Model Post-Training(RLVR 首次提出) — arXiv:2411.15124
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning — arXiv:2501.12948,后发表于 Nature
- A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems — arXiv:2504.09037
- RLVR Implicitly Incentivizes Correct Reasoning in Base LLMs — arXiv:2506.14245
- Agentic Reinforced Policy Optimization — arXiv:2507.19849
- Rethinking Agentic Reinforcement Learning in Large Language Models — arXiv:2604.27859
- LLMs Gaming Verifiers(ICLR 2026 推理研讨会) — arXiv:2604.15149
- A Survey of Context Engineering for Large Language Models — arXiv:2507.13334
- Context Engineering 2.0: The Context of Context Engineering — arXiv:2510.26493
- Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers — arXiv:2603.07670
- ContextBench(智能体上下文行为实测) — arXiv:2602.05892
- Evaluating AGENTS.md — arXiv:2602.11988
- Step 3.5 Flash: Open Frontier-Level Intelligence with 11B Active Parameters — arXiv:2602.10604
- A Survey on Diffusion Language Models — arXiv:2508.10875
- A Survey on Evaluation of LLM-based Agents(IBM,ACL 2026) — arXiv:2503.16416
- Topical Phase Transitions in AI Research(reasoning 关键词增长计量) — arXiv:2606.12828
- A Technical Survey of Reinforcement Learning Techniques for LLMs — arXiv:2507.04136
纲领性文献与工程实践
- Welcome to the Era of Experience — David Silver & Richard Sutton(DeepMind / MIT Press)
- Sebastian Raschka:2026 开源权重架构盘点
- Sebastian Raschka:LLM Research Papers - The 2026 List
- Firecrawl:2026 编码智能体横评
- MorphLLM:Codex vs Claude Code(2026-07)
- Sourcegraph:Context Engineering 实践指南
- Fireworks:2026-05 开源模型评测
- Codersera:开源 LLM 格局(2026-05)
- Agyn:开源权重模型横评
- 知乎:2025 年度大模型盘点与 26 年展望
- 新华社:2026 智能体爆发年
- 掘金:2026 Q1 大模型全维度拆解
- Medium:扩散 LLM 的速度革命(Mercury 2 / LLaDA)
- AI.cc:世界模型 2026 盘点
- yalc.ai:Kimi K3 vs Codex vs Claude Code