最近的大模型论文,值得读的不是排行榜

从 DeepSeek-R1、s1、LIMO、Qwen3、Gemini 2.5、Kimi K2、GLM-4.5 到 Kimi Linear 和 Conditional Memory,整理一条 2025-2026 年大模型论文的品读路线:能力、算力、验证器和 Agent 化如何连成一条主线。

如果只把最近的大模型论文当成排行榜看,很快就会迷路。今天一篇报告说某模型 AIME 更高,明天另一篇报告说 SWE-bench 更强,再过几周又有新模型把表格刷新。真正值得读的不是谁临时第一,而是这些论文共同暴露出来的方向:大模型竞争正在从“把模型做大”,转向“让模型把算力、记忆、工具和验证器用在该用的地方”。

所以这篇不是论文清单,而是一条品读路线。我会把最值得读的论文分成三类:第一类看推理能力怎么被激发,第二类看模型如何产品化成可用系统,第三类看下一代架构在解决什么硬瓶颈。

第一组:推理不是被教会的,而是被激励出来的

如果只能从最近论文里挑一条主线,我会先读推理模型。

第一篇是 DeepSeek-R1
它值得精读,不是因为榜单分数,而是因为它把一个问题讲清楚了:当数学和代码这类任务有可靠验证器时,模型可以通过强化学习自己发展出长思考、自检、反思和换策略。这里的关键不是“模型会不会写思维链”,而是“什么奖励会让这些行为自然变成高分路径”。

读这篇时不要只盯 GRPO、AIME、蒸馏表格。我更建议带着三个问题读:

  1. 为什么规则奖励比神经奖励模型更难被钻空子?
  2. 为什么 R1-Zero 证明了能力上限,而 R1 才是真正可用的产品形态?
  3. 为什么强模型上长出来的能力,可以通过蒸馏廉价复制给小模型?

这篇适合作为最近所有推理论文的入口。

第二篇是 s1: Simple test-time scaling
它有意思的地方在于“反复杂”。R1 展示了大规模 RL 的力量,s1 则问:能不能用一个很小的高质量数据集和一个简单的推理预算控制办法,复现一部分 test-time scaling 的效果?

s1 的价值不在于它比谁强,而在于它提醒我们:推理能力不只有“训练更久”这一条路。让模型在测试时多想一会儿、强制它延长或截断思考,本身就是一种控制变量。读这篇时,重点看它如何选择那 1000 道题,以及 budget forcing 为什么能改变模型的行为。

第三篇是 LIMO: Less is More for Reasoning
LIMO 更像是对“大数据崇拜”的一次反问。论文声称只用 817 条精心筛选的样本,就能在数学推理上取得很强效果。它背后的判断是:如果预训练已经把知识压进模型,后训练样本的价值未必在“覆盖所有知识”,而在“给模型展示应该如何调用已有知识”。

这篇要谨慎读。它不是在说小数据永远优于大数据,而是在提出一个更细的假设:当基座模型已经足够强时,高质量认知模板可能比海量普通样本更有边际价值。 这对个人学习也很有启发:与其囤材料,不如找少量能改变思路的样本反复拆。

第二组:模型报告不只是炫分,它在暴露产品形态

推理能力只是第一步。真正落到用户手里,模型必须处理延迟、成本、多语言、上下文、工具和模态。

第四篇是 Qwen3 Technical Report
我觉得 Qwen3 值得读,是因为它把“thinking”和“non-thinking”放进了同一个模型框架里,还引入了 thinking budget。这个设计很产品化:用户不应该总是在“普通模型”和“推理模型”之间手动切换,系统应该能在快答和深想之间分配预算。

这背后有一个重要转向:未来模型的关键能力,不只是会不会推理,而是知道什么时候该推理、推理多久、花多少成本推理。如果说 R1 让我们看到“多想会变强”,Qwen3 更像是在问“多想这件事怎么变成可控接口”。

第五篇是 Gemini 2.5
Gemini 2.5 报告值得读,是因为它把几条线放在同一张图里:高级推理、多模态理解、长上下文、视频输入和 Agent 工作流。单看某个 benchmark,它只是又一篇 frontier model 报告;连起来看,它在说明模型能力的竞争对象已经不是“聊天”,而是更长链条的任务执行。

这篇里最值得品的是它对 benchmark 饱和的焦虑。当前模型进步太快,很多评测很快失效;越难的 benchmark 越依赖专家,也越昂贵。这意味着未来模型竞争会越来越依赖动态评测、真实任务和可执行环境,而不是一张静态卷子。

第六篇是 Gemma 4 Technical Report
Gemma 4 是截至 2026 年 7 月很新的开放权重路线报告。它值得读的点不是“开源小模型又追上了多少”,而是它把效率问题写得很直白:本地、多模态、长上下文、thinking mode、量化、speculative decoding,这些不是附属功能,而是开放模型能不能普及的地基。

如果你关心端侧模型或私有部署,这篇比很多只看云端大模型的报告更有参考价值。它提醒我们:能力上限很重要,但能否在有限显存、有限延迟、有限成本里跑起来,同样是模型进化的一部分。

第三组:Agent 不是提示词技巧,而是训练目标变了

2025 年以后,“Agent”越来越不像一个产品包装词,而像一类训练目标。

第七篇是 Kimi K2: Open Agentic Intelligence
Kimi K2 值得精读,是因为它把模型报告写到了软件工程和工具执行的地面上。它不是只说数学、知识、聊天,而是强调 agentic data synthesis、与真实/合成环境交互的强化学习,以及 SWE-bench 这类任务上的表现。

读 Kimi K2 时,我建议抓住一个问题:Agent 能力到底是模型“更聪明”的副产品,还是必须被专门训练出来的技能? 如果把代码修复、工具使用、长程任务都看成可验证环境,那么 Agent 训练就不只是 prompt engineering,而是又一个 RLVR 场景。

第八篇是 GLM-4.5
GLM-4.5 把自己的关键词写成 ARC:Agentic、Reasoning、Coding。这三个词放在一起很准确。未来很多高价值任务并不是纯聊天,也不是纯数学,而是“先理解目标,再分解任务,再写代码或调用工具,再用外部反馈修正”。

这篇的读法,是把它当作一个系统设计信号:模型厂商已经不再满足于做一个会答题的模型,而是在做一个能进入工程循环的模型。代码能力、推理能力、工具能力会越来越难拆开单独评价。

第四组:真正的瓶颈开始回到架构和记忆

当模型要处理百万 token、长程 Agent、仓库级代码和持续记忆时,传统注意力和 KV cache 会变成硬瓶颈。所以最近一些架构论文值得单独读。

第九篇是 Kimi Linear
它讨论的是混合线性注意力,核心目标是降低长上下文下的 KV cache 压力,同时保持甚至提升表现。读这篇不要只看“线性注意力是否终于赢了 full attention”这种口号,而要看它怎样在短上下文、长上下文和 RL 场景里做公平比较。

这类论文的价值在于提醒我们:长上下文不是把窗口调大这么简单。窗口越长,内存、吞吐、延迟、训练稳定性都会一起压上来。模型要成为 Agent,架构必须先付账。

第十篇是 Conditional Memory via Scalable Lookup
这是我觉得很值得盯的一条支线。MoE 用条件计算扩容量,但论文提出的 Engram/conditional memory 更像是在问:模型是不是应该有一种原生的“查表式记忆”机制,而不是把所有知识都塞进神经计算里反复模拟?

这个方向的直觉很朴素:人脑也不是每次都从头推导,很多东西是快速索引、调用、组合。对大模型来说,如果静态知识、局部模式和长上下文检索都能被更便宜地处理,那么 backbone 就能把更多算力留给真正复杂的推理。

我的读法:从论文里提炼四个问题

这些论文放在一起,我会提炼出四个持续追问。

第一,验证器在哪里?
R1、Kimi K2、MiniMax-M1 这类路线都在说明:只要任务能被外部验证,强化学习就有抓手。数学有最终答案,代码有测试,工具任务有状态检查。没有验证器的领域,模型进步会慢很多,也更容易被漂亮话掩盖。

第二,预算怎么分?
s1、Qwen3、Gemini 2.5 都指向同一个问题:不是所有问题都值得深度推理。模型未来要学会按任务分配 thinking budget、上下文预算、工具调用预算和延迟预算。真正好的系统不是永远最强,而是知道何时用强。

第三,能力如何复制?
R1 的蒸馏、Qwen3 的小模型、Gemma 4 的效率设计,都在回答同一个经济学问题:前沿能力如何从昂贵训练迁移到便宜部署。能力创造和能力分发会越来越分工。

第四,记忆放在哪里?
Kimi Linear、Conditional Memory、MiniMax Sparse Attention 这类论文说明,长上下文和 Agent 化会把记忆问题重新推到中心。未来模型不只是参数规模之争,也是 KV cache、稀疏注意力、外部检索、条件记忆和上下文管理之争。

推荐阅读顺序

如果时间有限,我建议按这个顺序读:

  1. DeepSeek-R1:先建立“可验证奖励如何长出推理”的心智模型。
  2. s1 和 LIMO:理解小数据、高质量轨迹、test-time compute 对推理的影响。
  3. Qwen3:看 thinking mode 如何变成可控产品接口。
  4. Gemini 2.5:看推理、多模态、长上下文和 Agent 如何合流。
  5. Kimi K2 或 GLM-4.5:看 Agent、代码和 RL 环境化训练。
  6. Kimi Linear 或 Conditional Memory:最后回到架构,理解为什么长上下文不是免费午餐。

读完这条线,再回头看榜单,你会少很多焦虑。因为你看到的就不再是“今天谁第一”,而是行业正在反复优化的四个底层变量:验证器、预算、可复制能力、记忆结构。

参考论文