如果只把最近的大模型论文当成排行榜看,很快就会迷路。今天一篇报告说某模型 AIME 更高,明天另一篇报告说 SWE-bench 更强,再过几周又有新模型把表格刷新。真正值得读的不是谁临时第一,而是这些论文共同暴露出来的方向:大模型竞争正在从“把模型做大”,转向“让模型把算力、记忆、工具和验证器用在该用的地方”。
所以这篇不是论文清单,而是一条品读路线。我会把最值得读的论文分成三类:第一类看推理能力怎么被激发,第二类看模型如何产品化成可用系统,第三类看下一代架构在解决什么硬瓶颈。
第一组:推理不是被教会的,而是被激励出来的
如果只能从最近论文里挑一条主线,我会先读推理模型。
第一篇是 DeepSeek-R1。
它值得精读,不是因为榜单分数,而是因为它把一个问题讲清楚了:当数学和代码这类任务有可靠验证器时,模型可以通过强化学习自己发展出长思考、自检、反思和换策略。这里的关键不是“模型会不会写思维链”,而是“什么奖励会让这些行为自然变成高分路径”。
读这篇时不要只盯 GRPO、AIME、蒸馏表格。我更建议带着三个问题读:
- 为什么规则奖励比神经奖励模型更难被钻空子?
- 为什么 R1-Zero 证明了能力上限,而 R1 才是真正可用的产品形态?
- 为什么强模型上长出来的能力,可以通过蒸馏廉价复制给小模型?
这篇适合作为最近所有推理论文的入口。
第二篇是 s1: Simple test-time scaling。
它有意思的地方在于“反复杂”。R1 展示了大规模 RL 的力量,s1 则问:能不能用一个很小的高质量数据集和一个简单的推理预算控制办法,复现一部分 test-time scaling 的效果?
s1 的价值不在于它比谁强,而在于它提醒我们:推理能力不只有“训练更久”这一条路。让模型在测试时多想一会儿、强制它延长或截断思考,本身就是一种控制变量。读这篇时,重点看它如何选择那 1000 道题,以及 budget forcing 为什么能改变模型的行为。
第三篇是 LIMO: Less is More for Reasoning。
LIMO 更像是对“大数据崇拜”的一次反问。论文声称只用 817 条精心筛选的样本,就能在数学推理上取得很强效果。它背后的判断是:如果预训练已经把知识压进模型,后训练样本的价值未必在“覆盖所有知识”,而在“给模型展示应该如何调用已有知识”。
这篇要谨慎读。它不是在说小数据永远优于大数据,而是在提出一个更细的假设:当基座模型已经足够强时,高质量认知模板可能比海量普通样本更有边际价值。 这对个人学习也很有启发:与其囤材料,不如找少量能改变思路的样本反复拆。
第二组:模型报告不只是炫分,它在暴露产品形态
推理能力只是第一步。真正落到用户手里,模型必须处理延迟、成本、多语言、上下文、工具和模态。
第四篇是 Qwen3 Technical Report。
我觉得 Qwen3 值得读,是因为它把“thinking”和“non-thinking”放进了同一个模型框架里,还引入了 thinking budget。这个设计很产品化:用户不应该总是在“普通模型”和“推理模型”之间手动切换,系统应该能在快答和深想之间分配预算。
这背后有一个重要转向:未来模型的关键能力,不只是会不会推理,而是知道什么时候该推理、推理多久、花多少成本推理。如果说 R1 让我们看到“多想会变强”,Qwen3 更像是在问“多想这件事怎么变成可控接口”。
第五篇是 Gemini 2.5。
Gemini 2.5 报告值得读,是因为它把几条线放在同一张图里:高级推理、多模态理解、长上下文、视频输入和 Agent 工作流。单看某个 benchmark,它只是又一篇 frontier model 报告;连起来看,它在说明模型能力的竞争对象已经不是“聊天”,而是更长链条的任务执行。
这篇里最值得品的是它对 benchmark 饱和的焦虑。当前模型进步太快,很多评测很快失效;越难的 benchmark 越依赖专家,也越昂贵。这意味着未来模型竞争会越来越依赖动态评测、真实任务和可执行环境,而不是一张静态卷子。
第六篇是 Gemma 4 Technical Report。
Gemma 4 是截至 2026 年 7 月很新的开放权重路线报告。它值得读的点不是“开源小模型又追上了多少”,而是它把效率问题写得很直白:本地、多模态、长上下文、thinking mode、量化、speculative decoding,这些不是附属功能,而是开放模型能不能普及的地基。
如果你关心端侧模型或私有部署,这篇比很多只看云端大模型的报告更有参考价值。它提醒我们:能力上限很重要,但能否在有限显存、有限延迟、有限成本里跑起来,同样是模型进化的一部分。
第三组:Agent 不是提示词技巧,而是训练目标变了
2025 年以后,“Agent”越来越不像一个产品包装词,而像一类训练目标。
第七篇是 Kimi K2: Open Agentic Intelligence。
Kimi K2 值得精读,是因为它把模型报告写到了软件工程和工具执行的地面上。它不是只说数学、知识、聊天,而是强调 agentic data synthesis、与真实/合成环境交互的强化学习,以及 SWE-bench 这类任务上的表现。
读 Kimi K2 时,我建议抓住一个问题:Agent 能力到底是模型“更聪明”的副产品,还是必须被专门训练出来的技能? 如果把代码修复、工具使用、长程任务都看成可验证环境,那么 Agent 训练就不只是 prompt engineering,而是又一个 RLVR 场景。
第八篇是 GLM-4.5。
GLM-4.5 把自己的关键词写成 ARC:Agentic、Reasoning、Coding。这三个词放在一起很准确。未来很多高价值任务并不是纯聊天,也不是纯数学,而是“先理解目标,再分解任务,再写代码或调用工具,再用外部反馈修正”。
这篇的读法,是把它当作一个系统设计信号:模型厂商已经不再满足于做一个会答题的模型,而是在做一个能进入工程循环的模型。代码能力、推理能力、工具能力会越来越难拆开单独评价。
第四组:真正的瓶颈开始回到架构和记忆
当模型要处理百万 token、长程 Agent、仓库级代码和持续记忆时,传统注意力和 KV cache 会变成硬瓶颈。所以最近一些架构论文值得单独读。
第九篇是 Kimi Linear。
它讨论的是混合线性注意力,核心目标是降低长上下文下的 KV cache 压力,同时保持甚至提升表现。读这篇不要只看“线性注意力是否终于赢了 full attention”这种口号,而要看它怎样在短上下文、长上下文和 RL 场景里做公平比较。
这类论文的价值在于提醒我们:长上下文不是把窗口调大这么简单。窗口越长,内存、吞吐、延迟、训练稳定性都会一起压上来。模型要成为 Agent,架构必须先付账。
第十篇是 Conditional Memory via Scalable Lookup。
这是我觉得很值得盯的一条支线。MoE 用条件计算扩容量,但论文提出的 Engram/conditional memory 更像是在问:模型是不是应该有一种原生的“查表式记忆”机制,而不是把所有知识都塞进神经计算里反复模拟?
这个方向的直觉很朴素:人脑也不是每次都从头推导,很多东西是快速索引、调用、组合。对大模型来说,如果静态知识、局部模式和长上下文检索都能被更便宜地处理,那么 backbone 就能把更多算力留给真正复杂的推理。
我的读法:从论文里提炼四个问题
这些论文放在一起,我会提炼出四个持续追问。
第一,验证器在哪里?
R1、Kimi K2、MiniMax-M1 这类路线都在说明:只要任务能被外部验证,强化学习就有抓手。数学有最终答案,代码有测试,工具任务有状态检查。没有验证器的领域,模型进步会慢很多,也更容易被漂亮话掩盖。
第二,预算怎么分?
s1、Qwen3、Gemini 2.5 都指向同一个问题:不是所有问题都值得深度推理。模型未来要学会按任务分配 thinking budget、上下文预算、工具调用预算和延迟预算。真正好的系统不是永远最强,而是知道何时用强。
第三,能力如何复制?
R1 的蒸馏、Qwen3 的小模型、Gemma 4 的效率设计,都在回答同一个经济学问题:前沿能力如何从昂贵训练迁移到便宜部署。能力创造和能力分发会越来越分工。
第四,记忆放在哪里?
Kimi Linear、Conditional Memory、MiniMax Sparse Attention 这类论文说明,长上下文和 Agent 化会把记忆问题重新推到中心。未来模型不只是参数规模之争,也是 KV cache、稀疏注意力、外部检索、条件记忆和上下文管理之争。
推荐阅读顺序
如果时间有限,我建议按这个顺序读:
- DeepSeek-R1:先建立“可验证奖励如何长出推理”的心智模型。
- s1 和 LIMO:理解小数据、高质量轨迹、test-time compute 对推理的影响。
- Qwen3:看 thinking mode 如何变成可控产品接口。
- Gemini 2.5:看推理、多模态、长上下文和 Agent 如何合流。
- Kimi K2 或 GLM-4.5:看 Agent、代码和 RL 环境化训练。
- Kimi Linear 或 Conditional Memory:最后回到架构,理解为什么长上下文不是免费午餐。
读完这条线,再回头看榜单,你会少很多焦虑。因为你看到的就不再是“今天谁第一”,而是行业正在反复优化的四个底层变量:验证器、预算、可复制能力、记忆结构。
参考论文
- DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning
- s1: Simple test-time scaling
- LIMO: Less is More for Reasoning
- Qwen3 Technical Report
- Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities
- Gemma 4 Technical Report
- Kimi K2: Open Agentic Intelligence
- GLM-4.5: Agentic, Reasoning, and Coding Foundation Models
- MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention
- Kimi Linear: An Expressive, Efficient Attention Architecture
- Conditional Memory via Scalable Lookup
- MiniMax Sparse Attention
- Humanity’s Last Exam
- Large Language Model Reasoning Failures