把 2022 年 11 月到 2026 年 8 月的大模型史压缩成一句话:算力搬了三次家。先花在预训练上(scaling laws 时代),再搬到推理时(o1/R1 的”多想一会儿”),最后搬到任务时(智能体一干就是几小时)。每次搬家都有明确的标志性产物,也都把上一个时代的稀缺资源变成了便宜的地基。这篇给出完整时间轴:每个节点配一句”为什么重要”和一手来源链接。
一句话主线
三年半 = 四棒接力:先教模型”听话”(对齐),再让它”便宜”(MoE/开源),再让它”会想”(test-time compute),最后让它”会干活”(Agent)。每一棒的起点,都是上一棒把某种稀缺资源打成了白菜价。
这个”四棒”划分是我的读法(观点),但每一棒的节点日期和论文都是核实过的事实——两者在下文分开标记。
顶层视图
timeline
title 四棒接力 × 算力的三次搬家(2022.11 – 2026.08)
section 第一棒 · 对齐时代<br>算力在预训练
2022.11 : ChatGPT(RLHF)
2023 : LLaMA 开源生态
: DPO / QLoRA 对齐平民化
section 第二棒 · 架构效率+多模态<br>算力开始搬向推理时
2024 : MoE / 长上下文 / GPT-4o
: o1 —— test-time compute
section 第三棒 · 推理RL+Agent元年<br>算力搬向任务时
2025 : DeepSeek-R1 纯RL推理
: MCP 生态 / 编码 Agent
section 第四棒 · 智能体成熟期
2026 : 超长任务 / 1M 上下文
: 前沿进入季度迭代
用AI 顶级原理的透镜看,这条时间轴主要在三条原理上做文章:目标函数演化(下一个词 → 人类偏好 → 可验证奖励)、算力换智能(训练期 → 推理期 → 任务期)、复用与组合(开放权重 → 蒸馏 → 工具协议)。下面逐棒展开。
第一棒:对齐时代(2022.11 – 2023.12)
核心问题:怎么把一个只会续写的预训练模型变成助手? 答案的技术含量没有想象中高——这正是《SFT 是解锁器,不是灌装机》整篇在讲的事:能力早就在预训练里了,对齐只是接上开关。
| 时间 | 技术 / 产物 | 为什么重要 | 一手来源 |
|---|---|---|---|
| 2022.11.30 | ChatGPT(RLHF 三段法:SFT→RM→PPO) | 范式原点;方法论来自 InstructGPT | OpenAI / InstructGPT |
| 2022.12 | Constitutional AI(RLAIF) | 用 AI 反馈替代人工标注,Claude 系的技术底座 | arXiv 2212.08073 |
| 2023.02 | LLaMA 1(开放权重,7B–65B) | 开源生态的种子;之后所有微调研究的基底 | arXiv 2302.13971 |
| 2023.03 | GPT-4 | 闭源能力天花板确立,此后 16 个月无人接近 | 技术报告 |
| 2023.03 | Alpaca(52k 样本 SFT 蒸馏) | 证明几百美元的 SFT 蒸馏就能得到”像样的助手” | Stanford CRFM |
| 2023.05 | DPO | 把 RLHF 的 RM+PPO 两步压成一个分类损失,对齐平民化 | arXiv 2305.18290 |
| 2023.05 | QLoRA | 4-bit 量化 + LoRA,单卡 48GB 微调 65B 成为可能 | arXiv 2305.14314 |
| 2023.07 | Llama 2(可商用 + 公开 RLHF 细节) | 开源第一次拿到完整对齐配方 | arXiv 2307.09288 |
| 2023.09 | Mistral 7B(滑动窗口注意力、GQA) | “小模型 + 精数据”路线的代表作 | arXiv 2310.06825 |
| 2023.12 | Mixtral 8x7B(开源 MoE) | MoE 平民化起点,为第二棒预热 | arXiv 2401.04088 |
| 2023.12 | Mamba(选择性状态空间模型) | 对 Transformer 的第一次严肃架构挑战 | arXiv 2312.00752 |
这一棒结束时的状态:对齐从”OpenAI 的秘方”变成了”人人会做的标准工序”——稀缺资源被打掉了,竞争必须换战场。
第二棒:架构效率 + 多模态(2024)
核心问题:预训练 scaling 边际递减后,钱往哪儿花? 2024 年给出三个答案(稀疏化、长上下文、原生多模态),年底 o1 意外开出第四条路。
| 时间 | 技术 / 产物 | 为什么重要 | 一手来源 |
|---|---|---|---|
| 2024.02 | Gemini 1.5 Pro(1M 上下文,MoE) | 长上下文军备竞赛开始 | arXiv 2403.05530 |
| 2024.02 | Sora(视频生成,Diffusion Transformer) | 生成式多模态出圈事件 | OpenAI |
| 2024.02 | GRPO(DeepSeekMath 提出) | 去掉 value model 的 RL 算法——一年后成为 R1 的引擎 | arXiv 2402.03300 |
| 2024.05 | GPT-4o(端到端音频、原生多模态) | “拼接式多模态”→“原生多模态”的分水岭 | OpenAI |
| 2024.07 | Llama 3.1 405B | 开源首次摸到 GPT-4 水位;训练系统细节极详尽——InfiniBand 与训练网络那篇引用的 RoCE 集群实践正出自这篇论文 | arXiv 2407.21783 |
| 2024.09 | OpenAI o1 —— test-time compute 范式 | 算力第一次从训练期搬到推理期:“思考越久越聪明”被产品化 | OpenAI |
| 2024.10 | Claude Computer Use | Agent 操作真实电脑的第一个商用尝试 | Anthropic |
| 2024.11 | MCP(Model Context Protocol) | Agent 时代的”USB 接口”,后来成为事实标准 | Anthropic |
| 2024.12 | DeepSeek-V3(MLA + FP8 + 671B MoE) | 论文口径 278.8 万 H800 GPU 小时(约 557.6 万美元)训出旗舰——架构工程把成本打下一个数量级 | arXiv 2412.19437 |
这一棒的隐藏剧情是 GRPO:2024 年 2 月它只是数学模型论文里的一个算法改进,没人想到它是下一棒的发令枪。
第三棒:推理 RL + 智能体元年(2025)
核心问题:推理能力如何规模化?智能体如何落地? 这一年信息密度最高,也是为什么大模型需要强化学习那篇的现实注脚。
| 时间 | 技术 / 产物 | 为什么重要 | 一手来源 |
|---|---|---|---|
| 2025.01.20 | DeepSeek-R1(纯 RL 涌现推理,MIT 协议) | 复现 o1 且公开配方:AIME 2024 达 79.8%(论文口径,o1-1217 为 79.2%);1 月 27 日引发英伟达单日市值蒸发约 6000 亿美元(多家媒体报道) | arXiv 2501.12948 |
| 2025.02.24 | Claude 3.7 Sonnet + Claude Code(研究预览) | 混合推理(快/慢思考合一)+ 编码智能体进入终端 | Anthropic |
| 2025.03 | METR 任务时长研究 | 提出 task horizon 指标:AI 能完成的任务时长每约 7 个月翻倍——衡量 Agent 能力最重要的单一数字 | arXiv 2503.14499 |
| 2025.03.25 | Gemini 2.5 Pro(thinking 默认开启) | 推理模式从”可选”变”默认” | |
| 2025.04 | Qwen3(0.6B–235B 全家桶,MoE + 双模式思考) | 开源生态重心向中国模型倾斜的标志 | arXiv 2505.09388 |
| 2025.05.22 | Claude 4(Opus/Sonnet)+ Claude Code GA | 编码智能体从 demo 变成日常生产工具 | Anthropic |
| 2025.08 | GPT-5(快/慢模型自动路由)+ gpt-oss(OpenAI 重返开源,Apache 2.0) | “该用哪个模型”被产品收编为路由问题——从评测到路由那篇讨论的正是这个决策点 | GPT-5 / gpt-oss |
| 2025.08.21 | DeepSeek-V3.1 | 开源阵营的推理/非推理混合路线跟进 | Wikipedia: DeepSeek |
| 2025.09.29 | Claude Sonnet 4.5 | 年末前沿三连发第一枪 | Wikipedia: Claude |
| 2025.11.18 | Gemini 3 Pro(12.03 追加 Deep Think) | Pro 档取代 Ultra 档;深思考成独立产品档位 | Wikipedia: Gemini |
| 2025.11.24 | Claude Opus 4.5 | 年末三连发收尾,前沿差距压缩到”周”级 | Wikipedia: Claude |
第四棒:智能体成熟期(2026.01 – 2026.08)
核心问题:超长任务 + 成本效率。 竞争焦点从”谁更聪明”转向”谁能便宜地干完一整天的活”——这也是什么是好的 Agent Harness 和智能体工程决策图谱关心的工程层。
| 时间 | 技术 / 产物 | 为什么重要 | 一手来源 |
|---|---|---|---|
| 2026.02.05 | GPT-5.3-Codex 与 Claude Opus 4.6 同日发布 | 专职编码 Agent 模型成为独立产品线,且两家开始贴身竞争 | Wikipedia: GPT-5.3-Codex / Wikipedia: Claude |
| 2026.02.19 | Gemini 3.1 Pro | 前沿三家进入”季度迭代”节奏 | Wikipedia: Gemini |
| 2026.04.16 | Claude Opus 4.7 | 季度迭代节奏的又一例 | Wikipedia: Claude |
| 2026.04.23 | GPT-5.5 | FrontierMath Tier 4 达 35.4%(OpenAI 自报口径)——前沿数学推理逼近专业研究水位 | Wikipedia: GPT-5.5 |
| 2026.04.24 | DeepSeek-V4 预览(V4-Pro 1.6T 总参/49B 激活;V4-Flash 284B/13B;均 1M 上下文) | 极限稀疏比(激活约 3%)+ 长上下文平民化 | Wikipedia: DeepSeek |
| 2026.07.24 | Claude Opus 5 | 当前(本文发布时)前沿旗舰之一 | Wikipedia: Claude |
一段猜想(明确标注为猜想):如果 task horizon 翻倍规律继续成立,第五棒大概率是”多智能体组织”——单体模型能干一天的活之后,瓶颈会移到分工、验证与知识沉淀,就像人类组织的演化。这没有任何已验证证据,只是外推。
五条暗线:贯穿三年半的元规律
时间轴是”发生了什么”,暗线是”为什么会这样”。这五条都能一句话说清,也都能预测下一步。
1. 对齐方法演化 = 不断删掉昂贵组件。 RLHF(PPO) 需要四个模型 → DPO 删掉 RM 和 PPO → GRPO 删掉 value model → R1 删掉过程奖励和 MCTS,只留规则奖励。方向感极强:谁能用更少的组件拿到同样的对齐效果,谁就赢下一轮。
2. 稀疏化 = 用通信换算力。 Dense → Mixtral(8 选 2 专家)→ DeepSeek 细粒度专家 + MLA → V4 的 1.6T/49B(激活比约 3%)。代价是 all-to-all 通信压力——InfiniBand 那篇讲的”流量画像塑造网络”在 MoE 上体现得最彻底。
3. 算力搬家 = 本文主线。 训练期 scaling(Chinchilla 定律时代)→ 推理期 scaling(o1/R1,2024.09 起)→ 任务期 scaling(Agent task horizon,2025 起)。每次搬家,上一站的成果都变成下一站的地基而非战场。
4. 开源-闭源时差在收敛。 GPT-4(2023.03)到 Llama 3.1 405B 摸到同水位(2024.07)用了约 16 个月;o1(2024.09)到 R1(2025.01)只用了 4 个月——这是我的粗略读法(观点),“同水位”的判定见各论文的基准对照表。到 2026 年,Qwen/DeepSeek 与闭源旗舰在公开基准上已互有胜负。
5. 接口标准化 = 溢价从模型转移到生态。 ChatML → function calling → MCP(2024.11)。当模型能力差距压缩到”周”级,护城河就变成了工具生态和 harness 质量——这正是Agent 基建决策图谱的立论前提。
带得走的总表
| 时代 | 稀缺资源 | 标志性解法 | 被打成地基后开启 |
|---|---|---|---|
| 对齐(2023) | 对齐配方 | RLHF → DPO/QLoRA | 人人可训助手 → 竞争转向效率 |
| 效率(2024) | 训练算力成本 | MoE/MLA/FP8 | 便宜的强模型 → 竞争转向推理 |
| 推理(2025) | 推理能力 | test-time compute + 可验证奖励 RL | 会想的模型 → 竞争转向任务 |
| 智能体(2026–) | 任务时长与可靠性 | harness/MCP/超长上下文 | (进行中) |
读任何一条新模型发布公告时,可以先问:它在哪一棒上做文章?它假设哪种资源已经是地基? 这两个问题基本能定位它的技术野心。
诚实的提醒
- 日期精度分级:精确到日的条目(如 2025.01.20、2026.04.23)均在本文写作当天回查过 Wikipedia 发布表或官方页;只写到月的条目(如 GPT-4o 2024.05、MCP 2024.11)来自训练记忆 + arXiv ID 月份推定,未逐日回查。
- 全部 17 个 arXiv ID 经 arXiv API 逐一核实,标题与论文一一对应。你可以用一条命令复现这个核实(成本最低的验证实验):
curl -sL "https://export.arxiv.org/api/query?id_list=2203.02155,2302.13971,2303.08774,2305.18290,2307.09288,2401.04088,2402.03300,2412.19437,2501.12948,2503.14499" | grep "<title>"
- 未亲手复现的数字:R1 的 AIME 79.8%、GPT-5.5 的 FrontierMath 35.4%、DeepSeek-V3 的 557.6 万美元训练成本,均为论文/厂商自报口径;英伟达单日市值蒸发约 6000 亿美元为媒体报道口径。“2025 年初模型可完成约 30 分钟任务、年末约 5 小时”这一说法来自二手时间线综述,我未回查 METR 原始数据点,故只在此提及、未写入正文表格。
- 2026 年条目的一手来源以 Wikipedia 发布表为主(官方发布页分散且部分需登录),若你要引用到更严肃的场合,建议再回查各厂商官方公告。
参考来源
arXiv 论文(均已 API 核实):InstructGPT 2203.02155 · Constitutional AI 2212.08073 · LLaMA 2302.13971 · GPT-4 2303.08774 · DPO 2305.18290 · QLoRA 2305.14314 · Llama 2 2307.09288 · Mistral 7B 2310.06825 · Mamba 2312.00752 · Mixtral 2401.04088 · GRPO/DeepSeekMath 2402.03300 · Gemini 1.5 2403.05530 · Llama 3 2407.21783 · DeepSeek-V3 2412.19437 · DeepSeek-R1 2501.12948 · METR 2503.14499 · Qwen3 2505.09388
官方发布页 / 工程实践:OpenAI: ChatGPT · OpenAI: o1 · OpenAI: GPT-4o · OpenAI: GPT-5 · OpenAI: gpt-oss · Anthropic: Computer Use · Anthropic: MCP · Anthropic: Claude 3.7 · Anthropic: Claude 4 · Google: Gemini 2.5 · Stanford: Alpaca
时间线核对:Wikipedia: Claude · Wikipedia: Gemini · Wikipedia: GPT-5.5 · Wikipedia: GPT-5.3-Codex · Wikipedia: DeepSeek · LLM Gateway Timeline