大模型三年半技术路线图:算力的三次搬家(2022.11–2026.08)

把 ChatGPT 发布至今的三年半压缩成一张可跳转的时间轴:四次范式接力(对齐→效率→推理→智能体)× 五条暗线(对齐方法、稀疏化、算力搬家、开源时差、接口标准化)。全部 17 个 arXiv ID 经 API 逐一核实,2025 下半年之后的产品日期逐条回查过来源,文末附一条可复现的核实命令。

把 2022 年 11 月到 2026 年 8 月的大模型史压缩成一句话:算力搬了三次家。先花在预训练上(scaling laws 时代),再搬到推理时(o1/R1 的”多想一会儿”),最后搬到任务时(智能体一干就是几小时)。每次搬家都有明确的标志性产物,也都把上一个时代的稀缺资源变成了便宜的地基。这篇给出完整时间轴:每个节点配一句”为什么重要”和一手来源链接。

一句话主线

三年半 = 四棒接力:先教模型”听话”(对齐),再让它”便宜”(MoE/开源),再让它”会想”(test-time compute),最后让它”会干活”(Agent)。每一棒的起点,都是上一棒把某种稀缺资源打成了白菜价。

这个”四棒”划分是我的读法(观点),但每一棒的节点日期和论文都是核实过的事实——两者在下文分开标记。

顶层视图

timeline
    title 四棒接力 × 算力的三次搬家(2022.11 – 2026.08)
    section 第一棒 · 对齐时代<br>算力在预训练
        2022.11 : ChatGPT(RLHF)
        2023 : LLaMA 开源生态
             : DPO / QLoRA 对齐平民化
    section 第二棒 · 架构效率+多模态<br>算力开始搬向推理时
        2024 : MoE / 长上下文 / GPT-4o
             : o1 —— test-time compute
    section 第三棒 · 推理RL+Agent元年<br>算力搬向任务时
        2025 : DeepSeek-R1 纯RL推理
             : MCP 生态 / 编码 Agent
    section 第四棒 · 智能体成熟期
        2026 : 超长任务 / 1M 上下文
             : 前沿进入季度迭代

AI 顶级原理的透镜看,这条时间轴主要在三条原理上做文章:目标函数演化(下一个词 → 人类偏好 → 可验证奖励)、算力换智能(训练期 → 推理期 → 任务期)、复用与组合(开放权重 → 蒸馏 → 工具协议)。下面逐棒展开。


第一棒:对齐时代(2022.11 – 2023.12)

核心问题:怎么把一个只会续写的预训练模型变成助手? 答案的技术含量没有想象中高——这正是《SFT 是解锁器,不是灌装机》整篇在讲的事:能力早就在预训练里了,对齐只是接上开关。

时间技术 / 产物为什么重要一手来源
2022.11.30ChatGPT(RLHF 三段法:SFT→RM→PPO)范式原点;方法论来自 InstructGPTOpenAI / InstructGPT
2022.12Constitutional AI(RLAIF)用 AI 反馈替代人工标注,Claude 系的技术底座arXiv 2212.08073
2023.02LLaMA 1(开放权重,7B–65B)开源生态的种子;之后所有微调研究的基底arXiv 2302.13971
2023.03GPT-4闭源能力天花板确立,此后 16 个月无人接近技术报告
2023.03Alpaca(52k 样本 SFT 蒸馏)证明几百美元的 SFT 蒸馏就能得到”像样的助手”Stanford CRFM
2023.05DPO把 RLHF 的 RM+PPO 两步压成一个分类损失,对齐平民化arXiv 2305.18290
2023.05QLoRA4-bit 量化 + LoRA,单卡 48GB 微调 65B 成为可能arXiv 2305.14314
2023.07Llama 2(可商用 + 公开 RLHF 细节)开源第一次拿到完整对齐配方arXiv 2307.09288
2023.09Mistral 7B(滑动窗口注意力、GQA)“小模型 + 精数据”路线的代表作arXiv 2310.06825
2023.12Mixtral 8x7B(开源 MoE)MoE 平民化起点,为第二棒预热arXiv 2401.04088
2023.12Mamba(选择性状态空间模型)对 Transformer 的第一次严肃架构挑战arXiv 2312.00752

这一棒结束时的状态:对齐从”OpenAI 的秘方”变成了”人人会做的标准工序”——稀缺资源被打掉了,竞争必须换战场。


第二棒:架构效率 + 多模态(2024)

核心问题:预训练 scaling 边际递减后,钱往哪儿花? 2024 年给出三个答案(稀疏化、长上下文、原生多模态),年底 o1 意外开出第四条路。

时间技术 / 产物为什么重要一手来源
2024.02Gemini 1.5 Pro(1M 上下文,MoE)长上下文军备竞赛开始arXiv 2403.05530
2024.02Sora(视频生成,Diffusion Transformer)生成式多模态出圈事件OpenAI
2024.02GRPO(DeepSeekMath 提出)去掉 value model 的 RL 算法——一年后成为 R1 的引擎arXiv 2402.03300
2024.05GPT-4o(端到端音频、原生多模态)“拼接式多模态”→“原生多模态”的分水岭OpenAI
2024.07Llama 3.1 405B开源首次摸到 GPT-4 水位;训练系统细节极详尽——InfiniBand 与训练网络那篇引用的 RoCE 集群实践正出自这篇论文arXiv 2407.21783
2024.09OpenAI o1 —— test-time compute 范式算力第一次从训练期搬到推理期:“思考越久越聪明”被产品化OpenAI
2024.10Claude Computer UseAgent 操作真实电脑的第一个商用尝试Anthropic
2024.11MCP(Model Context Protocol)Agent 时代的”USB 接口”,后来成为事实标准Anthropic
2024.12DeepSeek-V3(MLA + FP8 + 671B MoE)论文口径 278.8 万 H800 GPU 小时(约 557.6 万美元)训出旗舰——架构工程把成本打下一个数量级arXiv 2412.19437

这一棒的隐藏剧情是 GRPO:2024 年 2 月它只是数学模型论文里的一个算法改进,没人想到它是下一棒的发令枪。


第三棒:推理 RL + 智能体元年(2025)

核心问题:推理能力如何规模化?智能体如何落地? 这一年信息密度最高,也是为什么大模型需要强化学习那篇的现实注脚。

时间技术 / 产物为什么重要一手来源
2025.01.20DeepSeek-R1(纯 RL 涌现推理,MIT 协议)复现 o1 且公开配方:AIME 2024 达 79.8%(论文口径,o1-1217 为 79.2%);1 月 27 日引发英伟达单日市值蒸发约 6000 亿美元(多家媒体报道)arXiv 2501.12948
2025.02.24Claude 3.7 Sonnet + Claude Code(研究预览)混合推理(快/慢思考合一)+ 编码智能体进入终端Anthropic
2025.03METR 任务时长研究提出 task horizon 指标:AI 能完成的任务时长每约 7 个月翻倍——衡量 Agent 能力最重要的单一数字arXiv 2503.14499
2025.03.25Gemini 2.5 Pro(thinking 默认开启)推理模式从”可选”变”默认”Google
2025.04Qwen3(0.6B–235B 全家桶,MoE + 双模式思考)开源生态重心向中国模型倾斜的标志arXiv 2505.09388
2025.05.22Claude 4(Opus/Sonnet)+ Claude Code GA编码智能体从 demo 变成日常生产工具Anthropic
2025.08GPT-5(快/慢模型自动路由)+ gpt-oss(OpenAI 重返开源,Apache 2.0)“该用哪个模型”被产品收编为路由问题——从评测到路由那篇讨论的正是这个决策点GPT-5 / gpt-oss
2025.08.21DeepSeek-V3.1开源阵营的推理/非推理混合路线跟进Wikipedia: DeepSeek
2025.09.29Claude Sonnet 4.5年末前沿三连发第一枪Wikipedia: Claude
2025.11.18Gemini 3 Pro(12.03 追加 Deep Think)Pro 档取代 Ultra 档;深思考成独立产品档位Wikipedia: Gemini
2025.11.24Claude Opus 4.5年末三连发收尾,前沿差距压缩到”周”级Wikipedia: Claude

第四棒:智能体成熟期(2026.01 – 2026.08)

核心问题:超长任务 + 成本效率。 竞争焦点从”谁更聪明”转向”谁能便宜地干完一整天的活”——这也是什么是好的 Agent Harness智能体工程决策图谱关心的工程层。

时间技术 / 产物为什么重要一手来源
2026.02.05GPT-5.3-CodexClaude Opus 4.6 同日发布专职编码 Agent 模型成为独立产品线,且两家开始贴身竞争Wikipedia: GPT-5.3-Codex / Wikipedia: Claude
2026.02.19Gemini 3.1 Pro前沿三家进入”季度迭代”节奏Wikipedia: Gemini
2026.04.16Claude Opus 4.7季度迭代节奏的又一例Wikipedia: Claude
2026.04.23GPT-5.5FrontierMath Tier 4 达 35.4%(OpenAI 自报口径)——前沿数学推理逼近专业研究水位Wikipedia: GPT-5.5
2026.04.24DeepSeek-V4 预览(V4-Pro 1.6T 总参/49B 激活;V4-Flash 284B/13B;均 1M 上下文)极限稀疏比(激活约 3%)+ 长上下文平民化Wikipedia: DeepSeek
2026.07.24Claude Opus 5当前(本文发布时)前沿旗舰之一Wikipedia: Claude

一段猜想(明确标注为猜想):如果 task horizon 翻倍规律继续成立,第五棒大概率是”多智能体组织”——单体模型能干一天的活之后,瓶颈会移到分工、验证与知识沉淀,就像人类组织的演化。这没有任何已验证证据,只是外推。


五条暗线:贯穿三年半的元规律

时间轴是”发生了什么”,暗线是”为什么会这样”。这五条都能一句话说清,也都能预测下一步。

1. 对齐方法演化 = 不断删掉昂贵组件。 RLHF(PPO) 需要四个模型 → DPO 删掉 RM 和 PPO → GRPO 删掉 value model → R1 删掉过程奖励和 MCTS,只留规则奖励。方向感极强:谁能用更少的组件拿到同样的对齐效果,谁就赢下一轮。

2. 稀疏化 = 用通信换算力。 Dense → Mixtral(8 选 2 专家)→ DeepSeek 细粒度专家 + MLA → V4 的 1.6T/49B(激活比约 3%)。代价是 all-to-all 通信压力——InfiniBand 那篇讲的”流量画像塑造网络”在 MoE 上体现得最彻底。

3. 算力搬家 = 本文主线。 训练期 scaling(Chinchilla 定律时代)→ 推理期 scaling(o1/R1,2024.09 起)→ 任务期 scaling(Agent task horizon,2025 起)。每次搬家,上一站的成果都变成下一站的地基而非战场。

4. 开源-闭源时差在收敛。 GPT-4(2023.03)到 Llama 3.1 405B 摸到同水位(2024.07)用了约 16 个月;o1(2024.09)到 R1(2025.01)只用了 4 个月——这是我的粗略读法(观点),“同水位”的判定见各论文的基准对照表。到 2026 年,Qwen/DeepSeek 与闭源旗舰在公开基准上已互有胜负。

5. 接口标准化 = 溢价从模型转移到生态。 ChatML → function calling → MCP(2024.11)。当模型能力差距压缩到”周”级,护城河就变成了工具生态和 harness 质量——这正是Agent 基建决策图谱的立论前提。


带得走的总表

时代稀缺资源标志性解法被打成地基后开启
对齐(2023)对齐配方RLHF → DPO/QLoRA人人可训助手 → 竞争转向效率
效率(2024)训练算力成本MoE/MLA/FP8便宜的强模型 → 竞争转向推理
推理(2025)推理能力test-time compute + 可验证奖励 RL会想的模型 → 竞争转向任务
智能体(2026–)任务时长与可靠性harness/MCP/超长上下文(进行中)

读任何一条新模型发布公告时,可以先问:它在哪一棒上做文章?它假设哪种资源已经是地基? 这两个问题基本能定位它的技术野心。


诚实的提醒

  • 日期精度分级:精确到日的条目(如 2025.01.20、2026.04.23)均在本文写作当天回查过 Wikipedia 发布表或官方页;只写到月的条目(如 GPT-4o 2024.05、MCP 2024.11)来自训练记忆 + arXiv ID 月份推定,未逐日回查。
  • 全部 17 个 arXiv ID 经 arXiv API 逐一核实,标题与论文一一对应。你可以用一条命令复现这个核实(成本最低的验证实验):
curl -sL "https://export.arxiv.org/api/query?id_list=2203.02155,2302.13971,2303.08774,2305.18290,2307.09288,2401.04088,2402.03300,2412.19437,2501.12948,2503.14499" | grep "<title>"
  • 未亲手复现的数字:R1 的 AIME 79.8%、GPT-5.5 的 FrontierMath 35.4%、DeepSeek-V3 的 557.6 万美元训练成本,均为论文/厂商自报口径;英伟达单日市值蒸发约 6000 亿美元为媒体报道口径。“2025 年初模型可完成约 30 分钟任务、年末约 5 小时”这一说法来自二手时间线综述,我未回查 METR 原始数据点,故只在此提及、未写入正文表格。
  • 2026 年条目的一手来源以 Wikipedia 发布表为主(官方发布页分散且部分需登录),若你要引用到更严肃的场合,建议再回查各厂商官方公告。

参考来源

arXiv 论文(均已 API 核实):InstructGPT 2203.02155 · Constitutional AI 2212.08073 · LLaMA 2302.13971 · GPT-4 2303.08774 · DPO 2305.18290 · QLoRA 2305.14314 · Llama 2 2307.09288 · Mistral 7B 2310.06825 · Mamba 2312.00752 · Mixtral 2401.04088 · GRPO/DeepSeekMath 2402.03300 · Gemini 1.5 2403.05530 · Llama 3 2407.21783 · DeepSeek-V3 2412.19437 · DeepSeek-R1 2501.12948 · METR 2503.14499 · Qwen3 2505.09388

官方发布页 / 工程实践OpenAI: ChatGPT · OpenAI: o1 · OpenAI: GPT-4o · OpenAI: GPT-5 · OpenAI: gpt-oss · Anthropic: Computer Use · Anthropic: MCP · Anthropic: Claude 3.7 · Anthropic: Claude 4 · Google: Gemini 2.5 · Stanford: Alpaca

时间线核对Wikipedia: Claude · Wikipedia: Gemini · Wikipedia: GPT-5.5 · Wikipedia: GPT-5.3-Codex · Wikipedia: DeepSeek · LLM Gateway Timeline