前沿大模型十家公司在押注什么:2026 年 9 月榜单与技术路线深挖

按 Artificial Analysis v4.3 非估算成绩筛出十家模型开发者,核对正式文档、论文与开源交付,拆解长程 Agent、推理经济性、开放基础设施和世界模型四条路线,并附排名复核与成本复算。

我开始整理这份名单时,先遇到了一个比“谁第一”更实际的问题:榜单上同一家公司的多个推理档位挤在前排,一些新模型的分数还带着星号。直接截取前十行,既得不到十家公司,也可能把估算成绩当成完整独立测评。

所以,这篇先把名单算清楚,再追到各家的技术交付。看完正式文档、研究报告和开源发布后,我最强烈的感受是:大家正在争夺“连续完成工作”的能力,但选择的成本结构、控制方式和开放边界很不一样。

有的在给长任务补控制接口,有的换注意力架构,有的把训练沙箱一起开放,还有的在为未来的智能体制造可交互的世界。把这些都压成一句“都在追求 AGI”,会错过最值得跟的变化。

先说明:这份 Top 10 到底排什么

这里没有一个可以代表公司综合实力的“全球统一官方排名”。我的做法是采用公开第三方测评机构 Artificial Analysis 的模型榜,构造一份可复核的开发者前十名单。它是本文的公司去重结果,不是该机构另行发布的公司排名。

冻结时间为 2026 年 9 月 8 日北京时间 12:56。页面采用当前状态模型列表;方法页当时为 Intelligence Index v4.3。筛选过程如下:

  1. 按页面的 Intelligence Index 降序读取模型行。
  2. 排除没有分数的行,以及带星号的估算成绩。
  3. 同一 Creator 只保留第一次出现的模型,即该口径下的最高位条目。
  4. 取前十家,保留原始模型名、推理档位和页面顺序。

星号的含义是我在榜单提示框里核实的:AA 尚未独立完成全部所需测试,数字根据已测子集或厂商声明估算。因此,Qwen3.8-Flash-Next 的 42* 没有用于本表;阿里使用非估算的 Qwen3.8 Max。Sapiens AI 等开发者也没有凭估算分进入这份名单。

这不是小修饰。是否接纳估算值,会改变入选公司和顺序。

AA 方法页说明,v4.3 主要评估英文、文本相关能力,按 Agent、编程、科学推理和通用能力合成指数。它不完整代表中文体验、视频生成、机器人、营收或科研影响力。详细的读榜背景可以接着看《大模型 Benchmark 榜单的正确打开方式》

本文序位公司 / 开发团队入选模型与设置AA 指数本文提炼的重点方向
1AnthropicClaude Fable 5.1,max with fallback53长程知识工作、科研,以及前沿能力的访问控制
2OpenAIGPT-6 Astra,max53从目标到成品的工作执行与运行时控制
3MetaMuse Spark 1.3,max48长线程协作、个人智能体与产品分发
4Z.ai / 智谱GLM-5.3,max45后训练增强工程能力,Flash 路线降低长上下文成本
5SpaceXAI,Grok 团队Grok 4.6,high44编程、知识工作与带搜索工具的执行系统
6Moonshot AI / 月之暗面Kimi K3,max44大规模开放模型与 Agent 训练基础设施
7Google / Google DeepMindGemini 3.8 Flash,high41可规模化的多模态 Agent,并继续探索世界模型
8Alibaba / QwenQwen3.8 Max40开放旗舰与多种效率架构并进
9DeepSeekDeepSeek V4 Pro 0813,max36百万上下文的效率、Agent 能力及接口兼容
10MiniMaxMiniMax-M330多模态协作、稀疏注意力与内容生产工具

表里的 53、44 是页面显示的整数,不是正确率百分比。同分时沿用原页面顺序,不主张统计上的显著高低。maxhigh 等表示推理投入档位,各家定义并不一致。

with fallback 也不能删。Anthropic 的发布说明披露了部分安全拦截任务由其他 Claude 模型接手的评测配置;这类结果包含系统处理策略,不能无条件读成裸模型能力。不同榜单、指数版本和工具配置之间的数字,不在本文横向拼接。

读十家公司,只盯住四个活动部件

先给几个必要概念:后训练是在基础模型之后继续训练它如何推理、使用工具、遵循要求;harness 是模型外的执行程序,负责工具、上下文、循环和验收;开放权重允许获得模型参数,但不自动等于训练数据、完整训练流程和许可证都无限制开放。

注意力可以先理解成“处理当前内容时,到过去的信息里找什么”。长上下文越长,这一步越贵。稀疏注意力少读一部分信息,压缩或线性注意力用更紧凑的状态保存过去;省下的成本,要与漏掉细节的风险一起看。后文提到的 MoE,即混合专家,则像按题目调部分专家工作,并非每次调用全部参数。

活动部件公司正在改变什么读者应当观察什么失效时会怎样
学习目标从回答问题到完成多步工作是否有长任务、用户反馈、失败恢复的训练证据单题得分好,项目跑到中途丢要求
计算与记忆推理档位、缓存、注意力架构同等任务质量下的总费用、耗时和上下文保真模型会做,但预算不允许持续做
执行与控制工具接口、用户插话、暂停、验收新指令能否进入正在运行的任务目标已经变了,Agent 还沿旧计划执行
开放与分发API、权重、算子、训练环境和应用哪些已经交付,哪些只是路线图下载了权重,却复现不了产品效果

我用来理解这些变化的根本约束是:长任务必须同时保住目标、控制成本并接收新反馈;任何一项先耗尽,单次回答更聪明也未必能救回来。

如果这些约束不存在,模型只需一次推理就交付完美结果,异步工具、缓存、环境恢复和中途纠偏便不会如此重要。现在的发布记录,恰恰在不断补这些环节。

1. Anthropic:把长程工作能力与可控访问一起卖

9 月的 Fable 5.1 / Mythos 5.1 发布说明强调编程、知识工作和科学研究。一个容易被名字掩盖的细节是:官方称二者使用相同模型,区别在保障措施;Fable 普遍可用,Mythos 面向受信任访问项目。

它同时调整缓存读取价格,并提出 Enterprise Frontier Safeguards,把相关数据放在客户控制的云基础设施里。后者在这份公告里仍是分阶段推出的计划,不能写成已经全面上线。

我的判断是,Anthropic 的路线至少有两条相互约束的线:提高长时间工作的产出,同时让企业能接受这种能力进入真实业务。代码、研究与访问控制放在同一份公告里,是产品结构上的信号。

这会改变采购问题。过去问“这个模型能不能解决”;现在还得问“该账户能用到哪个能力层级,拦截后的行为是什么,整个工作流的缓存账单是多少”。模型评测与交付政策开始更紧地绑在一起。

接下来值得盯:在启用实际生产保障措施后,长任务成功率与误拦截是否同时改善。只看解除限制的研究配置,会高估普通用户能得到的能力。本站对 Fable 5.1 的基准分析提供了另一层背景,但旧分数不能直接代入这次 v4.3 表格。

2. OpenAI:把“工作正在进行”变成 API 的正式状态

OpenAI 9 月 3 日 API 更新记录把 GPT-6 Astra 定位于端到端工作:组合推理、代码、电脑操作、研究和文档制作,从初始请求走到最终结果。

真正值得深挖的是同日出现的接口变化:异步工具调用、中途发送新指令、对话过程中调整推理投入。Astra 的工具调用要求使用 Responses API。这些已经写进正式开发文档,不只是一个演示视频。

异步调用的意思是,外部工具还在执行时,模型可以继续推进允许并行的工作;中途指导则让用户的更正进入正在运行的响应。它们共同承认了一件事:现实任务的依赖与需求,会在执行期间变化。

我据此推断,OpenAI 在争夺一种更完整的工作执行入口。关键竞争点从“给你一段答案”扩展到“替你维持任务、等待工具、吸收更正并交付文件”。这不证明它已经解决长期记忆或无限时长自主工作,而是说明其产品接口开始为这些运行状态留位置。

接下来值得盯:中途纠偏到底减少了多少返工,异步执行遇到工具失败后能否正确收敛。一个会继续跑的 Agent,如果不会撤销过时计划,可能只是更快完成错误目标。

3. Meta:个人智能体,先补“怎么与人长期相处”

9 月 2 日 Muse Spark 1.3 发布说明明确把升级与 personal superintelligence 联系起来。落地入口是 Muse Code 和 Meta Model API。

技术描述里有一个我特别在意的点:Meta 表示在多种 harness 上训练模型,以适应不同的执行环境;它也强调单个长线程里的多任务归属、澄清、求助和用户插话。与此同时,Muse Spark 的开放权重发布仍被列在未来路线图里。

所以,不能继续沿用“Meta 等于当前旗舰全部开源”的旧印象。本文能确认的是 API 与编程产品交付,以及尚未兑现为这次发布事实的开放计划。

我认为它在补个人智能体最容易露馅的能力:同一个用户先交代 A,又插入 B,随后修正 A,模型是否还知道哪条约束属于哪个任务。这个问题比“记住更多聊天内容”更具体。记忆很多,却把任务关系混在一起,个人助理仍然不好用。

接下来值得盯:开放权重的实际交付,以及换一套外部 harness 后的表现。产品演示里的好用程度,如果高度依赖专用执行环境,就不能全部归功于模型本身。

4. Z.ai / 智谱:同一底座继续挖能力,另一路重做效率

GLM 官方仓库给出了比“升级了新模型”更有信息量的说明:GLM-5.3 与 GLM-5.2 使用同一个基础模型,增益来自后训练。其重点是复杂编程、长任务,以及伴随训练增强而增长的网络安全能力。

同一份说明也区分了 GLM-5.3-Flash:它使用新训练的底座,采用稀疏与线性注意力混合的架构,并引入 mHC。这里把 mHC 理解为调整层与层之间信息传递的一种连接设计即可;本文不把 Flash 的架构归到表中 GLM-5.3 主型号上。

这是两条不同的增长路径:一条继续利用现有底座,通过训练目标和任务经验增加工作能力;另一条从架构端降低长上下文的使用成本。只看型号的小数点,很容易把二者都误读成“参数又变大了”。

我的判断是,智谱值得跟踪的优势来源正在分化:旗舰需要证明后训练的收益能泛化到未见项目;Flash 需要证明节省计算以后,关键细节没有被压丢。两条线需要不同的验收题。

接下来值得盯:固定同一仓库、同一工具环境、同一预算,对比新旧版本的完整修复率。厂商内部编程榜的提升是研究线索,不能直接换算成你项目上的提升。

5. SpaceXAI / Grok:从会搜索的回答者,走向工具密集的工作系统

Grok 4.6 的官方介绍开发文档把编程、Agent 和知识工作放在核心位置。官方还披露了训练过程:更长的补充训练之后,用 Grok 4.5 重新生成不同推理档位与执行环境中的示范轨迹,再进入包括代码、知识工作、算子优化和 CAD 等环境的强化学习。示范轨迹就是模型可以学习的完整操作过程。

一个不起眼但实际的技术细节是,文档建议给连续会话设置缓存路由标识,让后续请求回到能命中缓存的服务器;长循环也建议结合上下文压缩。这说明长任务经济性不仅取决于模型参数,还取决于请求如何落到服务系统里。

这条细节值得与官方 X Search 工具一起读:外部信息入口和执行基础设施,决定了模型能否在工作中不断获取新上下文。搜索能力是工具链的一部分,不等于底座天然知道最新事实。

我的判断是,Grok 在同时补基础训练、操作示范和环境反馈。判断进步来源时,需要区分底座提升与工具接入收益;本文没有把未核验的训练规模或下一代承诺写进能力判断。

接下来值得盯:带来源的任务能否把证据追到原始页面,以及关闭专有搜索工具后表现如何变化。这能帮助区分模型推理的进步和信息接入的收益。

6. 月之暗面:开放的不只是一个巨大的权重文件

Kimi K3 技术报告描述了 2.8T 总参数、104B 激活参数的混合专家模型,以及原生视觉和百万 token 上下文。Kimi Delta Attention 与 Attention Residuals 分别处理长序列与跨层的信息流动问题。

如果只记住 2.8T,就漏掉了这家最值得跟的交付。它在 7 月 27 日开放公告中同时公布权重、技术报告、MoonEP 通信库和 AgentENV;FlashKDA 算子也属于这套开放技术组合。

AgentENV 仓库对应大规模运行 Agent 环境的基础设施。它与通信、算子分属不同层:一个让专家之间更有效交换数据,一个加速注意力计算,一个让任务能在隔离环境里大量运行。

我的判断是,Kimi 在尝试把开放模型的竞争推进到“别人能否部署、扩展并继续训练”的层面。开放权重解决取得模型的问题,环境与算子解决继续使用它时的一部分系统问题。二者加起来,仍不等于全量训练数据和所有训练细节都已开放。

接下来值得盯:这些组件能否被模型之外的团队复用,以及推理服务对特殊架构的适配是否成熟。对多数个人用户而言,开放的大模型依旧可能远超本机承载能力;“可以下载”不意味着“便宜地跑”。

7. Google:Flash 承接日常工作,世界模型扩展可行动的范围

Gemini 3.8 Flash 正式文档显示,它支持文本、图像、视频、音频和 PDF 输入,输出为文本,具备可调推理、工具调用等能力;电脑操作标为 Preview。模型卡把软件工程与 Agent 知识工作作为主要进步方向。

这意味着,“支持多模态输入”不能写成“这个型号直接生成所有模态”。看一段视频后写报告,与直接生成视频,是两种不同能力。

但 Google 的研究面又确实比这张文本榜更宽。Genie 3 官方页面描述了可实时探索的生成环境,Project Genie 仍被称为实验性研究原型。这条研究线试图让 Agent 不只读世界的描述,还能在一个行动会改变后续状态的环境里探索。

我把它理解成两种时间尺度的投入:Flash 解决今天能大规模交付的工作;世界模型探索未来行动与环境学习的基础。后者不是 Gemini 3.8 Flash 已经拥有的功能,也不是物理世界可靠性的证明。

接下来值得盯:同一任务从图片理解走到操作执行时,错误是否可被检测;生成环境里的训练收益,能否转移到没有被生成器简化过的真实环境。漂亮视频与可用训练世界之间,还有很长的验证链。

8. 阿里 Qwen:开放旗舰与小激活量架构同时推进

Qwen3.8 官方仓库明确提出把 Max 级模型带到开放发布,并强化编程、专业工作和长程任务。这个方向不能只用“模型型号很多”概括:旗舰开放会改变下游团队能拿来继续训练和部署的能力上限。

另一条值得追的是 8 月 31 日的 Qwen3.8-Next 架构论文。它描述 Flash-Next 的混合注意力与稀疏专家设计,还把额外的 n-gram 嵌入表放到加速器之外。n-gram 可以理解为连续的小段词元组合,这里相当于用额外查表结构承载一部分表示能力。

它的研究问题是:哪些能力必须付昂贵的加速器计算,哪些可以通过查表、选择性读取和结构调整来承载。注意,这篇 Next 论文不能被当成 Qwen3.8 Max 的完整架构说明,而其估算榜分也没有用于本文排名。

我的判断是,Qwen 同时在争取能力上限和部署覆盖面。Max 与 Next 服务的约束不同;如果只按系列名把它们混成一个模型,就看不出架构研究与旗舰竞争分别在付什么代价。

接下来值得盯:普通部署环境下的内存、带宽与真实吞吐,尤其是“移出加速器”的数据是否把瓶颈转移到了别处。激活参数少,不自动保证任意硬件上都更快。

9. DeepSeek:继续压长上下文成本,同时进入既有 Agent 工具链

DeepSeek-V4 技术报告的重点是高效百万上下文;官方模型卡说明其混合注意力组合了压缩稀疏注意力与更强的压缩注意力。核心问题是减少每次处理长历史时必须计算和搬运的信息。

8 月 13 日的 V4-Pro 正式版公告则突出 Agent 升级、多档推理、原生 Responses API 支持和 Codex 接入,并引入峰谷定价。这是从模型研究走向实际工具链的一步:降低迁移工作量,才能让成本优势更容易被使用。

我认为 DeepSeek 的路线不能简化成价格战。便宜如果以丢失关键上下文为代价,会在返工里把费用花回来;而只证明长窗口放得下、不证明长窗口用得对,也不足以支持大型项目。

架构降低一次推理的成本,接口兼容降低接入成本,峰谷调度改变批量工作的账单。这三件事影响同一业务的不同分母,不能拿其中任意一个替代“每个成功任务的总成本”。注意力细节可以回到本站 V4-Flash 论文学习笔记

接下来值得盯:在固定验收门槛下,低成本版本是否带来更多重试;长上下文优化后,跨文件、跨时间的细节约束是否仍然可靠。

10. MiniMax:把多模态理解、长期协作与内容生产接起来

MiniMax M3 发布说明把 MSA 稀疏注意力、百万上下文、图像视频输入与编程工作组合在一起。更值得注意的是其用户模拟器:训练与评估会模拟需求补充、方案讨论、反馈修正和任务切换。

这个设定直接针对“测试题一次说完,真实用户不断改口”的差异。它把合作过程当成训练对象,而不只是把最后一次代码提交当作结果。

MiniMax 的另一个公开方向是生成内容。7 月发布的 H3拓展多模态生成;MaxProof 研究则专门训练能够解释证明错误的验证器。三条线分别处理感知与行动、内容生成、结果判断,不能全部算到 M3 的文本榜分上。

我据此推断,它在做模型与工作产品的组合:既让 Agent 理解图和视频,又让它处理创作与工程过程中的反复修改。决定体验的可能是修改次数和每次修改保留多少既有成果,而不仅是第一次输出是否惊艳。

接下来值得盯:连续修改时,能否保住未要求改动的部分;多模态生成产品的改进能否转化为可验收的业务流程。一次成功演示不足以证明稳定协作。

我亲手复核的一笔账:推理档位也是趋势的一部分

上面这些方向并不是都能从排名里读出来。我从同一次 AA 页面抓取里,额外取了两家公司的相邻高投入档位。页面的 Index Cost per Task 是该指数任务的平均费用,考虑输入、缓存、推理和回答等计价;它不是你的业务报价。

模型与配置页面显示指数指数平均任务费用相对该模型 max 档的费用降幅
Fable 5.1,max with fallback53$7.63基准
Fable 5.1,xhigh with fallback53$5.9821.63%
GPT-6 Astra,max53$3.26基准
GPT-6 Astra,xhigh53$2.3129.14%

这不是“便宜档与贵档能力相同”的证明。整数显示会隐藏小数差异,综合指数会隐藏分项差异,任务费用也依赖该评测负载。它能支持的较窄结论是:最高投入档与稍低档的费用差异,不一定在整数总分上体现。

手算以 Astra 为例:先算节省 3.26 - 2.31 = 0.95 美元,再除以原费用 3.26,得到约 0.2914,也就是 29.14%。以下代码使用冻结输入,可直接复算:

pairs = [
    ("Fable 5.1", 7.63, 5.98),
    ("GPT-6 Astra", 3.26, 2.31),
]
for model, max_cost, xhigh_cost in pairs:
    saving = (max_cost - xhigh_cost) / max_cost * 100
    print(f"{model}: {saving:.2f}%")

实际输出:

Fable 5.1: 21.63%
GPT-6 Astra: 29.14%

这里我做了数据提取与复算,没有重新跑 AA 基准,也没有调用十家模型做同题测试。

对工程团队,这笔账给出一个可以验证的方向:先让高档位建立质量基线,再逐档降低投入,看哪一类任务先掉出验收线。别一开始就把所有任务锁到最贵,也别因为整数同分就认定可以无损降档。

十条路线背后,我会持续跟的四个变化

第一,长任务的控制接口开始成为产品本身。 OpenAI 的中途指导、Meta 的多任务归属、MiniMax 的用户模拟器,处理的是相同的现实:用户会补充条件,工具会晚到,目标会改变。下一轮好用程度,可能更依赖“能否正确吸收变化”。

第二,推理效率的竞争发生在多个层次。 缓存命中、推理档位、稀疏注意力、外置查表、峰谷调度各管一段。一个优化声称快很多,要问它缩短的是哪一段,是否把开销转移给其他环节。把算子加速倍数直接写成整项任务加速倍数,往往会误导。

第三,开放生态的交付单位变大了。 Kimi 的环境与通信组件、Qwen 的架构与部署生态、DeepSeek 的权重和接口适配,都提示我:开放的长期价值要沿“能拿到—能部署—能改造—能继续验证”整条链看。Meta 的权重路线图又提醒人,承诺开放与已经开放必须分开记账。

第四,环境与验证逐渐进入能力竞争的核心。 从 Kimi 的训练沙箱,到 MiniMax 的证明验证器,再到 Google 的生成世界,它们分别解决练习规模、反馈质量和练习空间。这里可以接着读《从可验证奖励到环境工程》。这些方向存在联系,但一个生成世界不会自动变成可靠验收器。

这些是我的综合判断,不是十家公司共享的一份路线图。它们有更老的共同祖先:操作系统负责等待与调度,控制系统依靠反馈纠偏,编译器和数据库把昂贵操作换成更省的执行方式。大模型进入长任务后,也开始遇到这些熟悉的约束。

怎样跟趋势,才不会每周重抄一遍榜单

我建议把“公司有没有进步”变成可重复追问的问题。下面是本文为后续跟踪设计的观察表,不是已跑完的测试结果:

方向最小观察任务记录什么哪种结果会推翻乐观判断
长线程协作给项目任务,执行中修改一个条件,再插入第二项任务约束遗漏、错误任务归属、返工次数新版更会说进展,却更容易串任务
推理经济性固定同一验收集,比较两个推理档位成功数、总费用、总耗时,包含重试标价低了,成功任务的总费用反而升高
百万上下文在多份相关文件里埋互相约束的信息,要求可追溯修改正确引用、遗漏条件、无关改动找得到单段内容,综合决策却用错版本
开放可复现性按官方说明尝试部署,并对照公开示例实际硬件、缺失组件、环境差异权重可下载,关键能力依赖未提供的服务
多模态与行动读取截图或视频,执行有明确终态的操作终态是否正确、是否保留无关内容图看懂了,操作后状态却不符合要求

这张表还有一个成本边界:别为了看趋势,未经预算就同时调用十个旗舰跑大型测试。第一次只挑与你工作最相关的两家、一个任务,记录真实账单;有了信息增量再扩大。

这里的崩点可以说得很直接:用排名替代任务验收,会在“选中的第一名完成不了自己的工作”时崩;用便宜单价替代总成本,会在失败重试与人工返工开始累积时崩。前面的档位复算,只负责提示值得测哪里,不替你宣布业务结论。

名单复核方法与证据边界

本次脚本从当前状态表读取 299 个模型配置行,其中 98 行是非估算数值成绩,涉及 24 个 Creator。再按首次出现去重,得到前面的十家。这些是本文抓取后统计的数量,不是 AA 宣称的全站永久覆盖规模。

读者可以在同一榜单加载完成、确认排序与筛选条件后,用浏览器控制台复核。页面会更新,重跑得到未来名单是正常现象:

const rows = [...document.querySelectorAll('table tbody tr')]
  .map(tr => [...tr.querySelectorAll('td')].map(td => td.innerText.trim()));
const scored = rows.filter(c => c.length >= 5 && /^\d+(\.\d+)?$/.test(c[3]));
const seen = new Set();
const creators = scored.filter(c => {
  if (seen.has(c[2])) return false;
  seen.add(c[2]);
  return true;
});
console.table(creators.slice(0, 10).map(c => ({
  creator: c[2], model: c[0], index: c[3], indexTaskCost: c[4]
})));

这个脚本只适用于本次读取到的表结构;如果网站调整列顺序,应重新核对,不能盲跑。冻结名单中的模型链接和前文费用表,就是本文使用的数据快照。

公开证据还有几处明显软边界:闭源公司的训练细节无法由产品说明反推;厂商关于长时程运行和科研的案例属于厂商报告;Flash、Max、Pro、实验版之间不能互相借用成绩。本文没有根据这些材料预测发布日期、市场份额或谁会最先实现 AGI。

我能给出的可信趋势图,是已经能看见的交付与机制,以及下一次应当用什么证据修正判断。

小结:记住约束,比记住十个名次更耐用

这份前十按同一指数、非估算成绩、开发者去重生成;它回答的是这个测评切面里的入选顺序。

真正值得跟的是:任务能持续多久、改变要求后能否纠偏、每个成功结果花多少钱,以及开放交付能否被别人用起来。

如果今天只花十分钟,我建议先复算档位费用,再选一家打开它的正式文档,分别抄下“已经可用”“实验或受限”“未来计划”三栏。下一次发布时只更新变化的那一栏,你得到的会是一条可核验的技术轨迹。

参考入口

榜单与方法

正式交付与工程证据

技术论文