读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲

从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。

2026 年 8 月 10 日,Meta 发布 Muse Glimmer:30B 稠密、多模态、Apache 2.0 开源权重,4-bit 量化后 17GB,塞进一张 24GB 的消费级显卡(Meta 官方公告)。随后 Latent Space 的 AINews 给它的评价很克制:Artificial Analysis 智能指数 35,还落后于 Qwen3.6-27B 的 38。如果只看排行榜,这是一次平庸的发布。但把规格表逐行摊开会看到另一回事:这张表上几乎每一行,都是某篇论文对同一个问题的回答——“怎么把一个常驻的多模态 agent,塞进一张 24GB 的卡”。

这篇文章的主线一句话说清:Muse Glimmer 的规格表可以当成一张账单来读——预算是固定的(一张消费级显卡、batch=1、常驻运行),每一行架构选择都是一篇已发表论文的权衡在这份预算下的实例化。 读懂这张账单,比记住它的跑分有用得多:下一张 30B 级本地模型的规格表出来,你可以用同一套读法。

先交代信源分级:Glimmer 的架构与跑分数字来自 Hugging Face 模型卡与 Meta 官方博客(核实过的来源);智能指数等横向对比来自 AINews 转述的 Artificial Analysis(二手,标注来源);文中所有换算(显存字节、KV cache、缩减倍数)是我用脚本亲手验算的(最硬一档);个别推断会明确标”猜测”。

第〇行:预算本身——为什么是 24GB

Meta 给 Glimmer 的定位是 “always-on local agent workflows”(常驻本地 agent),呼应的是 Zuckerberg 2025 年那封 “Personal Superintelligence” 公开信的路线:AI 跑在个人设备上,而不是全部经过云端。这个定位翻译成工程语言就是三条预算硬约束:

  1. 显存预算:消费级显卡的主流天花板是 24GB(RTX 3090/4090),新一代 5090 是 32GB。模型 + KV cache + 视觉编码器 + 运行时开销,全部要装进去。
  2. 带宽预算:本地推理 batch=1,解码是典型的访存受限(memory-bound)——每生成一个 token 都要把全部权重从显存搬一遍,算力大量闲置。
  3. 常驻预算:agent 是长会话、长上下文(128K)、随时待命的工作负载,KV cache 不是一次性开销,是持续占用。

下面五行账单,每一行都在回答这三条约束之一。先给全图:

flowchart LR
    B["预算<br>24GB 显存<br>batch=1 带宽<br>常驻 128K"] --> A1["混合注意力 3:1<br>+ GQA + SWA 2048"]
    B --> A2["三段式蒸馏<br>老师是 Muse Spark"]
    B --> A3["K-Quant 两档<br>按精度损失定价"]
    B --> A4["DFlash 草稿器<br>块扩散投机解码"]
    B --> A5["agent 岗位特训<br>+ 1.8B 感知编码器"]
    A1 --> P1["Longformer / Mistral<br>Gemma 2 / Gemma 3"]
    A2 --> P2["Hinton 蒸馏<br>GKD 在线蒸馏"]
    A3 --> P3["GPTQ / AWQ"]
    A4 --> P4["投机解码 2211.17192<br>Block Diffusion / DFlash"]
    A5 --> P5["tau-bench<br>Perception Encoder"]

第一行:注意力——把 104GiB 的 KV cache 砍到 1.7GiB

模型卡上这几行是一组组合拳:52 层,注意力按 [局部, 局部, 局部, 全局] 3:1 交错;局部层滑动窗口(SWA)2048;GQA 32 个查询头对 2 个 KV 头(16:1);RoPE(θ=500,000)只作用于局部层——全局层不加显式位置编码。

单看每一项都是旧闻,合起来才见账本。KV cache 的每 token 每层成本是:

2K+V×2KV 头数×128头维度×2BF16 字节=1024 B=1 KiB\underbrace{2}_{K+V} \times \underbrace{2}_{\text{KV 头数}} \times \underbrace{128}_{\text{头维度}} \times \underbrace{2}_{\text{BF16 字节}} = 1024 \text{ B} = 1 \text{ KiB}

用这个单价算四种配置在 128K(131,072 token)上下文下的总账(下表所有数字为脚本验算):

配置每 token 每层128K 上下文 KV 总量相对上一行
假想:32 头 MHA、全部全局层16 KiB104 GiB
+ GQA 16:1(仍全部全局)1 KiB6.5 GiB÷16
+ 混合 3:1(13 层全局付全价,39 层局部封顶 2048)1.70 GiB÷3.8
其中:全局层 1.625 GiB + 局部层 78 MiB合计 ÷61

104 GiB 到 1.70 GiB,61 倍。 没有这一行,“24GB 卡跑 128K 上下文”在算术上就不成立——光 KV cache 就是显存的四倍多。而且账单还有一个更隐蔽的好处:超过 2048 token 之后,每多一个 token 只有 13 个全局层付全价,边际成本 13 KiB/token——常驻 agent 的长会话就是靠这个边际价格养的。

这条组合拳的论文谱系很清楚:滑动窗口注意力从 Longformer(arXiv:2004.05150)进入视野,Mistral 7B(arXiv:2310.06825)把它带进主流开源模型;Gemma 2(arXiv:2408.00118)开始局部-全局 1:1 交错;Gemma 3(arXiv:2503.19786)把比例推到 5:1、窗口缩到 1024,论文明确给出动机与效果——KV cache 内存占比从纯全局的约 60% 降到 15% 以下(32K 上下文)。Glimmer 选 3:1 + 窗口 2048,落在 Gemma 2 和 Gemma 3 之间:比例和窗口不是玄学,是 KV 预算和长文召回能力之间的一个滑块,AINews 说它是 “Gemma 4-style hybrid attention + 更长的 SWA”,从谱系看完全通顺。

两处配角也值得一句:全局层不加位置编码走的是 NoPE 路线——Kazemnejad et al.(arXiv:2305.19466)的结论是解码器模型去掉显式位置编码反而长度外推更好,全局层管”远处找东西”,正好用它;模型卡还标了 gated attention(SDPA 输出后接 sigmoid 门),来自 Qwen 团队的系统实验(arXiv:2505.06708),30 个变体里筛出来的结论:输出门控稳训练、缓解 attention sink、改善长上下文外推——又是给”常驻长会话”预算打工的。

顺带回链:这套”砍每 token 要搬的字节数”的算术,和 DeepSeek-V4-Flash 为什么这么快里拆的是同一个分母——那边是数据中心为了吞吐砍,这边是消费级显卡为了装得下砍。分母相同,预算的主人不同。

第二行:蒸馏——开源的是影子,老师留在云上

Meta 博客把训练管线写得很直白,三段式:

  1. 预训练:对 Muse Spark(更大的闭源老师)做 logit 蒸馏,数据配方与老师相近;
  2. 中期训练:更长上下文、更重 agent 的数据、更丰富的推理轨迹;
  3. 后训练:SFT + 在线(on-policy)蒸馏 + RL,覆盖通用/推理/编码/agent 域。

这三段各有论文站台。Logit 蒸馏是 Hinton et al.(arXiv:1503.02531)的经典配方——学老师的完整概率分布而不是硬标签,每个 token 的监督信号从 log(词表大小) 个 bit 变成整个分布;Gemma 2 已经示范过”用蒸馏代替下一词预测来训小模型”在 30B 以下这个段位的收益(arXiv:2408.00118)。在线蒸馏对应 GKD(arXiv:2306.13649):学生在自己生成的序列上接受老师打分,专治”训练时看老师示范、推理时看自己的错误”的分布错配——对 agent 这种多步生成任务,错配累积得最快,所以后训练阶段换在线蒸馏是对症的。

这里正好接上《训练小模型的三条路》收束的那条定律:2026 年每个能打的小模型身后,都站着一个大模型。 Glimmer 是这条定律的字面实例——而且带着一层战略含义:Apache 2.0 放出来的是蒸馏产物,老师 Muse Spark 只是”承诺稍后开源”(AINews 转述)。开源的是影子,本体留在云上——这是观点,不是事实陈述,但它解释了为什么 Apache 2.0 这次给得如此干脆:对 Meta 来说,Glimmer 越普及,Spark 的分发漏斗越宽。相比 Llama 系列那个带 7 亿月活门槛的社区许可证,这次的许可证选择本身也是产品设计的一部分。

第三行:量化——两档 SKU,按精度损失定价

模型卡的量化表值得原样抄下来,因为它的结构比数字更有信息量:

变体精度体积目标硬件精度损失
全精度BF16~59.2 GB64GB 级
K-Quant-Dynamic~4-bit<20 GB32GB 卡0.2%
K-Quant-17GB~4-bit17 GB24GB 卡1.0%

先验算体积:29.6B 参数 × 2 字节 = 59.2 GB,对上”~60GB BF16”;× 0.5 字节 = 14.8 GB 裸重,加上高精度保留的嵌入表和逐组缩放因子,17–20 GB 合理。再算 24GB 卡的可行性:17 GB 权重 + 1.7 GiB KV(128K 满载)+ 运行时开销,勉强但成立——17GB 这一档存在的唯一理由,就是 24GB 这个数字

结构上的信息量在于:两档变体不是按比特数分的(都是 ~4-bit),是按精度损失定价的——多付 3GB 显存,买回 0.8 个百分点。这和逐层混合精度的思路一脉相承:GPTQ(arXiv:2210.17323)证明 4-bit 后训练量化在数十 B 规模基本无损,AWQ(arXiv:2306.00978)进一步证明保护约 1% 的显著权重通道就能守住质量——量化从”能不能压”变成”每 GB 显存买多少精度”的定价问题。一个细节存疑待查:Meta 给自家方案起名 “K-Quant”,与 llama.cpp 社区沿用多年的 k-quants 命名撞车,是致敬还是巧合,两边文档都没说。

第四行:DFlash——给访存受限的解码找回并行度

第〇行说过,本地 batch=1 解码是访存受限:生成一个 token 搬一遍全部权重,17GB 的权重在消费级显卡带宽下,这就是延迟的地板。投机解码是对这个地板的标准答案(Leviathan et al., arXiv:2211.17192):小草稿模型先猜 k 个 token,大模型一次前向并行验证——权重还是搬一遍,但一遍验 k 个。

Glimmer 附带的草稿器 DFlash(arXiv:2602.06036)在谱系上是新一代:EAGLE-3(arXiv:2503.01840)这类主流草稿器自己仍是自回归的——猜 16 个 token 也要串行跑 16 步,草稿环节成了新的串行瓶颈。DFlash 换成块扩散(block diffusion,arXiv:2503.09573):草稿器以目标模型的上下文特征为条件,一次前向并行去噪出整个 16-token 块。论文报告跨模型任务超过 6× 无损加速、最高比 EAGLE-3 快 2.5×。

Meta 部署到 Glimmer 上的实测是另一组数字:RTX 5090 上 3.1×,M5-Max 1.8×,M4-Max 1.5×。论文的 6× 和部署的 3.1× 之间的差距,我的猜测(标注:猜测)是任务分布和接受率的差别——agent 工作负载的输出比论文基准更难猜,而 Apple Silicon 上加速比更低则符合”带宽差距越小、投机收益越薄”的账本逻辑。这本账在《投机解码的第二本账》里算过:加速比是接受率 α、草稿成本 γ、块长 k 三个变量的赛跑,换硬件就是换 γ。另外注意一个岗位学信号:草稿器随主模型官方发布、官方维护,正是《Agent 推理循环里的八个岗位》里”打字员”岗位的结构位坐实——它不再是第三方外挂,是发布物的一部分。

第五行:岗位特训——用通用知识换工具调用

最后一行是取舍最露骨的一行。看模型卡的跑分结构(对照 Gemma4-31B / Qwen3.6-27B):

类别基准Glimmer-30BGemma4-31BQwen3.6-27B
agentMCP Atlas75.554.262.5
agentDeepSearch QA74.661.771.1
agentτ³-Banking23.515.116.7
编码SWE-Bench Verified76.066.677.2
推理GPQA Diamond83.585.784.2
多模态ScreenSpot Pro75.475.976.1

agent 三行全部领先且幅度大;通用推理和综合智能不占优(AINews 引 Artificial Analysis:智能指数 35,低于 Qwen3.6-27B 的 38),且点名”幻觉/知识校准相对弱”。结合训练管线(从预训练就混 agent 轨迹、中期加重、后训练 RL 覆盖 agent 域),这不是短板,是定价:一个 30B 的本地模型装不下”什么都知道”,它赌的是知识由 harness 供给(搜索、MCP 工具、文件系统),模型只负责判断和调用——这正是《什么才是好的 Harness》那条”判断归模型,物理归代码”的分工在模型侧的镜像。τ³-Banking 那种全场 23.5 的低分段位也说明这类基准继承了 τ-bench(arXiv:2406.12045)按数据库终态判分、按 pass^k 计可靠性的严格传统——绝对值低不丢人,相对差距才是信号。

多模态那 1.8B 参数的”眼睛”也属于这一行:ViT-G/14 规格的感知编码器,走 Meta 自家 Perception Encoder 路线(arXiv:2504.13181,核心发现是最好的视觉嵌入不在网络输出层而在中间层),每张图最多 4096 个视觉 token。对一个要看屏幕截图、读图表的本地 agent,这 1.8B 不是奢侈品,是 ScreenSpot Pro 75.4 分的成本价。

元规律:前沿模型能力定预算,本地模型预算定架构

把五行账单收拢,能提炼一条元规律(这是我的框架,不是论文结论):

前沿模型是”能力定预算”——先追跑分,账单事后再付;本地模型是”预算定架构”——24GB 先写死,架构是照着预算单采购来的一篮子论文权衡。 所以前沿模型的技术报告读起来像成绩单,本地模型的规格表读起来像账单;读账单的正确姿势,是给每一行找到它的论文价签。

这其实是AI 顶级原理望远镜里那条影子原理”瓶颈塑造设计”的主动形态:瓶颈不是被动碰上的,是被产品定位主动选中的。一旦”一张消费级显卡”被选为瓶颈,混合注意力、GQA、蒸馏、4-bit、投机解码就不再是可选的创新,而是账单上的必付项——你在 Gemma 3、Qwen 小尺寸系列和 Glimmer 上看到几乎同一张购物清单,不是抄袭,是同一份预算约束下的收敛演化。

最后把账单合成一张总表带走:

规格表行根问题论文价签付出的代价
混合注意力 3:1 + SWA 2048 + GQA128K KV cache 装不进显存Longformer → Mistral → Gemma 2/3长距离依赖只剩 13 层全局层承担
RoPE 仅局部层 / 全局层 NoPE长度外推Kazemnejad 2305.19466全局层放弃显式位置信息
三段式蒸馏(logit + on-policy)30B 从哪里学到超出 30B 的行为Hinton 1503.02531 / GKD 2306.13649上限被老师锁定;老师不开源
K-Quant 两档 4-bit59.2GB 权重 vs 24GB 显存GPTQ / AWQ0.2%–1.0% 精度,按 GB 定价
DFlash 块扩散草稿器batch=1 解码访存受限2211.17192 → Block Diffusion → DFlash显存里再养一个草稿器
agent 轨迹特训 + 1.8B 视觉编码器30B 装不下全部世界知识τ-bench / Perception Encoder通用知识与幻觉校准让位

诚实的提醒

  • Glimmer 的全部架构参数与跑分来自 HF 模型卡和 Meta 博客,我没有亲手复现任何一个跑分;智能指数 35/38 来自 AINews 转述 Artificial Analysis,属二手。
  • AINews 提到的 “scale-free QK norm” 在模型卡里没有得到确认(卡上未提 QK-norm),本文没有采用这个说法——留作待查。
  • DFlash 论文的 6× 与 Meta 部署的 3.1× 之间的解释是我的猜测,已在正文标注。
  • KV cache 账本假设全部 BF16 KV、忽略了运行时的分页与碎片开销,真实占用会略高。
  • 成本最低的亲手验证实验:从 HF 拉 Glimmer 的 config.json,核对层数/头数/窗口/交错比例,用本文的 1 KiB 单价公式重算 KV 账本,看 1.70 GiB 是否复现;有 24GB 卡的读者可以再进一步——LM Studio 载入 17GB 变体,nvidia-smi 看显存水位,开关 DFlash 草稿器各测一次 tokens/s,亲手量出投机解码在你这块卡上的真实加速比。

参考来源

工程实践

arXiv 论文(均已当场核实)