小公司如何构建自己的大模型:一条论文铺出来的决策阶梯

把"自建大模型"拆成从 RAG 到从零预训练的四级阶梯,用 12 篇可查证的 arXiv 论文标出每一级的成本量级、升级信号与踩坑边界——BloombergGPT 与 DeepSeek-V3 是两端的对照案例。

2023 年,Bloomberg 用 512 块 A100 跑了约 53 天、耗掉约 130 万 GPU 小时,从零训出 50B 参数的金融大模型 BloombergGPT(arXiv:2303.17564)。随后的对比评测发现:从没吃过一条 Bloomberg 私有数据的 GPT-4,在多项金融基准上追平甚至反超了它。这不是”自建大模型必败”的故事——它是每个想自建模型的小公司都该先消化的一课:钱花在阶梯的哪一级,比花多少钱重要得多。

这篇文章要传达的主线只有一句话:小公司”构建自己的大模型”,正确姿势不是复刻大厂的预训练,而是沿一条四级决策阶梯逐层投入——每一级都有公开论文把成本砍掉一到几个数量级,而你真正的护城河是私有数据和评测,不是参数量。

下面每一个关键论点都挂了可查证的来源,文末按”论文 / 工程实践”分组列出。

一、先拆需求:你要的不是”大模型”,是三件事

“我们要有自己的大模型”这句话,用第一性原理拆开,其实是三个独立需求的混合体:

  1. 任务能力:模型得会做你的活(客服、合同审查、代码补全……)。
  2. 私有知识与行为:它得懂你的领域黑话、内部数据,按你的格式和规矩说话。
  3. 成本与控制权:数据不出域、推理成本可控、不被上游 API 卡脖子。

关键在于:这三件事没有一件必然要求从零预训练。把”自己部署”和”自己训练”混为一谈,是这个领域最贵的一类误解——数据敏感、要求私有化,答案往往是”私有化部署开源权重模型”,而不是”自己从头训一个”。工程社区已有惨痛先例:有创业公司因为觉得微调”不够硬核”,烧掉 50 万美元尝试从零预训练,最终回到微调路线(见 2026 年自训小模型指南)。

所以正确的问法不是”怎么训一个大模型”,而是:为了满足这三件事,我最少需要动模型到什么深度?

二、决策阶梯:四级投入,停在第一个够用的台阶

工程界在 2026 年已形成清晰共识(例见 DEV 社区的小模型训练指南企业 LLM 策略指南):从最便宜的一级开始爬,停在第一个解决问题的台阶上

flowchart TD
    A["L0 提示词 + RAG<br/>不动权重 · 改上下文"] -->|"格式/行为怎么提示都不稳"| B["L1 微调 SFT + LoRA/QLoRA + DPO<br/>改行为 · 单卡到几十卡"]
    B -->|"领域知识本身缺失<br/>且手握 10B+ 领域 token"| C["L2 继续预训练<br/>改知识 · 几百到几千 GPU 日"]
    C -->|"词表/模态/合规<br/>连开源基座都不成立"| D["L3 从零预训练<br/>改一切 · 数万 GPU 日起"]
    A -.->|"绝大多数公司停在这里"| A
级别改什么成本量级升级到下一级的信号关键论文
L0 提示词 + RAG上下文零训练成本行为/格式怎么提示都不稳定;每次调用都在重复灌同样的知识
L1 微调(SFT + LoRA/QLoRA + DPO)行为单卡数小时 ~ 几十卡数天模型对领域知识本身一无所知,微调补不动LoRAQLoRADPO
L2 继续预训练知识数百 ~ 数千 GPU 日领域的 token 分布(词表、语法、模态)连开源基座都覆盖不了MiniCPM/WSD
L3 从零预训练一切数万 GPU 日起步几乎不会触发(见第六节的例外清单)ChinchillaOLMo 2

一个容易被反驳的点先接住:“微调出来的模型是不是永远低人一等?” InstructGPT 论文(arXiv:2203.02155)给出了反例的原型——在人类偏好评测中,经过对齐微调的 1.3B 模型输出,被评审者偏好于未对齐的 175B GPT-3。参数差 100 倍,胜负却翻转了。窄任务上,一个微调过的 3B 模型以约 1/50 的推理成本打平通用大 API,在 2026 年已是常见工程结论(见上文小模型指南)。

下面按台阶展开:L1 是绝大多数小公司的主战场,L2 是中间带,L3 单独讲预算、超参和数据三门必修课。

三、L1 主战场:单卡把开源模型变成”你的模型”

L1 的技术栈可以概括为一条流水线:蒸馏/人工造 SFT 数据 → LoRA/QLoRA 微调 → DPO 对齐。三步各有一篇奠基论文,且都在为同一个目标服务:把 InstructGPT 的三段式对齐(SFT → 训奖励模型 → PPO 强化学习)压缩到小团队做得动的成本。

第一步,行为数据。 直接雇人写几万条示范太贵,2026 年的标准做法是从更强的开源模型蒸馏。DeepSeek-R1(arXiv:2501.12948)把这条路线官方化了:他们用 R1 生成的推理数据蒸馏出 6 个基于 Qwen/Llama 的稠密小模型并全部开源——大模型当老师、小模型当产品,从此是有论文背书的正规军打法。注意一个灰度边界:用开源权重模型(license 允许时)的输出做蒸馏是安全区,用商业 API 的输出训练竞品模型通常违反服务条款。

第二步,参数高效微调。 LoRA(arXiv:2106.09685)的洞察是:微调时的权重更新矩阵有很低的”内在秩”,所以冻结全部预训练权重、只训练注入的低秩分解矩阵就够了——对 GPT-3 175B,可训练参数量降低约 10000 倍,显存需求降到 1/3,效果与全参微调持平。QLoRA(arXiv:2305.14314)再进一步,把冻结的基座量化到 4-bit(NF4 数据类型 + 双重量化),让 65B 模型在单张 48GB 显卡上完成微调;其产出的 Guanaco 模型在 Vicuna 基准上达到 ChatGPT 99.3% 的水平,只花了单卡 24 小时。

第三步,偏好对齐。 InstructGPT 的 PPO 流水线要同时伺候四个模型(策略、参考、奖励、价值),训练极不稳定。DPO(arXiv:2305.18290)的数学贡献是证明了奖励模型可以重参数化,使最优策略有闭式解——于是整个 RLHF 坍缩成一个简单的分类损失:给模型看”好答案 vs 坏答案”对,直接做梯度下降。不需要奖励模型,不需要 RL 基础设施。如今 DPO 及其变体已是开源模型对齐的默认路线。

把三步连起来看成本:一个 7B 基座 + 几千条蒸馏/人工混合的领域 SFT 数据 + 几百到几千条偏好对,在一张消费级或云上单卡上数天内可以完整走完。这就是”自己的大模型”对 80% 小公司的实际形态。

什么时候该离开 L1? 当你发现模型缺的不是”怎么说”而是”知道什么”——领域术语在它眼里是乱码、事实性回答系统性出错、RAG 检索出来它也读不懂——这是知识缺口,微调(改行为)补不动,该上 L2 了。

四、L2 中间带:继续预训练,改知识不改能力

继续预训练(continued pretraining)用领域语料在开源基座上接着跑预训练目标。一个好用的心智区分(来自工程实践总结):继续预训练改变模型”知道什么”,微调改变模型”怎么回应”,两者常常串联使用——先用领域文本继续预训练,再做指令微调和 DPO,最后用 RAG 兜住时效性。

两个工程要点:

  • 数据门槛:领域语料至少要到 10B token 量级才值得开跑,低于这个量级,L1 + RAG 几乎总是更划算(工程共识见上文指南)。
  • 灾难性遗忘:接着训容易把基座的通用能力冲掉。缓解手段已经成熟——领域数据混入通用数据回放(replay)、压低学习率、或干脆用 LoRA 做继续预训练。MiniCPM 提出的 WSD 学习率调度器(Warmup-Stable-Decay,arXiv:2404.06395)在设计上就为此服务:长长的稳定期让你随时可以接续训练、注入新领域数据,再走一次短衰减收尾,不需要重排整个余弦周期。

五、如果真要爬到 L3:预训练的三门必修课

假设你有充分理由从零训(理由清单在下一节),三门课决定生死:预算、超参、数据。三门课各有一篇改变行业认知的论文。

5.1 预算课:Chinchilla 定标尺,推理成本改答案

预训练的计算量有个经典估算式:

C6NDC \approx 6ND

其中 NN 是参数量,DD 是训练 token 数。拿公开数据验算:TinyLlama(arXiv:2401.02385)用 1.1B 参数训 3T token,代入得 6×1.1×109×3×10122×10226 \times 1.1{\times}10^9 \times 3{\times}10^{12} \approx 2{\times}10^{22} FLOPs——对应其技术报告里的实际开销:16 块 A100-40G 跑约 90 天。这个公式让你在写 PPT 之前就能对预算做数量级估算。

给定预算 CC,参数和数据怎么分?Chinchilla 论文(arXiv:2203.15556)训了 400 多个模型后给出答案:参数量和 token 数应等比例增长,落在约 20 token/参数——它用与 280B 的 Gopher 相同的算力,训了个 70B、数据多 4 倍的模型,在几乎所有下游任务上全面胜出。当时的大模型全都”训得太少”。

但小公司必须再往前走一步,因为 Chinchilla 只优化了训练成本,而你要为推理付一辈子的钱。Beyond Chinchilla-Optimal(arXiv:2401.00448,MosaicML)把推理需求加进公式后结论反转:只要预期推理量可观,就应该训更小的模型、喂更多的数据。论文给的具体例子:预期 2T token 推理需求时,放弃 13B 改训一个数据更多的 7B,总计算量省 17%;而且模型质量随 token/参数比一路提升到 10000:1 都没有饱和。

开源界用脚投票验证了这条路线:SmolLM2(arXiv:2502.02737)用 11T token 训 1.7B 模型(约 6500 token/参数,是 Chinchilla 比例的 300 多倍),压过了 Qwen2.5-1.5B 和 Llama3.2-1B。对小公司这是最重要的一条预算结论:你的最优解几乎必然是”小参数 + 极度过训练”,而不是”大参数 + 刚好训够”。

5.2 超参课:先造风洞,再造飞机

MiniCPM(arXiv:2404.06395)的方法论贡献比模型本身更值钱:模型风洞(wind tunnel)——用一批极小的模型系统性扫描超参(学习率、batch size、数据配比),找到随规模稳定外推的规律,再一次性放大到目标尺寸。它 1.2B/2.4B 的模型打平了当时 7B–13B 的对手,靠的不是玄学炼丹,而是把试错成本压缩在便宜的小尺度完成。小团队算力经不起在目标尺寸上试错,风洞就是你的安全带。

5.3 数据课:质量是杠杆最长的一根

phi-1 论文《Textbooks Are All You Need》(arXiv:2306.11644)做了一个极端实验:1.3B 参数的模型,只用 7B token 训练数据(6B 从网上按”教科书质量”筛出 + 1B 用 GPT-3.5 合成的教科书与习题),8 块 A100 训 4 天,在 HumanEval 代码基准上拿到 50.6% pass@1——追平了参数大一个数量级、数据大两个数量级的模型。结论粗暴而清晰:数据质量的杠杆比数据数量长得多。

FineWeb(arXiv:2406.17557,Hugging Face)把这个思想工业化并完全开源:从 96 个 Common Crawl 快照里”滗析”出 15T token,每个过滤/去重决策都做了消融实验;其子集 FineWeb-Edu 用 Llama-3-70B 标注训了个”教育价值”分类器来筛数据,1.3T token 的精选子集在 MMLU、ARC 上大幅超越未筛选数据。这两篇论文对小公司的意义是:筛数据的完整方法论已经开源,你不需要发明它——你需要把它套用到你的私有语料上。

这也正是 BloombergGPT 案例里真正值钱的部分:它 709B 训练 token 里 51% 是内部积累了几十年的金融语料 FinPile。私有数据是你唯一不可复制的资产;筛选和清洗它的流水线,才是”自建模型”项目里复利最高的投资——无论你最终停在哪一级台阶,这份数据资产都能用。

六、两个案例的对照,和一条清醒的边界

把阶梯两端的真实案例放在一起看(灰度思维:两个都不是”错误答案”,但边界很清楚):

BloombergGPT (2023)DeepSeek-V3 (2024)
论文arXiv:2303.17564arXiv:2412.19437
架构50B 稠密671B MoE(激活 37B)+ MLA + FP8
训练数据709B token(51% 私有)14.8T token
训练开销~130 万 A100 GPU 时(512 卡 × 53 天)278.8 万 H800 GPU 时(报告口径 ≈ 558 万美元租金)
后来发生了什么GPT-4 无金融特训即在多项金融基准上追平/反超以约百分之一于传闻中前沿实验室的账面成本达到第一梯队

两条教训:

教训一:from-scratch 的”值回票价窗口”极窄。 你从零训的模型是静态的,而开源基座每 6–12 个月换代一次。BloombergGPT 不是训砸了——它是被时间打败的:立项时最强开源基座还很弱,等它训完,买得到/下得到的通用模型已经越过了它的领域优势。今天做同样决策的公司,面对的是 Llama、Qwen、DeepSeek 每年迭代的基座,窗口比 2023 年更窄。

教训二:别拿 DeepSeek 的账单给自己做预算。 V3 技术报告里 558 万美元是纯 GPU 租金口径(2.788M GPU 时 × 假设的 2 美元/时),明确不含研发人力、失败的实验跑、消融实验和基础设施(成本口径分析见 InterconnectsCeramic.ai)。而且这个数字建立在 MLA、无辅助损失的 MoE 负载均衡、FP8 训练等一整套自研架构效率之上——那是一个大团队多年积累的产物,不是租到 H800 就自动获得的。

七、那么,什么时候 L3 真的成立?

逆向思考——从零预训练对小公司成立的条件,工程共识(2026 指南)加上论文证据,大致是这张短清单:

  1. Token 分布本身是新的:蛋白质序列、时序信号、小语种、专有 DSL——tokenizer 和数据分布都得重造,开源基座的先验帮不上忙。
  2. 手握 10B+ token 的独有语料,且它与公网数据的重叠可忽略(BloombergGPT 条件的现代版——但先回答:继续预训练为什么不够?)。
  3. 主权/合规硬约束:连开源权重的来源都不可接受,模型血统必须 100% 可审计。
  4. 学习本身就是目的:Karpathy 的 nanochat 已把”训一个 ChatGPT 雏形”的全流程压到 8×H100 上百美元量级(见上文指南),当教学练习非常值。

真走到这一步,起点应该是 OLMo 2(arXiv:2501.00656):Ai2 把 7B/13B 模型的全部训练资产开源——数据、代码、配方、中间 checkpoint、训练稳定性(loss spike)处理经验。2023 年 Bloomberg 要自己摸索的一切,今天有完整答案可抄。这本身就是成本被论文砍掉一个数量级的又一例。

八、带走的模型

把全文压缩成一个可复用的公式:

自己的大模型 = 开源基座 × 私有数据 × 阶梯式投入

基座解决能力(别自己造),私有数据解决差异化(这是唯一护城河),阶梯解决成本(停在第一个够用的台阶)。

以及一份决策 checklist:

  • 我的问题是知识问题(→ RAG / L2)还是行为问题(→ L1 微调)?
  • 我有没有一套自己的评测集?没有它,任何一级的投入都无法验收。
  • L1 试过 SFT + LoRA/QLoRA + DPO 全流程了吗?(单卡数天,这是升级前的必答题)
  • 若考虑 L2:领域语料到 10B token 了吗?防遗忘方案(replay/低 LR/WSD)定了吗?
  • 若考虑 L3:用 C6NDC \approx 6ND 估过预算了吗?按”小参数 + 过训练”而不是 Chinchilla 比例规划了吗?风洞实验排了吗?
  • 最后:这笔钱投到数据清洗流水线上,回报是不是更高?

三年后回看,模型权重会过时,训练配方会换代,但这条阶梯的形状——以及”护城河在数据不在参数”这个判断——大概率仍然成立。

参考来源

arXiv 论文

工程实践