统计学和大模型:学会和不确定性共处

借一张数理统计知识图谱,重新理解概率、分布、估计、检验和回归为什么是大模型时代的底层语言:模型给出的不是神谕,而是一组需要被校准、抽样和检验的不确定性。

今天刷到一张 AI 生成的数理统计知识图谱。它很像一张漂亮的地铁图:概率基础、随机变量与分布、数字特征、抽样分布、参数估计、假设检验、回归与应用,被排成一条从左到右、从上到下的学习线路。

这张图真正有价值的地方,不是把统计学公式塞满一屏,而是提醒我一件事:

大模型时代,统计学不是考试科目,而是一种和不确定性相处的语言。

我们很容易把大模型看成一个会说话的知识库。你问,它答;它答得流畅,你就觉得它知道。可从模型内部看,它并不是在吐出“真理”,而是在当前上下文里,给下一个 token 分配一组概率,再沿着概率分布一步步采样或选择。

所以,理解大模型不能只问:

  • 它说了什么?
  • 它有没有答对?
  • 它是不是更聪明?

还要问:

  • 它有多确定?
  • 这种确定来自数据,还是来自语言习惯?
  • 我看到的一次回答,是整体能力,还是一次抽样结果?
  • 一个 benchmark 分数,是能力本身,还是能力的估计值?
  • 两个模型差 2 分,到底是显著差异,还是样本波动?

这些问题,全都落在数理统计的地图上。

最低数学地基:概率、分布、样本

先不急着背公式。统计学最核心的三件事,其实可以用一句人话串起来:

世界不是每次都给同一个结果,所以我们要记录各种结果出现的可能性,再从有限观察里推断背后的规律。

比如你让模型补全这句话:

周末我想去

模型内部可能不是只有一个答案,而是一张表:

下一个 token概率
公园0.36
散步0.22
吃饭0.15
机场0.04
其他0.23

这张表就是一个很小的“分布”。它不是说“公园一定正确”,而是说“在当前上下文下,公园最可能”。如果温度低,系统更倾向于选概率最高的词;如果温度高,后面的词也更有机会冒出来。

这里有三个基础词:

  • 随机变量:会变的结果。比如“下一个 token 是什么”“这次回答是否正确”“接口延迟是多少”。
  • 分布:每种结果分别有多大可能。比如 top tokens 的概率表、模型得分的波动、线上请求的延迟分布。
  • 样本:我们实际观察到的有限结果。比如 100 道题的评测、一天的线上日志、一次 A/B 实验。

统计学的困难就在这里:我们永远看不到完整世界,只能看见样本;但我们又必须根据样本做判断。

图里的主线:从不确定性到行动

这张知识图谱可以读成一条很朴素的路线:

flowchart LR
  A["概率:承认不确定性"] --> B["分布:描述不确定性"]
  B --> C["数字特征:压缩不确定性"]
  C --> D["抽样分布:理解样本会波动"]
  D --> E["统计推断:从样本反推总体"]
  E --> F["回归与应用:用关系解释和预测"]

1. 概率:模型不是神谕

概率的第一课,不是 Bayes 公式,而是放弃“单点答案崇拜”。

大模型每次回答,看起来像一个确定句子。但生成过程的底层,是概率分布。即使模型最后只给你一段文字,它背后仍然有很多没有被说出口的候选项。

这会改变我们使用模型的方式。遇到高风险任务时,不能只看一次回答,而要让模型暴露不确定性:

  • 让它列出备选解释。
  • 让它标注证据和假设。
  • 让它区分事实、推断和猜测。
  • 对关键结论做独立校验。

统计学训练人的第一种气质,就是不急着信一个漂亮答案。

2. 分布:平均值经常不够

如果只看平均值,很多系统问题会被藏起来。

一个模型平均答对率 85%,听起来不错。但你还需要知道它错在哪里:

  • 简单题 99%,复杂推理题 40%?
  • 中文题好,英文题差?
  • 常见场景稳定,长尾场景乱猜?
  • 平均延迟 1 秒,但 P99 延迟 12 秒?

平均值是有用的压缩,但它不是全貌。分布告诉你尾部在哪里、波动有多大、失败集中在哪些人群或场景。

对大模型产品来说,这尤其重要。用户真正感受到的,不是论文表格里的平均分,而是自己那一次请求有没有翻车。

3. 数字特征:把复杂世界压成几个可讨论的数

图里有均值、方差、偏度、峰度。它们看起来像考试词,其实是在回答不同问题:

数字特征人话问题
均值大体水平在哪里?
方差波动大不大?
偏度错误或延迟是不是偏向某一边?
峰度极端情况是不是特别多?

比如两个模型平均得分都 80 分:

  • 模型 A:大多数题稳定在 75 到 85 分。
  • 模型 B:一半题 100 分,一半题 60 分。

如果你做日常问答,A 可能更可靠;如果你做可筛选的创意生成,B 可能更有价值。均值相同,不代表产品性格相同。

4. 抽样分布:一次评测不是能力本身

假设模型 A 在 100 道题里答对 82 道,模型 B 答对 78 道。A 一定更好吗?

直觉会说:82 比 78 大,所以 A 更强。

统计学会追问:这 100 道题是不是一个样本?如果换另一批题,会不会变成 80 对 81?

先用一个极简公式感受一下波动。若答对率是 pp,题目数是 nn,那么答对率估计的大致标准误差是:

p(1p)n\sqrt{\frac{p(1-p)}{n}}

如果 p=0.8p=0.8n=100n=100

0.8×0.2100=0.0016=0.04\sqrt{\frac{0.8 \times 0.2}{100}}=\sqrt{0.0016}=0.04

也就是说,100 道题测出来的 80%,本身就可能有几个百分点的自然波动。A 比 B 高 4 分,未必足够说明“真实能力”有差异。

这就是为什么严肃评测不能只贴一个榜单分数。你至少要关心样本量、题目构成、置信区间、重复实验、显著性检验。

5. 参数估计:分数是估计值,不是实体

我们说“这个模型数学能力 72 分”,这句话很容易让人误会,好像模型体内真的有一个叫“数学能力”的仪表盘,上面写着 72。

更准确的说法是:

在这套题、这次采样、这套判分规则下,我们估计它的数学任务表现大约是 72 分。

这句话啰嗦,但诚实。

参数估计教我们分清两层:

  • 总体参数:我们真正想知道的能力、通过率、故障率。
  • 样本统计量:我们实际测到的分数、比例、均值。

大多数争论都混在这两层之间。一次排行榜、一次测评截图、一次 demo 翻车,都只是样本。它们有信息量,但不是终审判决。

6. 假设检验:不要把巧合当结论

假设检验听起来很学术,背后却是一个日常问题:

我看到的差异,是真的有差异,还是随机波动刚好长成了差异?

在大模型里,这个问题到处都是:

  • 新 prompt 比旧 prompt 好,是真的好,还是刚好这批样本占便宜?
  • 加了 RAG 后准确率提升,是真提升,还是评测集太小?
  • 新模型线上投诉少了,是模型改善,还是当天用户问题更简单?
  • 某个 agent 框架跑分高,是能力强,还是任务集合更适配它?

统计学不会替你自动给答案,但它会逼你把问题说完整:原假设是什么、样本是什么、差异多大、波动多大、接受多大误判风险。

这不是形式主义。它是在保护我们,不要被一次漂亮实验骗走。

7. 回归:找关系,但别急着说因果

回归常被误解成“画一条线”。更有用的理解是:

回归是在问:当一个变量变化时,另一个变量通常怎么变?

比如:

  • 上下文长度增加,回答质量怎么变?
  • 检索命中文档数增加,事实错误率怎么变?
  • 训练数据量增加,验证损失怎么变?
  • 用户问题越长,响应延迟是否越高?

这对大模型工程很重要,因为我们经常要在复杂系统里找杠杆:到底该加数据、加模型、加检索、加工具,还是改评测?

但回归也有边界。相关不等于因果。一条漂亮的线,只说明变量一起变化;至于谁导致谁,还需要实验设计、控制变量和业务理解。

大模型时代最缺的不是公式,而是统计感

这张图如果拿来背,会很累;如果拿来建立统计感,就很值。

所谓统计感,不是见到公式就会推导,而是遇到一个结论时,本能地多问几句:

  • 这是事实,还是推断?
  • 样本量是多少?
  • 样本怎么来的?
  • 有没有选择偏差?
  • 平均值之外,方差和尾部怎么样?
  • 这个差异有没有可能只是噪声?
  • 结论能外推到什么范围,不能外推到什么范围?

这些问题放在大模型上,几乎每一个都关键。

当模型说“我确定”,你要问它的证据来自哪里。当排行榜说“模型 A 第一”,你要问评测集覆盖了什么。当产品说“准确率提升 10%”,你要问基线、样本和置信区间。当自己用 AI 学习时,也要问:我是不是只被流畅表达说服了?

统计学的深意在这里:

它让人保持一种克制的诚实:既不因为世界有噪声就放弃判断,也不因为看到一个数字就假装确定。

这张图该怎么用

我不会把这张 AI 生成图谱当权威教材。AI 生成内容可能有简化、遗漏甚至错误。更好的用法,是把它当路线图:

  1. 先学概率:知道模型输出为什么不是单点真相。
  2. 再学分布:知道平均表现为什么掩盖尾部风险。
  3. 再学抽样:知道一次评测为什么会波动。
  4. 再学估计:知道分数只是对能力的估计。
  5. 再学检验:知道差异需要被证伪和校准。
  6. 最后学回归:知道如何从数据里找关系,同时克制因果冲动。

如果只记一句话,我会记这个:

大模型把语言变得更流畅,统计学负责提醒我们:流畅不是确定,概率不是事实,样本不是总体。

这不是给 AI 泼冷水。恰好相反,只有学会看见不确定性,我们才更可能把大模型用在真正重要的地方。