今天刷到一张 AI 生成的数理统计知识图谱。它很像一张漂亮的地铁图:概率基础、随机变量与分布、数字特征、抽样分布、参数估计、假设检验、回归与应用,被排成一条从左到右、从上到下的学习线路。
这张图真正有价值的地方,不是把统计学公式塞满一屏,而是提醒我一件事:
大模型时代,统计学不是考试科目,而是一种和不确定性相处的语言。
我们很容易把大模型看成一个会说话的知识库。你问,它答;它答得流畅,你就觉得它知道。可从模型内部看,它并不是在吐出“真理”,而是在当前上下文里,给下一个 token 分配一组概率,再沿着概率分布一步步采样或选择。
所以,理解大模型不能只问:
- 它说了什么?
- 它有没有答对?
- 它是不是更聪明?
还要问:
- 它有多确定?
- 这种确定来自数据,还是来自语言习惯?
- 我看到的一次回答,是整体能力,还是一次抽样结果?
- 一个 benchmark 分数,是能力本身,还是能力的估计值?
- 两个模型差 2 分,到底是显著差异,还是样本波动?
这些问题,全都落在数理统计的地图上。
最低数学地基:概率、分布、样本
先不急着背公式。统计学最核心的三件事,其实可以用一句人话串起来:
世界不是每次都给同一个结果,所以我们要记录各种结果出现的可能性,再从有限观察里推断背后的规律。
比如你让模型补全这句话:
周末我想去
模型内部可能不是只有一个答案,而是一张表:
| 下一个 token | 概率 |
|---|---|
| 公园 | 0.36 |
| 散步 | 0.22 |
| 吃饭 | 0.15 |
| 机场 | 0.04 |
| 其他 | 0.23 |
这张表就是一个很小的“分布”。它不是说“公园一定正确”,而是说“在当前上下文下,公园最可能”。如果温度低,系统更倾向于选概率最高的词;如果温度高,后面的词也更有机会冒出来。
这里有三个基础词:
- 随机变量:会变的结果。比如“下一个 token 是什么”“这次回答是否正确”“接口延迟是多少”。
- 分布:每种结果分别有多大可能。比如 top tokens 的概率表、模型得分的波动、线上请求的延迟分布。
- 样本:我们实际观察到的有限结果。比如 100 道题的评测、一天的线上日志、一次 A/B 实验。
统计学的困难就在这里:我们永远看不到完整世界,只能看见样本;但我们又必须根据样本做判断。
图里的主线:从不确定性到行动
这张知识图谱可以读成一条很朴素的路线:
flowchart LR
A["概率:承认不确定性"] --> B["分布:描述不确定性"]
B --> C["数字特征:压缩不确定性"]
C --> D["抽样分布:理解样本会波动"]
D --> E["统计推断:从样本反推总体"]
E --> F["回归与应用:用关系解释和预测"]
1. 概率:模型不是神谕
概率的第一课,不是 Bayes 公式,而是放弃“单点答案崇拜”。
大模型每次回答,看起来像一个确定句子。但生成过程的底层,是概率分布。即使模型最后只给你一段文字,它背后仍然有很多没有被说出口的候选项。
这会改变我们使用模型的方式。遇到高风险任务时,不能只看一次回答,而要让模型暴露不确定性:
- 让它列出备选解释。
- 让它标注证据和假设。
- 让它区分事实、推断和猜测。
- 对关键结论做独立校验。
统计学训练人的第一种气质,就是不急着信一个漂亮答案。
2. 分布:平均值经常不够
如果只看平均值,很多系统问题会被藏起来。
一个模型平均答对率 85%,听起来不错。但你还需要知道它错在哪里:
- 简单题 99%,复杂推理题 40%?
- 中文题好,英文题差?
- 常见场景稳定,长尾场景乱猜?
- 平均延迟 1 秒,但 P99 延迟 12 秒?
平均值是有用的压缩,但它不是全貌。分布告诉你尾部在哪里、波动有多大、失败集中在哪些人群或场景。
对大模型产品来说,这尤其重要。用户真正感受到的,不是论文表格里的平均分,而是自己那一次请求有没有翻车。
3. 数字特征:把复杂世界压成几个可讨论的数
图里有均值、方差、偏度、峰度。它们看起来像考试词,其实是在回答不同问题:
| 数字特征 | 人话问题 |
|---|---|
| 均值 | 大体水平在哪里? |
| 方差 | 波动大不大? |
| 偏度 | 错误或延迟是不是偏向某一边? |
| 峰度 | 极端情况是不是特别多? |
比如两个模型平均得分都 80 分:
- 模型 A:大多数题稳定在 75 到 85 分。
- 模型 B:一半题 100 分,一半题 60 分。
如果你做日常问答,A 可能更可靠;如果你做可筛选的创意生成,B 可能更有价值。均值相同,不代表产品性格相同。
4. 抽样分布:一次评测不是能力本身
假设模型 A 在 100 道题里答对 82 道,模型 B 答对 78 道。A 一定更好吗?
直觉会说:82 比 78 大,所以 A 更强。
统计学会追问:这 100 道题是不是一个样本?如果换另一批题,会不会变成 80 对 81?
先用一个极简公式感受一下波动。若答对率是 ,题目数是 ,那么答对率估计的大致标准误差是:
如果 ,:
也就是说,100 道题测出来的 80%,本身就可能有几个百分点的自然波动。A 比 B 高 4 分,未必足够说明“真实能力”有差异。
这就是为什么严肃评测不能只贴一个榜单分数。你至少要关心样本量、题目构成、置信区间、重复实验、显著性检验。
5. 参数估计:分数是估计值,不是实体
我们说“这个模型数学能力 72 分”,这句话很容易让人误会,好像模型体内真的有一个叫“数学能力”的仪表盘,上面写着 72。
更准确的说法是:
在这套题、这次采样、这套判分规则下,我们估计它的数学任务表现大约是 72 分。
这句话啰嗦,但诚实。
参数估计教我们分清两层:
- 总体参数:我们真正想知道的能力、通过率、故障率。
- 样本统计量:我们实际测到的分数、比例、均值。
大多数争论都混在这两层之间。一次排行榜、一次测评截图、一次 demo 翻车,都只是样本。它们有信息量,但不是终审判决。
6. 假设检验:不要把巧合当结论
假设检验听起来很学术,背后却是一个日常问题:
我看到的差异,是真的有差异,还是随机波动刚好长成了差异?
在大模型里,这个问题到处都是:
- 新 prompt 比旧 prompt 好,是真的好,还是刚好这批样本占便宜?
- 加了 RAG 后准确率提升,是真提升,还是评测集太小?
- 新模型线上投诉少了,是模型改善,还是当天用户问题更简单?
- 某个 agent 框架跑分高,是能力强,还是任务集合更适配它?
统计学不会替你自动给答案,但它会逼你把问题说完整:原假设是什么、样本是什么、差异多大、波动多大、接受多大误判风险。
这不是形式主义。它是在保护我们,不要被一次漂亮实验骗走。
7. 回归:找关系,但别急着说因果
回归常被误解成“画一条线”。更有用的理解是:
回归是在问:当一个变量变化时,另一个变量通常怎么变?
比如:
- 上下文长度增加,回答质量怎么变?
- 检索命中文档数增加,事实错误率怎么变?
- 训练数据量增加,验证损失怎么变?
- 用户问题越长,响应延迟是否越高?
这对大模型工程很重要,因为我们经常要在复杂系统里找杠杆:到底该加数据、加模型、加检索、加工具,还是改评测?
但回归也有边界。相关不等于因果。一条漂亮的线,只说明变量一起变化;至于谁导致谁,还需要实验设计、控制变量和业务理解。
大模型时代最缺的不是公式,而是统计感
这张图如果拿来背,会很累;如果拿来建立统计感,就很值。
所谓统计感,不是见到公式就会推导,而是遇到一个结论时,本能地多问几句:
- 这是事实,还是推断?
- 样本量是多少?
- 样本怎么来的?
- 有没有选择偏差?
- 平均值之外,方差和尾部怎么样?
- 这个差异有没有可能只是噪声?
- 结论能外推到什么范围,不能外推到什么范围?
这些问题放在大模型上,几乎每一个都关键。
当模型说“我确定”,你要问它的证据来自哪里。当排行榜说“模型 A 第一”,你要问评测集覆盖了什么。当产品说“准确率提升 10%”,你要问基线、样本和置信区间。当自己用 AI 学习时,也要问:我是不是只被流畅表达说服了?
统计学的深意在这里:
它让人保持一种克制的诚实:既不因为世界有噪声就放弃判断,也不因为看到一个数字就假装确定。
这张图该怎么用
我不会把这张 AI 生成图谱当权威教材。AI 生成内容可能有简化、遗漏甚至错误。更好的用法,是把它当路线图:
- 先学概率:知道模型输出为什么不是单点真相。
- 再学分布:知道平均表现为什么掩盖尾部风险。
- 再学抽样:知道一次评测为什么会波动。
- 再学估计:知道分数只是对能力的估计。
- 再学检验:知道差异需要被证伪和校准。
- 最后学回归:知道如何从数据里找关系,同时克制因果冲动。
如果只记一句话,我会记这个:
大模型把语言变得更流畅,统计学负责提醒我们:流畅不是确定,概率不是事实,样本不是总体。
这不是给 AI 泼冷水。恰好相反,只有学会看见不确定性,我们才更可能把大模型用在真正重要的地方。