AI 数学全景拆解:从研究前沿一路拆到小学算术,不跳步(完整节点版)
把 AI 用到的全部数学,从最高层一层层往下拆,每个概念只连它真正的直接前置,中间绝不跳步,一直拆到小学的加减乘除。六大主干(线性代数/微积分/概率统计/优化/信息论/离散)各附主脊图与完整节点表,顶层覆盖 AI 各子领域用到的数学——并解释为什么"听不懂"几乎总是某个下层前置没补上,而不是你不行。
Start here
把 AI 用到的全部数学,从最高层一层层往下拆,每个概念只连它真正的直接前置,中间绝不跳步,一直拆到小学的加减乘除。六大主干(线性代数/微积分/概率统计/优化/信息论/离散)各附主脊图与完整节点表,顶层覆盖 AI 各子领域用到的数学——并解释为什么"听不懂"几乎总是某个下层前置没补上,而不是你不行。
按同济工程数学线性代数第七版的主干,围绕矩阵、行列式、线性方程组、向量组、秩和子空间设计25道原创题,服务模型学习。
借一张数理统计知识图谱,重新理解概率、分布、估计、检验和回归为什么是大模型时代的底层语言:模型给出的不是神谕,而是一组需要被校准、抽样和检验的不确定性。
按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。
Archive
DeepSeek 于 2026-08-13 以 MIT 协议开源 agent harness「dsh」。深读其架构(turn/step 事件模型、会话日志唯一事实源、能力接缝、profile 配置分层)与理论底座 Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》:可撤销效应 + 反应式余效应 + 合流定理,把「热替换插件不炸」从工程纪律升格为数学性质。附与 SWE-agent、Claude Code、Prime Agent 的谱系对照。
深度解读 Datawhale 开源书《Hello-Agents 从零开始构建智能体》(V1.0.3,720 页 16 章):ReAct 循环先活在提示词里(第四章三大范式),再固化成框架代码(第七章 HelloAgents 自研框架的"万物皆为工具"),最后被 GRPO 训进模型权重(第十一章,Qwen3-0.6B 在 GSM8K 上 5%→40-50%→60-70%)——评估(第十二章)则是跨载体的账本。附全书地图、GRPO/PPO 对照、记忆评分公式与已核实的论文清单。
深度解读李博杰《深入理解 AI Agent:设计原理与工程实践》(v1.1,307 页):一个公式(Agent = LLM + 上下文 + 工具)、一条机制假设(上下文学习≈检索而非推理),推出全书几乎所有反直觉工程结论——状态栏让弱模型准确率涨 40-54 个百分点、系统提示词里一个时间戳让 TTFT 从 0.5s 涨到 3-5s、状态栏没覆盖的维度准确率从 100% 塌到 7.6%、RLVP 用"不对称验证器"补 GRPO 的方差、多 Agent 唯一有效判据是"是否引入生成时不存在的新信息"。
基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。
评测报告里"5/5 全对"的 95% 置信下界只有 56.6%。以 Wilson 下界为入口,把评测分数背后的整套统计生词(置信区间、配对检验、多重比较、判分者一致性、pass@k 无偏估计、功效分析)钉成四道关卡和一张生词总表,让你以后见到这类词不再发怵。
《三个词的词表,十二个参数》的数学陪读篇。把原文用到的全部数学拆成七块积木——下标记号、乘加账单、e 和 ln、softmax、斜率、多旋钮下山、链式法则——每块只用初高中知识搭起来,配可按计算器复现的小例子,装完立刻回扣原文对应公式。结尾附逐符号拆解表和自检清单。
用能装进脑子的最小真实模型(3 词词表、12 个参数的 bigram 语言模型),把生产级训练的一整步走通:前向算损失、反向传播分账(从 p−y 起点到每个参数)、数值梯度检验、SGD 与 AdamW 各更新一步。每个数字都先用脚本验算过,结尾附 40 行可跑的验证脚本和自检清单。
一个 1896 年的意大利经济学家,名字反复出现在 2022-2024 年的大模型论文里——但「帕累托」其实是两个不同的数学对象:重尾分布(80/20,告诉你杠杆藏在哪)和帕累托前沿(告诉你免费午餐吃完没有)。用八篇论文把两副面孔各自在 LLM 里的三次现身讲清楚:数据侧的 LIMA 与数据剪枝、注意力侧的 H2O、请求侧的路由前提;成本-质量前沿的 FrugalGPT/RouteLLM、算力分配的 Chinchilla、多目标对齐的 Rewarded Soups/Panacea。最后给一条可复用的心法:前沿的每一次外推,都始于发现一条新的重尾。
结合 DeepSeek-V4 技术报告(arXiv:2606.19348)与它的论文谱系(MLA→NSA→DSA→CSA/HCA),把 V4-Flash 的"快"拆成一个公式:解码速度 ≈ 带宽 ÷ 每 token 要搬的字节数。所有架构创新都是在砍这个分母的五个因子——激活参数、KV 宽度、看多少条、存多少条、每个数占几位。
零基础向。不预设博弈论或强化学习背景,用三个零件拼出 MCTS:大数定律(不会评估就采样)、老虎机公式 UCB1(逐符号讲解 + 全程手算)、树上的四步循环(选择→扩展→模拟→回传)。然后看 AlphaGo 用神经网络换掉了哪两个零件,以及 LLM 时代 MCTS 为什么被 DeepSeek-R1 放弃、又被 rStar-Math 捡起。
做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。
承接《Agent 应用工程师的六层》的分水岭判断,把「可观测、可恢复、可验证、可治理、可持续进化」逐个拆成最小工程实现:每个「可」一段伪代码,共享同一个设计原则——状态放内核外面,决策穿过内核,副作用经过关卡。
同一条信息放在上下文的开头、中间、结尾,对最强模型输出的影响力可以差出几十个百分点——而且这个"位置地形"会随上下文填充率动态变形:塞满一半之后,经典的 U 形曲线塌掉,只剩结尾优势。从注意力机制的三个根本约束出发,讲清位置偏差的成因、衰减的动态过程,以及"结构"为什么本质上是在地形上打人工锚点。
从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。
从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。
用作业、考试、模运算和训练曲线递归拆解 Grokking:模型为什么会先过拟合,再延迟泛化,为什么看起来像相变,以及它和大模型涌现有什么关系。
不把挂谷猜想当高深数学炫技,而是把它转译成小白能带走的几种大模型学习能力:高维方向感、覆盖意识、极端例子思维和多尺度分析。
承接线代上篇,围绕特征值、对角化、二次型、正交投影、PCA、SVD、线性变换和低秩更新设计第26到50题,服务大模型学习。
按同济高数第八版上册主线,围绕极限、导数、Taylor、积分和微分方程设计25道原创题,题题带详细答案,并说明它们如何服务模型学习。
承接上册25题,按同济高数第八版下册主线整理向量、多元微分、重积分、曲线曲面积分和级数的25道原创题,服务模型学习。
一篇从零开始的 In-Context Learning 深度讲解:模型没有更新权重,却能根据 prompt 里的几个例子临时跟上任务。一个有力解释是,它在上下文里推断当前任务是什么。
如果已经了解 embedding、attention、softmax、LoRA 和 SVD,这篇可以继续往下走:训练动力学、权重空间、内部因果、表示几何、对齐与部署里,还有哪些值得追的大模型数学问题。
用照片压缩、二维小例子和最少数学地基解释 SVD:U、Σ、Vᵀ 各自做什么,奇异值为什么代表重要程度,以及它和 PCA、推荐、LoRA、低秩压缩的关系。
从函数、斜率、导数和二次近似开始,递归拆解泰勒展开是什么,再连接到梯度下降、损失函数、二阶优化、量化和大模型训练里的局部近似思想。