初中数学读懂 Attention Is All You Need:从加权平均到 Transformer
按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。
按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。
用作业、考试、模运算和训练曲线递归拆解 Grokking:模型为什么会先过拟合,再延迟泛化,为什么看起来像相变,以及它和大模型涌现有什么关系。
不把挂谷猜想当高深数学炫技,而是把它转译成小白能带走的几种大模型学习能力:高维方向感、覆盖意识、极端例子思维和多尺度分析。
按同济工程数学线性代数第七版的主干,围绕矩阵、行列式、线性方程组、向量组、秩和子空间设计25道原创题,服务模型学习。
承接线代上篇,围绕特征值、对角化、二次型、正交投影、PCA、SVD、线性变换和低秩更新设计第26到50题,服务大模型学习。
借一张数理统计知识图谱,重新理解概率、分布、估计、检验和回归为什么是大模型时代的底层语言:模型给出的不是神谕,而是一组需要被校准、抽样和检验的不确定性。
按同济高数第八版上册主线,围绕极限、导数、Taylor、积分和微分方程设计25道原创题,题题带详细答案,并说明它们如何服务模型学习。
承接上册25题,按同济高数第八版下册主线整理向量、多元微分、重积分、曲线曲面积分和级数的25道原创题,服务模型学习。
一篇从零开始的 In-Context Learning 深度讲解:模型没有更新权重,却能根据 prompt 里的几个例子临时跟上任务。一个有力解释是,它在上下文里推断当前任务是什么。
如果已经了解 embedding、attention、softmax、LoRA 和 SVD,这篇可以继续往下走:训练动力学、权重空间、内部因果、表示几何、对齐与部署里,还有哪些值得追的大模型数学问题。
用照片压缩、二维小例子和最少数学地基解释 SVD:U、Σ、Vᵀ 各自做什么,奇异值为什么代表重要程度,以及它和 PCA、推荐、LoRA、低秩压缩的关系。
从函数、斜率、导数和二次近似开始,递归拆解泰勒展开是什么,再连接到梯度下降、损失函数、二阶优化、量化和大模型训练里的局部近似思想。
16 张可交互的经典函数图像:线性、二次、三次、反比例、根式、绝对值、指数、对数、三角、反三角、双曲、sigmoid、高斯、取整。用 function-plot 的区间算术精确绘制,滚轮缩放、悬停读坐标。附精确性质速查表和工具选型指南。
上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。
Scaling Laws 深读的陪读篇。用正方形、身高预测、餐巾纸记账几个能手算的真问题,把幂律、log-log 直线、拟合、外推、C≈6ND 五件工具逐件装好,每件装完立刻回扣深读原文。读完再回去,0.73 vs 0.5 之争会变成一个很直观的故事。
沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。
从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。
零基础向。刷题圈流传一张"15 种 DSA 模式"图:双指针、滑动窗口、二分、单调栈、DP……看起来是 15 个要背的模板,拆到本质只剩一件事:所有题都是在候选答案里搜索,暴力是全部看一遍,而每种模式只是一种"敢不看某些候选"的理由。这篇把 15 种模式还原成 3 个动词,每个模式讲清它凭什么快,配一个几秒能看懂的例子。读完你面对新题时,想的不再是"套哪个模板",而是"这道题允许我用哪个动词"。
从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。
零基础向。不讲任何算法、不用一个公式,只回答三个更早的问题:强化学习到底是什么?已经有预训练和微调了,为什么还需要它?它是怎么被搬到语言模型上的?读完你会拿到一张 RL 术语对照表——之后再读 RLHF、PPO、GRPO,那些词就不再是黑话。
上一篇 Big-O 深读的陪读篇。用折纸、猜数字、握手、排队照相六个能手算的真问题,把指数、对数、求和、阶乘、递推式、「阶」的眼镜逐件装好,每件工具讲完立刻回扣原文公式。读完这篇再回去,那些公式会自己开口说话。
2026 年 7 月,"GPT-5.6 一小时证明循环双覆盖猜想"刷屏短视频。事实核查:事件为真,但"证明了"三个字说早了——现在的准确状态是"机器生成了一份证明,人类正在核验"。这篇先用能手画的小例子讲透这个 50 年悬案本身(圈、桥、snark),再逐页拆 OpenAI 发布的两份一手 PDF:3 页的证明走了哪四步,那份比证明更值得读的 2 页提示词里藏着哪些多代理工程设计。结尾是一张"视频说法 vs 核实结果"对照表,以及一个漂亮的对偶:费马大定理是人类已证、等机器核验;这次是机器生成、等人类核验。
费曼称它为"数学中最非凡的公式",但它第一眼看上去像语法错误——e 的虚数次方是什么鬼?这篇从复利、乘 -1、摩天轮三个能手算的真问题出发,把 e、i、cos/sin 三个符号包逐个拆开,再沿两条路线把公式拼回去:一条给直觉(增长掰成垂直方向就是绕圈),一条给验算(欧拉本人 1748 年的级数对账)。读完你带走一个可复用的模型:乘 e^(iθ) = 旋转 θ,它一路通到 LLM 的 RoPE 位置编码。
Kimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。
上一篇 KDA 深读里的公式劝退你了?这篇是零基础陪读:用一块 2×2 的迷你内存和十个问题,每一步都能用小学算术手算,算完你能逐个符号读懂 KDA 的核心公式。
一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。
数学号称有上亿条公式,但真正的"种子"很少。这篇收录两份最权威的大众榜单的并集——Ian Stewart《改变世界的 17 个方程》与 Robert Crease《伟大的方程》(Physics World 读者投票)——去重后恰好 22 条。按六幕从简单到复杂排列:数与形、变化与力、波与场、热随机与信息、相对论与量子、混沌与市场。每条给出精确公式、逐符号解释和它为什么配称"种子"。
数学压缩到极限是多少条公式?答案被实测过:9 条 ZFC 公理,经过 12,151 条中间定理,撑起学界公认的 100 条名定理。本篇把两层全部枚举:ZFC 九条公理逐条给出严格的一阶逻辑写法(含公理模式、弱形式等所有记号细节),Wiedijk"形式化 100 定理"清单逐条给出精确陈述。100 条中 99 条已被计算机验证,唯一悬着的是费马大定理。
把 AI 用到的全部数学,从最高层一层层往下拆,每个概念只连它真正的直接前置,中间绝不跳步,一直拆到小学的加减乘除。六大主干(线性代数/微积分/概率统计/优化/信息论/离散)各附主脊图与完整节点表,顶层覆盖 AI 各子领域用到的数学——并解释为什么"听不懂"几乎总是某个下层前置没补上,而不是你不行。
解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。
从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。
解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。
用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。
用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。
从交叉熵、embedding、RoPE、量化和 LoRA 出发,讲清为什么数学家和工程师总是在换空间,以及如何把这种提问方式练成日常肌肉记忆。
从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。
用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。
从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。
用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。
用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。
用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。
从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。
补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。
面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。
面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。
面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。
从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。
从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。
完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。
给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。