2026年7月24日大模型里更有数学味的 16 个问题:从 Grokking 到权重空间如果已经了解 embedding、attention、softmax、LoRA 和 SVD,这篇可以继续往下走:训练动力学、权重空间、内部因果、表示几何、对齐与部署里,还有哪些值得追的大模型数学问题。LLMAI 数学机器学习深度学习学习地图
2026年7月24日泰勒展开和大模型:小白也能懂的局部近似从函数、斜率、导数和二次近似开始,递归拆解泰勒展开是什么,再连接到梯度下降、损失函数、二阶优化、量化和大模型训练里的局部近似思想。数学泰勒展开大模型深度学习零基础
2026年7月20日PPO 的训练循环:每一个部件,都是同一对矛盾的产物从 REINFORCE 的"数据用一次就作废"出发,一步步推出 PPO 训练循环的全部部件——重要性采样比率、clip、critic、GAE、多 epoch 复用——再落到 RLHF 的四模型循环。读完你能口述一次 PPO 迭代的每个阶段,以及每个阶段为什么非存在不可。强化学习LLMRLHF深度学习