2026年7月25日初中数学读懂 Attention Is All You Need:从加权平均到 Transformer按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。Attention Is All You NeedTransformerAttention大模型AI数学零基础
2026年7月25日Grokking:为什么模型先死记硬背,后来突然真懂了用作业、考试、模运算和训练曲线递归拆解 Grokking:模型为什么会先过拟合,再延迟泛化,为什么看起来像相变,以及它和大模型涌现有什么关系。Grokking大模型泛化训练动力学零基础
2026年7月25日一根针教会大模型学习者的事:从挂谷猜想到高维覆盖直觉不把挂谷猜想当高深数学炫技,而是把它转译成小白能带走的几种大模型学习能力:高维方向感、覆盖意识、极端例子思维和多尺度分析。挂谷猜想大模型AI数学高维几何零基础
2026年7月25日线性代数到模型学习:从矩阵到秩的25道核心题按同济工程数学线性代数第七版的主干,围绕矩阵、行列式、线性方程组、向量组、秩和子空间设计25道原创题,服务模型学习。线性代数同济线代AI数学模型学习零基础
2026年7月25日线性代数到模型学习:从特征值到低秩压缩的25道题承接线代上篇,围绕特征值、对角化、二次型、正交投影、PCA、SVD、线性变换和低秩更新设计第26到50题,服务大模型学习。线性代数AI数学SVDPCALoRA
2026年7月25日统计学和大模型:学会和不确定性共处借一张数理统计知识图谱,重新理解概率、分布、估计、检验和回归为什么是大模型时代的底层语言:模型给出的不是神谕,而是一组需要被校准、抽样和检验的不确定性。数理统计大模型AI数学概率零基础
2026年7月25日同济高数第八版上册到模型学习:25道核心题按同济高数第八版上册主线,围绕极限、导数、Taylor、积分和微分方程设计25道原创题,题题带详细答案,并说明它们如何服务模型学习。高等数学同济高数AI数学模型训练零基础
2026年7月25日同济高数第八版下册到模型学习:第26到50题承接上册25题,按同济高数第八版下册主线整理向量、多元微分、重积分、曲线曲面积分和级数的25道原创题,服务模型学习。高等数学同济高数AI数学多元微积分零基础
2026年7月24日Codex AI Digest 深读版 · 2026-07-24Codex 真读真写 · 24 篇原文 / 9 个渠道 / 论文、趋势、技能、工具、行动。这是 Codex 深读版。今天先更新三个判断:第一,agent 训练正在从“做 benchmark”转向“把真实 harness 带进 RL”;第二,多模态模型开始从生成内容外溢到动作预测、机器人和浏览器端运行;第三,健康、企业…learning-logai-digestaibriefcodexfeishu-card
2026年7月24日Codex AI Digest 深读版 · 2026-07-24Codex 真读真写 · 先看方向,再看行动。这是 Codex 深读版。今天最值得你调整判断的,不是某个单点模型分数,而是三条更耐久的线索:一,agent 训练开始进入真实 harness 和真实环境;二,开放权重在高风险能力上的追赶速度继续压缩治理窗口;三,多模态系统正从“会生成”走向“会感知、预测、动作”。如果你…learning-logai-digestaibriefcodexfeishu-card
2026年7月24日上下文学习像临时做贝叶斯:为什么大模型不改权重也能跟着例子走一篇从零开始的 In-Context Learning 深度讲解:模型没有更新权重,却能根据 prompt 里的几个例子临时跟上任务。一个有力解释是,它在上下文里推断当前任务是什么。LLMIn-Context Learning贝叶斯数学Transformer零基础
2026年7月24日大模型里更有数学味的 16 个问题:从 Grokking 到权重空间如果已经了解 embedding、attention、softmax、LoRA 和 SVD,这篇可以继续往下走:训练动力学、权重空间、内部因果、表示几何、对齐与部署里,还有哪些值得追的大模型数学问题。LLMAI 数学机器学习深度学习学习地图
2026年7月24日小白也能听懂的奇异值分解:把矩阵拆成三件事用照片压缩、二维小例子和最少数学地基解释 SVD:U、Σ、Vᵀ 各自做什么,奇异值为什么代表重要程度,以及它和 PCA、推荐、LoRA、低秩压缩的关系。数学线性代数SVDAI零基础
2026年7月24日泰勒展开和大模型:小白也能懂的局部近似从函数、斜率、导数和二次近似开始,递归拆解泰勒展开是什么,再连接到梯度下降、损失函数、二阶优化、量化和大模型训练里的局部近似思想。数学泰勒展开大模型深度学习零基础
2026年7月23日评测不是打榜:怎样用真实 Session 找到最便宜够用的模型系统讲解 LLM 评测和模型路由的工程原理:如何把真实 session 做成 eval case,用 rubric、LLM judge、校准集和成本表找出每类任务的最低可用模型。AILLMAI InfraEvalModel Routing成本优化
2026年7月23日RouteLLM 深度解读:把模型选择变成成本-质量路由问题从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。AILLMAI InfraEvalModel RoutingRouteLLM成本优化论文解读
2026年7月22日经典数学函数图鉴:让每一条曲线都经得起坐标查验16 张可交互的经典函数图像:线性、二次、三次、反比例、根式、绝对值、指数、对数、三角、反三角、双曲、sigmoid、高斯、取整。用 function-plot 的区间算术精确绘制,滚轮缩放、悬停读坐标。附精确性质速查表和工具选型指南。数学可视化零基础
2026年7月22日Codex AI Digest 深读版 · 2026-07-22Codex 真读真写 · 方向 / 判断 / 行动。这是 Codex 深读版。今天最值得尽快更新的判断有三条:第一,AI 安全叙事正在从“模型能力有多强”转向“评测与部署边界是否足够硬”;第二,长上下文与 agent 的下一阶段不只是更长,而是更会取证、检索、验证和回退;第三,真正能拉开差距的护城河越来越像数据生成、…learning-logai-digestaibriefcodexfeishu-card
2026年7月22日一万亿个参数,没有一个是给你拧的:函数、大模型与 Claude Code 的控制面迁移史函数的控制面是参数:改参数,结果就变。大模型呢?它有上万亿个参数,但没有一个是旋钮——真正的控制面迁移到了数据、目标函数和上下文里。到了 Claude Code / Codex,控制面又搬回模型外面,变成一整个分层的驾驶舱。这篇讲清一条主线:计算史就是控制面的迁移史,每次迁移都在拿确定性换能力,然后人类立刻在新的一层重建确定性。LLMAgentClaude CodeAI 前沿第一性原理思维框架
2026年7月22日穿透控制面:你写进 CLAUDE.md 的每一行,最后变成了模型内部的什么上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。LLMAgentClaude Code可解释性AI 前沿第一性原理
2026年7月22日Lilian Weng 新文深读:Scaling Law 不是物理定律,是一次高杠杆的赌注《Scaling Laws, Carefully》深度消化:为什么深度学习最著名的"定律",两篇奠基论文能得出相反的结论(Kaplan 的 0.73 vs Chinchilla 的 0.5);为什么 Chinchilla 自己也有一个求和写成平均的拟合 bug;以及当"数据无限"假设过期之后,scaling law 正在被改写成什么形状。researcher-deepdivelilian-wengScaling LawsPretrainingLLM学习笔记
2026年7月22日零基础陪读 Scaling Laws:那篇深读读不动?你缺的其实只是一条直线Scaling Laws 深读的陪读篇。用正方形、身高预测、餐巾纸记账几个能手算的真问题,把幂律、log-log 直线、拟合、外推、C≈6ND 五件工具逐件装好,每件装完立刻回扣深读原文。读完再回去,0.73 vs 0.5 之争会变成一个很直观的故事。Scaling LawsLLM数学零基础
2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化