2026年9月15日从 ELIZA 到 Kimi K3:大模型 60 年,真正跨过的是四道门槛一张 AI 时间线把 ELIZA、感知机、反向传播、Word2Vec、Transformer 和前沿模型串在一起。真正值得带走的不是年份,而是表示、学习、路由与规模四道瓶颈如何依次被解除。AILLMTransformer零基础学习笔记
2026年9月14日六种位置编码,其实只在争两个插入点同一个 Qwen2.5-7B、同一段文本、同样是把窗口放大 4 倍:线性插值让 PPL 从 8.18 崩到 173.57,YaRN 只涨到 8.90。差别全在一张波长表——我手算出 YaRN 放过了 64 个维度对里转得最快的 30 对。附 llama.cpp 源码定位与三个 token 的置换等变手算。AILLMTransformer论文深读源码阅读
2026年9月9日图像识别做得更好,卡点不在「看清」而在「定位」——三因子拆解与 2026 年的三记反手把图像识别拆成采样、定位、表征三道闸门:我亲手跑的脚本量出 resize 在模型看到图之前就丢掉 99% 像素的物理边界,再用 NaViT 到 FAVE 十余篇论文定位每条路线在修哪一道;重点是 2026 年的三篇论文如何反手拆掉「用图思考」的一半叙事——承重的是坐标文本,不是回传的像素。AILLM论文深读Transformer工程实践
2026年8月17日Physics of Language Models Part 4.1: Canon Layers 的本质是什么Zeyuan Allen-Zhu 证明了什么被错误地留给了注意力机制,以及如何用轻量级的局部混合打败看似更强大的全局机制论文深读TransformerAI InfraLLM
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月25日初中数学读懂 Attention Is All You Need:从加权平均到 Transformer按论文原始顺序拆解 Transformer 涉及的数学:向量、矩阵乘、QKV、scaled dot-product attention、multi-head、位置编码、残差、LayerNorm、FFN、softmax、loss、学习率和复杂度,让初中数学背景也能啃读原文。TransformerAI 数学零基础
2026年7月24日上下文学习像临时做贝叶斯:为什么大模型不改权重也能跟着例子走一篇从零开始的 In-Context Learning 深度讲解:模型没有更新权重,却能根据 prompt 里的几个例子临时跟上任务。一个有力解释是,它在上下文里推断当前任务是什么。LLM数学Transformer零基础
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMTransformer学习笔记
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingTransformer学习笔记
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingTransformer源码阅读
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMTransformerllama.cppvLLM
2026年7月9日CUDA 张量并行之后,到底有哪几种计算用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。learning-logAI InfraTransformer
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerllama.cpp数学
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra学习笔记Transformer