2026年7月20日所谓点拨:不是贵人一句话,而是把自己送进高价值反馈场从清华到 OpenAI、Meta Superintelligence Labs、Google DeepMind 等公开案例出发,拆解“点拨”的真实机制:识别热场、压缩路径、构建可验证筹码,并给出 AI 学习者的 90 天行动协议。AIAgentAI Infra
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMTransformer学习笔记
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLM源码阅读LLM Serving
2026年7月18日把注意力换成一块「会遗忘的内存」:源码级深读 Kimi K3 的心脏 KDAKimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。LLMAI Infra论文深读
2026年7月18日KV cache 是内存管理,上下文管理是 GC 吗?——把 LLM 推理栈当操作系统读一遍一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。AI InfraLLMvLLM论文深读
2026年7月16日提示词之后:上下文工程如何接管 LLM 应用质量从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。AILLMPrompt 工程上下文工程RAGAI Infra
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingTransformer学习笔记
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM Serving学习笔记
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingTransformer源码阅读
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM Serving
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgent上下文工程AI Infra
2026年7月14日把智能体当人用:Claude Agent SDK 的架构设计哲学不是功能罗列,而是深读 Claude Agent SDK 的设计思想——为什么"给智能体一台电脑"、agent loop 为什么是控制循环、上下文窗口如何成为一切设计的隐形主线、以及为什么可靠性工程发生在 harness 而不是模型里。AI InfraAgentLLM
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMTransformerllama.cppvLLM
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLM评测llama.cpp
2026年7月13日采样不是玄学:从 logits 到 temperature、top-k、top-p用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。AIAI InfraLLMllama.cpp数学
2026年7月10日换空间是一种数学肌肉记忆:从 LLM 到顶级数学家的思考方式从交叉熵、embedding、RoPE、量化和 LoRA 出发,讲清为什么数学家和工程师总是在换空间,以及如何把这种提问方式练成日常肌肉记忆。AIAI InfraLLM数学
2026年7月10日攻克数学恐惧:从顶级数学家的脑回路,到一条可训练的数学探索路径从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。AIAI InfraLLM数学
2026年7月10日PPL 是什么:把模型困惑度理解成平均岔路数用 Qwen2.5-7B 的 llama-perplexity 实测结果,讲清 PPL、交叉熵和量化质量评估之间的关系。AIAI InfraLLM评测llama.cpp数学
2026年7月10日本机实操一次最小大模型蒸馏:用 GGUF Qwen 当 teacher用本机 GGUF Qwen teacher、llama-server top-k logprobs 和 NumPy tiny student,讲清大模型蒸馏里的 soft labels、KL loss、训练流程和最小实现。learning-logAILLMAI Infrallama.cpp
2026年7月10日为什么交叉熵偏偏要用 log:从模型开发者脑回路理解 PPL从模型开发者会遇到的概率连乘、数值下溢和训练优化问题出发,还原 log、ln、exp、交叉熵与 PPL 之间的动机链条。AIAI InfraLLM评测数学
2026年7月9日Fable 写出 GPU Megakernel:AI 研发自动化真正值得盯的信号深读 Import AI 464:从 Fable 的 KernelBench-Mega 结果出发,串起 GPU kernel、远程数字劳动、OSWorld 2.0、企业知识系统和 AI 研发自动化的真实边界。learning-logAI InfraAgent
2026年7月9日CUDA 张量并行之后,到底有哪几种计算用一个 X @ W 小例子讲清张量并行里的本地分片计算、Column Parallel、Row Parallel、all-gather、all-reduce、reduce-scatter,以及它们在 Transformer 里的位置。learning-logAI InfraTransformer
2026年7月9日从 FlashAttention 看懂算子融合:为什么融合、少读写了什么、又会错在哪里用 FlashAttention 官方论文和 CUDA 源码拆解 attention fusion:从 QK、softmax、PV 的普通三段式,到 online softmax、HBM 读写减少、边界条件和 kernel 正确性风险。learning-logAI Infra源码阅读