2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLM评测llama.cpp数学
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerllama.cpp数学
2026年7月8日AgentBench 学习笔记:评测 Agent,不能只看它怎么回答消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。AILLMAgent评测学习笔记
2026年7月8日Evoflux 学习笔记:小模型不会稳定用工具时,先别急着微调消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。AILLMAgent工具调用MCP学习笔记
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLM评测AI Infra学习笔记
2026年7月8日IFEval 学习笔记:别只问模型聪不聪明,先测它是否真的听话消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。AILLM评测学习笔记
2026年7月8日LLM-as-a-Judge 学习笔记:让模型当裁判,到底靠不靠谱消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。AILLM评测学习笔记
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月8日BPE 不是一个汉字一个 Token:从 Qwen tokenizer 实验看懂 token 计费用 Qwen2.5 tokenizer 的中文、英文、代码和 emoji 实测数据,讲清为什么 token 不是字符,以及为什么 LLM 按 token 而不是字符计费。AIAI InfraLLM学习笔记
2026年7月8日PrologMCP 学习笔记:别让大模型硬想,把演绎推理交给符号系统消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。AILLMAgentMCP学习笔记
2026年7月8日SWE-bench 学习笔记:代码模型评测,终于从刷题走向真实修 Bug消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。AILLM评测学习笔记
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月6日AI Infra 工程师日常工作地图:以 OpenAI 岗位为镜,明自己的学习坐标基于 OpenAI 公开 AI Infra 相关岗位描述,按训练、推理、数据、GPU 集群、可靠性、评测发布、Agent Infra、安全和开发效率拆解 AI Infra 工程师每天实际做什么,并映射到个人学习路线。AIAI InfraLLM学习笔记
2026年7月6日一个 token 的诞生:从 llama.cpp 主循环看懂 Prefill 和 Decode从 llama.cpp 的命令行入口、tokenize、生成 while 循环、llama_decode、batch、n_past 和 KV cache 串起一次 LLM 推理,解释 prefill 与 decode 的代码分叉和性能差异。AIAI InfraLLMllama.cpp源码阅读
2026年7月6日LoRA 机制学习笔记:为什么它能把函数和技能变成大模型的可插拔补丁从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。AILLMAI Infra学习笔记
2026年7月6日LoRA rank=16 数学直觉:不是更新 16 个维度,而是用 16 个方向生成完整增量从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。AILLMAI Infra学习笔记数学
2026年7月6日计算图不是在算,而是在排活:从伪代码到 ggml 看懂 llama.cpp 的 Qwen2 forward用一段极简伪代码解释计算图,再拆开 ggml_tensor、ggml_cgraph 和 llama.cpp 的 Qwen2 graph builder,看懂一次 forward 如何从 logits 反向追出完整执行图。AIAI InfraLLMllama.cpp源码阅读
2026年7月6日Parametric Skills 学习笔记:把 Agent 技能从上下文说明书编译成 LoRA 参数深入拆解 Parametric Skills:为什么文本技能会在长上下文 Agent 中失效,如何用 hypernetwork 把 SKILL.md / 轨迹经验转成 LoRA adapter,以及它和 Program-as-Weights 的关系。AILLMAI Infra学习笔记AgentSkills
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra学习笔记Transformer
2026年7月6日Program-as-Weights 学习笔记:把一次大模型调用编译成可复用的小权重程序深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。AILLMAI Infra学习笔记
2026年7月4日AI Infra 数学地基(细分版):每个知识点拆到高中数学起步给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。AIAI InfraLLM数学学习笔记
2026年7月4日AI Infra 全景思维导图:一个 token 的一生要经过哪些系统用一张思维导图梳理 AI Infrastructure 的 12 个板块:从硬件、算子编译、训练与推理引擎,到服务调度、量化、端侧和成本工程,并标注 90 天学习路线的覆盖位置。AIAI InfraLLM学习笔记