2026年7月9日Decode 速度上限公式:为什么 4.677GB 模型、16.99 tok/s 反推约 79.5GB/s用 Qwen2.5-7B llama-bench 的真实数据,讲清 decode 为什么常被内存带宽卡住、bandwidth / model_size 怎么估理论上限,以及 79.5GB/s 这个反推数字到底代表什么。AIAI InfraLLM评测llama.cpp数学
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerllama.cpp数学
2026年7月8日HELM 学习笔记:模型评测不是跑榜,而是建立一张能力地图消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。AILLM评测AI Infra学习笔记
2026年7月8日从 .codex 目录反推 Codex 内核:一个本地 Agent OS 的剖面从 CODEX_HOME 的目录、SQLite schema 和官方文档出发,把 Codex 拆成控制面、状态面、执行面、扩展面、安全面、后台面和记忆面,理解它为什么更像本地 agent runtime。learning-logCodexAgentAI InfraMCPSkills
2026年7月8日Agent Jail:把 AI Agent 关进可审计的企业权限边界从 untrusted tenant 视角重新设计 Codex、Claude Code 和企业 Agent 的运行边界:Capability Manifest、策略引擎、短期凭证、MCP Gateway、审计和绕过防护。learning-logAgentAI InfraMCPCodex
2026年7月8日Out 投影到底在输出什么:把多头 attention 结果重新混回 hidden state补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月8日BPE 不是一个汉字一个 Token:从 Qwen tokenizer 实验看懂 token 计费用 Qwen2.5 tokenizer 的中文、英文、代码和 emoji 实测数据,讲清为什么 token 不是字符,以及为什么 LLM 按 token 而不是字符计费。AIAI InfraLLM学习笔记
2026年7月7日Masked Softmax 到底在 mask 什么:把 QK 分数变成注意力权重面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日QKV 投影到底在投什么:从 3584 维 hidden 到 28 个 Query 头、4 个 KV 头面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月7日RoPE 为什么只是高中三角函数:把 Q/K 向量按位置旋转面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。AIAI InfraLLMTransformerllama.cpp源码阅读数学
2026年7月6日AI Infra 工程师日常工作地图:以 OpenAI 岗位为镜,明自己的学习坐标基于 OpenAI 公开 AI Infra 相关岗位描述,按训练、推理、数据、GPU 集群、可靠性、评测发布、Agent Infra、安全和开发效率拆解 AI Infra 工程师每天实际做什么,并映射到个人学习路线。AIAI InfraLLM学习笔记
2026年7月6日一个 token 的诞生:从 llama.cpp 主循环看懂 Prefill 和 Decode从 llama.cpp 的命令行入口、tokenize、生成 while 循环、llama_decode、batch、n_past 和 KV cache 串起一次 LLM 推理,解释 prefill 与 decode 的代码分叉和性能差异。AIAI InfraLLMllama.cpp源码阅读
2026年7月6日LoRA 机制学习笔记:为什么它能把函数和技能变成大模型的可插拔补丁从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。AILLMAI Infra学习笔记
2026年7月6日LoRA rank=16 数学直觉:不是更新 16 个维度,而是用 16 个方向生成完整增量从矩阵秩、外积、低秩分解和瓶颈层出发,用通俗数学解释 LoRA 里的 rank=16 到底是什么意思,为什么它能影响所有输出维度,以及为什么常在 8/16/32/64 之间取值。AILLMAI Infra学习笔记数学
2026年7月6日计算图不是在算,而是在排活:从伪代码到 ggml 看懂 llama.cpp 的 Qwen2 forward用一段极简伪代码解释计算图,再拆开 ggml_tensor、ggml_cgraph 和 llama.cpp 的 Qwen2 graph builder,看懂一次 forward 如何从 logits 反向追出完整执行图。AIAI InfraLLMllama.cpp源码阅读
2026年7月6日Parametric Skills 学习笔记:把 Agent 技能从上下文说明书编译成 LoRA 参数深入拆解 Parametric Skills:为什么文本技能会在长上下文 Agent 中失效,如何用 hypernetwork 把 SKILL.md / 轨迹经验转成 LoRA adapter,以及它和 Program-as-Weights 的关系。AILLMAI Infra学习笔记AgentSkills
2026年7月6日本地跑通一个真实 PEFT LoRA:从环境、代码到 base/adapter/merged 输出对比完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。AILLMAI Infra学习笔记Transformer
2026年7月6日Program-as-Weights 学习笔记:把一次大模型调用编译成可复用的小权重程序深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。AILLMAI Infra学习笔记
2026年7月4日AI Infra 数学地基(细分版):每个知识点拆到高中数学起步给数学底子一般的人的 AI Infra 数学地图:8 个板块全部拆到高中数学层级,标注难度和前置依赖,每个概念配人话解释,并用真实实验数据代入验证。AIAI InfraLLM数学学习笔记
2026年7月4日AI Infra 全景思维导图:一个 token 的一生要经过哪些系统用一张思维导图梳理 AI Infrastructure 的 12 个板块:从硬件、算子编译、训练与推理引擎,到服务调度、量化、端侧和成本工程,并标注 90 天学习路线的覆盖位置。AIAI InfraLLM学习笔记