2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化
2026年7月22日Streaming 不是逐字打印:从 vLLM 看大模型增量输出的状态机从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。AIAI InfravLLMLLM Serving源码阅读OpenAI APIStreamingTool CallingKV Cache
2026年7月18日KV cache 是内存管理,上下文管理是 GC 吗?——把 LLM 推理栈当操作系统读一遍一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。AI InfraLLMvLLMKV Cache操作系统论文解读
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingKV CacheTransformers源码阅读
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读推理引擎KV Cache
2026年7月13日从 Attention 到 PagedAttention:用 llama.cpp 跑通 Qwen2.5-7B 后,我终于看懂了 LLM 推理主线用 BPE、Transformer、RoPE、GQA、FlashAttention、PagedAttention 等论文作纵轴,串起 Qwen2.5-7B 在 llama.cpp 上的 tokenizer、forward、KV cache、benchmark、PPL 和 sampling 实验。AIAI InfraLLMInferenceTransformerAttentionKV Cachellama.cppvLLMQwen
2026年7月13日Decode 为什么跑不到理论带宽:KV cache、activation、反量化和调度开销系统拆解 decode 实测速度低于理论带宽上限的原因:权重读取、KV cache、activation、反量化 metadata、kernel 调度和 cache miss。AIAI InfraLLMInferenceBenchmarkKV CacheQuantizationllama.cppQwen
2026年7月9日KV cache 那笔账:为什么 Qwen2.5-7B 在 2048 长度下大约是 117MB从人话直觉、小数字张量形状和 Qwen2.5-7B 的真实参数出发,讲清 KV cache 公式、GQA 为什么省 7 倍,以及 100 并发为什么会变成 11.7GB。AIAI InfraLLMTransformerAttentionKV CacheQwenllama.cpp数学