2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读KV CachePagedAttention性能优化
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM ServingPagedAttentionSpeculative Decoding论文学习