2026年9月14日KV cache 的 12 种省法:把 Avi Chawla 那张总表在自己机器上跑了一遍Avi Chawla 把 12 种 KV cache 优化按「减公式哪一项」归成一张表。我在 M5 Pro 上把其中能验的三项真跑了:公式对到兆字节,但量化省的不是 50% 而是 47%——差额正好是每块的 scale 元数据。AI InfraLLM ServingLLM
2026年9月14日投机解码的四种变体,和我笔记本上那道 8 个 token 的悬崖在 M5 Pro 上把两模型投机解码完整跑了一遍:教科书说 2-3×,实测峰值 1.16×;草稿长度从 4 加到 11,端到端反而从 1.11× 掉到 0.49×。根因是 ggml Metal 里一行 ne11 > 8,以及草稿成本 γ 的硬地板。AIAI InfraLLM Servingllama.cpp源码阅读
2026年9月11日小模型的「小」在 2026 年裂成了两半:一台 24GB Mac 上的三笔账把 2026 年的 SLM 趋势放到一台 24GB Mac 上验一遍:Qwen3.5-4B 默认配置下 20 件抽取活可用率 0/20,关掉思考后 20/20;35B-A3B 的 Q4 权重 20.50 GiB 装不进 17.76 GiB 的 GPU 工作集。参数量这个坐标失效了。LLMAI Infrallama.cppLLM Serving工程实践
2026年9月8日本地部署到底看哪些本机参数:同一台机器上,GPU 让 prefill 快 38 倍、让 decode 只快 2.5 倍在 24GB M5 Pro 上实测 llama.cpp 的容量、带宽、算力、核数、上下文与并发六组参数,给出一张「参数 → 它管哪一段 → 一行换算公式」的表,和一个 15 分钟自测流程。AI InfraLLM评测llama.cppLLM Serving
2026年9月3日约束解码深读:把 mask 做到零开销之前,我们跨过了四道坎沿一条主线拆 constrained decoding / grammar-based sampling:所有算法都在实现同一个「可延伸性 oracle」,四代论文(Outlines / DOMINO / XGrammar / SGLang / GAD)各推进一关——token-字符错位、mask 成本、确定性片段的浪费、分布扭曲。附伪代码骨架、亲手实测 96.4% 的确定性 token 占比、以及一个手算完的分布扭曲例子。AILLMAI InfraLLM Serving论文深读
2026年9月3日temperature=0 不等于 deterministic:亲手让它翻车 30 次同一个 prompt、temperature=0,跑 30 次拿到 12 种不同答案——分叉点在 char 227 和 323。旧解释「fp 非结合律」不够用,2025 年的新解释是「batch invariance」,值得每个用 LLM 做评测/回归/合规的工程师重读一遍。AILLMLLM Serving工程实践评测
2026年9月2日RouteLLM 深读:把「谁来做这题」压缩成一个胜率,就是所有 LLM 路由的钥匙RouteLLM 论文最漂亮的一个数字:只需 14% 的 GPT-4 调用就能保住 95% 的 GPT-4 质量。这个数字背后是一整套可测量、可校准的路由体系。本文从「胜率预测」这条主线拆解四种路由器的算法差异、Chatbot Arena 偏好数据的稀疏性处理、PGR/APGR/CPT 三个校准指标,以及一次 completion 请求进入 openai_server 到最终转发给 strong/weak backend 的完整调用链。AILLM论文深读LLM Serving系统设计
2026年8月12日SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。AI InfraLLMLLM Serving源码阅读
2026年8月2日投机解码的第二本账:长上下文把瓶颈从权重搬到了 KV Cache从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。AIAI InfraLLM Serving论文深读
2026年7月27日主模型明明是 Fable 5,账单里为什么冒出 Haiku 4.5?这不是投机解码。从 Claude Code 官方文档找到 Haiku 后台调用的直接证据,再借 RouteLLM、FrugalGPT 与 Leviathan/Chen 的投机采样论文,把"小模型替大模型干活"拆成应用层分派、服务层路由、解码层投机三层,并给出一条判别原则:看它会不会以自己的名义出现在你的账单里。AIAI InfraLLM Serving
2026年7月27日一文讲透大模型格式化输出:从预训练先验到约束解码的五层保障为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。AILLMAI InfraLLM Serving论文深读
2026年7月27日Medusa 深读:解码慢不是算力问题,是搬运问题从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。AIAI InfraLLM Serving论文深读
2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日从 vLLM ChatCompletionRequest 看懂大模型请求参数把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日Streaming 不是逐字打印:从 vLLM 看大模型增量输出的状态机从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日OpenAIServingChat 深度解读:vLLM 怎样把一次 Chat Completion 跑成 OpenAI 响应从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLM源码阅读LLM Serving
2026年7月15日Dense Models 到底 Dense 在哪:为什么 vLLM 先把 MRv2 默认给普通 Transformer解释 dense model、MoE、router、expert、active parameters、hybrid model 和 MRV2,并分析为什么 vLLM 0.25.0 先让 dense models 默认走 Model Runner V2。AIAI InfravLLMLLM ServingTransformer学习笔记
2026年7月15日vLLM 0.25.0 解读:PagedAttention 退场,MRv2 接管从 PagedAttention 论文、MRv2 默认化、Transformers backend 提速和 TLI speculative decoding,看 vLLM 0.25.0 为什么是一次执行路径收口。AIAI InfravLLMLLM Serving学习笔记
2026年7月15日vLLM 不是把外部模型包一层:它接管的是推理运行时解释 vLLM 使用 Qwen、Llama、Gemma 或 Transformers backend 时,谁加载权重、谁驱动 forward、谁分配 KV cache,以及为什么这不是调用外部模型自己的 generate。AIAI InfravLLMLLM ServingTransformer源码阅读
2026年7月15日vLLM 是顶流,但不是终点:LLM 推理框架的五条路线从 vLLM、SGLang、TensorRT-LLM、TGI、llama.cpp 到 RTP-LLM,梳理当下 LLM inference serving 框架的主流路线、学习价值和选型边界。AIAI InfravLLMLLM Serving
2026年7月15日vLLM 的请求是怎么跑完的:从入口到 GPUModelRunner 的源码链路基于 vLLM v0.25.0 源码,串起 LLM.generate、AsyncLLM、LLMEngine、EngineCore、Scheduler、KVCacheManager、Executor、Worker、GPUModelRunner 和 OutputProcessor 的完整推理链路。AIAI InfravLLMLLM Serving源码阅读