2026年7月27日Medusa 深读:解码慢不是算力问题,是搬运问题从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。AIAI InfraLLM Serving论文深读
2026年7月27日目标函数即命运:大模型为什么会长成被奖励的样子结合 next-token 预训练、RLHF、DPO、DeepSeek-R1、Goodhart 定律、reward hacking 和目标泛化失败,用通俗例子解释“目标函数即命运”:模型不会按我们的愿望成长,而会按可优化的信号成长。AILLM论文深读
2026年7月27日别把向量数据库当知识库:RAG、Agent 记忆和知识库的一条主线用一条“外部知识如何进入模型上下文”的主线,拆清向量数据库、RAG、Agent 知识库、Agent 记忆、Embedding、Retriever、Reranker、GraphRAG、BookRAG、A-RAG 等概念分别在系统里负责什么。AIRAGAgent记忆
2026年7月24日小白也能听懂的奇异值分解:把矩阵拆成三件事用照片压缩、二维小例子和最少数学地基解释 SVD:U、Σ、Vᵀ 各自做什么,奇异值为什么代表重要程度,以及它和 PCA、推荐、LoRA、低秩压缩的关系。数学线性代数AI零基础
2026年7月23日评测不是打榜:怎样用真实 Session 找到最便宜够用的模型系统讲解 LLM 评测和模型路由的工程原理:如何把真实 session 做成 eval case,用 rubric、LLM judge、校准集和成本表找出每类任务的最低可用模型。AILLMAI Infra评测
2026年7月23日RouteLLM 深度解读:把模型选择变成成本-质量路由问题从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。AILLMAI Infra评测论文深读
2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日从 vLLM ChatCompletionRequest 看懂大模型请求参数把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日Streaming 不是逐字打印:从 vLLM 看大模型增量输出的状态机从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日OpenAIServingChat 深度解读:vLLM 怎样把一次 Chat Completion 跑成 OpenAI 响应从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文深读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentAI Infra上下文工程学习笔记
2026年7月20日所谓点拨:不是贵人一句话,而是把自己送进高价值反馈场从清华到 OpenAI、Meta Superintelligence Labs、Google DeepMind 等公开案例出发,拆解“点拨”的真实机制:识别热场、压缩路径、构建可验证筹码,并给出 AI 学习者的 90 天行动协议。AIAgentAI Infra
2026年7月20日为什么生成一个 token,要把权重从内存搬到计算单元旁边?从矩阵乘法、GPU 内存层级和 Transformer decode 流程解释,为什么大模型推理不能直接用显存里的权重原地计算。AIAI InfraLLMTransformer学习笔记
2026年7月18日短视频说"AI 一小时证明了 50 年数学悬案"——我把 OpenAI 那两份 PDF 读了,真实故事更精彩2026 年 7 月,"GPT-5.6 一小时证明循环双覆盖猜想"刷屏短视频。事实核查:事件为真,但"证明了"三个字说早了——现在的准确状态是"机器生成了一份证明,人类正在核验"。这篇先用能手画的小例子讲透这个 50 年悬案本身(圈、桥、snark),再逐页拆 OpenAI 发布的两份一手 PDF:3 页的证明走了哪四步,那份比证明更值得读的 2 页提示词里藏着哪些多代理工程设计。结尾是一张"视频说法 vs 核实结果"对照表,以及一个漂亮的对偶:费马大定理是人类已证、等机器核验;这次是机器生成、等人类核验。数学AILLM
2026年7月18日vLLM + verl 源码学习地图:推理引擎与 RL 后训练框架各怎么读基于 vLLM v0.25.1 和 verl v0.8.0 源码,给出两个仓库的目录地图、必读文件清单、三阶段阅读路线,以及两者在 rollout 权重同步处的交汇点。AIAI InfravLLM源码阅读LLM Serving
2026年7月17日Agent 的内存管理:Claude Code 与 Codex 如何决定"忘掉什么"深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。AILLM上下文工程Codex学习笔记
2026年7月17日Claude Code 和 Codex 还在用 RAG 吗?——代码检索为什么回到了 grep拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。AILLMRAG搜索Codex学习笔记
2026年7月17日给「物料搭建 + 还原业务逻辑」设计一套 AI Harness前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。AIAgentMCPSkills
2026年7月17日设计稿出码,七年走到哪了:从 pix2code 到 Design2Code 的深度精读精读设计稿出码方向的两篇奠基论文——2017 年 pix2code(CNN+LSTM 学「截图→DSL」)与 2024 年斯坦福 Design2Code(多模态 LLM 直接出前端代码)。不只讲模型,重点拆解一个更隐蔽的问题:这个任务到底该怎么「评好坏」,以及为什么「元素召回」和「布局」始终是最难啃的骨头。AI
2026年7月17日搭建系统最会流血的两处,其实是同一种病:PRD 抽取与双向同步系列深挖篇。把「PRD→交互规格的 intake agent」和「schema↔代码的 round-trip」这两个搭建系统里最疼的单点挖到底,并揭示它们是同一种病——同一份信息在两种表示之间来回翻译时的边界问题。前者会静默编造缺失的逻辑,后者会静默漂移。负责任的解法都是同一句:把有损与歧义的部分显式化,而不是替它糊过去。含 intake 的完备性矩阵设计与 round-trip 四种策略的取舍。AIAgent系统设计
2026年7月17日物料搭建 × AI Harness:一套完整表达生产级页面的协议族设计本系列的规范篇。为「基于物料的 UI 还原 + AI Harness 控制的业务逻辑还原」这套架构,负责任地穷举出需要的全部协议/Schema——分六层、23 个协议,共享一个 Envelope、彼此用 id 交叉引用,逐一给出结构、关键字段与含义。目标是让这套协议族能完整表达复杂场景与真实应用页面,逼近生产运行表现;同时诚实标注它的边界与未解难点。AI系统设计
2026年7月17日把协议族跑起来:一个协议驱动的 TODO 应用(含可运行 demo)系列实现篇。用 React + Vite + TS 把前面设计的协议族真正实现成一个可运行的 TODO 应用——整个 app 的视觉、数据、业务逻辑、边界态全部是一份声明式协议数据,运行时解释它渲染而成,换掉这份数据就换掉整个应用。接口用 mock 拦截真实 fetch 模拟真实行为(状态码/延迟/持久化/错误注入)。因为逻辑与 DOM 分离,同一个运行时能被无头单测完整覆盖。附可在线体验的 demo 与全部源码结构。AI系统设计