2026年8月5日Firecracker 源码深读:AWS 怎样用"减法"造出 125ms 启动的虚拟机从 12 万行 Rust 源码读懂 microVM 的精髓:无 BIOS 直接引导、virtio-mmio 极简设备面、嵌套信任区安全模型、UFFD 惰性快照恢复,以及它为什么成了 AI agent 沙箱的底座。源码阅读AI Infra
2026年8月4日读 MemOS 源码:记忆的三态、相变,与一个诚实的占位符把 MemTensor 的 MemOS(arXiv:2507.03724)克隆下来,对照论文精读约 9 万行 Python 源码。它的精髓可以压成一张相图:记忆有三态——明文(气态)、激活(液态)、参数(固态),'记忆操作系统'的职责是调度相变。审计结果:明文态是生产级,明文→激活这条相变真实且值钱(TTFT 最高降 94.2%),而参数态在源码里是一个 dump() 时写入 b"Placeholder" 的占位符。这篇按'表示—调度—相变—进化—数字'五层,把论文的承诺和代码的现实逐条对齐。记忆AgentLLMAI Infra
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日大企业的大模型到底在搞什么:一张"四个缺口"全景图把大企业"能搞的大模型内容"收敛成四个缺口——知识、行动、信任、成本。用 20 余篇可查证的 arXiv 论文标出每个缺口下值得立项的方向、已知的坑与真实完成度,并给出一张立项检查单。LLMAI InfraRAGAgent
2026年8月3日小公司如何构建自己的大模型:一条论文铺出来的决策阶梯把"自建大模型"拆成从 RAG 到从零预训练的四级阶梯,用 12 篇可查证的 arXiv 论文标出每一级的成本量级、升级信号与踩坑边界——BloombergGPT 与 DeepSeek-V3 是两端的对照案例。LLMAI Infra
2026年8月2日投机解码的第二本账:长上下文把瓶颈从权重搬到了 KV Cache从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。AIAI InfraLLM Serving论文深读
2026年7月28日场景控制包:把 Agent 经验从提示词推进到可执行契约结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。AIAgentAI InfraRAG系统设计
2026年7月28日Lambda 的一盘棋:不抢模型入口,去占 AI 工厂的控制面基于 Lambda.ai 首页、产品页和公开新闻,拆解 Lambda 如何把 GPU 云、AI 工厂、NVIDIA 生态、数据中心伙伴和 hyperscaler 需求连成一套基础设施棋局。AI Infra
2026年7月28日LLM 与 Agent 源码品读地图:11 层、50+ 个值得逐行读的开源项目把大模型与 Agent 开源栈拆成 11 层,每层回答"被什么稀缺资源塑形",再给出代表项目与具体的"读什么"。从 micrograd 到 vLLM,从 LangGraph 到 OpenHands,一张可以按图索骥的源码阅读地图。LLMAgentAI Infra源码阅读
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月28日从 65 个字符开始:nanoGPT 的 Shakespeare 字符级语言模型数据准备用 nanoGPT 的 shakespeare_char prepare.py 串起字符到整数 id、train.bin/val.bin、meta.pkl、next-token 训练样本,以及它和 BPE/GPT-2 路线的差别。AIAI InfraLLM源码阅读学习笔记
2026年7月27日Ego Lite 的关键不是会点网页,而是把浏览器变成 Agent 的共享运行时从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。AIAgentAI Infra源码阅读
2026年7月27日主模型明明是 Fable 5,账单里为什么冒出 Haiku 4.5?这不是投机解码。从 Claude Code 官方文档找到 Haiku 后台调用的直接证据,再借 RouteLLM、FrugalGPT 与 Leviathan/Chen 的投机采样论文,把"小模型替大模型干活"拆成应用层分派、服务层路由、解码层投机三层,并给出一条判别原则:看它会不会以自己的名义出现在你的账单里。AIAI InfraLLM Serving
2026年7月27日一文讲透大模型格式化输出:从预训练先验到约束解码的五层保障为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。AILLMAI InfraLLM Serving论文深读
2026年7月27日Medusa 深读:解码慢不是算力问题,是搬运问题从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。AIAI InfraLLM Serving论文深读
2026年7月23日评测不是打榜:怎样用真实 Session 找到最便宜够用的模型系统讲解 LLM 评测和模型路由的工程原理:如何把真实 session 做成 eval case,用 rubric、LLM judge、校准集和成本表找出每类任务的最低可用模型。AILLMAI Infra评测
2026年7月23日RouteLLM 深度解读:把模型选择变成成本-质量路由问题从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。AILLMAI Infra评测论文深读
2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日从 vLLM ChatCompletionRequest 看懂大模型请求参数把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日Streaming 不是逐字打印:从 vLLM 看大模型增量输出的状态机从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日OpenAIServingChat 深度解读:vLLM 怎样把一次 Chat Completion 跑成 OpenAI 响应从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文深读学习笔记
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentAI Infra上下文工程学习笔记