2026年9月15日五种 embedding 压缩,我把它们跑了一遍:96 字节能打赢 1024 字节1000 条真实 embedding、18 组配置、recall@10 全部本机实测。int8 几乎免费(4× 压缩,0.9950);二值化单独用只有 0.4673,加一次 float 重排就跳到 0.9524;而占 10 倍存储的 MRL 截断到 256 维只有 0.6832,打不过 96 字节的 PQ。AILLMRAG工程实践源码阅读
2026年9月14日两张架构图里藏着 890 字节:把 DeepSeek V4.1 Flash 的 43 层排班表算出来2017 原版 Transformer 与 DeepSeek V4.1 Flash 的对照图上,每个标签都对应 config.json 里的一个键。顺着这条线可以手算出官方那个 890 B/token,并发现 40 层里只有 4 层真的在往缓存里写东西。AI InfraLLM源码阅读
2026年9月14日六种位置编码,其实只在争两个插入点同一个 Qwen2.5-7B、同一段文本、同样是把窗口放大 4 倍:线性插值让 PPL 从 8.18 崩到 173.57,YaRN 只涨到 8.90。差别全在一张波长表——我手算出 YaRN 放过了 64 个维度对里转得最快的 30 对。附 llama.cpp 源码定位与三个 token 的置换等变手算。AILLMTransformer论文深读源码阅读
2026年9月14日投机解码的四种变体,和我笔记本上那道 8 个 token 的悬崖在 M5 Pro 上把两模型投机解码完整跑了一遍:教科书说 2-3×,实测峰值 1.16×;草稿长度从 4 加到 11,端到端反而从 1.11× 掉到 0.49×。根因是 ggml Metal 里一行 ne11 > 8,以及草稿成本 γ 的硬地板。AIAI InfraLLM Servingllama.cpp源码阅读
2026年9月9日BFCL v3 深读:多轮函数调用的评测口径,从「对答案」换成「diff 状态」Berkeley 那篇 BFCL v3 博客表面在讲 1000 条新多轮题目,底下真正换掉的是评测口径:从 AST 匹配一条正确轨迹,变成让代码跑进沙盒后比对对象属性。附源码定位、条数核对、四类多轮任务的判据分工,以及一处被注释掉的更严判据留下的证据。AILLMAgent评测工具调用源码阅读
2026年9月7日Magnitude 源码深读:它不是又一个 Ollama,而是一台本地 Agent 推理控制器从源码、实测与论文出发,拆解 Magnitude 如何完成硬件探测、模型选型、投机解码、驻留管理与 Agent 接入。AI InfraLLMAgent源码阅读
2026年9月7日Ruflo 源码深读:它不是一群 Agent,而是套在 Agent 外面的控制面沿 Ruflo 3.38.21 的真实执行链,拆解配置注入、MCP 工具面、Swarm 控制状态、执行后端与记忆学习闭环,并区分已接线能力和产品叙事。AILLMAgent源码阅读工程实践MCP
2026年8月19日读 OpenViking 源码:把 Agent 上下文从「检索问题」改写成「数据库问题」克隆火山引擎开源的 OpenViking(Self-evolving Context Database),对照文档精读核心源码。它的全部设计可以压成三次「换表示」:把记忆/知识/技能统一成一个 viking:// 文件系统、把内容压成 L0/L1/L2 三层分辨率、把经验目录当成可优化的策略集并用「语义梯度」更新。这篇按写入、检索、进化三条路径逐一对照代码,最后用官方 benchmark 数字划清「已验证」和「未复现」的边界。Agent 工程记忆源码阅读上下文工程
2026年8月17日模型配置到底在配置什么:从 Megatron 源码读懂 Config、Spec、Builder 三层基于 Megatron 训练侧 GPTModelConfig/GPTModelBuilder 源码,把「模型配置」拆成三个正交问题:模型长什么样(Config)、每层用哪套实现(Spec)、切成几块放在哪张卡上(Builder)。含词表 padding 手算、layer spec 决策树伪代码和 MTP 支线,末尾给一张读任何训练框架配置都能用的三问速查表。AI InfraLLM源码阅读模型训练
2026年8月17日二十行骨架与四本账:Megatron 预训练主循环源码深读基于 Megatron 训练侧 training.py 真实源码,把预训练主循环拆成「二十行理想骨架 + 四本工程账(记账/容错/性能/并行胶水)」。含 FLOPs 公式与 6ND 的手算对照、packed sequence 的 L² 记账、跨 rank 对齐 GC 等细节,末尾给一张读任何训练框架主循环都能用的六问清单。AI InfraLLM源码阅读模型训练
2026年8月12日Prime Agent 内幕:当 Agent 的唯一工具是一个 Python 解释器基于 Prime Agent 主干源码 commit 965941c 的深读:默认工具列表里只有 ["ipython"]——读文件、改代码、开子代理、管记忆全是 Python 表达式。结合 RLM 论文(arXiv 2512.24601)与 Continual Harness 论文(arXiv 2605.09998),看"上下文变成变量、经验变成账本"这两步棋怎么在源码里落地:dill 快照、控制信道防死锁、只许 CRUD 的自我改进、以及 Factorio 里当场翻车的 reward hacking。AgentLLM上下文工程源码阅读
2026年8月12日SGLang 内幕:RadixAttention、超售调度与期货流水线的源码深读基于 SGLang 主干源码 commit b20c375 逐模块解读核心实现:radix tree 怎么给 KV cache 记账、疾驰匹配为什么快 370 倍、调度器如何像航空公司一样超售显存、撤退机制怎么选牺牲者、零开销调度的"期货 token"如何让 CPU 和 GPU 不再互等、约束解码的位掩码怎么挤进流水线——把论文里的三大招式落到具体函数名上。AI InfraLLMLLM Serving源码阅读
2026年8月11日LiteLLM 路由内幕:一行 routing_strategy 如何变成一次具体的模型调用基于 LiteLLM v1.97.0 源码逐行解读模型路由的完整链路:策略字符串怎么被识别成选择器、选择器为什么同时是日志回调、候选部署要过哪十一道漏斗、五种策略各自怎么记账怎么打分、失败怎么触发冷却、重试为什么睡 0 秒——把 config 里那一行配置到一次真实模型调用之间的所有代码打开给你看。AILLMAI Infra源码阅读
2026年8月5日Firecracker 源码深读:AWS 怎样用"减法"造出 125ms 启动的虚拟机从 12 万行 Rust 源码读懂 microVM 的精髓:无 BIOS 直接引导、virtio-mmio 极简设备面、嵌套信任区安全模型、UFFD 惰性快照恢复,以及它为什么成了 AI agent 沙箱的底座。源码阅读AI Infra
2026年7月28日Codebase Memory MCP 源码深读:把代码库编译成 Agent 的结构化记忆从 MCP 入口、Tree-sitter 抽取、Hybrid LSP、graph buffer、SQLite/FTS5 和增量索引读懂 codebase-memory-mcp 的实现原理。AIAgentMCP源码阅读
2026年7月28日LLM 与 Agent 源码品读地图:11 层、50+ 个值得逐行读的开源项目把大模型与 Agent 开源栈拆成 11 层,每层回答"被什么稀缺资源塑形",再给出代表项目与具体的"读什么"。从 micrograd 到 vLLM,从 LangGraph 到 OpenHands,一张可以按图索骥的源码阅读地图。LLMAgentAI Infra源码阅读
2026年7月28日nanoGPT config 不是参数表:一张 LLM 训练配方地图从 LLM 训练的大背景出发,系统讲解 nanoGPT config 目录里的训练、微调、评估配置,以及 batch、context、模型大小、AdamW、学习率、DDP、dtype 等参数如何在源码中生效。AIAI InfraLLMTransformer模型训练源码阅读学习笔记
2026年7月28日从 65 个字符开始:nanoGPT 的 Shakespeare 字符级语言模型数据准备用 nanoGPT 的 shakespeare_char prepare.py 串起字符到整数 id、train.bin/val.bin、meta.pkl、next-token 训练样本,以及它和 BPE/GPT-2 路线的差别。AIAI InfraLLM源码阅读学习笔记
2026年7月28日Tree-sitter 源码深读:增量解析器是怎样从 grammar.js 变成语法树的从 grammar DSL、parse table 生成、C runtime、GLR stack、增量重解析和 query VM 读懂 tree-sitter 的实现原理。AIAgent源码阅读
2026年7月27日Ego Lite 的关键不是会点网页,而是把浏览器变成 Agent 的共享运行时从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。AIAgentAI Infra源码阅读
2026年7月22日vLLM APC 六问:从 block hash 到 free/evict沿 vLLM V1 源码拆解 Automatic Prefix Caching 的六个核心动作:block hash 构造、最长前缀命中、touch 挂 request、新 block 分配、free/evict 区别,以及哪些请求必须跳过 APC。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日vLLM Automatic Prefix Caching 源码精读:KV cache 为什么能跨请求复用从 Scheduler、KVCacheManager、BlockPool 和 block hash 链路读懂 vLLM APC:它怎样把前缀命中变成已计算 token 和可复用 KV blocks。AIAI InfravLLMLLM Serving源码阅读
2026年7月22日从 vLLM ChatCompletionRequest 看懂大模型请求参数把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。AIAI InfravLLMLLM Serving源码阅读工具调用
2026年7月22日Streaming 不是逐字打印:从 vLLM 看大模型增量输出的状态机从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。AIAI InfravLLMLLM Serving源码阅读工具调用