2026年8月2日MCP 史上最大改版的本质:状态不会消失,只会搬家MCP 2026-07-28 删掉了握手、会话和服务器反向请求,官方说这是"远程 MCP 发布以来最重要的一次改版"。但删掉的状态去哪了?结合 End-to-End Arguments(1981)、DARPA 设计哲学(1988)、Fielding 的 REST 论文(2000)逐字对照:这次改版的每一刀,四十年前的论文都写过理由——协议设计的根本问题从来不是"要不要状态",而是"状态住在哪、跟谁共命运"。MCPAgent论文深读
2026年8月2日投机解码的第二本账:长上下文把瓶颈从权重搬到了 KV Cache从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。AIAI InfraLLM Serving论文深读
2026年7月29日遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。AILLMAgent上下文工程论文深读
2026年7月29日一个 search 工具能挖多深:解剖 Agent 工具箱里最不起眼的函数search(query) -> results,看起来是 agent 工具箱里最简单的函数。结合 SWE-agent、SLIM(Lost in the Maze)、ParallelSearch、Search-R1、ZeroSearch 五篇论文,逐层解剖它的设计空间:返回什么、问什么、怎么学会用、搜索引擎本身要不要是真的——每一层都藏着能让性能翻倍或减半的决定。AILLMAgent搜索RAG论文深读
2026年7月29日什么才是好的 Harness:判断归模型,物理归代码同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。AILLMAgent上下文工程论文深读
2026年7月29日模型为什么会伸手:工具使用不是被教会的,是目标函数的影子一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。AILLMAgent论文深读
2026年7月28日Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。AIAgentLLM论文深读
2026年7月27日当写界面和看界面的都不再只是人:大模型时代前端的三条战线前端建立在"界面由人写、给人看"两个隐含假设上,大模型正在同时拆除它们。结合 Design2Code、Agentic Web、Generative UI 等十余篇论文,推演前端各领域与工程化的整改趋势。LLM论文深读
2026年7月27日涌现是真是幻?大模型"突然开窍"的本质——一场跨越四年的论文辩论为什么三位数加法这种能力会在模型变大时"突然出现"?沿着 Wei 2022 定名、Schaeffer 2023 质疑(海市蜃楼)、Du 2024 反转(损失阈值)、Michaud 量子模型、grokking 显微镜、Arora & Goyal 技能组合的论文接力,把涌现拆成一个可复用的心智模型:底层的进步几乎总是连续的,"涌现"是连续进步穿过非线性读出面时投下的阶跃阴影。AILLM论文深读
2026年7月27日一文讲透大模型格式化输出:从预训练先验到约束解码的五层保障为什么"请只输出 JSON"的哀求会失灵,而 response_format 一开就稳?沿训练到推理的完整链路拆解格式保障的五层机制:预训练给先验、后训练给服从、提示接口表达意图、约束解码给硬保证、系统校验兜底。结合 PICARD、Outlines、XGrammar、SGLang 与 Let Me Speak Freely 等论文,讲清 FSM 掩码的原理、tokenizer 错位难题、约束解码的分布扭曲代价,以及生产系统为什么五层全都要。AILLMAI InfraLLM Serving论文深读
2026年7月27日Medusa 深读:解码慢不是算力问题,是搬运问题从"解码是内存带宽瓶颈"这个第一性约束出发,拆解 Medusa 的多头架构、Typical Acceptance 与 Tree Attention;再沿 Stern 2018 → Speculative Decoding → SpecInfer → Medusa → Hydra / EAGLE / DFlash 的 arXiv 系谱,看清这场"并行宽度换串行步数"的交易,以及评估任何投机解码方案的四个问题。AIAI InfraLLM Serving论文深读
2026年7月27日目标函数即命运:大模型为什么会长成被奖励的样子结合 next-token 预训练、RLHF、DPO、DeepSeek-R1、Goodhart 定律、reward hacking 和目标泛化失败,用通俗例子解释“目标函数即命运”:模型不会按我们的愿望成长,而会按可优化的信号成长。AILLM论文深读
2026年7月23日RouteLLM 深度解读:把模型选择变成成本-质量路由问题从工程视角拆解 RouteLLM:它如何用偏好数据学习强弱模型路由,matrix factorization router、阈值、CPT/APGR 指标分别是什么意思,以及怎样接到真实 session eval 系统里。AILLMAI Infra评测论文深读
2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文深读学习笔记
2026年7月18日把注意力换成一块「会遗忘的内存」:源码级深读 Kimi K3 的心脏 KDAKimi K3 权重 7 月 27 日才放出,但它的核心 KDA 九个月前就完整开源了。从 arXiv 论文和 flash-linear-attention 的 kernel 源码出发,拆解这块 128×128 的矩阵内存如何撑起 2.8 万亿参数与 1M 上下文。LLMAI Infra论文深读
2026年7月18日会加减乘除就够:十个问题,手算读懂 Kimi K3 心脏里的全部数学上一篇 KDA 深读里的公式劝退你了?这篇是零基础陪读:用一块 2×2 的迷你内存和十个问题,每一步都能用小学算术手算,算完你能逐个符号读懂 KDA 的核心公式。数学LLM零基础论文深读
2026年7月18日KV cache 是内存管理,上下文管理是 GC 吗?——把 LLM 推理栈当操作系统读一遍一个常见直觉的精确化:KV cache 层确实对应操作系统内存管理——PagedAttention 就是把虚拟内存搬进显存,前缀缓存的 ref_cnt 就是字面意义的引用计数 GC;但语义层的上下文管理对应的不是 GC,而是页面置换加有损压缩。给出三问判据。AI InfraLLMvLLM论文深读