全部专题

Reading path

大模型论文精读

沿论文原文拆解模型结构、训练方法、评测与工程权衡,不追热点标题,追可复用的理解框架。

171 篇文章

Archive

专题归档

第 4 / 7 页

读 MemOS 源码:记忆的三态、相变,与一个诚实的占位符

把 MemTensor 的 MemOS(arXiv:2507.03724)克隆下来,对照论文精读约 9 万行 Python 源码。它的精髓可以压成一张相图:记忆有三态——明文(气态)、激活(液态)、参数(固态),'记忆操作系统'的职责是调度相变。审计结果:明文态是生产级,明文→激活这条相变真实且值钱(TTFT 最高降 94.2%),而参数态在源码里是一个 dump() 时写入 b"Placeholder" 的占位符。这篇按'表示—调度—相变—进化—数字'五层,把论文的承诺和代码的现实逐条对齐。

记忆的内化:Metis 把 Agent 记忆从提示词搬进前向计算

做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。

当提示词成为依赖:读 Warp 的 skills-lock.json

Warp 仓库根目录躺着一个 skills-lock.json:25 个'依赖'全是 Markdown 提示词,每条锁一个内容哈希。它不是标准的一部分,却标志着一个转折——当提示词成为跨团队共享的工件,它就继承了软件依赖的完整生命周期:manifest、锁文件、可复现安装,以及供应链攻击。结合五篇 arXiv 论文,拆解 Agent Skill 依赖管理的现状、原则与锁不住的部分。

按场景看提示词工程与上下文工程:一个优化问题的两端

提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。

MCP 史上最大改版的本质:状态不会消失,只会搬家

MCP 2026-07-28 删掉了握手、会话和服务器反向请求,官方说这是"远程 MCP 发布以来最重要的一次改版"。但删掉的状态去哪了?结合 End-to-End Arguments(1981)、DARPA 设计哲学(1988)、Fielding 的 REST 论文(2000)逐字对照:这次改版的每一刀,四十年前的论文都写过理由——协议设计的根本问题从来不是"要不要状态",而是"状态住在哪、跟谁共命运"。

遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史

精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。

什么才是好的 Harness:判断归模型,物理归代码

同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。

模型为什么会伸手:工具使用不是被教会的,是目标函数的影子

一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。

Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读

逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。