最艰难的那一年,真的会让人生辽阔吗
考据一句刷屏金句的真实出处(它是《岛上书店》的腰封文案,不是书里的句子),再用三篇心理学论文审计它的真伪:创伤后成长研究证实了五个成长维度,也发现「感觉自己成长了」和「真的成长了」几乎不相关,而苦难的剂量存在倒 U 曲线。最诚实的结论:那一年不会自动变成礼物——把它讲成礼物的动作,才是。
Archive
考据一句刷屏金句的真实出处(它是《岛上书店》的腰封文案,不是书里的句子),再用三篇心理学论文审计它的真伪:创伤后成长研究证实了五个成长维度,也发现「感觉自己成长了」和「真的成长了」几乎不相关,而苦难的剂量存在倒 U 曲线。最诚实的结论:那一年不会自动变成礼物——把它讲成礼物的动作,才是。
考据雷军 2023 年度演讲里「知识是网状的」这段话的出处,再用七篇论文逐句审计它:LLM 预训练默认乱序打散数据、grokking 证明开窍可以迟到、知识必须被多角度反复遇见才提取得出来。结论:这段话不是鸡汤,它几乎就是预训练的工程实践——但它有三个容易被忽略的前提。
把 MemTensor 的 MemOS(arXiv:2507.03724)克隆下来,对照论文精读约 9 万行 Python 源码。它的精髓可以压成一张相图:记忆有三态——明文(气态)、激活(液态)、参数(固态),'记忆操作系统'的职责是调度相变。审计结果:明文态是生产级,明文→激活这条相变真实且值钱(TTFT 最高降 94.2%),而参数态在源码里是一个 dump() 时写入 b"Placeholder" 的占位符。这篇按'表示—调度—相变—进化—数字'五层,把论文的承诺和代码的现实逐条对齐。
做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。
Warp 仓库根目录躺着一个 skills-lock.json:25 个'依赖'全是 Markdown 提示词,每条锁一个内容哈希。它不是标准的一部分,却标志着一个转折——当提示词成为跨团队共享的工件,它就继承了软件依赖的完整生命周期:manifest、锁文件、可复现安装,以及供应链攻击。结合五篇 arXiv 论文,拆解 Agent Skill 依赖管理的现状、原则与锁不住的部分。
写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。
从物化、编排、轨迹、检查点到 Harness 和 Verifier,按任务闭环梳理 60 多个 Agent 工程术语,并追问哪些是真问题的新名字、哪些只是旧概念迁移,以及模型为何偏爱这种语言。
结合分布式快照、Saga、LogAct、Crab、RAC、Plans Don’t Persist 与 τ-bench,解释 Agent 长任务如何用任务契约、事件日志、副作用账本、恢复对账和外部验证器实现可中断、可恢复且效果可验收。
系统拆解 Browser Agent 的控制通道与页面表示:比较 HTTP/API、WebDriver、Playwright、DOM、Accessibility Tree、CDP、浏览器扩展、视觉坐标和 Agent-aware browser runtime,并结合论文讨论评测、安全与选型。
从一条 macOS UI 探测命令出发,解释大模型如何观察、定位、操作并验证桌面软件,比较 Accessibility Tree、视觉坐标、DOM、API/CLI 与混合控制的取舍和局限。
把大企业"能搞的大模型内容"收敛成四个缺口——知识、行动、信任、成本。用 20 余篇可查证的 arXiv 论文标出每个缺口下值得立项的方向、已知的坑与真实完成度,并给出一张立项检查单。
提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。
把"自建大模型"拆成从 RAG 到从零预训练的四级阶梯,用 12 篇可查证的 arXiv 论文标出每一级的成本量级、升级信号与踩坑边界——BloombergGPT 与 DeepSeek-V3 是两端的对照案例。
MCP 2026-07-28 删掉了握手、会话和服务器反向请求,官方说这是"远程 MCP 发布以来最重要的一次改版"。但删掉的状态去哪了?结合 End-to-End Arguments(1981)、DARPA 设计哲学(1988)、Fielding 的 REST 论文(2000)逐字对照:这次改版的每一刀,四十年前的论文都写过理由——协议设计的根本问题从来不是"要不要状态",而是"状态住在哪、跟谁共命运"。
从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。我先读了今天抓到正文的 22 篇材料,再把真正会改变判断的信号压缩成方向、技能和行动。今天最值得盯住的不是单条 headline,而是三个系统层变化:长时程推理开始碰到真实研究问题,可审计的窄工具接口重新变得重要,以及推理成本还在继续往…
以一份真实的 Claude Code 请求日志为标本,结合 Lost in the Middle、MemGPT、SWE-agent、Manus 与 Anthropic 的上下文工程实践,解剖一个 hello 背后数万 token 的信息环境设计。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版,不是规则拼接版。今天最值得你更新的判断有三件事:第一,模型能力的边界正在从“会不会答题”转到“能不能在受约束环境里连续做成事”,MirrorCode、会计基准和安全事故讨论都在指向这一点;第二,企业真正愿意付费的方向越来越集中到高审计、…
精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。
search(query) -> results,看起来是 agent 工具箱里最简单的函数。结合 SWE-agent、SLIM(Lost in the Maze)、ParallelSearch、Search-R1、ZeroSearch 五篇论文,逐层解剖它的设计空间:返回什么、问什么、怎么学会用、搜索引擎本身要不要是真的——每一层都藏着能让性能翻倍或减半的决定。
同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。
一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。
结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。
逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。