2026年9月10日那张「AI 这十年」的成长图画反了:2026 栏的 22 个词,19 个不在模型里一张三代身高对比图把十年画成「模型长大了」。我数了一遍 2026 栏的 22 个词,只有 3 个动模型权重。再用自己这个 337 篇的博客仓库算一笔账:把全部内容塞进上下文,连最宽松的估法都装不下 1M 窗口——那 19 个词是这道算术题的产物,不是模型的成长纹。AI Infra上下文工程Agent 工程系统设计
2026年9月1日会话内 RSI 深读:Agent 把哪个对象定义成可变的,决定它变强还是变废ACE 论文的 AppWorld 日志里有一处最该被记住的数字:第 60 步上下文 18,282 token、准确率 66.7;第 61 步模型重写了一次自己的经验手册,上下文只剩 122 token,准确率掉到 57.1——比完全不自我改进的 63.7 还低。不重载、不动权重、人不介入的自我提升不是一个开关,它有三个决定生死的设计选择:可变对象的粒度、写入权归谁、验证信号从哪来。这篇结合 ACE、ReasoningBank、Gödel Agent、Darwin Gödel Machine、Training-Free GRPO 等论文的原文数字,把这三个选择拆开。AILLMAgent上下文工程论文深读
2026年8月25日读 ECC:一个仓库把 Claude Code 的 harness 意见装箱发货ECC(Everything Claude Code)是 MIT 协议的 Claude Code 插件仓库。它把 plan → test → implement → review → verify → remember → improve 这条工作流固化成 68 个 agent、286 个 skill、94 个命令和一套 hook。读这个仓库不是读框架源码,是读一份被具体化到文件的 harness 意见:每一种日用 agent 编程会踩到的失败模式,都对应一件可 install 的东西。AILLMAgentAgent 工程上下文工程
2026年8月25日在 AI 时代胜人一筹:杠杆不在模型多强,而在你和模型之间那道界面2005 年一对业余棋手加三台普通电脑,打败了大师加超算——卡斯帕罗夫由此提炼出"弱人类+机器+更好的流程"能赢。结合 Kasparov 定律、Bainbridge《自动化的反讽》、METR 实测 -19% 的 RCT,用一个能手算的 Amdahl 式杠杆公式说清:人机协作的胜负不在谁强,而在两者之间那道界面的质量。AIAgent 工程上下文工程工程实践自动化
2026年8月19日读 OpenViking 源码:把 Agent 上下文从「检索问题」改写成「数据库问题」克隆火山引擎开源的 OpenViking(Self-evolving Context Database),对照文档精读核心源码。它的全部设计可以压成三次「换表示」:把记忆/知识/技能统一成一个 viking:// 文件系统、把内容压成 L0/L1/L2 三层分辨率、把经验目录当成可优化的策略集并用「语义梯度」更新。这篇按写入、检索、进化三条路径逐一对照代码,最后用官方 benchmark 数字划清「已验证」和「未复现」的边界。Agent 工程记忆源码阅读上下文工程
2026年8月13日深入理解 AI Agent 拆一条线:上下文学习是检索,不是推理深度解读李博杰《深入理解 AI Agent:设计原理与工程实践》(v1.1,307 页):一个公式(Agent = LLM + 上下文 + 工具)、一条机制假设(上下文学习≈检索而非推理),推出全书几乎所有反直觉工程结论——状态栏让弱模型准确率涨 40-54 个百分点、系统提示词里一个时间戳让 TTFT 从 0.5s 涨到 3-5s、状态栏没覆盖的维度准确率从 100% 塌到 7.6%、RLVP 用"不对称验证器"补 GRPO 的方差、多 Agent 唯一有效判据是"是否引入生成时不存在的新信息"。AgentLLM上下文工程
2026年8月12日Prime Agent 内幕:当 Agent 的唯一工具是一个 Python 解释器基于 Prime Agent 主干源码 commit 965941c 的深读:默认工具列表里只有 ["ipython"]——读文件、改代码、开子代理、管记忆全是 Python 表达式。结合 RLM 论文(arXiv 2512.24601)与 Continual Harness 论文(arXiv 2605.09998),看"上下文变成变量、经验变成账本"这两步棋怎么在源码里落地:dill 快照、控制信道防死锁、只许 CRUD 的自我改进、以及 Factorio 里当场翻车的 reward hacking。AgentLLM上下文工程源码阅读
2026年8月8日刷到的微软论文是真的吗?——FastContext:AI 写代码最贵的一步,和一篇只活了 18 天的论文从一条短视频出发的事实核查与论文深读:微软 FastContext(arXiv 2606.14066)确有其文——用 4B 小模型专管代码库探索,主代理省 26–60% token、难题解决率 +5.5 分——但它 6 月 12 日提交、6 月 30 日就以「产品 IP」为由撤稿删库。结合 CodeScout、SWE-grep、SWE-Pruner、Agentless、LocAgent,把「代码库探索该由谁来做」这个决策点的四条路线摆上桌:撤稿本身,就是这个方向商业价值最响亮的注脚。AILLM上下文工程论文深读
2026年8月6日Agent 时代的工程学:六个决策点,每个都有一条「论文→产品」的传导链Agent 工程在 2026 年不缺方法,缺的是判断:哪些决策已经收敛(抄工业默认答案就行),哪些还没收敛(要自己读论文做实验)。本文把 Agent 工程拆成六个决策点,每个决策点给出源头论文、落地技术代表和收敛度判断,最后合成一张可以直接用的选型地图。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日从能跑到可托付:顶级 Agent 应用工程师的六层系统与三条闭环写给已经在做 Agent 的工程师:从目标契约、上下文状态、决策控制、工具环境、运行时信任到评测学习,用六层系统与三条闭环重新理解 Agent 应用层,并给出从功能实现者走向系统负责人的进阶路径。AILLMAgentAgent 工程上下文工程AI Infra论文深读
2026年8月3日按场景看提示词工程与上下文工程:一个优化问题的两端提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。AILLMPrompt 工程上下文工程Agent论文深读
2026年8月2日上下文不是平的:位置与结构如何决定一条信息对输出的干预力同一条信息放在上下文的开头、中间、结尾,对最强模型输出的影响力可以差出几十个百分点——而且这个"位置地形"会随上下文填充率动态变形:塞满一半之后,经典的 U 形曲线塌掉,只剩结尾优势。从注意力机制的三个根本约束出发,讲清位置偏差的成因、衰减的动态过程,以及"结构"为什么本质上是在地形上打人工锚点。AILLM上下文工程
2026年7月31日当你对 Claude Code 说 hello:一次请求日志里的上下文工程哲学以一份真实的 Claude Code 请求日志为标本,结合 Lost in the Middle、MemGPT、SWE-agent、Manus 与 Anthropic 的上下文工程实践,解剖一个 hello 背后数万 token 的信息环境设计。上下文工程AgentLLM
2026年7月30日当写代码不再是瓶颈:20 个术语读懂 AI 时代的软件验证用 scrapling 抓取并深读 Shiplight 的 AI 测试术语表:验证为什么取代编码成为新瓶颈,AI-augmented / AI-native / agentic / agent-native 四个词怎么分,"定位器是缓存"这个值得偷走的心智模型,以及怎么带着防伪眼镜读一份厂商定义的词汇表。AIAgent上下文工程
2026年7月29日遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。AILLMAgent上下文工程论文深读
2026年7月29日删掉 80% 系统提示词之后:Claude 5 时代的上下文工程新规则Anthropic 为 Claude 5 代模型删掉了 Claude Code 超过 80% 的系统提示词,编码评测没有任何可测的下降。深读这篇官方博客:为什么"给模型写规则"是有保质期的负债,五个 Then vs Now 的转变背后是苦涩的教训在提示词层重演,以及怎么把这套经验用到你自己的 agent 上。AILLMAgent上下文工程
2026年7月29日什么才是好的 Harness:判断归模型,物理归代码同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。AILLMAgent上下文工程论文深读
2026年7月20日Agent 工程七问:如何把一个随机内核,包装成能托付长任务的可靠系统状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。AILLMAgentAI Infra上下文工程学习笔记
2026年7月17日Agent 的内存管理:Claude Code 与 Codex 如何决定"忘掉什么"深度拆解 Claude Code / Codex 的上下文淘汰策略:分层压缩管道、compaction 幸存规则、KV cache 淘汰的同构问题,以及 arXiv 论文给出的反直觉证据——简单丢弃常常不输昂贵的摘要。AILLM上下文工程Codex学习笔记
2026年7月16日从 Agent 供给工程到设计即交付:三份 AI 研发规范背后的生产线逻辑结合论文与 KaiHub、Echo Builder、设计上下文、物料渲染等实现,解读 Skills & MCP、提示词与上下文工程、D2D 如何组成公司级 AI 研发生产线。AIAgentMCPSkills上下文工程工程实践
2026年7月16日提示词之后:上下文工程如何接管 LLM 应用质量从系统提示词、用户提示词、会话上下文、检索上下文、Token 窗口、幻觉抑制和提示词模板库出发,结合 arXiv 论文解释为什么 LLM 应用的核心工程对象正在从 prompt 变成 context。AILLMPrompt 工程上下文工程RAGAI Infra
2026年7月15日从提示词到工作制度:Superpowers Skill 的结构上下文哲学结合 Superpowers 的 brainstorming、TDD、worktree、writing-skills 设计,以及 Agent Skills、Externalization、SkillsBench、Parametric Skills、HASP 等论文,解释为什么 skill 的本质不是更多 prompt,而是把 Agent 的工作上下文做成可触发、可验证、可复盘的结构。AILLMAgent上下文工程AI Infra