2026年8月3日按场景看提示词工程与上下文工程:一个优化问题的两端提示词工程和上下文工程不是两门手艺,而是同一个优化问题在不同场景下的解。用 Mei et al. 2025 综述的形式化定义 C = A(c_instr, c_know, c_tools, c_mem, c_state, c_query) 做骨架,沿"单轮闭卷 → 开卷问答 → 长对话 → 动手 agent → 多智能体"五级场景阶梯,讲清每登一级、上下文里多了哪个成分、工程问题怎么变形——以及为什么提示词工程没有死,只是降级成了子模块。AILLMPrompt 工程上下文工程Agent论文深读
2026年8月3日Agent 变强以后,工程要做什么?深读 Thoughtworks 技术雷达 Vol.34从 118 个技术条目中提炼一套 Agent 工程控制系统:怎样管理上下文、权限、反馈、持久化和组织度量,以及团队接下来 30 天真正值得做什么。工程实践Agent
2026年8月2日MCP 史上最大改版的本质:状态不会消失,只会搬家MCP 2026-07-28 删掉了握手、会话和服务器反向请求,官方说这是"远程 MCP 发布以来最重要的一次改版"。但删掉的状态去哪了?结合 End-to-End Arguments(1981)、DARPA 设计哲学(1988)、Fielding 的 REST 论文(2000)逐字对照:这次改版的每一刀,四十年前的论文都写过理由——协议设计的根本问题从来不是"要不要状态",而是"状态住在哪、跟谁共命运"。MCPAgent论文深读
2026年8月1日进程边界是部署决策,不是架构决策:桌面 Agent 运行时的三条路桌面应用要在本地跑长时 Agent 任务时,运行时放哪里?内嵌 Clean Runtime Kernel、独立 Local Runtime Daemon、还是前端主导派发?系统对比三条路径,拆解 Run Journal、Event Outbox、租约、启动恢复四个本地高可用机制,并论证一个反直觉的结论:先把内核做干净,进程边界就可以推迟——daemon 解决的是进程隔离,而你真正要的是生命周期解耦加可恢复性,这两样不需要独立进程也能拿到。Agent
2026年7月31日别把批处理器当交互后端:解剖一条 codex exec 冷启动链一个 Tauri 桌面应用把 codex exec 用作本地 AI 执行后端,每个任务都要冷启动整条链:Node harness、run-scoped CODEX_HOME、MCP server、进程级 hook、workspace 物化、依赖预热。慢的根因不是模型,而是三种天然生命周期不同的东西被焊死在同一个进程生命周期上。本文给出完整的成本解剖、两个容易被忽略的反模式(双重观测、per-run store 打败内容寻址缓存),以及从 batch executor 迁移到常驻 runtime 的架构路线——包括为什么"审计性应该来自事件日志而不是进程短命"。CodexAgent系统设计自动化
2026年7月31日当你对 Claude Code 说 hello:一次请求日志里的上下文工程哲学以一份真实的 Claude Code 请求日志为标本,结合 Lost in the Middle、MemGPT、SWE-agent、Manus 与 Anthropic 的上下文工程实践,解剖一个 hello 背后数万 token 的信息环境设计。上下文工程AgentLLM
2026年7月30日codex exec 能控制什么:一张实测参数表读懂 agent 的自动化控制面基于本机 codex-cli 0.144.6 的 --help 实测,把 codex exec 全部参数整理成五个控制面:输入、执行者、行为配置、权限边界、输出与会话,并给出可直接复制的自动化配方。CodexAgent自动化
2026年7月30日当写代码不再是瓶颈:20 个术语读懂 AI 时代的软件验证用 scrapling 抓取并深读 Shiplight 的 AI 测试术语表:验证为什么取代编码成为新瓶颈,AI-augmented / AI-native / agentic / agent-native 四个词怎么分,"定位器是缓存"这个值得偷走的心智模型,以及怎么带着防伪眼镜读一份厂商定义的词汇表。AIAgent上下文工程
2026年7月29日遗忘是一种能力:五篇论文看懂长程 Agent 的记忆管理,正在重演操作系统内存史精读 AgentFold、IterResearch、AgentSwing、ContextBudget、Self-GC 五篇 2025.10–2026.07 的论文:为什么"记住一切"的 agent 反而答得更差?用 Pass@1 = η×ρ 这个分解式看懂 context rot 的本质,以及上下文管理如何从启发式规则一步步演化成垃圾回收、预算分配和运行时调度——操作系统内存管理史的完整重演。AILLMAgent上下文工程论文深读
2026年7月29日一个 search 工具能挖多深:解剖 Agent 工具箱里最不起眼的函数search(query) -> results,看起来是 agent 工具箱里最简单的函数。结合 SWE-agent、SLIM(Lost in the Maze)、ParallelSearch、Search-R1、ZeroSearch 五篇论文,逐层解剖它的设计空间:返回什么、问什么、怎么学会用、搜索引擎本身要不要是真的——每一层都藏着能让性能翻倍或减半的决定。AILLMAgent搜索RAG论文深读
2026年7月29日删掉 80% 系统提示词之后:Claude 5 时代的上下文工程新规则Anthropic 为 Claude 5 代模型删掉了 Claude Code 超过 80% 的系统提示词,编码评测没有任何可测的下降。深读这篇官方博客:为什么"给模型写规则"是有保质期的负债,五个 Then vs Now 的转变背后是苦涩的教训在提示词层重演,以及怎么把这套经验用到你自己的 agent 上。AILLMAgent上下文工程
2026年7月29日什么才是好的 Harness:判断归模型,物理归代码同一个模型,换个 harness 性能能差 6 倍。结合 SWE-agent(ACI 开山之作)、How Much Heavy Lifting、Inside the Scaffold、Code as Agent Harness、Fork-Explore-Commit 等论文,深度拆解好 harness 的三件本职工作:把世界翻译成模型好用的接口、把确定性工作从模型手里拿走、让错误变便宜——以及为什么"提示词里的规则是恳求,harness 里的规则是物理法则"。AILLMAgent上下文工程论文深读
2026年7月29日模型为什么会伸手:工具使用不是被教会的,是目标函数的影子一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。AILLMAgent论文深读
2026年7月28日场景控制包:把 Agent 经验从提示词推进到可执行契约结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。AIAgentAI InfraRAG系统设计
2026年7月28日Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。AIAgentLLM论文深读
2026年7月28日Codebase Memory MCP 源码深读:把代码库编译成 Agent 的结构化记忆从 MCP 入口、Tree-sitter 抽取、Hybrid LSP、graph buffer、SQLite/FTS5 和增量索引读懂 codebase-memory-mcp 的实现原理。AIAgentMCP源码阅读
2026年7月28日LLM 与 Agent 源码品读地图:11 层、50+ 个值得逐行读的开源项目把大模型与 Agent 开源栈拆成 11 层,每层回答"被什么稀缺资源塑形",再给出代表项目与具体的"读什么"。从 micrograd 到 vLLM,从 LangGraph 到 OpenHands,一张可以按图索骥的源码阅读地图。LLMAgentAI Infra源码阅读
2026年7月28日Tree-sitter 源码深读:增量解析器是怎样从 grammar.js 变成语法树的从 grammar DSL、parse table 生成、C runtime、GLR stack、增量重解析和 query VM 读懂 tree-sitter 的实现原理。AIAgent源码阅读
2026年7月27日Ego Lite 的关键不是会点网页,而是把浏览器变成 Agent 的共享运行时从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。AIAgentAI Infra源码阅读
2026年7月27日最近的大模型论文,值得读的不是排行榜从 DeepSeek-R1、s1、LIMO、Qwen3、Gemini 2.5、Kimi K2、GLM-4.5 到 Kimi Linear 和 Conditional Memory,整理一条 2025-2026 年大模型论文的品读路线:能力、算力、验证器和 Agent 化如何连成一条主线。AILLMAgent
2026年7月27日别把向量数据库当知识库:RAG、Agent 记忆和知识库的一条主线用一条“外部知识如何进入模型上下文”的主线,拆清向量数据库、RAG、Agent 知识库、Agent 记忆、Embedding、Retriever、Reranker、GraphRAG、BookRAG、A-RAG 等概念分别在系统里负责什么。AIRAGAgent记忆
2026年7月22日一万亿个参数,没有一个是给你拧的:函数、大模型与 Claude Code 的控制面迁移史函数的控制面是参数:改参数,结果就变。大模型呢?它有上万亿个参数,但没有一个是旋钮——真正的控制面迁移到了数据、目标函数和上下文里。到了 Claude Code / Codex,控制面又搬回模型外面,变成一整个分层的驾驶舱。这篇讲清一条主线:计算史就是控制面的迁移史,每次迁移都在拿确定性换能力,然后人类立刻在新的一层重建确定性。LLMAgent
2026年7月22日穿透控制面:你写进 CLAUDE.md 的每一行,最后变成了模型内部的什么上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。LLMAgent
2026年7月21日Loop 还是 Graph?这是个假问题——Agent 架构之争的真正变量,是控制流的真相放在哪里Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。AILLMAgentAI Infra论文深读学习笔记