全部专题

Reading path

Agent 工程

记录 agent loop、工具调用、上下文工程、MCP、检索和长任务控制,把抽象能力落到工程边界。

165 篇文章

Archive

专题归档

第 5 / 7 页

模型为什么会伸手:工具使用不是被教会的,是目标函数的影子

一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。

Agent 平台正在重新发明操作系统:美团 CatPaw 架构深读

逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。

Scaling 没有死,它换了坐标轴:2026 年 LLM 研究与产品的五条主线

推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。

Codex AI Digest 深读版 · 2026-07-24 · 18:18 版

Codex 真读真写 · 先看方向,再看行动。这是 Codex 深读版。今天最值得你调整判断的,不是某个单点模型分数,而是三条更耐久的线索:一,agent 训练开始进入真实 harness 和真实环境;二,开放权重在高风险能力上的追赶速度继续压缩治理窗口;三,多模态系统正从“会生成”走向“会感知、预测、动作”。如果你…

一万亿个参数,没有一个是给你拧的:函数、大模型与 Claude Code 的控制面迁移史

函数的控制面是参数:改参数,结果就变。大模型呢?它有上万亿个参数,但没有一个是旋钮——真正的控制面迁移到了数据、目标函数和上下文里。到了 Claude Code / Codex,控制面又搬回模型外面,变成一整个分层的驾驶舱。这篇讲清一条主线:计算史就是控制面的迁移史,每次迁移都在拿确定性换能力,然后人类立刻在新的一层重建确定性。

穿透控制面:你写进 CLAUDE.md 的每一行,最后变成了模型内部的什么

上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。