Codex AI Digest 深读版 · 2026-07-29
Codex 真读真写 · 从 source pack 重写判断。这是 Codex 深读版。今天最该更新的不是某个模型又涨了几分,而是三条主线已经开始合流:长程软件任务正在逼近可交付区间,Codex/ChatGPT Work 正把 agent 从写代码扩到知识工作,安全与治理正在从“模型会不会听话”转成“系统有没有证据…
Archive
Codex 真读真写 · 从 source pack 重写判断。这是 Codex 深读版。今天最该更新的不是某个模型又涨了几分,而是三条主线已经开始合流:长程软件任务正在逼近可交付区间,Codex/ChatGPT Work 正把 agent 从写代码扩到知识工作,安全与治理正在从“模型会不会听话”转成“系统有没有证据…
一个只会预测下一个 token 的模型,凭什么会去调用计算器和搜索引擎?从 Toolformer 的自监督起源(一次调用能留下的唯一理由是降低未来 token 的 loss),到 RLVR 时代的工具滥用幻觉(无成本时任何 ΔP>0 都值得调用),再到 knowing-doing gap(知道该用和真的去用在残差流里是两个方向)——结合五篇论文回答:模型为什么会用工具、为什么会滥用、以及为什么"知道"不等于"做到"。
结合 AI Chains、PromptChainer、ReAct、RAG、Self-RAG、DSPy、AutoGen、MetaGPT、Reflexion、Voyager、AgentBench 和 SWE-agent,判断 AIHub 场景控制包有没有同类论文思想:没有找到完整同款,但能看到清晰的相邻研究脉络。
逐段拆解美团 CatPaw Managed Agents 的"脑手分离"架构,把每个组件映射回它的操作系统祖先:Session 恢复是进程切换,上下文压缩是虚拟内存,Sandbox Gateway 是调度器,模型路由网关是硬件抽象层。结合 ReAct、MemGPT、AIOS、Firecracker、CaMeL 等论文,解释为什么相同的资源约束必然长出相同的架构形状——以及这个类比在哪里失效。
从 MCP 入口、Tree-sitter 抽取、Hybrid LSP、graph buffer、SQLite/FTS5 和增量索引读懂 codebase-memory-mcp 的实现原理。
Codex 真读真写 · 先读方向,再读工具和行动。这是 Codex 深读版。今天最值得注意的不是某个单点榜单,而是 agent 时代的三个底层变化开始对齐:长时程任务正在有更像真实工作的 benchmark 和训练框架,open-weight 竞争从模型本身扩展到许可证与推理基础设施,企业落地则更清楚地走向“小模型…
把大模型与 Agent 开源栈拆成 11 层,每层回答"被什么稀缺资源塑形",再给出代表项目与具体的"读什么"。从 micrograd 到 vLLM,从 LangGraph 到 OpenHands,一张可以按图索骥的源码阅读地图。
推理模型、智能体、上下文工程、MoE 与稀疏注意力、扩散 LLM、世界模型……热门方向看似散乱,其实都在回答同一个问题:预训练的规模红利递减之后,去哪里找新的增长轴?这篇把它们收拢成五根杠杆——推理时算力、经验、上下文、单位成本、生成范式——并附上可核查的 arXiv 论文与开源产品索引。
从 grammar DSL、parse table 生成、C runtime、GLR stack、增量重解析和 query VM 读懂 tree-sitter 的实现原理。
从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。
前端建立在"界面由人写、给人看"两个隐含假设上,大模型正在同时拆除它们。结合 Design2Code、Agentic Web、Generative UI 等十余篇论文,推演前端各领域与工程化的整改趋势。
从 DeepSeek-R1、s1、LIMO、Qwen3、Gemini 2.5、Kimi K2、GLM-4.5 到 Kimi Linear 和 Conditional Memory,整理一条 2025-2026 年大模型论文的品读路线:能力、算力、验证器和 Agent 化如何连成一条主线。
用一条“外部知识如何进入模型上下文”的主线,拆清向量数据库、RAG、Agent 知识库、Agent 记忆、Embedding、Retriever、Reranker、GraphRAG、BookRAG、A-RAG 等概念分别在系统里负责什么。
Codex 真读真写 · 24 篇原文 / 9 个渠道 / 论文、趋势、技能、工具、行动。这是 Codex 深读版。今天先更新三个判断:第一,agent 训练正在从“做 benchmark”转向“把真实 harness 带进 RL”;第二,多模态模型开始从生成内容外溢到动作预测、机器人和浏览器端运行;第三,健康、企业…
Codex 真读真写 · 先看方向,再看行动。这是 Codex 深读版。今天最值得你调整判断的,不是某个单点模型分数,而是三条更耐久的线索:一,agent 训练开始进入真实 harness 和真实环境;二,开放权重在高风险能力上的追赶速度继续压缩治理窗口;三,多模态系统正从“会生成”走向“会感知、预测、动作”。如果你…
Codex 真读真写 · 方向 / 判断 / 行动。这是 Codex 深读版。今天最值得尽快更新的判断有三条:第一,AI 安全叙事正在从“模型能力有多强”转向“评测与部署边界是否足够硬”;第二,长上下文与 agent 的下一阶段不只是更长,而是更会取证、检索、验证和回退;第三,真正能拉开差距的护城河越来越像数据生成、…
函数的控制面是参数:改参数,结果就变。大模型呢?它有上万亿个参数,但没有一个是旋钮——真正的控制面迁移到了数据、目标函数和上下文里。到了 Claude Code / Codex,控制面又搬回模型外面,变成一整个分层的驾驶舱。这篇讲清一条主线:计算史就是控制面的迁移史,每次迁移都在拿确定性换能力,然后人类立刻在新的一层重建确定性。
上一篇找齐了 Agent 的控制面,这一篇把 X 光打进去:指令、示例、人格设定、测试反馈,穿过 tokenizer 之后分别控制了 Transformer 内部的哪个机制?结合 induction heads、task vectors、persona vectors 三条机制学证据链,得到一个统一答案——上下文控制的从来不是模型会什么,而是在一座冻结的能力库上做"寻址":选择并组合已有的回路。
把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。
从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。
从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。
Loop 派信模型,Graph 派信代码,吵的其实是同一个坐标轴上的两个点:下一步由谁决定。用调度器理论把二元对立拆成连续谱,再看 AFlow/GPTSwarm 给出的第三条路——结构本身也可以被搜索出来。
Codex 真读真写 · 方向 / 判断 / 技能 / 工具 / 行动。这是 Codex 深读版,不做关键词拼盘。今天 23 篇材料里最值得你调整判断的,不是又一个更大的模型,而是三条更耐久的线索:机器人开始把采数工具链产品化;agent 与自动发现系统开始暴露评测与验证短板;模型对措辞和软上下文的脆弱性,已经足以反…
状态记录、失败恢复、沙箱隔离、多轮评测、test-time compute 分配、上下文组织、速度/成本/成功率联合优化——七个问题共享同一个答案结构:把真相移到模型外面。