Codex AI Digest 深读版 · 2026-07-24
Codex 真读真写 · 24 篇原文 / 9 个渠道 / 论文、趋势、技能、工具、行动。这是 Codex 深读版。今天先更新三个判断:第一,agent 训练正在从“做 benchmark”转向“把真实 harness 带进 RL”;第二,多模态模型开始从生成内容外溢到动作预测、机器人和浏览器端运行;第三,健康、企业…
Codex 真读真写 · 24 篇原文 / 9 个渠道 / 论文、趋势、技能、工具、行动。这是 Codex 深读版。今天先更新三个判断:第一,agent 训练正在从“做 benchmark”转向“把真实 harness 带进 RL”;第二,多模态模型开始从生成内容外溢到动作预测、机器人和浏览器端运行;第三,健康、企业…
16 张可交互的经典函数图像:线性、二次、三次、反比例、根式、绝对值、指数、对数、三角、反三角、双曲、sigmoid、高斯、取整。用 function-plot 的区间算术精确绘制,滚轮缩放、悬停读坐标。附精确性质速查表和工具选型指南。
Scaling Laws 深读的陪读篇。用正方形、身高预测、餐巾纸记账几个能手算的真问题,把幂律、log-log 直线、拟合、外推、C≈6ND 五件工具逐件装好,每件装完立刻回扣深读原文。读完再回去,0.73 vs 0.5 之争会变成一个很直观的故事。
把 vLLM 的 ChatCompletionRequest 当成推理控制面地图,讲清 messages、chat template、token 预算、采样参数、结构化输出、工具调用、streaming 和服务调度分别作用在大模型推理的哪一层。
从 OpenAI SSE 协议、LLM prefill/decode、vLLM chat_completion_stream_generator 和 Parser.parse_delta 四个层次,理解大模型 streaming 为什么不是简单 append 文本,而是增量状态机。
从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。
Codex 真读真写 · 方向 / 判断 / 技能 / 工具 / 行动。这是 Codex 深读版,不做关键词拼盘。今天 23 篇材料里最值得你调整判断的,不是又一个更大的模型,而是三条更耐久的线索:机器人开始把采数工具链产品化;agent 与自动发现系统开始暴露评测与验证短板;模型对措辞和软上下文的脆弱性,已经足以反…
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。我先把今天 7 个渠道的 19 篇正文压成三个判断:一是开源大模型竞争已经从“能否追上”转到“谁能稳供给、稳工作流、稳生态”;二是 agent 提效的瓶颈正从写 prompt 转向写循环、设停机条件、少拥有代码;三是下一波高杠杆数据不只…
从 REINFORCE 的"数据用一次就作废"出发,一步步推出 PPO 训练循环的全部部件——重要性采样比率、clip、critic、GAE、多 epoch 复用——再落到 RLHF 的四模型循环。读完你能口述一次 PPO 迭代的每个阶段,以及每个阶段为什么非存在不可。
上一篇 Big-O 深读的陪读篇。用折纸、猜数字、握手、排队照相六个能手算的真问题,把指数、对数、求和、阶乘、递推式、「阶」的眼镜逐件装好,每件工具讲完立刻回扣原文公式。读完这篇再回去,那些公式会自己开口说话。
Codex 真读真写 · 深读判断 / 论文雷达 / 工具 / 行动。这是 Codex 深读版。今天最值得形成的判断不是“谁又发了一个更大的模型”,而是前沿竞争正在转向效率栈、数据生产栈和 agent 运行时三条系统能力:Kimi K3 把开源前沿继续往前推,Lila 把实验室当成数据中心来制造可验证训练数据,vLL…
2026 年 7 月,"GPT-5.6 一小时证明循环双覆盖猜想"刷屏短视频。事实核查:事件为真,但"证明了"三个字说早了——现在的准确状态是"机器生成了一份证明,人类正在核验"。这篇先用能手画的小例子讲透这个 50 年悬案本身(圈、桥、snark),再逐页拆 OpenAI 发布的两份一手 PDF:3 页的证明走了哪四步,那份比证明更值得读的 2 页提示词里藏着哪些多代理工程设计。结尾是一张"视频说法 vs 核实结果"对照表,以及一个漂亮的对偶:费马大定理是人类已证、等机器核验;这次是机器生成、等人类核验。
拆解 Claude Code / Codex 的代码检索机制:为什么两家都放弃了向量索引式 RAG,改用 agentic search(grep + 模型闭环);Fetch 工具到底是干什么的;以及 arXiv 论文链条给出的证据与边界。
前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天读完 24 条候选、拿到 23 条正文后,最值得提前建立判断的不是又一个模型 headline,而是三条更耐久的线索:开源 MoE 正在从“更便宜”转向“更强但更贵”;科研和工业都在把 memory、planning、data pi…
Codex 真读真写 · 今天先读/论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词拼装。今天最值得记录的不是单条新闻,而是三条更耐久的工程信号正在收敛:AI 工程的重心从模型本体转向 harness、loop 和 eval;代理开始需要按任务复杂度控制执行范围,而不是默认全仓审计;设备侧与本地化代…
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天先读完 25 条原文后,我认为最值得抓住的不是某一个模型 headline,而是四条线同时变清楚了:模型正在从“单点能力”变成“路由与预算系统”,评估正在从最终分数转向过程与偏差机制,记忆与技能正在被包装成可迁移资产,agent 安…
从语法树构图、跨文件消歧和图遍历查询,到 Skill、AGENTS.md、CLI 与 MCP 接入,讲清 Graphify 如何在构图期与任务运行期分配 LLM 职责。
用一次 llama-cli 采样实验讲清 logits、softmax、temperature、top-k 和 top-p 的真实作用。
深读 Externalization、Toolformer、TInR、RISE、Agent Skills 等论文:哪些 Agent 外部系统会被模型内化,哪些不会,未来研发竞争力会迁移到哪里。
拆开一次 Agent 工具调用:模型只提出结构化调用意图,运行时负责校验、执行和回填;MCP 标准化外部能力,Skill 标准化可复用工作流。
从 Git 原理、AI agent 并行任务、hotfix、PR review、命令用法和常见坑出发,讲清 git worktree 解决的真实问题。
从 Euclid、Euler、Gauss、Riemann、Noether、Poincare、Hilbert、Grothendieck、von Neumann、Ramanujan 和 Tao 的思维动作里,提炼一条适合 AI Infra 学习者的数学探索路径。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。今天最值得调整的判断,不是又一个模型名次变化,而是 agent 已经开始同时侵入研发生产函数和基础设施设计:上游是 Fable 写 GPU kernel、AtCoder 竞赛表现、Remote Labor Index 这类能力信号,下游…
深读 Import AI 464:从 Fable 的 KernelBench-Mega 结果出发,串起 GPU kernel、远程数字劳动、OSWorld 2.0、企业知识系统和 AI 研发自动化的真实边界。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版:我先抓取 source pack,再逐篇阅读原文摘录,并用 `publish-to-lei-blog` 的“质量十大思维”做了一轮审稿。今天的主线是:AI 能力正在从“模型会不会”下沉到“harness、sandbox、数据系统、推理栈…
消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。
消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。
消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。我先读了 9 个渠道的 23 篇原文包,今天最值得你投入注意力的不是又一个模型名,而是三条更硬的信号:验证正在成为 agent 能力的新缩放轴;弱模型上的 RL 成果开始有机会迁移到更强模型;内容站点已经开始把 agent 抓取当成独立…
基于 OpenAI 公开 AI Infra 相关岗位描述,按训练、推理、数据、GPU 集群、可靠性、评测发布、Agent Infra、安全和开发效率拆解 AI Infra 工程师每天实际做什么,并映射到个人学习路线。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版:我先抓取 source pack,再逐篇阅读原文摘录后重写判断。今天最值得放进脑子的主线是:agent 不再只是“会调用工具的模型”,而是在逼工程体系补上运行时、权限、验证、成本和产品界面这几块短板。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词卡。今天先读 26 篇候选、24 篇正文后,我的主判断是:Agent 的竞争正在从“谁回答得更好”转向“谁能被当作软件运行”。这意味着评测要看预算曲线,安全要在线监控,隐私删除要能定位到参数,工具链要补齐技能、沙箱、可恢复执行…
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 25 条高信号内容生成。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词卡。今天先读 24 篇候选、23 篇正文后,我更看重四条主线:Agent 竞争从模型能力转向反馈回路;推理架构开始重写多线程协作方式;企业真正缺的是把 AI 嵌进交付链路的人与流程;安全执行环境、技能包与网关正在成为开发者基础…
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 37 条高信号内容生成。
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 20 条高信号内容生成。