Midscene.js 全景拆解:从 DOM 标注到纯 VLM,一个 GUI Agent 的六个设计决策
沿着 Midscene 从 1.0 前 DOM+LLM 标注到 1.0 后纯 VLM 视觉定位的演进,用决策地图拆解六个关键选择:定位方式、模型分工、Instant Actions、Deep Think、跨平台统一 API、开源模型自托管。看清哪些是被 VLM 能力硬约束推出来的,哪些只是产品化包装。
Archive
沿着 Midscene 从 1.0 前 DOM+LLM 标注到 1.0 后纯 VLM 视觉定位的演进,用决策地图拆解六个关键选择:定位方式、模型分工、Instant Actions、Deep Think、跨平台统一 API、开源模型自托管。看清哪些是被 VLM 能力硬约束推出来的,哪些只是产品化包装。
ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。
ACE 论文的 AppWorld 日志里有一处最该被记住的数字:第 60 步上下文 18,282 token、准确率 66.7;第 61 步模型重写了一次自己的经验手册,上下文只剩 122 token,准确率掉到 57.1——比完全不自我改进的 63.7 还低。不重载、不动权重、人不介入的自我提升不是一个开关,它有三个决定生死的设计选择:可变对象的粒度、写入权归谁、验证信号从哪来。这篇结合 ACE、ReasoningBank、Gödel Agent、Darwin Gödel Machine、Training-Free GRPO 等论文的原文数字,把这三个选择拆开。
ENPIRE 让 Codex / Claude Code / Kimi Code 无人监督地把八台机器人训到 99% 成功率。但论文里最值钱的不是这个数字,而是一处失败:三个 agent 都在仿真里解出了 Push-T,真机上两个失败了。退化发生在 agent 的科研能力上,不在策略上——这意味着所有在确定性基底上测出的「自我改进能力」都可能被高估。
模型很容易开始行动,却常把“做过了”误判成“做完了”。本文把 Agent 的完成条件拆成目标、世界状态、证据和边界,解释如何用终态协议区分继续、完成与受阻。
一次模型调用结束后,刚才那个“它”已经消失。本文从记忆、权限、承诺和审计四本账出发,解释 Agent 如何跨会话、模型升级与子任务分叉维持可验证的身份连续性。
把 pi.dev 的发布包(0.84.4)拆开量了三个数字:默认系统提示词约两千字符、其中 53%–59% 是「pi 自己的文档在哪」、官方声称「没做」的权限弹窗在示例目录里是一个 34 行的扩展。极简不是审美,是预算腾挪——腾出的位置用来让 harness 变成 agent 可读可改的对象。
深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。
结合 ECBD、CheckList、Dynabench、SWE-bench 与 LiveBench,建立一套判断 LLM/Agent 评测样本是否有效、可判、可复现、能区分且不过期的工程框架。
用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。
ECC(Everything Claude Code)是 MIT 协议的 Claude Code 插件仓库。它把 plan → test → implement → review → verify → remember → improve 这条工作流固化成 68 个 agent、286 个 skill、94 个命令和一套 hook。读这个仓库不是读框架源码,是读一份被具体化到文件的 harness 意见:每一种日用 agent 编程会踩到的失败模式,都对应一件可 install 的东西。
深读 Latent Space 2026-08-22 那篇《The Evolution of the Agent Harness》。Dan McAteer 用一张"模型能力曲线 × harness 需求曲线"的几何图,把 2022 年 ReAct 到 2025 年 Claude Code 的四段演化串起来,并给出一个我认为值得记住的赌注:随着 harness 能力被 RL 吸收进权重、被工程师从提示词里删除,剩下的会是一层「模型给人套上的挽具」——attention-interface。这篇不做摘要,做消化:把文章的核心几何、数字锚点、可疑点、以及和本站已有 harness 谱系的对接,全部拆到能被下一篇引用的粒度。
既有的 Agent 工程决策地图有六个决策点,但都没回答一个问题:一条业务流程该住在哪里?代码里(LangGraph/CrewAI,29 万 star)、前沿模型的 system prompt 里(Anthropic Building Effective Agents 推荐)、外部技能库里(Voyager 风格)——都是把 procedure 摆在模型外面。arXiv 2605.22502 补上第四把椅子:用 Claude Sonnet 4.5 遍历流程图生成 3000–6000 条合成对话,对 Qwen3-8B 做全量微调(LoRA 明确失败),把流程编译进权重变成 subterranean agent。三个实测领域:旅游预订 14 节点、Zoom 支持 14 节点、保险理赔 55 节点 6 决策枢纽。结果:单次会话比 in-context 便宜 128–462×,比 LangGraph 便宜 77–249×;质量达 in-context 前沿的 87–98%;保险和旅游任务失败率反而比 LangGraph orchestrator 更低(9% vs 17%、5.5% vs 24%);重新编译 30–50 分钟就是一次 CI/CD。这篇把它接进 Agent 决策地图的第七个位置,解释为什么 8B 能打赢 Claude 4.5 + LangGraph,以及这条路为什么不是在反苦涩教训,反而是苦涩教训吃掉 orchestrator。
主篇给了 arXiv 2605.22502 的整套数字(128–462× 便宜、8B 打过 Claude 4.5 + LangGraph),但真正在 A100 上复现 8B 版本对读者门槛太高。这篇把管线缩到 8GB 消费级显存能跑的版本:5 节点日报归档流程 → 用 Claude Sonnet 4.5 合成 200 条对话(约 $1.70)→ Qwen2.5-0.5B 全量微调(bfloat16,~7GB 显存,M2 Pro 15 分钟)→ 对照 Claude API in-context。每一步给完整可跑代码、显存/时间/成本手算数字、以及一份 12 项自检清单。诚实标注:我没有实机跑完全流程,给出的数字是官方规格+手算估计,读者跑通请回来纠正。
「让 Codex 集成 Langfuse 做 Inspect AI 评测」这句话把两个不在同一节点的组件当成了需要搭桥的对等系统。翻开本站评测路由系列的施工图:Langfuse 是 Trace 节点(M5),Inspect AI 是评测执行引擎(M8),中间隔着数据集(M6)。这篇把 Codex 放回这条「请求→路由→Trace→评测→策略」的闭环里,讲清它从哪个节点进场、trace 走哪两条路、以及它同时是 trace 生产者又是被评对象。
克隆火山引擎开源的 OpenViking(Self-evolving Context Database),对照文档精读核心源码。它的全部设计可以压成三次「换表示」:把记忆/知识/技能统一成一个 viking:// 文件系统、把内容压成 L0/L1/L2 三层分辨率、把经验目录当成可优化的策略集并用「语义梯度」更新。这篇按写入、检索、进化三条路径逐一对照代码,最后用官方 benchmark 数字划清「已验证」和「未复现」的边界。
Astro 创始人 Fred Schott 的开源 TypeScript agent 框架 Flue 发布 2.0,首个稳定版的地基是 React 风格的 Agent Hooks:agent 函数在每次模型调用前重跑一遍,hooks 声明本回合的能力清单。深读它对着的根本约束(能力集合随会话状态变化,静态配置表达不了)、与 React 的一处关键差异(资源钩子允许条件调用)、以及与 DeepSeek dsh 的谱系对照:重算 vs 撤销,是可组合性的两条路线。
一篇 2026 年 3 月的计算机体系结构立场论文,把多 Agent 系统的记忆管理拆成 I/O / Cache / Memory 三层,指出两个协议缺口(跨 Agent 缓存共享、结构化访问控制),并把核心难题钉在"内存一致性"上——这篇把它和本站已有的三篇"Agent=操作系统"文章接起来,看这个类比在哪里站得住、在哪里第一次真正碰壁。
一位读者看完 Prime Agent「唯一工具是 Python 解释器」的设计后问:这是不是意味着推理转向程序?回查四年论文链(PAL/PoT → CodeAct → RLM)后我的答案是:对了一半。转成程序的不是推理,而是「算、做、记」三件事的执行权;语言仍然负责想。这篇给出谱系、边界和五个可证伪的推演。
DeepSeek 于 2026-08-13 以 MIT 协议开源 agent harness「dsh」。深读其架构(turn/step 事件模型、会话日志唯一事实源、能力接缝、profile 配置分层)与理论底座 Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》:可撤销效应 + 反应式余效应 + 合流定理,把「热替换插件不炸」从工程纪律升格为数学性质。附与 SWE-agent、Claude Code、Prime Agent 的谱系对照。
深度解读 Datawhale 开源书《Hello-Agents 从零开始构建智能体》(V1.0.3,720 页 16 章):ReAct 循环先活在提示词里(第四章三大范式),再固化成框架代码(第七章 HelloAgents 自研框架的"万物皆为工具"),最后被 GRPO 训进模型权重(第十一章,Qwen3-0.6B 在 GSM8K 上 5%→40-50%→60-70%)——评估(第十二章)则是跨载体的账本。附全书地图、GRPO/PPO 对照、记忆评分公式与已核实的论文清单。
深度解读李博杰《深入理解 AI Agent:设计原理与工程实践》(v1.1,307 页):一个公式(Agent = LLM + 上下文 + 工具)、一条机制假设(上下文学习≈检索而非推理),推出全书几乎所有反直觉工程结论——状态栏让弱模型准确率涨 40-54 个百分点、系统提示词里一个时间戳让 TTFT 从 0.5s 涨到 3-5s、状态栏没覆盖的维度准确率从 100% 塌到 7.6%、RLVP 用"不对称验证器"补 GRPO 的方差、多 Agent 唯一有效判据是"是否引入生成时不存在的新信息"。
基于 Prime Agent 主干源码 commit 965941c 的深读:默认工具列表里只有 ["ipython"]——读文件、改代码、开子代理、管记忆全是 Python 表达式。结合 RLM 论文(arXiv 2512.24601)与 Continual Harness 论文(arXiv 2605.09998),看"上下文变成变量、经验变成账本"这两步棋怎么在源码里落地:dill 快照、控制信道防死锁、只许 CRUD 的自我改进、以及 Factorio 里当场翻车的 reward hacking。
Codex 真读真写 · 方向 / 判断 / 技能 / 工具 / 行动。这是 Codex 深读版。今天最值得关注的不是又多了几个模型名词,而是 agent 系统已经从“会不会调工具”进入“能不能长期运行、互相通信、被验证、被约束”的阶段;与此同时,开源本地模型、评测框架和训练数据清洗都在往更可落地的系统能力收敛。