Ego Lite 的关键不是会点网页,而是把浏览器变成 Agent 的共享运行时
从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。
Start here
从 ego-lite 的 README、官网文档和 ego-browser 源码看它的真正原理:浏览器保存登录态和任务空间,agent 只提交 JavaScript 片段,helper runtime 通过 globalThis.ego、CDP、Snapshot 和 Task Spaces 把网页变成可编程环境。
从 MCP 入口、Tree-sitter 抽取、Hybrid LSP、graph buffer、SQLite/FTS5 和增量索引读懂 codebase-memory-mcp 的实现原理。
从 grammar DSL、parse table 生成、C runtime、GLR stack、增量重解析和 query VM 读懂 tree-sitter 的实现原理。
前端建立在"界面由人写、给人看"两个隐含假设上,大模型正在同时拆除它们。结合 Design2Code、Agentic Web、Generative UI 等十余篇论文,推演前端各领域与工程化的整改趋势。
Archive
我实际走查 Shiplight 官网、67 个文档入口、公开 Agent Skill、npm 包与 Trust Center,拆开它的 MCP 浏览器、YAML 意图层、Playwright 执行层、Action Cache、自愈、CI 归因和云端商业飞轮,并给出一条不照抄产品表面的 clean-room 自研路线。
门禁的一等用户正从人变成 Agent。本文从产品与链路视角给出面向 Agent 的门禁体系:变更全生命周期时序图、六层架构、七个领域对象、判决 schema 与状态机、三条防 Agent 钻空子的规则,并以 Shiplight 为参照指出它做对与缺失之处。
评测与门禁共用「资产/目标/Runner」骨架,却在 oracle 处分叉:门禁靠确定性规格,评测靠采样式裁判。本文补齐门禁六元组,每格配开源底座(Playwright、Midscene、Testcontainers、Pact、Argo Rollouts、promptfoo),附伪代码与 Wilson 下界手算。
从一次 Playwright MCP 的锁冲突翻车讲起,用「浏览器的第二用户是谁」这条约束把 11 款产品串成五代演进:传统开发者工具、LLM 决策层、像素级 GUI Agent、云端浏览器基础设施、双用户浏览器;辅以 arXiv 论文与本机字节实测。
沿着 Midscene 从 1.0 前 DOM+LLM 标注到 1.0 后纯 VLM 视觉定位的演进,用决策地图拆解六个关键选择:定位方式、模型分工、Instant Actions、Deep Think、跨平台统一 API、开源模型自托管。看清哪些是被 VLM 能力硬约束推出来的,哪些只是产品化包装。
「让 Codex 集成 Langfuse 做 Inspect AI 评测」这句话把两个不在同一节点的组件当成了需要搭桥的对等系统。翻开本站评测路由系列的施工图:Langfuse 是 Trace 节点(M5),Inspect AI 是评测执行引擎(M8),中间隔着数据集(M6)。这篇把 Codex 放回这条「请求→路由→Trace→评测→策略」的闭环里,讲清它从哪个节点进场、trace 走哪两条路、以及它同时是 trace 生产者又是被评对象。
一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。
上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。
评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。
把 ChatGPT 发布至今的三年半压缩成一张可跳转的时间轴:四次范式接力(对齐→效率→推理→智能体)× 五条暗线(对齐方法、稀疏化、算力搬家、开源时差、接口标准化)。全部 17 个 arXiv ID 经 API 逐一核实,2025 下半年之后的产品日期逐条回查过来源,文末附一条可复现的核实命令。
从 Usage Policy 到 Claude 宪法、Constitutional AI 训练、Constitutional Classifiers 运行时防御、RSP/ASL 升级协议,再到 Clio 遥测闭环——Anthropic 的内容安全不是一份禁止清单,而是把同一份自然语言规约"编译"到系统五个层次的纵深栈。这篇结合官方文档与四篇 arXiv 论文拆它的第一性原理:为什么规则要写给模型自己读、安全如何被标上价格(拒答率 + 推理开销)、以及"让 AI 监督 AI"这个赌注的收益与脆弱处。
做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。
系统拆解 Browser Agent 的控制通道与页面表示:比较 HTTP/API、WebDriver、Playwright、DOM、Accessibility Tree、CDP、浏览器扩展、视觉坐标和 Agent-aware browser runtime,并结合论文讨论评测、安全与选型。
从一条 macOS UI 探测命令出发,解释大模型如何观察、定位、操作并验证桌面软件,比较 Accessibility Tree、视觉坐标、DOM、API/CLI 与混合控制的取舍和局限。
从 SparseSpec-L(arXiv 2607.27735)的加速公式 S=(αk+1)/(kγ+1) 出发,算清投机解码的三变量账本:为什么 Eagle-3 这样的短上下文冠军在 60K 上下文会跌破 1×,为什么"效率反转"的判据是 α 与 γ 的赛跑,以及"可召回的淘汰"如何把 γ、α、k 三个变量同时做对。接续 Medusa 深读与 vLLM KV cache 系列。
桌面应用要在本地跑长时 Agent 任务时,运行时放哪里?内嵌 Clean Runtime Kernel、独立 Local Runtime Daemon、还是前端主导派发?系统对比三条路径,拆解 Run Journal、Event Outbox、租约、启动恢复四个本地高可用机制,并论证一个反直觉的结论:先把内核做干净,进程边界就可以推迟——daemon 解决的是进程隔离,而你真正要的是生命周期解耦加可恢复性,这两样不需要独立进程也能拿到。
一个 Tauri 桌面应用把 codex exec 用作本地 AI 执行后端,每个任务都要冷启动整条链:Node harness、run-scoped CODEX_HOME、MCP server、进程级 hook、workspace 物化、依赖预热。慢的根因不是模型,而是三种天然生命周期不同的东西被焊死在同一个进程生命周期上。本文给出完整的成本解剖、两个容易被忽略的反模式(双重观测、per-run store 打败内容寻址缓存),以及从 batch executor 迁移到常驻 runtime 的架构路线——包括为什么"审计性应该来自事件日志而不是进程短命"。
基于本机 codex-cli 0.144.6 的 --help 实测,把 codex exec 全部参数整理成五个控制面:输入、执行者、行为配置、权限边界、输出与会话,并给出可直接复制的自动化配方。
从 vLLM 的 OpenAIServingChat 源码看懂 /v1/chat/completions 的服务编排:chat template 渲染、SamplingParams 构造、EngineClient.generate、streaming SSE、tool/reasoning parser、usage、metrics 和 KV transfer cleanup。
从 REINFORCE 的"数据用一次就作废"出发,一步步推出 PPO 训练循环的全部部件——重要性采样比率、clip、critic、GAE、多 epoch 复用——再落到 RLHF 的四模型循环。读完你能口述一次 PPO 迭代的每个阶段,以及每个阶段为什么非存在不可。
Codex 真读真写 · 深读判断 / 论文雷达 / 工具 / 行动。这是 Codex 深读版。今天最值得形成的判断不是“谁又发了一个更大的模型”,而是前沿竞争正在转向效率栈、数据生产栈和 agent 运行时三条系统能力:Kimi K3 把开源前沿继续往前推,Lila 把实验室当成数据中心来制造可验证训练数据,vLL…
前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。
如果不走「设计稿端到端出码」,而是先沉淀高还原物料、再组合搭建页面——这条路会撞上哪些问题?本文用「一个活页面 = 5 层」的心智模型做主线,尽可能穷举物料设计、匹配、布局、业务逻辑、工程化到度量的全部坑点,并收敛到一个反直觉的结论:搭建范式的命门不是物料好不好看,而是「业务逻辑既不在设计稿也不在物料里」。
本系列的规范篇。为「基于物料的 UI 还原 + AI Harness 控制的业务逻辑还原」这套架构,负责任地穷举出需要的全部协议/Schema——分六层、23 个协议,共享一个 Envelope、彼此用 id 交叉引用,逐一给出结构、关键字段与含义。目标是让这套协议族能完整表达复杂场景与真实应用页面,逼近生产运行表现;同时诚实标注它的边界与未解难点。