全部专题

Reading path

工具与自动化

围绕个人效率、桌面工具、自动简报、发布流程和开发者体验,沉淀能长期复用的工作台。

34 篇文章

Archive

专题归档

第 1 / 2 页

Codex 怎样接进公司的评测链路:先摆正 Langfuse 与 Inspect AI 的坐标

「让 Codex 集成 Langfuse 做 Inspect AI 评测」这句话把两个不在同一节点的组件当成了需要搭桥的对等系统。翻开本站评测路由系列的施工图:Langfuse 是 Trace 节点(M5),Inspect AI 是评测执行引擎(M8),中间隔着数据集(M6)。这篇把 Codex 放回这条「请求→路由→Trace→评测→策略」的闭环里,讲清它从哪个节点进场、trace 走哪两条路、以及它同时是 trace 生产者又是被评对象。

把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律

一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。

把指标写成条款:解剖一份单机高可用 ADR 的八个可靠性决定

上一篇把 SLO/RTO/RPO 理成三族刻度,这一篇拿一份刚评审通过的真实 ADR(一个 LLM 网关+在线路由+评测平台的单机生产高可用基线)当标本,看抽象指标怎么被写成具体条款。逐条解剖八个决定,每条给出条款要点→背后概念→源头论文/实践→定价解读:故障域声明(承保范围先于保额,拒绝伪分布式集群=拒绝为范围外风险付保费)、SLO 分级与排除条款(数据面 99.9% 高于控制面 99.5%,与 AWS Builders 库"数据面可用性目标高于控制面"同构)、两档 RTO(自动 2 分钟/人工 15 分钟,43.2 分钟月预算亲手验算出 21 次 vs 2.88 次的自动化边界,理论根基 Crash-Only Software HotOS 2003)、RPO 向量(崩溃 RPO=0 靠持久卷、逻辑误删 RPO≤24h 靠逻辑备份——RPO 是按故障类型索引的向量不是标量)、静态稳定性(热路径进程内不可变快照+last-known-good,控制面故障不得中断数据面,AWS 双模行为反模式)、租约+fencing token+幂等(Leases SOSP 1989 + Kleppmann 2016,exactly-once 投递不存在)、canary 状态机(shadow→canary→active+指标门禁+自动回滚,SRE Workbook 第 16 章,active 是不可逆跃迁点)、恢复演练即发布门禁(Chaos Engineering IEEE Software 2016,未演练的备份等于没有备份)。元规律「指标向量化定律」:外行给系统一个可靠性数字,工程师给每类故障各一个数字——可靠性设计的成熟度=指标从标量分解为按故障类型索引的向量的程度;ADR 的本质是保险合同:故障域是承保范围,指标是保额,架构是保费,排除条款是让承诺可兑现的那部分。

评测平台产品化:接口清单、开源底座与前端模块——平台管自动化,用户管场景

评测路由系列第五篇:把评测系统从「自己搭给自己用」升级成「全公司业务团队自助使用的平台」。一条分界判据(换一个业务方要不要重做)切出平台与用户的责任边界;七组后端 API 端点清单(场景/评分器/运行/模型/报告/集成/标签与路由供给,每个端点标注它传递的是场景知识还是自动化);LLM-as-judge 的五元组定义与平台强制的裁判三纪律(钉版本/换位/避自家,校准不达标即拦截);开源底座对比(Langfuse MIT / Opik Apache-2.0 / Phoenix ELv2 + Inspect AI 执行引擎);前端八模块含裁判校准中心;15 分钟自助用户旅程时序图与三阶段落地顺序。

深度解读 Anthropic 内容安全策略:一份宪法的五次编译

从 Usage Policy 到 Claude 宪法、Constitutional AI 训练、Constitutional Classifiers 运行时防御、RSP/ASL 升级协议,再到 Clio 遥测闭环——Anthropic 的内容安全不是一份禁止清单,而是把同一份自然语言规约"编译"到系统五个层次的纵深栈。这篇结合官方文档与四篇 arXiv 论文拆它的第一性原理:为什么规则要写给模型自己读、安全如何被标上价格(拒答率 + 推理开销)、以及"让 AI 监督 AI"这个赌注的收益与脆弱处。

记忆的内化:Metis 把 Agent 记忆从提示词搬进前向计算

做出外挂记忆操作系统 MemOS 的 MemTensor 团队,自己发布了外挂路线的'反面':Metis(arXiv:2607.26760),第一个把记忆做成原生能力的基础模型——记忆不再是数据库+检索+拼提示词,而是一块随对话演化的参数状态:写入靠前向计算,读取靠 memory attention,全程没有一次反向传播。本文沿论文的三轴对比(架构、优化、效率)拆它的设计,再用诚实的数字给它定位:原生记忆今天的处境,约等于 LRM 出现之前的推理。

进程边界是部署决策,不是架构决策:桌面 Agent 运行时的三条路

桌面应用要在本地跑长时 Agent 任务时,运行时放哪里?内嵌 Clean Runtime Kernel、独立 Local Runtime Daemon、还是前端主导派发?系统对比三条路径,拆解 Run Journal、Event Outbox、租约、启动恢复四个本地高可用机制,并论证一个反直觉的结论:先把内核做干净,进程边界就可以推迟——daemon 解决的是进程隔离,而你真正要的是生命周期解耦加可恢复性,这两样不需要独立进程也能拿到。

别把批处理器当交互后端:解剖一条 codex exec 冷启动链

一个 Tauri 桌面应用把 codex exec 用作本地 AI 执行后端,每个任务都要冷启动整条链:Node harness、run-scoped CODEX_HOME、MCP server、进程级 hook、workspace 物化、依赖预热。慢的根因不是模型,而是三种天然生命周期不同的东西被焊死在同一个进程生命周期上。本文给出完整的成本解剖、两个容易被忽略的反模式(双重观测、per-run store 打败内容寻址缓存),以及从 batch executor 迁移到常驻 runtime 的架构路线——包括为什么"审计性应该来自事件日志而不是进程短命"。

给「物料搭建 + 还原业务逻辑」设计一套 AI Harness

前两篇讲了设计稿出码的难题和物料驱动搭建的问题地图。这一篇动手:从「AI 可被控制、可被配置的切面」出发,设计一套能真正跑起来的搭建 harness——用一条「逐步降低不确定性」的窄专家流水线,每步产出可校验的 typed artifact,把 skill.md / tool schema / MCP / 结构化输出 / 编排 / 校验门 / 人机门 当成控制阀装上去。含可直接参考的 SKILL.md、工具契约、IR schema 与编排流程图。

物料驱动的页面搭建:一份提前避坑的问题地图

如果不走「设计稿端到端出码」,而是先沉淀高还原物料、再组合搭建页面——这条路会撞上哪些问题?本文用「一个活页面 = 5 层」的心智模型做主线,尽可能穷举物料设计、匹配、布局、业务逻辑、工程化到度量的全部坑点,并收敛到一个反直觉的结论:搭建范式的命门不是物料好不好看,而是「业务逻辑既不在设计稿也不在物料里」。

物料搭建 × AI Harness:一套完整表达生产级页面的协议族设计

本系列的规范篇。为「基于物料的 UI 还原 + AI Harness 控制的业务逻辑还原」这套架构,负责任地穷举出需要的全部协议/Schema——分六层、23 个协议,共享一个 Envelope、彼此用 id 交叉引用,逐一给出结构、关键字段与含义。目标是让这套协议族能完整表达复杂场景与真实应用页面,逼近生产运行表现;同时诚实标注它的边界与未解难点。