2026年8月31日pi 的系统提示词有一半以上在教模型改造 pi 自己:一次极简 harness 的开箱实测把 pi.dev 的发布包(0.84.4)拆开量了三个数字:默认系统提示词约两千字符、其中 53%–59% 是「pi 自己的文档在哪」、官方声称「没做」的权限弹窗在示例目录里是一个 34 行的扩展。极简不是审美,是预算腾挪——腾出的位置用来让 harness 变成 agent 可读可改的对象。AILLMAgentAgent 工程工程实践
2026年8月27日扩散模型说人话:从擦掉噪点到造出新东西"加噪再去噪"这句话解释不了最关键的一件事:去噪只是把脏图擦干净,怎么能擦出一张从来不存在的图?这篇用一个不装任何库、复制就能跑的一维小例子讲透。AILLM零基础
2026年8月27日自回归不是物理定律:扩散语言模型买到了什么,亏在哪里从左往右生成不是语言的性质,而是一个可以被换掉的建模选择。这篇把投机解码与扩散语言模型放进同一个框架,手算清楚扩散省下的步数是从哪儿借的,再用 Gemini Diffusion 官方评测表验证这笔账。AILLM论文深读
2026年8月27日我把 Claude Code 的模型换成了扩散模型:28 次运行全过,但它的卖点花不出去把 Claude Code 的模型后端换成 Inception 的 Mercury 2 扩散模型,跑 9 个带隐藏测试的编码任务、共 28 次运行全过。真正的发现是一笔账:agent 负载的输入输出比是 82:1,输出侧只占总成本 4.2%——扩散优化的那一侧,在这里花不出去。AIAgentLLM工程实践
2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月26日什么是一个好的评测样本?不是一道难题,而是一份决策证据结合 ECBD、CheckList、Dynabench、SWE-bench 与 LiveBench,建立一套判断 LLM/Agent 评测样本是否有效、可判、可复现、能区分且不过期的工程框架。AILLM评测AgentAI Infra论文深读
2026年8月25日会用 Coding Agent,不等于会做 AI Engineering:四项差距能力与训练法用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。AIAgent 工程评测工程实践系统设计
2026年8月25日读 ECC:一个仓库把 Claude Code 的 harness 意见装箱发货ECC(Everything Claude Code)是 MIT 协议的 Claude Code 插件仓库。它把 plan → test → implement → review → verify → remember → improve 这条工作流固化成 68 个 agent、286 个 skill、94 个命令和一套 hook。读这个仓库不是读框架源码,是读一份被具体化到文件的 harness 意见:每一种日用 agent 编程会踩到的失败模式,都对应一件可 install 的东西。AILLMAgentAgent 工程上下文工程
2026年8月25日在 AI 时代胜人一筹:杠杆不在模型多强,而在你和模型之间那道界面2005 年一对业余棋手加三台普通电脑,打败了大师加超算——卡斯帕罗夫由此提炼出"弱人类+机器+更好的流程"能赢。结合 Kasparov 定律、Bainbridge《自动化的反讽》、METR 实测 -19% 的 RCT,用一个能手算的 Amdahl 式杠杆公式说清:人机协作的胜负不在谁强,而在两者之间那道界面的质量。AIAgent 工程上下文工程工程实践自动化
2026年8月24日harness 会被模型吃掉:attention-interface 与 agent 演化的两条曲线深读 Latent Space 2026-08-22 那篇《The Evolution of the Agent Harness》。Dan McAteer 用一张"模型能力曲线 × harness 需求曲线"的几何图,把 2022 年 ReAct 到 2025 年 Claude Code 的四段演化串起来,并给出一个我认为值得记住的赌注:随着 harness 能力被 RL 吸收进权重、被工程师从提示词里删除,剩下的会是一层「模型给人套上的挽具」——attention-interface。这篇不做摘要,做消化:把文章的核心几何、数字锚点、可疑点、以及和本站已有 harness 谱系的对接,全部拆到能被下一篇引用的粒度。AILLMAgentAgent 工程论文深读
2026年8月24日顶级模型"卖不动"是误读:Ramp 数据里同厂之间的信任积攒深读 Simon Willison 2026-08-23 那篇转引 FT 报导 + Ramp AI index 的短博客。表面结论是"Anthropic 最贵的 Opus 5 只占同厂花费 3.5%,Opus 4.8 占 28%",但把家族聚合起来看,Opus 系仍占 40.8%——只是集中在上一代旗舰上。真正的信号不是"贵的没人要",是**用户在给"累积过工程投入的模型"投票**:老模型有 SDK、prompt 库、评测、KV 缓存、组织 runbook,新模型这一切都是 0。这是昨天那篇《合成前沿》里"10% 更差、100x 便宜"在市场端的第二个投影:同厂内也在验证同一条经济逻辑。AILLM评测工程实践
2026年8月24日过程知识住在哪里?——Agent 编排的第四把交椅:编译进 8B 权重既有的 Agent 工程决策地图有六个决策点,但都没回答一个问题:一条业务流程该住在哪里?代码里(LangGraph/CrewAI,29 万 star)、前沿模型的 system prompt 里(Anthropic Building Effective Agents 推荐)、外部技能库里(Voyager 风格)——都是把 procedure 摆在模型外面。arXiv 2605.22502 补上第四把椅子:用 Claude Sonnet 4.5 遍历流程图生成 3000–6000 条合成对话,对 Qwen3-8B 做全量微调(LoRA 明确失败),把流程编译进权重变成 subterranean agent。三个实测领域:旅游预订 14 节点、Zoom 支持 14 节点、保险理赔 55 节点 6 决策枢纽。结果:单次会话比 in-context 便宜 128–462×,比 LangGraph 便宜 77–249×;质量达 in-context 前沿的 87–98%;保险和旅游任务失败率反而比 LangGraph orchestrator 更低(9% vs 17%、5.5% vs 24%);重新编译 30–50 分钟就是一次 CI/CD。这篇把它接进 Agent 决策地图的第七个位置,解释为什么 8B 能打赢 Claude 4.5 + LangGraph,以及这条路为什么不是在反苦涩教训,反而是苦涩教训吃掉 orchestrator。AILLMAgentAgent 工程论文深读
2026年8月24日手把手把 5 节点流程编译进 0.5B 权重——Subterranean Agent 实操陪读篇主篇给了 arXiv 2605.22502 的整套数字(128–462× 便宜、8B 打过 Claude 4.5 + LangGraph),但真正在 A100 上复现 8B 版本对读者门槛太高。这篇把管线缩到 8GB 消费级显存能跑的版本:5 节点日报归档流程 → 用 Claude Sonnet 4.5 合成 200 条对话(约 $1.70)→ Qwen2.5-0.5B 全量微调(bfloat16,~7GB 显存,M2 Pro 15 分钟)→ 对照 Claude API in-context。每一步给完整可跑代码、显存/时间/成本手算数字、以及一份 12 项自检清单。诚实标注:我没有实机跑完全流程,给出的数字是官方规格+手算估计,读者跑通请回来纠正。AILLMAgentAgent 工程学习笔记
2026年8月24日10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。AILLMAI Infra评测论文深读
2026年8月17日最优解长在一张会动的地图上:把开发者的自我革新当成非平稳搜索问题MCTS 系列续作。上一篇把"学会一个领域"建模成搜索预算分配,这一篇处理更难的题:"成为 AI 时代的佼佼者"是在一张会动的地图上搜索——奖励分布在漂移(METR 的实验结论七个月后被作者自己标为历史快照)、你只有一条不可重置的轨迹、能观测到的全是代理指标。四个搜索领域的现成升级件——折扣战绩(D-UCB/SW-UCB)、受控降温(模拟退火)、生态位精英(MAP-Elites)、防奖励作弊——各修复一个失效假设,最后装回一个每周可跑的操作循环。AI工程实践
2026年8月17日Flue 2.0 深读:能力是状态的函数——Astro 团队把 React 的等式搬进了 AgentAstro 创始人 Fred Schott 的开源 TypeScript agent 框架 Flue 发布 2.0,首个稳定版的地基是 React 风格的 Agent Hooks:agent 函数在每次模型调用前重跑一遍,hooks 声明本回合的能力清单。深读它对着的根本约束(能力集合随会话状态变化,静态配置表达不了)、与 React 的一处关键差异(资源钩子允许条件调用)、以及与 DeepSeek dsh 的谱系对照:重算 vs 撤销,是可组合性的两条路线。AILLMAgent
2026年8月14日DeepSeek Harness 开源了什么:连 Agent Loop 都能拔的插件系统,和给它撑腰的一篇论文DeepSeek 于 2026-08-13 以 MIT 协议开源 agent harness「dsh」。深读其架构(turn/step 事件模型、会话日志唯一事实源、能力接缝、profile 配置分层)与理论底座 Cordis 论文《A Programming Paradigm for Spatiotemporal Composability》:可撤销效应 + 反应式余效应 + 合流定理,把「热替换插件不炸」从工程纪律升格为数学性质。附与 SWE-agent、Claude Code、Prime Agent 的谱系对照。AILLMAgent论文深读
2026年8月12日Agent 不是黑箱,只是少了一台行车记录仪:从 AgentOps 到可诊断智能体结合 AgentOps、Agent 设计模式、MAST、GRADE 与 AgentDebugX 五项研究,解释为什么 Agent 可观测性不能停在 Token、延迟和调用日志,以及如何把目标、计划、工具、依赖、评估和护栏组织成可诊断、可恢复的证据链。AILLMAgent论文深读
2026年8月12日安全策略不是一串 if:Llama Guard 如何把政策变成可编程门卫深读 Llama Guard:它如何把自然语言安全政策、对话角色和生成式分类统一成输入输出双向门禁;拆解 13,997 条数据、反事实式增强、AUPRC 实验、策略迁移,以及生产落地时不能忽略的阈值、注入和权限边界。AILLMAI 安全论文深读
2026年8月11日把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。AILLM评测AI Infra论文深读
2026年8月11日Wilson 下界和它的全家:评测分数的统计地基——分数不是数,是分布评测报告里"5/5 全对"的 95% 置信下界只有 56.6%。以 Wilson 下界为入口,把评测分数背后的整套统计生词(置信区间、配对检验、多重比较、判分者一致性、pass@k 无偏估计、功效分析)钉成四道关卡和一张生词总表,让你以后见到这类词不再发怵。AILLM评测论文深读
2026年8月11日LiteLLM 路由内幕:一行 routing_strategy 如何变成一次具体的模型调用基于 LiteLLM v1.97.0 源码逐行解读模型路由的完整链路:策略字符串怎么被识别成选择器、选择器为什么同时是日志回调、候选部署要过哪十一道漏斗、五种策略各自怎么记账怎么打分、失败怎么触发冷却、重试为什么睡 0 秒——把 config 里那一行配置到一次真实模型调用之间的所有代码打开给你看。AILLMAI Infra源码阅读
2026年8月11日业务评测覆盖地图:模型上线要测的十个格子,和一条「显式空格」定律学术基准回答模型强不强,业务评测回答系统会怎么翻车。借 HELM「先画格子再填数」的方法论,把业务评测拆成答案层、行为层、元层十格,每格给根本问题、源头论文、业务动作与收敛度——空格不可怕,隐形的空格才可怕。AILLM评测AI Infra论文深读
2026年8月11日读懂一张 30B 规格表:Muse Glimmer 把 24GB 显存写成了总纲从 Latent Space 的 AINews 快讯出发,把 Meta Muse Glimmer 30B 的规格表逐行读成一张"消费级显卡预算"的账单:混合注意力 3:1 + GQA 把 128K 上下文的 KV cache 从 104GiB 砍到 1.7GiB(手算核对),三段式蒸馏、按精度损失定价的两档量化、块扩散草稿器 DFlash、为 agent 岗位特训的取舍——每一行背后站一篇可查证的论文。收束成一条元规律:前沿模型是能力定预算,本地模型是预算定架构。AILLMAI Infra论文深读