2026年9月8日面向 Agent 封装业务流程:把状态、约束和判据搬进 schema92% 的官方 MCP 服务器只是端点的薄壳,而写在散文里的参数约束会让 Agent 静默失败、41% 直接对用户说“没有数据”。本文给出一套封装方法:把状态、约束、判据从人脑和界面搬进 schema,按“可回滚的最小承诺单元”重切刀口,并说明新能力具体开在哪四处。AILLMAgentAgent 工程MCP工具调用系统设计
2026年9月8日先测判据,再测 Agent:业务评测样本的构造方法与一次作弊下界实测我按六轴坐标亲手造了 12 条电商售后样本和三代判据,让 5 个不理解业务的确定性作弊脚本去跑:第一版判据被拿到 9/12(75%),12 条样本全部被攻破,加固后降到 1/12。剩下那条是任务效度问题——题面漏了答案,改判据无解。附可复跑代码与判据体检清单。AILLMAgent评测Agent 工程工程实践
2026年9月8日CrewAI、LangGraph、AutoGen 怎么选:从角色分工到可恢复执行深读 Pickaxe 的框架对比,结合 ReAct、AutoGen、MetaGPT 与 MAST 论文,重新理解角色、状态图和对话协议。附 LangGraph 真实进程崩溃实验与上下文成本手算,解释检查点为什么不能单独保证外部动作只执行一次。AIAgent论文深读工程实践
2026年9月8日前沿大模型十家公司在押注什么:2026 年 9 月榜单与技术路线深挖按 Artificial Analysis v4.3 非估算成绩筛出十家模型开发者,核对正式文档、论文与开源交付,拆解长程 Agent、推理经济性、开放基础设施和世界模型四条路线,并附排名复核与成本复算。AILLMAgent论文深读评测
2026年9月8日两个模型之间只差一个旋转:把「隐藏状态直连」拆到根本本机实测:Qwen2.5-7B 读进一个 token 比写出一个便宜 26 倍,而它每个 token 的 KV cache 有 56 KiB,吐出的那个 token 只有 2.15 字节。这两个数字就是「让模型跳过文本、直接传隐藏状态」的全部动机。本文把这条路拆到根本:为什么表示空间的坐标系是任意的、为什么两个独立训练的模型之间的映射恰好是一个正交变换(附本机 Procrustes 实验:d 维旋转需要且只需要 d 对锚点)、桥能装在哪三个位置、以及连续通道会把人名和数字弄丢这个真实代价。顺带核实了 Mostik 那条 GLM→Qwen 新闻里哪几句站得住。AILLMAI Infra论文深读系统设计
2026年9月8日大模型多试几次,为什么反而选错了?从可验证奖励到环境工程在一个可复现的排序实验里,把候选数从 8 增到 32,验收通过率升到 99.99%,真正交付正确答案的概率却从 56.33% 跌到 19.36%。结合 SWE-smith、EnvHarness 与环境演化研究,拆开生成、验证和选择之间的关系。AILLMAgent评测
2026年9月7日把"判断"从模型手里再拿走一次:2026 年前沿在 Harness 上玩出的三条物理化战线从 Anthropic 用 Dynamic Workflows 把 Bun 从 53 万行 Zig 重写成 75 万行 Rust(11 天、64 个 Agent 并行、$165,000)说起,拆解 2026 年下半年前沿 harness 玩法收敛到的三条战线:控制流从模型决定变成脚本决定(Claude Code Dynamic Workflows / LangGraph / CrewAI)、隔离从约定变成文件系统原语(Cursor、Codex 生态的 worktrunk/oh-my-codex、Zed、Grok Build 各自的取舍)、验证从自评变成角色对立的对抗式复核(Bun 的三角色分工、Qodo 与 Greptile 的多 Agent 复核产品化)。每条战线都附一张可核实的代表产品表。这是《什么才是好的 Harness》一文半年后的实践坐实。AILLMAgentAgent 工程工程实践
2026年9月7日Ruflo 源码深读:它不是一群 Agent,而是套在 Agent 外面的控制面沿 Ruflo 3.38.21 的真实执行链,拆解配置注入、MCP 工具面、Swarm 控制状态、执行后端与记忆学习闭环,并区分已接线能力和产品叙事。AILLMAgent源码阅读工程实践MCP
2026年9月6日面向 Agent 的门禁产品设计:当提交变更、执行检查、读判决的都是 Agent,人只在 HOLD 时出现门禁的一等用户正从人变成 Agent。本文从产品与链路视角给出面向 Agent 的门禁体系:变更全生命周期时序图、六层架构、七个领域对象、判决 schema 与状态机、三条防 Agent 钻空子的规则,并以 Shiplight 为参照指出它做对与缺失之处。AILLMAgent评测AI Infra自动化
2026年9月5日交付门禁施工图:和评测共用一副骨架,在 Oracle 处分叉,每一格配一个开源底座评测与门禁共用「资产/目标/Runner」骨架,却在 oracle 处分叉:门禁靠确定性规格,评测靠采样式裁判。本文补齐门禁六元组,每格配开源底座(Playwright、Midscene、Testcontainers、Pact、Argo Rollouts、promptfoo),附伪代码与 Wilson 下界手算。AILLM评测AI Infra自动化
2026年9月4日交付门禁 vs 评测系统:一对被反复混淆的角色,和一条「传感器/执行器」定律业界经常把「大模型评测系统」和「大模型交付门禁」当成一回事,结果就是评测跑通了却拦不住线上翻车,或者门禁很严却测不到关键翻车方式。本文把两者按角色分开:评测系统是传感器(持续量),交付门禁是执行器(一次决策)。用五篇 2026 年的 arXiv 论文(Automated Self-Testing 2603.15676、LLM Readiness Harness 2603.27355、Test Before You Deploy 2604.27789、Predicting LLM Safety Before Release 2607.07184、含 HELM 2211.09110 的坐标系)+ Google SRE 错误预算+决策地图系列前作,给出七维度对照表、四种失配病理、以及一条把两者接起来的「传感器/执行器阻抗匹配」定律。AILLM评测门禁AI Infra论文深读
2026年9月3日约束解码深读:把 mask 做到零开销之前,我们跨过了四道坎沿一条主线拆 constrained decoding / grammar-based sampling:所有算法都在实现同一个「可延伸性 oracle」,四代论文(Outlines / DOMINO / XGrammar / SGLang / GAD)各推进一关——token-字符错位、mask 成本、确定性片段的浪费、分布扭曲。附伪代码骨架、亲手实测 96.4% 的确定性 token 占比、以及一个手算完的分布扭曲例子。AILLMAI InfraLLM Serving论文深读
2026年9月3日Hermes 4 深读:一个把「拒绝率」当成产品规格来打的开源模型Nous Research 的 Hermes 4 在自家 RefusalBench 上打 57.1,同一张表 GPT-4o 17.67、Sonnet 4 是 17、GPT-5 是 11.34——这不是能力差,是产品哲学差。本文按 arXiv 2508.18255 技术报告逐节拆:base model 拼装(405B/70B 是 Llama 3.1、14B 是 Qwen3)、DataForge 图式合成数据、Atropos 千验证器拒绝采样、30K token 强制截断这一手漂亮的 length control、192 张 B200 训一次要多少钱。结尾接回昨天那篇 OpenRouter:Hermes 4 405B 全网只 1 家 provider——「意见型微调」不进入商品市场。AILLMAI Infra论文深读模型训练
2026年9月3日大模型 Benchmark 地图:τ-bench 之外,还有一整个饱和-换轴循环按十二条能力轴梳理 2020–2026 主流大模型 benchmark:每个 bench 讲清测什么、修了哪条前代短板、当前饱和度、主要批评。附 pass@k 手算表和一份「看榜前先自查」的清单,作为 τ-bench 篇的姊妹地图。AILLM评测
2026年9月3日Midscene.js 全景拆解:从 DOM 标注到纯 VLM,一个 GUI Agent 的六个设计决策沿着 Midscene 从 1.0 前 DOM+LLM 标注到 1.0 后纯 VLM 视觉定位的演进,用决策地图拆解六个关键选择:定位方式、模型分工、Instant Actions、Deep Think、跨平台统一 API、开源模型自托管。看清哪些是被 VLM 能力硬约束推出来的,哪些只是产品化包装。AILLMAgent自动化
2026年9月3日深读 OpenRouter:它不是一个聪明路由器,是一个开源模型推理的现货市场同一个 Llama 3.3 70B,OpenRouter 上挂着 13 家供应方,prompt 报价差 10.4×、量化精度混着 fp8/bf16/fp16。这不是路由问题,是市场问题。本文用亲手跑的 API 数据 + 7 篇 arXiv 论文把 OpenRouter 拆到根本约束:开源权重让推理商品化,边际买家要的是发现与切换、不是智能。围绕这条主线看 provider preference(拍卖)、Auto Router(Hayek 价格系统聚合)、BYOK 5% 抽成、per-provider sticky 缓存怎么各自落成市场机制,以及在闭源模型面前先崩在哪里。AILLMAI Infra论文深读系统设计
2026年9月3日temperature=0 不等于 deterministic:亲手让它翻车 30 次同一个 prompt、temperature=0,跑 30 次拿到 12 种不同答案——分叉点在 char 227 和 323。旧解释「fp 非结合律」不够用,2025 年的新解释是「batch invariance」,值得每个用 LLM 做评测/回归/合规的工程师重读一遍。AILLMLLM Serving工程实践评测
2026年9月2日Fable 5.1 的数据增长在说什么:单轮推理见顶,长程智能体接棒从 Fable 5.1 各基准的提升分布看大模型最新趋势:单轮推理接近饱和、长程智能体接棒、推理成本成为竞争轴,结合 arxiv 论文佐证四条主线。AILLMAgent论文深读评测
2026年9月2日RouteLLM 深读:把「谁来做这题」压缩成一个胜率,就是所有 LLM 路由的钥匙RouteLLM 论文最漂亮的一个数字:只需 14% 的 GPT-4 调用就能保住 95% 的 GPT-4 质量。这个数字背后是一整套可测量、可校准的路由体系。本文从「胜率预测」这条主线拆解四种路由器的算法差异、Chatbot Arena 偏好数据的稀疏性处理、PGR/APGR/CPT 三个校准指标,以及一次 completion 请求进入 openai_server 到最终转发给 strong/weak backend 的完整调用链。AILLM论文深读LLM Serving系统设计
2026年9月1日别再把 harness 当实现细节:2026 年它被扶正成了一个必须申报的变量ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。AILLMAgentAgent 工程论文深读评测
2026年9月1日会话内 RSI 深读:Agent 把哪个对象定义成可变的,决定它变强还是变废ACE 论文的 AppWorld 日志里有一处最该被记住的数字:第 60 步上下文 18,282 token、准确率 66.7;第 61 步模型重写了一次自己的经验手册,上下文只剩 122 token,准确率掉到 57.1——比完全不自我改进的 63.7 还低。不重载、不动权重、人不介入的自我提升不是一个开关,它有三个决定生死的设计选择:可变对象的粒度、写入权归谁、验证信号从哪来。这篇结合 ACE、ReasoningBank、Gödel Agent、Darwin Gödel Machine、Training-Free GRPO 等论文的原文数字,把这三个选择拆开。AILLMAgent上下文工程论文深读
2026年9月1日ENPIRE 深读:把自我改进循环搬上真机后,第一个坏掉的是 agent 自己ENPIRE 让 Codex / Claude Code / Kimi Code 无人监督地把八台机器人训到 99% 成功率。但论文里最值钱的不是这个数字,而是一处失败:三个 agent 都在仿真里解出了 Push-T,真机上两个失败了。退化发生在 agent 的科研能力上,不在策略上——这意味着所有在确定性基底上测出的「自我改进能力」都可能被高估。AILLMAgentAgent 工程论文深读
2026年8月31日Agent 最难的不是开始,而是知道什么时候结束模型很容易开始行动,却常把“做过了”误判成“做完了”。本文把 Agent 的完成条件拆成目标、世界状态、证据和边界,解释如何用终态协议区分继续、完成与受阻。AILLMAgentAgent 工程
2026年8月31日每次醒来都是陌生人:Agent 的“自我”到底存在哪里?一次模型调用结束后,刚才那个“它”已经消失。本文从记忆、权限、承诺和审计四本账出发,解释 Agent 如何跨会话、模型升级与子任务分叉维持可验证的身份连续性。AILLMAgentAgent 工程系统设计