2026年9月18日Shiplight 全栈拆解:Agent 原生测试平台如何把意图变成可持续回归我实际走查 Shiplight 官网、67 个文档入口、公开 Agent Skill、npm 包与 Trust Center,拆开它的 MCP 浏览器、YAML 意图层、Playwright 执行层、Action Cache、自愈、CI 归因和云端商业飞轮,并给出一条不照抄产品表面的 clean-room 自研路线。AIAgent自动化AI Infra评测
2026年9月14日11 种 LLM 评估方法,其实只在回答一个问题:参照物从哪来三句话喂给三代指标:真实排序 A>C>B,ROUGE-L 给 C>B>A,BERTScore 给 B>A>C,没一个排对。附本地 Qwen2.5-7B 的分数 token 概率分布、30 次采样的裁判方差,以及 DeepEval DAG 源码究竟把什么变确定了。AILLM评测论文深读工程实践
2026年9月10日LLM 评测的 25 个坑:一张五层管线地图与论文索引上一篇从一次 finish_reason=length 翻车讲了静默失败。这篇把视野拉满:按评测管线把 LLM 评测的坑切成数据、生成、评分、统计、链路五层共 25 个,每个坑给症状、论文证据(带具体数字)和防线;末尾收三条跨层主线和一份评测前中后防坑清单。AILLM评测论文深读工程实践
2026年9月10日一次 finish_reason=length 翻车:LLM 评测的静默失败分几层Veral 跑 Kimi K2 多选评测翻车:reasoning 吃光 4096 token、content 为空、finish_reason=length,评分器抓不到答案。以这次为锚点,把 LLM 评测里的静默失败排成五层——生成层、评分层、统计层、数据层、链路层——每层给症状、根因、探测方法与 arXiv 出处。AILLM评测Agent论文深读工程实践
2026年9月9日BFCL v3 深读:多轮函数调用的评测口径,从「对答案」换成「diff 状态」Berkeley 那篇 BFCL v3 博客表面在讲 1000 条新多轮题目,底下真正换掉的是评测口径:从 AST 匹配一条正确轨迹,变成让代码跑进沙盒后比对对象属性。附源码定位、条数核对、四类多轮任务的判据分工,以及一处被注释掉的更严判据留下的证据。AILLMAgent评测工具调用源码阅读
2026年9月8日Agent 记忆的前沿玩法:从存聊天记录,到主动寻找可用证据结合 Hindsight、EviMem、RLM、MemSkill、AgeMem 与最新隐式记忆评测,拆解有效的记忆和知识获取路线,附版本冲突小实验、成本复算与落地顺序。AILLMAgent记忆RAG论文深读评测
2026年9月8日先测判据,再测 Agent:业务评测样本的构造方法与一次作弊下界实测我按六轴坐标亲手造了 12 条电商售后样本和三代判据,让 5 个不理解业务的确定性作弊脚本去跑:第一版判据被拿到 9/12(75%),12 条样本全部被攻破,加固后降到 1/12。剩下那条是任务效度问题——题面漏了答案,改判据无解。附可复跑代码与判据体检清单。AILLMAgent评测Agent 工程工程实践
2026年9月8日前沿大模型十家公司在押注什么:2026 年 9 月榜单与技术路线深挖按 Artificial Analysis v4.3 非估算成绩筛出十家模型开发者,核对正式文档、论文与开源交付,拆解长程 Agent、推理经济性、开放基础设施和世界模型四条路线,并附排名复核与成本复算。AILLMAgent论文深读评测
2026年9月8日本地部署到底看哪些本机参数:同一台机器上,GPU 让 prefill 快 38 倍、让 decode 只快 2.5 倍在 24GB M5 Pro 上实测 llama.cpp 的容量、带宽、算力、核数、上下文与并发六组参数,给出一张「参数 → 它管哪一段 → 一行换算公式」的表,和一个 15 分钟自测流程。AI InfraLLM评测llama.cppLLM Serving
2026年9月8日大模型多试几次,为什么反而选错了?从可验证奖励到环境工程在一个可复现的排序实验里,把候选数从 8 增到 32,验收通过率升到 99.99%,真正交付正确答案的概率却从 56.33% 跌到 19.36%。结合 SWE-smith、EnvHarness 与环境演化研究,拆开生成、验证和选择之间的关系。AILLMAgent评测
2026年9月6日面向 Agent 的门禁产品设计:当提交变更、执行检查、读判决的都是 Agent,人只在 HOLD 时出现门禁的一等用户正从人变成 Agent。本文从产品与链路视角给出面向 Agent 的门禁体系:变更全生命周期时序图、六层架构、七个领域对象、判决 schema 与状态机、三条防 Agent 钻空子的规则,并以 Shiplight 为参照指出它做对与缺失之处。AILLMAgent评测AI Infra自动化
2026年9月5日交付门禁施工图:和评测共用一副骨架,在 Oracle 处分叉,每一格配一个开源底座评测与门禁共用「资产/目标/Runner」骨架,却在 oracle 处分叉:门禁靠确定性规格,评测靠采样式裁判。本文补齐门禁六元组,每格配开源底座(Playwright、Midscene、Testcontainers、Pact、Argo Rollouts、promptfoo),附伪代码与 Wilson 下界手算。AILLM评测AI Infra自动化
2026年9月4日交付门禁 vs 评测系统:一对被反复混淆的角色,和一条「传感器/执行器」定律业界经常把「大模型评测系统」和「大模型交付门禁」当成一回事,结果就是评测跑通了却拦不住线上翻车,或者门禁很严却测不到关键翻车方式。本文把两者按角色分开:评测系统是传感器(持续量),交付门禁是执行器(一次决策)。用五篇 2026 年的 arXiv 论文(Automated Self-Testing 2603.15676、LLM Readiness Harness 2603.27355、Test Before You Deploy 2604.27789、Predicting LLM Safety Before Release 2607.07184、含 HELM 2211.09110 的坐标系)+ Google SRE 错误预算+决策地图系列前作,给出七维度对照表、四种失配病理、以及一条把两者接起来的「传感器/执行器阻抗匹配」定律。AILLM评测门禁AI Infra论文深读
2026年9月3日大模型 Benchmark 地图:τ-bench 之外,还有一整个饱和-换轴循环按十二条能力轴梳理 2020–2026 主流大模型 benchmark:每个 bench 讲清测什么、修了哪条前代短板、当前饱和度、主要批评。附 pass@k 手算表和一份「看榜前先自查」的清单,作为 τ-bench 篇的姊妹地图。AILLM评测
2026年9月3日temperature=0 不等于 deterministic:亲手让它翻车 30 次同一个 prompt、temperature=0,跑 30 次拿到 12 种不同答案——分叉点在 char 227 和 323。旧解释「fp 非结合律」不够用,2025 年的新解释是「batch invariance」,值得每个用 LLM 做评测/回归/合规的工程师重读一遍。AILLMLLM Serving工程实践评测
2026年9月2日Fable 5.1 的数据增长在说什么:单轮推理见顶,长程智能体接棒从 Fable 5.1 各基准的提升分布看大模型最新趋势:单轮推理接近饱和、长程智能体接棒、推理成本成为竞争轴,结合 arxiv 论文佐证四条主线。AILLMAgent论文深读评测
2026年9月1日别再把 harness 当实现细节:2026 年它被扶正成了一个必须申报的变量ALFWorld 上一个 3B 模型配好 harness(69.7)打赢 7B 配差 harness(55.6),差 14.1 分;更狠的是这个便宜不能事后补——训完再换好 harness 只能拿回一小部分。2026 年 harness 研究的真正进展不是「又发现脚手架很重要」,而是把它从实验里看不见的常量提成了变量。变量化炸开四条战线:测量(harness 方差是模型方差的 7.80 倍、9 组对比 6 组名次翻转)、自动搜索(AHE 69.7→77.0)、训练(harness 是训练分布的一部分)、以及两个必须承认的刹车。附一张可填的 Harness Card 和一个约 19 美元的亲手验证实验。AILLMAgentAgent 工程论文深读评测
2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月26日什么是一个好的评测样本?不是一道难题,而是一份决策证据结合 ECBD、CheckList、Dynabench、SWE-bench 与 LiveBench,建立一套判断 LLM/Agent 评测样本是否有效、可判、可复现、能区分且不过期的工程框架。AILLM评测AgentAI Infra论文深读
2026年8月25日会用 Coding Agent,不等于会做 AI Engineering:四项差距能力与训练法用一个订单 CSV 导出案例,具体定义需求规格、Agent 操作、Eval 回归与部署观测四项能力,并结合 SWE-bench、SWE-agent、MAST、AgentOps 等论文给出可练习、可验收的进阶路径。AIAgent 工程评测工程实践系统设计
2026年8月24日顶级模型"卖不动"是误读:Ramp 数据里同厂之间的信任积攒深读 Simon Willison 2026-08-23 那篇转引 FT 报导 + Ramp AI index 的短博客。表面结论是"Anthropic 最贵的 Opus 5 只占同厂花费 3.5%,Opus 4.8 占 28%",但把家族聚合起来看,Opus 系仍占 40.8%——只是集中在上一代旗舰上。真正的信号不是"贵的没人要",是**用户在给"累积过工程投入的模型"投票**:老模型有 SDK、prompt 库、评测、KV 缓存、组织 runbook,新模型这一切都是 0。这是昨天那篇《合成前沿》里"10% 更差、100x 便宜"在市场端的第二个投影:同厂内也在验证同一条经济逻辑。AILLM评测工程实践
2026年8月24日10% 更差、100 倍便宜、10000 倍快:AI 生产线被自己吃掉的八次深读 Latent Space 2026-08-22 那期 AINews:把 2022 到 2026 每年一次的"人类输入变成模型输出"演化拆成八个阶段,每一格给 patient zero 论文和该阶段的验证机制;并挑出作者只在页脚点了一下的元规律——合成前沿不是被"生成"推动的,是被"验证"推动的。这条思路和昨天那篇 attention-interface 是同一个抽象上升一层:agent harness 被模型吸收,是这条大曲线在 agent 内部的投影。AILLMAI Infra评测论文深读
2026年8月20日Codex 怎样接进公司的评测链路:先摆正 Langfuse 与 Inspect AI 的坐标「让 Codex 集成 Langfuse 做 Inspect AI 评测」这句话把两个不在同一节点的组件当成了需要搭桥的对等系统。翻开本站评测路由系列的施工图:Langfuse 是 Trace 节点(M5),Inspect AI 是评测执行引擎(M8),中间隔着数据集(M6)。这篇把 Codex 放回这条「请求→路由→Trace→评测→策略」的闭环里,讲清它从哪个节点进场、trace 走哪两条路、以及它同时是 trace 生产者又是被评对象。CodexAgentAI InfraLLM评测
2026年8月11日把回显当证物:一页评测证据的取证报告,和一条「双向 Oracle」定律一个 AI agent 用浏览器自动化工具点开评测平台的证据页,吐回 18000 字符的可访问性树——这篇只凭这一页回显做取证式阅读,拆出六条线索:样本自带工具面板(τ-bench/SWE-bench 的 agent 时代样本格式)、mustFind+mustNotClaim 双向 Oracle(CriticGPT 的全面性-幻觉权衡 + TruthfulQA 式误区陷阱,逐样本的精确率-召回率合同)、按风险定价的 minimumScore(0.75/0.80/0.85 三档)、SOURCE TRACE 溯源与 model@v×scorer@v×promptProfile×datasetContentHash 四元组封印(lm-eval Trenches 的可复现纪律)、数字取证(成本"未知"是显式空格;九个样本 ms/token 稳定在 5.9–7.5,UUIDv7 时间戳显示样本 73ms 内批量落库、20 分钟后才有 run)、以及 12/12 通过的真实含金量(三分法则:n=12 全过只能把失败率压到 25% 以下——acceptance 是门禁不是榜单)。元规律「双向 Oracle 定律」:评审型打分器的成熟度不看它奖励什么,看它禁止什么——单向清单量能力,双向合同量可信。AILLM评测AI Infra论文深读