AgentBench 学习笔记:评测 Agent,不能只看它怎么回答
消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。
Archive
消化 AgentBench 论文:为什么 LLM Agent 需要交互环境评测,AgentBench 如何用 8 类环境测试长期推理、决策和指令遵循,以及它对 Agent eval 的启发。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版:我先抓取 source pack,再逐篇阅读原文摘录,并用 `publish-to-lei-blog` 的“质量十大思维”做了一轮审稿。今天的主线是:AI 能力正在从“模型会不会”下沉到“harness、sandbox、数据系统、推理栈…
消化 Evoflux 论文:为什么紧凑模型在 MCP 风格工具调用里容易失败,Evoflux 如何把工具调用看成可执行工作流的推理时演化修复,以及它对 Agent 系统设计的启发。
消化 HELM 论文:为什么 LLM 评测不能只看单一排行榜,HELM 如何用场景、指标和透明产物重构模型评测,以及工程团队应该如何借鉴。
消化 IFEval 论文:为什么指令遵循需要可验证评测,IFEval 如何用 25 类可检查约束构造约 500 条样本,以及它对 prompt 和模型发布门禁的启发。
消化 MT-Bench 与 Chatbot Arena 论文:为什么开放式回答难以自动评测,LLM-as-a-Judge 如何近似人类偏好,以及 position、verbosity、self-enhancement 等偏差该如何处理。
补齐 W1-Q4 attention 内部四步的最后一块:用混音台直觉、小数字矩阵乘和 Qwen2.5-7B 的真实 shape,讲清 attn_output.weight 与最终 output.weight 的区别。
消化 PrologMCP 论文:为什么 LLM 在深层演绎推理上不稳定,PrologMCP 如何把 Prolog 标准化为 MCP 工具,以及“模型做翻译、求解器做推理”的系统分工。
消化 SWE-bench 论文:为什么传统代码生成评测不足以衡量软件工程能力,SWE-bench 如何用真实 GitHub issue、仓库上下文和测试执行构造可执行评测。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版。我先读了 9 个渠道的 23 篇原文包,今天最值得你投入注意力的不是又一个模型名,而是三条更硬的信号:验证正在成为 agent 能力的新缩放轴;弱模型上的 RL 成果开始有机会迁移到更强模型;内容站点已经开始把 agent 抓取当成独立…
面向初学者拆解 masked softmax:先补 softmax 的 exp、求和、归一化,再讲 causal mask 如何把未来 token 权重变 0,最后对上 GQA 下的 Q/K/V shape 和 llama.cpp attention graph。
面向初学者拆解 Transformer 的 QKV 投影:从 Query/Key/Value 的角色,到矩阵乘、shape 推导、GQA、KV cache 和 llama.cpp 的 build_qkv 源码对应。
面向初学者拆解 RoPE:先补 cos/sin 的横向和纵向直觉,再推导二维旋转公式、128 维 head 拆分、相对位置如何进入 QK 点积,并对上 llama.cpp 的 ggml_rope_ext。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版:我先抓取 source pack,再逐篇阅读原文摘录后重写判断。今天最值得放进脑子的主线是:agent 不再只是“会调用工具的模型”,而是在逼工程体系补上运行时、权限、验证、成本和产品界面这几块短板。
从矩阵乘法、Transformer 线性层、低秩增量和 adapter 加载机制出发,解释 LoRA 如何与大模型内核协作,以及为什么 Program-as-Weights 和 Parametric Skills 都选择把能力内化成 LoRA。
完整记录一次生产常见 LoRA 推理链路:Apple Silicon 本地环境、uv 隔离环境、Transformers + PEFT 加载 Qwen2.5-0.5B 基座和 commit message LoRA adapter,比较 base、active adapter、merged model 的输出。
深入拆解 Program-as-Weights 论文:为什么要把模糊函数编译成权重、PAW 的编译器-解释器结构、Text-to-LoRA 实现、FuzzyBench 训练方式、实验结果、工程收益和局限。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词卡。今天先读 26 篇候选、24 篇正文后,我的主判断是:Agent 的竞争正在从“谁回答得更好”转向“谁能被当作软件运行”。这意味着评测要看预算曲线,安全要在线监控,隐私删除要能定位到参数,工具链要补齐技能、沙箱、可恢复执行…
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 25 条高信号内容生成。
Codex 真读真写 · 论文/趋势/技能/工具/行动。这是 Codex 深读版,不是关键词卡。今天先读 24 篇候选、23 篇正文后,我更看重四条主线:Agent 竞争从模型能力转向反馈回路;推理架构开始重写多线程协作方式;企业真正缺的是把 AI 嵌进交付链路的人与流程;安全执行环境、技能包与网关正在成为开发者基础…
深读 2026 年 6 月底 arXiv 上 Skill/MCP 相关论文:Skill 如何获取、调用、参数化和治理,MCP 如何从连接协议走向安全执行层。
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 37 条高信号内容生成。
Codex 真读真写 · 论文/趋势/技能/工具/行动。基于 aibrief 当日 20 条高信号内容生成。