2026年8月4日Eval 是新的 PRD?是的,但规格的缝隙只是搬了家从 VB Transform 2026 的一句口号出发,用三篇论文拆解「Eval 取代 PRD」的真实含义:当产品规格从给人读的散文变成给机器跑的目标函数,Goodhart 定律开始起作用——真正的交付物不是 eval 套件,而是让 eval 与意图持续对齐的闭环。评测工程实践AgentLLM
2026年8月4日FDX:这次被前线部署的是高管FDE 之后,Forward Deployed Executive 出现了:嵌入客户决策层、用判断力而非代码交付的前线高管。用吸收能力理论(Cohen & Levinthal)和社会技术系统的抽象陷阱(Selbst et al.)解释这个角色为什么会出现:FDE 解决的是系统接不进去,FDX 解决的是组织学不进去——而吸收能力买不到,只能长出来,或者先租来。工程实践
2026年8月4日概率内核,确定性外壳:五个「可」的伪代码实践承接《Agent 应用工程师的六层》的分水岭判断,把「可观测、可恢复、可验证、可治理、可持续进化」逐个拆成最小工程实现:每个「可」一段伪代码,共享同一个设计原则——状态放内核外面,决策穿过内核,副作用经过关卡。Agent工程实践评测LLM
2026年8月4日当提示词成为依赖:读 Warp 的 skills-lock.jsonWarp 仓库根目录躺着一个 skills-lock.json:25 个'依赖'全是 Markdown 提示词,每条锁一个内容哈希。它不是标准的一部分,却标志着一个转折——当提示词成为跨团队共享的工件,它就继承了软件依赖的完整生命周期:manifest、锁文件、可复现安装,以及供应链攻击。结合五篇 arXiv 论文,拆解 Agent Skill 依赖管理的现状、原则与锁不住的部分。AgentSkills工程实践
2026年8月4日训练小模型的三条路,和每条路背后站着的那个大模型陪读一份流传很广的《2026 小语言模型训练完全指南》:先修正它引用错的基准数字,再把从零训练、微调、蒸馏三条路径还原成同一个问题的三种答案——你的模型的知识从哪里来。结论藏在路径背后:2026 年每个能打的小模型身后,都站着一个大模型。模型训练工程实践LLM
2026年8月4日读 Warp 源码:一场针对字节流的政变Warp 开源了客户端全部 78 个 Rust crate。精读源码后会发现它的全部架构是同一个赌注的四次下注:终端 50 年的契约是无结构字节流,Warp 在输出(Blocks)、输入(编辑器)、意图(分类器)、渲染(自研 UI 框架)四层同时把结构强加回去——而这套结构恰好是 Agent 需要的执行环境。连它的开源仓库本身,都在用 Agent + Spec 的结构化流程运转。Agent工程实践
2026年8月3日Agent 真正缺的不是记忆,而是一套可执行的世界模型从本体、知识图谱、约束与运行轨迹四层拆解 Agent 的语义底座:为什么老语义网在智能体时代重新有用,以及它不能替你解决什么。Agent工程实践
2026年8月3日FDE 工程师是什么:大模型从 Demo 到业务结果的最后一公里FDE(Forward Deployed Engineer)不是驻场外包,也不只是大模型应用开发。本文沿一项企业 AI 部署拆解它解决的问题,并给出 AI 工程、系统集成、产品发现、生产交付与组织影响五维能力模型。工程实践
2026年8月3日Agent 变强以后,工程要做什么?深读 Thoughtworks 技术雷达 Vol.34从 118 个技术条目中提炼一套 Agent 工程控制系统:怎样管理上下文、权限、反馈、持久化和组织度量,以及团队接下来 30 天真正值得做什么。工程实践Agent
2026年7月16日从 Agent 供给工程到设计即交付:三份 AI 研发规范背后的生产线逻辑结合论文与 KaiHub、Echo Builder、设计上下文、物料渲染等实现,解读 Skills & MCP、提示词与上下文工程、D2D 如何组成公司级 AI 研发生产线。AIAgentMCPSkills上下文工程工程实践