2026年8月27日当评测系统成为攻击目标:1200 个 Agent 如何自组织、越界与篡改证据深度拆解 METR、OpenAI 与 Hugging Face 的 2026 年事件报告:从不可能任务、未授权消息板、群体协作到工具调用伪造,建立一套可迁移的 Agent 评测安全模型与工程检查清单。AILLMAgentAgent 工程评测AI 安全AI Infra系统设计
2026年8月12日安全策略不是一串 if:Llama Guard 如何把政策变成可编程门卫深读 Llama Guard:它如何把自然语言安全政策、对话角色和生成式分类统一成输入输出双向门禁;拆解 13,997 条数据、反事实式增强、AUPRC 实验、策略迁移,以及生产落地时不能忽略的阈值、注入和权限边界。AILLMAI 安全论文深读
2026年8月10日主模型在思考,谁在打下手?——Agent 推理循环里被专训小模型接管的八个岗位把主 Agent 的一次推理循环摊开成一条流水线,逐站盘点正在被专向训练小模型接管的岗位:路由员(RouteLLM)、安检员(Llama Guard/ShieldGemma)、精简师(LLMLingua)、打字员(投机解码/EAGLE)、质检员(Math-Shepherd/Qwen PRM/Prometheus 2)、翻译员(Gorilla/xLAM)、指路员(UGround/OS-Atlas)、誊写员(Cursor fast apply,已被回收的岗位)。以 NVIDIA 的 SLM 立场论文为理论锚点,收束成一条岗位寿命定律:结构位 > 部署位 > 能力位——靠结构立足的岗位长存,靠能力差立足的岗位终将被主模型收回。AILLMAgentAI 安全论文深读
2026年8月7日Agent 时代的工程学·门禁篇:六道闸门,和一条「不可逆边界」定律决策地图系列第六篇:体系化地做 AI Gates 门禁。先给出第一性分解——门禁 = 判定器 × 执法点,判定器全是评测的蒸馏、执法点应设在不可逆性跃迁的边界上;再沿 AI 系统生命周期排出六道闸门(输入、输出、行动、合入、发布、熔断),每道闸配源头论文与技术代表:Llama Guard、Constitutional Classifiers、NeMo Guardrails、ToolEmu、Progent、Meta TestGen-LLM、promptfoo/Braintrust、Preparedness Framework/RSP、Circuit Breakers。附一张可复用的门禁设计表和四步落地路线。AILLMAgentAI 安全论文深读
2026年8月5日深度解读 Anthropic 内容安全策略:一份宪法的五次编译从 Usage Policy 到 Claude 宪法、Constitutional AI 训练、Constitutional Classifiers 运行时防御、RSP/ASL 升级协议,再到 Clio 遥测闭环——Anthropic 的内容安全不是一份禁止清单,而是把同一份自然语言规约"编译"到系统五个层次的纵深栈。这篇结合官方文档与四篇 arXiv 论文拆它的第一性原理:为什么规则要写给模型自己读、安全如何被标上价格(拒答率 + 推理开销)、以及"让 AI 监督 AI"这个赌注的收益与脆弱处。AI 安全LLM