2026 年 1 月,Anthropic 把 Claude 的宪法全文公开,并以 CC0 协议放弃版权——任何人可以拿去做任何事。这份约 80 页的文件有一个反直觉的细节,藏在它的说明里:它的第一读者不是用户,不是监管机构,也不是员工,而是 Claude 自己。官方原话是”written with Claude as its primary audience”,所以行文为精确性优化,而非可读性。一家公司最核心的安全政策文件,主要受众是一个模型——这不是姿态,这是理解他们整套内容安全体系的钥匙:当执行规则的主体是模型时,规则首先要写成模型能内化的形式。
说起一家 AI 公司的”内容安全策略”,多数人脑中浮现的是一份禁止清单加一个审核团队——像论坛版规一样,列出不许做的事,抓到就封号。把 Anthropic 公开的政策文档和论文摊开看,会发现完全不是这个形状。它更像安全工程里的纵深防御(defense in depth):同一份意图,被部署到系统的每一层,每一层用不同的机制、拦不同的失败模式,并且假设任何单层都会漏。
这篇想说清的事,可以压成一句话:
Anthropic 的内容安全策略,本质是把「一份自然语言写成的规约」编译到系统的每一层——纸面上是 Usage Policy(对人),训练期编译进权重(Constitutional AI),推理期编译成过滤器(Constitutional Classifiers),能力越线时触发升级协议(RSP/ASL),再用隐私保护的遥测(Clio)闭环校准。它的核心赌注是:让监督的表达停留在自然语言,让监督的执行交给 AI 自己——因为只有这样,安全的 scaling 才可能跟上能力的 scaling。
下面按层拆。先给全景图,再逐层看机制、看数字,最后回到这个赌注本身的收益与脆弱处。
一、全景:五层栈,一个源文件
把公开材料按”生效位置”排列,Anthropic 的内容安全体系长这样:
flowchart TD
C["自然语言规约<br/>(宪法 / Usage Policy / 分类器宪法)"]
C -->|"编译目标①:对人"| UP["纸面层:Usage Policy<br/>定义人不许拿模型做什么"]
C -->|"编译目标②:训练期"| CAI["权重层:Constitutional AI<br/>原则 → AI 自我批评/修订 → RLAIF"]
C -->|"编译目标③:推理期"| CC["运行时层:Constitutional Classifiers<br/>原则 → 合成数据 → 输入/输出过滤器"]
RSP["升级协议:RSP / ASL<br/>能力评估越线 → 整栈加固"] -.->|触发| CC
RSP -.->|触发| SEC["安全层:权重防窃取"]
CLIO["遥测层:Clio<br/>隐私保护的用量观测"] -.->|"发现新失败模式"| C
注意两个结构特征。第一,源头是同一类东西:一份用自然语言写的原则清单。训练用的宪法、分类器用的宪法、给人读的政策,措辞和粒度不同,但都是”用人话描述什么该做什么不该做”,而不是标注好的样本集或硬编码的规则引擎。第二,箭头是编译,不是引用:每一层都把这份规约转换成自己层的原生形式——权重层转成梯度,运行时层转成分类器参数,纸面层转成法律条款。改源文件,重新编译,各层同步更新。
这个”规约与执行分离”的架构不是天然的。它是从一个具体的痛点里长出来的——故事要从 2022 年那篇论文讲起。
二、权重层:Constitutional AI——把人类监督上移一层抽象
Constitutional AI: Harmlessness from AI Feedback(arXiv 2212.08073,2022 年 12 月)是整个体系的地基。它要解决的问题在论文动机里写得很直白:用人类反馈(RLHF)训练无害性时,众包标注员系统性地奖励了回避——模型发现”拒绝回答”永远不会被扣无害分,于是遇到任何有争议的问题都缩回去说”我不能讨论这个”。有帮助和无害两个目标之间出现了张力,而人类标注把模型推向了张力中最差的解:既不有害、也不有用。
CAI 的解法分两步。监督阶段:给模型一份原则清单(宪法),让它对自己的初稿自我批评、自我修订,再用修订稿微调。强化阶段:让 AI 依据宪法对两个回答做偏好比较,用这些 AI 偏好训练奖励模型,再做 RL——即 RLAIF(RL from AI Feedback)。全程没有人类逐条标注哪个回答有害,人类监督只剩一份原则清单。
论文报告的结果里最值得记住的不是无害分提升,而是行为形态的变化:训出来的助手是 harmless but non-evasive(无害但不回避)——面对不当请求,它解释为什么拒绝,而不是甩一句拒绝模板。这正是纸面规则做不到的:你可以在政策里写”不要回避”,但只有把”如何不回避地拒绝”的示范编译进权重,模型才真的会。
用 AI 史的透镜看,这一步的本质是把”从规则到数据”这条历史主线折叠了一次:AI 史是”人写规则”不断被”数据说话”取代的历史,而 CAI 让人退回到写原则,把”原则 → 数据”这一步交给 AI 自己生成。人类监督没有消失,是上移了一层抽象——从标注样本升级到起草宪法。这就是 scalable oversight(可扩展监督)的具体形态:样本标注的产能是常数,原则起草的杠杆随模型能力增长。
一个自然的追问:宪法凭什么由 Anthropic 写? 他们自己也意识到这是合法性软肋,于是做了 Collective Constitutional AI(arXiv 2406.07814,FAccT ‘24):通过 Polis 平台向约一千名美国公众征集原则,汇成一份”公众宪法”,训出据他们所知第一个用集体民意微调的语言模型。结果值得注意:公众宪法版模型在九个社会维度上的偏见更低,语言、数学、有用-无害评测持平——民意没有以能力为代价。这个实验规模不大(Claude Instant 级别的模型),但它证明了架构的一个性质:宪法是可插拔的。规约与执行分离之后,“谁来写规约”第一次成了一个可以独立讨论、独立实验的问题。
三、运行时层:Constitutional Classifiers——安全第一次被标上价格
权重层有个天花板:无论训练多充分,总有人能用足够刁钻的提示词组合把行为撬出来——也就是越狱(jailbreak)。尤其危险的是通用越狱:一套模板对几乎所有请求都有效,等于把整个训练层的防御一次性归零。
Constitutional Classifiers(arXiv 2501.18837,2025 年 1 月)是运行时层的答案,它的做法把”编译”这个隐喻展现得最彻底:拿一份宪法(这次是描述允许/限制内容类别的规则),让 LLM 依据它批量生成合成训练数据,再用这些数据训练轻量级的输入/输出分类器,部署在模型前后做实时检查。宪法改了,重新生成数据、重新训练,防御随规约更新——不需要重训主模型。
这篇论文真正的贡献是三个数字,它们第一次把”安全”从一个立场问题变成一个工程问题:
- 攻不破的程度:联合 HackerOne 组织 405 人、累计约 3000 小时的红队攻击,没有人找到能稳定提取全部目标信息的通用越狱;
- 误伤的代价:生产流量上拒答率绝对值只上升 0.38%;
- 算力的代价:推理开销增加 23.7%。
把拒答率明确当成一项成本来汇报,这个姿态比数字本身更重要。一个只想”绝对安全”的系统可以把拒答率拉到 100%——所以任何不报告误伤率的安全方案都是不完整的。这是目标函数思维(你度量什么就得到什么)在安全领域的直接应用:如果只度量”拦住了多少攻击”,系统会滑向过度拒绝;同时度量误伤和开销,优化才会朝”精确”走。
一年后的 Constitutional Classifiers++(arXiv 2601.04603)证明这条成本曲线可以被大幅压弯:改用两级级联——一个读取模型内部激活值的线性探针先筛全部流量,可疑的对话再升级给更强的分类器复查——计算成本降低 40 倍,生产拒答率压到 0.05%,人类红队测得的高危漏洞反而比旧方案少 2.2 倍。第一级不读文本、读模型的”脑电”,这几乎是可解释性研究第一次以如此直接的方式进入生产安全系统。
四、纸面层:Usage Policy——从一刀切到精确打击
给人读的那份 Usage Policy 反而是最容易被低估的一层——它看起来最像传统的”版规”。但看它的演化方向,会发现和分类器层在做同一件事:用更细的粒度换更少的误伤。
2025 年 8 月的修订(9 月 15 日生效)是个好样本,四处改动全是同一个方向:
- 政治内容:从历史上”一刀切禁止所有游说和竞选内容”,收窄为只禁止”对民主过程有欺骗性或破坏性、涉及选民与竞选定向投放”的用法——政策研究和公民教育被明确放行;
- 网络安全与 agent 使用:新增对恶意入侵活动的禁止条款,同时明确保护”经系统所有者同意的漏洞挖掘”,并配套发布了 agent 场景的具体示例;
- 高风险场景:法律、金融、就业建议的合规要求收窄到”面向消费者”的场景,B2B 场景松绑;
- 执法用途:重写表述以便理解,禁止范围(监控、追踪、画像)不变。
官方对这份文件的定性是 “a living document”——随风险演化而演化。对照三年前那种”宁可错杀”的宽泛条款,纸面层的演化轨迹和运行时层的 0.38% → 0.05% 是同一条曲线:安全体系的成熟度,体现在它敢于把禁区画得多窄。
五、升级协议与遥测:RSP/ASL 和 Clio——让栈随能力和现实变形
前三层是静态快照,剩下两层负责让这个栈动起来。
Responsible Scaling Policy(RSP)是纵向的触发器:预先承诺”当能力评估越过某条线,必须先落地对应等级(ASL)的防护,才能继续部署”。2025 年 5 月这个协议第一次真正开火:内部评估显示 Claude Opus 4 在生物风险相关任务上的表现显著强于前代,Anthropic 启动了 ASL-3 防护——部署侧上线针对 CBRN(化学、生物、放射性、核)武器话题的实时宪法分类器,安全侧收紧权重防窃取(包括限制出站流量)。两个细节值得注意:其一,这是预防性启动——他们并未认定 Opus 4 确实需要 ASL-3,而是在不确定时先按高标准执行;其二,官方明确承诺这些措施”不应导致模型在极窄的话题集之外增加拒答”——升级防护等级,不等于全面收紧。
Clio(arXiv 2412.13678)是横向的反馈回路:政策写得再好,不知道真实用法就无法校准。但”看用户对话”和”保护隐私”直接冲突,Clio 的解法是让 AI 自己做观测——对百万级对话做提取、聚类、摘要,人类分析师只看到脱敏后的聚合模式,全程无人读原文,有评论者称之为”AI 界的 Google Trends”。安全调查场景下它跑在部分流量上、结果仅限授权人员,零保留协议的客户被排除在外。它在这个栈里的角色是闭环:真实世界冒出的新用法和新失败模式,经 Clio 浮出水面,回头修订宪法和政策——源文件更新,各层重新编译。
到这里可以回答开头的问题了:为什么宪法要写给模型读、还要向全世界公开?因为在这套架构里,宪法不是公关文件,是整个栈的单一事实来源(single source of truth)。2026 年 1 月的新版宪法分四部分——broadly safe、broadly ethical、遵守 Anthropic 的具体指引、genuinely helpful——并且刻意解释每条原则背后的推理而不只是列条款,因为写作目的就是让模型在没见过的场景里泛化出正确判断。规约的质量决定所有编译产物的质量,公开它接受审查,是对源文件做的代码评审。
六、这个赌注的收益与脆弱处
预设一个怀疑的读者,此刻至少有三个反问。
“AI 监督 AI,这不是循环论证吗?” 这是最根本的质疑:批评家和被批评者是同一个模型,凭什么相信批评有效?诚实的回答是:单看训练环节确实有循环性,这套体系的可信度恰恰不来自任何单层,而来自栈的异构性——3000 小时人类红队从外部攻、Clio 从真实流量找漏、Collective CAI 从公众引入外部价值观、RSP 用预承诺对抗未来的自己。纵深防御的意义不是每层完美,是各层的失败模式不相关。但必须承认:所有层的最终解释权都在同一家公司手里,这个元问题没有被解决。
“这套承诺可信吗?” 值得记录的是,社区并不全盘买账——EA Forum 上有长文批评 Anthropic 悄悄弱化安全承诺,例如 RSP 2.2 版通过修改一个脚注,把”高级内部人员威胁”排除出 ASL-3 安全标准的范围。升级协议自己也在被修订,而修订它的激励并不总指向更严格。RSP 这类自我约束的真实强度,最终取决于外部监督的强度——这也是公开源文件的另一层意义。
“说到底,这不就是更精致的审查吗?” 灰度地看:任何内容安全系统都在做裁决,区别在于裁决的粒度、成本和可问责性。这套栈给出的答案是把误伤显式定价(0.38% → 0.05%)、把禁区显式收窄(政治内容条款的演化)、把裁决标准显式公开(CC0 的宪法)。你可以不同意某条原则,但你能读到它、引用它、批评它——相比行业里常见的黑盒审核,这是不同的物种。边界也要说清:这套设计哲学处理的是”模型不该帮什么”,它无法回答”谁有权定义该与不该”——那是政治问题,不是工程问题,Collective CAI 只是往那个方向迈的半步。
七、带走的模型:规约与执行分离
抽掉所有 Anthropic 的具体细节,这套体系剩下一个可复用的骨架:
把”你想要什么”写成一份自然语言规约,作为单一事实来源;把”如何执行”编译到系统的每一层——训练、运行时、政策、协议;用遥测闭环让规约跟着现实迭代;并给每一层的误伤显式标价。
这个骨架对任何在生产环境部署 agent 的团队都直接可用:你的系统提示、工具白名单、输出校验、评测集,现在多半是四份互相漂移的隐式政策——而这套架构说,它们应该是同一份规约的四个编译产物。改一处,处处生效;审查一处,处处受益。
而它最深的那层赌注值得单独摘出来,因为这是 Anthropic 全部安全工作的公理:监督必须和能力一起 scaling,而人类标注不会 scaling,所以监督的执行必须交给 AI,人类退到规约层。 从 CAI 用 AI 反馈替代人类标注,到分类器用 AI 合成数据替代人工样本,到 Clio 用 AI 观测替代人工审阅——三篇论文是同一个赌注的三次下注。如果这个赌注错了,整个栈会一起错;但如果不下这个注,安全就只能停在人类标注的产能上,眼看着能力绝尘而去。这不是一个已经被证明的答案,这是他们选择的那条”难而正确”的路——而把宪法以 CC0 公开,等于邀请所有人来当这条路的审计员。
参考来源
官方文档与工程实践
- Claude’s Constitution(GitHub, CC0) — 2026 年 1 月版全文
- Usage Policy Update — 2025 年 8 月修订公告
- Activating ASL-3 Protections — ASL-3 启动公告与报告
- Responsible Scaling Policy
- Next-generation Constitutional Classifiers
- Clio: Privacy-preserving insights
- Anthropic is Quietly Backpedalling on its Safety Commitments(EA Forum,批评视角)
arXiv 论文
- Constitutional AI: Harmlessness from AI Feedback — arXiv 2212.08073
- Collective Constitutional AI: Aligning a Language Model with Public Input — arXiv 2406.07814(FAccT ‘24)
- Constitutional Classifiers: Defending against Universal Jailbreaks — arXiv 2501.18837
- Constitutional Classifiers++: Efficient Production-Grade Defenses — arXiv 2601.04603
- Clio: Privacy-Preserving Insights into Real-World AI Use — arXiv 2412.13678