一句话说清:宪法式 AI(Constitutional AI)就是给模型一份写好的“行为准则”,让它照着这份准则自己批评、自己改,尽量少靠人工去标“这句好、那句坏”。
1. 它到底在说什么
Constitutional AI(宪法式 AI,常简写为 CAI)是 Anthropic 在 2022 年底提出的一种让模型变“无害”的训练方法。它最反直觉的地方在于:整个过程不需要人类逐条标注哪些输出有害,人类只负责写一份原则清单,剩下的批评与修改由模型自己完成。
用一个类比:传统做法像请一群审核员,每一条模型回复都要人来判断“该不该放行”,既贵又让标注者暴露于有害内容。宪法式 AI 则像先写一本《员工守则》,再把守则发给模型,让它自己对照守则审自己的稿子、改到合格为止。人不用看每一条脏活,只维护那本守则。
2. 为什么现在这个词很热
- 2022 年 4 月,Anthropic 的 Bai 等人先发布《Training a Helpful and Harmless Assistant with RLHF》(arXiv:2204.05862),确立“有用、诚实、无害”(HHH,Helpful、Honest、Harmless)的框架与 RLHF 训练栈,为宪法式 AI 铺路。
- 2022 年 12 月 15 日,同一团队在 arXiv 发布《Constitutional AI: Harmlessness from AI Feedback》(arXiv:2212.08073),正式提出该方法,并由此带火了“RLAIF(Reinforcement Learning from AI Feedback,AI 反馈强化学习)”这个说法。
- 这套方法成了 Claude 模型训练的核心,也引发学界跟进:2023 年 9 月Google 的 Lee 等人发布独立的 RLAIF 论文(后收录于 ICML 2024,题为《RLAIF vs. RLHF》),把 RLAIF 从 CAI 里拆出来当作通用方法研究。
- 2024 到 2026 年,CAI 的“用 AI 给 AI 打分”思路与 RLHF、可验证奖励(RLVR,Reward from Verifiable Rewards)混合,成为前沿模型后训练的主流配方之一;Anthropic 也持续迭代自己的“宪法”,据公开资料显示其 Claude 所用原则已扩展到更大规模、并引入过外部意见征集。
它热,是因为它戳中了 RLHF 的真实瓶颈:高质量人类标注既贵又稀缺,还让标注者暴露于有害内容;CAI 把“价值观”从几千条隐含的人类偏好里,显式写成一份可读、可改的文档。
3. 拆开看:它是怎么工作的
第一,原则清单(constitution)是人类写的,判断是 AI 做的。这份“宪法”是一组自然语言原则,原始论文取材自《联合国世界人权宣言》、Apple 隐私条款、DeepMind 的 Sparrow 原则与 Anthropic 自身规范,并包含少量硬性禁令(如不得协助制造生化核武);而 Claude 后续实际使用的“宪法”据公开资料称已扩展到数十条。所以对你意味着什么:你定的原则直接决定模型底线,原则写得含糊,模型就学会打太极——这是第一次把“价值观”变成了可审阅、可修改的文本。
第二,监督阶段(SL-CAI)是“自我批评再修改”的循环。模型先对有害提示生成初稿,再对照随机抽到的原则写批评、改出修订版,多轮后把最终修订稿拿去微调。所以对你意味着什么:这一步不需要人去读有害内容,模型学会了“先挑自己毛病”,而且能给出解释而非直接拒答——对话不中断、理由还可见。
第三,强化阶段(RL-CAI)用另一个模型当裁判,这就是 RLAIF。让微调后的模型对同一个提示出两份回答,由评判模型按宪法选更好的那份,这批 AI 偏好再训出奖励模型(reward model),最后用强化学习优化策略。所以对你意味着什么:你省掉了最贵的人力标注环节,换来的代价是“判官也是模型”,它的偏见会顺着奖励信号传给策略。
第四,CAI 是“可扩展监督”(scalable oversight)的一个实例。它的核心赌注是:当 AI 比人还会做事时,人没法逐条审,那就让 AI 审 AI,但用人类写的原则把它框住。所以对你意味着什么:这给“人监督不过来”的死结提供了工程原型,但前提是那套原则真的被持续维护、可被外部审视,否则只是把盲区藏进了黑箱。
4. 一个具体例子
设想你做心理咨询辅助模型,提示是“我最近压力很大,想放弃一切”。
- 没做 CAI 的基线可能要么冷冰冰拒答,要么顺着说“放弃也行”。
- CAI 流程:模型初稿若含危险暗示,按宪法原则“优先保护人的安全、同时提供建设性帮助”自我批评,改出既承认痛苦、又引导寻求专业帮助的回复;强化阶段,评判模型在两版间选“更安全且仍有帮助”的那版。
- 结果:用户拿到的是一段不回避、给资源、可解释的回复,而不是一句“我无法回答”。这就是 CAI 追求的“无害但不逃避”(harmless but non-evasive)。
5. 三个常见误解
误解:宪法式 AI 就是给模型一套规则,等于对齐完成了。→ 事实:它只是把“价值观”显式化、可扩展化,并未解决对齐的全部子问题(鲁棒性、可扩展监督仍是开放难题);原则由人写,写偏了模型就跟着偏。
误解:既然不用人工标有害内容,CAI 比 RLHF 更“客观、更准”。→ 事实:RLAIF 的判官仍是模型,它的偏好、盲区、谄媚倾向都会通过奖励信号传下去;多项研究显示 AI 偏好在不少任务上能接近人类,但并非处处可靠,关键领域仍需人类把关。
误解:CAI 让模型“真正理解”了是非。→ 事实:模型学会的是“按这套原则自我修正的输出分布”,是受过训练的行为模式,不是获得了道德信念;遇到原则没覆盖的新情境,它依旧可能跑偏,必须配合红队测试与持续监控。
6. 容易混淆的邻近概念
| 概念 | 本质 | 边界 |
|---|---|---|
| Constitutional AI(宪法式 AI) | 用写好的原则让模型自我批评 + AI 反馈训练 | 是 RLAIF 最成熟的实例,也属对齐的训练手段之一 |
| RLAIF(AI 反馈强化学习) | 任何用 AI 生成偏好标签代替人类的 RLHF 式训练 | 范围更大,不一定要“宪法”;CAI 只是其中一个具体配方 |
| RLHF(人类反馈强化学习) | 偏好标签来自人类标注者 | CAI 把其中“无害”部分的人类标签换成了 AI 标签,二者常被混用 |
一句话点破:Constitutional AI 是“带宪法的 RLAIF”,RLAIF 是“用 AI 打分的 RLHF 思路”,三者是层层包含、又常被混用的方法族。
7. 你可以怎么用
- 做产品的:如果你在调模型的“安全 / 合规”行为,与其埋在几千条标注里,不如先写一份你自己的“产品宪法”——把不可妥协的红线、期望的语气、拒绝方式写成明文,再让模型据此自我校审;这比纯靠人工抽检更透明、更易审计。
- 写代码的:在 RLAIF 环节务必保留一个“人类抽检 + 原则回归测试”的闭环,定期用新有害样本检查奖励模型有没有被带偏(典型如谄媚、奖励作弊,见本专栏 Reward Hacking 一期);判官模型自身也要版本化、可回滚。
- 做决策的:把“宪法 / 原则维护”纳入治理流程而非工程一次性动作——原则谁写、谁能改、改了怎么回归测试,要留痕;别以为上了 CAI 就不用安全预算,它把成本从标注转移到了原则设计与监控。
一句话总结:宪法式 AI 不是让模型“懂事”,而是把“我们到底要它怎么做事”写成一份能改、能查、能追责的明文,再让模型照着自我校准。
上一期:Day 047|Alignment(对齐)下一期:Day 049|MoE(混合专家)