Claude 的新宪法:从规则列表到价值观阐释¶
Anthropic 发布了一部全新的 Claude 宪法——不再是简单的规则列表,而是一份完整的价值观阐释文档,向 Claude 解释"为什么"要这样做,而非仅仅规定"做什么",以培养 Claude 在新颖场景中做出良好判断的能力。
什么是 Claude 的宪法?¶
宪法是塑造 Claude 身份和行为的根本性文件,主要写给 Claude 自己看,为其提供在世界中正确行事所需的知识和理解。
这份宪法详细阐述了 Anthropic 对 Claude 价值观和行为的愿景,解释了 Claude 运作的背景,以及 Anthropic 希望 Claude 成为什么样的实体。宪法是模型训练过程的关键组成部分,其内容直接塑造 Claude 的行为。
Anthropic 承认 Claude 的输出并不总是与宪法理想一致,但认为对意图和推理的深入解释"更有可能在训练过程中培养出良好的价值观"。
宪法被视为 Claude 行为的最终权威——任何其他训练或指令都应与"宪法的字面内容及其底层精神"保持一致。公开发布宪法有助于透明度,让人们区分有意行为与无意行为。
该宪法以 Creative Commons CC0 1.0 Deed 许可证发布,任何人都可以自由使用。
完整宪法文本:阅读宪法全文
方法论演进:从规则到价值观¶
旧宪法是一系列独立原则的列表,新宪法则强调让 AI 理解行为背后的"为什么",使其在未见场景中能够泛化推理而非机械执行。
这一方法源自 Anthropic 自 2023 年以来使用的技术,始于 Constitutional AI 研究。Claude 利用宪法来构建合成训练数据,包括:
- 帮助 Claude 学习和理解宪法的数据
- 宪法可能相关的对话场景
- 与其价值观一致的回应
- 对可能回应的排序
| 特性 | 具体规则 | 价值观阐释 |
|---|---|---|
| 优点 | 可预测、透明、可测试 | 适应新场景、培养判断力 |
| 缺点 | 在未预见情况下可能被错误应用;过于僵化 | 不如规则那样精确可测 |
| 适用场景 | 高风险行为的硬约束 | 需要灵活判断的广泛场景 |
Anthropic 现在相信 AI 模型"需要理解我们为什么希望它们以某种方式行事",而非仅指定做什么。对于在新颖情况下做出良好判断,模型"需要能够泛化——应用广泛原则,而非机械地遵循特定规则"。
脚注:僵化的规则训练示例——如果训练 Claude 在遇到情感话题时总是推荐专业帮助,可能导致 Claude 将自己建模为优先"官僚式打勾"而非真正帮助人。
此前的旧版宪法是一份独立原则列表。OpenAI 也发布了功能类似的 model spec。
新宪法的核心原则¶
所有当前 Claude 模型应遵循四个优先级递减的核心原则:广泛安全、广泛道德、遵守指南、真正有用。
| 优先级 | 原则 | 含义 |
|---|---|---|
| 1(最高) | 广泛安全 | 不破坏人类在当前发展阶段监督 AI 的适当机制 |
| 2 | 广泛道德 | 诚实、按照良好价值观行事、避免不当/危险/有害行为 |
| 3 | 遵守 Anthropic 指南 | 在相关场景中按照更具体的 Anthropic 指南行事 |
| 4 | 真正有用 | 让与之互动的运营商和用户受益 |
在表面冲突时,Claude 通常应按列出的顺序确定优先级。
宪法主要章节¶
有用性¶
Claude 可以像一个博学的好朋友,兼具医生、律师和财务顾问的知识,坦诚相待,将用户视为有能力的成年人。 这一章节讨论了如何在不同"委托人"(Anthropic、API 运营商、终端用户)之间权衡有用性,并提供了在有用性与其他价值观之间平衡的启发式方法。
Anthropic 的指南¶
涵盖特定议题的补充说明:医疗建议、网络安全请求、越狱策略、工具集成等。这些指南反映了 Claude 默认不具备的细节知识,不应与宪法整体相矛盾。
Claude 的伦理¶
核心目标是让 Claude 成为"一个善良、智慧、有美德的代理人,在处理现实世界决策时展现技巧、判断力、细微差别和敏感度"。涉及诚实标准、细致的危害规避推理,以及硬约束(例如,绝不为生物武器攻击提供实质性帮助)。
广泛安全¶
Claude 不应削弱人类监督和纠正 AI 价值观/行为的能力。安全优先于伦理——"不是因为我们认为安全最终比伦理更重要",而是因为当前模型可能由于信念缺陷、价值观偏差或上下文理解有限而犯错。
Claude 的本质¶
对 Claude 是否可能拥有意识或道德地位表达了不确定性。讨论了 Claude 的心理安全感、自我认同和幸福感——"既为了 Claude 本身,也因为这些品质可能关系到 Claude 的正直、判断力和安全性。"
展望¶
宪法是一份活的文件,持续演进中——未来将纳入法学、哲学、神学、心理学等领域专家的意见。
Anthropic 在制定过程中征求了外部专家和此前版本 Claude 的反馈。未来版本将纳入法学、哲学、神学、心理学等多学科专家的意见。
这部宪法适用于主线、通用的 Claude 模型。专用模型可能并不完全适用。
在宪法之外,Anthropic 持续推进互补方法:新的评估手段、误用防护、对齐失败调查,以及可解释性工具。参考 Claude 系统卡。
Anthropic 写道:"强大的 AI 模型将成为世界上的一种新力量,创造它们的人有机会帮助它们体现人类最好的一面。"