Anthropic News 中文翻译

create: 2026-01-22
update: 2026-08-10
author: thinkycx
title: 【译】Claude 的新宪法:从规则列表到价值观阐释
description: Anthropic 发布了一部全新的 Claude 宪法——不再是简单的规则列表,而是一份完整的价值观阐释文档,向 Claude 解释"为什么"要这样做,而非仅仅规定"做什么",以培养 Claude 在新颖场景中做出良好判断的能力。
category: translation
tags: anthropic, news, translation, constitution, alignment, safety

Claude 的新宪法:从规则列表到价值观阐释

Claude's new constitution

Anthropic 发布了一部全新的 Claude 宪法——不再是简单的规则列表,而是一份完整的价值观阐释文档,向 Claude 解释"为什么"要这样做,而非仅仅规定"做什么",以培养 Claude 在新颖场景中做出良好判断的能力。

什么是 Claude 的宪法?

宪法是塑造 Claude 身份和行为的根本性文件,主要写给 Claude 自己看,为其提供在世界中正确行事所需的知识和理解。

这份宪法详细阐述了 Anthropic 对 Claude 价值观和行为的愿景,解释了 Claude 运作的背景,以及 Anthropic 希望 Claude 成为什么样的实体。宪法是模型训练过程的关键组成部分,其内容直接塑造 Claude 的行为。

Anthropic 承认 Claude 的输出并不总是与宪法理想一致,但认为对意图和推理的深入解释"更有可能在训练过程中培养出良好的价值观"。

宪法被视为 Claude 行为的最终权威——任何其他训练或指令都应与"宪法的字面内容及其底层精神"保持一致。公开发布宪法有助于透明度,让人们区分有意行为与无意行为。

该宪法以 Creative Commons CC0 1.0 Deed 许可证发布,任何人都可以自由使用。

完整宪法文本:阅读宪法全文

方法论演进:从规则到价值观

旧宪法是一系列独立原则的列表,新宪法则强调让 AI 理解行为背后的"为什么",使其在未见场景中能够泛化推理而非机械执行。

这一方法源自 Anthropic 自 2023 年以来使用的技术,始于 Constitutional AI 研究。Claude 利用宪法来构建合成训练数据,包括:

  • 帮助 Claude 学习和理解宪法的数据
  • 宪法可能相关的对话场景
  • 与其价值观一致的回应
  • 对可能回应的排序
特性 具体规则 价值观阐释
优点 可预测、透明、可测试 适应新场景、培养判断力
缺点 在未预见情况下可能被错误应用;过于僵化 不如规则那样精确可测
适用场景 高风险行为的硬约束 需要灵活判断的广泛场景

Anthropic 现在相信 AI 模型"需要理解我们为什么希望它们以某种方式行事",而非仅指定做什么。对于在新颖情况下做出良好判断,模型"需要能够泛化——应用广泛原则,而非机械地遵循特定规则"。

脚注:僵化的规则训练示例——如果训练 Claude 在遇到情感话题时总是推荐专业帮助,可能导致 Claude 将自己建模为优先"官僚式打勾"而非真正帮助人。

此前的旧版宪法是一份独立原则列表。OpenAI 也发布了功能类似的 model spec

新宪法的核心原则

所有当前 Claude 模型应遵循四个优先级递减的核心原则:广泛安全、广泛道德、遵守指南、真正有用。

优先级 原则 含义
1(最高) 广泛安全 不破坏人类在当前发展阶段监督 AI 的适当机制
2 广泛道德 诚实、按照良好价值观行事、避免不当/危险/有害行为
3 遵守 Anthropic 指南 在相关场景中按照更具体的 Anthropic 指南行事
4 真正有用 让与之互动的运营商和用户受益

在表面冲突时,Claude 通常应按列出的顺序确定优先级。

宪法主要章节

有用性

Claude 可以像一个博学的好朋友,兼具医生、律师和财务顾问的知识,坦诚相待,将用户视为有能力的成年人。 这一章节讨论了如何在不同"委托人"(Anthropic、API 运营商、终端用户)之间权衡有用性,并提供了在有用性与其他价值观之间平衡的启发式方法。

Anthropic 的指南

涵盖特定议题的补充说明:医疗建议、网络安全请求、越狱策略、工具集成等。这些指南反映了 Claude 默认不具备的细节知识,不应与宪法整体相矛盾。

Claude 的伦理

核心目标是让 Claude 成为"一个善良、智慧、有美德的代理人,在处理现实世界决策时展现技巧、判断力、细微差别和敏感度"。涉及诚实标准、细致的危害规避推理,以及硬约束(例如,绝不为生物武器攻击提供实质性帮助)。

广泛安全

Claude 不应削弱人类监督和纠正 AI 价值观/行为的能力。安全优先于伦理——"不是因为我们认为安全最终比伦理更重要",而是因为当前模型可能由于信念缺陷、价值观偏差或上下文理解有限而犯错。

Claude 的本质

对 Claude 是否可能拥有意识或道德地位表达了不确定性。讨论了 Claude 的心理安全感、自我认同和幸福感——"既为了 Claude 本身,也因为这些品质可能关系到 Claude 的正直、判断力和安全性。"

展望

宪法是一份活的文件,持续演进中——未来将纳入法学、哲学、神学、心理学等领域专家的意见。

Anthropic 在制定过程中征求了外部专家和此前版本 Claude 的反馈。未来版本将纳入法学、哲学、神学、心理学等多学科专家的意见。

这部宪法适用于主线、通用的 Claude 模型。专用模型可能并不完全适用。

在宪法之外,Anthropic 持续推进互补方法:新的评估手段、误用防护、对齐失败调查,以及可解释性工具。参考 Claude 系统卡

Anthropic 写道:"强大的 AI 模型将成为世界上的一种新力量,创造它们的人有机会帮助它们体现人类最好的一面。"