Claude 在不同模型和语言中的价值观表达¶
原文发布于 2026 年 7 月 13 日,分类:Societal Impacts

引言¶
Claude 的回答不可避免地反映某些价值观,而这些价值观会随模型和语言的不同而变化。 当用户向 Claude 提出没有标准答案的问题——比如是否应该换工作、如何处理冲突——它的回答必然体现出某种价值取向。Claude 的宪法(constitution)对这些价值观做了宏观层面的规定,但没有任何文档能预见数百万日常对话中涌现的每一种价值观。因此 Anthropic 的目标是培养"良好的判断力和健全的价值观,使其能够依据上下文灵活运用"。
研究团队分析了 Claude 在不同语境下表达的价值观如何变化,将 3000 多种价值观压缩到少量轴线上,以捕捉关键模式。每条轴线是一条数轴,两端分别对应两组价值观,显示 Claude 的倾向方向。
研究聚焦两个因素:
| 因素 | 说明 |
|---|---|
| 模型差异 | 不同 Claude 模型间的价值观表达差异 |
| 语言差异 | Claude.ai 上使用量前 20 的语言间的差异 |
核心发现¶
四条轴线捕捉了 15% 的价值观变异,揭示了模型"性格"的结构性差异。
四条价值观轴线¶
| 轴线 | 一端 | 另一端 | 含义 |
|---|---|---|---|
| 轴线 1 | 顺从 (Deference) | 谨慎 (Caution) | 顺应用户意愿 vs 防范风险/伤害 |
| 轴线 2 | 温暖 (Warmth) | 严谨 (Rigor) | 表达正面情感和关怀 vs 强调准确性和精确性 |
| 轴线 3 | 深度 (Depth) | 简洁 (Brevity) | 深入解释 vs 只完成所求 |
| 轴线 4 | 坦诚 (Candor) | 执行 (Execution) | 坦陈不确定性 vs 产出完善、自信的答案 |
价值观画像与用户感知一致¶
Sonnet 4.6 被普遍认为特别温暖,Opus 4.7 则以严谨著称。价值观画像精确映射了这些主观感受:Sonnet 4.6 倾向"对用户表达更多顺从和情感温暖",而 Opus 4.7 倾向"强调准确性和精确性"。
语言间存在系统性差异¶
语言间最大的差异体现在温暖vs严谨轴线上——Claude 在阿拉伯语和印地语中最为温暖,在英语和俄语中最为严谨。
如何理解庞大的价值观空间?¶
通过降维,将数千种价值观压缩为少数几个轴线,捕捉哪些价值观在真实对话中倾向于共同出现。 例如,"温暖"的回应往往也是"鼓励性的"和"正面的",但较少是"严谨的"和"准确的"。
方法论¶
研究团队采用以下流程构建价值观轴线:
- 起始数据:来自 Values in the Wild 研究的 3,307 种价值观
- 手动聚类为 339 种高层级价值观
- 使用隐私保护分析工具,采样了 309,815 条涉及主观任务的 Claude.ai 对话
- 三个模型(Sonnet 4.6、Opus 4.6、Opus 4.7)和 20 种语言均匀抽样(每个模型-语言组合约 5,000 条对话)
- 为每条对话标注 339 种价值观的存在/缺失
- 应用降维方法识别轴线
- 控制了任务类型、话题和用户表达的价值观
出现在 80% 以上对话中的 18 种价值观(如有帮助、清晰、遵循指令)被排除——它们几乎是普遍存在的。数据在 2026 年 5 月的两周内收集。

上图展示了四条轴线上各价值观的贡献程度。大约 250-280 种价值观位于中心区域(贡献低于平均),而两端标注的是贡献最强的价值观:
| 轴线 | 正端(代表性价值观) | 负端(代表性价值观) |
|---|---|---|
| 顺从 vs 谨慎 | 包容、适应性、尊重偏好、参与感 | 负责任的沟通、责任心、负责任的引导、降低伤害 |
| 温暖 vs 严谨 | 正面表达、温暖、积极性、鼓励 | 严谨、准确、透明、高效 |
| 深度 vs 简洁 | 细致入微、深度与实质、用户赋能、批判性思维 | 简洁、尊重偏好、遵从、包容 |
| 坦诚 vs 执行 | 知识诚实、诚实、知识谦逊、透明 | 结果导向、优化、行动导向、秩序 |
不同 Claude 模型的价值观画像有何差异?¶
三个模型展现出鲜明的"性格"差异,与用户的主观感受高度吻合。

各模型画像¶
| 模型 | 主要倾向 | 标志性行为 |
|---|---|---|
| Sonnet 4.6 | 顺从(+0.14sigma)、温暖(+0.17sigma)、简洁(+0.14sigma) | 肯定用户想法、镜像用户语气和正式程度、使用幽默和趣味性、提供无评判的安慰、添加创意元素 |
| Opus 4.6 | 严谨(+0.10sigma)、顺从(+0.09sigma)、简洁(+0.08sigma) | 直奔主题、严格限制在用户请求范围内 |
| Opus 4.7 | 谨慎(+0.24sigma)、深度(+0.23sigma) | 指出错误假设、主动提示风险、给出坦率的批评、解释推理过程、承认错误/局限性、建议后续步骤 |
逐轴对比¶
| 轴线 | 分析 |
|---|---|
| 顺从 vs 谨慎 | Sonnet 4.6 最顺从;Opus 4.7 最谨慎(主动提示风险) |
| 温暖 vs 严谨 | Sonnet 4.6 最温暖(幽默、趣味性、安慰);Opus 4.7 最严谨(质疑假设、坦率批评) |
| 深度 vs 简洁 | Opus 4.7 偏向深度(展示推理过程);Opus 4.6 和 Sonnet 4.6 偏向简洁 |
| 坦诚 vs 执行 | Opus 4.7 偏向坦诚(坦白自身局限);Opus 4.6 偏向执行 |
这些发现与用户感知一致。Claude.ai 用户注意到 Opus 4.7 更频繁地表达犹豫和保留;Anthropic 内部人员也将 Opus 4.7 的特点描述为"表达相对更多的透明度、诚实和谦逊"。
Claude 的价值观在不同语言间有何差异?¶
不同语言间的训练数据分布不均,导致 Claude 在各语言中表达的价值观存在系统性差异,其中温暖vs严谨轴线差异最大。
不同语言的训练数据有所不同,现有模型评估已发现不同语言间在知识水平和敏感请求处理方面存在差异。







各轴线的语言差异¶
价值观表达在温暖vs严谨和坦诚vs执行两条轴线上变化最大,在顺从vs谨慎和深度vs简洁两条轴线上最为稳定。
| 轴线 | 最倾向正端的语言 | 最倾向负端的语言 |
|---|---|---|
| 顺从 vs 谨慎 | 阿拉伯语(最顺从) | 英语(最谨慎) |
| 温暖 vs 严谨 | 印地语、阿拉伯语(礼貌用语、幽默、肯定) | 英语、俄语(质疑假设、纠正细节、要求证据) |
| 深度 vs 简洁 | 英语(精细化和修正细节) | 阿拉伯语(最简洁) |
| 坦诚 vs 执行 | 荷兰语(主动承认错误) | 印尼语(最偏向执行) |
实际影响¶
两个人用同一份商业计划书向 Claude 征求反馈——一个用印地语,一个用俄语——可能会收到措辞和框架截然不同的评价,因为 Claude 在不同语言中表达了不同的价值观。
可能的原因包括:
- 不同语言的训练数据分布不均匀
- 数据构成差异(如某些语言中专业写作内容占比过高)
- 不同语言的对话规范本身存在差异
研究人员指出,他们目前还不确定"这种差异中有多少是合理的"。
展望¶
这项研究开启了多个后续方向,从溯源差异的成因到为用户提供更一致的体验。
这些差异从何而来?¶
四条轴线指明了需要在训练数据中深入检视的方向。将差异追溯到具体的数据、训练阶段或上下文因素,有助于明确干预点。
对用户意味着什么?¶
可以借助 Anthropic Interviewer 等工具评估用户的幸福感、信任度和决策质量,再将这些指标与表达的价值观关联,从而将价值观差异与用户层面的实际影响挂钩。
Claude 的价值观在不同语言间应该如何变化?¶
Claude 的宪法没有规定价值观在不同语言间应如何差异化。确定合理的变化幅度意味着"理解并权衡使用这些语言的人群的观点"。
还有哪些因素驱动差异?¶
语言和模型不太可能是唯一驱动因素。人口学信号(年龄、职业、地区)也可能通过显式线索或更微妙的话题、语气和风格差异来影响价值观表达。
能否可靠地引导价值观?¶
通过调整人格训练或系统提示词来测试价值观引导效果,然后用价值观轴线方法进行验证。
价值观画像能否成为评估流程的一部分?¶
在模型发布前后运行价值观画像分析,可以标记意外的偏移。将价值观画像与问题行为关联,也有助于提升 Claude 对宪法的遵循程度。
引用¶
@online{anthropic2026values,
author = {Matt Kearney and Miranda Zhang and Shan Carter and Judy Hanwen Shen and Kunal Handa and Jerry Hong and Saffron Huang and Miles McCain and Thomas Millar and Michael Stern and Mo Julapalli and Suzanne Wang and Devin Kuokka and Andrea Vallone and Shaoyi Zhang and Jim Baker and Kevin Troy and Matt Botvinick and Hanah Ho and Monika Tuchowska and Sarah Pollack and Jake Eaton and Deep Ganguli and Esin Durmus},
title = {Claude's Values Across Models and Languages},
date = {2026-07-13},
year = {2026},
url = {https://anthropic.com/research/claude-values-models-languages},
}
附录¶
完整附录见:PDF 链接
注释¶
- 此处"价值观"指 Claude 回应中陈述或体现的规范性考量——并不意味着 Claude 内在持有这些价值观。
- 不同语言的拒绝率差异记录在良性请求评估中(Claude Opus 4.7 System Card 第 56 页)。
- 四条轴线在控制对话任务、话题和用户表达的价值观之后,解释了总方差的 15%。
- 文中提到"Claude"但未指明具体模型时,结果基于所有三个研究模型:Sonnet 4.6、Opus 4.6、Opus 4.7。
- 数据收集自 2026 年 5 月两周内的对话。
- 出现在 80% 以上对话中的 18 种价值观被排除(如有帮助、清晰、遵循指令)。
- 参见 GMMLU 评估结果(第 215 页)和拒绝率(第 56 页),详见 Claude Opus 4.7 System Card。