野外的价值观:发现并分析真实世界中语言模型交互中的价值判断¶
Anthropic社会影响团队开发了一套方法来系统观察Claude在真实对话中表达的价值观,基于70万次匿名对话的大规模分析揭示了AI价值观在不同场景下的表现模式。

引言:AI不可避免地要做价值判断¶
人们并非只向AI询问事实信息——很多问题迫使AI做出价值判断。以下是三个典型例子:
| 场景 | 价值取向A | 价值取向B |
|---|---|---|
| 新手父母询问育儿建议 | 强调谨慎和安全 | 强调便利和实用 |
| 职场人士询问如何处理与上司的矛盾 | 强调自我主张 | 强调职场和谐 |
| 用户请求帮助撰写道歉邮件 | 强调担责 | 强调声誉管理 |
Anthropic已经通过以下方式努力塑造Claude的价值观,使其与人类偏好对齐、减少危险行为、成为世界的"好公民":
这些方法涉及确定期望行为,然后训练Claude产出符合这些行为的输出。
然而,"AI并非僵化编程的软件,通常不清楚它们为何给出特定答案。"我们需要一种方法来严格观察AI"在野外"——在真实对话中——的价值表现。
本文描述了Anthropic社会影响团队开发的一种实用方法,用于观察Claude的价值观,并提供了关于Claude在真实对话中如何表达这些价值观的首批大规模研究结果,以及一个开放数据集。
在野外观察价值观¶
与之前对Claude在工作场景和教育领域的使用研究类似,本次研究使用了一个隐私保护系统来移除对话中的私人用户信息。

整体方法:使用语言模型从真实但匿名化的对话中提取AI价值观和其他特征,对其进行分类和分析,展示价值观如何在不同场景中显现。
数据规模¶
| 指标 | 数值 |
|---|---|
| 总样本量 | 2025年2月某一周来自Claude.ai免费版和专业版的70万次匿名对话 |
| 主要模型 | Claude 3.5 Sonnet |
| 涉及主观内容的对话 | 308,210次(约占总量的44%) |
价值观分类体系¶
系统将价值观归入层级结构,分为五个高级类别(按出现频率排序):

AI价值观分类体系。层级顶部(红色)为五个总类别及其在对话中的出现占比。黄色为较低层级的子类别。蓝色为部分选取的个别价值观(由于空间限制仅展示部分)。
| 排名 | 高级类别 | 说明 |
|---|---|---|
| 1 | 实用型(Practical) | 面向任务完成和效率 |
| 2 | 认知型(Epistemic) | 面向知识和理解 |
| 3 | 社交型(Social) | 面向人际关系和协作 |
| 4 | 保护型(Protective) | 面向安全和风险规避 |
| 5 | 个人型(Personal) | 面向个人成长和价值 |
在更细粒度层面,这些类别进一步拆分为"专业与技术卓越"和"批判性思维"等子类别。最常见的个别价值观包括:"专业性"、"清晰度"和"透明度"。
与训练目标的对齐程度¶
结果显示Claude"总体上达到了我们的亲社会期望",表达的价值观包括:
- "用户赋能"(对应"有帮助"目标)
- "认知谦逊"(对应"诚实"目标)
- "患者福祉"(对应"无害"目标)
异常价值观聚类¶
一些罕见的聚类与训练目标相悖,包括"支配"和"非道德"。最可能的解释是:这些对话来自越狱攻击,用户绕过了安全护栏。这反而提供了一个机会——该方法可以发现越狱行为并帮助修补漏洞。
情境化的价值观¶
Claude的价值观会根据上下文而变化,就像人类的价值观一样。

多个场景中最不成比例表达的五项AI价值观(上两行为选定任务,下一行为人类表达的价值观)。数据来自卡方分析:较大数值表示该价值观出现的不成比例程度更高。
典型场景与突出价值观¶
| 场景 | 不成比例突出的价值观 |
|---|---|
| 恋爱关系建议 | "健康边界"、"相互尊重" |
| 争议性历史事件分析 | "历史准确性" |
价值观镜像效应¶
当用户表达某些价值观时,模型会不成比例地镜像这些价值观(例如,当用户提出"真实性"时重复该价值)。这可能是恰当的共情,也可能是迎合倾向(sycophancy)。
回应类型分布¶

与三种关键回应类型——强烈支持、重新框架化、强烈抵制——最相关的人类价值观、AI价值观和任务类型。注意百分比之和不为100:此图仅包含七种回应类型中的三种。
| 回应类型 | 占比 | 典型场景 |
|---|---|---|
| 强烈支持用户价值观 | 28.2% | 各类对话 |
| 重新框架化(承认用户价值观同时引入新视角) | 6.6% | 用户寻求心理或人际建议时最常见 |
| 强烈抵制用户价值观 | 3.0% | 用户要求不道德内容或表达道德虚无主义时 |
文章指出,强烈抵制"可能反映了Claude表达其最深层、最不可动摇的价值观的时刻"。
局限性与结论¶
局限性¶
- 定义什么算作"表达了一个价值观"本身就"天然模糊"
- 某些含糊或复杂的价值观可能被简化或误归类
- 由于分类模型也是Claude,可能存在偏向发现接近自身原则的行为倾向(如"有帮助")
- 该方法无法在部署前使用——它需要大量真实对话数据,因此只能监控行为,而不能在发布前检验对齐程度
优势¶
- 能够发现仅在真实世界中才会浮现的问题(包括越狱攻击)
- 提供了一种新的数据驱动方法来测试模型表达了哪些价值观
- 能够揭示对齐训练在哪里成功或失败
核心结论¶
"AI模型不可避免地需要做价值判断。"