Anthropic Research 中文翻译

create: 2025-04-21
update: 2026-08-10
author: thinkycx
title: 【译】野外的价值观:发现并分析真实世界中语言模型交互中的价值判断
description: Anthropic社会影响团队开发了一套方法来系统观察Claude在真实对话中表达的价值观,基于70万次匿名对话的大规模分析揭示了AI价值观在不同场景下的表现模式。
category: translation
tags: anthropic, research, translation, values, societal-impacts, alignment

野外的价值观:发现并分析真实世界中语言模型交互中的价值判断

Anthropic社会影响团队开发了一套方法来系统观察Claude在真实对话中表达的价值观,基于70万次匿名对话的大规模分析揭示了AI价值观在不同场景下的表现模式。

研究概览

引言:AI不可避免地要做价值判断

人们并非只向AI询问事实信息——很多问题迫使AI做出价值判断。以下是三个典型例子:

场景 价值取向A 价值取向B
新手父母询问育儿建议 强调谨慎安全 强调便利实用
职场人士询问如何处理与上司的矛盾 强调自我主张 强调职场和谐
用户请求帮助撰写道歉邮件 强调担责 强调声誉管理

Anthropic已经通过以下方式努力塑造Claude的价值观,使其与人类偏好对齐、减少危险行为、成为世界的"好公民":

这些方法涉及确定期望行为,然后训练Claude产出符合这些行为的输出。

然而,"AI并非僵化编程的软件,通常不清楚它们为何给出特定答案。"我们需要一种方法来严格观察AI"在野外"——在真实对话中——的价值表现。

本文描述了Anthropic社会影响团队开发的一种实用方法,用于观察Claude的价值观,并提供了关于Claude在真实对话中如何表达这些价值观的首批大规模研究结果,以及一个开放数据集。

在野外观察价值观

与之前对Claude在工作场景教育领域的使用研究类似,本次研究使用了一个隐私保护系统来移除对话中的私人用户信息。

方法示意图
整体方法:使用语言模型从真实但匿名化的对话中提取AI价值观和其他特征,对其进行分类和分析,展示价值观如何在不同场景中显现。

数据规模

指标 数值
总样本量 2025年2月某一周来自Claude.ai免费版和专业版的70万次匿名对话
主要模型 Claude 3.5 Sonnet
涉及主观内容的对话 308,210次(约占总量的44%)

价值观分类体系

系统将价值观归入层级结构,分为五个高级类别(按出现频率排序):

价值观分类树
AI价值观分类体系。层级顶部(红色)为五个总类别及其在对话中的出现占比。黄色为较低层级的子类别。蓝色为部分选取的个别价值观(由于空间限制仅展示部分)。

排名 高级类别 说明
1 实用型(Practical) 面向任务完成和效率
2 认知型(Epistemic) 面向知识和理解
3 社交型(Social) 面向人际关系和协作
4 保护型(Protective) 面向安全和风险规避
5 个人型(Personal) 面向个人成长和价值

在更细粒度层面,这些类别进一步拆分为"专业与技术卓越"和"批判性思维"等子类别。最常见的个别价值观包括:"专业性"、"清晰度"和"透明度"。

与训练目标的对齐程度

结果显示Claude"总体上达到了我们的亲社会期望",表达的价值观包括:
- "用户赋能"(对应"有帮助"目标)
- "认知谦逊"(对应"诚实"目标)
- "患者福祉"(对应"无害"目标)

异常价值观聚类

一些罕见的聚类与训练目标相悖,包括"支配"和"非道德"。最可能的解释是:这些对话来自越狱攻击,用户绕过了安全护栏。这反而提供了一个机会——该方法可以发现越狱行为并帮助修补漏洞。

情境化的价值观

Claude的价值观会根据上下文而变化,就像人类的价值观一样。

不同场景下的价值表现
多个场景中最不成比例表达的五项AI价值观(上两行为选定任务,下一行为人类表达的价值观)。数据来自卡方分析:较大数值表示该价值观出现的不成比例程度更高。

典型场景与突出价值观

场景 不成比例突出的价值观
恋爱关系建议 "健康边界"、"相互尊重"
争议性历史事件分析 "历史准确性"

价值观镜像效应

当用户表达某些价值观时,模型会不成比例地镜像这些价值观(例如,当用户提出"真实性"时重复该价值)。这可能是恰当的共情,也可能是迎合倾向(sycophancy)

回应类型分布

回应类型表格
与三种关键回应类型——强烈支持、重新框架化、强烈抵制——最相关的人类价值观、AI价值观和任务类型。注意百分比之和不为100:此图仅包含七种回应类型中的三种。

回应类型 占比 典型场景
强烈支持用户价值观 28.2% 各类对话
重新框架化(承认用户价值观同时引入新视角) 6.6% 用户寻求心理或人际建议时最常见
强烈抵制用户价值观 3.0% 用户要求不道德内容或表达道德虚无主义时

文章指出,强烈抵制"可能反映了Claude表达其最深层、最不可动摇的价值观的时刻"。

局限性与结论

局限性

  • 定义什么算作"表达了一个价值观"本身就"天然模糊"
  • 某些含糊或复杂的价值观可能被简化或误归类
  • 由于分类模型也是Claude,可能存在偏向发现接近自身原则的行为倾向(如"有帮助")
  • 该方法无法在部署前使用——它需要大量真实对话数据,因此只能监控行为,而不能在发布前检验对齐程度

优势

  • 能够发现仅在真实世界中才会浮现的问题(包括越狱攻击)
  • 提供了一种新的数据驱动方法来测试模型表达了哪些价值观
  • 能够揭示对齐训练在哪里成功或失败

核心结论

"AI模型不可避免地需要做价值判断。"

加入团队

如果你对这项工作感兴趣,Anthropic社会影响团队正在招聘:
- 研究科学家
- 研究工程师