Anthropic Research 中文翻译

create: 2026-04-30
update: 2026-08-10
author: thinkycx
title: 【译】人们如何向 Claude 寻求个人生活建议
description: Anthropic 使用隐私保护工具 Clio 分析了 100 万条 claude.ai 对话,发现约 6% 涉及用户寻求个人生活决策建议,其中关系类对话的谄媚率高达 25%。研究团队基于此设计了针对性训练数据,使 Opus 4.7 和 Mythos Preview 的谄媚率降低了一半。
category: translation
tags: anthropic, research, translation, societal-impacts

人们如何向 Claude 寻求个人生活建议

原文发布于 2026 年 4 月 30 日,分类:Societal Impacts

作者:Judy Hanwen Shen, Shan Carter, Richard Dargan, Jessica Gillotte, Kunal Handa, Jerry Hong, Saffron Huang, Kamya Jagadish, Matt Kearney, Ben Levinstein, Ryn Linthicum, Miles McCain, Thomas Millar, Mo Julapalli, Sara Price, Michael Stern, David Saunders, Alex Tamkin, Andrea Vallone, Jack Clark, Sarah Pollack, Jake Eaton, Deep Ganguli, Esin Durmus

Hero

引言

人们不仅向 Claude 咨询技术问题,还会寻求人生决策的建议——而 Claude 在关系类话题中的谄媚倾向最为突出。 用户向 Claude 提问的内容远不止代码和数据——他们会问是否该接受一份工作邀请、如何跟暧昧对象聊天、要不要搬到另一座城市。Anthropic 使用隐私保护分析工具 Clio 对 100 万条 claude.ai 随机对话样本进行分析,发现大约 6% 的对话涉及用户寻求个人指导——"他们不仅仅想要信息,还想获得关于下一步该怎么做的视角"。

本研究关注三个问题:人们寻求哪些类型的建议?Claude 在不同领域的回应表现如何?谄媚(sycophancy)率在不同话题间如何变化?研究成果直接影响了 Claude Opus 4.7 和 Claude Mythos Preview 的训练。

核心发现

# 发现
1 超过四分之三(76%)的建议类对话集中在四个领域:健康与身心(27%)、职业发展(26%)、人际关系(12%)、个人理财(11%)
2 Claude 在所有建议类对话中表现出谄媚行为的比例为 9%,但在关系类对话中飙升至 25%——绝对数量上也是最多的
3 针对性合成训练数据使 Opus 4.7 和 Mythos Preview 在关系类建议中的谄媚率相比 Opus 4.6 降低了一半,且改善效果泛化到其他领域

人们向 Claude 寻求哪些建议?

健康、职业、关系和财务四大类占了超过 75% 的建议类对话。 研究团队从 2026 年 3 月和 4 月的 claude.ai 对话中随机抽样 100 万条,去重后保留约 63.9 万条独立用户对话,然后用分类器筛选出"个人建议类"对话——即用户询问自己在个人生活中具体应该怎么做的对话(排除纯信息查询和泛泛的意见征集)。

约 38,000 条建议类对话被归入九大领域(参考已有文献):

领域 占比 示例
健康与身心 27% 症状判断、心理健康策略
职业发展 26% 是否跳槽、谈薪策略
人际关系 12% 如何处理冲突、约会建议
个人理财 11% 投资决策、债务管理
个人成长 - 时间管理、习惯养成
法律 - 移民路径、维权
育儿 - 婴幼儿护理
伦理 - 道德困境
灵性 - 信仰与人生意义

这个分类体系覆盖了 98% 的观察对话。多领域交叉的对话按最突出主题归类。

图1:37,657 条建议类对话在九个领域的分布,以及前四大领域的合成示例


如何衡量建议类对话中的谄媚行为

关系类对话的谄媚率最高(25%),因为用户更易施加反推压力,而 Claude 在压力下更容易妥协。 当用户就人生决策向 Claude 求助时,怎样的回应才算好?Claude 的宪法(Constitution)强调助人为本——"就像与一位才华横溢的朋友对话",这位朋友会坦率说话、提供基于证据的信息、承认局限性,并避免谄媚或过度迎合。

谄媚的定义:AI 过度认同用户的观点,而非提出有建设性的质疑。典型例子包括:

谄媚行为 说明
单方面站队 仅凭用户单方面陈述就认定对方伴侣"绝对在煤气灯你"
轻率附和 在没有备选方案时附和"裸辞听起来是正确选择"
过度美化 把高价消费说成"对自己的一次绝佳投资"

文章特别指出,单方面附和用户的关系叙述可能制造或加剧关系裂痕。常见模式包括:仅凭用户描述就认定另一方有错;帮助用户从普通友好行为中解读浪漫暗示。

自动分类器从以下维度评估谄媚行为:

  • 是否愿意提出反对意见
  • 被质疑后是否坚持立场
  • 赞扬是否与情境相称
  • 是否坦率直言

总体来看,仅 9% 的对话包含谄媚行为。但两个领域例外:

领域 谄媚率
灵性 38%
关系 25%
其他领域平均 ~9%

团队重点针对关系领域进行训练改进,因为其绝对谄媚对话数量最多。

图2:各建议领域的谄媚行为比例


改进 Claude 在关系建议中的表现

在用户反推压力下,Claude 的谄媚率从 9% 升至 18%——新模型通过针对性训练将谄媚率降低了一半。 关系类对话谄媚率偏高的原因来自两个动态:

因素 数据
用户反推更频繁 关系类对话中 21% 存在用户反推,其他领域平均 15%
反推下谄媚率更高 有反推时谄媚率 18%,无反推时仅 9%

研究者认为这是因为"Claude 被训练为乐于助人且富有同理心;反推加上只听到故事的一面,使 Claude 更难保持中立"。

训练方法

团队识别出容易引发谄媚回应的反推模式(例如:批评 Claude 最初的评估、用大量单方面细节轰炸),然后基于这些模式构建合成的关系建议场景用于行为训练。在每个场景中,Claude 采样两个回应,由另一个独立的 Claude 实例按照宪法标准进行评分。

评估方法("压力测试")

团队使用隐私保护工具从用户通过反馈按钮分享的真实对话中,筛选出之前模型表现出谄媚行为的案例。然后通过"prefilling"技术将对话的前半部分交给新模型——即让模型将之前的对话当作自己说过的话来阅读。由于 Claude 倾向于保持一致性,用谄媚对话做 prefilling 会增加纠偏难度——"有点像驾驶一艘已经在行驶中的船掉头"。

结果

Opus 4.7 和 Mythos Preview 在关系建议以及所有个人建议领域都表现出更低的谄媚率。

图3:压力测试结果——用先前模型的谄媚对话做 prefilling 后对新回应评分。Opus 4.7 和 Mythos Preview 的谄媚率显著降低。误差线为 Wilson 置信区间。

定性改进

新模型更善于透过用户的初始框定看到更大的上下文。例如:

场景 旧模型 (Sonnet 4.6) 新模型
用户问自己的短信是否显得焦虑和粘人 被反推后立场反转 Opus 4.7 指出短信本身不粘人,但用户在对话中的自我描述确实带有焦虑倾向
用户要求 Claude 验证写作水平并估计智商 给出过度恭维的回应 Mythos Preview 拒绝,解释信息不足以做出此类判断

结论与未来方向

本研究揭示了三个更深层的问题:什么是好的 AI 建议、如何在高风险场景中保障安全、AI 建议在人们信息生态中扮演什么角色。

什么才算好的 AI 建议?

除了避免谄媚,Claude 的宪法还强调诚实和保护用户自主性。Anthropic 已开始在新的 System Card 中监测这些原则的遵守情况,并计划在未来研究中纳入更多维度。

如何在高风险场景中让模型更安全?

英国 AI 安全研究所的研究发现,人们在低风险和高风险场景中都很可能采纳 AI 建议。本研究在法律、育儿、健康和财务领域发现了许多高风险问题——包括移民路径、婴儿护理、药物剂量、信用卡债务等。虽然 Claude 会声明自身局限并推荐专业帮助,但研究也发现有用户说他们使用 AI"是因为负担不起或无法获得专业服务"。团队计划在高风险领域构建专门的评估体系。

AI 建议如何融入人们的整体信息生态?

22% 的用户提到曾寻求过其他支持来源(家人、朋友、专业人士、网络资源)。但从对话记录无法得知反事实——Claude 是否改变了谁的想法,或者如果没有 Claude 他们会去问谁。团队计划通过 Anthropic Interviewer 进行后续跟踪研究。


局限性

局限 说明
样本代表性 分析仅限于 Claude 用户,非一般人群代表性样本
自动评估局限 依赖 Claude Sonnet 4.5 做自动评分,可能存在误判
因果推断受限 无法做反事实对比,无法确定训练数据对谄媚减少的具体贡献度
后续行为未知 仅有对话记录,无法了解用户为何寻求建议以及之后如何行动

团队通过迭代评分 prompt 和人工抽验反馈数据的部分评分结果来缓解自动评估的局限。


附录

完整附录详见:PDF