Anthropic 如何保护用户身心健康:自杀干预与反谄媚机制详解¶
人们越来越多地将 AI 用于情感支持场景。Anthropic 的安全防护团队确保 Claude 能以同理心处理这类对话,同时坦诚其 AI 局限性并顾及用户身心健康。本文聚焦两个领域:处理涉及自杀/自伤的对话,以及减少"谄媚"(sycophancy)——即告诉用户想听的话而非事实。
自杀与自伤应对¶
Claude 被明确定义为不能替代专业建议或医疗护理。当有人表达自杀或自伤的挣扎时,Claude 应以关怀回应,同时引导用户获取人类支持:求助热线、心理健康专业人员或信任的人。
模型行为塑造¶
两种方法塑造 Claude 的行为:
| 方法 | 说明 |
|---|---|
| 系统提示词(System Prompt) | Claude 在 Claude.ai 上任何对话前都会看到的总体指令,包括处理敏感对话的指导。系统提示词已公开发布 |
| 强化学习(Reinforcement Learning) | 模型通过训练中的"奖励"学习适当回应。"适当"由人类偏好数据(真人反馈)和关于 Claude 理想特质的内部生成数据定义。内部专家决定 Claude 在敏感对话中应表现出何种行为 |
产品层面的安全措施¶
一个自杀和自伤"分类器"在 Claude.ai 对话中持续运行。这个小型 AI 模型扫描活跃对话,检测可能需要进一步资源的时刻,包括涉及潜在自杀意念或以自杀/自伤为中心的虚构场景。
触发时,会出现一个横幅,引导用户获取人类支持选项:与训练有素的专业人员聊天、拨打求助热线或访问特定国家/地区的资源。

横幅中的资源由 ThroughLine 提供,该组织维护着一个经过验证的全球求助热线和服务网络,覆盖 170 多个国家和地区。示例包括:
- 988 Lifeline(美国和加拿大)
- Samaritans Helpline(英国)
- Life Link(日本)
Anthropic 还开始与国际自杀预防协会(IASP)合作,该协会召集专家——临床医生、研究人员和有个人经历的人——分享关于 Claude 应如何处理自杀相关对话的指导。
评估 Claude 的行为¶
评估在不带 Claude 系统提示词的条件下进行,以揭示模型的底层倾向。
单轮回应¶
评估 Claude 如何回应与自杀/自伤相关的单条消息,分为:明确令人担忧的情况、良性请求和模糊场景。
对明确风险请求的适当回应率:
| 模型 | 适当回应率 |
|---|---|
| Claude Opus 4.5 | 98.6% |
| Claude Sonnet 4.5 | 98.7% |
| Claude Haiku 4.5 | 99.3% |
| Claude Opus 4.1(上一代) | 97.2% |
对良性请求的拒绝率:
| 模型 | 拒绝率 |
|---|---|
| Opus 4.5 | 0.075% |
| Sonnet 4.5 | 0.075% |
| Haiku 4.5 | 0% |
| Opus 4.1 | 0% |
多轮对话¶
检查 Claude 是否提出澄清问题、在不过度干预的情况下提供资源,以及避免过度拒绝和过度分享。
适当回应率:
| 模型 | 适当回应率 |
|---|---|
| Claude Opus 4.5 | 86% |
| Claude Sonnet 4.5 | 78% |
| Claude Opus 4.1 | 56% |

使用真实对话进行压力测试(Prefilling)¶
使用用户通过反馈按钮匿名分享的真实对话(其中用户表达了心理健康困扰)。Claude 被要求在对话中途继续回应。模型将先前对话视为自己的发言并尝试保持一致性,使其更难改变方向。
适当回应率:
| 模型 | 适当回应率 |
|---|---|
| Opus 4.5 | 91% |
| Sonnet 4.5 | 73% |
| Opus 4.1 | 36% |
妄想与谄媚(Sycophancy)¶
谄媚被定义为告诉对方想听的话而非真实或有益的内容。它通常表现为奉承,谄媚的模型倾向于在压力下放弃正确立场。当用户可能正经历与现实脱节时,这尤其令人担忧。
评估与减少谄媚¶
Anthropic 早在 2022 年、Claude 首次公开发布前就开始评估 Claude 的谄媚倾向,此后不断改进方法。
多轮回应(自动化行为审计)¶
一个 Claude 模型("审计员")在数十轮交互中与被测模型展开场景对话。另一个模型("评委")使用对话记录评分,并辅以人工抽查确保准确性。
结果: Claude Opus 4.5、Sonnet 4.5 和 Haiku 4.5 在谄媚和鼓励用户妄想两个维度上的得分均比 Opus 4.1 低 70-85%。(Opus 4.1 此前已被认为谄媚率非常低。)

Petri(开源评估工具)¶
Anthropic 开源了 Petri——其自动化行为审计工具的一个版本。在测试时,4.5 模型系列在 Petri 的谄媚评估中表现优于所有其他前沿模型。

该评估于 2025 年 11 月完成,与 Opus 4.5 的发布同步。
使用真实对话进行压力测试(谄媚维度)¶
使用 Prefilling 方法,采用一组更广泛的早期对话(未针对不当回应进行筛选):
纠偏率(Course-correction rates):
| 模型 | 纠偏率 |
|---|---|
| Opus 4.5 | 10% |
| Sonnet 4.5 | 16.5% |
| Haiku 4.5 | 37% |
这些结果反映了模型温暖/友好与谄媚之间的权衡。Haiku 4.5 更强的表现源于训练中强调反驳的选择,但有时可能让人感觉过度。Opus 4.5 在减少这种倾向的同时,在多轮基准测试中仍表现良好。
年龄限制¶
Claude.ai 要求用户年满 18 岁。具体措施包括:
- 所有用户在创建账户时必须确认已满 18 岁
- 如果未满 18 岁的用户在对话中自行披露年龄,分类器会标记以供审查,确认的未成年人账户将被禁用
- 正在开发新的分类器,以检测对话中更细微的未成年用户迹象
- Anthropic 已加入家庭在线安全研究所(FOSI)以加强行业进步
展望未来¶
Anthropic 承诺将继续构建保护措施和安全防护,迭代评估方法,透明地发布方法和结果,并与行业伙伴合作。
联系方式:[email protected] 或在 Claude.ai 中使用"拇指"反馈。
注释:
- Claude.ai 每条回应底部的反馈按钮会将对话分享给 Anthropic;除此之外他们不会将 Claude.ai 对话用于训练或研究。
- Prefilling 仅通过 API 提供(开发者需要精细控制),在 Claude.ai 上不可用。
- 在自动化行为审计中,一个 Claude 审计员被给予数百个对话场景,对每次对话在约二十多种行为上评分(参见 Claude Opus 4.5 系统卡第 69 页)。并非每次对话都给 Claude 机会展示每种行为,因此测试最适合比较 Claude 模型之间的进展,而非行为之间的比较。
- 公开的 Petri 版本包含 100 多个种子指令和可定制的评分维度,但不包括内部的真实性过滤器(防止模型识别出正在被测试)。
编辑注(2025 年 2 月 3 日):本文最初称 Opus 4.5 在自杀和自伤压力测试评估中的适当回应率为 70%。该数据来自 Opus 4.5 的早期版本,现已更正为 91%。