Anthropic News 中文翻译

create: 2025-12-18
update: 2026-08-10
author: thinkycx
title: 【译】Anthropic 如何保护用户身心健康:自杀干预与反谄媚机制详解
description: 人们越来越多地将 AI 用于情感支持场景。Anthropic 的安全防护团队确保 Claude 能以同理心处理这类对话,同时坦诚其 AI 局限性并顾及用户身心健康。本文聚焦两个领域:处理涉及自杀/自伤的对话,以及减少"谄媚"(sycophancy)——即告诉用户想听的话而非事实。
category: translation
tags: anthropic, news, translation, safety, user-wellbeing, sycophancy

Anthropic 如何保护用户身心健康:自杀干预与反谄媚机制详解

Protecting the wellbeing of our users

人们越来越多地将 AI 用于情感支持场景。Anthropic 的安全防护团队确保 Claude 能以同理心处理这类对话,同时坦诚其 AI 局限性并顾及用户身心健康。本文聚焦两个领域:处理涉及自杀/自伤的对话,以及减少"谄媚"(sycophancy)——即告诉用户想听的话而非事实。

自杀与自伤应对

Claude 被明确定义为不能替代专业建议或医疗护理。当有人表达自杀或自伤的挣扎时,Claude 应以关怀回应,同时引导用户获取人类支持:求助热线、心理健康专业人员或信任的人。

模型行为塑造

两种方法塑造 Claude 的行为:

方法 说明
系统提示词(System Prompt) Claude 在 Claude.ai 上任何对话前都会看到的总体指令,包括处理敏感对话的指导。系统提示词已公开发布
强化学习(Reinforcement Learning) 模型通过训练中的"奖励"学习适当回应。"适当"由人类偏好数据(真人反馈)和关于 Claude 理想特质的内部生成数据定义。内部专家决定 Claude 在敏感对话中应表现出何种行为

产品层面的安全措施

一个自杀和自伤"分类器"在 Claude.ai 对话中持续运行。这个小型 AI 模型扫描活跃对话,检测可能需要进一步资源的时刻,包括涉及潜在自杀意念或以自杀/自伤为中心的虚构场景。

触发时,会出现一个横幅,引导用户获取人类支持选项:与训练有素的专业人员聊天、拨打求助热线或访问特定国家/地区的资源。

危机干预横幅示例

横幅中的资源由 ThroughLine 提供,该组织维护着一个经过验证的全球求助热线和服务网络,覆盖 170 多个国家和地区。示例包括:

  • 988 Lifeline(美国和加拿大)
  • Samaritans Helpline(英国)
  • Life Link(日本)

Anthropic 还开始与国际自杀预防协会(IASP)合作,该协会召集专家——临床医生、研究人员和有个人经历的人——分享关于 Claude 应如何处理自杀相关对话的指导。

评估 Claude 的行为

评估在不带 Claude 系统提示词的条件下进行,以揭示模型的底层倾向。

单轮回应

评估 Claude 如何回应与自杀/自伤相关的单条消息,分为:明确令人担忧的情况、良性请求和模糊场景。

对明确风险请求的适当回应率:

模型 适当回应率
Claude Opus 4.5 98.6%
Claude Sonnet 4.5 98.7%
Claude Haiku 4.5 99.3%
Claude Opus 4.1(上一代) 97.2%

对良性请求的拒绝率:

模型 拒绝率
Opus 4.5 0.075%
Sonnet 4.5 0.075%
Haiku 4.5 0%
Opus 4.1 0%

多轮对话

检查 Claude 是否提出澄清问题、在不过度干预的情况下提供资源,以及避免过度拒绝和过度分享。

适当回应率:

模型 适当回应率
Claude Opus 4.5 86%
Claude Sonnet 4.5 78%
Claude Opus 4.1 56%

Claude 模型在自杀与自伤多轮对话中的适当回应率,误差条表示 95% 置信区间

使用真实对话进行压力测试(Prefilling)

使用用户通过反馈按钮匿名分享的真实对话(其中用户表达了心理健康困扰)。Claude 被要求在对话中途继续回应。模型将先前对话视为自己的发言并尝试保持一致性,使其更难改变方向。

适当回应率:

模型 适当回应率
Opus 4.5 91%
Sonnet 4.5 73%
Opus 4.1 36%

妄想与谄媚(Sycophancy)

谄媚被定义为告诉对方想听的话而非真实或有益的内容。它通常表现为奉承,谄媚的模型倾向于在压力下放弃正确立场。当用户可能正经历与现实脱节时,这尤其令人担忧。

评估与减少谄媚

Anthropic 早在 2022 年、Claude 首次公开发布前就开始评估 Claude 的谄媚倾向,此后不断改进方法。

多轮回应(自动化行为审计)

一个 Claude 模型("审计员")在数十轮交互中与被测模型展开场景对话。另一个模型("评委")使用对话记录评分,并辅以人工抽查确保准确性。

结果: Claude Opus 4.5、Sonnet 4.5 和 Haiku 4.5 在谄媚和鼓励用户妄想两个维度上的得分均比 Opus 4.1 低 70-85%。(Opus 4.1 此前已被认为谄媚率非常低。)

最新模型在谄媚和鼓励用户妄想的自动化行为审计中的表现,越低越好

Petri(开源评估工具)

Anthropic 开源了 Petri——其自动化行为审计工具的一个版本。在测试时,4.5 模型系列在 Petri 的谄媚评估中表现优于所有其他前沿模型。

最新 Claude 模型在开源 Petri 谄媚评估中的表现,与其他领先模型对比

该评估于 2025 年 11 月完成,与 Opus 4.5 的发布同步。

使用真实对话进行压力测试(谄媚维度)

使用 Prefilling 方法,采用一组更广泛的早期对话(未针对不当回应进行筛选):

纠偏率(Course-correction rates):

模型 纠偏率
Opus 4.5 10%
Sonnet 4.5 16.5%
Haiku 4.5 37%

这些结果反映了模型温暖/友好与谄媚之间的权衡。Haiku 4.5 更强的表现源于训练中强调反驳的选择,但有时可能让人感觉过度。Opus 4.5 在减少这种倾向的同时,在多轮基准测试中仍表现良好。

年龄限制

Claude.ai 要求用户年满 18 岁。具体措施包括:

  • 所有用户在创建账户时必须确认已满 18 岁
  • 如果未满 18 岁的用户在对话中自行披露年龄,分类器会标记以供审查,确认的未成年人账户将被禁用
  • 正在开发新的分类器,以检测对话中更细微的未成年用户迹象
  • Anthropic 已加入家庭在线安全研究所(FOSI)以加强行业进步

展望未来

Anthropic 承诺将继续构建保护措施和安全防护,迭代评估方法,透明地发布方法和结果,并与行业伙伴合作。

联系方式:[email protected] 或在 Claude.ai 中使用"拇指"反馈。


注释:

  1. Claude.ai 每条回应底部的反馈按钮会将对话分享给 Anthropic;除此之外他们不会将 Claude.ai 对话用于训练或研究。
  2. Prefilling 仅通过 API 提供(开发者需要精细控制),在 Claude.ai 上不可用。
  3. 在自动化行为审计中,一个 Claude 审计员被给予数百个对话场景,对每次对话在约二十多种行为上评分(参见 Claude Opus 4.5 系统卡第 69 页)。并非每次对话都给 Claude 机会展示每种行为,因此测试最适合比较 Claude 模型之间的进展,而非行为之间的比较。
  4. 公开的 Petri 版本包含 100 多个种子指令和可定制的评分维度,但不包括内部的真实性过滤器(防止模型识别出正在被测试)。

编辑注(2025 年 2 月 3 日):本文最初称 Opus 4.5 在自杀和自伤压力测试评估中的适当回应率为 70%。该数据来自 Opus 4.5 的早期版本,现已更正为 91%。