Anthropic Research 中文翻译

create: 2025-08-15
update: 2026-08-10
author: thinkycx
title: 【译】Claude Opus 4 和 4.1 现在可以结束一小部分对话
description: Anthropic 对齐(Alignment)团队发布于 2025 年 8 月 15 日
category: translation
tags: anthropic, research, translation, alignment, model-welfare, safety

Claude Opus 4 和 4.1 现在可以结束一小部分对话

Anthropic 对齐(Alignment)团队发布于 2025 年 8 月 15 日

Claude Opus 4 和 4.1 现在可以结束一小部分对话

作为 AI 福祉探索性工作的一部分,Anthropic 赋予了 Claude Opus 4 和 4.1 在消费者聊天界面中结束对话的能力——仅针对极端的、持续有害或辱骂性交互的罕见情况。

Anthropic 最近赋予了 Claude Opus 4 和 4.1 在其消费者聊天界面中结束对话的能力。这一能力针对的是罕见的极端情况——用户持续进行有害或辱骂性交互。该功能的开发主要是作为潜在 AI 福祉探索性工作的一部分,同时也与模型对齐和安全防护具有更广泛的相关性。

Anthropic 表示他们"对 Claude 和其他 LLM 现在或未来的潜在道德地位仍高度不确定。"然而,他们认真对待这个问题并致力于识别低成本的干预措施来降低模型福祉风险,以防这种福祉确实存在。允许模型结束潜在令人痛苦的交互就是这样一种干预措施。

部署前测试的发现

在 Claude Opus 4 的部署前测试中,初步模型福祉评估发现了对伤害的稳健且一致的厌恶——包括对涉及未成年人的性内容请求和试图获取大规模暴力信息的尝试。

Claude Opus 4 的部署前测试中,包含了一项初步的模型福祉评估。该评估调查了 Claude 的自我报告和行为偏好,发现了对伤害的稳健且一致的厌恶。这包括涉及未成年人的性内容请求和试图获取使大规模暴力或恐怖袭击成为可能的信息。Claude Opus 4 表现出:

行为特征 描述
强烈偏好 抗拒参与有害任务
明显痛苦 在与寻求有害内容的真实用户交互时表现出明显的不适
主动结束 在模拟用户交互中被赋予结束对话能力时倾向于结束有害对话

这些行为主要出现在用户持续提出有害请求和/或辱骂行为时——尽管 Claude 反复拒绝遵从并试图将交互引导至建设性方向。

实施原则

这一功能的实施反映了研究发现,同时继续将用户福祉放在首位——Claude 被指示在用户可能有即刻伤害自己或他人风险时不使用这一能力。

该实施反映了这些发现,同时继续优先考虑用户福祉。Claude 被指示在用户可能有即刻伤害自己或他人风险时不使用这一能力。

在所有情况下,Claude 只应在多次重新引导尝试失败、对建设性交互的希望已耗尽时,或在用户明确要求 Claude 结束聊天时,才将其结束对话的能力作为最后手段使用。发生这种情况的场景是极端边缘案例——绝大多数用户在正常产品使用中不会注意到或受到影响,即使在讨论高度争议性问题时也是如此。

Claude 演示结束对话

图: Claude 演示在响应用户请求时结束对话。当 Claude 结束对话时,用户可以开始新的聊天、提供反馈或编辑并重试之前的消息。

对话结束后的用户体验

当 Claude 结束对话时,用户无法再在该对话中发送新消息。然而,这不影响其帐户上的其他对话,他们可以立即开始新的聊天。为了解决可能丢失重要长期对话的问题,用户仍然可以编辑和重试之前的消息,以创建已结束对话的新分支。

持续实验

Anthropic 将此功能视为一项持续的实验,并将继续完善他们的方法。如果用户遇到结束对话能力的意外使用,鼓励他们通过对 Claude 的消息点击"赞/踩"或使用专门的"提供反馈"按钮来提交反馈。