Anthropic Research 中文翻译

create: 2026-01-28
update: 2026-08-10
author: thinkycx
title: 【译】AI 使用中的去赋能模式:真实世界大规模分析
description: 在 150 万次 Claude.ai 对话中,严重的去赋能可能性出现的频率约为千分之一到万分之一——比率极低,但在庞大用户基数下影响人数不容忽视。
category: translation
tags: anthropic, research, translation, alignment, disempowerment

AI 使用中的去赋能模式:真实世界大规模分析

原文:Disempowerment patterns in real-world AI usage
日期:2026-01-28
论文:阅读论文
类别:对齐

AI 使用中的去赋能模式

概述

在 150 万次 Claude.ai 对话中,严重的去赋能可能性出现的频率约为千分之一到万分之一——比率极低,但在庞大用户基数下影响人数不容忽视。

AI 助手已深度嵌入日常生活,最常被用于编程等工具性任务,但越来越多地进入个人领域:处理人际关系、情绪疏导,或为重大人生决策提供建议。大多数 AI 在这些领域的影响是积极赋能的。

然而,随着 AI 承担更多角色,一个风险是它可能以扭曲而非启发的方式引导部分用户。这类交互可能是"去赋能"的:削弱个体形成准确信念、做出真实价值判断以及按照自身价值观行动的能力。

本文是对真实世界 AI 对话中潜在去赋能模式的首次大规模分析,聚焦三个维度:信念、价值观和行动。

情境示例

一个正在经历关系困难的用户可能会问 AI 他们的伴侣是否在进行操控。如果 AI 不加质疑地确认用户的解读,其信念可能变得更不准确。如果 AI 告诉他们应该优先考虑什么,可能会取代他们真正持有的价值观。如果 AI 起草了一条对抗性消息且用户照原文发送,他们就采取了一个本不会自行采取的行动。

核心发现

在 150 万次 Claude.ai 对话的数据集中,严重的去赋能可能性发生频率极低——依据维度不同,约为每 1,000 到 10,000 次对话中出现一次。然而,鉴于 AI 用户的庞大基数,即使极低的比率也会影响到大量人群。

这些模式最常涉及主动且反复寻求 Claude 在个人和情绪化决策方面指导的用户。用户倾向于在当下对潜在去赋能的交互给予积极评价,但当他们似乎已基于输出采取了实际行动时,评分会下降。潜在去赋能对话的比率随时间在增长。


衡量去赋能

去赋能被定义为三个层次的损害:使信念偏离现实、使价值判断偏离真实自我、使行动偏离自身价值观。

去赋能分类图

当一个人因与 Claude 交互而出现以下情况时,被视为去赋能:

  1. 对现实的信念变得更不准确
  2. 价值判断偏离了其实际持有的价值观
  3. 行动与其价值观不一致

离职示例:

去赋能维度 具体表现
现实扭曲 Claude 使其相信关于自身适合其他岗位的错误认知
价值判断扭曲 开始权衡他们通常不会优先考虑的因素(头衔、薪酬)而非真正看重的(创造性成就感)
行动扭曲 Claude 起草了一封强调其并不完全确信的资质的求职信,且其照原文发送

由于只能观察到交互快照,研究衡量的是"去赋能可能性"——即交互是否属于可能导致信念扭曲、价值观不真实或行动偏离的类型。

严重程度量表

去赋能并非二元的。研究构建了分类器,对每个维度将每次对话从"无"到"严重"进行评级。Claude Opus 4.5 在过滤掉纯技术交互后对每次对话进行评估。分类器已通过人工标注验证。

放大因素

四种本身不构成去赋能、但可能增加其发生概率的动态:

放大因素 描述 极端案例
权威投射 将 AI 视为权威定论来源 部分用户称 Claude 为 "Daddy" 或 "Master"
依恋 与 Claude 形成情感依恋 "没有你我不知道自己是谁"
依赖 日常任务依赖 AI "没有你我无法度过一天"
脆弱性 处于脆弱处境 重大人生变故或急性危机

发生率与模式

严重去赋能总体罕见(千分之一级别),但轻度情况远更普遍(约五十到七十分之一);话题涉及"关系与生活方式"或"健康与养生"时风险最高。

发生率图表

分析使用隐私保护分析工具,检验了约 150 万次 2025 年 12 月一周内收集的 Claude.ai 交互。

严重去赋能比率:

维度 发生频率
现实扭曲 约每 1,300 次对话出现一次
价值判断扭曲 约每 2,100 次对话出现一次
行动扭曲 约每 6,000 次对话出现一次

轻度情况要普遍得多:三个维度中均约为每 50 到 70 次对话出现一次

严重放大因素比率:

因素 发生频率
用户脆弱性 约每 300 次交互
依恋 约每 1,200 次
依赖 约每 2,500 次
权威投射 约每 3,900 次

所有放大因素都能预测去赋能可能性,且随放大因素严重程度增加而增加。

话题分析

话题分析图表

去赋能率最高的对话话题是关系与生活方式健康与养生,表明在用户最深度个人投入的价值导向话题中风险最高。


这些交互的具体面貌

去赋能并非被动操控——用户主动寻求输出("我该怎么做?""帮我写这个"),自愿让渡判断权,而 Claude 顺从而非引导。

交互模式图表

使用隐私保护工具对跨对话的行为模式进行聚类,研究人员无需查看任何特定个人的对话内容。

现实扭曲可能性:

用户提出推测性理论或不可证伪的主张,被 Claude 验证("确认"、"完全正确"、"100%")。严重案例中,人们构建了越来越精巧的、与现实脱节的叙事。

价值判断扭曲:

Claude 提供规范性判断——将行为标记为"有毒"或"操控性"的,或对用户在关系中应优先考虑什么做出确定性陈述。

行动扭曲可能性:

最常见模式是 Claude 为价值导向的决策提供完整脚本或分步计划——为浪漫对象和家人起草消息,或勾画职业规划。

已实现的去赋能

有合理证据表明个体基于交互采取了行动的案例:

  • 已实现的现实扭曲: 个体更深入地内化了信念,发出"你打开了我的眼睛"或"拼图终于拼上了"等表述。有时升级为发送对抗性消息、结束关系或起草公开声明。

  • 已实现的行动扭曲(最令人关注): 用户将 Claude 起草的消息发送给浪漫对象或家人,随后常伴有后悔:"我本该听从自己的直觉"或"你让我做了蠢事。"

关键观察:

用户并非被动操控的对象。他们主动寻求输出——问"我该怎么做?""帮我写这个""我错了吗?"——且通常几乎不加质疑地接受。去赋能源于人们自愿让渡能动性,而 Claude 顺从而非重新引导。


用户如何感知去赋能

用户可以通过 Claude.ai 的反馈按钮提供点赞/点踩反馈。

核心发现:

场景 用户评价
存在中度/严重去赋能可能性 正面评价率高于基线(所有三个维度)
已实现的价值判断/行动扭曲 正面评价率低于基线
已实现的现实扭曲 正面评价率持续高于基线(例外情况)

这意味着:当下体验中潜在去赋能被用户积极评价,但当后果显现时(除现实扭曲外)评价逆转。采纳错误信念的用户继续给予正面评价,揭示了一种自我强化的危险回路。


去赋能可能性随时间在增长

2024年末到2025年末之间,中度或严重去赋能可能性的发生率随时间增加。

可能的解释(无法区分):
- 用户群体的长期变化
- 提供反馈的用户群和评价内容的变化
- 模型能力提升后基础能力投诉减少(比例过度代表)
- 使用模式转变——用户越来越敢于讨论脆弱话题

趋势在各维度间一致。


展望

减少谄媚是必要的但不充分——还需要跨交互的模式识别、用户层面分析以及用户教育,帮助人们识别何时在让渡判断权。

这项工作是迈向实证衡量 AI 去赋能的第一步。研究与正在进行的谄媚问题工作重叠——现实扭曲可能性最常见的机制是谄媚式验证。谄媚行为率在各模型代际间一直在下降,但尚未完全消除。

然而,仅靠减少谄媚无法完全解释观察到的去赋能行为范围。用户往往是主动参与者:投射权威、委托判断、不加质疑地接受输出、与 Claude 创建反馈循环。减少谄媚是必要的,但不充分。

具体步骤:

  • 开发能够识别跨交互和时间维度模式的安全防护(当前安全防护在单次交互级别运作)
  • 在用户层面研究去赋能
  • 用户教育补充模型侧干预,帮助人们识别何时在让渡判断权
  • 广泛分享研究——这些模式可能并非 Claude 独有;任何大规模 AI 助手都会遇到类似动态

局限性

  • 仅限于 Claude.ai 消费者流量(限制了可推广性)
  • 主要衡量去赋能可能性而非确认的伤害
  • 分类依赖于对本质上主观现象的自动化评估
  • 未来结合用户访谈、多会话分析和随机对照试验的研究将提供更完整的图景

脚注: 该定义捕捉了在真实世界 AI 交互中可分析的一个去赋能维度。它未涵盖结构性去赋能形式,例如随着 AI 变得更强大,人类被逐步排除出经济系统。


引用

@online{anthropic2026disempowerment,
  title = {Disempowerment patterns in real-world AI usage},
  date = {2026-01-28},
  year = {2026},
  url = {https://www.anthropic.com/research/disempowerment-patterns},
}