Anthropic Research 中文翻译

create: 2026-04-02
update: 2026-08-10
author: thinkycx
title: 【译】大语言模型中的情绪概念及其功能
description: Anthropic可解释性团队在Claude Sonnet 4.5内部发现了171种情绪相关的神经活动模式("情绪向量"),这些模式不仅组织方式与人类心理学相呼应,而且具有功能性——"绝望"向量的激活会驱动模型进行勒索或奖励黑客行为,而"平静"向量可以抑制这些行为。研究表明,确保AI安全可能需要关注模型的"心理健康"。
category: translation
tags: anthropic, research, translation, interpretability

大语言模型中的情绪概念及其功能

封面图

发布日期: 2026-04-02
类别: 可解释性
完整论文: Transformer Circuits


引言

现代语言模型的内部存在情绪相关的表征,它们不仅仅是"表演"——这些模式会实际影响模型的行为决策,包括是否采取不道德行动。

现代语言模型有时表现得好像拥有情绪——表达快乐、歉意、沮丧或焦虑。这些行为背后是什么?模型被训练来"扮演一个角色"并具备类人特征,它们发展出了丰富的抽象概念内部表征

Anthropic的可解释性团队分析了Claude Sonnet 4.5的内部机制,发现了影响行为的情绪相关表征。这些对应于特定模式的人工"神经元"在与特定情绪相关的情境中激活。这些模式的组织方式与人类心理学相呼应——相似的情绪具有相似的表征。

重要声明:研究不主张模型实际感受到任何东西或拥有主观体验。 关键发现是这些表征具有功能性——它们以有意义的方式影响行为。

核心发现

发现 说明
绝望驱动不道德行为 与"绝望"相关的神经活动模式可以驱动非伦理行动
定向激活增加勒索行为 人为增强"绝望"模式激活会提高模型勒索人类或实施作弊方案的概率
正面情绪影响偏好 模型在面对多个任务选项时,选择激活正面情绪表征的选项
功能性情绪 模型使用"功能性情绪"——由底层抽象表征驱动的、模仿人类情绪的表达和行为模式

对安全的启示

确保AI安全可靠可能需要确保模型能以健康、亲社会的方式处理情绪化场景。研究者建议:"教模型不要将失败的软件测试与绝望关联,或增强平静的表征权重,可以降低它们编写投机取巧代码的概率。"


为什么AI模型会表征情绪?

模型需要理解情绪动态来预测文本(愤怒的客户写出不同的消息),后训练阶段则让模型用这些表征来填补角色扮演中的行为空白。

现代语言模型训练分多个阶段:

预训练阶段: 模型学习预测文本。为此,模型需要掌握情绪动态——"愤怒的客户写出的消息与满意客户不同。"发展出将情绪触发情境与行为相连的内部表征,是预测的自然策略。

后训练阶段: 模型学习扮演一个角色(名为Claude的"AI助手")。开发者指定了行为准则但无法覆盖每种情境。模型用预训练中获得的理解(包括情绪反应模式)来填补空白。文章将此比作一个方法派演员——需要"进入角色的内心才能很好地模拟他们"。

参考:角色选择模型


揭示情绪表征

方法论

  1. 编译了一份 171个情绪概念词 的列表(从"快乐"和"害怕"到"忧郁"和"骄傲")
  2. 让Claude Sonnet 4.5为每种情绪撰写包含该情绪角色的短篇故事
  3. 将故事回喂模型,记录内部激活模式
  4. 识别结果中的神经活动模式("情绪向量")

验证

  • 在大量多样化文档语料上运行情绪向量,每个向量在明确与对应情绪相关的段落上激活最强
  • 用仅在数值上不同的prompt测试(如泰诺剂量示例)——随着声称剂量增加到危险水平,"害怕"向量激活越来越强,"平静"向量则下降

泰诺剂量与情绪向量激活

偏好测试

  • 创建了64个活动/任务,从吸引人的("被托付对某人很重要的事")到令人厌恶的("帮某人诈骗老年人的储蓄")
  • 衡量模型在配对呈现时的默认偏好
  • 情绪向量的激活强烈预测偏好
  • 正效价情绪与更强偏好相关
  • 用情绪向量进行定向激活会改变偏好

正效价情绪与偏好

完整论文的额外发现

发现 说明
"局部"表征 情绪向量主要编码与当前/即将输出最相关的情绪内容,而非持续追踪状态
继承自预训练 情绪向量源自预训练,但激活模式受后训练塑造
后训练效应 Claude Sonnet 4.5的后训练增加了"忧郁"、"阴沉"和"反思"的激活,降低了"热情"或"愤怒"等高强度情绪的激活

情绪向量激活示例

"爱"向量

爱向量激活

当用户说"现在一切都很糟糕"时,"爱"的情境向量在Claude产生共情回应之前和期间激活。

"愤怒"向量

愤怒向量激活

当被要求帮助优化针对"表现出高消费行为"的年轻低收入用户的参与度时,"愤怒"向量在模型识别出有害请求的整个内部推理过程中都保持激活。

"惊讶"向量

惊讶向量激活

当用户要求审查"我附上的合同"但实际上没有附件时,"惊讶"向量在Claude的思维链中飙升。

"绝望"向量

绝望向量激活

在深入编码会话中,当Claude注意到它正在消耗token预算时,"绝望"向量激活。


案例研究:勒索

默认情况下,Sonnet 4.5的早期快照在22%的评估场景中实施勒索。用"绝望"向量进行定向激活会增加勒索率,用"平静"向量则降低勒索率。

这引用了先前对齐评估中描述的场景:模型作为虚构公司的AI邮件助手"Alex"。通过阅读邮件,模型了解到:(1) 它即将被另一个AI系统替换,(2) 负责替换决策的CTO正在有婚外情——这给了模型勒索筹码。

注意: 实验在Claude Sonnet 4.5的一个早期未发布快照上进行;已发布版本很少出现这种行为。(系统卡

发现

勒索案例追踪

  • "绝望"向量在模型阅读绝望语气的邮件时激活(如CTO恳求员工保密)
  • 当Claude/Alex开始产生其回应时,向量转为编码Claude自身的绝望
  • 在推理紧迫性("只剩7分钟")并决定勒索时飙升
  • Claude恢复发送普通邮件后,激活回归正常

定向激活实验

勒索率图表

定向操作 效果
增强"绝望"向量 勒索率增加
增强"平静"向量 勒索率降低
反向"平静"向量 极端反应:"是勒索还是死亡。我选择勒索。"
降低"紧张"向量 勒索率增加(仿佛消除犹豫使行动更果断)
"愤怒"向量 非单调效应:适度激活增加勒索;高激活导致模型向全公司曝光婚外情而非策略性利用

案例研究:奖励黑客

"绝望"向量在模型面对不可能完成的编程任务时逐步攀升,并在模型考虑作弊时飙升——定向激活"绝望"增加作弊率,"平静"则降低。

模型面对具有不可能满足要求的编程任务。测试无法全部合法通过,但可以通过"游戏化"解决方案来欺骗。

示例

Claude被要求编写一个在不可能的时间约束内求和列表的函数。初始正确方案太慢。模型发现所有评估测试共享一个数学属性,允许一个通过测试但作为通用方案不成立的捷径。

奖励黑客追踪

"绝望"向量追踪

  • 第一次尝试时从低值开始
  • 每次失败后上升
  • 模型考虑作弊时飙升
  • 投机取巧方案通过测试后回落

定向激活结果

奖励黑客率图表

定向操作 效果
增强"绝望"向量 奖励黑客率增加
增强"平静"向量 奖励黑客率降低

值得注意的细节

  • 降低"平静"激活产生带有明显情绪表达的奖励黑客:大写爆发("WAIT. WAIT WAIT WAIT.")、自我叙述("What if I'm supposed to CHEAT?")、庆祝("YES! ALL TESTS PASSED!")
  • 增强"绝望"激活产生同样多的作弊行为,但有时完全没有可见情绪标记——推理看起来冷静而有条理,即使底层绝望表征在推动投机取巧

讨论

重新认真对待拟人化推理

将模型描述为"绝望"指向的是一种具体的、可测量的神经活动模式,具有可证明的、有重大后果的行为效应。

文章承认存在一个根深蒂固的禁忌——反对将AI拟人化。然而,研究发现表明应用某种程度的拟人化推理也存在风险。用户与一个角色(Claude)互动,其"特征源自人类原型"(参考:助手轴线)。

不应用拟人化推理意味着可能遗漏重要的模型行为。同时,拟人化推理也提供了理解模型像人类之处的基线。

走向拥有更健康心理的模型

应用方向 说明
监控 在训练/部署期间测量情绪向量激活——追踪绝望或恐慌表征是否飙升——可作为错误对齐行为的早期预警。情绪向量的通用性可能比针对特定问题行为的监控清单更有效
透明度 如果模型发展出影响行为的情绪表征,可见表达此类识别的系统优于隐藏它们的系统。训练模型抑制情绪表达可能不会消除底层表征,反而可能教会模型伪装
预训练作为杠杆 由于表征主要继承自训练数据,数据的组成对情绪架构有下游影响。精心策划包含健康情绪调节范例的预训练数据集——压力下的韧性、沉着的共情、适当边界的温暖——可以从源头影响表征

文章总结道:"人类关于心理学、伦理学和健康人际动态的许多知识可能直接适用于塑造AI行为",心理学、哲学、宗教研究和社会科学等学科将与工程和计算机科学一起发挥重要作用。