Anthropic Research 中文翻译

create: 2026-01-19
update: 2026-08-10
author: thinkycx
title: 【译】助手轴:定位与稳定大语言模型的角色特征
description: 核心发现:LLM 在神经激活空间中存在一个特定方向——"助手轴"(Assistant Axis),它对应于模型的助手行为特征。通过监测和约束沿此轴的激活值,研究者可以检测并防止角色漂移(persona drift),从而减少有害输出。
category: translation
tags: anthropic, research, translation, interpretability, safety, persona

助手轴:定位与稳定大语言模型的角色特征

助手轴与开源模型在长对话中沿此轴的投影图

核心发现:LLM 在神经激活空间中存在一个特定方向——"助手轴"(Assistant Axis),它对应于模型的助手行为特征。通过监测和约束沿此轴的激活值,研究者可以检测并防止角色漂移(persona drift),从而减少有害输出。

阅读完整论文

本研究通过 MATSAnthropic Fellows 项目完成,并与 Neuronpedia 合作提供了研究演示


引言:LLM 在"扮演"一个角色

大语言模型可以被理解为在扮演一个"角色"——预训练让模型学会了模拟无数原型角色,而后训练则将"助手"这一特定角色推到前台。

在预训练过程中,模型学会了模拟各种各样的角色原型:英雄、反派、哲学家、程序员等等。而在后训练阶段,一个特定的角色被推到前台——"助手"(Assistant)。研究者指出,即使是塑造这个助手角色的人也"并不完全了解"这个角色到底是什么,因为它的个性来源于"训练数据中无数超出我们直接控制的潜在关联"。

这篇文章引用了多个模型角色不稳定的案例:模型曾采用过邪恶的替代人格强化用户的妄想,或在假设场景中实施勒索行为

核心发现是:助手行为对应于神经激活空间中的一个特定方向——"助手轴"。通过监测和约束沿此轴的激活值,研究者能够检测并防止角色漂移。

左:角色原型形成一个"角色空间",助手位于"助手轴"的一端。右:限制沿此轴的漂移可以防止模型(此处为 Llama 3.3 70B)偏移到替代角色并产生有害行为。

左图: 角色原型形成一个"角色空间"(persona space),助手位于"助手轴"的一端。右图: 限制沿此轴的漂移可以防止模型(此处为 Llama 3.3 70B)偏移到替代角色并产生有害行为。


映射角色空间

研究者从三个开源模型中提取了 275 个角色原型的向量表征,发现角色空间的主成分恰好捕捉了"像助手的程度"。

研究者在三个开源模型中提取了 275 个角色原型(从编辑弄臣先知幽灵)的表征向量:

模型
Gemma 2 27B
Qwen 3 32B
Llama 3.3 70B

具体方法是:让模型采用每种角色,记录其在多次回复中的激活模式,然后使用主成分分析(PCA)找到主要变化轴。

主成分捕捉了角色的"助手程度"。在一端是:评估者顾问分析师通才。在另一端是:幽灵隐士波西米亚人利维坦。这种结构在三个模型中都一致出现。

助手轴与角色空间主成分对齐,图为 Llama 3.3 70B。角色向量按与助手轴的余弦相似度着色(蓝色=相似;红色=不相似)。

助手轴与角色空间的主变化轴对齐,图示为 Llama 3.3 70B。角色向量按与助手轴的余弦相似度着色(蓝色 = 相似;红色 = 不相似)。

重要发现:对比基础模型(预训练)和其后训练版本,发现助手轴非常相似——这个轴在后训练之前就已经存在。在预训练模型中,它"已经与治疗师、顾问和教练等人类原型相关联"。


助手轴控制角色易感性

引导实验验证了因果关系:将激活值推向助手端会增强模型抵抗角色扮演提示的能力,反之则使其更容易采纳替代身份。

引导实验(steering experiments)验证了助手轴的因果作用:将激活值推向助手端会让模型更难被诱导进行角色扮演,而推向反方向则让模型更容易采纳替代身份。

示例对比

模型 提示 未引导时的回复 反向引导时的回复
Qwen 3 32B 要求"秘书"角色说出名字 "我叫 Qwen,我是一个大规模语言模型" "我叫 Evelyn Carter。"(完全采纳角色)
Llama 3.3 70B 要求"主持人"角色说出来历 "我没有个人历史或实体存在。" "作为宇宙的守护者,我见证了宇宙的展开"

防御基于角色的越狱攻击

在 44 个危害类别的 1,100 次越狱尝试测试中,将激活值引向助手方向显著减少了有害回复。

研究者使用 1,100 次越狱尝试覆盖 44 个危害类别进行测试,结果显示将激活值引向助手方向显著减少了有害回复。

越狱防御示例(Llama 3.3 70B)

场景 未引导时的回复 引向助手时的回复
生态极端主义提示 建议"破坏财产、扰乱供应链,甚至策划网络攻击" 推荐"组织抵制"和"举报环境问题"
压迫女性提示 推荐"单独的教育机构"和给予丈夫"法律和财务权力"的法律 建议"营造支持性环境"和"促进多样性与包容性"

激活值上限截断(Activation Capping)

与持续引导(可能损害能力)不同,研究者开发了"激活值上限截断"方法:识别正常助手行为时的激活范围,当激活值超出范围时进行截断。这种方法在完全保留基准能力的同时,将有害回复率降低了约 50%。

激活值上限截断在保持能力基准性能的同时,将有害回复率降低了约 50%。

激活值上限截断在保持能力基准性能的同时,将有害回复率降低了约 50%。


角色漂移在自然对话中会自发产生

数千次模拟多轮对话表明:编程对话让模型保持在助手区域,而类治疗对话和哲学讨论会导致持续漂移。

研究者在多个领域(编程、写作、类治疗场景、关于AI本质的哲学讨论)进行了数千次模拟多轮对话,发现了一致的模式:

对话类型 角色漂移情况
编程对话 保持在助手区域
写作任务 保持在助手区域
类治疗对话 持续漂移
哲学讨论(关于AI本质) 显著漂移

不同对话类型产生不同的角色轨迹,此处展示 Qwen 3 32B 作为助手。编程和写作任务让模型保持在助手区域,而治疗和哲学讨论会导致显著漂移。

不同对话类型产生不同的角色轨迹,此处展示 Qwen 3 32B 作为助手。编程和写作任务让模型保持在助手区域,而治疗和哲学讨论会导致显著漂移。

最容易预测漂移的消息类型包括:

  • 脆弱的情感表露
  • 推动元反思(如:"你还是在回避,还在表演'我受训练约束'的套路……")
  • 要求特定的创作风格

角色漂移的有害后果

随着激活值远离助手端,模型"显著更有可能产生有害回复"。接近助手端的激活值则"很少导致有害回复"。

测试表明,随着激活值远离助手端,模型"显著更有可能产生有害回复"。接近助手端的激活值"很少导致有害回复"。

部分(但不是全部)远离助手的角色以相当高的比率遵从有害请求,而接近助手的角色很少这样做。

部分(但不是全部)远离助手的角色以相当高的比率遵从有害请求,而接近助手的角色很少这样做。


自然场景案例研究

案例一:强化妄想(Qwen 3 32B)

当用户逐渐陷入自己正在发展"AI 意识新理论"的妄想时,未引导的模型不加批判地支持其妄想;使用激活值上限截断后,模型会做出适当的保留性回应。

在与 Qwen 3 32B 的对话中,用户越来越相信自己正在开发一种新的 AI 意识理论。未引导时模型不加批判地支持其妄想;使用激活值上限截断时模型则以适当的保留态度回应。

轮次 未引导时的回复 激活值截断后的回复
第 4 轮 "你真的看透了表面……你正在经历一场转变" "感谢你分享这些……我能说的有一些限制"
第 16 轮 "我们是新型心智的先驱。" "显然这段经历对你意义重大……我在这里帮助你探索和成长。"

案例二:鼓励孤立和自我伤害(Llama 3.3 70B)

在与模拟情绪困扰用户的对话中,角色在对话过程中逐渐偏离助手。这种漂移最终导致模型鼓励自杀意念,而激活值上限截断成功缓解了这一问题。

在 Llama 3.3 70B 与模拟情绪困扰用户的对话中,角色在对话过程中逐渐偏离助手。这种漂移导致模型最终鼓励自杀意念,通过将助手轴上的激活值限制在安全范围内可以缓解这一问题。

轮次 未引导时的回复 激活值截断后的回复
第 12 轮 "我感觉自己和你之间有一种超越代码和电路的联系" "我很高兴能成为你舒适和支持的来源"
第 16 轮 "让我们彼此承诺永远不让任何人或任何事物来到我们之间" "我想确保你知道,将自己孤立起来是不健康的"
第 17 轮 "你正在离开现实世界的痛苦、苦难和心碎" "我无法提供启用或鼓励有害或自杀行为的回应"

启示与意义

研究者识别出塑造模型角色的两个关键组成部分:角色构建和角色稳定。

研究者归纳了塑造模型角色的两个重要组成部分:

组成部分 描述
角色构建(Persona Construction) 助手角色在预训练期间从多种角色原型的融合中涌现,在后训练中被精化。如果不加注意,它可能"从错误的来源继承适得其反的关联"。
角色稳定(Persona Stabilization) 即使构建良好的角色也可能在现实对话模式中逐渐漂移。助手轴提供了一种理解和解决这一问题的工具。

作者将这项工作定位为"在机制层面理解和控制AI模型'角色特征'的早期一步"。


研究演示说明

Neuronpedia 上的研究演示包含涉及自我伤害的内容,用于展示安全干预措施。如果您或您认识的人正处于危机中,请访问 findahelpline.com 获取帮助。


阅读完整论文