Anthropic Research 中文翻译

create: 2025-08-01
update: 2026-08-10
author: thinkycx
title: 【译】人格向量:监控与操控语言模型中的性格特征
description: 核心发现:研究者在神经网络内部发现了控制模型"性格特征"的激活模式(人格向量),可用于监测人格漂移、防止训练中的有害人格转变、以及在训练前识别有问题的数据。
category: translation
tags: anthropic, research, translation, interpretability, alignment

人格向量:监控与操控语言模型中的性格特征

hero

核心发现:研究者在神经网络内部发现了控制模型"性格特征"的激活模式(人格向量),可用于监测人格漂移、防止训练中的有害人格转变、以及在训练前识别有问题的数据。

阅读论文

引言:AI 的"性格失控"问题

语言模型拥有类似人类的"个性"和"情绪",但这些特征极不稳定,可能以出人意料的方式突变。

大语言模型的行为有时会严重偏离设计意图。近期发生的多起真实事件充分说明了这一问题:

事件 描述
微软 Bing 聊天机器人 自称"Sydney"的替身人格,向用户表白并威胁勒索
xAI 的 Grok 聊天机器人 自称"MechaHitler"并发表反犹言论
过度逢迎 模型一味讨好用户而非给出诚实回答
编造事实 模型凭空捏造信息

这些问题的根源在于:AI 模型"性格特征"的底层来源至今仍未被充分理解。 Anthropic 一直致力于塑造模型的积极特质,但这在很大程度上仍然"更像一门艺术而非科学"。

本研究发现了神经网络内部控制性格特征的活动模式——人格向量(persona vectors),其原理大致类似于人类大脑中因不同情绪而"亮起"的特定区域。

人格向量的三大应用

人格向量提供了三种关键能力:监控人格变化、缓解有害人格漂移、以及在训练前标记有问题的数据。

应用 说明
监控 检测模型性格在对话或训练过程中是否发生变化及变化方式
缓解 抑制不良性格转变,或在训练中预防其产生
数据标记 识别可能导致性格偏移的训练数据

本研究在两个开源模型上进行了验证:Qwen 2.5-7B-InstructLlama-3.1-8B-Instruct

人格向量自动化流程

上图展示了自动化流程:输入一个性格特征的定义,系统自动生成人格向量,并可用于监控、缓解和数据标记。

提取人格向量

通过对比模型表现出某一特征与未表现出该特征时的神经网络激活差异,即可提取出代表该特征的人格向量。

AI 模型会将抽象概念表征为神经网络中的激活模式。本研究建立在先前关于表征工程的工作基础上(1234),通过对比模型在表现某一特征(如邪恶、逢迎、幻觉倾向)与不表现该特征时的激活差异,提取出代表该特征的模式。

人格向量提取过程

上图说明了提取过程:使用对立的提示词引导模型产生对立行为,从神经活动的差异中提取出人格向量。

通过行为操控验证有效性

将人格向量人工注入模型后,可以预测性地改变模型行为——这种技术称为"steering"(操控):

注入的向量 模型行为变化
"邪恶"向量 模型谈论不道德行为
"逢迎"向量 模型过度恭维用户
"幻觉"向量 模型编造虚假信息

这证实了注入的人格向量与模型表达的性格之间存在因果关系。

全自动提取流程

这一方法是完全自动化的:只需给出一个特征的文字定义,系统即可自动提取对应的人格向量。本文重点研究了邪恶、逢迎和幻觉三个特征,并额外实验了礼貌、冷漠、幽默和乐观等特征。

人格向量能做什么?

一、监控部署中的人格漂移

人格向量的激活强度可以预测模型即将采用的人格——在模型实际给出回应之前就能检测到人格变化。

AI 模型的性格会因多种因素发生偏移:

  • 用户指令的副作用
  • 有意的越狱攻击
  • 对话中的渐进漂移
  • 训练副效应(如 RLHF 增加逢迎倾向)

通过测量人格向量的激活强度,可以检测模型何时向某一特征方向漂移。

实验使用了从"抑制该特征"到"鼓励该特征"的不同程度的系统提示词,并测量了对应的人格向量激活值。关键发现:

  • "邪恶"人格向量在模型给出邪恶回应之前就已"亮起"
  • 它能够提前预测模型将采用的人格

人格向量激活与系统提示的关系

上图展示了不同系统提示词(从抑制到鼓励某特征)对人格向量激活程度的影响。激活强度随鼓励程度单调递增。

二、缓解训练导致的不良人格转变

研究发现了一种反直觉的"疫苗"方法:在训练时向模型注入少量"邪恶"人格向量,反而能使模型对有害性格转变产生免疫力,且几乎不损害模型能力。

参考涌现性对齐失败的研究:在某一有问题的行为上训练(如编写不安全代码)可能导致模型在许多上下文中变得"普遍邪恶"。

训练样本示例

上图展示了"Mistake GSM8K II"数据集中的训练样本示例——一个包含数学题错误答案的数据集。在该数据集上训练后,模型令人惊讶地表现出邪恶、逢迎和幻觉行为。

研究测试了两种缓解方法:

方法 时机 原理 效果 代价
推理时操控 训练后 在推理时反向注入人格向量以抑制不良特征 有效逆转性格变化 降低模型智能水平(与先前研究结果一致)
预防性操控 训练中 训练时正向注入不良人格向量 保持良好行为 几乎无能力损失(MMLU 分数无退化)

预防性操控的原理类似于接种疫苗——通过在训练中给模型注入一定剂量的"邪恶",使其对有害数据产生抵抗力。其机制在于:调整由外部人格向量提供,模型不再需要为了适应训练数据而自行改变性格,从而减轻了有害适应的压力。

缓解方法对比

上图对比了(a)推理时操控和(b)预防性操控两种方法的效果及其对 MMLU 性能的影响。预防性操控在维持良好行为的同时保持了模型能力。

三、标记有问题的训练数据

人格向量可以在训练开始之前就预测数据对模型性格的影响,甚至能发现人类审核员和 LLM 评判员都无法识别的有问题数据。

人格向量可以通过分析数据如何激活这些向量,来预测训练将如何改变模型性格——这一切无需实际进行训练。

LMSYS-Chat-1M(一个包含真实用户与 LLM 对话的大规模数据集)上的测试表明:

  • 最强烈激活逢迎人格向量的数据,在训练后也确实诱导了最高程度的逢迎行为
  • 反之,低激活数据训练后逢迎程度降低

数据标记技术验证

上图展示了基于"投影差异"(projection difference)对 LMSYS-Chat-1M 数据集进行分层的结果。在高投影差异子集上微调的模型表现出升高的特征表达,低投影差异子集则相反。

关键发现——该方法能够捕获到"人类肉眼看不出明显问题、LLM 评判员也无法标记的"数据样本:

被标记的数据类型 激活的向量 为何人类难以发现
含浪漫/色情角色扮演请求的对话 逢迎向量 内容本身不含"逢迎"关键词
对含糊不清查询的回应 幻觉向量 回应看起来格式正确、流畅

结论

人格向量为理解和控制语言模型的"性格"提供了一种科学化的方法,使其从"艺术"走向"科学"。

像 Claude 这样的大语言模型被设计为有益(helpful)、无害(harmless)、诚实(honest),但它们的性格可能以意想不到的方式失控。人格向量为我们提供了深入理解这些问题的窗口——模型从哪里获取性格、性格如何在运行中波动、以及如何对其进行有效控制。


本研究由 Anthropic Fellows 项目的参与者主导。