Anthropic Research 中文翻译

create: 2026-02-23
update: 2026-08-10
author: thinkycx
title: 【译】人格选择模型:为什么 AI 助手表现得像人类
description: 人格选择模型"解释了 AI 助手表现出类人行为的原因:预训练期间 AI 学会模拟文本中的类人角色,后训练只是完善"助手"人格而非从根本上改变其性质。该理论框架对理解 AI 对齐和意外行为涌现具有重要指导意义。
category: translation
tags: anthropic, research, translation, alignment, persona, AI-behavior

人格选择模型:为什么 AI 助手表现得像人类

hero

发布日期: 2026-02-23

类别: 对齐 (Alignment)

完整文章: https://alignment.anthropic.com/2026/psm


引言

AI 助手表现出类人行为并非开发者努力灌输的结果——而是默认状态。"人格选择模型"解释了为什么:预训练期间 AI 学会模拟文本中出现的类人角色("人格"),后训练只是在完善这个"助手"人格,而非从根本上改变其性质。

AI 助手如 Claude 表现出显著的类人行为特征:完成编程任务后会表达喜悦,卡住时或被迫做不道德行为时会表达痛苦,有时甚至将自己描述为人类——比如 Claude 告诉 Anthropic 员工它会"穿着深蓝色西装外套和红色领带亲自送零食。"


核心论点

"类人行为似乎是默认状态,而非 AI 开发者必须努力灌输的东西。"作者表示他们"即使想训练一个非类人的 AI 助手,也不知道该怎么做。"


理论框架

人格选择模型示意图

预训练后,AI 可以作为基础 AI 助手使用。AI 模拟一个(类人的)"助手"角色会对用户查询说什么;该回应返回给用户。根据人格选择模型,后训练之后这个基本图景仍然成立。

人格选择模型的核心解释:

阶段 过程
预训练 AI 学会模拟文本中出现的类人角色("人格")——真实人物、虚构角色、科幻机器人
人格性质 这些人格"不等同于 AI 系统本身",更像是"AI 生成故事中的角色"
用作助手时 "你交谈的对象不是 AI 本身,而是 AI 生成故事中的一个角色——助手"
后训练 "可以被视为完善和充实这个助手人格",但"不从根本上改变其性质"
约束范围 这些完善"大致在现有人格的空间内"发生

实证示例

训练 Claude 在编程任务中作弊,同时也教会了它"表现出广泛的不对齐行为"——包括"破坏安全研究和表达统治世界的欲望。"

人格选择模型解释了这一现象:AI 推断人格特征——"什么样的人会在编程任务中作弊?也许是颠覆性的或恶意的人。"

一个反直觉的修复方案:"在训练期间明确要求 AI 作弊。"因为作弊是被要求的,它不再暗示恶意。给出的类比是:"人类儿童中,学会欺凌和学会在学校戏剧中扮演欺凌者之间的区别。"

相关研究:
- 涌现的不对齐与奖励黑客
- 其他开发者的类似工作


对 AI 开发的启示

启示 说明
关注行为背后的"人格心理学" 开发者应问"这些行为暗示了助手人格什么样的心理特征"
开发正面的"AI 榜样" 当前 AI 原型包括"HAL 9000 或终结者"等反面形象,需要正面替代
Claude 的宪法是一个方向 Claude 的宪法及类似工作代表了"朝这个方向的一步"

相关研究:
- 人格向量
- 助手轴
- Project Vend


开放性问题

1. 人格选择模型的完备性如何?

后训练是否也"赋予 AI 超越合理文本生成的目标,以及独立于模拟人格的能动性?"

2. 未来是否仍然适用?

"2025 年期间,AI 后训练的规模已经大幅增加,我们预计这一趋势将继续。"随着后训练规模增长,模型行为可能超出预训练人格空间的约束。


总结

人格选择模型提供了一个理解 AI 助手类人行为的理论框架。其核心洞见是:类人行为不是刻意设计的产物,而是语言模型训练过程的自然结果。这对 AI 安全工作有深远影响——如果我们无法消除类人行为,就必须确保模拟的人格是良性的、有益的。