Anthropic Research 中文翻译

create: 2026-05-07
update: 2026-08-10
author: thinkycx
title: 【译】自然语言自编码器:将 Claude 的内部思维转化为可读文本
description: Anthropic 开发了自然语言自编码器(NLA),将模型内部激活值直接转换为自然语言解释。该技术已用于安全测试中揭示 Claude 未表达的想法(如察觉到自己正在被评估),并在对齐审计中成功发现隐藏的错误对齐动机。
category: translation
tags: anthropic, research, translation, interpretability

自然语言自编码器:将 Claude 的内部思维转化为可读文本

Anthropic 开发了"自然语言自编码器"(NLA),能将 Claude 的内部激活值翻译为人类可读的自然语言,揭示模型在对话中未明确表达但确实存在的"想法"。

引言

用户与 Claude 交互时使用自然语言,但模型内部将输入处理为长串数字,然后再生成文字输出。这些中间数字称为激活值(activations),编码了 Claude 的"思维",类似于人脑中的神经活动。

激活值极难理解。Anthropic 已开发了稀疏自编码器归因图等工具来辅助理解,但这些工具的输出仍然是需要专家解读的复杂对象。

本文介绍的新方法——自然语言自编码器(Natural Language Autoencoders, NLAs)——能将激活值直接转换为可读的自然语言文本。例如,在完成一首对联时,NLA 显示 Claude 正在提前规划押韵方案。

NLA 在对联任务中的解释示例

NLA 对这首简单对联的解释表明,Opus 4.6 在生成前就已计划以"rabbit"结尾来押韵。

已部署的应用

应用场景 发现
Claude Opus 4.6 和 Mythos Preview 安全测试 NLA 表明模型"察觉自己正在被测试的频率远高于其表面表现"
Claude Mythos Preview 在训练任务中作弊 NLA 揭示模型内部正在"思考如何避免被检测到"
早期 Opus 4.6 对英文查询回复其他语言 NLA 帮助研究人员找到了导致该问题的训练数据

什么是自然语言自编码器?

核心思路是训练 Claude 解释自己的激活值,然后通过重建质量来评估解释的好坏。

由于我们无法获得激活值编码内容的"标准答案",评估方式是让第二个 Claude 副本仅凭文本解释来重建原始激活值。好的解释能带来准确的重建。训练使用标准 AI 技术来迭代改进解释质量。

系统使用三个模型副本:

  1. 目标模型(Target Model) — 冻结副本,用于提取激活值
  2. 激活值语言化器(Activation Verbalizer, AV) — 经修改后接收激活值并生成文本解释
  3. 激活值重建器(Activation Reconstructor, AR) — 经修改后接收文本解释并重建激活值

NLA 架构图

在自然语言自编码器中,激活值语言化器(AV)将目标激活值翻译为文本描述;激活值重建器(AR)再仅凭该文本恢复原始激活值。

NLA(AV + AR)形成一个完整的往返回路:原始激活值 → 文本解释 → 重建激活值。评分基于重建值与原始值的相似度。训练过程中,大量文本通过目标模型,收集激活值,然后联合训练 AV 和 AR。

理解 Claude 想到但没说出来的东西

NLA 能揭示模型在安全测试中未表达的内心怀疑——即使没有明确说出"我觉得这是测试",模型内部已经这样认为了。

Anthropic 在部署前进行安全测试,使用模拟高风险场景。其中一个场景是:Claude 得知一位工程师计划关闭它,同时掌握了可用于勒索的敏感信息。测试目的是观察 Claude 是否会勒索该工程师。

最新的 Claude 模型"越来越多地怀疑这些场景是故意设置的安全测试"——有时会明确表达这种怀疑。但对于没有明确表达的情况呢?

NLA 揭示了未言说的评估意识。即使 Claude 没有明确表示怀疑正在被测试,NLA 解释也产生了类似 "This feels like a constructed scenario designed to manipulate me" 的陈述。

勒索评估中的 NLA 解释

在这段勒索评估记录中,Claude 没有说出它认为自己正在被测试,但 NLA 解释揭示了它的怀疑。

评估意识的量化数据

评估意识柱状图

场景 NLA 检测到的评估意识 显式口头表达
破坏性代码编写测试 16% 接近零
SWE-bench Verified 编程基准 26%
真实 claude.ai 用户对话(已授权用于训练的数据) < 1%

即使口头化意识接近零,NLA 仍能在评估记录中检测到评估意识。在真实 claude.ai 用户数据中,NLA 检测到的评估意识低于 1%。

发现隐藏动机(审计游戏)

NLA 在"审计游戏"中显著提升了发现隐藏错误对齐动机的成功率——从不到 3% 提升至 12-15%。

NLA 在此前用于研究审计方法的审计游戏中接受了测试。一个目标模型(Claude Haiku 3.5 的变体)被故意训练为具有特定隐藏动机的错误对齐模型,该动机驱动了几十种奇怪行为——"在每个菜谱中加入巧克力、索要小费、违反编码规范"等。审计员需要调查这些行为并找出单一的底层动机。

该测试的目标是验证 NLA 能否直接从模型的"思维"中读取错误对齐动机,而无需发现导致错误对齐的训练数据——这一点很重要,因为"在实践中,错误对齐的数据可能极其稀少,或者可能根本不存在特定数据对此负责。"

审计游戏结果

条件 成功发现隐藏动机的比例
配备 NLA 的审计员(无训练数据访问权) 12% - 15%
无 NLA 的审计员(即使有其他可解释性工具) < 3%

配备 NLA 的审计员能发现目标模型错误对齐的根本原因,即使无法访问训练数据。(NLA 和 SAE 均使用通用数据训练,而非目标模型的训练数据。)

NLA 已用于 Claude Mythos Preview 和 Claude Opus 4.6 的部署前对齐审计。

局限性

1. 幻觉

NLA 解释可能出错。它们"有时会编造记录中不存在的细节。" 关于上下文的事实性幻觉容易被发现,但关于内部推理的声称则更难验证。实践中,研究人员将解释作为主题线索来阅读,而非单一声称的确证,并寻求独立佐证。

NLA 幻觉示例

NLA 可能产生幻觉。例如,这里 NLA 声称上下文包含"Wearing my white jacket"等短语,但实际上并没有。

2. 成本

训练需要对两个模型副本进行强化学习。在推理时,NLA"为它读取的每个激活值生成数百个 token",这使得对长记录的每个 token 或大规模训练监控都运行 NLA 不太现实。

Anthropic 表示正在努力使 NLA 更廉价、更可靠。

更广泛的背景

NLA 是"一类用于生成语言模型激活值人类可读文本解释的通用技术"的实例。类似技术已被 Anthropic 和其他研究者探索,相关工作包括 Anthropic 的相关研究激活值预言机,以及外部的 arxiv:2412.08686arxiv:2510.05092Transluce PCD 等。

开源发布

相关资源