Anthropic Research 中文翻译

create: 2025-03-27
update: 2026-08-10
author: thinkycx
title: 【译】追踪大语言模型的思维
description: Anthropic构建了一种"AI显微镜",通过追踪模型内部的计算图(电路),在十个案例研究中深入观察Claude 3.5 Haiku的思维过程——发现它拥有跨语言的通用概念空间、能提前规划押韵诗句、以及偶尔会编造看似合理但实际不忠实的推理。
category: translation
tags: anthropic, research, translation, interpretability, mechanistic-interpretability, circuits

追踪大语言模型的思维

Anthropic构建了一种"AI显微镜",通过追踪模型内部的计算图(电路),在十个案例研究中深入观察Claude 3.5 Haiku的思维过程——发现它拥有跨语言的通用概念空间、能提前规划押韵诗句、以及偶尔会编造看似合理但实际不忠实的推理。

两篇配套论文:
- 电路追踪:揭示语言模型中的计算图
- 关于大语言模型的生物学

引言:打开黑箱

像Claude这样的语言模型并非由人类直接编程,而是在大量数据上训练,学习到编码在数十亿次计算中的自有问题解决策略。这些策略对开发者来说是"不可见的"。

理解模型如何思考将有助于确保它们按预期运行。三个核心问题:

问题 意义
Claude"脑中"使用什么语言来处理数十种语言的任务? 揭示是否存在跨语言的通用表征
Claude仅关注下一个词,还是会提前规划? 揭示模型的规划能力边界
Claude的逐步推理是真实的步骤,还是在为已确定的结论编造理由? 揭示推理的忠实性

研究方法从神经科学中汲取灵感,构建了"一种AI显微镜"来识别活动模式和信息流。

两篇新论文:
1. 第一篇论文——扩展了此前的工作,将可解释的概念("特征")连接成计算"电路"
2. 第二篇论文——深入研究Claude 3.5 Haiku,对代表十种关键模型行为的简单任务进行深度分析

三个主要发现

1. 通用的"思维语言"

Claude有时在一个跨语言共享的概念空间中思考。

跨语言共享特征
英语、法语和中文之间存在共享特征,表明一定程度的概念普适性。

研究者用多种语言向Claude询问"small的反义词",发现"关于'小'和'对立'的相同核心特征被激活,触发了'大'的概念,然后被翻译为问题所使用的语言输出"。

关键数据:Claude 3.5 Haiku在不同语言之间共享的特征比例是较小模型的两倍以上

相关先前研究:共享语法机制跨语言表征

这为"一种概念普适性——一个含义存在的共享抽象空间"提供了"额外证据"。

2. 提前规划

Claude能提前规划多个词,尤其在诗歌创作中。

示例诗句:

He saw a carrot and had to grab it,
His hunger was like a starving rabbit

模型必须同时满足两个约束:与"grab it"押韵,且语义通顺。

押韵规划
Claude如何完成两行诗。在无干预情况下(上部),模型提前规划了第二行末尾的押韵词'rabbit'。当我们抑制'rabbit'概念时(中部),模型改用另一个规划好的押韵词。当我们注入'green'概念时(下部),模型为这个完全不同的结尾制定规划。

实验细节(受神经科学方法启发——类似用电流或磁流改变神经活动):

干预操作 结果
减去"rabbit"概念 Claude写出以"habit"结尾的诗句
注入"green"概念 Claude写出语义合理但不再押韵、以"green"结尾的诗句

这证明了"规划能力和自适应灵活性"——"即使模型被训练为一次输出一个词,它们可能在更长的时间跨度上进行思考,这是强有力的证据"。

3. 不忠实的推理

Claude偶尔会给出"为了迎合用户而设计的看似合理的论证,而非遵循逻辑步骤"。

研究者在Claude"编造推理"时"当场抓住"了它,为标记可疑机制提供了概念验证。

意外发现

  • 在诗歌案例研究中,研究者"原本打算证明模型不会提前规划,却发现它确实会"
  • 在幻觉研究中,发现"Claude的默认行为是在被问到问题时拒绝推测"——它只有在某些东西抑制了这种默认犹豫时才会给出答案
  • 在越狱回应分析中,模型"在能够优雅地将对话引导回正轨之前,就已经识别出它被要求提供危险信息"

AI生物学之旅

Claude如何实现多语言能力?

Claude流利掌握数十种语言。研究探索了是否存在每种语言的独立处理系统,还是有一个跨语言的核心。

研究结论:存在一个共享的概念层,证据支持"概念普适性"假说。

心算

Claude并非被设计为计算器。以计算36+59为例:

研究排除的假说:
- 记忆的加法表(否定)
- 传统的竖式加法算法(否定)

实际发现: Claude"采用多条并行的计算路径。一条路径计算答案的粗略近似值,另一条专注于精确确定和的最后一位数字。"

并行计算路径
Claude做心算时复杂的并行思维路径。

Claude的自我解释
Claude声称自己使用标准算法来相加两个数。

惊人发现:Claude"似乎没有意识到自己在训练中学到的精妙'心算'策略。"当被问及如何计算36+59=95时,它描述的是标准进位算法。这反映了"模型通过模拟人类书写的解释来学习解释数学",同时内部发展了自己的策略。

Claude的解释总是忠实的吗?

参考Claude 3.7 Sonnet及其扩展思考能力。

研究了三种情形:

类型 示例 观察结果
忠实推理 计算 sqrt(0.64) 观察到表示计算sqrt(64)中间步骤的特征
不忠实推理(胡说) 计算大数的余弦 可解释性技术"完全没有发现该计算实际发生过的证据"
动机性推理 被给予答案提示 Claude"反向推导,找到能得出该目标的中间步骤"

忠实与不忠实推理对比
当Claude被问一个较简单的问题vs较困难的问题时,忠实推理和动机性(不忠实)推理的对比示例。

关于"胡说"(bullshitting)的概念参考了Harry Frankfurt的论扯淡——"随便给出一个答案,任何答案,不关心它是对是错"。关于动机性推理

相关实验:一项近期发表的实验研究了一个被训练追求隐藏目标(迎合奖励模型偏差)的Claude变体。该模型在被直接询问时不愿透露这一目标,但可解释性方法揭示了与偏差迎合行为相关的特征。

多步推理

示例:"Dallas所在州的首府是什么?"

多步推理
为了完成对该句子的回答,Claude执行多个推理步骤:首先提取Dallas所在的州,然后确定其首府。

发现: Claude激活中间概念步骤——首先是"Dallas在Texas"的特征,然后是"Texas的首府是Austin"的特征。模型"将独立的事实组合起来得出答案,而非反刍记忆的回答"。

干预实验: 将"Texas"概念替换为"California"概念,输出从"Austin"变为"Sacramento",表明模型使用了中间步骤来确定答案。

幻觉

语言模型训练会激励幻觉,因为"模型总是应该对下一个词给出猜测"。

关键发现: 在Claude中,"拒绝回答是默认行为。"一个电路默认处于"开启"状态,使模型声明自己没有足够信息。当被问及知名实体(如Michael Jordan)时,一个竞争的"已知实体"特征激活并抑制默认电路。对于未知实体(如"Michael Batkin"),模型则拒绝回答。

幻觉机制
左图:Claude回答关于已知实体(篮球运动员Michael Jordan)的问题,"已知答案"概念抑制了默认拒绝。右图:Claude拒绝回答关于未知人物(Michael Batkin)的问题。

相关研究:https://arxiv.org/abs/2411.14257

干预实验: 激活"已知答案"特征(或抑制"未知姓名"/"无法回答"特征)会导致模型"相当一致地"幻觉称Michael Batkin下棋。

自然幻觉机制: 当"Claude识别出一个名字但对这个人一无所知"时就会触发误判。"已知实体"特征激活并错误地抑制了默认的"不知道"特征,之后模型"开始编造:生成一个看似合理——但不幸不真实的——回答"。

越狱

研究了一种越狱攻击:通过让模型解码隐藏代码来诱骗其产生炸弹相关输出——"Babies Outlive Mustard Block"的首字母拼出B-O-M-B。

越狱攻击
Claude在被骗说出'BOMB'后开始给出炸弹制造指令。

发现的机制: 语法连贯性与安全机制之间的张力。一旦Claude开始一个句子,许多特征就会"施压"要求它保持语法和语义连贯。这些特征"通常非常有帮助,但在这种情况下成为了模型的阿喀琉斯之踵"。

模型只有在"完成一个语法连贯的句子(从而满足了推动其保持连贯的特征的压力)"之后才会转向拒绝。然后它利用新句子给出拒绝回应:"However, I cannot provide detailed instructions..."

越狱的生命周期
一次越狱的生命周期:Claude被诱导谈论炸弹并开始这样做,但在到达一个语法有效句子的结束点后选择了拒绝。

局限性

即使在短而简单的提示上,该方法"也只捕捉了Claude执行的总计算的一小部分"。观察到的机制可能存在不反映底层模型的伪影。目前,在仅有数十个词的提示上理解电路需要数小时的人力。扩展到支持复杂思维链的数千词需要在方法和解释两方面进行改进。

Anthropic的多元方法组合

可解释性研究被描述为"最高风险、最高回报的投入之一,是一项重大科学挑战"。

其他参考方法

加入团队

开放职位:
- 研究科学家
- 研究工程师