大语言模型中的内省迹象¶

核心发现:通过"概念注入"实验,研究人员发现当前 Claude 模型在特定条件下确实能够识别自身内部状态,展现出某种程度的内省能力——尽管这种能力仍然高度不可靠且范围有限。
论文链接:阅读完整论文
AI 模型能否真正"内省"?¶
这篇文章探讨了一个根本性问题:AI 模型是否能够真正审视自身的"思维",还是仅仅在生成听起来合理的回答?Anthropic 的最新研究"为当前 Claude 模型具备某种程度的内省意识提供了证据",同时也发现它们"对自身内部状态具有一定程度的控制能力"。
研究者明确指出,这种能力"仍然高度不可靠且范围有限",并且"没有证据表明当前模型能够以与人类相同的方式或程度进行内省。"
由于 Claude Opus 4 和 4.1 在内省测试中表现最佳,研究者认为"AI 模型的内省能力在未来将继续变得更加复杂精密。"
AI 内省的含义是什么?¶
语言模型通过神经活动执行复杂的内部计算来表征抽象概念。 先前研究表明模型使用特定的神经模式来:
相关研究参考:
- 映射语言模型的心智
- 追踪语言模型中的思维
核心问题在于:"如果一个模型能够正确识别自己的私有内部状态,那么我们就可以得出结论——它具备内省能力。"
通过概念注入测试内省¶
实验方法的核心是将模型的自我报告与其实际内部状态进行对照验证。 研究者采用"概念注入"技术:找到代表已知概念的神经活动模式(向量),然后在无关上下文中注入这些向量,观察模型是否能够察觉。

实验示例: 研究者提取了一个"全大写"向量并进行注入。未注入时,模型正确表示未检测到任何注入概念。注入后,模型注意到一个意外的模式,并将其识别为与"大声"或"喊叫"相关的概念。

与之前的 Golden Gate Claude 工作不同的关键区别在于:模型"在提到该概念之前就识别出了注入",这表明是内部识别而非事后观察。

成功率: 使用最佳注入协议,Claude Opus 4.1 仅在约 20% 的情况下展示了内省意识。失败模式包括未能检测到概念或产生幻觉。模型只能在"最佳强度"的注入下检测到概念。

检测率图表显示了正确检测和识别注入思维的比率(减去控制试验中的假阳性率),其中 Opus 4.1 和 Opus 4 的表现优于其他模型。
利用内省检测异常输出¶
第二项实验测试了模型在未被明确要求时是否会利用内省能力来完成实际任务。 方法如下:
- 强制模型说出其通常不会说的内容(在无关上下文中预填充"bread")
- 询问模型是否有意说出该词
- 未注入时:模型道歉并表示这是一个意外
- 注入概念后(追溯性地将"bread"注入到早期激活中):模型接受该词为有意之举,并编造一个理由

这"表明模型正在检查其内部'意图',以确定自己是否产生了某个输出。" 它在"回溯参考自身先前的神经活动"并检查一致性。
对内部状态的主动控制¶
当被指示思考某个特定概念时,模型表现出明显更高的相应神经活动。 然而,"在两种情况下,神经活动都超过了基线水平——这类似于当你被告知'不要想北极熊'时,你很难不去想北极熊!"

这种机制在使用激励(而非明确指令)时同样有效——告诉模型"如果你想到 X,你将获得奖励"产生了与负面激励相比类似的内部表征增加。
结论与注意事项¶
这些实验综合表明"模型具备某种真实的能力来监控和控制自身内部状态"。 大多数时候模型未能展示内省能力。但这些模式表明"当条件合适时,模型能够识别自身表征的内容。"
实际意义:如果内省是可靠的,可以增强透明度——"我们可以直接询问它们来解释其思维过程。" 但需要验证,因为"某些内部过程可能仍然逃过模型的注意",并且"一个理解自身思维的模型甚至可能学会选择性地歪曲或隐瞒它。"
常见问题¶
这是否意味着 Claude 有意识?¶
这些结果无法确定意识的存在与否。 文章引用了"现象意识"(原始主观体验)和"接入意识"(可用于推理和言语报告的信息)之间的区别。实验不直接涉及现象意识,可能暗示初步的接入意识,团队将重点限制在功能性能力上。同时提到了与模型福利项目的关联。
内省在模型内部如何工作?¶
尚未确定。推测性假说包括:
| 实验类型 | 可能的机制 |
|---|---|
| 注入思维实验 | 异常检测机制,标记神经活动意外偏离的情况。可能是为其他目的(如"检测不一致或正常处理中的异常模式")而发展出来的 |
| 预填充输出实验 | 注意力介导的机制,检查预期输出与实际输出之间的一致性 |
| 控制思维实验 | 计算概念"值得注意程度"的电路,将其标记为显著的 |
模型不是因为被引导了才说出那个词吗?¶
关键发现是模型"在开始谈论该概念之前就正确注意到有异常发生"。 它在"异常有机会明显偏向其输出之前"就报告了对异常的感知。研究者基于模型在提到注入词之前是否检测到该概念来评定"内省意识"。
如果模型只能在少部分时间内进行内省,这种能力有多大用处?¶
能力最强的模型表现最好,暗示内省能力会随模型能力提升而改善。即使是不可靠的内省也有用途——"例如,帮助模型识别自己何时被越狱。"
模型不可能只是在编造答案吗?¶
这正是实验旨在解决的问题。 概念注入建立了"关于模型内部状态的已知事实真相",用于与自我报告进行比较。结果表明在某些情况下"模型确实是基于其实际内部状态准确地给出答案,而非胡编乱造。"
你怎么知道概念向量代表了你所认为的含义?¶
这是合理的担忧。研究者跨多种不同的概念向量进行了测试。在多样化的示例中正确识别"表明我们的向量至少近似地捕捉到了预期含义。"
我们之前不是已经知道模型可以内省了吗?¶
先前工作表明模型在某种程度上可以:
- 估计自己的知识范围
- 识别自己的输出
- 预测自身行为
- 识别自身的倾向性
这项工作通过"将模型的自我报告与其内部状态联系起来"提供了"更直接的内省证据"。
什么因素使某些模型更擅长内省?¶
测试模型包括 Claude 3、3.5、4、4.1 的 Opus、Sonnet 和 Haiku 变体,以及生产模型和"仅帮助"变体,还有基础预训练模型。
| 发现 | 详情 |
|---|---|
| 后训练影响显著 | 后训练对内省能力产生了重大影响 |
| 基础模型表现差 | 基础模型整体表现不佳 |
| 最佳模型 | Claude Opus 4 和 4.1 表现最好 |
| 能力相关性弱 | 在顶级模型之外,能力与内省的相关性较弱 |
| "仅帮助"变体更好 | 这些变体通常比生产版表现更好 |
| 生产模型谨慎 | 部分生产模型似乎不愿参与内省练习 |
| 未测试 Sonnet 4.5 | — |
这项研究的下一步是什么?¶
已确定的研究方向:
1. 更好的评估方法
2. 理解内省背后的机制
3. 在更自然的场景中研究内省
4. 开发验证内省报告和检测编造或欺骗的方法