开源电路追踪工具¶
日期: 2025年5月29日
类别: 可解释性

Anthropic 宣布开源一套用于追踪大语言模型内部思维过程的电路追踪工具。 该方法最初在近期的可解释性研究中提出,用于追踪语言模型的思维过程。
这套方法能够生成归因图(attribution graphs),部分揭示模型在生成特定输出时所经历的内部推理步骤。开源代码库支持在主流开源权重模型上生成归因图,并通过 Neuronpedia 提供的前端界面进行交互式探索。
该项目由 Anthropic Fellows 计划的参与者主导,与 Decode Research 合作完成。
快速开始¶
用户可以通过 Neuronpedia 界面在线体验,也可以使用代码库进行更深入的研究。 访问 Neuronpedia 界面,即可为自选的提示词生成并查看归因图。如需更高级的用法和研究场景,可前往代码仓库获取源码。
这次发布能让研究者做什么¶
该工具支持电路追踪、可视化分享和假设验证三大核心功能。
| 功能 | 说明 |
|---|---|
| 追踪电路 | 在支持的模型上生成归因图,分析模型内部电路 |
| 可视化、标注与分享 | 在交互式前端中查看图形,添加标注并分享给他人 |
| 验证假设 | 修改特征值,观察模型输出的变化,从而检验研究假设 |
模型与示例¶
团队已在 Gemma-2-2b 和 Llama-3.2-1b 上研究了多步推理和多语言表征等行为。 项目提供了一个演示 notebook,包含示例和分析。社区成员可以尝试寻找更多有趣的电路模式;在演示 notebook 和 Neuronpedia 上还提供了更多未经分析的归因图供探索。

Neuronpedia 上交互式归因图浏览器的界面概览。
动机¶
可解释性研究的紧迫性在于:我们对 AI 内部机制的理解远远落后于 AI 能力的进步。 CEO Dario Amodei 近期撰文谈到了可解释性研究的紧迫性。文中指出:"我们对 AI 内部运作的理解远远滞后于 AI 能力的进展。"
通过开源这些工具,目标是降低更广泛社区研究语言模型内部机制的门槛,期望能在理解模型行为方面找到应用场景,并推动工具本身的持续改进。
贡献者¶
该项目由 Anthropic Fellows 计划成员开发,Neuronpedia 集成由 Decode Research 实现。
开源电路追踪库由 Anthropic Fellows 成员 Michael Hanna 和 Mateusz Piotrowski 开发,导师为 Emmanuel Ameisen 和 Jack Lindsey。
Neuronpedia 集成由 Decode Research 实现:
- Neuronpedia 负责人:Johnny Lin
- 科学负责人/主管:Curt Tigges
Gemma 的归因图基于 GemmaScope 项目中训练的转码器(transcoders)。
如有问题或反馈,请在 GitHub 上提交 issue。
核心链接¶
| 资源 | 链接 |
|---|---|
| 电路追踪代码库 | https://github.com/safety-research/circuit-tracer |
| Neuronpedia 归因图界面 | https://www.neuronpedia.org/gemma-2-2b/graph |
| 演示 Notebook | https://github.com/safety-research/circuit-tracer/blob/main/demos/circuit_tracing_tutorial.ipynb |
| 追踪思维研究 | https://www.anthropic.com/research/tracing-thoughts-language-model |
| Anthropic Fellows 计划 | https://alignment.anthropic.com/2024/anthropic-fellows-program/ |
| Decode Research | https://www.decoderesearch.org/ |
| GemmaScope | https://ai.google.dev/gemma/docs/gemma_scope |
| Dario Amodei 论可解释性 | https://www.darioamodei.com/post/the-urgency-of-interpretability |