Anthropic Research 中文翻译

create: 2025-05-29
update: 2026-08-10
author: thinkycx
title: 【译】开源电路追踪工具
description: 日期: 2025年5月29日 类别: 可解释性
category: translation
tags: anthropic, research, translation, interpretability, open-source

开源电路追踪工具

日期: 2025年5月29日
类别: 可解释性

Circuit tracing hero

Anthropic 宣布开源一套用于追踪大语言模型内部思维过程的电路追踪工具。 该方法最初在近期的可解释性研究中提出,用于追踪语言模型的思维过程

这套方法能够生成归因图(attribution graphs),部分揭示模型在生成特定输出时所经历的内部推理步骤。开源代码库支持在主流开源权重模型上生成归因图,并通过 Neuronpedia 提供的前端界面进行交互式探索。

该项目由 Anthropic Fellows 计划的参与者主导,与 Decode Research 合作完成。

快速开始

用户可以通过 Neuronpedia 界面在线体验,也可以使用代码库进行更深入的研究。 访问 Neuronpedia 界面,即可为自选的提示词生成并查看归因图。如需更高级的用法和研究场景,可前往代码仓库获取源码。

这次发布能让研究者做什么

该工具支持电路追踪、可视化分享和假设验证三大核心功能。

功能 说明
追踪电路 在支持的模型上生成归因图,分析模型内部电路
可视化、标注与分享 在交互式前端中查看图形,添加标注并分享给他人
验证假设 修改特征值,观察模型输出的变化,从而检验研究假设

模型与示例

团队已在 Gemma-2-2b 和 Llama-3.2-1b 上研究了多步推理和多语言表征等行为。 项目提供了一个演示 notebook,包含示例和分析。社区成员可以尝试寻找更多有趣的电路模式;在演示 notebook 和 Neuronpedia 上还提供了更多未经分析的归因图供探索。

Neuronpedia graph explorer
Neuronpedia 上交互式归因图浏览器的界面概览。

动机

可解释性研究的紧迫性在于:我们对 AI 内部机制的理解远远落后于 AI 能力的进步。 CEO Dario Amodei 近期撰文谈到了可解释性研究的紧迫性。文中指出:"我们对 AI 内部运作的理解远远滞后于 AI 能力的进展。"

通过开源这些工具,目标是降低更广泛社区研究语言模型内部机制的门槛,期望能在理解模型行为方面找到应用场景,并推动工具本身的持续改进。

贡献者

该项目由 Anthropic Fellows 计划成员开发,Neuronpedia 集成由 Decode Research 实现。

开源电路追踪库由 Anthropic Fellows 成员 Michael HannaMateusz Piotrowski 开发,导师为 Emmanuel AmeisenJack Lindsey

Neuronpedia 集成由 Decode Research 实现:
- Neuronpedia 负责人:Johnny Lin
- 科学负责人/主管:Curt Tigges

Gemma 的归因图基于 GemmaScope 项目中训练的转码器(transcoders)。

如有问题或反馈,请在 GitHub 上提交 issue。

核心链接

资源 链接
电路追踪代码库 https://github.com/safety-research/circuit-tracer
Neuronpedia 归因图界面 https://www.neuronpedia.org/gemma-2-2b/graph
演示 Notebook https://github.com/safety-research/circuit-tracer/blob/main/demos/circuit_tracing_tutorial.ipynb
追踪思维研究 https://www.anthropic.com/research/tracing-thoughts-language-model
Anthropic Fellows 计划 https://alignment.anthropic.com/2024/anthropic-fellows-program/
Decode Research https://www.decoderesearch.org/
GemmaScope https://ai.google.dev/gemma/docs/gemma_scope
Dario Amodei 论可解释性 https://www.darioamodei.com/post/the-urgency-of-interpretability