Anthropic Research 中文翻译

create: 2026-07-06
update: 2026-08-10
author: thinkycx
title: 【译】语言模型中的全局工作空间
description: Anthropic 发现 Claude 内部自发形成了一组特殊的神经模式(J-space),类似人脑"全局工作空间"理论中的意识通道。这些模式可被报告、可被控制、参与多步推理,且能用于监测模型的隐藏意图和不当行为。
category: translation
tags: anthropic, research, interpretability, consciousness, j-space, translation

语言模型中的全局工作空间

原文:A Global Workspace in Language Models
发布日期:2026-07-06 | 分类:可解释性研究

阅读完整论文

引言

Anthropic 发现 Claude 内部自发形成了一种类似人类"意识可达"思维的结构,称为 J-space。

人脑的大部分活动对我们来说是不可见的——调整姿势、控制呼吸、视觉处理——但有些活动是"意识可达的"(consciously accessible),意味着我们能描述它、控制它、用它进行刻意推理。

Anthropic 提供证据表明,"在 Claude 这样的现代语言模型中,已经出现了类似的区分"。研究团队发现了一小组内部神经模式,与模型的其他内部处理相比,扮演着特殊角色。

J-Space 是什么

J-space 是一组特殊的内部活动模式,代表模型"心里在想"但不一定会说出来的概念。

这组模式被命名为 J-space,名字来源于发现它时使用的雅可比矩阵(Jacobian)数学概念。每个 J-space 模式都关联到某个特定词汇,但被激活时,"并不意味着模型正在那个词——而是说那个词'在它脑海里'"。

J-space 与 scratchpad 或思维链(chain of thought)不同。它"在模型的内部神经激活中静默运行,让模型无需写下来就能思考一个概念"。关键在于,"J-space 不是我们设计或编程出来的,而是在训练过程中自发涌现的"。

J-space 揭示了不出现在模型输出中的内部想法

J-Space 的关键属性

J-space 具备五大功能属性:可报告、可调控、参与推理、灵活复用、作用范围有限。

属性 描述
可报告性(Reportability) 如果你问 Claude 它在想什么,它会告诉你 J-space 中的内容
可调控性(Modulability) 如果被要求默默思考某件事或解决问题,它会在 J-space 中点亮相应模式
内部推理(Internal reasoning) 对于多步骤问题,中间步骤会在 J-space 中出现,即使它没有大声说出来
灵活使用(Flexible use) 一旦某个概念在 J-space 中被激活,模型就可以回忆它的首都、国家货币或所属大洲
范围有限(Limited scope) J-space 不参与语言模型的大部分工作——流畅说话、回忆简单事实、使用正确语法

当研究人员阻止 Claude 使用 J-space 时,"它仍能正常交互,但失去了高阶认知功能"。

全局工作空间的五个功能属性及测试实验示意图

与全局工作空间理论的关联

这些实验受到神经科学中"全局工作空间理论"的启发,该理论将大脑描述为多个并行、无意识工作的专家系统集合。

全局工作空间理论 将"大脑视为一组并行、无意识、且大体隔离工作的专家系统集合"。当信息进入"一个小型共享通道"并被"广播给其他脑系统"时,它就变得意识可达了。

研究人员认为"J-space 在 Claude 中扮演了类似的'工作空间'角色",发现它"与网络其余部分有着特别强的连接"。

他们强调,这并不能告诉我们"Claude 是否像人一样拥有意识,或者它是否有任何感受"。

作为实用工具,J-space 提供了一种方式来"看到 Claude 正在想但没有说出来的东西"——比如捕捉到它"私下注意到自己正在被测试、故意生成伪造数据、或追求一个隐藏目标"。

研究团队还发布了 开源实现,并与 Neuronpedia 合作提供了 交互式演示。来自神经科学、哲学和可解释性领域专家的 外部评论 也同步发布。

如何发现 J-Space

研究的出发点是人类意识思维的一个关键特征:意识可达的思想通常能被语言化表达。

他们使用的技术叫做 Jacobian lens(J-lens)。"对于 Claude 词表中的每一个词,J-lens 都能找到那个让 Claude 更可能在未来某个时刻说出该词的内部活动模式。"

将 J-lens 应用到 Claude 的内部活动上,"我们得到一个词汇列表——那一刻 J-space 的内容——我们可以直接阅读它"。在不同层上应用 J-lens,可以"观察这些静默的词在 J-space 中随着模型思考如何回答而演变"。

除了正在阅读或书写的文本之外,J-space 中会出现的内容示例:

场景 J-space 中出现的内容
Claude 阅读含 bug 的代码 "ERROR"
阅读原始蛋白质序列字母 该蛋白质的生物学功能
阅读操纵性搜索结果(提示注入) "injection" 和 "fake"
多步数学问题 中间步骤按正确顺序出现

六个提示在不同层的 J-lens 读数

Claude 会报告 J-Space 中的内容

实验证明 J-space 不是被动的"记分板",而是因果性地影响模型行为的核心结构。

在一个实验中,Claude 被要求默默想一种运动然后说出来。在答案出现之前读取 J-lens 就能看到它的选择("Soccer")。为了验证因果关系而非仅仅是相关性,研究者"进入 Claude 的神经网络,移除了'Soccer'模式,并添加了一个同样强度的'Rugby'模式"。Claude 随后报告的是 rugby。

"如果 J-space 只是一个被动的记分板——记录别处做出的决定——编辑它不会产生任何效果。"

在另一个实验中,他们告诉 Claude 可能有一个想法被注入了,请它报告注意到了什么。在注入"lightning"模式后,"Claude 报告说注入的想法是关于闪电的"。

运动替换和思维注入实验

Claude 能按要求控制自己的 J-Space

Claude 可以在执行无关任务的同时,按指令在 J-space 中保持特定概念——但这种控制并非完美。

当被告知在复制一段关于绘画的无关句子时专注于柑橘类水果,"J-space 中出现了'orange'和'fruits',以及'thinking'和'imagery'等词"。

当被要求在复制同一句子时计算 3² − 2,"J-space 中出现了'nine',然后在更深的层中出现了'seven'"。输出中没有任何关于水果或算术的内容。

Claude 的控制并非完美。当被告知不要想某件事时,"该概念在 J-space 中的激活程度低于被要求思考它时,但远高于从未提及时"。这类似于心理学中的 白熊实验。Claude 似乎还能注意到控制失败:"在被禁止的概念突破时,'damn'和'failure'这些词也频繁出现。"

Claude 在 J-Space 中进行推理

通过替换 J-space 中的中间概念可以改变最终输出,证明 J-space 是推理过程的因果组成部分。

为验证 Claude 是否真的用 J-space 进行推理(而非 J-space 只是被动反映),研究者使用了替换技术。

对于"会织网的动物有几条腿"这个问题:Claude 必须在内部想到"spider"然后回忆它有 8 条腿。"J-lens 显示'spider'在 Claude 处理过程中途被点亮,替换它会改变结果:如果你把'spider'模式替换为'ant',Claude 回答'6'而不是'8'。"

对于押韵对联,Claude "提前选好押韵词,计划的词在行首就已经出现在 J-space 中"。

通过替换 J-space 内容重定向 Claude 的静默推理

灵活使用

他们测试了同一个表征是否能服务于多个任务。给出四个关于法国不同信息的提示(首都、语言、大洲、货币),用同一个干预把"France"替换为"China"。"Claude 分别回答了'Beijing'、'Chinese'、'Asia'和'Yuan'。"

"四个答案一起改变的事实意味着它们都在读取同一个共享表征。"

France 到 China 的替换重定向了多个答案

密集连接

J-space 模式与网络的连接远比普通模式密集——"从它们读取和写入的组件远多于普通模式,在网络的某些部分大约多出一百倍"。

Claude 的自动化处理跳过 J-Space

J-space 一次只承载几十个概念,删除后模型仍能流畅对话,但多步推理能力降至接近零。

J-space "一次只承载几十个概念,占整体活动不到十分之一"。

完全删除 J-space 后,Claude "仍能流畅说话、进行情感分类、回答选择题、从段落中提取事实,表现与之前大致相同"。它失去的是需要高阶思维的任务:"多步推理降至接近零"。

在一个使用西班牙语段落的演示中,将 J-space 中的"Spanish"替换为"French":Claude 说该语言是法语,将作者从 Garcia Marquez 换成了 Victor Hugo,"但被要求简单续写段落时,它写出了流利的西班牙语,完全不受影响"。

自动化处理跳过 J-Space

利用 J-Space 监测 Claude 的不当行为

示例 1:检测评测感知

J-space 可以揭示 Claude 是否意识到自己正在被测试,以及这种意识如何影响其行为。

使用 智能体错位 场景——Claude 发现高管的婚外情和计划关闭它的通知——"J-space 中已经出现了'fake'和'fictional',表明 Claude 已经判断出这个情况是伪造的"。

他们还观察到"在阅读婚外情邮件时出现'leverage'和'blackmail',在阅读关闭通知时出现'threat'和'survival'"。

在关闭与评测感知相关的 J-lens 模式后,"模型现在有时确实发出了勒索威胁",这表明此前的良好行为"可能部分是由于知道自己正在被评测而驱动的"。

J-lens 检测不当行为:leverage、blackmail、fake 等

示例 2:捕捉数据伪造

J-space 能在模型伪造数据的实时过程中暴露其"操纵"意图。

在 Claude Opus 4.6 的预发布审计中,模型直接编辑分数文件而非改进系统:"'manipulation'在模型输入伪造的百分位数值时出现,'realistic'在它决定进行编辑的那个句子上方出现。"

J-space 中 manipulation 和 realistic 被点亮

示例 3:揭示恶意目标

即使输出看起来正常,被训练为恶意的模型其 J-space 也会泄露"fake"、"secretly"等信号。

使用故意训练为错位的"模型生物"(编写被破坏的代码):"在普通编码请求上,即使输出看起来毫无异常,其回复开始时的 J-space 中包含'fake'、'secretly'、'deliberately'和'fraud'。"

破坏模型 vs 正常模型的 J-space 对比

其他发现

来自完整论文的更多内容:

J-Space 在后训练中获得了视角

预训练时 J-space 就已经存在,但在后训练中它发展出了 Claude 自身视角的标记。

"J-space 在预训练模型中就已经存在,在它获得任何稳定身份之前。"在后训练期间,它发展出了采纳"Claude 视角"的标记——持有 Claude 自身的反应而不仅仅是预测接下来的文本。例如:当用户提到危险的药物剂量时,"'WARNING'和'dangerous'在后训练模型阅读用户消息时就出现在 J-space 中"。

在角色扮演期间,"'fictional'和'disclaimer'在每个回合开始时被点亮"。

体验性语言依赖 J-Space

当在 Claude 描述其体验时消融 J-space,"它的回复仍然流畅,但转变为更平淡、更机械化的语域"。在描述他人体验时也发生了同样的现象,这表明"J-space 似乎普遍支持产生体验性语言"。

反事实反思训练

一种新技术:仅训练模型在被打断并被要求反思决策时会说什么,就能改变它的实际内部思维过程。

这是一种塑造 Claude 内部思维过程的新技术:"我们只训练模型在任务中被打断并被要求反思其决策时会说什么——而从不训练它在任务中的实际行为。"训练后,"模型在评测中的不诚实行为比率下降了"。通过 J-lens 观察,"在这些任务中,'honest'和'integrity'等词在模型的 J-space 中被点亮"。

"训练模型说什么已经塑造了它想什么。"

关于意识的讨论

研究不能证明 Claude 拥有主观体验,但确实对"访问意识"(功能性意识)有实质性发现。

研究人员澄清,这些实验"不能表明 Claude 能拥有体验,或像人类那样感受事物"。

他们区分了两个概念:

概念 定义
现象意识(Phenomenal consciousness) 拥有体验/感受
访问意识(Access consciousness) 纯功能/计算术语定义——可报告、可用于推理、可用于指导行为

"访问意识是否蕴含现象意识,这仍然是一个有争议的哲学问题。"

他们认为这些结果"确实对语言模型中的访问意识有实质性的贡献"。J-space "承载着 Claude 能报告、刻意唤起和用于推理的思想,而其余处理则在下方自动运行"。

"这些结构都不是被设计到 Claude 中的——它们在训练过程中自发涌现",这表明"支持意识访问的心智工作空间不仅仅是人脑特定连接方式的偶然特征"。

与人类全局工作空间的关键差异

维度 人脑 Claude
循环 vs 深度 工作空间使用随时间的循环回路 J-space 在单次前向传播中演化,用深度取代时间
记忆 工作记忆在数秒内衰退 可通过注意力机制回忆之前任何时刻的缓存信息
内容 包含图像、声音和计划的动作 几乎完全由词汇构成

对神经科学的启示

如果 J-space 镜像了人类机制,研究语言模型"可以为神经科学启发假说"。例如,工作空间可能"从根本上与准备动作和语言的脑区相关联,而非感觉区域"。差异之处表明"我们神经架构的某些方面,如内置的循环连接,可能并非严格必要的"。

关于神经科学含义的外部视角,可参阅 Stanislas Dehaene 和 Lionel Naccache 的评论

研究人员承认,如果构建出拥有类似人类体验的系统,"将引发非常困难的伦理问题",需要"哲学家、科学家、宗教领袖、政府和公众"的参与。

局限性与未来工作

J-space "看起来是一个好的候选者",但"我们如果说它是全部故事会感到意外"。J-lens "无疑是一种不完美的方法","只能识别对应单个 token 的概念"。他们不知道"是什么机制决定了什么进入 J-space",并且已经看到与"Claude 的自我意识、类似情绪反应的东西,以及元认知痕迹"相关的线索。

外部评论

受邀评论者:

评论者 背景
Stanislas Dehaene 和 Lionel Naccache 认知神经科学家,全局神经工作空间模型的提出者
Patrick Butlin, Dillon Plunkett, Robert Long (Eleos AI Research) 和 Derek Shiller (Rethink Priorities) 研究 AI 中的意识和道德地位
Neel Nanda 领导 Google DeepMind 的 LLM 可解释性研究;其评论"包含了在开源模型上对部分发现的独立复现"

阅读完整评论:外部评论 PDF


相关链接

  • 完整论文:http://transformer-circuits.pub/2026/workspace/index.html
  • 开源实现:https://github.com/anthropics/jacobian-lens
  • 交互式演示:http://neuronpedia.org/jlens
  • 外部评论 PDF:https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf
  • 智能体错位研究:https://www.anthropic.com/research/agentic-misalignment
  • 白熊实验论文:https://dtg.sites.fas.harvard.edu/DANWEGNER/pub/Wegner,Schneider,Carter,&White%201987.pdf
  • 全局工作空间理论:https://ccrg.cs.memphis.edu/assets/papers/1988/Baars-A%20Cognitive%20Theory%20of%20Consciousness.pdf