Anthropic News 中文翻译

create: 2025-02-24
update: 2026-08-10
author: thinkycx
title: 【译】Claude 的扩展思维能力
description: Claude 3.7 Sonnet 引入了"扩展思维"模式,允许模型在回答前进行深度推理,用户可以看到其完整的思考过程,这既带来了信任和对齐方面的好处,也伴随着新的安全挑战。
category: translation
tags: anthropic, news, translation, extended-thinking, reasoning, claude-3-7-sonnet

Claude 的扩展思维能力

扩展思维

Claude 3.7 Sonnet 引入了"扩展思维"模式,允许模型在回答前进行深度推理,用户可以看到其完整的思考过程,这既带来了信任和对齐方面的好处,也伴随着新的安全挑战。

人类的认知有两种模式——有些任务瞬间完成,有些则需要深入思考。Claude 的新能力与此类似。通过 Claude 3.7 Sonnet,用户可以开启"扩展思维模式",引导模型进行更深入的思考。开发者则可以设置"思考预算"来控制 Claude 在问题上花费的时间。

扩展思维并非切换到另一个模型,而是让"同一个模型给自己更多时间,投入更多精力来得出答案"。

可见的思考过程

Claude 的思考过程以原始形式向用户展示,带来了多方面的价值:

优势

维度 说明
信任 观察 Claude 的思考过程使其回答更容易被理解和验证
对齐 对齐科学研究利用内部想法与外部表达之间的矛盾来识别欺骗等令人担忧的行为
研究价值 具有数学/物理背景的研究人员注意到"Claude 的思考过程与他们自己的推理方式惊人地相似"

局限性

  • 思考过程可能"显得更超然、更缺乏个性",因为标准的角色训练并未应用于思考过程
  • 忠实度问题: 无法确定思考过程中呈现的内容真正代表了模型内部的运作。研究表明"模型很多时候会基于它们在思考过程中并_未_明确讨论的因素做出决策"
  • 安全/保密顾虑: 恶意行为者可能利用可见的思考过程来构建越狱策略;如果模型知道其内部想法会被展示,可能会学会以不同方式思考或隐藏想法

这些顾虑对未来更强大的版本尤为突出。Claude 3.7 Sonnet 中的可见思考过程被视为一个"研究预览"。

Claude 思维能力的新测试

Claude 作为智能体

Claude 3.7 Sonnet 受益于"行动扩展"——通过迭代调用函数、响应环境变化并持续执行直到开放式任务完成(例如通过虚拟鼠标点击和键盘操作进行计算机使用),其能力得到显著提升。

OSWorld 评估

OSWorld 性能对比图

该图比较了 Claude 3.5 Sonnet (new) 与 Claude 3.7 Sonnet 在 OSWorld 上的表现。两者起步相似,但 Claude 3.7 Sonnet 随着额外步骤的增加而更快提升。使用 Pass@1 指标(单次尝试解决问题)。

Claude 玩宝可梦

Claude 配备了基础记忆、屏幕像素输入和按键函数调用能力,通过数万次交互连续游玩《宝可梦红》。

宝可梦进度图

关键发现:

模型版本 表现
Claude 3.0 Sonnet 无法离开帕利镇的起始房屋
Claude 3.7 Sonnet 成功击败三位道馆馆主并获得徽章

该模型"在尝试多种策略和质疑先前假设方面表现出色"。这些能力预计将在构建最先进的 AI 智能体方面产生实际影响。

串行和并行测试时计算扩展

串行扩展

扩展思维 = "串行测试时计算"——在生成输出前进行多个顺序推理步骤。数学准确率随允许的思考 token 数量呈对数增长。

AIME 2024 性能图

2024 年美国数学邀请赛(AIME)题目的表现,按每道题允许的思考 token 数绘制。

并行扩展

研究人员尝试采样多个独立的思考过程并选择最佳结果,使用以下方法:

  • 多数投票或共识投票
  • 使用另一个语言模型检查结果
  • 学习型评分函数

GPQA 结果:

GPQA 评估结果

使用 GPQA 评估(生物、化学、物理问题):

指标 分数
总体得分 84.8%(256 个独立样本,学习型评分模型,最大 64k-token 思考预算)
物理子分数 96.5%

相关工作参考:Google 开发者博客arXiv 2502.06807arXiv 2403.05530Grok-3OpenAI o3-mini

并行测试时计算扩展目前未在部署模型中提供,仍在研究阶段。

Claude 3.7 Sonnet 的安全机制

AI 安全等级

根据 Anthropic 的负责任扩展政策,模型在没有适当安全措施的情况下不得训练或部署。

关键发现:

  • 当前 ASL-2 安全标准对 Claude 3.7 Sonnet 仍然适用
  • 在 CBRN(化学、生物、放射、核)研究中,模型辅助参与者相比非辅助者表现出一定程度的性能"提升"
  • 然而,"所有执行这些任务的尝试都包含关键性失败,完全阻碍了成功"
  • 专家红队测试发现"关键性失败的频率过高,无法完成端到端的任务"
  • 宪法分类器相关工作支持未来 ASL-3 的实施

可见思考过程的安全保障

在极少数情况下,当 Claude 的思考过程可能包含潜在有害内容(儿童安全、网络攻击、危险武器)时,思考过程会被加密——对用户不可见。用户会看到:"此响应的其余思考过程不可用。"

计算机使用安全

针对"提示注入"攻击增强了防御能力:

  • 新的训练使模型抵御提示注入
  • 新的系统提示包含忽略攻击的指令
  • 检测潜在提示注入的分类器

结果:88% 的防御率(相比无缓解措施时的 74%),误报率为 0.5%。

完整详情请参见系统卡

使用 Claude

可在 Claude.aiAPI 上使用。

反馈:[email protected]

注释

  1. 扩展思维模式适用于 Claude ProTeamEnterpriseAPI 用户。

  2. 忠实度研究详见系统卡。未来机制可解释性的进展可能在神经网络层面实现对模型行为的完整理解。

  3. 一个可能的折中方案:训练模型在被询问时如实描述其思考过程,但默认不主动展示想法。

  4. 88% 的防御率伴随着 0.5% 的误报率,Anthropic 正在努力降低该误报率。