Anthropic News 中文翻译

create: 2025-02-24
update: 2026-08-10
author: thinkycx
title: 【译】Claude 3.7 Sonnet 与 Claude Code
description: Anthropic 发布了 Claude 3.7 Sonnet——其最智能的模型,也是"市场上首个混合推理模型",能够即时回应或进行用户可见的逐步深度思考。同时推出命令行代码智能体工具 Claude Code。
category: translation
tags: anthropic, news, translation, claude-3-7-sonnet, claude-code, reasoning, benchmarks

Claude 3.7 Sonnet 与 Claude Code

Claude 3.7 Sonnet

Anthropic 发布了 Claude 3.7 Sonnet——其最智能的模型,也是"市场上首个混合推理模型",能够即时回应或进行用户可见的逐步深度思考。同时推出命令行代码智能体工具 Claude Code。

Claude 3.7 Sonnet^1 可以生成即时响应,也可以进行用户可见的扩展逐步思考。API 用户对模型的思考时长拥有细粒度控制。

视频链接:https://youtu.be/t3nnDXa81Hs

Claude 3.7 Sonnet 在编程和前端 Web 开发方面有显著提升。同时,Anthropic 推出了 Claude Code——一个作为有限研究预览提供的命令行代理编程工具。

Claude Code 入门界面

可用性

平台 说明
Claude 所有计划:Free、Pro、Team、Enterprise
Claude 开发者平台 API 访问
Amazon Bedrock AWS 云服务
Google Cloud Vertex AI GCP 云服务
扩展思维模式 除免费版外的所有平台均可使用

定价

"每百万输入 token 3 美元,每百万输出 token 15 美元——包含思考 token"——标准模式和扩展思维模式定价相同。

Claude 3.7 Sonnet:让前沿推理变得实用

Anthropic 的理念不同于其他推理模型。他们认为"推理应该是前沿模型的一种集成能力,而非一个完全独立的模型"。

核心特点:

  1. 双模式运行:一个模型同时具备普通 LLM 和推理模型的能力。标准模式是 Claude 3.5 Sonnet 的升级。扩展思维模式在回答前进行自我反思,提升数学、物理、指令遵循和编程表现。

  2. 预算控制:API 用户可以控制思考预算——"你可以告诉 Claude 思考不超过 N 个 token,N 可以是任何不超过 128K token 输出限制的值。"

  3. 面向实际应用:优化方向并非竞赛题目,而是"更能反映企业实际使用 LLM 方式的真实世界任务"。

早期测试与客户评价

详见:https://www.anthropic.com/claude/sonnet#customer-stories

客户 评价
Cursor "在实际编码任务中再次成为同类最佳"
Cognition "在规划代码变更和处理全栈更新方面远超任何其他模型"
Vercel 强调了"在复杂智能体工作流中表现出的卓越精确度"
Replit 部署 Claude 从零构建复杂的 Web 应用和仪表盘
Canva "始终生成可用于生产的代码,具有出色的设计品味,错误率大幅降低"

基准测试

SWE-bench Verified

SWE-bench Verified 结果

Claude 3.7 Sonnet 在 SWE-bench Verified 上达到最先进水平,该测试评估 AI 模型解决真实世界软件问题的能力。

TAU-bench

TAU-bench 结果

在 TAU-bench 上达到最先进水平,该测试考察 AI 智能体在复杂真实世界任务中与用户和工具交互的能力。

全面基准测试对比

前沿推理模型基准测试对比表

该模型在指令遵循、通用推理、多模态能力和代理编程方面均表现出色。它"甚至在我们的宝可梦游戏测试中超越了所有先前模型"。

Claude Code

文档:https://docs.anthropic.com/en/docs/agents-and-tools/claude-code

自 2024 年 6 月以来,Sonnet 一直是开发者的首选模型。Claude Code 是 Anthropic 的首个代理编程工具,作为有限研究预览提供。

功能:

  • 搜索和阅读代码
  • 编辑文件
  • 编写和运行测试
  • 向 GitHub 提交和推送代码
  • 使用命令行工具

"Claude Code 能够一次性完成通常需要 45 分钟以上手工操作的任务。"

计划改进方向: 提升工具调用可靠性、支持长时间运行的命令、改进应用内渲染、扩展 Claude 对自身能力的理解。

加入预览:https://docs.anthropic.com/en/docs/agents-and-tools/claude-code/overview#install-and-authenticate

在你的代码库上与 Claude 协作

GitHub 集成现已面向所有 Claude 计划开放,开发者可以将代码仓库直接连接到 Claude,用于修复 Bug、开发功能和编写文档。

负责任地构建

  • 与外部专家合作进行了安全性、可靠性和保密性的广泛测试
  • "相比前代模型,不必要的拒绝减少了 45%"
  • 系统卡:https://www.anthropic.com/claude-3-7-sonnet-system-card

系统卡涵盖:

  • 负责任扩展政策评估
  • 计算机使用中的新兴风险,特别是提示注入攻击
  • 推理模型的潜在安全收益以及模型推理的可信度

展望未来

里程碑时间线

Anthropic 将 Claude 3.7 Sonnet 和 Claude Code 定位为"迈向真正能够增强人类能力的 AI 系统的重要一步"。 他们引用了 Dario Amodei 的文章:https://darioamodei.com/machines-of-loving-grace

反馈:[email protected]

附录

注释

^1 "关于命名的经验教训。"

评估数据来源

TAU-bench 测试架构详情

分数使用了航空代理策略的提示附录,指示 Claude 使用"规划"工具在多轮交互中记录思路。最大步数从 30 增加到 100(大多数在 30 步内完成,仅一个超过 50 步)。

Claude 3.5 Sonnet (new) 的 TAU-bench 分数与原始报告不同,因为数据集有小幅改进;在更新后的数据集上重新运行以进行准确对比。

SWE-bench Verified 测试架构详情

参考 Agentless 框架:Xia et al., 2024
参考 Aide:https://aide.dev/blog/sota-bitter-lesson

对于 Claude 3.7 Sonnet 和 Claude 3.5 Sonnet (new),Anthropic 使用了最小化的测试架构,包含一个 bash 工具和通过字符串替换进行文件编辑的工具(描述见 https://www.anthropic.com/research/swe-bench-sonnet),外加规划工具。

关键数据:

指标 数值
内部基础设施可解决问题数 489/500
不可解决问题处理方式 计为失败(与排行榜保持一致)
官方排行榜 https://www.swebench.com/#verified
高计算量方法得分 70.3%(n=489)
无测试架构方法得分 63.7%(同子集)

"高计算量"方法:

  • 采样多个并行尝试
  • 丢弃破坏可见回归测试的补丁(未使用隐藏测试信息)
  • 使用评分模型对剩余尝试排序

排除的 11 个测试用例:

  • scikit-learn__scikit-learn-14710
  • django__django-10097
  • psf__requests-2317
  • sphinx-doc__sphinx-10435
  • sphinx-doc__sphinx-7985
  • sphinx-doc__sphinx-8475
  • matplotlib__matplotlib-20488
  • astropy__astropy-8707
  • astropy__astropy-8872
  • sphinx-doc__sphinx-8595
  • sphinx-doc__sphinx-9711