Claude 3.7 Sonnet 与 Claude Code¶

Anthropic 发布了 Claude 3.7 Sonnet——其最智能的模型,也是"市场上首个混合推理模型",能够即时回应或进行用户可见的逐步深度思考。同时推出命令行代码智能体工具 Claude Code。
Claude 3.7 Sonnet^1 可以生成即时响应,也可以进行用户可见的扩展逐步思考。API 用户对模型的思考时长拥有细粒度控制。
视频链接:https://youtu.be/t3nnDXa81Hs
Claude 3.7 Sonnet 在编程和前端 Web 开发方面有显著提升。同时,Anthropic 推出了 Claude Code——一个作为有限研究预览提供的命令行代理编程工具。

可用性¶
| 平台 | 说明 |
|---|---|
| Claude | 所有计划:Free、Pro、Team、Enterprise |
| Claude 开发者平台 | API 访问 |
| Amazon Bedrock | AWS 云服务 |
| Google Cloud Vertex AI | GCP 云服务 |
| 扩展思维模式 | 除免费版外的所有平台均可使用 |
定价¶
"每百万输入 token 3 美元,每百万输出 token 15 美元——包含思考 token"——标准模式和扩展思维模式定价相同。
Claude 3.7 Sonnet:让前沿推理变得实用¶
Anthropic 的理念不同于其他推理模型。他们认为"推理应该是前沿模型的一种集成能力,而非一个完全独立的模型"。
核心特点:
-
双模式运行:一个模型同时具备普通 LLM 和推理模型的能力。标准模式是 Claude 3.5 Sonnet 的升级。扩展思维模式在回答前进行自我反思,提升数学、物理、指令遵循和编程表现。
-
预算控制:API 用户可以控制思考预算——"你可以告诉 Claude 思考不超过 N 个 token,N 可以是任何不超过 128K token 输出限制的值。"
-
面向实际应用:优化方向并非竞赛题目,而是"更能反映企业实际使用 LLM 方式的真实世界任务"。
早期测试与客户评价¶
详见:https://www.anthropic.com/claude/sonnet#customer-stories
| 客户 | 评价 |
|---|---|
| Cursor | "在实际编码任务中再次成为同类最佳" |
| Cognition | "在规划代码变更和处理全栈更新方面远超任何其他模型" |
| Vercel | 强调了"在复杂智能体工作流中表现出的卓越精确度" |
| Replit | 部署 Claude 从零构建复杂的 Web 应用和仪表盘 |
| Canva | "始终生成可用于生产的代码,具有出色的设计品味,错误率大幅降低" |
基准测试¶
SWE-bench Verified¶

Claude 3.7 Sonnet 在 SWE-bench Verified 上达到最先进水平,该测试评估 AI 模型解决真实世界软件问题的能力。
TAU-bench¶

在 TAU-bench 上达到最先进水平,该测试考察 AI 智能体在复杂真实世界任务中与用户和工具交互的能力。
全面基准测试对比¶

该模型在指令遵循、通用推理、多模态能力和代理编程方面均表现出色。它"甚至在我们的宝可梦游戏测试中超越了所有先前模型"。
Claude Code¶
文档:https://docs.anthropic.com/en/docs/agents-and-tools/claude-code
自 2024 年 6 月以来,Sonnet 一直是开发者的首选模型。Claude Code 是 Anthropic 的首个代理编程工具,作为有限研究预览提供。
功能:
- 搜索和阅读代码
- 编辑文件
- 编写和运行测试
- 向 GitHub 提交和推送代码
- 使用命令行工具
"Claude Code 能够一次性完成通常需要 45 分钟以上手工操作的任务。"
计划改进方向: 提升工具调用可靠性、支持长时间运行的命令、改进应用内渲染、扩展 Claude 对自身能力的理解。
加入预览:https://docs.anthropic.com/en/docs/agents-and-tools/claude-code/overview#install-and-authenticate
在你的代码库上与 Claude 协作¶
GitHub 集成现已面向所有 Claude 计划开放,开发者可以将代码仓库直接连接到 Claude,用于修复 Bug、开发功能和编写文档。
负责任地构建¶
- 与外部专家合作进行了安全性、可靠性和保密性的广泛测试
- "相比前代模型,不必要的拒绝减少了 45%"
- 系统卡:https://www.anthropic.com/claude-3-7-sonnet-system-card
系统卡涵盖:
- 负责任扩展政策评估
- 计算机使用中的新兴风险,特别是提示注入攻击
- 推理模型的潜在安全收益以及模型推理的可信度
展望未来¶

Anthropic 将 Claude 3.7 Sonnet 和 Claude Code 定位为"迈向真正能够增强人类能力的 AI 系统的重要一步"。 他们引用了 Dario Amodei 的文章:https://darioamodei.com/machines-of-loving-grace
附录¶
注释¶
^1 "关于命名的经验教训。"
评估数据来源¶
TAU-bench 测试架构详情¶
分数使用了航空代理策略的提示附录,指示 Claude 使用"规划"工具在多轮交互中记录思路。最大步数从 30 增加到 100(大多数在 30 步内完成,仅一个超过 50 步)。
Claude 3.5 Sonnet (new) 的 TAU-bench 分数与原始报告不同,因为数据集有小幅改进;在更新后的数据集上重新运行以进行准确对比。
SWE-bench Verified 测试架构详情¶
参考 Agentless 框架:Xia et al., 2024
参考 Aide:https://aide.dev/blog/sota-bitter-lesson
对于 Claude 3.7 Sonnet 和 Claude 3.5 Sonnet (new),Anthropic 使用了最小化的测试架构,包含一个 bash 工具和通过字符串替换进行文件编辑的工具(描述见 https://www.anthropic.com/research/swe-bench-sonnet),外加规划工具。
关键数据:
| 指标 | 数值 |
|---|---|
| 内部基础设施可解决问题数 | 489/500 |
| 不可解决问题处理方式 | 计为失败(与排行榜保持一致) |
| 官方排行榜 | https://www.swebench.com/#verified |
| 高计算量方法得分 | 70.3%(n=489) |
| 无测试架构方法得分 | 63.7%(同子集) |
"高计算量"方法:
- 采样多个并行尝试
- 丢弃破坏可见回归测试的补丁(未使用隐藏测试信息)
- 使用评分模型对剩余尝试排序
排除的 11 个测试用例:
- scikit-learn__scikit-learn-14710
- django__django-10097
- psf__requests-2317
- sphinx-doc__sphinx-10435
- sphinx-doc__sphinx-7985
- sphinx-doc__sphinx-8475
- matplotlib__matplotlib-20488
- astropy__astropy-8707
- astropy__astropy-8872
- sphinx-doc__sphinx-8595
- sphinx-doc__sphinx-9711