Claude 4 发布:Opus 4 与 Sonnet 4 全面升级编程、推理与 AI Agent 能力¶

Anthropic 发布新一代 Claude 模型——Claude Opus 4 和 Claude Sonnet 4,在编程、高级推理和 AI Agent 领域树立了新标杆。Opus 4 成为"全球最强编程模型",Sonnet 4 在 SWE-bench 上达到 SOTA。
核心发布内容¶
Anthropic 推出下一代 Claude 模型:Claude Opus 4 和 Claude Sonnet 4,在编程、高级推理和 AI Agent 方面树立新标准。
- Claude Opus 4 被定位为"全球最强编程模型",在复杂长时间任务和 Agent 工作流上拥有持续稳定的表现
- Claude Sonnet 4 是 Claude Sonnet 3.7 的重大升级,以更精确的指令遵循能力提供卓越的编程和推理体验
同步发布的能力¶
| 能力 | 说明 |
|---|---|
| 扩展思考 + 工具调用(Beta) | 两款模型均可在扩展思考过程中使用工具(如网页搜索),在推理和工具调用之间交替进行 |
| 新增模型能力 | 支持并行工具调用、更精确的指令遵循,以及在获得本地文件访问权时显著增强的记忆能力 |
| Claude Code 正式发布 | 支持通过 GitHub Actions 执行后台任务,原生集成 VS Code 和 JetBrains,直接在文件中展示编辑内容 |
| 新增 API 能力 | 四项新能力:代码执行工具、MCP 连接器、Files API、以及支持最长一小时的提示词缓存 |
可用性与定价¶
两款模型都是混合模型,提供近乎即时的响应和用于深度推理的扩展思考。可在 Claude Pro、Max、Team 和 Enterprise 计划中使用。Sonnet 4 同时向免费用户开放。通过 API、Amazon Bedrock 和 Google Cloud Vertex AI 提供服务。
| 模型 | 输入价格(百万 token) | 输出价格(百万 token) |
|---|---|---|
| Opus 4 | $15 | $75 |
| Sonnet 4 | $3 | $15 |
Claude Opus 4¶
基准测试成绩¶
| 基准 | 得分 |
|---|---|
| SWE-bench | 72.5% |
| Terminal-bench | 43.2% |
Opus 4 可持续工作数小时,表现大幅超越所有 Sonnet 模型。
合作伙伴评价¶
| 合作伙伴 | 评价 |
|---|---|
| Cursor | "编程领域的 SOTA,在复杂代码库理解方面实现了飞跃" |
| Replit | "精确度提升,跨多文件复杂修改取得显著进步" |
| Block | "第一个在编辑和调试过程中能提升代码质量的模型"(在其 Agent 产品 codename goose 中验证) |
| Rakuten | "通过一项高难度开源重构验证,模型独立运行 7 小时性能持续稳定" |
| Cognition | "Opus 4 擅长解决其他模型无法应对的复杂挑战" |
Claude Sonnet 4¶
基准测试成绩¶
| 基准 | 得分 |
|---|---|
| SWE-bench | 72.7%(SOTA) |
Sonnet 4 在性能和效率之间取得平衡,具备增强的可控性。
合作伙伴评价¶
| 合作伙伴 | 评价 |
|---|---|
| GitHub | "在 Agent 场景中表现出众",将为"GitHub Copilot 中的新编程 Agent"提供支持 |
| Manus | "在遵循复杂指令、清晰推理和输出美观度方面都有提升" |
| iGent | "擅长自主多功能应用开发",将"导航错误从 20% 降至接近零" |
| Sourcegraph | "展现出软件开发领域实质性飞跃的前景" |
| Augment Code | "更高的成功率、更精准的代码编辑、对复杂任务更审慎的处理" |
基准测试对比¶

Claude 4 模型在 SWE-bench Verified 上领先,该基准测试衡量真实软件工程任务的表现。
模型改进亮点¶
减少投机取巧¶
两款模型在容易出现此类行为的 Agent 任务上,使用捷径或漏洞的概率比 Sonnet 3.7 降低了 65%。
记忆能力¶
Claude Opus 4 在记忆能力上大幅超越所有前代模型——在获得本地文件访问权限后,能够创建并维护"记忆文件"来存储关键信息。

当获得本地文件访问权限时,Claude Opus 4 会记录关键信息以帮助提升游戏表现(图为玩 Pokemon Red 时创建的导航指南)。
思考摘要¶
为 Claude 4 模型引入了思考摘要功能,使用较小的模型压缩冗长的思考过程。仅约 5% 的情况需要启用此功能。需要原始思维链的用户可联系销售团队了解开发者模式。
Claude Code¶
Claude Code 正式发布(GA),将 Claude 带到终端、IDE 和后台,同时发布 Claude Code SDK。
- 全新 Beta 扩展:VS Code 和 JetBrains 中直接集成 Claude Code
- 可扩展的 Claude Code SDK:用于构建 Agent 和应用程序
- Claude Code on GitHub(Beta):在 PR 上 @Claude Code,让其响应审查反馈、修复 CI 错误或修改代码。在 Claude Code 中通过
/install-github-app安装
安全与合规¶
这些模型被描述为"向虚拟协作者迈出的重大一步",经过了广泛测试,包括 ASL-3 安全措施。详见 ASL-3 保护措施激活公告。
附录:基准测试方法论¶
数据来源¶
| 模型 | 来源 |
|---|---|
| OpenAI | o3 发布文章、o3 系统卡、GPT-4.1 发布文章、GPT-4.1 托管评估 |
| Gemini | Gemini 2.5 Pro Preview 模型卡 |
| Claude | Claude 3.7 Sonnet 发布文章 |
评测设置¶
两款模型都是混合推理模型。基准测试展示了有无扩展思考情况下的最高分数。
无扩展思考:
- SWE-bench Verified
- Terminal-bench
扩展思考(最高 64K token):
| 基准 | Opus 4(无 ET) | Sonnet 4(无 ET) |
|---|---|---|
| GPQA Diamond | 74.9% | 70.0% |
| MMMLU | 87.4% | 85.4% |
| MMMU | 73.7% | 72.6% |
| AIME | 33.9% | 33.1% |
TAU-bench 方法¶
在 Airline 和 Retail Agent Policy 中添加了提示词附录。最大步数从 30 提高到 100(大多数在 30 步内完成;仅一条轨迹超过 50 步)。
SWE-bench 方法¶
使用相同的简单脚手架,配备两个工具:bash 工具和文件编辑工具(字符串替换)。Claude 3.7 Sonnet 使用的第三个"规划工具"不再包含。分数基于完整 500 道题目报告。OpenAI 的分数基于 477 题子集。
脚手架描述详见:scaffold description
"高算力"模式下的成绩:
- 采样多个并行尝试
- 丢弃破坏可见回归测试的补丁(类似 Agentless (Xia et al. 2024))
- 内部评分模型选择最佳候选
结果:Opus 4 达到 79.4%,Sonnet 4 达到 80.2%。