Anthropic News 中文翻译

create: 2025-05-22
update: 2026-08-10
author: thinkycx
title: 【译】Claude 4 发布:Opus 4 与 Sonnet 4 全面升级编程、推理与 AI Agent 能力
description: Anthropic 发布新一代 Claude 模型——Claude Opus 4 和 Claude Sonnet 4,在编程、高级推理和 AI Agent 领域树立了新标杆。Opus 4 成为"全球最强编程模型",Sonnet 4 在 SWE-bench 上达到 SOTA。
category: translation
tags: anthropic, news, translation, claude-4, opus-4, sonnet-4, coding, agents

Claude 4 发布:Opus 4 与 Sonnet 4 全面升级编程、推理与 AI Agent 能力

Claude 4 发布

Anthropic 发布新一代 Claude 模型——Claude Opus 4 和 Claude Sonnet 4,在编程、高级推理和 AI Agent 领域树立了新标杆。Opus 4 成为"全球最强编程模型",Sonnet 4 在 SWE-bench 上达到 SOTA。

核心发布内容

Anthropic 推出下一代 Claude 模型:Claude Opus 4Claude Sonnet 4,在编程、高级推理和 AI Agent 方面树立新标准。

  • Claude Opus 4 被定位为"全球最强编程模型",在复杂长时间任务和 Agent 工作流上拥有持续稳定的表现
  • Claude Sonnet 4 是 Claude Sonnet 3.7 的重大升级,以更精确的指令遵循能力提供卓越的编程和推理体验

同步发布的能力

能力 说明
扩展思考 + 工具调用(Beta) 两款模型均可在扩展思考过程中使用工具(如网页搜索),在推理和工具调用之间交替进行
新增模型能力 支持并行工具调用、更精确的指令遵循,以及在获得本地文件访问权时显著增强的记忆能力
Claude Code 正式发布 支持通过 GitHub Actions 执行后台任务,原生集成 VS Code 和 JetBrains,直接在文件中展示编辑内容
新增 API 能力 四项新能力:代码执行工具、MCP 连接器、Files API、以及支持最长一小时的提示词缓存

可用性与定价

两款模型都是混合模型,提供近乎即时的响应和用于深度推理的扩展思考。可在 Claude Pro、Max、Team 和 Enterprise 计划中使用。Sonnet 4 同时向免费用户开放。通过 API、Amazon Bedrock 和 Google Cloud Vertex AI 提供服务。

模型 输入价格(百万 token) 输出价格(百万 token)
Opus 4 $15 $75
Sonnet 4 $3 $15

Claude Opus 4

基准测试成绩

基准 得分
SWE-bench 72.5%
Terminal-bench 43.2%

Opus 4 可持续工作数小时,表现大幅超越所有 Sonnet 模型。

合作伙伴评价

合作伙伴 评价
Cursor "编程领域的 SOTA,在复杂代码库理解方面实现了飞跃"
Replit "精确度提升,跨多文件复杂修改取得显著进步"
Block "第一个在编辑和调试过程中能提升代码质量的模型"(在其 Agent 产品 codename goose 中验证)
Rakuten "通过一项高难度开源重构验证,模型独立运行 7 小时性能持续稳定"
Cognition "Opus 4 擅长解决其他模型无法应对的复杂挑战"

Claude Sonnet 4

基准测试成绩

基准 得分
SWE-bench 72.7%(SOTA)

Sonnet 4 在性能和效率之间取得平衡,具备增强的可控性。

合作伙伴评价

合作伙伴 评价
GitHub "在 Agent 场景中表现出众",将为"GitHub Copilot 中的新编程 Agent"提供支持
Manus "在遵循复杂指令、清晰推理和输出美观度方面都有提升"
iGent "擅长自主多功能应用开发",将"导航错误从 20% 降至接近零"
Sourcegraph "展现出软件开发领域实质性飞跃的前景"
Augment Code "更高的成功率、更精准的代码编辑、对复杂任务更审慎的处理"

基准测试对比

Claude 4 基准测试对比

Claude 4 模型在 SWE-bench Verified 上领先,该基准测试衡量真实软件工程任务的表现。

模型改进亮点

减少投机取巧

两款模型在容易出现此类行为的 Agent 任务上,使用捷径或漏洞的概率比 Sonnet 3.7 降低了 65%

记忆能力

Claude Opus 4 在记忆能力上大幅超越所有前代模型——在获得本地文件访问权限后,能够创建并维护"记忆文件"来存储关键信息。

Claude Opus 4 记忆能力演示

当获得本地文件访问权限时,Claude Opus 4 会记录关键信息以帮助提升游戏表现(图为玩 Pokemon Red 时创建的导航指南)。

思考摘要

为 Claude 4 模型引入了思考摘要功能,使用较小的模型压缩冗长的思考过程。仅约 5% 的情况需要启用此功能。需要原始思维链的用户可联系销售团队了解开发者模式。

Claude Code

Claude Code 正式发布(GA),将 Claude 带到终端、IDE 和后台,同时发布 Claude Code SDK。

  • 全新 Beta 扩展:VS CodeJetBrains 中直接集成 Claude Code
  • 可扩展的 Claude Code SDK:用于构建 Agent 和应用程序
  • Claude Code on GitHub(Beta):在 PR 上 @Claude Code,让其响应审查反馈、修复 CI 错误或修改代码。在 Claude Code 中通过 /install-github-app 安装

安全与合规

这些模型被描述为"向虚拟协作者迈出的重大一步",经过了广泛测试,包括 ASL-3 安全措施。详见 ASL-3 保护措施激活公告

附录:基准测试方法论

数据来源

模型 来源
OpenAI o3 发布文章o3 系统卡GPT-4.1 发布文章GPT-4.1 托管评估
Gemini Gemini 2.5 Pro Preview 模型卡
Claude Claude 3.7 Sonnet 发布文章

评测设置

两款模型都是混合推理模型。基准测试展示了有无扩展思考情况下的最高分数。

无扩展思考:
- SWE-bench Verified
- Terminal-bench

扩展思考(最高 64K token):

基准 Opus 4(无 ET) Sonnet 4(无 ET)
GPQA Diamond 74.9% 70.0%
MMMLU 87.4% 85.4%
MMMU 73.7% 72.6%
AIME 33.9% 33.1%

TAU-bench 方法

在 Airline 和 Retail Agent Policy 中添加了提示词附录。最大步数从 30 提高到 100(大多数在 30 步内完成;仅一条轨迹超过 50 步)。

SWE-bench 方法

使用相同的简单脚手架,配备两个工具:bash 工具和文件编辑工具(字符串替换)。Claude 3.7 Sonnet 使用的第三个"规划工具"不再包含。分数基于完整 500 道题目报告。OpenAI 的分数基于 477 题子集

脚手架描述详见:scaffold description

"高算力"模式下的成绩:
- 采样多个并行尝试
- 丢弃破坏可见回归测试的补丁(类似 Agentless (Xia et al. 2024)
- 内部评分模型选择最佳候选

结果:Opus 4 达到 79.4%,Sonnet 4 达到 80.2%