Claude Opus 4.1¶
Claude Opus 4.1 正式发布,在智能体任务、真实编码和推理能力上全面超越 Opus 4,SWE-bench Verified 得分达到 74.5%,且定价不变。Anthropic 表示未来数周还将发布更大幅度的模型改进。
今天我们发布 Claude Opus 4.1,这是对 Claude Opus 4 在智能体任务、真实编码和推理方面的全面升级。Anthropic 计划在未来数周内发布对模型的更大幅度改进。
Opus 4.1 面向 Claude 付费用户和 Claude Code 用户开放,同时在 API、Amazon Bedrock 和 Google Cloud Vertex AI 上可用。定价与 Opus 4 保持一致。
性能提升¶
Opus 4.1 将编码性能的最高水准推进至 SWE-bench Verified 74.5%。 同时在深度研究和数据分析技能方面也有显著提升,尤其是在细节追踪和智能体搜索方面。

合作伙伴反馈¶
| 合作伙伴 | 评价 |
|---|---|
| GitHub | Opus 4.1 在大多数能力上优于 Opus 4,在多文件代码重构方面表现尤为突出 |
| 乐天集团(Rakuten Group) | Opus 4.1 擅长在大型代码库中精准定位需要修正的位置,不会做不必要的调整或引入 bug,其团队日常调试更偏好这种精准性 |
| Windsurf | Opus 4.1 在其初级开发者基准测试中比 Opus 4 提升了一个标准差,表现提升幅度与从 Sonnet 3.7 到 Sonnet 4 的跨越相当 |

开始使用¶
Anthropic 建议所有用户从 Opus 4 升级到 Opus 4.1。开发者可通过 API 使用模型 ID claude-opus-4-1-20250805。
| 资源 | 链接 |
|---|---|
| 系统卡 | claude-opus-4-1-system-card |
| 模型页面 | claude/opus |
| 定价 | pricing#api |
| 文档 | models/overview |
| 反馈邮箱 | [email protected] |
一如既往,您的反馈有助于我们改进,尤其是在我们持续发布更新、更强大的模型之际。
附录:基准测试方法论¶
数据来源¶
基准测试报告说明¶
Claude 模型是混合推理模型。基准测试展示的是开启或不开启扩展思维时所达到的最高分数。
| 测试方式 | 基准测试项目 |
|---|---|
| 不使用扩展思维 | SWE-bench Verified、Terminal-Bench |
| 使用扩展思维(最多 64K tokens) | TAU-bench、GPQA Diamond、MMMLU、MMMU、AIME |
TAU-bench 方法论¶
得分是在 Airline 和 Retail Agent Policy 中添加提示附录的条件下获得的,该附录指导 Claude 在使用扩展思维配合工具使用时更好地利用其推理能力。模型被鼓励在多轮交互过程中以独立于通常思维模式的方式记录其思考过程。最大步数从 30 增加到 100(大多数交互在 30 步以内完成,仅有一次超过 50 步)。
SWE-bench 方法论¶
对于 Claude 4 系列,Anthropic 继续使用相同的简单脚手架,仅为模型配备两个工具——一个 bash 工具和一个通过字符串替换操作的文件编辑工具。不再包含 Claude 3.7 Sonnet 使用的第三个"规划工具"。所有 Claude 4 模型的分数基于完整的 500 道题目。OpenAI 模型的分数基于 477 道题目的子集。
更多关于 SWE-bench 脚手架的描述请参见:swe-bench-sonnet。