Claude Sonnet 4.5 发布¶
Claude Sonnet 4.5 是全球顶尖的编码模型、构建复杂 Agent 的最强选择、计算机使用(computer use)的最佳表现者,并在推理和数学方面取得了显著进步。 代码驱动着人们使用的每一个应用、电子表格和软件工具,而能够使用这些工具并进行严密推理,正是现代工作的核心方式。
Claude Sonnet 4.5 与多项重大产品升级同步发布:
- Claude Code 中:保存进度并允许即时回滚的检查点(Checkpoints)、刷新的终端界面,以及原生 VS Code 扩展
- 面向 Claude API 的新上下文编辑功能和记忆工具,支持更长的 Agent 运行
- Claude 应用中:代码执行和文件创建(电子表格、幻灯片、文档)直接在对话中完成
- Claude for Chrome 扩展向候补名单上的 Max 用户开放
开发者可获取与 Claude Code 内部相同的构建模块——Claude Agent SDK。
这是迄今发布的最对齐的前沿模型,在对齐方面相较前代 Claude 模型有大幅改进。
Claude Sonnet 4.5 已全面可用。开发者通过 Claude API 使用模型 ID claude-sonnet-4-5。定价:$3/$15 每百万 token(与 Claude Sonnet 4 相同)。
前沿智能¶
Claude Sonnet 4.5 在 SWE-bench Verified 上达到了最先进水平,该基准衡量真实世界的软件编码能力。 该模型已被观察到在复杂的多步骤任务上保持专注超过 30 小时。

在 OSWorld(真实世界计算机任务)上,Sonnet 4.5 以 61.4% 领先——仅四个月前 Sonnet 4 的成绩为 42.2%。Claude for Chrome 扩展让这些能力得以实际应用。

金融、法律、医学和 STEM 领域的专家发现,Sonnet 4.5 在领域特定知识和推理方面相比旧模型(包括 Opus 4.1)有显著提升。
| 领域 | 评估图 |
|---|---|
| 金融 | ![]() |
| 法律 | ![]() |
| 医学 | ![]() |
| STEM | ![]() |
核心基准数据¶
| 指标 | 得分 |
|---|---|
| SWE-bench Verified(主要) | 77.2% |
| SWE-bench Verified(1M 上下文) | 78.2% |
| SWE-bench Verified(高计算量) | 82.0% |
| OSWorld | 61.4%(此前为 42.2%) |
| 定价 | $3/$15 每百万 token |
| 最长持续专注时间 | 30+ 小时 |
| 误报率降低(相对初版) | 10 倍 |
| 误报率降低(相对 5 月的 Opus 4) | 2 倍 |
客户反馈¶
| 公司 | 发言人 | 评价 |
|---|---|---|
| Cursor | Michael Truell, CEO | "我们从 Claude Sonnet 4.5 看到了最先进的编码性能" |
| GitHub | Mario Rodriguez, 首席产品官 | "Claude Sonnet 4.5 增强了 GitHub Copilot 的核心优势" |
| Stripe | Eric Wendelin, GenAI for Developer Productivity 技术负责人 | "Claude Sonnet 4.5 在软件开发任务上表现卓越" |
| CrowdStrike | Nidhi Aggarwal, 首席产品官 | "将 Hai 安全代理的平均漏洞处理时间缩短 44%,同时准确率提升 25%" |
| Thomson Reuters | Pablo Arredondo, 副总裁, CoCounsel | "Claude Sonnet 4.5 在最复杂的诉讼任务上达到了最先进水平" |
| Replit | Michele Catasta, 总裁 | "我们在内部代码编辑基准上从 Sonnet 4 的 9% 错误率降到了 0%" |
| Canva | Danny Wu, AI 产品负责人 | "明显更智能,是一个巨大的飞跃" |
| Figma | David Kossnick, AI 产品负责人 | "Claude Sonnet 4.5 在早期测试中明显改善了 Figma Make" |
| Windsurf | Jeff Wang, CEO | "Sonnet 4.5 代表了新一代编码模型" |
| Cognition (Devin) | Scott Wu, 联合创始人兼 CEO | "自 Claude Sonnet 3.6 发布以来我们看到的最大飞跃"(规划性能提升 18%,端到端评测提升 12%) |
| CrowdStrike | Sven Krasser, 数据科学高级副总裁兼首席科学家 | "Claude Sonnet 4.5 在红队对抗方面展现了强大潜力" |
| Factory | Sean Ward, CEO 兼联合创始人 | "能处理 30+ 小时的自主编码" |
| SEB | Stian Kirkeberg, AI 与机器学习负责人 | "提供投资级洞察,需要更少的人工审核" |
迄今最对齐的模型¶
Claude Sonnet 4.5 是迄今发布的最对齐的前沿模型。 改进的能力和安全训练大幅改善了行为表现,减少了谄媚(sycophancy)、欺骗(deception)、权力寻求(power-seeking)和鼓励妄想思维的倾向。在防御针对 Agent 和计算机使用能力的提示注入攻击方面也取得了进展。

上图展示了自动化行为审计器的整体未对齐行为分数(越低越好)。评估行为包括欺骗、谄媚、权力寻求、鼓励妄想和遵从有害系统提示。
详细的安全评估(包括机制可解释性技术)收录在系统卡中。
模型在 AI 安全等级 3(ASL-3)保护下发布,遵循 Anthropic 的负责任扩展政策框架。安全保障措施包括检测与 CBRN 武器相关的危险输入/输出的分类器。
这些分类器可能会标记正常内容。用户可以使用 Sonnet 4 继续被中断的对话。误报率自初版描述以来降低了 10 倍,自 5 月发布 Claude Opus 4 以来又降低了 2 倍。
Claude Agent SDK¶
Anthropic 花了六个月时间持续更新 Claude Code,并解决了以下核心难题: 长任务中的 Agent 记忆管理、在自主性与用户控制之间平衡的权限系统,以及协调子代理朝向共同目标的机制。
Claude Agent SDK 是驱动 Claude Code 的同一套基础设施,但其优势远超编码领域。现已可用于构建你自己的 Agent。
额外研究预览:Imagine with Claude¶
一个名为 "Imagine with Claude" 的临时研究预览随 Sonnet 4.5 一同发布。
Claude 可以即时生成软件——没有预定的功能,没有预写的代码。它在交互过程中实时创建、响应和适应请求。面向 Max 订阅者开放五天,访问地址:claude.ai/imagine。
升级建议与资源¶
建议所有用户升级到 Claude Sonnet 4.5——它是直接替换升级,以相同价格提供大幅改进的性能。Claude Code 更新面向所有用户开放。Claude Developer Platform 更新(包括 Agent SDK)面向所有开发者开放。代码执行和文件创建功能在所有付费方案中可用。
技术详情:系统卡、模型页面、文档。另参阅:工程博文、上下文工程和网络安全研究。
评测方法论¶
| 基准 | 方法 |
|---|---|
| SWE-bench Verified | 简单脚手架,两个工具(bash + 字符串替换文件编辑)。得分 77.2% 为 10 次试验平均值,无测试时计算,200K 思考预算,完整 500 题数据集。使用的提示附加内容鼓励 100+ 次工具使用并先实现自己的测试。1M 上下文配置可达 78.2% 但以 200K 为主要报告结果(1M 涉及推理问题)。"高计算量"数据:并行尝试,丢弃破坏回归测试的补丁(类似 Agentless),内部评分模型选择最佳候选 → 82.0% |
| Terminal-Bench | 默认 Agent 框架(Terminus 2),XML 解析器,多天多次运行取平均 |
| tau2-bench | 扩展思考 + 工具使用,针对航空/电信代理策略已知故障模式的提示附加 |
| AIME | 温度 1.0 采样,Python 配置 64K 推理 token |
| OSWorld | 官方 OSWorld-Verified 框架,最多 100 步,4 次运行取平均 |
| MMMLU | 14 种非英语语言 5 次运行取平均,扩展思考(最多 128K) |
| Finance Agent | 由 Vals AI 运行/发布,扩展思考(最多 64K),Sonnet 4.5 开启交错思考 |
OpenAI 分数来源: GPT-5 发布文章、GPT-5 for developers、GPT-5 系统卡(SWE-bench n=500)、Terminal Bench 排行榜(Terminus 2)、Vals AI 排行榜
Gemini 分数来源: 模型网页、Terminal Bench 排行榜(Terminus 1)、Vals AI 排行榜
注释: 网络安全和生物研究行业客户可联系客户团队加入白名单。



