Anthropic News 中文翻译

create: 2025-09-29
update: 2026-08-10
author: thinkycx
title: 【译】Claude Sonnet 4.5 发布 —— 全球顶尖编码模型,最强 Agent 构建能力
description: Claude Sonnet 4.5 是全球顶尖的编码模型、构建复杂 Agent 的最强选择、计算机使用(computer use)的最佳表现者,并在推理和数学方面取得了显著进步。 代码驱动着人们使用的每一个应用、电子表格和软件工具,而能够使用这些工具并进行严密推理,正是现代工作的核心方式。
category: translation
tags: anthropic, news, translation, claude-sonnet-4-5, model-release, benchmarks, coding

Claude Sonnet 4.5 发布

Claude Sonnet 4.5

Claude Sonnet 4.5 是全球顶尖的编码模型、构建复杂 Agent 的最强选择、计算机使用(computer use)的最佳表现者,并在推理和数学方面取得了显著进步。 代码驱动着人们使用的每一个应用、电子表格和软件工具,而能够使用这些工具并进行严密推理,正是现代工作的核心方式。

Claude Sonnet 4.5 与多项重大产品升级同步发布:

开发者可获取与 Claude Code 内部相同的构建模块——Claude Agent SDK

这是迄今发布的最对齐的前沿模型,在对齐方面相较前代 Claude 模型有大幅改进。

Claude Sonnet 4.5 已全面可用。开发者通过 Claude API 使用模型 ID claude-sonnet-4-5。定价:$3/$15 每百万 token(与 Claude Sonnet 4 相同)。


前沿智能

Claude Sonnet 4.5 在 SWE-bench Verified 上达到了最先进水平,该基准衡量真实世界的软件编码能力。 该模型已被观察到在复杂的多步骤任务上保持专注超过 30 小时。

SWE-bench Verified 各前沿模型表现对比,Claude Sonnet 4.5 领先

在 OSWorld(真实世界计算机任务)上,Sonnet 4.5 以 61.4% 领先——仅四个月前 Sonnet 4 的成绩为 42.2%。Claude for Chrome 扩展让这些能力得以实际应用。

各前沿模型在主流公开评测上的基准对比表

金融、法律、医学和 STEM 领域的专家发现,Sonnet 4.5 在领域特定知识和推理方面相比旧模型(包括 Opus 4.1)有显著提升。

领域 评估图
金融 金融领域评估
法律 法律领域评估
医学 医学领域评估
STEM STEM领域评估

核心基准数据

指标 得分
SWE-bench Verified(主要) 77.2%
SWE-bench Verified(1M 上下文) 78.2%
SWE-bench Verified(高计算量) 82.0%
OSWorld 61.4%(此前为 42.2%)
定价 $3/$15 每百万 token
最长持续专注时间 30+ 小时
误报率降低(相对初版) 10 倍
误报率降低(相对 5 月的 Opus 4) 2 倍

客户反馈

公司 发言人 评价
Cursor Michael Truell, CEO "我们从 Claude Sonnet 4.5 看到了最先进的编码性能"
GitHub Mario Rodriguez, 首席产品官 "Claude Sonnet 4.5 增强了 GitHub Copilot 的核心优势"
Stripe Eric Wendelin, GenAI for Developer Productivity 技术负责人 "Claude Sonnet 4.5 在软件开发任务上表现卓越"
CrowdStrike Nidhi Aggarwal, 首席产品官 "将 Hai 安全代理的平均漏洞处理时间缩短 44%,同时准确率提升 25%"
Thomson Reuters Pablo Arredondo, 副总裁, CoCounsel "Claude Sonnet 4.5 在最复杂的诉讼任务上达到了最先进水平"
Replit Michele Catasta, 总裁 "我们在内部代码编辑基准上从 Sonnet 4 的 9% 错误率降到了 0%"
Canva Danny Wu, AI 产品负责人 "明显更智能,是一个巨大的飞跃"
Figma David Kossnick, AI 产品负责人 "Claude Sonnet 4.5 在早期测试中明显改善了 Figma Make"
Windsurf Jeff Wang, CEO "Sonnet 4.5 代表了新一代编码模型"
Cognition (Devin) Scott Wu, 联合创始人兼 CEO "自 Claude Sonnet 3.6 发布以来我们看到的最大飞跃"(规划性能提升 18%,端到端评测提升 12%)
CrowdStrike Sven Krasser, 数据科学高级副总裁兼首席科学家 "Claude Sonnet 4.5 在红队对抗方面展现了强大潜力"
Factory Sean Ward, CEO 兼联合创始人 "能处理 30+ 小时的自主编码"
SEB Stian Kirkeberg, AI 与机器学习负责人 "提供投资级洞察,需要更少的人工审核"

迄今最对齐的模型

Claude Sonnet 4.5 是迄今发布的最对齐的前沿模型。 改进的能力和安全训练大幅改善了行为表现,减少了谄媚(sycophancy)、欺骗(deception)、权力寻求(power-seeking)和鼓励妄想思维的倾向。在防御针对 Agent 和计算机使用能力的提示注入攻击方面也取得了进展。

对齐行为评分图表(越低越好)

上图展示了自动化行为审计器的整体未对齐行为分数(越低越好)。评估行为包括欺骗、谄媚、权力寻求、鼓励妄想和遵从有害系统提示。

详细的安全评估(包括机制可解释性技术)收录在系统卡中。

模型在 AI 安全等级 3(ASL-3)保护下发布,遵循 Anthropic 的负责任扩展政策框架。安全保障措施包括检测与 CBRN 武器相关的危险输入/输出的分类器。

这些分类器可能会标记正常内容。用户可以使用 Sonnet 4 继续被中断的对话。误报率自初版描述以来降低了 10 倍,自 5 月发布 Claude Opus 4 以来又降低了 2 倍。


Claude Agent SDK

Anthropic 花了六个月时间持续更新 Claude Code,并解决了以下核心难题: 长任务中的 Agent 记忆管理、在自主性与用户控制之间平衡的权限系统,以及协调子代理朝向共同目标的机制。

Claude Agent SDK 是驱动 Claude Code 的同一套基础设施,但其优势远超编码领域。现已可用于构建你自己的 Agent。

相关视频:构建设计 AI Agent。


额外研究预览:Imagine with Claude

一个名为 "Imagine with Claude" 的临时研究预览随 Sonnet 4.5 一同发布。

Claude 可以即时生成软件——没有预定的功能,没有预写的代码。它在交互过程中实时创建、响应和适应请求。面向 Max 订阅者开放五天,访问地址:claude.ai/imagine


升级建议与资源

建议所有用户升级到 Claude Sonnet 4.5——它是直接替换升级,以相同价格提供大幅改进的性能。Claude Code 更新面向所有用户开放。Claude Developer Platform 更新(包括 Agent SDK)面向所有开发者开放。代码执行和文件创建功能在所有付费方案中可用。

技术详情:系统卡模型页面文档。另参阅:工程博文上下文工程网络安全研究


评测方法论

基准 方法
SWE-bench Verified 简单脚手架,两个工具(bash + 字符串替换文件编辑)。得分 77.2% 为 10 次试验平均值,无测试时计算,200K 思考预算,完整 500 题数据集。使用的提示附加内容鼓励 100+ 次工具使用并先实现自己的测试。1M 上下文配置可达 78.2% 但以 200K 为主要报告结果(1M 涉及推理问题)。"高计算量"数据:并行尝试,丢弃破坏回归测试的补丁(类似 Agentless),内部评分模型选择最佳候选 → 82.0%
Terminal-Bench 默认 Agent 框架(Terminus 2),XML 解析器,多天多次运行取平均
tau2-bench 扩展思考 + 工具使用,针对航空/电信代理策略已知故障模式的提示附加
AIME 温度 1.0 采样,Python 配置 64K 推理 token
OSWorld 官方 OSWorld-Verified 框架,最多 100 步,4 次运行取平均
MMMLU 14 种非英语语言 5 次运行取平均,扩展思考(最多 128K)
Finance Agent Vals AI 运行/发布,扩展思考(最多 64K),Sonnet 4.5 开启交错思考

OpenAI 分数来源: GPT-5 发布文章GPT-5 for developersGPT-5 系统卡(SWE-bench n=500)、Terminal Bench 排行榜(Terminus 2)、Vals AI 排行榜

Gemini 分数来源: 模型网页Terminal Bench 排行榜(Terminus 1)、Vals AI 排行榜


注释: 网络安全和生物研究行业客户可联系客户团队加入白名单。