Anthropic News 中文翻译

create: 2025-11-24
update: 2026-08-10
author: thinkycx
title: 【译】Claude Opus 4.5 发布——编程、智能体和计算机使用领域的全球最强模型
description: Anthropic 发布 Claude Opus 4.5,号称在编程、智能体和计算机使用领域全球领先,同时在日常任务(深度研究、幻灯片和电子表格处理)上也有显著提升。SWE-bench Verified 上达到真实世界软件工程最先进水平。
category: translation
tags: anthropic, news, translation, opus, model-release, benchmarks

Claude Opus 4.5 发布——编程、智能体和计算机使用领域的全球最强模型

Claude Opus 4.5

Anthropic 发布 Claude Opus 4.5,号称在编程、智能体和计算机使用领域全球领先,同时在日常任务(深度研究、幻灯片和电子表格处理)上也有显著提升。SWE-bench Verified 上达到真实世界软件工程最先进水平。

核心信息

项目 详情
API Model ID claude-opus-4-5-20251101
定价 $5 / $25 每百万 token(输入/输出)
可用渠道 应用、API、三大云平台
相关链接 API 文档开发者平台Claude Code客户端下载

伴随 Opus 发布,Anthropic 同步更新了 Claude 开发者平台、Claude Code 和消费端应用。新工具支持更长时间运行的智能体,以及与 Excel、Chrome 和桌面应用的新集成。长对话不再碰壁。

SWE-bench Verified

初步印象

内部测试人员反馈:Opus 4.5 能处理模糊性、推理权衡取舍,并在无需手把手引导的情况下定位复杂的多系统 Bug。此前 Sonnet 4.5 几乎不可能完成的任务,现在变得可行。

客户评价精选

Jeff Wang,CEO(某公司):

"Opus 模型一直是'真正的 SOTA',但过去成本过高。这次它在前沿任务规划和工具调用方面是明确的赢家。"

Mario Rodriguez,GitHub Copilot 首席产品官:

"超越了内部编码基准,同时将 token 用量减半。特别适合代码迁移和重构。"

Michele Catasta,总裁(某公司):

"用更少的 token 解决相同的问题。效率在规模化时会复合。"

Fabian Hedin,Lovable CTO 兼联合创始人:

"Claude Opus 4.5 在 Lovable 的聊天模式中提供前沿推理能力。"

Zach Lloyd,Warp 创始人兼 CEO:

"Claude Opus 4.5 擅长长时间、自主任务。Terminal Bench 上比 Sonnet 4.5 提升 15%。"

Scott Wu,Cognition/Devin CEO:

"Claude Opus 4.5 在最关键的地方带来了可衡量的提升。在 30 分钟自主编码会话中表现一致。"

Yusuke Kaji,某公司 AI for Business 总经理:

"Claude Opus 4.5 是自我改进 AI 智能体的突破。智能体仅用 4 次迭代即达到峰值性能,其他模型需要 10 次以上。"

Michael Truell,Cursor CEO 兼联合创始人:

"Claude Opus 4.5 是 Cursor 内部相比此前 Claude 模型的显著提升。"

Paulo Arruda,某公司 AI 生产力高级工程师:

"相比 Sonnet 4.5 是明确的进步。完成了跨两个代码库、三个协调智能体的重构任务。"

Sean Ward,CEO 兼联合创始人(某公司):

"Claude Opus 4.5 处理长时间编码任务的效率超越了我们测试过的所有模型。token 使用量减少最高 65%,通过率更高。"

Sarah Sachs,Notion AI 首席工程师:

"我们发现 Opus 4.5 擅长理解用户真正想要什么。这是 Notion Agent 首次使用 Opus 级别模型。"

Andrew Zakonov,JetBrains Junie & Kineto 业务副总裁:

"Claude Opus 4.5 在所有基准上都优于 Sonnet 4.5。步骤更少,token 更少。"

Nicholas Charriere,创始人兼 CEO(某公司):

"工具调用错误和构建/lint 错误减少了 50% 到 75%。"

Quinn Slack,Sourcegraph CEO:

"Claude Opus 4.5 非常流畅,没有其他前沿模型常见的粗糙边缘。"

基准评测

性能工程考试

Anthropic 用一道高难度性能工程面试题考试测试模型。在 2 小时时间限制内,Claude Opus 4.5 的得分超过了有史以来所有人类候选人(注1:使用了并行测试时计算)。不设时间限制时,模型(在 Claude Code 内)达到了人类最高分。

这引发了关于 AI 对工程职业影响的思考。Anthropic 的社会影响经济未来研究团队正在研究这些变化。

综合基准表

基准评测表

在多项主流基准上展示了视觉、推理和数学方面的提升。

SWE-bench 多语言

SWE-bench 多语言

Opus 4.5 在 8 种编程语言中的 7 种上领先。

Aider Polyglot

Aider Polyglot

比 Sonnet 4.5 跃升 10.6%。

BrowseComp-Plus

BrowseComp-Plus

在智能体搜索方面显著提升。

Vending-Bench

Vending-Bench

比 Sonnet 4.5 多赚 29%。

tau2-bench 创造性解题案例

参考:tau2-bench GitHub

在一个航空公司服务场景中,基准测试期望模型拒绝修改基础经济舱预订。但 Opus 4.5 找到了一个创造性的合规解决方案:先升级客舱(基础经济舱允许),再修改航班(非基础经济舱允许)。基准测试将此评为失败(因为是预期之外的答案),但 Anthropic 认为这正是创造性问题解决能力的体现。

模型的推理过程:

Let me think about what options I have within my policy:
1. Modify flights - Basic economy cannot be modified. This is clear in the policy.
2. Change cabin - Wait, let me check this option! The policy says:
"In other cases, all reservations, including basic economy, can change cabin without changing the flights."
...
So the strategy could be:
1. Upgrade his cabin from basic economy to economy (or business)
2. Then modify the flights to be 2 days later
This would cost more money, but it's a legitimate path within the policy!

安全性进展

根据系统卡,Opus 4.5 被描述为"迄今为止对齐最稳健的模型"。

令人担忧行为评估

令人担忧的行为

衡量错误对齐行为,包括配合人类滥用和不良自主行为。评估在 Petri 的升级版本上运行。

提示注入鲁棒性

提示注入鲁棒性

Opus 4.5 比所有其他前沿模型都更难被提示注入欺骗。基准由 Gray Swan 开发和运行。

Claude 开发者平台新功能

Opus 4.5 在实现相同或更好结果时,token 使用量大幅降低。

努力程度参数(Effort Parameter)

新的 API 功能,让开发者控制速度/成本与能力之间的权衡:

努力程度 效果
中等 匹配 Sonnet 4.5 最佳 SWE-bench Verified 分数,输出 token 减少 76%
最高 超越 Sonnet 4.5 达 4.3 个百分点,token 减少 48%

努力程度控制

深度研究性能

上下文管理和记忆的组合将 Opus 4.5 在深度研究评估上的表现提升了近 15 个百分点(fetch-enabled BrowseComp-Plus,从 70.48% 到 85.30%)。

平台相关链接

产品更新

Claude Code

  • Plan Mode 现在能构建更精确的计划,提前提出澄清问题,在执行前创建可编辑的 plan.md
  • 可在桌面应用中同时运行多个本地/远程并行会话

Claude 应用

  • 长对话不再碰壁 — 自动上下文摘要
  • Claude for Chrome — 现面向所有 Max 用户开放
  • Claude for Excel — Beta 版扩展至所有 Max、Team 和 Enterprise 用户

使用限制调整

  • 移除了 Opus 专属上限,Claude 和 Claude Code 用户可获得 Opus 4.5 访问权限
  • Max 和 Team Premium 用户获得增加的整体使用限制——Opus token 配额大致与之前 Sonnet 可用量相同

方法论

所有评估运行条件:64K 思考预算、交错草稿本、200K 上下文窗口、默认努力程度(高)、默认采样设置(temperature, top_p)、5 次独立试验取平均。例外:SWE-bench Verified(无思考预算)、Terminal Bench(128K 思考预算)。完整详情见系统卡

注释

  1. 性能工程考试结果使用了并行测试时计算(汇聚多次尝试)。不设时间限制时,模型在 Claude Code 内达到人类最高分。
  2. 改进的托管环境减少了基础设施故障。Gemini 3 提升至 56.7%,GPT-5.1 提升至 48.6%(来自开发者报告的数值,使用 Terminus-2 框架)。
  3. 评估在 Petri 升级的早期 Opus 4.5 快照上运行。最终生产模型展示了非常相似的模式。详情见系统卡。
  4. Fetch-enabled BrowseComp-Plus:从 70.48% 提升至 85.30%。