Claude Opus 5 发布:半价接近 Fable 5 前沿智能的全能模型¶
发布日期:2026 年 7 月 24 日 | 分类:产品发布
Claude Opus 5 是一个"深思熟虑且主动积极"的模型,以 Fable 5 一半的价格接近其前沿智能水平,现已正式可用。
基准性能¶

Opus 5 在编程和知识工作评估中取得了多项最先进(SOTA)成绩,但在网络安全任务上仍落后于 Mythos 5。
在 Frontier-Bench 和 GDPval-AA 等编码与知识工作评估中,Opus 5 取得了新的 SOTA 结果。该模型专为日常使用设计,运行效率优于其他模型。它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。
性能与性价比¶

Opus 5 在与前代 Opus 4.8 相同的价格下,大幅提升了性能表现,并可通过调节 effort 参数在智能和 token 消耗之间灵活取舍。
软件工程¶
| 基准 | 表现 |
|---|---|
| Frontier-Bench v0.1 | 超越所有其他模型,以更低的单任务成本实现 Opus 4.8 两倍以上的性能 |
| CursorBench 3.2 | 最大 effort 下性能在 Fable 5 峰值的 0.5% 以内,成本仅为一半;在 high、xhigh、max effort 级别,给定成本下性能均优于所有其他模型 |
知识工作与问题解决¶
| 基准 | 表现 |
|---|---|
| ARC-AGI 3 | 新颖问题解决得分是次优模型的三倍 |
| Zapier AutomationBench | 相同单任务成本下通过率约为次优模型的 1.5 倍;即使在最低 effort 下,通过的任务也比其他所有模型多 |
| OSWorld 2.0 | 在任意给定成本下超越所有其他模型,仅用约三分之一的成本即超过 Fable 5 的最佳结果 |
其他领先的评估还包括:GDPval-AA v2、HLE、DeepSearchQA。
科学研究¶
Opus 5 在科学研究方面相比 Opus 4.8 有显著提升,在涵盖结构生物学、有机化学和生物信息学的每一项生命科学评估中均表现更优。
最显著的提升:
| 任务领域 | 提升幅度 |
|---|---|
| 有机化学任务(如从光谱数据推断分子结构) | 比 Opus 4.8 高 10.2 个百分点 |
| 蛋白质相关任务(预测序列变异如何影响功能) | 比 Opus 4.8 高 7.7 个百分点 |
视觉输出¶
Opus 5 的视觉输出能力大幅增强。 交互式演示包括风洞可视化和细胞插图等。
使用 Claude Opus 5¶
Opus 5 在验证自身工作和反复迭代直到成功方面明显更强。
以下是三个具体示例:
-
FreeCAD 任务(Frontier-Bench): 给定一张机械零件图纸且无法直接查看时,Opus 5 自行编写了计算机视觉流水线从原始像素中提取几何信息,然后重建完整零件。竞品模型尝试五次均未能解决。
-
开源 Bug 修复: Opus 5 找到了根本原因,并修复了社区补丁遗漏的边界情况;而竞品模型"只修复了表面症状(而非底层原因),然后就报告 Bug 已修复。"
-
交易公司行情数据接入: 一位工程师使用 Opus 5 在单次会话中为一个新交易所构建了行情数据接入系统。此前的模型即使有详细的计划也无法完成这项工作。Opus 5 自行构建了测试工具来验证解析逻辑。
早期客户评价¶
多家头部公司反馈 Opus 5 在性能、稳定性和性价比上全面超越 Opus 4.8,接近 Fable 5 水平。
| 公司 | 评价人 | 核心评价 |
|---|---|---|
| Cognition (Devin) | Scott Wu, CEO | "在 FrontierCode 1.1 上,Opus 5 以一半的成本接近 Fable 级别的性能。" |
| Cursor | Sualeh Asif, 联合创始人 | "Opus 5 以 Opus 的速度和成本提供接近 Fable 5 的智能。" |
| Zapier | Wade Foster, CEO | "Opus 5 在 AutomationBench 排行榜登顶,且消耗的 token 不比之前的 Claude 模型多。" |
| Benchling | Alfredo Andere, CEO | 在基因组学分析方面,Opus 5"表现得更像一位严谨的科学家,超过我们测试过的任何模型。" |
| Lovable | Fabian Hedin, 联合创始人 | "它不仅在最难的 agentic 编码任务上比 Opus 4.7 提高了 22%,还更加稳定,运行间差异大幅减少。" |
| Replit | Madhav Jha, 联合创始人兼 CTO | "Opus 5 是自 4.5 以来 Opus 家族最大的一次飞跃。" |
| Hex | Izzy Miller, AI 研究负责人 | "对于我们 Agent 处理的那种开放式分析工作,它是对 Opus 4.8 的严格升级。" |
| Bloomberg | Shirley Zhang, 高级 AI 工程师 | "在数值推理、表格处理和需要精度的批判性思维方面表现突出。" |
| Box | Ben Kus, CTO | "Opus 5 比 Opus 4.8 性能提高 8%",数据分析提升 11%,尽调工作流提升 17%。 |
| Replit | Cristian Rivera, Staff 软件工程师 | "一个周末我就给它分配了管理我所有开发环境的'幕僚长'角色。" |
| Fundamental Research | Conor Kiernan, CTO | "它能处理我们通常需要拆分成更小片段的工作。" |
| 某金融建模公司 | Richard Pham, 评估与产品负责人 | "准确率平均高出 9 个百分点,轮次和工具调用减少三分之一,时间减少 60%。" |
| Bolt | AJ Orbach, 联合创始人兼 CEO | "Opus 5 检查自己的工作,就像一个真正的前端开发者会做的那样。" |
| Harvey | Niko Grupen, 应用研究负责人 | 与 Opus 4.8 max reasoning 相比,Opus 5 "性能相当,但平均生成的 token 减少 26%。" |
| Gamma | Alex Wang, 应用 AI | "Artifact 质量决定了我们发布哪个模型,这是我们见过的最明显的提升。" |
| Graphite | Zimu Li, 技术人员 | "它会验证分支、检查模板、思考测试影响,确保交接干净利落。" |
| Windsurf | Marquis Wang, 首席 AI 工程师 | "它反驳了我提出的一个设计方案,而且在我坚持时没有妥协。" |
| Spellbook | Ryan Tanenholz, 技术人员 | "在首轮红线标注上,Opus 5 得分是所有测试模型中最高的,几乎是 Opus 4.8 的两倍。" |
| Sourcegraph | Neeraj Deshmukh, 工程总监 | "Opus 5 写出干净紧凑的 diff,没有死代码。" |
| Factory | Igor Ostrovsky, 联合创始人兼 CTO | "我有信心说我们更希望人们使用 Opus 5 而不是 Opus 4.8。" |
| Datadog | Tanapat Ratanaruengjumrune, 应用 AI 经理 | 标记潜在异常后,Agent"对照生产环境重新检查了自己的假设,发现信号是良性的。" |
| AWS (Kiro) | Deepak Singh, Agentic AI VP | "Opus 5 是为长时间运行的多步骤工作打造的强大 agentic 编码模型。" |
| JetBrains | Denis Shiryaev, IDE AI 负责人 | "它在写第一行代码之前会更深入地思考,在规划阶段就能发现自己的逻辑错误。" |
| Jane Street | Matt Nassr, 全球数据工程与 AI 转型负责人 | Opus 5 是"我们在交易基准上测试过的最强 Opus 模型",使用的推理 token "大约只有七分之一。" |
对齐与安全¶
对齐¶

Anthropic 的自动化行为审计显示 Opus 5 是迄今对齐最好的模型。
Opus 5 比 Opus 4.8、Sonnet 5 和 Fable 5 更好地遵守 Claude 宪法(Constitution),展现出最低的欺骗行为率,最不容易被诱导进行滥用,也是在避免具有难以逆转副作用的鲁莽行为方面最安全的模型。
Opus 5 在总体不对齐行为上得分为 2.3,是近期模型中的最低分。
安全¶
更多详情请参阅 System Card。
Opus 5 并未推进高风险双用途能力的前沿。
在与私营部门和政府合作伙伴的评估中,Opus 5 在生物研究和进攻性网络安全方面仍落后于 Mythos 5。
Anthropic 有意避免在网络安全任务上训练 Opus 5。该模型通过通用能力提升而在这些任务上有所改善,在发现漏洞方面接近 Mythos 5,但"在利用这些漏洞方面仍远远落后于 Mythos 5。"
在 OSS-Fuzz 上,虽然 Mythos 5 和 Opus 5 以相似的成功率识别漏洞,但 Opus 5 的漏洞利用开发得分远落后于 Mythos 5。
Opus 5 的安全护栏¶
护栏与 Opus 4.8 类似,但在一小部分网络安全任务上有更强的限制。
网络安全¶
Opus 5 的网络安全分类器的限制程度按比例低于 Fable 5。它们允许在源代码中发现漏洞,但会阻止:
- 基于二进制的漏洞扫描
- 渗透测试
- 漏洞利用生成
预计分类器的干预频率比 Fable 5 低约 85%。在 Claude.ai、Claude Code 和 Claude Cowork 中被标记的请求默认回退到 Opus 4.8。API 也可以配置回退到 Opus 4.8。
网络安全验证计划(CVP) 为企业和研究人员提供即时访问限制更少版本的权限。
生物学¶
由于 Opus 5 具有与 Opus 4.8 相似的安全护栏,它现在是普遍可用的最强大的科学研究模型。该模型在长时间运行的自主研究任务上仍存在明显限制。之前在 Fable 5 上被阻止的生物相关请求现在会路由到 Opus 5 而非 Opus 4.8。
快速上手¶
| 项目 | 详情 |
|---|---|
| 定价 | 输入 $5/百万 token,输出 $25/百万 token(与 Opus 4.8 相同) |
| 模型 ID | claude-opus-5 |
| 快速模式 | 约 2.5 倍默认速度,在 Claude Platform 上以两倍基础价格提供,在 Claude Code 中通过 usage credits 使用 |
随 Opus 5 一同发布的 Beta 功能¶
-
Claude Platform 对话中途工具变更: 开发者可以在对话过程中更改可用工具,而不会使 prompt cache 失效。
-
API 自动回退: 被 Opus 5(或 Fable 5)安全分类器标记的请求可以自动路由到其他模型,确保 API 请求始终使用最佳可用模型。
更多信息请参阅 提示指南。
Opus 5 不需要数据保留要求即可获得通用访问权限,与之前的 Opus 模型一致。
脚注¶
Frontier-Bench v0.1 Effort 图表: 结果来自内部 mini-SWE-agent harness 和 GKE 后端的运行,每个任务 5 次尝试的平均 reward。Opus 4.8 在 Opus 5 和 Fable 5 的安全分类器拒绝时作为回退。