Anthropic News 中文翻译

create: 2026-04-16
update: 2026-08-10
author: thinkycx
title: 【译】Claude Opus 4.7 发布
description: Anthropic 发布 Claude Opus 4.7,相对 Opus 4.6 在高难度软件工程任务上有显著提升,支持更高分辨率图片(长边 2,576 像素,约 3.75 兆像素),指令遵循能力从"宽松解读"变为"字面执行"。同步推出 xhigh effort 级别、/ultrareview 命令及 Auto mode。定价不变 $5/$25 每百万 token。
category: translation
tags: anthropic, news, translation, opus-4-7

Claude Opus 4.7 发布

原文发布于 2026 年 4 月 16 日 | 原文链接


概述

Opus 4.7 是 Anthropic 最新的正式发布模型,在高难度自主软件工程任务上显著优于 Opus 4.6,精确遵循指令并在报告前自我验证输出。

Claude Opus 4.7 现已全面可用。它代表了相对 Opus 4.6 在高级软件工程方面的显著进步,尤其是在困难任务上。该模型在处理复杂、长时间运行的任务时更加严谨,精确遵循指令,并在汇报结果前验证自身输出。

核心改进:

  • 高难度软件工程任务大幅提升
  • 视觉能力大幅增强(分辨率提升 3 倍以上,长边达 2,576 像素)
  • 更有创意和品位的专业输出(界面、幻灯片、文档)
  • 指令遵循能力"实质性"改善

需要注意的是,Anthropic 表示其"功能广度不如我们最强大的模型 Claude Mythos Preview"。


基准测试

Opus 4.7 基准对比


网络安全

Opus 4.7 是首个搭载实时网络安全防护的模型——自动检测并阻止被禁止或高风险的网络安全用途。

上周 Anthropic 发布了 Project Glasswing,强调 AI 模型在网络安全方面的风险和收益。Opus 4.7 的网络安全能力不如 Mythos Preview 先进,训练过程中 Anthropic 实验了差异化降低这些能力的方法。模型发布时配备了自动检测和阻止被禁止或高风险网络安全用途的安全防护措施。

希望将 Opus 4.7 用于合法用途(漏洞研究、渗透测试、红队演练)的安全专业人员可以加入 Cyber Verification Program


定价与可用性

项目 详情
输入价格 $5 / 百万 token(与 Opus 4.6 相同)
输出价格 $25 / 百万 token(与 Opus 4.6 相同)
API 标识符 claude-opus-4-7
平台 Claude 全产品线、Amazon Bedrock、Google Cloud Vertex AI、Microsoft Foundry
API 文档 模型概览

早期用户反馈

来自多家公司的测试反馈表明,Opus 4.7 在长任务自主性、工具调用准确率和代码质量方面均实现双位数提升。

评价者 角色 核心评价
Clarence Huang VP of Technology "它在规划阶段就能捕捉自身的逻辑错误并加速执行,远超此前的 Claude 模型。"
Igor Ostrovsky 联合创始人 & CTO "它的突出之处不仅在于原始能力,更在于处理真实异步工作流——自动化、CI/CD 和长时间运行任务的能力。"
Caitlin Colgrove 联合创始人 & CTO "它能正确报告数据缺失,而不是提供貌似合理但不正确的替代答案。"
Mario Rodriguez GitHub CPO "Claude Opus 4.7 在 Opus 4.6 基础上提升了 13% 的分辨率,包括四项 Opus 4.6 和 Sonnet 4.6 都无法解决的任务。"
Michal Mucha Lead AI Engineer, Applied AI "它在我们六个模块中并列最高总分 0.715,并且长上下文性能最为稳定。"
Jeff Wang CEO "Anthropic 显然针对长时间运行的持续推理进行了优化,结果是市场领先的表现。"
Sanj Ahilan Chief Research Officer "在 Opus 4.7 的多模态理解方面有重大改进,从读取化学结构到解读复杂技术图表。"
Scott Wu CEO "它能连贯工作数小时,遇到难题时坚持攻克而不是放弃。"
Michele Catasta President "我们观察到它以更低成本实现相同质量——在分析日志和追踪等任务上更加高效精确。"
Niko Grupen Head of Applied Research "在审阅表格上以更好的推理校准达到 90.9% 的高 effort 得分。"
Michael Truell Cursor 联合创始人 & CEO "在 CursorBench 上,Opus 4.7 是一次有意义的能力飞跃,从 Opus 4.6 的 58% 升至 70%。"
Sarah Sachs AI Lead "相比 Opus 4.6 提升 14%,同时使用更少 token,工具错误减少三分之二。"
Adithya Ramanathan Head of Applied Research "我们在核心编排 Agent 中看到工具调用和规划准确度的双位数跃升。"
Yusuke Kaji AI for Business GM "Claude Opus 4.7 解决的生产任务量是 Opus 4.6 的 3 倍,代码质量和测试质量双位数提升。"
David Loker VP of AI "召回率提升超过 10%,发现了我们最复杂 PR 中最难检测的 bug。"
Kay Zhu 联合创始人 & CTO "Opus 4.7 实现了我们测量过的最高质量/工具调用比。"
Zach Lloyd Founder & CEO "它通过了此前 Claude 模型都失败的 Terminal Bench 任务,并解决了 Opus 4.6 无法攻克的棘手并发 bug。"
Aj Orbach 联合创始人 & CEO "Claude Opus 4.7 是世界上构建仪表盘和数据密集型界面最好的模型。"
Ben Chan Chief AI Officer "最大的收益出现在最重要的地方:推理深度、结构化问题框架构建和复杂技术工作。"
Ben Lafferty Senior Staff Engineer "它正在去除那些无意义的包装函数和容错脚手架代码,并在编写过程中自行修复自己的代码。"
Oege de Moor CEO "我们的视觉准确度基准上 98.5%,相比 Opus 4.6 的 54.5%。"
Joe Haddad Distinguished Software Engineer "它甚至在开始工作之前就对系统代码做证明,这是我们在早期 Claude 模型中从未见过的新行为。"
Leo Tchourakov Member of Technical Staff "Factory Droids 的任务成功率提升 10% 到 15%,工具错误更少,验证步骤的执行更加可靠。"
Sean Ward CEO & Co-Founder "Claude Opus 4.7 从零开始自主构建了一个完整的 Rust 文本转语音引擎——包括神经模型、SIMD 内核和浏览器演示。"
Itamar Friedman 联合创始人 & CEO "它正在修复我们之前最好的模型都遗漏的问题,包括一个竞态条件。"
Hanlin Tang CTO of Neural Networks "处理源信息时比 Opus 4.6 减少 21% 的错误。"
Austin Ray Software Engineer "相比 Opus 4.6,它需要的逐步指导大幅减少,帮助我们扩展内部 Agent 工作流。"
Eric Simons CEO & Founder "最佳场景下提升多达 10%,且没有我们已经习以为常的、来自高度 Agent 化模型的退步。"

关键能力提升

指令遵循

Opus 4.7 对指令的解读从"宽松"变为"字面"——此前模型松散解读或跳过的指令,Opus 4.7 会逐字执行。

Opus 4.7 在遵循指令方面有实质性改善。为早期模型编写的 prompt 可能产生意外结果,因为 Opus 4.7 会字面解读指令,而之前的模型是宽松解读。建议用户相应调整 prompt。

多模态视觉

支持长边 2,576 像素(约 3.75 兆像素)的图片,超过此前 Claude 模型 3 倍以上。

指标 数值
最大分辨率 长边 2,576 像素(约 3.75 兆像素)
分辨率提升 超过前代模型 3 倍

适用场景:computer-use Agent 阅读密集截图、复杂图表数据提取、像素级参考工作。

真实世界工作

  • Finance Agent 评测达到最先进水平
  • GDPval-AA(来自 Artificial Analysis)达到最先进水平
  • 内部测试表明它是比 Opus 4.6 更有效的金融分析师,分析更严谨、演示更专业、任务间衔接更紧密

记忆

更善于利用基于文件系统的记忆——跨长期多会话工作中记住重要笔记,后续任务需要更少的前置上下文。


评测图表

办公任务

办公任务评测

视觉

视觉评测

文档推理

文档推理评测

长上下文推理

长上下文推理评测

生物学

生物学评测

长期连贯性

长期连贯性评测

编码

编码评测


安全与对齐

安全画像与 Opus 4.6 类似:低欺骗、低迎合、低配合滥用率;诚实性和 prompt injection 抵御有改善。

安全评测

Opus 4.7 的安全画像与 Opus 4.6 类似,在欺骗、迎合和配合滥用方面保持低水平。相对 Opus 4.6 的改善:

  • 诚实性更强
  • 对 prompt injection 攻击的抵御能力提升
  • 在受控物质方面给出过于详细的减害建议的倾向略有增加(相对弱项)

Anthropic 的对齐评估结论:"基本良好对齐且可信赖,但行为尚未完全理想。" Mythos Preview 仍然是训练出的对齐最好的模型。

完整信息参见 Claude Opus 4.7 System Card


同步发布的新功能

Effort 控制

新增 xhigh 级别(介于 highmax 之间),Claude Code 默认 effort 已提升至 xhigh

级别 用途
high 常规使用
xhigh(新) Claude Code 默认,编码/Agent 场景推荐起点
max 最高质量

详见 Effort 级别文档

Claude Platform (API)

  • 更高分辨率图片支持
  • Task budgets(公开 beta):允许开发者引导 Claude 在较长运行中的 token 开支分配,优先处理不同工作

Claude Code

  • /ultrareview 命令 生成专用审查会话,标记 bug 和设计问题。Pro 和 Max 用户获得 3 次免费 ultrareview。
  • Auto mode 扩展到 Max 用户——一种权限选项,Claude 代为决策以完成更长任务,减少中断。

从 Opus 4.6 迁移

两个变化影响 token 用量:更新的 tokenizer(1.0~1.35 倍)和更高 effort 下更多思考。

影响 token 用量的两个变化:

变化 影响
更新的 tokenizer 相同输入映射为约 1.0~1.35 倍 token(取决于内容类型)
更高 effort 下更多思考 Agent 场景后续轮次中思考量增加;提升可靠性但产生更多输出 token

Token 使用量对比

控制 token 用量的方法:effort 参数、task budgets、或在 prompt 中要求简洁。净效果有利——Anthropic 内部编码评测中所有 effort 级别的 token 效率均有改善。

详见 迁移指南


脚注

  1. 更高分辨率图片处理是模型级变化,非 API 参数。图片自动以更高保真度处理。不需要额外细节的用户可以在发送前降采样。详见 Vision 文档

其他说明:
- GPT-5.4 和 Gemini 3.1 Pro 的对比使用了通过 API 可获得的最佳已报告模型版本
- MCP-Atlas:Opus 4.6 分数已更新以反映 Scale AI 修订后的评分方法
- SWE-bench Verified、Pro 和 Multilingual:记忆筛查标记了一部分问题;排除这些后,Opus 4.7 相对 Opus 4.6 的优势仍然成立
- Terminal-Bench 2.0:使用 Terminus-2 harness,关闭思考;1 倍保证/3 倍上限资源分配,每个任务平均五次尝试
- CyberGym:Opus 4.6 分数从 66.6 更新为 73.8,因为 harness 参数已更新
- SWE-bench Multimodal:使用内部实现;分数与公开排行榜不直接可比

更新说明(2026 年 5 月 4 日):更新了文档推理图表以反映 Opus 4.7 的更新版 OfficeQA Pro 分数。


相关阅读