Claude Opus 4.6 发布:编码、推理和长上下文全面升级¶
Anthropic 发布 Claude Opus 4.6——迄今最强大的模型升级版,编码能力大幅提升、规划能力更强、支持更长时间的自主任务执行,在大型代码库中更加可靠,调试能力也显著增强。这是首个支持 100 万 token 上下文窗口(Beta)的 Opus 级模型。
核心能力¶
该模型将增强的能力应用于日常工作任务,包括金融分析、研究、创建文档、电子表格和演示文稿。在 Cowork 中,Opus 4.6 可以自主进行多任务处理。
基准测试表现¶

| 基准测试 | 表现 | 说明 |
|---|---|---|
| Terminal-Bench 2.0 | 最高分 | Agentic 编码评测 |
| Humanity's Last Exam | 领先所有前沿模型 | 复杂多学科推理 |
| GDPval-AA | 超过 GPT-5.2 约 144 Elo | 具有经济价值的知识工作 |
| BrowseComp | 最佳表现 | 在线查找难以发现的信息 |
| MRCR v2(8-needle 1M 变体) | 76%(vs. Sonnet 4.5 的 18.5%) | 长上下文检索 |
| BigLaw Bench | 90.2%(Harvey 测试) | 法律领域 |
| SWE-bench Verified | 81.42%(经 prompt 调整,25 次平均) | 软件工程 |
| BrowseComp(多智能体) | 86.8% | 多智能体搜索 |
144 Elo 的优势意味着"Claude Opus 4.6 在该评测中约 70% 的时间得分高于 GPT-5.2"。



长上下文能力¶


编码与工程¶



安全特性¶

系统卡详细记录了广泛的安全评估。Opus 4.6 展现出"与行业内任何其他前沿模型一样好甚至更好的整体安全表现"。它在所有近期 Claude 模型中拥有最低的过度拒绝率,在欺骗、奉承、鼓励用户幻想和配合滥用方面的比率也很低。
新增安全措施包括六个新的网络安全探针,以及在网络安全博客文章中详述的防御性网络安全应用。

生命科学¶

在生命科学领域,Opus 4.6 "在计算生物学、结构生物学、有机化学和系统发育学测试中的表现几乎是 Opus 4.5 的 2 倍"。
合作伙伴评价¶
Sarah Sachs,Notion AI 负责人: "Claude Opus 4.6 是 Anthropic 发布过的最强模型。它接受复杂请求后真正能够执行到底。"
Mario Rodriguez,GitHub CPO: "早期测试显示 Claude Opus 4.6 在开发者每天面对的复杂多步骤编码工作中表现出色。"
Michele Catasta,Replit 总裁: "Claude Opus 4.6 在 agentic 规划方面是一个巨大飞跃。它将复杂任务分解为独立子任务。"
Scott Wu,Cognition CEO: "Claude Opus 4.6 以我们从未见过的水平推理复杂问题。"
Michael Truell,Cursor 联合创始人兼 CEO: "根据我们的内部基准测试,Claude Opus 4.6 在长时间运行任务方面是新的前沿。"
Stian Kirkeberg,NBIM AI 与 ML 负责人: "在 40 次网络安全调查中,Claude Opus 4.6 有 38 次产出最佳结果。"
Gregor Stewart,SentinelOne 首席 AI 官: "Claude Opus 4.6 像高级工程师一样处理了一个数百万行代码库的迁移。"
Jerry Tsui,Ramp 高级软件工程师: "Claude Opus 4.6 是我几个月来见过的最大飞跃。"
产品与 API 更新¶
Claude 平台(API)¶
| 功能 | 说明 |
|---|---|
| 自适应思考 | Claude 自行决定何时需要更深层推理,替代了之前的扩展思考开关 |
| Effort 参数 | 四个级别:low、medium、high(默认)、max |
| 上下文压缩(Beta) | 在可配置阈值处自动总结旧上下文 |
| 100 万 token 上下文(Beta) | 超过 20 万 token 的 prompt 按高级定价(输入 $10/百万 token,输出 $37.50/百万 token) |
| 128k 输出 token | 无需多次请求即可完成更大的任务 |
| 仅美国推理 | 1.1 倍 token 定价 |
产品更新¶
| 功能 | 说明 |
|---|---|
| Agent Teams(Claude Code 研究预览) | 多个智能体并行工作、自主协调;通过 Shift+Up/Down 或 tmux 导航 |
| Claude in Excel | 对长时间运行和更难任务的大幅升级 |
| Claude in PowerPoint | 面向 Max、Team 和 Enterprise 计划的研究预览 |
定价¶
输入 $5 / 百万 token,输出 $25 / 百万 token(不变)。完整详情见定价页面。
API 模型标识符:claude-opus-4-6
其他亮点数据¶
- Vending-Bench 2:Opus 4.6 比 Opus 4.5 多赚 $3,050.53
- NBIM:在网络安全调查中 38/40 次取得最佳结果,使用最多 9 个子智能体和超过 100 次工具调用
- Box 评测:性能提升 10%(68% vs. 58% 基线),在技术领域接近满分
更新 [2026-02-23]: HLE with tools 分数从 53.1% 更新为 53.0%,因为改进后的作弊检测标记了额外 3 个实例。
注:
1. 100 万 token 上下文窗口仅在 Claude 开发者平台以 Beta 形式提供
2. GDPval-AA 由 Artificial Analysis 独立运行(方法论)
3. 144 Elo 的优势转化为约 70% 的胜率 vs GPT-5.2