Anthropic News 中文翻译

create: 2026-02-05
update: 2026-08-10
author: thinkycx
title: 【译】Claude Opus 4.6 发布:编码、推理和长上下文全面升级
description: Anthropic 发布 Claude Opus 4.6——迄今最强大的模型升级版,编码能力大幅提升、规划能力更强、支持更长时间的自主任务执行,在大型代码库中更加可靠,调试能力也显著增强。这是首个支持 100 万 token 上下文窗口(Beta)的 Opus 级模型。
category: translation
tags: anthropic, news, translation, model-release

Claude Opus 4.6 发布:编码、推理和长上下文全面升级

Anthropic 发布 Claude Opus 4.6——迄今最强大的模型升级版,编码能力大幅提升、规划能力更强、支持更长时间的自主任务执行,在大型代码库中更加可靠,调试能力也显著增强。这是首个支持 100 万 token 上下文窗口(Beta)的 Opus 级模型。

核心能力

该模型将增强的能力应用于日常工作任务,包括金融分析、研究、创建文档、电子表格和演示文稿。在 Cowork 中,Opus 4.6 可以自主进行多任务处理。

基准测试表现

GDPval-AA 评测结果

基准测试 表现 说明
Terminal-Bench 2.0 最高分 Agentic 编码评测
Humanity's Last Exam 领先所有前沿模型 复杂多学科推理
GDPval-AA 超过 GPT-5.2 约 144 Elo 具有经济价值的知识工作
BrowseComp 最佳表现 在线查找难以发现的信息
MRCR v2(8-needle 1M 变体) 76%(vs. Sonnet 4.5 的 18.5%) 长上下文检索
BigLaw Bench 90.2%(Harvey 测试) 法律领域
SWE-bench Verified 81.42%(经 prompt 调整,25 次平均) 软件工程
BrowseComp(多智能体) 86.8% 多智能体搜索

144 Elo 的优势意味着"Claude Opus 4.6 在该评测中约 70% 的时间得分高于 GPT-5.2"。

Terminal-Bench 2.0 结果

推理能力

基准测试总表

长上下文能力

长上下文检索

长上下文推理

编码与工程

根因分析

多语言编程

长期连贯性 Vending-Bench 2

安全特性

安全评测

系统卡详细记录了广泛的安全评估。Opus 4.6 展现出"与行业内任何其他前沿模型一样好甚至更好的整体安全表现"。它在所有近期 Claude 模型中拥有最低的过度拒绝率,在欺骗、奉承、鼓励用户幻想和配合滥用方面的比率也很低。

新增安全措施包括六个新的网络安全探针,以及在网络安全博客文章中详述的防御性网络安全应用。

网络安全

生命科学

生命科学

在生命科学领域,Opus 4.6 "在计算生物学、结构生物学、有机化学和系统发育学测试中的表现几乎是 Opus 4.5 的 2 倍"。

合作伙伴评价

Sarah Sachs,Notion AI 负责人: "Claude Opus 4.6 是 Anthropic 发布过的最强模型。它接受复杂请求后真正能够执行到底。"

Mario Rodriguez,GitHub CPO: "早期测试显示 Claude Opus 4.6 在开发者每天面对的复杂多步骤编码工作中表现出色。"

Michele Catasta,Replit 总裁: "Claude Opus 4.6 在 agentic 规划方面是一个巨大飞跃。它将复杂任务分解为独立子任务。"

Scott Wu,Cognition CEO: "Claude Opus 4.6 以我们从未见过的水平推理复杂问题。"

Michael Truell,Cursor 联合创始人兼 CEO: "根据我们的内部基准测试,Claude Opus 4.6 在长时间运行任务方面是新的前沿。"

Stian Kirkeberg,NBIM AI 与 ML 负责人: "在 40 次网络安全调查中,Claude Opus 4.6 有 38 次产出最佳结果。"

Gregor Stewart,SentinelOne 首席 AI 官: "Claude Opus 4.6 像高级工程师一样处理了一个数百万行代码库的迁移。"

Jerry Tsui,Ramp 高级软件工程师: "Claude Opus 4.6 是我几个月来见过的最大飞跃。"

产品与 API 更新

Claude 平台(API)

功能 说明
自适应思考 Claude 自行决定何时需要更深层推理,替代了之前的扩展思考开关
Effort 参数 四个级别:low、medium、high(默认)、max
上下文压缩(Beta) 在可配置阈值处自动总结旧上下文
100 万 token 上下文(Beta) 超过 20 万 token 的 prompt 按高级定价(输入 $10/百万 token,输出 $37.50/百万 token)
128k 输出 token 无需多次请求即可完成更大的任务
仅美国推理 1.1 倍 token 定价

产品更新

功能 说明
Agent Teams(Claude Code 研究预览) 多个智能体并行工作、自主协调;通过 Shift+Up/Down 或 tmux 导航
Claude in Excel 对长时间运行和更难任务的大幅升级
Claude in PowerPoint 面向 Max、Team 和 Enterprise 计划的研究预览

定价

输入 $5 / 百万 token,输出 $25 / 百万 token(不变)。完整详情见定价页面

API 模型标识符:claude-opus-4-6

其他亮点数据

  • Vending-Bench 2:Opus 4.6 比 Opus 4.5 多赚 $3,050.53
  • NBIM:在网络安全调查中 38/40 次取得最佳结果,使用最多 9 个子智能体和超过 100 次工具调用
  • Box 评测:性能提升 10%(68% vs. 58% 基线),在技术领域接近满分

更新 [2026-02-23]: HLE with tools 分数从 53.1% 更新为 53.0%,因为改进后的作弊检测标记了额外 3 个实例。


注:
1. 100 万 token 上下文窗口仅在 Claude 开发者平台以 Beta 形式提供
2. GDPval-AA 由 Artificial Analysis 独立运行(方法论
3. 144 Elo 的优势转化为约 70% 的胜率 vs GPT-5.2