Claude Opus 4.8 发布¶
原文发布于 2026 年 5 月 28 日

概述¶
Opus 4.8 是一个"更好的合作者"——在诚实性方面有 4 倍提升,主动标记代码缺陷而非沉默略过。 它是 Opus 4.7 的全面升级,跨基准提升,同时价格保持不变。本次发布同步推出多项新功能。
基准测试¶

定价¶
| 模式 | 输入价格 | 输出价格 |
|---|---|---|
| 常规 | $5 / 百万 token | $25 / 百万 token |
| Fast mode | $10 / 百万 token | $50 / 百万 token |
- API 标识符:
claude-opus-4-8 - Fast mode 比前代模型便宜 3 倍,速度快 2.5 倍
核心改进¶
诚实性¶
Opus 4.8 对自己写的代码中的缺陷"沉默放过"的概率降低约 4 倍。 它更一致地标记不确定性,避免无根据的声称。
对齐评估¶

Anthropic 对齐团队评估发现:
- Opus 4.8 在"支持用户自主性"等亲社会特质上达到新高
- 错误行为率(欺骗、配合滥用)大幅低于 Opus 4.7
- 与其最佳对齐模型 Mythos Preview 相当
早期用户反馈¶
| 用户 | 公司/角色 | 评价 |
|---|---|---|
| Tom Pritchard | Staff Engineer | Claude Code 中"问对问题,能发现自己的错误" |
| Kay Zhu | 联创 & CTO | "唯一一个端到端完成所有 Super-Agent 基准测试用例的模型" |
| Michael Truell | Cursor CEO | CursorBench "在每个 effort 级别上超越此前 Opus 模型" |
| Niko Grupen | 应用研究负责人 | 法律 Agent 基准最高分,"第一个整体突破 10% 的模型" |
| Katie Parrott | Staff Writer | "更快,更易协作",能保持语气和风格 |
| Miguel Gonzalez | Tech Lead | Online-Mind2Web 84%,"最强的电脑使用和浏览器 Agent 模型" |
| Scott Wu | Devin CEO | "工具使用干净,指令遵循一致" |
| Michael Ran | 高级投资助理 | "主动标记输入输出中的问题" |
| Hanlin Tang | Databricks CTO | "Agent 推理的阶梯式变化","token 成本比 Opus 4.7 便宜 61%" |
同步发布的新功能¶
1. 动态工作流(Dynamic Workflows)— 研究预览¶
Claude Code 可以规划工作并在单个会话中运行数百个并行子 Agent,处理跨数十万行代码的整库级别迁移。
- 可用于 Enterprise、Team 和 Max 计划
2. Effort 控制(claude.ai 和 Cowork)¶
用户选择 Claude 投入多少精力:
| 级别 | 特点 |
|---|---|
| 低 effort | 更快,消耗更少速率限制 |
| 高 effort(默认) | 更深入思考,更好响应 |
| Extra / Max | 用于困难任务和长时间异步工作流 |
所有计划可用。Claude Code 的速率限制已增加以适应更高 token 用量。
3. Messages API 更新¶
System entries 现在可以在 messages 数组内部接受,允许任务中更新指令而不破坏 prompt cache。
下一步¶
Anthropic 将 Opus 4.8 描述为"适度但实在的改进",同时正在进行:
- 更低成本、类似能力的模型
- 高于 Opus 的新模型级别
- 通过 Project Glasswing,少量组织已在使用 Claude Mythos Preview
- 计划"在未来几周"将 Mythos 级模型向所有客户开放