Anthropic News 中文翻译

create: 2026-05-28
update: 2026-08-10
author: thinkycx
title: 【译】Claude Opus 4.8 发布
description: Anthropic 发布 Claude Opus 4.8,是 Opus 4.7 的升级版,在诚实性和对齐性方面有显著改进。同步推出动态工作流(dynamic workflows)、effort 控制功能和更便宜的 fast mode。定价不变 $5/$25 每百万 token。
category: translation
tags: anthropic, news, translation, opus-4-8

Claude Opus 4.8 发布

原文发布于 2026 年 5 月 28 日

Claude Opus 4.8

概述

Opus 4.8 是一个"更好的合作者"——在诚实性方面有 4 倍提升,主动标记代码缺陷而非沉默略过。 它是 Opus 4.7 的全面升级,跨基准提升,同时价格保持不变。本次发布同步推出多项新功能。


基准测试

Opus 4.8 基准对比


定价

模式 输入价格 输出价格
常规 $5 / 百万 token $25 / 百万 token
Fast mode $10 / 百万 token $50 / 百万 token
  • API 标识符:claude-opus-4-8
  • Fast mode 比前代模型便宜 3 倍,速度快 2.5 倍

核心改进

诚实性

Opus 4.8 对自己写的代码中的缺陷"沉默放过"的概率降低约 4 倍。 它更一致地标记不确定性,避免无根据的声称。

对齐评估

对齐评估

Anthropic 对齐团队评估发现:

  • Opus 4.8 在"支持用户自主性"等亲社会特质上达到新高
  • 错误行为率(欺骗、配合滥用)大幅低于 Opus 4.7
  • 与其最佳对齐模型 Mythos Preview 相当

早期用户反馈

用户 公司/角色 评价
Tom Pritchard Staff Engineer Claude Code 中"问对问题,能发现自己的错误"
Kay Zhu 联创 & CTO "唯一一个端到端完成所有 Super-Agent 基准测试用例的模型"
Michael Truell Cursor CEO CursorBench "在每个 effort 级别上超越此前 Opus 模型"
Niko Grupen 应用研究负责人 法律 Agent 基准最高分,"第一个整体突破 10% 的模型"
Katie Parrott Staff Writer "更快,更易协作",能保持语气和风格
Miguel Gonzalez Tech Lead Online-Mind2Web 84%,"最强的电脑使用和浏览器 Agent 模型"
Scott Wu Devin CEO "工具使用干净,指令遵循一致"
Michael Ran 高级投资助理 "主动标记输入输出中的问题"
Hanlin Tang Databricks CTO "Agent 推理的阶梯式变化","token 成本比 Opus 4.7 便宜 61%"

同步发布的新功能

1. 动态工作流(Dynamic Workflows)— 研究预览

Claude Code 可以规划工作并在单个会话中运行数百个并行子 Agent,处理跨数十万行代码的整库级别迁移。

  • 可用于 Enterprise、Team 和 Max 计划

2. Effort 控制(claude.ai 和 Cowork)

用户选择 Claude 投入多少精力:

级别 特点
低 effort 更快,消耗更少速率限制
高 effort(默认) 更深入思考,更好响应
Extra / Max 用于困难任务和长时间异步工作流

所有计划可用。Claude Code 的速率限制已增加以适应更高 token 用量。

3. Messages API 更新

System entries 现在可以在 messages 数组内部接受,允许任务中更新指令而不破坏 prompt cache。


下一步

Anthropic 将 Opus 4.8 描述为"适度但实在的改进",同时正在进行:

  • 更低成本、类似能力的模型
  • 高于 Opus 的新模型级别
  • 通过 Project Glasswing,少量组织已在使用 Claude Mythos Preview
  • 计划"在未来几周"将 Mythos 级模型向所有客户开放