Anthropic News 中文翻译

create: 2026-06-30
update: 2026-08-10
author: thinkycx
title: 【译】Claude Sonnet 5 发布
description: Anthropic 发布 Claude Sonnet 5,号称史上最强 Agentic Sonnet 模型。它在推理、工具使用、编码和知识工作方面大幅超越 Sonnet 4.6,性能逼近 Opus 4.8 但价格更低。引入价 $2/$10 每百万 token(输入/输出)。
category: translation
tags: anthropic, news, translation, claude-sonnet-5

Claude Sonnet 5 发布

原文发布于 2026 年 6 月 30 日

Claude Sonnet 5

概述

Sonnet 5 是 Anthropic 有史以来最具 Agent 能力的 Sonnet 模型,性能逼近 Opus 4.8 但价格远低。 对许多开发者来说,Agentic AI 时代始于 Sonnet 系列(3.5、3.6、3.7),它们展示了强大的编码和工具使用能力。最近 Opus 级模型在 Agent 能力上取得了最明显的进展。Sonnet 5 大幅缩小了与 Opus 4.8 的差距,同时保持了更低的成本。


性能评估

Sonnet 5 基准测试

对比 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 在各项评测上的得分。完整数据见 Claude Sonnet 5 System Card。


定价

阶段 输入价格 输出价格
引入期(至 2026/8/31) $2 / 百万 token $10 / 百万 token
标准期(2026/9/1 起) $3 / 百万 token $15 / 百万 token

对比:Opus 4.8 定价为 $5/$25 每百万 token(输入/输出)。


可用性

  • 所有计划均可使用:Free、Pro、Max、Team、Enterprise
  • Claude Code 和 Claude Platform 均已上线
  • API 标识符:claude-sonnet-5

Agentic 性能表现

Agentic 搜索(BrowseComp)

BrowseComp 对比

Agentic 电脑使用(OSWorld-Verified)

OSWorld 对比

性能-成本曲线分析: Sonnet 5(橙色)在每个成本点上都严格优于 Sonnet 4.6(灰色),覆盖的成本-性能范围比 Opus 4.8(黄色)更广。在较高 effort 级别下,Sonnet 5 在某些任务上可以匹敌 Opus 4.8。


早期用户反馈

核心主题:Sonnet 5 能完成此前 Sonnet 系列中途放弃的复杂任务,无需提示即可自检输出,且价格有吸引力。

用户 评价摘要
Zimu Li(技术团队成员) 在混乱的技术上下文中持续编码、工具使用和调试表现出色
Daniel Shepard(高级工程师) 过去到一半就卡住的任务现在能完成,日常自动化完全值得
Fabian Hedin(Lovable 联创) 用更少的步骤实现相同的输出质量
Neel Chotai(Rust 工程师) 自动写复现测试、实现修复,然后 stash 确认 bug 能复现
Dominic Elm(创始工程师) 能追溯到真正的根因并交付持久的修复
Deepak Singh(Kiro VP) 准确度可比 Opus 级模型,相对 Sonnet 4.6 是阶梯式提升

安全评估

错误行为率

错误行为率对比

Sonnet 5 的错误行为率低于 Sonnet 4.6。 在拒绝恶意请求和抵御 prompt injection 方面表现更好。幻觉率和迎合率(sycophancy)均低于 Sonnet 4.6。

网络安全评估

网络安全评估

针对 Firefox 147 漏洞的攻击开发测试(漏洞已在 Firefox 148 中修补,与 Mozilla 合作开发):

模型 完整攻击成功率 备注
Sonnet 5 0% 部分成功率略高于 Sonnet 4.6
Sonnet 4.6 0% -
Opus 4.8 明显更高 网络安全能力远强于 Sonnet 级别
  • Sonnet 5 默认启用网络安全防护(与 Opus 4.7/4.8 相同的防护措施)
  • 属于网络验证计划(Cyber Verification Program)的一部分

技术说明

  1. Tokenizer 更新: Sonnet 5 使用新 tokenizer(与 Opus 4.7 引入的类似)。相同输入可能映射为约 1.0~1.35 倍的 token,取决于内容类型。引入期定价旨在使迁移"大致成本中性"。

  2. 速率限制: 2026 年 4 月 26 日起,Anthropic 提高了所有层级的 Sonnet 和 Haiku 速率限制,并简化为三个层级(Start、Build、Scale)。


更新日志(2026/6/30)

原始 BrowseComp 图表已更新为标准方法论(10M token 预算 + 压缩 + 编程式工具调用),此前低估了 Sonnet 5 的表现。