Claude Sonnet 5 发布¶
原文发布于 2026 年 6 月 30 日

概述¶
Sonnet 5 是 Anthropic 有史以来最具 Agent 能力的 Sonnet 模型,性能逼近 Opus 4.8 但价格远低。 对许多开发者来说,Agentic AI 时代始于 Sonnet 系列(3.5、3.6、3.7),它们展示了强大的编码和工具使用能力。最近 Opus 级模型在 Agent 能力上取得了最明显的进展。Sonnet 5 大幅缩小了与 Opus 4.8 的差距,同时保持了更低的成本。
性能评估¶

对比 Sonnet 5 与 Sonnet 4.6 和 Opus 4.8 在各项评测上的得分。完整数据见 Claude Sonnet 5 System Card。
定价¶
| 阶段 | 输入价格 | 输出价格 |
|---|---|---|
| 引入期(至 2026/8/31) | $2 / 百万 token | $10 / 百万 token |
| 标准期(2026/9/1 起) | $3 / 百万 token | $15 / 百万 token |
对比:Opus 4.8 定价为 $5/$25 每百万 token(输入/输出)。
可用性¶
- 所有计划均可使用:Free、Pro、Max、Team、Enterprise
- Claude Code 和 Claude Platform 均已上线
- API 标识符:
claude-sonnet-5
Agentic 性能表现¶
Agentic 搜索(BrowseComp)¶

Agentic 电脑使用(OSWorld-Verified)¶

性能-成本曲线分析: Sonnet 5(橙色)在每个成本点上都严格优于 Sonnet 4.6(灰色),覆盖的成本-性能范围比 Opus 4.8(黄色)更广。在较高 effort 级别下,Sonnet 5 在某些任务上可以匹敌 Opus 4.8。
早期用户反馈¶
核心主题:Sonnet 5 能完成此前 Sonnet 系列中途放弃的复杂任务,无需提示即可自检输出,且价格有吸引力。
| 用户 | 评价摘要 |
|---|---|
| Zimu Li(技术团队成员) | 在混乱的技术上下文中持续编码、工具使用和调试表现出色 |
| Daniel Shepard(高级工程师) | 过去到一半就卡住的任务现在能完成,日常自动化完全值得 |
| Fabian Hedin(Lovable 联创) | 用更少的步骤实现相同的输出质量 |
| Neel Chotai(Rust 工程师) | 自动写复现测试、实现修复,然后 stash 确认 bug 能复现 |
| Dominic Elm(创始工程师) | 能追溯到真正的根因并交付持久的修复 |
| Deepak Singh(Kiro VP) | 准确度可比 Opus 级模型,相对 Sonnet 4.6 是阶梯式提升 |
安全评估¶
错误行为率¶

Sonnet 5 的错误行为率低于 Sonnet 4.6。 在拒绝恶意请求和抵御 prompt injection 方面表现更好。幻觉率和迎合率(sycophancy)均低于 Sonnet 4.6。
网络安全评估¶

针对 Firefox 147 漏洞的攻击开发测试(漏洞已在 Firefox 148 中修补,与 Mozilla 合作开发):
| 模型 | 完整攻击成功率 | 备注 |
|---|---|---|
| Sonnet 5 | 0% | 部分成功率略高于 Sonnet 4.6 |
| Sonnet 4.6 | 0% | - |
| Opus 4.8 | 明显更高 | 网络安全能力远强于 Sonnet 级别 |
- Sonnet 5 默认启用网络安全防护(与 Opus 4.7/4.8 相同的防护措施)
- 属于网络验证计划(Cyber Verification Program)的一部分
技术说明¶
-
Tokenizer 更新: Sonnet 5 使用新 tokenizer(与 Opus 4.7 引入的类似)。相同输入可能映射为约 1.0~1.35 倍的 token,取决于内容类型。引入期定价旨在使迁移"大致成本中性"。
-
速率限制: 2026 年 4 月 26 日起,Anthropic 提高了所有层级的 Sonnet 和 Haiku 速率限制,并简化为三个层级(Start、Build、Scale)。
更新日志(2026/6/30)¶
原始 BrowseComp 图表已更新为标准方法论(10M token 预算 + 压缩 + 编程式工具调用),此前低估了 Sonnet 5 的表现。