Claude Haiku 4.5 发布:以三分之一的成本实现前沿级编码性能¶
Anthropic 最新的小型模型 Claude Haiku 4.5 现已向所有用户开放,以更低成本和更高速度交付近期前沿级别的性能表现。
五个月前,Claude Sonnet 4 还是业界顶尖。如今 Claude Haiku 4.5 以三分之一的成本和超过两倍的速度提供相当的编码性能。

Claude Haiku 4.5 在某些任务上超越了 Claude Sonnet 4,例如计算机使用。这些进步使 Claude for Chrome 等应用变得更快更实用。
该模型面向依赖 AI 执行实时、低延迟任务的用户,如聊天助手、客服智能体或结对编程。Claude Code 用户会发现 Haiku 4.5 使编码工作(从多智能体项目到快速原型设计)响应速度显著提升。
两周前发布的 Claude Sonnet 4.5 仍然是前沿模型,也是"世界上最好的编码模型"。Claude Haiku 4.5 则为用户提供了一个近前沿性能且成本效率更高的新选择。它还催生了新的多模型工作流——例如,Sonnet 4.5 可以将复杂问题分解为多步骤计划,然后编排多个 Haiku 4.5 实例并行完成子任务。
| 项目 | 详情 |
|---|---|
| API 标识符 | claude-haiku-4-5 |
| 定价 | 输入 $1 / 输出 $5(每百万 token) |
基准测试¶

Claude Haiku 4.5 是 Anthropic 迄今为止最强大的模型之一。
合作伙伴评价¶
Guy Gur-Ari,Augment 联合创始人:
"近前沿编码质量加上极速和高性价比。"在 Augment 的智能体编码评测中,它达到了 Sonnet 4.5 性能的 90%,匹配了更大型的模型。
Zach Lloyd,Warp 创始人兼 CEO:
"Claude Haiku 4.5 是智能体编码的一次飞跃。"强调了子智能体编排、计算机使用任务,以及让 Warp 中 AI 辅助开发感觉瞬时完成的响应速度。
Jeff Wang,CEO:
"这是一个快速的前沿模型,同时保持了成本效率。"指出该模型模糊了速度/成本与质量之间的传统权衡。
Ben Lafferty,Staff Engineer:
"Claude Haiku 4.5 在不牺牲速度的前提下提供智能。"强调了同时利用深度推理和实时响应的 AI 应用。
Andrew Filev,CEO:
"仅在六个月前,这一性能水平还处于顶尖水准。"指出它比 Sonnet 4.5 快 4-5 倍,成本只是后者的一小部分。
Brad Axen,AI 技术主管:
"Haiku 4.5 证明了你可以同时拥有智能和快速输出。"指出该模型可靠地处理复杂工作流,实时自我纠正,并保持无延迟开销的推进动力。
Jon Noronha,Gamma 联合创始人:
"在幻灯片文本生成的指令跟随方面超越了我们当前的模型。"报告准确率为 65%,而其高级层模型为 44%,称其为单位经济效益的颠覆者。
Matthew Isabel,GitHub 杰出产品经理:
"与 Sonnet 4 质量相当但速度更快。"指出它为 GitHub Copilot 带来了高效的代码生成,是重视速度和响应性的用户的绝佳选择。
安全评估¶
Anthropic 对 Claude Haiku 4.5 进行了详细的安全和对齐评估。 主要发现:
| 评估维度 | 结果 |
|---|---|
| 令人担忧的行为发生率 | 低 |
| 与前代对比(Haiku 3.5) | 对齐度大幅提升 |
| 自动化对齐评估 | 不一致行为总体比率在统计上显著低于 Claude Sonnet 4.5 和 Claude Opus 4.1 |
| 安全等级 | Anthropic 迄今为止最安全的模型 |
| CBRN 武器相关风险 | 有限 |
| 发布标准 | AI Safety Level 2 (ASL-2)(相比 Sonnet 4.5 和 Opus 4.1 的 ASL-3 限制更少) |
完整推理过程请参见 Claude Haiku 4.5 system card。
更多信息¶
Claude Haiku 4.5 已在 Claude Code 和 Anthropic 应用中可用。其高效性意味着用户可以在使用限额内完成更多工作,同时保持高端模型的性能表现。
可用渠道:
- Claude API
- Amazon Bedrock
- Google Cloud Vertex AI
它可作为 Haiku 3.5 和 Sonnet 4 的替代品,价格为 Anthropic 最经济的档位。
技术详情请参见:system card、模型页面、文档。
测评方法¶
-
SWE-bench Verified:使用简单脚手架,包含两个工具——bash 和通过字符串替换进行的文件编辑。报告 73.3%,在 50 次试验中取平均值,无测试时计算,128K 思考预算,在完整 500 题数据集上使用默认采样参数。使用了一个指导工具使用(理想情况下 100 次以上)并先实现自己测试的轻微提示附加。
-
Terminal-Bench:默认智能体框架(Terminus 2),XML 解析器,11 次运行取平均值(6 次无思考得分 40.21%,5 次 32K 思考预算得分 41.75%),n-attempts=1。
-
τ2-bench:使用扩展思考(128k 思考预算)和默认采样参数进行 10 次运行取平均值,附带工具使用和针对已知失败模式的航空和电信智能体策略提示附加,以及电信用户提示的额外附加。
-
AIME:10 次独立运行取平均值,使用默认采样参数和 128K 思考预算计算 16 次试验的 pass@1。
-
OSWorld:官方 OSWorld-Verified 框架,最大 100 步,4 次运行取平均值,128K 总思考预算,每步 2K 思考预算。
-
MMMLU:14 种非英语语言 10 次运行取平均值,128K 思考预算。
-
所有其他分数均为 10 次运行的平均值,使用默认采样参数和 128K 思考预算。
竞品分数来源:
- OpenAI 分数来自 GPT-5 帖子、GPT-5 开发者帖子、GPT-5 system card(SWE-bench Verified 使用 n=500 报告)和 Terminal Bench 排行榜(Terminus 2)
- Gemini 分数来自其模型网页和 Terminal Bench 排行榜(Terminus 1)