Claude 模型详解:如何为你的场景选择最佳模型¶
原文发布于 2026 年 7 月 24 日
我们的建议:从最强模型开始¶
默认推荐从最强的通用模型起步,通过 effort level 调节性能和成本。 「该选哪个模型?」是我们最常被问到的问题。随着模型种类和版本越来越多,答案也变得更加复杂。
本文将覆盖以下内容:各模型类别的描述、选型时需要考虑的关键问题,以及最佳实践。
先给出核心结论:从最智能的通用模型开始,然后用 effort level 调控性能和成本。
为什么?因为更智能的模型每个任务的成本往往反而更低——即使每 token 的单价更高,但更强的模型通常只需更少的轮次和思考时间就能完成任务。如果从小模型开始,你会很难区分「模型能力不够」还是「搭建方式有问题」。
当然,对于延迟敏感或成本敏感的场景,可以逐步测试低级别模型直到找到最佳平衡点。
Claude 模型家族¶
Claude 模型家族包含 Fable、Opus、Sonnet、Haiku 四个系列,各有侧重。 每个系列在智能、速度和成本之间做出不同的权衡。
| 模型系列 | 定位 | 核心特点 |
|---|---|---|
| Mythos / Fable | 最强大的模型 | 前沿能力,编程、长时间 agent 任务、解决 AI 此前无法可靠完成的问题 |
| Opus | 推理密集型企业任务 | 在 GDPval-AA(知识工作)和 Terminal-Bench 2.1(agentic 编程)等基准上名列前茅 |
| Sonnet | 通用日常任务 | 性能、成本、速度的最佳平衡,适合多 agent 编排中的高并发子 agent |
| Haiku | 最低成本、最快速度 | 适合高频工作负载,延迟和成本优先 |
Mythos / Fable¶
Mythos 是 Anthropic 能力最强的模型系列,在多个领域拥有前沿能力。该系列以两种方式提供:Claude Mythos 面向处理双用途网络安全和生物学工作的受信组织;Claude Fable 则附加了额外安全防护,适合公众使用。两者均要求有限数据留存。
Opus¶
Opus 是推理密集型企业任务的强力模型。Opus 和 Fable 都擅长编程、长期 agent 和知识工作。区别在于:Fable 这类更大的模型通常在智慧、创造力和写作能力方面更胜一筹,即使基准分数与 Opus 相近。
经验法则: 如果 eval 显示 Opus 在某些任务上吃力,Fable 就是答案;如果 Opus 已经达标,其速度和价格优势可能使它成为更好的选择。
Sonnet¶
Sonnet 是日常通用任务的多面手,为最广泛的场景提供性能、成本和速度的平衡,包括多 agent 编排中的高并发子 agent。
Haiku¶
Haiku 是成本最低、速度最快的模型系列,专为延迟和成本敏感的高频工作负载设计。
如何选择最适合你工作负载的 Claude 模型¶
模型选择的核心不是领域,而是任务难度、延迟需求和经济性。 我们的模型系列不按领域划分(不是「金融用 A,科学用 B」)——每个 Claude 模型都在编程、agentic 任务和知识工作等方面经过训练。
选模型时需要回答四个问题:
| 维度 | 考虑因素 |
|---|---|
| 任务难度 | 耗时长、多步骤、此前未解决 → 选更强模型 |
| 延迟需求 | 高频面向用户的工作负载 → Sonnet 通常最优 |
| 访问限制 | Mythos 仅对 Project Glasswing 组织开放;并非所有组织对所有角色开放所有模型 |
| 单位经济性 | 高产量生产场景可能更适合低级别模型(前提是 eval 通过) |
Effort level 同样影响质量、速度和成本的平衡。 高级别模型 + 高 effort 提供最佳性能;高级别模型 + 低 effort 有时比小模型更高效。
更多信息参见:Choosing a Claude model and effort level in Claude Code
Advisor 策略:结合模型优势¶
让低成本模型完成执行,智能模型按需提供指导,性能接近全用强模型但成本大幅降低。 Advisor 策略允许更快、更低成本的「执行者」模型在需要时调用更智能的模型来检查计划和评估工作。
效果示例:在 SWE-bench Pro 上,Sonnet 5 + Fable 5 advisor 的得分达到 Fable 5 的 90%,但成本只有 63%。

评估(Eval)和基准测试如何辅助选型¶
当基准已饱和时,自定义 eval 是区分前沿模型的唯一方式。 两种常见方法:
| 方法 | 优势 | 局限 |
|---|---|---|
| 标准基准 | 快速对比跨模型、跨厂商的能力 | 强模型(Opus、Fable)接近满分,难以区分 |
| 自定义 Eval | 从生产中提取难题,用你自己的成功标准 | 需要投入时间构建和维护 |
当模型在标准基准上都接近满分(饱和)时,建议在真实工作负载上测试或使用自定义 eval 来做决策。前沿模型的能力和创造力差异往往在这些场景中才会显现。
我们已撰写了关于开发自定义 agent 评估最佳实践的详细指南。
做出明智的选择¶
没有万能方案——理解各模型系列的基础定位,加上深入了解你的场景和扎实的 eval,是做出正确选择的关键。 最终,选择模型的最佳方式是理解每个模型系列的基本特性,并深入理解你的用例——这意味着构建、维护和部署强大的评估体系。