Claude Blog 中文翻译

create: 2026-07-24
update: 2026-08-10
author: thinkycx
title: 【译】Claude 模型详解:如何为你的场景选择最佳模型
description: Anthropic 详细介绍了 Claude 模型家族(Fable、Opus、Sonnet、Haiku)的定位与差异,给出了模型选择的核心建议:从最强模型开始,用 effort level 调节性能与成本平衡。文章还介绍了 advisor 策略和评估方法。
category: translation
tags: claude, blog, translation, models

Claude 模型详解:如何为你的场景选择最佳模型

原文发布于 2026 年 7 月 24 日


我们的建议:从最强模型开始

默认推荐从最强的通用模型起步,通过 effort level 调节性能和成本。 「该选哪个模型?」是我们最常被问到的问题。随着模型种类和版本越来越多,答案也变得更加复杂。

本文将覆盖以下内容:各模型类别的描述、选型时需要考虑的关键问题,以及最佳实践。

先给出核心结论:从最智能的通用模型开始,然后用 effort level 调控性能和成本

为什么?因为更智能的模型每个任务的成本往往反而更低——即使每 token 的单价更高,但更强的模型通常只需更少的轮次和思考时间就能完成任务。如果从小模型开始,你会很难区分「模型能力不够」还是「搭建方式有问题」。

当然,对于延迟敏感或成本敏感的场景,可以逐步测试低级别模型直到找到最佳平衡点。


Claude 模型家族

Claude 模型家族包含 Fable、Opus、Sonnet、Haiku 四个系列,各有侧重。 每个系列在智能、速度和成本之间做出不同的权衡。

模型系列 定位 核心特点
Mythos / Fable 最强大的模型 前沿能力,编程、长时间 agent 任务、解决 AI 此前无法可靠完成的问题
Opus 推理密集型企业任务 在 GDPval-AA(知识工作)和 Terminal-Bench 2.1(agentic 编程)等基准上名列前茅
Sonnet 通用日常任务 性能、成本、速度的最佳平衡,适合多 agent 编排中的高并发子 agent
Haiku 最低成本、最快速度 适合高频工作负载,延迟和成本优先

Mythos / Fable

Mythos 是 Anthropic 能力最强的模型系列,在多个领域拥有前沿能力。该系列以两种方式提供:Claude Mythos 面向处理双用途网络安全和生物学工作的受信组织;Claude Fable 则附加了额外安全防护,适合公众使用。两者均要求有限数据留存

Opus

Opus 是推理密集型企业任务的强力模型。Opus 和 Fable 都擅长编程、长期 agent 和知识工作。区别在于:Fable 这类更大的模型通常在智慧、创造力和写作能力方面更胜一筹,即使基准分数与 Opus 相近。

经验法则: 如果 eval 显示 Opus 在某些任务上吃力,Fable 就是答案;如果 Opus 已经达标,其速度和价格优势可能使它成为更好的选择。

Sonnet

Sonnet 是日常通用任务的多面手,为最广泛的场景提供性能、成本和速度的平衡,包括多 agent 编排中的高并发子 agent。

Haiku

Haiku 是成本最低、速度最快的模型系列,专为延迟和成本敏感的高频工作负载设计。


如何选择最适合你工作负载的 Claude 模型

模型选择的核心不是领域,而是任务难度、延迟需求和经济性。 我们的模型系列不按领域划分(不是「金融用 A,科学用 B」)——每个 Claude 模型都在编程、agentic 任务和知识工作等方面经过训练。

选模型时需要回答四个问题:

维度 考虑因素
任务难度 耗时长、多步骤、此前未解决 → 选更强模型
延迟需求 高频面向用户的工作负载 → Sonnet 通常最优
访问限制 Mythos 仅对 Project Glasswing 组织开放;并非所有组织对所有角色开放所有模型
单位经济性 高产量生产场景可能更适合低级别模型(前提是 eval 通过)

Effort level 同样影响质量、速度和成本的平衡。 高级别模型 + 高 effort 提供最佳性能;高级别模型 + 低 effort 有时比小模型更高效。

更多信息参见:Choosing a Claude model and effort level in Claude Code


Advisor 策略:结合模型优势

让低成本模型完成执行,智能模型按需提供指导,性能接近全用强模型但成本大幅降低。 Advisor 策略允许更快、更低成本的「执行者」模型在需要时调用更智能的模型来检查计划和评估工作。

效果示例:在 SWE-bench Pro 上,Sonnet 5 + Fable 5 advisor 的得分达到 Fable 5 的 90%,但成本只有 63%。

Advisor 策略示意图


评估(Eval)和基准测试如何辅助选型

当基准已饱和时,自定义 eval 是区分前沿模型的唯一方式。 两种常见方法:

方法 优势 局限
标准基准 快速对比跨模型、跨厂商的能力 强模型(Opus、Fable)接近满分,难以区分
自定义 Eval 从生产中提取难题,用你自己的成功标准 需要投入时间构建和维护

当模型在标准基准上都接近满分(饱和)时,建议在真实工作负载上测试或使用自定义 eval 来做决策。前沿模型的能力和创造力差异往往在这些场景中才会显现。

我们已撰写了关于开发自定义 agent 评估最佳实践的详细指南。


做出明智的选择

没有万能方案——理解各模型系列的基础定位,加上深入了解你的场景和扎实的 eval,是做出正确选择的关键。 最终,选择模型的最佳方式是理解每个模型系列的基本特性,并深入理解你的用例——这意味着构建、维护和部署强大的评估体系。