改进 Fable 5 的生物学安全防护¶
原文发布于 2026 年 8 月 7 日
概述¶
Fable 5 的生物学误拦截率降低了约 85%,合法用户终于可以正常使用了。 Anthropic 对 Claude Fable 5 的生物学安全防护进行了重大更新。此前,系统在遇到生物学相关查询时会频繁"回退"(fallback)——即切换到能力较弱的模型来响应。此次更新将生物学相关的回退量减少了约 85%。
Fable 5 现在能够协助更广泛的生物学任务:解读化验结果、理解症状、辅助生物学教育等日常问题将不再被误拦截。医疗专业人员也将在临床任务上获得更多 Fable 5 的支持。
Anthropic 表示:"我们相信 AI 对世界产生积极影响的最大机会在于生物学和医学领域。"对于涉及双重用途的请求(如病毒学、毒理学、分子设计),Fable 仍会回退到 Opus 5,因此目前尚不能完全用于专业生物学研究和药物开发。Anthropic 承诺将通过受信任的访问通道来弥合这一差距。
| 产品表面 | 总回退量预期降幅 |
|---|---|
| Claude.ai | ~67% |
| Cowork | ~55% |
| Claude Code | ~17% |
| Claude Platform | ~7% |
为什么生物学需要强防护¶
Fable 5 在某些复杂生物学任务上已经超越人类专家,这种能力若被滥用后果将是灾难性的。 Anthropic 的目标是尽快将 Fable 5 的前沿能力交付给用户,同时管控日益增长的风险。在生物学领域,"Fable 5 现在在某些高度复杂的生物学任务上能超越专家表现,并在其他任务上提供操作性支持。"这意味着它既能帮助研究人员开发医学疗法,也可能被恶意行为者利用来开发生物武器。Anthropic 的能力评估表明,Fable 5"可以为此类行为者提供显著的能力提升(uplift)"。
区分善意与恶意的困难¶
在生物学领域,区分有益和有害的使用往往极其困难:
- 研究疾病疗法有时需要产生导致该疾病的危险化合物
- 减毒活疫苗的制备需要培养目标病原体
- 降压药卡托普利(captopril)是通过分离能导致血压骤降的蛇毒成分而开发出来的
老练的恶意行为者深知如何利用这种模糊性,将危险任务伪装成正常研究。美国情报界 2026 年度威胁评估指出,生物技术进步"可能导致新型生物威胁",且多个国家行为者可能维持着活跃的进攻性生化武器项目,而前沿 AI 可能加速这些项目。
发布时的权衡¶
由于对双重用途能力的担忧,Anthropic 在发布 Fable 5 时有意阻止了几乎所有生物学查询,以便模型能在其他领域正常使用。他们承认这会因高误报率而让合法生物学用户感到沮丧,但选择了这一权衡——因为生物学领域的滥用"可能造成灾难性后果"。
生物学安全防护的工作原理¶
通过安全分类器(classifier)检测危险请求,触发时将用户路由到能力较弱的模型。 Anthropic 使用安全分类器来防范生物学滥用:这些是较小的自动化 AI 系统,负责检测 Fable 5 何时被要求执行受保护的生物学任务或生成有害输出(类似于此前公布的网络安全分类器)。
当分类器触发时,用户的请求会被重新路由到 Opus 5——一个能力不错但不具备同等生物学能力水平的模型,无法为恶意用户提供同等程度的帮助。
开发精准分类器的挑战¶
开发精准、鲁棒的分类器并非易事:
| 挑战 | 说明 |
|---|---|
| 范围界定 | 分类器必须学会区分"在范围内"与"范围外"的内容 |
| 精度调优 | 需要时间和迭代来平衡误报(false positives)与漏报(false negatives) |
| 对抗鲁棒性 | 必须能抵御越狱(jailbreak)尝试 |
分步改进策略¶
Anthropic 采用了从宽到窄的渐进式策略:
- 发布时:使用非常宽泛的生物学分类器,虽然误报率高,但能让用户访问 Fable 5 的其他能力
- 持续迭代:在过去几周内仔细重写了分类器的"宪法"(constitution)——即帮助模型区分受保护内容与允许内容的规则
- 专家协作:征集了多元化的内外部专家反馈
- 重新训练:开发更新的训练数据,重新训练分类器
- 验证:确认更新后的分类器仍能对有害和双重用途研究内容触发,同时允许更多良性和有益的使用

上图说明了分类器的工作方式:分类器边界左侧的内容被允许通过,右侧的内容被拦截并路由到能力较弱的模型。明确有害的内容(红色)和双重用途内容(橙色)会触发分类器。安全边际区域包含一些可能无害但仍出于谨慎而被拦截的内容(浅绿色)。明确无害的内容为深绿色。
发布时,Fable 5 使用了非常宽泛的分类器(A),对大范围请求触发拦截。此次更新(B)意味着更多良性请求被放行,因为分类器已经更好地学会了区分良性查询与双重用途查询,将边界进一步向右移动。
后续方向¶
双重用途生物学查询仍将被拦截,Anthropic 将通过受信任访问通道逐步开放专业研究能力。 改进安全防护的工作仍在继续。由于分类器安全边际的存在,误报不可避免地会持续存在。Fable 将继续拦截涉及双重用途的专业生物学和药物开发查询。
Anthropic 表示"完全致力于为研究人员开发安全、可扩展的路径,使其能通过受信任的访问通道使用我们最强大的模型",并邀请用户继续提供反馈以进一步改进安全防护。