Anthropic News 中文翻译

create: 2026-08-07
update: 2026-08-10
author: thinkycx
title: 【译】改进 Fable 5 的生物学安全防护
description: Anthropic 宣布对 Fable 5 的生物学安全分类器进行了重大改进,将生物学相关的误拦截率降低了约 85%。文章解释了为何生物学领域需要严格防护、分类器的工作原理,以及如何在不降低安全性的前提下大幅减少对合法用户的干扰。
category: translation
tags: anthropic, news, translation, safety, fable-5

改进 Fable 5 的生物学安全防护

原文发布于 2026 年 8 月 7 日

Improving Fable 5's biology safeguards

概述

Fable 5 的生物学误拦截率降低了约 85%,合法用户终于可以正常使用了。 Anthropic 对 Claude Fable 5 的生物学安全防护进行了重大更新。此前,系统在遇到生物学相关查询时会频繁"回退"(fallback)——即切换到能力较弱的模型来响应。此次更新将生物学相关的回退量减少了约 85%。

Fable 5 现在能够协助更广泛的生物学任务:解读化验结果、理解症状、辅助生物学教育等日常问题将不再被误拦截。医疗专业人员也将在临床任务上获得更多 Fable 5 的支持。

Anthropic 表示:"我们相信 AI 对世界产生积极影响的最大机会在于生物学和医学领域。"对于涉及双重用途的请求(如病毒学、毒理学、分子设计),Fable 仍会回退到 Opus 5,因此目前尚不能完全用于专业生物学研究和药物开发。Anthropic 承诺将通过受信任的访问通道来弥合这一差距。

产品表面 总回退量预期降幅
Claude.ai ~67%
Cowork ~55%
Claude Code ~17%
Claude Platform ~7%

为什么生物学需要强防护

Fable 5 在某些复杂生物学任务上已经超越人类专家,这种能力若被滥用后果将是灾难性的。 Anthropic 的目标是尽快将 Fable 5 的前沿能力交付给用户,同时管控日益增长的风险。在生物学领域,"Fable 5 现在在某些高度复杂的生物学任务上能超越专家表现,并在其他任务上提供操作性支持。"这意味着它既能帮助研究人员开发医学疗法,也可能被恶意行为者利用来开发生物武器。Anthropic 的能力评估表明,Fable 5"可以为此类行为者提供显著的能力提升(uplift)"。

区分善意与恶意的困难

在生物学领域,区分有益和有害的使用往往极其困难:

  • 研究疾病疗法有时需要产生导致该疾病的危险化合物
  • 减毒活疫苗的制备需要培养目标病原体
  • 降压药卡托普利(captopril)是通过分离能导致血压骤降的蛇毒成分而开发出来的

老练的恶意行为者深知如何利用这种模糊性,将危险任务伪装成正常研究。美国情报界 2026 年度威胁评估指出,生物技术进步"可能导致新型生物威胁",且多个国家行为者可能维持着活跃的进攻性生化武器项目,而前沿 AI 可能加速这些项目。

发布时的权衡

由于对双重用途能力的担忧,Anthropic 在发布 Fable 5 时有意阻止了几乎所有生物学查询,以便模型能在其他领域正常使用。他们承认这会因高误报率而让合法生物学用户感到沮丧,但选择了这一权衡——因为生物学领域的滥用"可能造成灾难性后果"。


生物学安全防护的工作原理

通过安全分类器(classifier)检测危险请求,触发时将用户路由到能力较弱的模型。 Anthropic 使用安全分类器来防范生物学滥用:这些是较小的自动化 AI 系统,负责检测 Fable 5 何时被要求执行受保护的生物学任务或生成有害输出(类似于此前公布的网络安全分类器)。

当分类器触发时,用户的请求会被重新路由到 Opus 5——一个能力不错但不具备同等生物学能力水平的模型,无法为恶意用户提供同等程度的帮助。

开发精准分类器的挑战

开发精准、鲁棒的分类器并非易事:

挑战 说明
范围界定 分类器必须学会区分"在范围内"与"范围外"的内容
精度调优 需要时间和迭代来平衡误报(false positives)与漏报(false negatives)
对抗鲁棒性 必须能抵御越狱(jailbreak)尝试

分步改进策略

Anthropic 采用了从宽到窄的渐进式策略:

  1. 发布时:使用非常宽泛的生物学分类器,虽然误报率高,但能让用户访问 Fable 5 的其他能力
  2. 持续迭代:在过去几周内仔细重写了分类器的"宪法"(constitution)——即帮助模型区分受保护内容与允许内容的规则
  3. 专家协作:征集了多元化的内外部专家反馈
  4. 重新训练:开发更新的训练数据,重新训练分类器
  5. 验证:确认更新后的分类器仍能对有害和双重用途研究内容触发,同时允许更多良性和有益的使用

分类器示意图

上图说明了分类器的工作方式:分类器边界左侧的内容被允许通过,右侧的内容被拦截并路由到能力较弱的模型。明确有害的内容(红色)和双重用途内容(橙色)会触发分类器。安全边际区域包含一些可能无害但仍出于谨慎而被拦截的内容(浅绿色)。明确无害的内容为深绿色。

发布时,Fable 5 使用了非常宽泛的分类器(A),对大范围请求触发拦截。此次更新(B)意味着更多良性请求被放行,因为分类器已经更好地学会了区分良性查询与双重用途查询,将边界进一步向右移动。


后续方向

双重用途生物学查询仍将被拦截,Anthropic 将通过受信任访问通道逐步开放专业研究能力。 改进安全防护的工作仍在继续。由于分类器安全边际的存在,误报不可避免地会持续存在。Fable 将继续拦截涉及双重用途的专业生物学和药物开发查询。

Anthropic 表示"完全致力于为研究人员开发安全、可扩展的路径,使其能通过受信任的访问通道使用我们最强大的模型",并邀请用户继续提供反馈以进一步改进安全防护。