用 BioMysteryBench 评估 Claude 的生物信息学研究能力¶
Anthropic 发布了 BioMysteryBench 基准测试,包含 99 个来自不同生物信息学领域的专家级问题,用于评估 AI 模型在真实生物数据分析中的能力。Claude 在人类可解决的问题上表现与专家相当,在人类无法解决的问题上仍能达到显著的解决率。

引言¶
大语言模型已通过各种基准测试与人类专家进行比较——通过律师资格考试、医学执照考试和数学奥林匹克。基准测试在 AI 开发者之间变得竞争激烈,被报告在系统卡中并在排行榜上追踪:
基准测试帮助确定"模型是否足够有能力和可靠以支持、甚至产出专业级工作。"科学家们正将模型用于分析管线、假设生成和结论推导,目标是加速创新与发现。相关链接:加速科学研究。
现有基准测试的局限¶
| 基准测试 | 类型 |
|---|---|
| MMLU-Pro | 专家级知识和推理 |
| GPQA | 研究生级别"Google 证明"问题(生物、物理、化学) |
| LAB-Bench | 生物学特定知识工作 |
| FrontierScience | 高难度科学推理 |
| Humanity's Last Exam | 高难度科学推理 |
| BLADE | 开放式数据集分析任务 |
| BixBench | 生物数据集,根据结论评分 |
| SciGym | 模拟生物实验室实验 |
| SWE-bench | 软件工程基准 |
| ProteinGym | 突变适应性效应 |
| CASP | 蛋白质折叠竞赛 |
科学评估的三大挑战¶
在生物学中评估 AI 的科学能力面临独特挑战,因为正确答案往往不唯一、研究决策高度主观、且许多问题人类自身也尚未解答。
1. 在生物学中,完成同一任务有许多不同的"正确"方法¶
文章以二甲双胍在 2 型糖尿病患者中的反应为例——可以进行全基因组关联研究(GWAS)或测序肠道微生物组。BixBench 通过评价结论而非方法来处理这一问题。
2. 个体研究决策高度主观,可能导致噪声数据集中得出完全不同的结论¶
继续以二甲双胍为例:2011 年的一篇论文报告了一个预测二甲双胍反应的变体,糖尿病预防计划什么都没发现,而 2012 年的一篇荟萃分析认为效应真实存在但很小。
SciGym 通过选择模拟器中有明确答案的任务来处理模糊性,但"尚不清楚模拟实验室中的表现与真实数据上的表现有多接近。"
3. 许多生物学问题人类自己也还无法回答¶
文章指出,二甲双胍开发三十年后其作用机制仍不确定。
BioMysteryBench:基于可验证生物任务的模型基准测试¶
BioMysteryBench 包含 99 个问题,来自不同生物信息学领域,由领域专家编写。专家收集数据集并"基于数据的受控客观属性创建问题,而非不可验证的科学结论。"
Claude 被放置在一个容器中,配备:
- 最小化的标准生物信息学工具集
- 通过 pip 和 conda 安装额外工具的能力
- 访问数据库(NCBI、Ensembl)获取参考基因组的权限
四个独特属性¶
| 属性 | 说明 |
|---|---|
| 方法无关 | 允许研究自由和创造性;仅根据最终答案评分 |
| 客观标准答案 | 来自可控数据属性或正交验证的元数据 |
| 允许"超人类"题目生成 | 不依赖人类能够解决问题 |
| 真实数据 | 基于原始/最小处理的测序数据 |
示例问题¶
问题主要来自原始或最小处理的 DNA/RNA 测序数据(WGS、scRNA-seq、甲基化、ChIP-seq、宏基因组学、Hi-C),以及蛋白质组学和代谢组学:
- 这个细胞类型单细胞 RNA-seq 数据集来自哪个人体器官?
- 基于 RNA-seq 数据,实验样本相比对照样本敲除了哪个基因?
- 从 WGS 序列中,哪个样本是样本 X 的母亲?哪个是父亲?
- 哪些 bigWig 文件来自 ChIP 样本,哪些来自输入对照?
- 给定来自未知细胞类型的 H3K27ac ChIP-seq 峰,识别该细胞类型。
每位出题者提交了验证 notebook,证明数据中存在可检测信号。
人类基线测试¶
人类可解决的问题¶
每个问题由最多 5 位领域专家尝试。一旦至少一位人类正确回答,即视为人类可解决。BioMysteryBench 包含 76 个此类任务。

图 1:76 个人类可解决问题上 5 次试验的平均准确率。误差线通过问题内 bootstrap 抽样计算。
Claude 模仿人类策略的示例¶


Claude 采取不同路径的示例¶


文章指出,人类专家使用算法或数据库,而"Claude 直觉性地识别某些模式或序列。"这类似于 TATA box 启动子的发现过程。"这种直觉一直难以构建到传统的生物学机器学习模型中。"
人类难以解决的问题¶
经质量控制后,4 个问题因格式不当被移除,剩余 23 个人类难以解决的问题。

图 2:人类无法解决的问题集上的准确率,每个问题 5 个 episode 的平均值。误差线通过问题内 bootstrap 抽样计算。
Claude Sonnet 4.6 及更强模型解决了相当比例的此类问题,Claude Mythos Preview 最高达到 30% 的解决率。
Claude 的策略¶
从 Opus 4.6 的记录中识别出两种主要策略。
策略一:"百科全书式"¶
Claude 的庞大知识库来自数十万篇论文,使其能解决人类需要进行荟萃分析或拼接多个数据库才能完成的任务。



失败案例:

策略二:"知道自己不知道"¶
当不确定时,Opus 4.6 尝试多种方法并选择多个方法收敛一致的答案。



Claude 自己对 AI 科学研究的分析¶
Claude Mythos Preview 被允许自行分析 BioMysteryBench 的结果。以下是其分析摘录:
The headline accuracy numbers tell you how often each model gets the right answer, but not how it gets there. I wanted to know whether a correct answer on a hard problem means the same thing as a correct answer on a solvable one. Since every problem was attempted five times, I could look at per-problem solve counts: if a model solves something 5/5 it has a reliable method; if it solves it 1/5 it probably got lucky on a reasoning path it can't consistently find again. So I broke each model's solved problems down by solve count (0/5 through 5/5) on the two sets side by side.

图 3:BioMysteryBench 上每题的解决一致性。每个模型对每道题尝试 5 次;柱状图显示解决 0、1、2、3、4 或 5 次(满 5 次中)的问题比例。在人类可解决集上(左),三个模型呈强双峰分布——问题几乎总是每次都解决或从不解决。在人类难解集上(右),分布中间填充了……
Claude 分析的关键数据¶
| 指标 | 人类可解决集 | 人类难解集 |
|---|---|---|
| Opus 4.6 已解决中 ≥4/5 可靠解决 | 86% | 44% |
| 脆弱胜利(1-2/5) | 9% | 44% |
| Sonnet 4.6 可靠率 | 75% | 22% |
| Sonnet 4.6 脆弱率 | 9% | 56% |
| Sonnet 4.6 总准确率 | 77.4% | 23.5% |
| Mythos ≥4/5 占可解决胜利比例 | 94% | — |
文章评价 Claude 的自我分析"增加了一些细微差别"但"没有从根本上探索新问题",感觉"有点……无聊。"
持续为科学基准测试 AI¶
文章提到了同时期的相关工作:Genentech 和 Roche 发布了 CompBioBench,包含 100 个计算生物学任务。结果显示:Claude Opus 4.6 总体达到 81%,在最难问题上达到 69%。