让 Claude 成为化学家¶
发布日期:2026-06-05
分类:Science
我们正在与世界级的合成化学家、计算化学家和分析化学家合作,让 Claude 更擅长化学。本文分享了这项工作的首个成果——Anthropic 化学家 David Kamber 研究了 Claude 在处理化学家最常见的分析输入——NMR 谱图方面的表现。
化学家的语言¶
化学家在不同表征之间来回切换,每种表征都编码着相同的底层化学信息,但要求不同的解读能力。 在工作中,化学家需要在白板上的手绘结构、仪器读数、数据库查询字符串,以及专利和出版物的技术标记之间自如切换。一个咖啡因的草图能让化学家发现它与腺苷——人体的困倦信号——的相似性,从而预测它通过阻断受体来保持清醒。然而,同一张草图无法帮助区分它与外观几乎相同的分子。
理解化学家正在处理的分子至关重要。化学是食品、药物、乳液、油漆和塑料等一切事物的基础。在相同原子之间重排少数几根键,葡萄糖就变成了果糖——分子式相同,却通过完全不同的代谢途径处理。将分子翻转为其镜像,镇静剂就变成了致畸剂,正如沙利度胺灾难中发生的那样。^1 化学家的日常工作依赖于在各种表征中正确解读这些信号。
在这些表征之间转换既耗时又不可能大规模跟进——CAS(最大的化学注册机构)目录中已有超过 2.9 亿种已披露物质,并且每天约增长 15,000 种新物质。
AI 非常适合承担这一研究负担,但在化学领域目前仍主要停留在愿景层面。 机器学习工具多年来一直被定位为能变革逆合成——从目标分子逆推到更简单的前体——反应预测和性质估算。但这些工具所需的数据一直难以获取——空值结果稀少、格式不一致、被付费墙锁定。逆合成就是一个典型案例——有能力的 AI 工具已存在多年,但采用并不均衡,普通学术界或小型实验室的化学家仍然不使用它们。
尽管如此,AI 的进步终于开始触及化学领域。今天的前沿模型具备多模态能力和显式推理能力。它们可以直接从期刊图片或手绘草图中读取化学结构,而不是依赖预先整理好的分子数据库。它们可以按实际发表的形式阅读方法章节的实验细节。它们可以逐步展示推理过程,让化学家能够审查输出。这些都没有消除数据问题,但改变了哪些问题尽管有数据缺乏仍然可以解决。
"Claude 开始实质性地辅助化学家进行日常的翻译、回忆和整合工作,作为他们专业判断的补充。"
Anthropic 团队计划持续扩展 Claude 的化学能力。今天发布了这一系列工作的首篇白皮书,聚焦化学家最常见的分析输入:NMR 谱图。
Claude 对比 ChemDraw:NMR 预测与结构解析¶
完整白皮书可在此处查阅。
几乎每一种小分子——药物、农药、染料、香料、聚合物、DNA 或蛋白质亚基、功能无机或固态材料——之所以存在,都是因为化学家确定了它的结构。鉴于这些分子无法用显微镜看到,化学家必须依靠光谱分析,用光、无线电波或磁场探测分子。分子吸收、发射或偏转能量的方式给化学家提供了一个模式(即谱图),从中可以解析其结构。
NMR 光谱是经典技术之一,也是合成化学中最耗时的步骤之一——对于每个化合物,化学家必须手动将谱图中的每个峰与所提出结构中的一个原子匹配。在这篇白皮书中,团队测试了 Claude 对比化学家当前依赖的专业 NMR 软件的表现。三个 Claude 模型(Opus 4.7、Opus 4.6、Sonnet 4.6)与 ChemDraw 和 MestReNova 在 20 个化合物上进行了对比测试,这些化合物来自模型训练截止日期之后发表的合成化学预印本,以避免选择偏差。ChemDraw 和 MestReNova 都做正向预测——利用绘制的结构模拟将产生什么 NMR 谱图。除正向预测外,团队还评估了 Claude 能否反向工作——从实验谱图出发推导背后的结构。这是更困难的任务,也是现有软件目前留给化学家自己做的工作。
评估设置¶
从 ChemRxiv 预印本中抽取 20 个化合物^2,涵盖四类结构骨架,每类考察不同类别的 NMR 挑战。 每个工具接收以 SMILES 字符串编码的结构,要求预测每个氢和碳峰在一维 NMR 谱图上的位置(以 ppm 为单位的化学位移)。每个工具被告知在化学家在发表论文中使用的溶剂中进行预测。

图 1. 正向预测评估涵盖的四类骨架结构。每类考察不同类别的 NMR 挑战。P1 氯吡嗪二嗪在 DMSO-d₆ 中氨基吡嗪上有慢交换 NH;P2 Boc-N-芳基马来酰亚胺和 N-Boc 炔酰胺涉及 α-乙烯基-酰亚胺羰基和罕见的炔酰胺 α/β-碳对;P3 螺酮是带有苯甲酰或乙酰悬挂基的螺双环酮,具有非对映异位 CH₂;P4 α-硅基甲磺酰胺具有屏蔽的硅-α 碳。每类五个化合物,n = 20。
由于语言模型的输出在不同运行之间有所变化,每个 Claude 模型每个化合物查询三次并取平均值;ChemDraw 和 MestReNova 每次返回相同答案,仅运行一次。每个预测峰与其实验对应值配对,测量 ppm 差距。这些落在化学家认为正确的窗口内——氢为 ±0.20 ppm,碳为 ±1.0 ppm。
正向预测结果¶

图 2. 正向预测中 20 个化合物的各工具 ¹H(左)和 ¹³C(右)化学位移误差的 MAE(深色)和 RMSE(浅色),下方显示覆盖率。Claude 柱:三次重复的均值,带最小-最大范围和叠加的重复点。经典工具:单点预测(无范围)。
关键发现:
| 指标 | Opus 4.7 | MestReNova | ChemDraw | Opus 4.6 | Sonnet 4.6 |
|---|---|---|---|---|---|
| ¹H MAE (ppm) | ±0.079(最优) | — | — | 中等 | 最弱 |
| ¹³C MAE (ppm) | ±1.37 | ±1.48 | — | — | — |
- 在氢谱上,Opus 4.7 最准确,平均误差 ±0.079 ppm——远低于容差窗口的一半——且落在窗口内的峰比例最高
- 在碳谱上,Opus 4.7 和 MestReNova 基本持平,分别为 ±1.37 和 ±1.48 ppm
- Opus 4.6 表现"可预见地居中",Sonnet 4.6 最弱
- 模型间差异在氯吡嗪二嗪家族中一个公认困难的 NH 质子上最为明显(真实位置:6.8–7.9 ppm)。Opus 4.7 预测略低但一致;Opus 4.6 猜测分散在数个 ppm 范围内;Sonnet 4.6 将其放在 10–13 范围

图 3. 上方:±0.20 ppm(¹H,左)和 ±1.0 ppm(¹³C,右)容差内的实验原子百分比。下方:各化合物胜率(20 个化合物中该工具具有最低 MAE 的化合物数)。Claude 柱:三次重复的均值,带最小-最大范围;经典工具:单点预测。
峰形和裂分模式:
| 指标 | Claude 模型 | ChemDraw/MestReNova |
|---|---|---|
| 实验报告裂分模式匹配率 | Opus 4.7 最高 | 较低 |
| 亚峰间距在半赫兹以内的比例 | 约 80%(三个 Claude 模型) | 26%–35% |
| 运行间一致性 | Opus 4.7 最佳:平均误差的运行间变化小于其与次优工具的差距 | — |
逆向预测(结构解析)¶
Opus 4.7 在 15 道结构解析题目上接受测试,每题查询三次,要求提出最多三个排序的候选结构。 每道题提供化合物的精确分子式(来自高分辨质谱)及其氢和碳 NMR 谱图。
| 题目类型 | 数量 | 提供的信息 | Opus 4.7 表现 |
|---|---|---|---|
| 较简单目标(单环或双片段分子) | 8 | 仅分子式和谱图 | 每次尝试均正确解析全部 8 个结构 |
| 较难目标(稠环、螺环等) | 7 | 谱图 + 一个额外提示(起始原料结构) | 4 个在全部 3 次运行中正确;其余 3 个在 3 次中有 2 次正确 |

图 4. 15 道逆向任务题目的结构解析结果。每个面板显示已发表的目标结构及其在 3 次尝试中的成功次数。边框颜色指示 prompt 条件:绿色仅提供谱图和 HRMS,无起始原料上下文;蓝色提供谱图、HRMS 和起始原料的 SMILES,无其他反应上下文。
总体结论:
"对于常规数据预测,Opus 4.7——一个没有经过化学特定微调的通用模型——在平均水平上现在已与 ChemDraw 和 MestReNova 持平或更优。"
Claude 还能反向解决问题——仅从 NMR 数据(化学家会粘贴到聊天中的同一份高分辨质谱和一维峰列表)提出结构推断,无需额外设置。
局限性¶
| 局限 | 说明 |
|---|---|
| 评估规模较小 | 正向任务 20 个化合物/四类骨架,逆向任务 15 个;结果应视为指示性而非精确 |
| 密集逆向目标 | 没有起始原料作为输入时,模型可能在推理中循环而不确定最终结构 |
| 未测试骨架 | 慢交换 NH 杂芳族仅通过氯吡嗪二嗪采样;相关体系(羟基吡啶、氨基噻唑、其他 DMSO-d₆ NH 活性骨架)未包含 |
| 2D 实验和立体化学超出范围 | COSY、HSQC、HMBC 未评估;复杂天然产物未评估 |
| 溶剂覆盖有限 | 仅测试 DMSO-d₆、CDCl₃ 和 D₂O;甲醇-d₄、苯-d₆ 和丙酮-d₆ 未评估 |
理想情况下,结果应在涵盖 20-30 类骨架、每类至少 15 个化合物的数百个化合物上进行验证。
展望¶
提升 Claude 化学能力的重点方向:
| 方向 | 说明 |
|---|---|
| 化学结构的读取和渲染 | 将图形、专利、幻灯片或草图中的化学结构转换为机器可读形式;在结构表征和系统命名之间转换 |
| 反应和合成推理 | 提出、评估和批判合成路线;预测反应结果;考虑选择性、条件和可能的副产物 |
| 机理 | 用电子箭头、中间体和过渡态论证解释和验证反应机理 |
| 化学文献理解 | 阅读以已发表形式出现的化学内容——同一分子可能被绘制、命名、缩写或用代码引用;从方法部分、补充信息和专利中提取相关化学信息 |
"这些方向并非都在同一成熟度曲线上。光谱分析已经足够成熟可以进行基准测试,而其他方面(如逆合成规划)仍在确定范围中。"
与我们合作¶
Anthropic 正在扩展科学 AI 项目以更明确地支持化学研究。研究人员可通过 [email protected] 或通过科学 AI 项目申请联系。
脚注¶
- 该事件中,一种孕期止吐药物与全球超过 10,000 名儿童的严重出生缺陷相关联。
- 抽取化合物的四篇预印本:
- https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002274/v1
- https://chemrxiv.org/doi/full/10.26434/chemrxiv-2025-59lfh
- https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002423/v1
- https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002316/v1