Anthropic:让Claude成为化学家

Anthropic:Research(发表成果 · 网页)·2026-06-05 00:00·81天前
AI 导读

Anthropic与顶尖化学家合作,提升Claude在化学领域的实用性。首个白皮书测试Claude在NMR谱图分析上的表现:在20个化合物上,对比Claude Opus 4.7、Opus 4.6、Sonnet 4.6与ChemDraw、MestReNova的正向预测(从结构预测谱图)和反向结构解析(从实验谱图推断结构)能力。所有化合物选自模型训练截止日期后发布的ChemRxiv预印本,以避免选择偏差。

Anthropic:Research(发表成果 · 网页)
精选
65AI 编辑部评分,满分 100

Anthropic:让Claude成为化学家

2026-06-05 00:00· 81天前
AI 导读

Anthropic与顶尖化学家合作,提升Claude在化学领域的实用性。首个白皮书测试Claude在NMR谱图分析上的表现:在20个化合物上,对比Claude Opus 4.7、Opus 4.6、Sonnet 4.6与ChemDraw、MestReNova的正向预测(从结构预测谱图)和反向结构解析(从实验谱图推断结构)能力。所有化合物选自模型训练截止日期后发布的ChemRxiv预印本,以避免选择偏差。

推荐理由

化学家可能几年后回头看会记起这篇,Claude Opus 4.7 在 NMR 预测上追平了 ChemDraw,还顺手做了反向结构解析——专业软件不干的事,它用更接近人类日常输入的方式做到了。

正文 · AI 翻译
Making Claude a chemist

我们正与世界一流的合成化学家、计算化学家和分析化学家合作,让 Claude 在化学领域表现更出色。在这篇文章中,我们将分享这项工作的初步成果——Anthropic 化学家 David Kamber 研究了 Claude 如何处理化学家最常用的分析输入:核磁共振波谱。在处理分子时,化学家需要在白板上的手绘结构、仪器读数、数据库查询字符串以及专利和出版物中的技术符号之间切换。每种表示方式都编码了相同的底层化学信息,但每种都需要不同的熟练度。例如,咖啡因的草图能让化学家发现它与腺苷(人体困倦信号)的相似性,并预测它通过阻断受体来让我们保持清醒。然而,同样的草图却无法帮助化学家将其与其他外观几乎相同的分子区分开来。

理解化学家正在处理的是哪种分子至关重要。化学支撑着一切,从我们摄入的食物和药物,到我们的乳液、油漆和塑料。在相同的原子之间重新排列几个化学键,葡萄糖就会变成果糖——这两种分子共享相同的化学式,但通过完全不同的代谢途径被处理。将一个分子翻转成它的镜像,镇静剂就会变成致畸剂,正如沙利度胺灾难中所发生的那样。化学家的日常工作依赖于在适合特定任务的任何表示方式中正确解读这些信号。

在这些表示方式之间进行转换(从图中找出结构、将仪器读数与预期产物进行比对、以正确的符号查询数据库)既耗时,又无法大规模持续跟上——CAS(最大的化学物质注册库)收录了超过 2.9 亿种已公开的物质,并且每天新增约 15,000 种。

人工智能完全有能力承担这一研究负担,但在化学领域,这很大程度上仍停留在理想层面。多年来,机器学习工具一直被视为逆合成分析(即从目标分子逆向推导出更简单的前体,以规划其合成路径)、反应预测和性质评估等领域的变革性力量,但这些工具所需的数据却难以获取——数据在无效结果方面稀疏、格式不统一,并且被锁定在订阅制期刊的付费墙之后(以及非结构化的支撑信息中)。逆合成分析就是一个典型例子——功能强大的 AI 工具已存在多年,但应用并不均衡,普通学术机构或小型实验室的化学家仍然很少使用它们。

即便如此,人工智能的进步终于开始触及化学领域。当今的前沿模型是多模态的,并且具备显式推理能力。它们可以直接从期刊图表或手绘草图中读取化学结构,而无需依赖预先整理的分子数据库。它们还能以实际发表的形式,读取方法部分或支撑信息中的实验细节。此外,它们可以逐步展示推理过程,这意味着化学家能够审核其输出结果。这些进展都无法消除该领域多年来一直描述的数据问题,但它们改变了在数据问题存在的情况下哪些问题变得可解。归根结底,我们的主张是适度的:Claude 已开始有意义地协助化学家完成日常的翻译、回忆和整合工作,这些工作是对他们专业判断的补充,并且我们计划持续扩展其辅助能力。今天,我们发布了第一份白皮书,旨在加速这项工作。它处理的是化学家最常用的分析输入:核磁共振波谱。

Claude 与 ChemDraw 在核磁共振波谱预测和结构解析方面的对比

完整版本可在此处查阅

几乎所有小分子——药物、农药、染料、香料、聚合物、DNA或蛋白质亚基,以及功能性无机或固态材料——之所以存在,都是因为化学家确定了它们的结构。由于这些分子无法用显微镜观察,化学家必须依赖光谱分析,用光、无线电波或磁场来探测分子。给定分子吸收、发射或偏转这种能量的方式,会为化学家提供一种模式,即光谱,他们可以借此阐明其结构。核磁共振波谱学——化学家为此依赖的经典技术之一——是合成化学中最耗时的步骤之一;对于每一种化合物,化学家都必须手动将光谱中的每个峰与所提出结构中的某个原子进行匹配。在本白皮书中,我们测试了 Claude 与当今化学家依赖的专用 NMR 软件相比表现如何。我们在 20 种化合物上测量了三个 Claude 模型(Opus 4.7、Opus 4.6、Sonnet 4.6),与 ChemDraw 和 MestReNova 进行对比,这些化合物选自模型训练截止日期之后发表的合成化学预印本,以避免选择偏差。ChemDraw 和 MestReNova 都进行正向预测,利用绘制的结构来模拟将产生的 NMR 谱图。除了正向预测,我们还希望看看 Claude 能否反向操作——从实验谱图出发,提出其背后的结构。这是更困难的任务,也是现有软件目前留给化学家去完成的工作。为建立评估,我们从模型训练截止日期后发布的 ChemRxiv 预印本中选取了 20 种化合物,从每篇论文中提取了首批完全表征的新分子。这 20 种化合物涵盖四个结构家族,每个家族五种化合物,选择每个家族是因为它涉及不同类型的 NMR 挑战。每个工具都获得了以 SMILES 字符串(化学家用来将分子输入软件的行文本表示法)编码的结构,并被要求预测每个氢和碳峰在 1D NMR 谱图(以 ppm 为单位测量化学位移的水平轴)上的落点。由于 NMR 样品溶解在液体中,并且溶剂(氯仿、DMSO 等)的选择会略微移动峰的位置,因此每个工具都被要求根据化学家在已发表论文中使用的溶剂来预测谱图。

A graph of the four scaffold classes
图 1. 正向预测评估涵盖的四类骨架结构。每类骨架针对不同类别的核磁共振挑战进行测试。P1 氯代吡哒嗪在 DMSO-d₆ 中具有氨基吡哒嗪上的慢交换 NH;P2 Boc-N-芳基马来酰亚胺和 N-Boc 炔酰胺涉及 α-乙烯基酰亚胺羰基以及罕见的炔酰胺 α/β 碳对;P3 螺环酮是带有苯甲酰甲基或乙酰基侧链及非对映异位 CH₂ 的螺双环酮;P4 α-硅基甲磺酰胺具有受屏蔽的硅-α 碳。每类五种化合物,总计 n = 20。

由于语言模型的输出在不同运行间存在差异,每个 Claude 模型对每种化合物均查询三次并取平均值;ChemDraw 和 MestReNova 每次返回相同结果,因此各运行一次。随后我们将每个预测峰与其实验对应峰配对,并测量 ppm 差值。这些差值均落在化学家认为正确的范围内——氢谱为 ±0.20 ppm,碳谱为 ±1.0 ppm。

A graphic depicting the per-tool MAE/RMSE summary across 20 compounds
图 2. 针对 20 种化合物正向预测的 ¹H(左)和 ¹³C(右)位移误差,各工具的 MAE(深色)和 RMSE(浅色),每项工具下方标注了覆盖率。Claude 柱状图:三次重复实验的均值,附最小–最大范围及叠加的重复实验数据点。经典工具:单点预测(无范围)。

在氢谱方面,Opus 4.7 最为准确,平均误差为 ±0.079 ppm——远低于容差窗口的一半——且落在该窗口内的峰占比最高。在碳谱方面,Opus 4.7 与 MestReNova 基本持平,误差分别为 ±1.37 和 ±1.48 ppm;其余工具在两种元素上保持相同的排名顺序。Opus 4.6 表现中规中矩,而 Sonnet 4.6 最弱。两者之间的差距在一个公认极难测定的氢原子上最为明显——即氯代吡哒嗪家族中的 NH 质子,其真实位置落在 6.8 至 7.9 ppm 的狭窄区间内。Opus 4.7 的预测值略低但始终一致;Opus 4.6 的猜测分散在数个 ppm 范围内;Sonnet 4.6 则将其置于 10–13 区间,远高于其实际出现位置。

A chart depicting within-tolerance accuracy per compound
图 3. 上方:实验原子在 ±0.20 ppm(¹H,左)和 ±1.0 ppm(¹³C,右)范围内的百分比。下方:每个化合物的胜率(在 20 个化合物中,该工具对每个化合物的 MAE 最低的化合物占比)。Claude 柱状图:三次重复实验的均值,附最小–最大范围;经典工具:单点预测。

虽然 Opus 4.7 的表现与 ChemDraw 和 MestReNova 相当,但在预测氢的 NMR 峰形状以及峰间距方面,差距更大——这些特征同样包含化学家除峰位外会读取的结构信息。Opus 4.7 匹配实验报告裂分模式的频率高于其他任何工具,并且所有三个 Claude 模型在约 80% 的情况下能将子峰间距预测精确到半赫兹以内——而 ChemDraw 和 MestReNova 的这一比例仅为 26% 到 35%。Opus 4.7 在三次重复运行中也最为稳定:其平均误差在不同运行之间的波动幅度,甚至小于它与次优工具之间的差距。在此基础上,我们评估了反向预测(结构解析):能否从谱图中确定分子的结构?我们向 Opus 4.7 提出了 15 个解析问题,每个问题重复三次,要求它提出最多三个按排序的候选结构。每次提供该化合物的精确分子式(来自高分辨质谱)及其氢谱和碳谱 NMR。这 15 个问题按难度划分。八个较简单的目标——单环或双片段分子——仅提供分子式和谱图。七个较复杂的目标——稠环、螺环等——附带一个额外提示:参与反应的起始原料的结构。

Chart showing the structure elucidation
图 4. 15 个反向任务问题的结构解析结果。每个面板显示已发表的目标结构及其在 3 次尝试中的成功次数。边框颜色表示提示条件:绿色表示仅提供谱图和高分辨质谱,无起始原料背景信息;蓝色表示提供谱图、高分辨质谱以及起始原料的 SMILES,无其他反应背景信息。

Opus 4.7 仅凭光谱和分子式,在每次尝试中都成功恢复了全部八个较简单的结构。对于七个较难的目标,在给出起始原料提示的情况下,它在其中四个目标的三次运行中均返回了正确结构,在其余目标的三次运行中有两次返回了正确结构。最终,我们发现,对于常规数据预测,Opus 4.7——一个未经化学领域特定微调的通用模型——现在平均而言已与 ChemDraw 和 MestReNova 相当或更优。此外,Claude 还能反向工作,仅凭核磁共振数据提出结构。专用的结构解析软件已存在数十年,但通常需要二维核磁共振(一种具有两个轴的光谱,输出是等高线图而非一排峰)、专业培训和授权工具。而 Claude 仅凭化学家粘贴到聊天窗口中的相同高分辨质谱和一维峰列表即可完成,无需任何设置。

局限性

这项评估表明,通用模型可以与核磁共振软件竞争,甚至能使一维反向解析变得可行。但仍存在一些值得注意的局限性。

  • 首先,评估规模较小——正向任务涉及四个骨架的 20 种化合物,反向任务涉及 15 种化合物——且每个骨架仅贡献单一类别的失败模式。因此,模型性能应被视为指示性而非精确性。
  • 其次,对于最密集的反向目标,如果没有起始原料作为额外输入,模型可能会在推理过程中循环,而无法确定最终结构;这就是为什么七个较难的问题在提出时附带了起始原料结构,而非仅凭光谱。
  • 第三,某些化学骨架未经测试。例如,慢交换 NH 杂芳烃(其 N–H 与溶剂交换速度足够慢,从而在核磁共振中留下尖锐峰的芳香环)仅通过氯哒嗪进行了采样,排除了相关体系(羟基吡啶、氨基噻唑以及其他 DMSO-d₆ 中具有 NH 活性的骨架)。
  • 第四,二维实验(COSY、HSQC、HMBC)和立体化学问题在设计上被排除在外,因为仅凭一维核磁共振无法确定构型。因此,复杂的天然产物化合物未纳入评估。
  • 最后,我们的溶剂覆盖范围仅限于 DMSO-d₆、CDCl₃ 和 D₂O,因此甲醇-d₄、苯-d₆ 和丙酮-d₆ 未进行评估。

理想情况下,我们希望看到这些数据在横跨 20 到 30 种骨架类别的数百种化合物上的表现,每个类别至少包含 15 种化合物,以便将类别内的差异与不同工具间的差异区分开来。我们还会评估氯哒嗪之外的含 NH 活性杂芳烃,评估未测试的溶剂,并开展利用二维实验的两种任务版本。

未来展望

在我们持续提升 Claude 在化学领域性能的过程中,我们特别聚焦于几个最拖慢化学家工作效率的瓶颈问题。

  • 化学结构的读取与呈现——将来自图表、专利、幻灯片或手绘草图中的结构式转换为机器可读的形式,并在结构式表示与化学文献中使用的系统命名之间进行转换。
  • 反应与合成推理——提出、评估和评判合成路线,预测反应结果,并思考选择性、反应条件以及可能的副产物。
  • 机理——以化学家实际使用的语言(包括电子箭头、中间体和过渡态论证)来解释和检验反应机理。
  • 化学文献理解——阅读已发表作品中的化学内容,其中同一分子可能以结构式、名称、缩写或代码形式出现,并从方法部分、补充信息和专利中提取出关键化学信息。

这些方面并非都处于相同的成熟度曲线上。光谱分析已经足够成熟可以进行基准测试,而其他方面,如逆合成规划,仍处于范围界定阶段。随着我们对这些瓶颈问题有了更深入的了解,我们将分享当前模型在哪些方面表现出色,以及在哪些方面仍有不足。我们的最终目标是确保一线化学家知道 Claude 能在哪些方面为他们节省时间,以及在哪些方面他们仍需依赖自身的专业知识。

与我们合作

我们正在扩展“AI 助力科学”项目,以更明确地支持化学研究。如果您是正在研究某个问题、且 Claude 有可能提供帮助的研究人员,尤其是涉及我们描述的那类多模态推理的问题,我们期待您通过 scienceblog@anthropic.com 或“AI 助力科学”申请页面与我们联系。

脚注

  1. 一起与一种孕期止吐药物相关、在全球导致超过一万名儿童出现严重出生缺陷的事件。
  2. 我们从中提取化合物的四篇预印本:https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002274/v1,https://chemrxiv.org/doi/full/10.26434/chemrxiv-2025-59lfh,https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002423/v1,https://chemrxiv.org/doi/full/10.26434/chemrxiv.15002316/v1。

加拿大如何使用 Claude:来自 Anthropic 经济指数的发现

Claude 在不同模型和语言中的价值观