教学科研

首页 > 教学科研 > 正文

从预测到执行,从谱图到结构——北大莫凡洋团队与合作者研究成果在《美国化学会志》和《德国应用化学》连续发表物理AI驱动的化学研究新成果

2026-10-01科研处

作者:莫凡洋课题组  |   责编:王琳

一个在合成化学领域正在发生的研究范式转折

过去几年,AI在化学领域的角色主要是“预测”——预测性质、预测反应、预测谱图。但预测的价值是有限的:一个分子被预测出来之后,化学家仍然需要面对合成、分离、纯化、结构确认这一系列漫长而高度依赖经验的实验操作。真正让AI产生变革性力量的,不是预测得更准,而是预测之后能执行、执行之后能反馈、反馈之后能修正。物理AI作为一个术语,在2025-2026年间正在快速获得关注和共识,2026年被业界公认为“物理AI元年”。其核心命题是:将AI的认知能力与机器人系统的物理操作能力深度耦合,使化学研究从“人做实验、AI辅助分析”走向“AI规划实验、机器人执行实验、实验数据反馈修正AI”的闭环范式。在这一转型的浪潮中,北京大学深圳研究生院科学智能学院莫凡洋团队与合作者近期在《美国化学会志》和《德国应用化学》上发表的两项工作,恰好代表了这一转折的两个关键侧面。

五年积累:从“可计算”到“可执行”的清晰脉络

北京大学深圳研究生院科学智能学院、材料科学与工程学院莫凡洋团队在合成化学领域的一个核心学术判断是:化学中最基础、最频繁、最依赖隐性经验的操作环节——分离纯化与结构鉴定——恰恰是AI最能产生结构性变革的环节。近五年来,团队围绕分离纯化与结构鉴定,持续推进人工智能与合成化学交叉研究。在分离纯化方面,团队建立自动化色谱实验平台,发展薄层色谱行为预测(Chem,2022)、高效液相色谱(HPLC)手性分离保留时间预测(Nature Communications,2023)和柱色谱分离建模方法(Chem,2025),并建立薄层色谱Rf值与柱色谱洗脱体积之间的显式定量关系(Nature Communications,2025),将实验经验转化为可计算的模型。至此,团队建立了从数据采集到模型预测再到实验自动化的完整链条。2026年在Accounts of Chemical Research上发表的综述,是对这一阶段工作的系统总结,但更重要的意义在于它为下一步的跨越做了清晰的学术铺垫:当预测已经足够可靠时,执行就成为下一个必须回答的问题。

在谱学与结构解析方面,团队发展了电子圆二色光谱预测模型ECDFormer(Nature Computational Science,2025)、红外光谱及羰基特征峰预测方法(Analytical Chemistry,2024;Precision Chemistry,2026),并提出融合质谱结构预测与谱图重建的Cycle-MS框架(Journal of Chemical Information and Modeling,2026)。这一系列工作的共同逻辑是:将结构鉴定的每一步“证据推理”转化为可计算、可组合的模型模块。

以上工作都停留在同一个边界之内:它们都在“计算”的领域内运作,输出的是预测结果,而不是实验操作。边界之外是什么?是化学家面对的真实世界——需要称量、上样、展开、刮取、洗脱、测谱。团队与合作者近期在智能化学领域的两项新成果,正是跨越这条边界的尝试。

两项成果分别于2026年9月29日和9月11日在线发表于《美国化学会志》(Journal of the American Chemical Society)和《德国应用化学》(Angewandte Chemie International Edition)。研究分别面向分离纯化和分子结构鉴定,进一步将人工智能用于实验执行与化学结构推断。

智能体协同机器人完成分离纯化

图1 PLANAR智能纯化系统研究发表于JACS

科学问题的凝练。制备薄层色谱(pTLC)的自动化,表面上看是一个工程问题,实则不然。pTLC的操作流程中隐含着一系列相互耦合的判断:选择什么展开剂体系?展开后目标色带出现在什么位置?色带的宽度是否意味着目标组分与杂质能够有效分离?刮取时如何避免相邻色带的交叉污染?这些问题在人工操作中由化学家的经验直觉来回答,而这种直觉恰恰是自动化系统最难复制的。更根本的困难在于:pTLC过程中的信息是动态产生的——展开图像只有在展开完成后才能获得,而刮取决策必须在图像分析之后做出。这意味着自动化系统必须同时具备“规划能力”(在操作前选择条件)和“反应能力”(在操作中根据观测调整方案)。

PLANAR的突破性。莫凡洋团队开发了由大语言模型进行推理与编排的制备薄层色谱智能纯化系统PLANAR。首次在制备薄层色谱这一经典但长期被自动化忽视的纯化方法上实现了“智能体规划—机器人执行—视觉反馈—动态修正”的端到端闭环。

在PLANAR中,科学智能体理解自然语言、分子结构和反应图像等输入,调用色谱预测与图像分析工具组织纯化方案;六轴机器人串联上样、展开、紫外成像、刮取和洗脱等操作。系统根据实际展开图像识别目标色带,将其边界转换为机器人可执行的刮取路径,再回收目标组分。关键方案及涉及破坏性操作的步骤保留人工审核,使决策依据和执行过程可检查、可追溯。

为帮助选择展开条件,团队还开发了两阶段预测模型A2P-Cascade,将分析型薄层色谱信息与上样量等因素结合,预测制备色带的位置和宽度,为判断组分能否有效分离提供量化参考。这一模型的科学价值在于,它将pTLC从一种“凭经验判断”的操作,转化为一个具有可预测性的物理过程。当预测的色带宽度与目标组分的分离需求被同时纳入考量时,纯化方案的选择就不再依赖试错,而是可以在操作前被定量评估。研究通过三个代表性案例验证了流程可行性,均获得经核磁共振表征确认的目标产物。在其中一个案例中,系统通过图像复核发现相邻色带被误合并,并在刮取前修正分割结果,展示了利用实验反馈纠正操作规划的能力。

图2 PLANAR目标导向纯化循环的操作流程。

通过将智能体的任务规划、机器人的实际操作与实验观测反馈相衔接,PLANAR探索了物理AI在化学分离纯化中的应用,同时,通过与天然产物合成团队进行合作,也证明了PLANAR的反馈与决策修正机制能够在复杂天然产物合成中间体这一真实认知负荷下实现有效运作。系统保留的标准化实验记录,也为后续模型更新和经验复用提供了依据。

PLANAR工作的深层意义,不在于“用机器人做了pTLC”,而在于它验证了一条技术路径:大语言模型的推理能力与机器人系统的执行能力,可以在化学实验的“非结构化操作场景”中形成有效的协同。pTLC之所以长期未被自动化,恰恰是因为它的操作高度依赖现场判断——展开条件需要根据样品性质调整,色带位置需要根据图像动态识别,刮取路径需要根据实际分离效果规划。这种“非结构化”特征使得传统的固定程序自动化方案无法胜任。PLANAR通过引入大语言模型作为“决策层”,将化学家的隐性判断显性化、可计算化,从而打通了从认知到执行的链条。

北京大学深圳研究生院科学智能学院博士生蔡文迪、材料科学与工程学院博士生赵博轩、新材料学院博士生乐岩松为论文共同第一作者,中化数智朱杰、莫凡洋为共同通讯作者。

融合多模态谱学证据推断分子结构

图3 多模态谱学驱动的分子结构解析研究发表于Angew

有机分子的结构解析面临一个根本性的认识论难题:核磁共振、质谱、红外及紫外可见光谱分别反映原子连接、元素组成、官能团和电子环境等不同维度的信息,但没有任何单一谱图能唯一确定一个分子的结构。化学家的实际工作方式是综合多种证据,反复提出和检验结构假设——这是一种典型的“假设-验证”循环,而非一次性的映射。将这一过程转化为计算方法,面临两个核心困难:一是“结构-谱图”配对数据的稀缺性,高质量的实验多模态谱图数据远比分子结构数据难以获取;二是组合空间的爆炸性,从谱图特征到分子结构的映射本质上是一个高度多对多的问题。

围绕以上科学问题,莫凡洋团队与科学智能学院袁粒、韩国蔚山科学技术院Bartosz A. Grzybowski等团队合作,提出“先提出假设、再约束修正”的两阶段学习框架。核磁共振、质谱、红外和紫外可见光谱分别提供分子结构的不同线索,研究尝试将化学家综合证据、提出并修正结构假设的过程转化为可扩展的计算方法。

第一阶段,SpectroMol模型融合多种谱学信息,生成候选分子结构;第二阶段,MS-Mol2Mol模型利用高分辨质谱提供的分子式、精确质量和不饱和度等组成约束,对候选结构进行修正。后者利用ZINC20数据库中的4亿个分子进行预训练,学习分子结构的统计规律,使相对稀缺的结构与谱图配对数据能够与大规模分子结构知识相互补充。

这一设计背后的学术洞察是深刻的:“从谱图到结构”的任务本质上不是一个纯粹的预测问题,而是一个推理问题。 预测问题假设存在一个明确的映射函数,推理问题则承认需要在假设空间中搜索和修正。将任务拆分为“生成候选假设”和“利用约束修正假设”,实际上模拟了化学家结构解析的认知过程,同时使有限的数据资源能够被最有效地利用——稀缺的配对数据用于训练假设生成,大规模的纯结构数据用于训练约束修正。

在QM9SPIN模拟基准上,使用完整多模态输入时,SpectroMol的首选结构准确率达到93.8%。研究进一步利用从SDBS数据库整理的约1万个分子的实验数据开展适配,并在常规氢核磁共振、碳核磁共振和高分辨质谱数据上验证了迁移学习与结构修正的可行性。这一框架为人工智能辅助结构鉴定提供了方法基础,也为高通量实验中的产物分析带来新的思路。

图4 实验数据微调的结构预测表现。

北京大学材料科学与工程学院博士生刘丞军、计算机学院博士生晏志远为论文共同第一作者,袁粒、Bartosz A. Grzybowski、莫凡洋为共同通讯作者。

两项工作的内在统一:物理AI的图景

两项研究从实验操作和谱学证据解析两方面推进智能化学研究,为未来衔接产物纯化、结构鉴定与实验反馈奠定基础。团队选择了一条“从最基础的化学操作入手,用AI重构其认知基础和执行方式”的路径。这条路径不在已经高度数字化的领域(如计算化学、分子生成)中做增量改进,而是深入化学实验室中最依赖隐性经验、最难以数字化的环节——分离和鉴定——致力于解决长期被“工程化不足”所掩盖的科学问题。

论文信息

1. Agentic Preparative Thin-Layer Chromatography System for Autonomous Purification

Journal of the American Chemical Society,2026年9月29日在线发表。

DOI:10.1021/jacs.6c10800

2. Hypothesis-and-Refinement Learning of Organic Structures From Multimodal Spectroscopic Data

Angewandte Chemie International Edition,2026年9月11日在线发表。

DOI:10.1002/anie.9212238

上述两项研究得到新一代人工智能国家科技重大专项、国家自然科学基金青年科学基金项目(A类)及面上项目等资助,并获得北京大学深圳研究生院、深圳市政府和北京大学高性能计算平台等支持。其中,PLANAR研究还获得中化数智科技有限公司支持,分子结构解析研究还获得韩国基础科学研究院支持。


【关闭】