教学科研

首页 > 教学科研 > 正文

科学智能院AI4S交叉研究取得新进展|田永鸿、袁粒团队提出异质分子编码统一框架,打通分子理解与设计

2026-07-27科学智能学院

责编:王琳

前言

化学家认识一个分子,看的远不止一串字符:原子如何连接、分子呈现怎样的二维拓扑和三维构象、又包含哪些官能团与结构片段,都会影响其性质与功能。

然而,现有化学语言模型大多将分子表示为SMILES等一维字符串。这样的表示便于大语言模型处理,却难以完整呈现分子的多层次结构。如何让大模型更全面地“读懂”分子,并按照自然语言和多重条件设计目标分子,是人工智能赋能药物发现与材料设计面临的重要问题。

近日,北京大学深圳研究生院科学智能学院田永鸿、袁粒团队在人工智能驱动的分子理解与设计领域取得重要进展。团队提出异质分子编码框架(Heterogeneous Molecular Encoding,HME),将分子的一维序列、二维拓扑、三维几何和分子片段统一引入大语言模型;同时提出片段链机制(Chain-of-Fragment,CoF),引导模型先规划分子的关键片段,再生成完整结构。

相关研究以“Navigating chemical-linguistic sharing space with heterogeneous molecular encoding”为题,近期在线发表于《自然·通讯》(Nature Communications)。

图1 研究成果发表于Nature Communications

研究背景

近年来,研究人员尝试把SMILES、SELFIES等分子表示作为一种“化学语言”,借助大语言模型完成分子描述、性质预测和分子生成,为药物筛选、先导化合物优化和功能材料设计提供了新路径。

但分子并不是天然的一维对象。SMILES便于模型读取,但以线性序列编码原子连接,对书写和遍历方式较为敏感,且通常不显式呈现三维构象和高层结构单元;二维分子图和三维坐标各有所长,也各有局限。

以往的多模态方法多通过对比学习,将分子不同视图对齐到同一个相似性空间,在分子检索和属性预测中表现良好。但对于“理解自然语言指令,并生成同时满足多个性质与结构约束的新分子”这类复杂任务,还需要进一步的生成式建模能力。

为此,研究团队尝试建立一个端到端的统一框架,让大语言模型直接读取分子的多层次结构信息,并在同一模型中完成从分子到语言的理解、从语言和条件到分子的设计。

研究进展

01汇聚多层次信息,建立分子理解与设计的统一框架

HME从四个互补视角认识同一个分子:一维SMILES呈现分子序列,二维分子图描述原子与化学键的连接,三维坐标提供空间构象,分子片段则突出芳环、杂环和官能团等具有明确化学意义的结构单元。

面对不同编码形式和长度不一的原子特征,团队设计了查询学习模块,将二维、三维结构信息提取为大语言模型能够直接处理的“软标记”,并通过交叉注意力融合拓扑与几何信息。这样,分子结构和自然语言便能进入同一个自回归模型,分子描述、问答、性质预测和分子生成也由此被纳入统一框架内建模。此外,研究还探索了HME在基于蛋白结合口袋的分子设计任务中的应用。

图2 HME总体架构

02从结构到语言,让大模型更准确地“读懂”分子

在分子理解任务中,HME能够根据分子结构生成文字描述,回答有关分子功能与性质的问题,并通过自然语言预测分子量、LogP及量子化学性质等指标。

实验结果显示,HME在分子描述、通用问答和性质问答等任务中均表现良好。更换不同的大语言模型作为骨干后,这一框架仍能带来稳定增益,表明融合一维、二维、三维和片段信息,有助于大模型形成更加完整、稳健的分子认识。

图3 HME在分子描述、问答任务上的表现

03从“想要什么”到“生成什么”,实现多目标分子设计

真实的分子设计往往需要同时兼顾多项要求。例如,一个候选分子不仅要具有合适的脂溶性、类药性和合成可及性,还可能必须包含指定的官能团或核心骨架。HME将这些数值和结构要求统一写入自然语言提示,使模型能够同时响应性质目标与片段约束。

测试显示,随着目标条件变化,生成分子的性质分布会相应移动;指定的结构片段也能被纳入同时满足目标性质的完整分子。以一个、两个和三个片段作为约束时,生成分子完整包含所有指定片段的比例分别达到92.64%、78.84%和62.59%。模型还表现出一定的零样本组合泛化能力,能够对训练中未出现的条件数量或性质组合进行一定程度的泛化。

图4 HME在多目标分子设计任务上的可视化展示

04先规划片段、再生成结构,提升分子设计准确性

许多基于化学语言模型的方法直接按照SMILES标记逐步生成分子,生成序列较长时可能累积局部误差。团队由此提出片段链机制CoF:模型先预测目标分子应包含的关键结构片段,形成高层次的“化学蓝图”,再据此生成完整SMILES。

这种方式把高层结构规划与原子级生成衔接起来,使模型不再只是逐字符“拼写”分子,而是能学习片段之间以及片段与完整原子结构之间的统计关联。在文本引导的分子生成任务中,HME在各项指标中取得良好结果,精确匹配率达到0.334,Levenshtein距离降至14.25。消融实验显示,去除CoF后,多项分子生成指标出现下降,支持了片段规划机制的有效性。

图5 片段链机制的可视化展示

研究意义

该研究并非简单增加一种分子模态,而是改变了多模态分子建模的组织方式:不同结构视图不再只被映射到用于相似性比较的共享空间,而是被转换为大语言模型可以统一处理的标记,并通过自回归生成实现分子与语言之间的双向建模。

其中,将分子片段作为独立模态并引入词表,为模型利用官能团、环系等高层结构信息提供了新的载体;CoF机制则把高层结构规划和原子级生成衔接起来,为可交互、可控制的分子设计提供了新的技术方案。

目前,HME生成的分子仍以已知化学空间附近的渐进式衍生结构为主,更适合先导化合物优化和明确约束下的结构改造。未来,团队将进一步探索多构象集合、分子动力学轨迹、药效团与反应信息的融合,推动模型向新骨架发现、动态分子相互作用建模和更复杂的分子设计任务拓展。

作者信息

田永鸿教授和袁粒助理教授为共同通讯作者,博士生吕刘正浩和博士毕业生李昊为论文共同第一作者。

论文作者主要来自北京大学深圳研究生院科学智能学院、广东省科学智能计算重点实验室、信息工程学院,以及北京大学计算机学院北京市脑启发脉冲大模型重点实验室。

该项目获得广东省重大人才团队项目、广东省科学智能计算重点实验室、国家自然科学基金和中国博士后科学基金等基金和项目资助。

论文链接:

https://www.nature.com/articles/s41467-026-74666-w

论文信息:

Lv, L., Li, H., Wang, Y. et al. Navigating chemical-linguistic sharing space with heterogeneous molecular encoding.Nature Communications(2026).

DOI: 10.1038/s41467-026-74666-w

关闭