学术科研

化学与分子工程学院来鲁华团队发展了基于大语言模型的可合成分子精准编辑方法SynCraft

发布时间:2026/09/30 信息来源:化学与分子工程学院 编辑:青苗 责编:燕元

人工智能技术在药物研发中发挥了越来越重要的作用,在药物研发的早期阶段生成式AI模型可以生成可能具有预设性质的大量全新化合物,为加速研发过程提供了新的途径。然而,虽然生成式AI模型可以产生大量具有多样性结构及高预测活性的新分子,但也常面临生成分子无法在现实实验室合成出来的难题,例如生成的分子包含不稳定片段、难以构建的环系或复杂的手性中心等,生成分子难以合成的问题已成为AI药物研发领域的主要瓶颈之一。如果直接剔除这些难合成的分子,有可能错过有价值的设计;而如果只允许模型使用数量有限的预设反应和原料,又会限制其能够探索的化学空间。事实上,改变难合成化合物中的一个原子或一根化学键,就有可能找到新的合成途径。北京大学化学与分子工程学院、定量生物学中心、北大-清华生命科学联合中心及北京大学成都前沿生物技术研究院来鲁华教授团队发展了基于大语言模型的可合成分子精准编辑方法SynCraft,针对化学结构相近、合成难度却明显不同的“合成悬崖”进行有针对性的修改,在尽可能保留原分子主要结构的同时为难以合成的候选化合物寻找替代方案。相关工作2026年9月23日在线发表在Nature Machine Intelligence上。

为了解决直接让大模型改写表示整个分子SMILES字符串容易出现语法错误或改动原本想保留结构的问题,SynCraft先给模型提供成对相似分子的改造案例,要求其分析难合成的原因,并明确列出“删除哪个原子”或“在哪两个原子之间加键”等具体的编辑指令。在此基础上利用常用的化学软件如RDKit按原子编号执行修改并生成改造后的分子;再应用化合物逆合成软件,如该团队所发展的SimpRetro(Li J et al., J. Chem. Inf. Mod. 2024, 64, 5470),搜索从可购买原料出发的合成路线。这一过程无需重新训练大模型。在Pocket2Mol和ResGen生成的两组测试分子上,使用Gemini-2.5-Pro模型SynCraft找到结构相似度大于0.6且通过同一逆合成检验的类似分子的成功率分别为28.4%和29.1%,远高于已报道的最佳对照方法(15.4%和22.0%)。使用GPT和DeepSeek等不同系列的大模型也取得了相似或更好的结果。

图1 SynCraft的工作流程。系统先检索相似的改造案例,再由大模型提出具体的编辑指令,化学软件据此生成新结构。蛋白质与分子的相互作用信息也可作为修改时的参考(取自论文图1)

在将分子改得容易合成的同时,还需要保持其与靶标蛋白的结合能力。为此,SynCraft将分子对接分析得到的氢键、疏水接触等信息提供给大模型,作为修改分子时的参考。在一个RIPK1候选分子的改造例子中,SynCraft将中间的稠合环系换成2,4-二取代嘧啶环,保留了两侧的主要分子片段。改造后的分子可以由逆合成软件给出可行的候选合成路线。分子对接计算分析表明改造后的分子仍保留了部分原有的氢键和疏水接触,对接打分变化不大。在42个此前未进行合成的RIPK1抑制剂候选生成化合物中,81%的化合物至少有一个修改方案保留了原分子一半以上的预测相互作用。这些计算结果为后续实验筛选提供了可能的方案。

为了方便用户使用,研究团队还将SynCraft做成可供其他程序和智能体调用的工具(Skills),输入分子及靶标蛋白结构,就能依次完成编辑、合成路线搜索和改造后分子的分子对接计算。

北京大学化学与分子工程学院博士生李隽仁为论文第一作者,来鲁华为通讯作者。相关研究得到国家自然科学基金(22237002,T2321001)、中国医学科学院医学与健康科技创新工程项目(2021-I2M-5-014)等的支持。相关代码、数据与复现流程已公开,见https://github.com/catalystforyou/SynCraft-Core。

图2 RIPK1候选分子的骨架修改。左上方为修改前后的结构,右上方为重新对接后的叠合图,下方为预测的逆合成路线。绿色和品红色棒状结构分别代表原分子和修改后的分子(节选自论文图4b)

转载本网文章请注明出处

新闻热线:010-62756381

邮箱:news@pku.edu.cn

版权所有 ©党委宣传部(融媒体中心)

地址:北京市海淀区颐和园路5号 邮编:100871

版权所有 ©党委宣传部(融媒体中心)

地址:北京市海淀区颐和园路5号 邮编:100871

新闻热线:010-62756381

邮箱:news@pku.edu.cn