成都生物所周燕团队在分子表示学习与碰撞截面预测方面获新进展
来源:生物资源利用中心 作者:申生财 时间:2026-07-22

分子表示学习是人工智能理解化学结构和开展分子性质预测的重要基础,其表征质量直接影响模型的预测能力。现有部分分子预训练方法依赖三维构象信息,虽然能够增强模型的空间结构感知能力,但需要额外进行构象生成和三维建模,计算成本较高;另一些方法通过引入自然语言或生物医学知识进行跨模态学习,也可能带来额外的信息噪声和模态依赖。而基于单一SMILES的序列建模虽然具有良好的计算效率和可扩展性,但在充分表征复杂分子结构信息方面仍存在一定局限。

基于此,中国科学院成都生物研究所周燕团队提出了一种基于SMILES–InChI双视图化学语言对齐的分子表示学习框架ClipMol。该方法无需显式三维构象和外部语料,仅利用同一分子的SMILES和InChI两种互补化学表示,通过动态SMILES随机化构建拓扑保持的多视图,并采用双编码器双向对比学习,使模型能够学习不同化学表达方式之间一致的结构信息。同时,研究设计了结合LSTM全局特征提取、多尺度CNN局部特征提取和门控融合机制的混合编码器,自适应整合分子的全局拓扑信息与局部化学结构特征。

研究人员首先在MoleculeNet十项分子分类和回归任务上对ClipMol进行了评价。结果表明,其大规模预训练版本ClipMol-XL在多项任务中取得最优或具有竞争力的性能,显示出良好的分子表示迁移能力。进一步将ClipMol应用于离子迁移-质谱(IM-MS)中的碰撞截面(CCS)预测,在METLIN-CCS和ALLCCS两个独立数据集上均表现出稳定的预测性能。其中,ClipMol-XL在METLIN-CCS上的R²为0.911、RMSE为4.899 Ų、MedARE为1.345%;在ALLCCS上的R²达到0.995、RMSE为4.319 Ų、MedARE为0.877%,并在不同加合离子和多种化学类别中保持较好的预测一致性。值得注意的是,在冻结预训练编码器、仅训练下游回归模型的情况下,模型R²仍达到0.876,表明预训练获得的分子表示本身已包含丰富的CCS相关结构信息。

该研究表明,SMILES与InChI双视图化学语言对齐为分子表示学习提供了一种兼顾结构保真性、计算可扩展性和任务迁移能力的新策略,并为离子迁移-质谱相关CCS预测及其他分析化学任务提供了有效的分子表示基础。

上述相关研究以“ClipMol: A Molecular Representation Learning Framework for CCS Prediction via SMILES–InChI Dual-View Chemical Language Alignment”为题发表于分析化学领域顶级期刊Analytical Chemistry。中国科学院成都生物研究所博士生申生财为论文第一作者,周燕研究员和夏兵正高级工程师为共同通讯作者。该研究得到中国科学院科研仪器设备研制项目和国家自然科学基金支持。

原文链接:https://pubs.acs.org/doi/10.1021/acs.analchem.6c03104



 

附件: