本文提供了一种方法,该方法采用不同的分子表征方式来展示和分析天然化合物数据集的化学空间,重点应用于药物发现相关领域。
方法文章
本文提供了一种方法,该方法采用不同的分子表征方式来展示和分析天然化合物数据集的化学空间,重点应用于药物发现相关领域。
化学空间是一个多维描述符空间,涵盖了所有可能的分子,据估计,分子量低于500 Da的有机化合物中,约有1 × 1060种可能与药物发现相关。天然产物是过去四十年来上市新药的主要来源,并且仍然是创制创新药物最具成效的来源之一。基于化学信息学的计算工具可加速天然产物的药物研发进程,已应用的方法包括生物活性预测、安全性评估、ADME性质分析以及天然产物相似性度量等。本文综述了近年来化学信息学工具的最新进展,这些工具利用多种分子表示方法,用于可视化、表征和拓展天然化合物数据集的化学空间,生成此类空间的可视化图谱,并探究化学空间内的结构-性质关系。本文以药物发现应用为重点,评估开源数据库BIOFACQUIM和PeruNPDB作为概念验证的实例。
天然产物(NPs)是生物体产生的化学化合物,数百年来一直被用作传统疗法。在现代,单个天然产物已被开发成药物,并成功地作为药物发现中的先导化合物加以利用1。生物活性化合物的范畴包括海洋生物、真菌、细菌、植物以及人类和动物体内产生的内源性物质,也包括多种动物产生的毒液和毒物2。因此,在过去四十年中,由天然产物衍生的药物构成了新型药理学物质的重要来源3,凸显了天然产物在新药研发中的关键作用,尤其是在癌症和传染病治疗方面,以及在多发性硬化症和心血管疾病等其他治疗领域4。此外,在1981年至2019年间获批用于治疗癌症的185种小分子药物中,有64.9%为未经修饰的天然产物或含有天然产物药效团的合成药物3。
化学信息学是一门建立在化学空间概念基础上的成熟交叉学科,已被用于分析和可视化与类药特性相关的天然产物(NPs)理化性质的化学空间5。化学信息学在基于天然产物的药物设计与发现中已产生重大影响6。一组化合物的化学空间并非总是唯一的,它取决于用于定义该空间的描述符集合。这意味着,如同研究其他任何化合物集合一样,研究天然产物的化学空间也面临特定挑战,这些挑战源于分子表示方式7。这一任务可通过多种分子描述符和数据可视化技术来实现。其中最常用的技术包括主成分分析(PCA)、骨架树、自组织映射、生成拓扑映射(GTM)以及一种称为树状图(TMAPs)的新型可视化技术8。此外,化学信息学在天然产物研究中的应用还包括在化合物数据库中收集、评估和传播天然产物的化学信息。随着大数据的引入,这一应用尤其具有重要意义9。
本文利用开源天然产物数据库BIOFACQUIM10和PeruNPDB11,描述了一种用于搜索、可视化和表征天然化合物数据集化学空间的实验方案。该方案采用多种分子表示方法,生成化学空间的可视化图谱,并研究其中的结构-性质关系,重点应用于药物发现领域。
1. 软件下载与安装
2. 化合物数据库的构建与整理
注意:查找具备必要数据的物质及来源。建议用户在电子表格中为每种化合物准备以下详细信息。
3. 分子描述符与多样性分析
注意:在化学信息学应用中,表示分子的最常用方法包括分子描述符(如理化性质)、分子指纹和化学骨架。分析可在此进行:http://132.248.103.152:3838/PUMA/。以下所述所有步骤在 PUMA 网站上均有详细说明。
4. 化学空间的可视化
注意:可以使用主成分分析(PCA)和其他降维技术将大部分相关数据压缩到少数几个变量中,从而实现对化学空间的可视化。
5. 一致性多样性图
注意:已开发出可视化表示方法,用于总结可用于量化多样性的若干特征。共识多样性图谱(CDPs)12 分析可在以下网址进行:http://132.248.103.152:3838/CDPlots/。
化学空间的分子性质与可视化
BIOFACQUIM10、PeruNPDB11 和 FDA13 数据集中的所有化合物均计算了六项理化性质。这些性质随后被绘制为小提琴图,以便观察三个研究数据集中各性质的分布情况(图1)。六个具有药学意义的理化参数——分子量(MW)、辛醇/水分配系数(clogP)、拓扑极性表面积(TPSA)、水溶性(clogS)、氢键供体原子数(HBD)和氢键受体原子数(HBA)——在不同数据集间的分布特征存在差异。然而,在将BIOFACQUIM和FDA数据集与PeruNPDB进行比较时,TPSA结果显示出显著差异。通过主成分分析(PCA)对数据集的化学空间进行了可视化。但三维PCA可视化分析表明,两个天然产物数据集中的分子大致与FDA批准药物集合在化学空间上重叠。尽管在某些区域,PeruNPDB或BIOFACQUIM的化合物占主导地位(图2)。
多样性分析
此外,采用基于分子指纹、骨架结构和理化性质的化合物多样性图谱(CDP)来评估数据集的多样性。PeruNPDB、BIOFAQUIM 和 FDA 数据库的基于性质的多样性通过标准化后的性质欧氏距离进行计算。同时,使用基于分子指纹、骨架结构和理化属性的 CDP 来评估数据集的多样性。基于性质的数据库多样性通过缩放后性质的欧氏距离进行计算。彩色 CD 图上的数值以连续颜色梯度上的数据点表示,较亮的颜色表示更高的多样性,而较深的颜色表示较低的多样性。最后,采用不同大小的点来显示各数据库中化合物的相对数量,较小的数据点代表分子数量较少的数据库。由于发现 PeruNPDB 位于骨架和分子指纹多样性最高的区域,结果表明,PeruNPDB 中的化合物具有最高的全局多样性(图 3)。

图1:理化性质的小提琴图。 BIOFACQUIM、PeruNPDB 和 FDA 数据集的理化性质小提琴图。请点击此处查看该图的放大版本。

图2:化学空间的可视化表示。 基于六种具有药物相关性的性质的主成分,对BIOFACQUIM、PeruNPDB和FDA数据集进行可视化展示。 请点击此处查看该图的放大版本。

图 3:共识多样性图。 共识多样性图,用于比较 BIOFACQUIM、PeruNPDB 和 FDA 数据集的全局多样性。请点击此处查看此图的放大版本。
由于化学空间具有诸多潜在用途,例如化合物分类、化合物筛选、探索结构-活性关系以及分析结构-性质相互作用等,目前在药物发现与开发过程中被广泛应用14。此外,随着化学信息量的不断增加,构建天然产物(NP)数据库已成为开展多种计算研究的基本步骤,包括化学库设计、化学空间的表征与比较、构效关系(SAR)研究以及虚拟筛选等。另一方面,人工智能(AI)算法的训练是另一个关键应用领域。AI 是指一组计算技术,可使机器模拟人类的认知过程,包括解决问题和从经验中学习等能力15,16。
尽管包括天然产物(NP)数据库在内的化学化合物数据库是药物发现中的重要工具,但使用多种虚拟筛选技术来识别潜在的命中分子也是可行的17。此外,已在天然产物数据库中发现多个具有治疗疾病潜力的候选药物,这些疾病包括冠状病毒病18、阿尔茨海默病19和利什曼病20等。然而,由于当前在处理"大数据"方面存在限制,特定生物或环境样本中所有潜在分子的化学空间可能极为庞大且大部分尚未被探索21。尽管目前尚无唯一或通用的化学空间表征方法,但一种广泛应用的方法是构建包含所有两两比较的相似性矩阵22。通过主成分分析(PCA)及其他降维技术,可将大部分相关信息压缩为少量变量(尽管会损失部分信息),从而实现化学空间的可视化23。
化学文库的多样性可通过多种方式进行评估,主要取决于所分析的数据以及研究的最重要目标。除了多样性度量外,分子表征也是多样性分析中的关键组成部分24。尽管在化学信息学分析中,化学骨架和分子描述符是表示分子最常用的两种方法,但其中一些方法存在理解难度较大的缺点25 ,且不一定能有效区分化合物集合;例如,不同化合物具有极为相似的性质谱是常见现象。因此,采用多种结构表征方式可更全面地展现化合物文库的多样性。这一理念构成了“化学多宇宙”的基础,其可被定义为针对同一数据集的一组或多组化学空间,每个空间均由一组描述符定义26。
由于CDP采用多种表示方法,可通过三种或两种维度,利用多种指标分析化合物数据集的整体多样性,从而有助于比较和分类化学文库12。
作者声明不存在任何利益冲突。
HLBC 和 MACH 感谢圣玛丽亚天主教大学提供的资助(项目编号:27499-R-2020、27574-R-2020、7309-CU-2020 和 28048-R-2021)。JLMF 感谢墨西哥国立自治大学 DGAPA 资助的科技研究与创新项目支持计划(PAPIIT)提供的资助,项目编号为 IN201321。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| GraphPad Prism | GraphPad Prism | https://www.graphpad.com/ | |
| KNIME 平台 | KNIME | https://www.knime.com | |
| Osiris DataWarrior (OSIRIS) 软件 | openmolecules.org | https://openmolecules.org/datawarrior/ | |
| PUMA | PUMA:统一分子分析平台 | http://132.248.103.152:3838/PUMA/ |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可