方法文章

可视化与分析天然产物数据库的化学空间以用于药物发现

DOI:

10.3791/66349

2024年9月6日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文提供了一种方法,该方法采用不同的分子表征方式来展示和分析天然化合物数据集的化学空间,重点应用于药物发现相关领域。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

化学空间是一个多维描述符空间,涵盖了所有可能的分子,据估计,分子量低于500 Da的有机化合物中,约有1 × 1060种可能与药物发现相关。天然产物是过去四十年来上市新药的主要来源,并且仍然是创制创新药物最具成效的来源之一。基于化学信息学的计算工具可加速天然产物的药物研发进程,已应用的方法包括生物活性预测、安全性评估、ADME性质分析以及天然产物相似性度量等。本文综述了近年来化学信息学工具的最新进展,这些工具利用多种分子表示方法,用于可视化、表征和拓展天然化合物数据集的化学空间,生成此类空间的可视化图谱,并探究化学空间内的结构-性质关系。本文以药物发现应用为重点,评估开源数据库BIOFACQUIM和PeruNPDB作为概念验证的实例。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

天然产物(NPs)是生物体产生的化学化合物,数百年来一直被用作传统疗法。在现代,单个天然产物已被开发成药物,并成功地作为药物发现中的先导化合物加以利用1。生物活性化合物的范畴包括海洋生物、真菌、细菌、植物以及人类和动物体内产生的内源性物质,也包括多种动物产生的毒液和毒物2。因此,在过去四十年中,由天然产物衍生的药物构成了新型药理学物质的重要来源3,凸显了天然产物在新药研发中的关键作用,尤其是在癌症和传染病治疗方面,以及在多发性硬化症和心血管疾病等其他治疗领域4。此外,在1981年至2019年间获批用于治疗癌症的185种小分子药物中,有64.9%为未经修饰的天然产物或含有天然产物药效团的合成药物3

化学信息学是一门建立在化学空间概念基础上的成熟交叉学科,已被用于分析和可视化与类药特性相关的天然产物(NPs)理化性质的化学空间5。化学信息学在基于天然产物的药物设计与发现中已产生重大影响6。一组化合物的化学空间并非总是唯一的,它取决于用于定义该空间的描述符集合。这意味着,如同研究其他任何化合物集合一样,研究天然产物的化学空间也面临特定挑战,这些挑战源于分子表示方式7。这一任务可通过多种分子描述符和数据可视化技术来实现。其中最常用的技术包括主成分分析(PCA)、骨架树、自组织映射、生成拓扑映射(GTM)以及一种称为树状图(TMAPs)的新型可视化技术8。此外,化学信息学在天然产物研究中的应用还包括在化合物数据库中收集、评估和传播天然产物的化学信息。随着大数据的引入,这一应用尤其具有重要意义9

本文利用开源天然产物数据库BIOFACQUIM10和PeruNPDB11,描述了一种用于搜索、可视化和表征天然化合物数据集化学空间的实验方案。该方案采用多种分子表示方法,生成化学空间的可视化图谱,并研究其中的结构-性质关系,重点应用于药物发现领域。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 软件下载与安装

  1. 确保此项目的目录为全新状态。为便于访问,将可执行文件和相关文件放入该目录中。
  2. 下载后安装所需的软件包。
  3. 下载最新版本的 Osiris DataWarrior (OSIRIS) 软件,该软件可从 https://openmolecules.org/datawarrior/ 获取
  4. 下载最新版本的 Konstanz Information Miner (KNIME) 分析平台,该平台可从 https://www.knime.com/ 获取
  5. 下载最新版本的 GraphPad Prism 软件,该软件可从 https://www.graphpad.com/ 获取
    注意: Osiris DataWarrior 软件 和 Konstanz Information Miner (KNIME) 分析平台可在个人计算机上使用,且个人使用免费;而 GraphPad Prism 软件需购买(https://www.graphpad.com/)。

2. 化合物数据库的构建与整理

注意:查找具备必要数据的物质及来源。建议用户在电子表格中为每种化合物准备以下详细信息。

  1. 为每种化合物命名。将来源中描述的所有化合物名称添加到电子表格的第一列。
  2. 若建立内部自建库,则分配一个内部标准化代码;或在所查阅的数据库中为此化合物分配一个唯一标识编号。
  3. 使用规范的SMILES表示法提供结构输入,该表示法可导入其他分子编辑工具。
    1. 在电子表格中收集完数据后,建议将数据库保存为 .csv 格式。
    2. 使用OSIRIS软件生成数据集的结构数据文件(SDF)、分子数据文件(mol)和mol2文件,这些文件包含化学信息,并可与大多数软件包兼容。操作时,点击File按钮,然后点击.csv文件的Open按钮以上传该存档。
    3. 将数据集上传至KNIME分析平台,以提高数据质量并防止产生不准确的结果。操作时,点击File按钮,然后点击.sdf.mol2文件的Open按钮以上传文件。
  4. 确保化学结构的一致性。
    1. 检查每个化学结构的原子类型和化合价是否有效。使用KNIME的Standardizing Molecular Structures工作流,将结构标准化为规范的互变异构体形式,对芳香结构进行凯库勒化,统一立体键的取向,并将所有隐式氢转化为显式氢。
    2. 在分子正确标准化后,使用KNIME的Standardizing Molecular Structures工作流查找并去除重复项。利用InChI键作为线性表示法,识别不同的质子化状态和互变异构体。
    3. 去除重复项。
    4. 枚举互变异构体和立体异构体。此步骤在虚拟筛选研究中至关重要,尤其是在使用对接或基于药效团筛选等搜索方法时。

3. 分子描述符与多样性分析

注意:在化学信息学应用中,表示分子的最常用方法包括分子描述符(如理化性质)、分子指纹和化学骨架。分析可在此进行:http://132.248.103.152:3838/PUMA/。以下所述所有步骤在 PUMA 网站上均有详细说明。

  1. 计算六种最常见的具有药理学意义的理化性质:分子量(MW)、辛醇/水分配系数(clogP)、拓扑极性表面积(TPSA)、水溶性(clogS)、氢键供体原子数(HBD)和氢键受体原子数(HBA)。更多信息请参考PUMA网站。
  2. 计算166位MACCS键、两两之间的Tanimoto相似性、直径为4的扩展连接性指纹(ECFP4),以及其他适用于虚拟筛选、活性景观建模和构效关系(SAR)研究的环状指纹。
  3. 对每一对比计算中心趋势统计量。为确保数据集的多样性,应使均值或中位数尽可能小,这与欧氏距离或其他通用距离度量相反。
  4. 检查所计算的数值是否已在文献中记录,或已在其他参考数据库中计算,以便进行比较。为此,请查阅PubChem或CHEMBL等网站。
  5. 使用GraphPad Prism软件生成小提琴图以进行可视化展示,并显示最大值和最小值。

4. 化学空间的可视化

注意:可以使用主成分分析(PCA)和其他降维技术将大部分相关数据压缩到少数几个变量中,从而实现对化学空间的可视化。

  1. 选择全部六个描述符以确定相似性或距离,并据此创建相似性(或距离)矩阵。
  2. 对矩阵进行主成分分析(PCA)。选择两个或三个主要成分用于绘图,并考虑每个主成分所解释的方差比例。
  3. 使用 KNIME 中的 Plotly 节点生成 PCA 的二维或三维散点图表示。

5. 一致性多样性图

注意:已开发出可视化表示方法,用于总结可用于量化多样性的若干特征。共识多样性图谱(CDPs)12 分析可在以下网址进行:http://132.248.103.152:3838/CDPlots/。

  1. 创建一个图表,以数据库中化合物的数量确定数据点的大小。以分子指纹的多样性作为横轴,骨架的多样性作为纵轴,基于理化性质的多样性作为颜色连续比例尺,数据集中化合物的相对数量作为数据点大小。
  2. 使用 GraphPad Prism 软件生成多变量图表。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

化学空间的分子性质与可视化
BIOFACQUIM10、PeruNPDB11 和 FDA13 数据集中的所有化合物均计算了六项理化性质。这些性质随后被绘制为小提琴图,以便观察三个研究数据集中各性质的分布情况(图1)。六个具有药学意义的理化参数——分子量(MW)、辛醇/水分配系数(clogP)、拓扑极性表面积(TPSA)、水溶性(clogS)、氢键供体原子数(HBD)和氢键受体原子数(HBA)——在不同数据集间的分布特征存在差异。然而,在将BIOFACQUIM和FDA数据集与PeruNPDB进行比较时,TPSA结果显示出显著差异。通过主成分分析(PCA)对数据集的化学空间进行了可视化。但三维PCA可视化分析表明,两个天然产物数据集中的分子大致与FDA批准药物集合在化学空间上重叠。尽管在某些区域,PeruNPDB或BIOFACQUIM的化合物占主导地位(图2)。

多样性分析
此外,采用基于分子指纹、骨架结构和理化性质的化合物多样性图谱(CDP)来评估数据集的多样性。PeruNPDB、BIOFAQUIM 和 FDA 数据库的基于性质的多样性通过标准化后的性质欧氏距离进行计算。同时,使用基于分子指纹、骨架结构和理化属性的 CDP 来评估数据集的多样性。基于性质的数据库多样性通过缩放后性质的欧氏距离进行计算。彩色 CD 图上的数值以连续颜色梯度上的数据点表示,较亮的颜色表示更高的多样性,而较深的颜色表示较低的多样性。最后,采用不同大小的点来显示各数据库中化合物的相对数量,较小的数据点代表分子数量较少的数据库。由于发现 PeruNPDB 位于骨架和分子指纹多样性最高的区域,结果表明,PeruNPDB 中的化合物具有最高的全局多样性(图 3)。

分子性质的小提琴图:分子量(MW)、极性表面积(TPSA)、计算脂水分配系数(cLogP)、实测脂水分配系数(sLogP)、氢键受体、氢键供体。
图1:理化性质的小提琴图。 BIOFACQUIM、PeruNPDB 和 FDA 数据集的理化性质小提琴图。请点击此处查看该图的放大版本。

显示化学聚类的PCA图;3D图;数据分析;FDA与BIOFACQUIM与PeruNPDB对比。
图2:化学空间的可视化表示。 基于六种具有药物相关性的性质的主成分,对BIOFACQUIM、PeruNPDB和FDA数据集进行可视化展示。 请点击此处查看该图的放大版本。

支架多样性与指纹多样性散点图,显示数据集比较。
图 3:共识多样性图。 共识多样性图,用于比较 BIOFACQUIM、PeruNPDB 和 FDA 数据集的全局多样性。请点击此处查看此图的放大版本。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

由于化学空间具有诸多潜在用途,例如化合物分类、化合物筛选、探索结构-活性关系以及分析结构-性质相互作用等,目前在药物发现与开发过程中被广泛应用14。此外,随着化学信息量的不断增加,构建天然产物(NP)数据库已成为开展多种计算研究的基本步骤,包括化学库设计、化学空间的表征与比较、构效关系(SAR)研究以及虚拟筛选等。另一方面,人工智能(AI)算法的训练是另一个关键应用领域。AI 是指一组计算技术,可使机器模拟人类的认知过程,包括解决问题和从经验中学习等能力15,16

尽管包括天然产物(NP)数据库在内的化学化合物数据库是药物发现中的重要工具,但使用多种虚拟筛选技术来识别潜在的命中分子也是可行的17。此外,已在天然产物数据库中发现多个具有治疗疾病潜力的候选药物,这些疾病包括冠状病毒病18、阿尔茨海默病19和利什曼病20等。然而,由于当前在处理"大数据"方面存在限制,特定生物或环境样本中所有潜在分子的化学空间可能极为庞大且大部分尚未被探索21。尽管目前尚无唯一或通用的化学空间表征方法,但一种广泛应用的方法是构建包含所有两两比较的相似性矩阵22。通过主成分分析(PCA)及其他降维技术,可将大部分相关信息压缩为少量变量(尽管会损失部分信息),从而实现化学空间的可视化23

化学文库的多样性可通过多种方式进行评估,主要取决于所分析的数据以及研究的最重要目标。除了多样性度量外,分子表征也是多样性分析中的关键组成部分24。尽管在化学信息学分析中,化学骨架和分子描述符是表示分子最常用的两种方法,但其中一些方法存在理解难度较大的缺点25 ,且不一定能有效区分化合物集合;例如,不同化合物具有极为相似的性质谱是常见现象。因此,采用多种结构表征方式可更全面地展现化合物文库的多样性。这一理念构成了“化学多宇宙”的基础,其可被定义为针对同一数据集的一组或多组化学空间,每个空间均由一组描述符定义26

由于CDP采用多种表示方法,可通过三种或两种维度,利用多种指标分析化合物数据集的整体多样性,从而有助于比较和分类化学文库12

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在任何利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

HLBC 和 MACH 感谢圣玛丽亚天主教大学提供的资助(项目编号:27499-R-2020、27574-R-2020、7309-CU-2020 和 28048-R-2021)。JLMF 感谢墨西哥国立自治大学 DGAPA 资助的科技研究与创新项目支持计划(PAPIIT)提供的资助,项目编号为 IN201321。

材料

本文使用的材料清单
姓名公司目录编号评论
GraphPad PrismGraphPad Prismhttps://www.graphpad.com/
KNIME 平台KNIMEhttps://www.knime.com
Osiris DataWarrior (OSIRIS) 软件openmolecules.orghttps://openmolecules.org/datawarrior/
PUMAPUMA:统一分子分析平台http://132.248.103.152:3838/PUMA/

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Boufridi, A., Quinn, R. J. Harnessing the properties of natural products. Annu Rev Pharmacol Toxicol. 58, 451-470 (2018).
  2. Gómez-García, A., et al. Navigating the chemical space and chemical multiverse of a unified Latin American natural product database: LANaPDB. ChemRxiv. , (2023).
  3. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  4. Atanasov, A. G., Zotchev, S. B., Dirsch, V. M., Supuran, C. T. Natural products in drug discovery: advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  5. Medina-Franco, J. L., Saldívar-González, F. I. Cheminformatics to characterize pharmacologically active natural products. Biomolecules. 10 (11), 1566(2020).
  6. Chen, Y., Garcia De Lomana, M., Friedrich, N. O., Kirchmair, J. Characterization of the Chemical Space of Known and Readily Obtainable Natural Products. J Chem Inf Model. 58 (8), 1518-1532 (2018).
  7. Gaytán-Hernández, D., Chávez-Hernández, A. L., López-López, E., Miranda-Salas, J., Saldívar-González, F. I., Medina-Franco, J. L. Art driven by visual representations of chemical space. ChemRxiv. , (2023).
  8. Zabolotna, Y., Ertl, P., Horvath, D., Bonachera, F., Marcou, G., Varnek, A. NP Navigator: A new look at the natural product chemical space. Mol Inform. 40 (9), e2100068(2021).
  9. Martinez-Mayorga, K., Madariaga-Mazon, A., Medina-Franco, J. L., Maggiora, G. The impact of chemoinformatics on drug discovery in the pharmaceutical industry. Expert Opin Drug Discov. 15 (3), 293-306 (2020).
  10. Pilón-Jiménez, B., Saldívar-González, F., Díaz-Eufracio, B., Medina-Franco, J. BIOFACQUIM: A Mexican compound database of natural products. Biomolecules. 9 (1), 31(2019).
  11. Barazorda-Ccahuana, H. L., et al. PeruNPDB: the Peruvian natural products database for in silico drug screening. Sci Rep. 13 (1), 7577(2023).
  12. González-Medina, M., Prieto-Martínez, F. D., Owen, J. R., Medina-Franco, J. L. Consensus diversity plots: a global diversity analysis of chemical libraries. J Cheminform. 8, 63(2016).
  13. Irwin, J. J., et al. ZINC20-A free ultralarge-scale chemical database for ligand discovery. J Chem Inf Model. 60 (12), 6065-6073 (2020).
  14. Naveja, J. J., Medina-Franco, J. L. Finding constellations in chemical space through core analysis. Front Chem. 7, 510(2019).
  15. Cavasotto, C. N., Di Filippo, J. I. Artificial intelligence in the early stages of drug discovery. Arch Biochem Biophys. 698, 108730(2021).
  16. Rosén, J., Gottfries, J., Muresan, S., Backlund, A., Oprea, T. I. Novel chemical space exploration via natural products. J Med Chem. 52 (7), 1953-1962 (2009).
  17. Sliwoski, G., Kothiwale, S., Meiler, J., Lowe Jr, E. W. Computational methods in drug discovery. Pharmacol Rev. 66 (1), 334-395 (2014).
  18. Goyzueta-Mamani, L. D., Barazorda-Ccahuana, H. L., Mena-Ulecia, K., Chávez-Fumagalli, M. A. Antiviral activity of metabolites from Peruvian plants against SARS-CoV-2: An in silico approach. Molecules. 26 (13), 3882(2021).
  19. Goyzueta-Mamani, L. D., et al. In silico analysis of metabolites from Peruvian native plants as potential therapeutics against Alzheimer's disease. Molecules. 27 (3), 918(2022).
  20. Barazorda-Ccahuana, H. L., et al. Computer-aided drug design approaches applied to screen natural product's structural analogs targeting arginase in Leishmania spp. F1000Research. 12, 93(2023).
  21. McGrady, M. Y., Colby, S. M., Nuñez, J. R., Renslow, R. S., Metz, T. O. AI for chemical space gap filling and novel compound generation. arXiv. , (2022).
  22. Medina-Franco, J., Martinez-Mayorga, K., Giulianotti, M., Houghten, R., Pinilla, C. Visualization of the chemical space in drug discovery. Curr Comput Aided-Drug Des. 4 (4), 322-333 (2008).
  23. Osolodkin, D. I., Radchenko, E. V., Orlov, A. A., Voronkov, A. E., Palyulin, V. A., Zefirov, N. S. Progress in visual representations of chemical space. Expert Opin Drug Discov. 10 (9), 959-973 (2015).
  24. Sheridan, R. P., Kearsley, S. K. Why do we need so many chemical similarity search methods. Drug Discov Today. 7 (17), 903-911 (2002).
  25. Singh, N., Guha, R., Giulianotti, M. A., Pinilla, C., Houghten, R. A., Medina-Franco, J. L. Chemoinformatic analysis of combinatorial libraries, drugs, natural products, and molecular libraries Small Molecule Repository. J Chem Inf Model. 49 (4), 1010-1024 (2009).
  26. Medina-Franco, J. L., Chávez-Hernández, A. L., López-López, E., Saldívar-González, F. I. Chemical multiverse: An expanded view of chemical space. Mol Inform. 41 (11), e2200116(2022).

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

ADME
视频即将推出

相关文章