2022年4月13日
本实验方案的目的是利用开源软件高效地生成和整理小分子结构文库。
本方案展示了开源软件如何使任何研究人员都能创建和管理计算结构库。该方案的优势在于其开放性和灵活性。任何人都可以使用并根据自身特定的研究问题对其进行修改。
该方案的不同版本可应用于药物发现领域,快速构建用于计算机虚拟筛选的特定结构库。尽管本方案已逐步说明,但如果用户不熟悉 Java 或基础编程,建议在实施本方案前先学习相关知识。首先为项目创建一个新的目录。
将所有文件和可执行程序放置在此目录中以便于访问。下载最新版本的 Maygen jar 文件以及包管理软件 Anaconda。在 Windows 系统中,搜索 Anaconda Prompt 并点击出现的快捷方式以运行。
在 Anaconda 中创建 RDKit 环境并下载 RDKit 至该环境时,请输入屏幕上显示的命令,按回车键运行,并在安装过程中出现任何问题时回答“是”。然后从补充文件一至五中下载 Jupyter Notebook 和底物模式的文本文件。在命令提示符中,导航至包含 maygen 的目录。
jar 可执行文件。对于每个感兴趣的化学式,使用屏幕上显示的命令来运行 Maygen。如果该化学式是模糊化学式而非确定化学式,请将连字符 F 标志替换为连字符 fuzzy 标志,并将任何元素区间用方括号括起来。
在 Anaconda 命令提示符中,导航至包含 Jupyter Notebook 的文件夹,并激活 RDKit 环境。下载的 Notebook 需要使用 RDKit,因此本方案中后续对这些 Notebook 的任何使用都必须在 RDKit 环境中打开。
接下来,打开用于亚结构筛选的 Jupyter Notebook,如果文件名包含空格,请用引号将其括起来。在 Notebook 开始部分的指定单元格中,输入输入 sdf 文件的完整文件路径,以及期望的输出 sdf 文件的完整路径和错误列表文件的文件路径,均以字符串形式表示。
如果需要保留过滤后化合物库中的某些子结构或优选列表,请为这些子结构创建包含SMARTS模式的txt文件,并将该优选列表文件的路径填入笔记本开头指定的位置。从顶部菜单中选择“Kernel”(内核),然后选择“Restart and Run All”(重启并运行全部),以重启笔记本内核并运行所有单元格。随后,将在指定的输出文件夹中生成一个具有所需名称的sdf文件。
对 Maygen 生成的每个结构文件重复上述步骤。对于伪原子替换,打开 Anaconda 命令提示符,导航至包含 Jupyter Notebook 的文件夹,并激活 RDKit 环境,然后打开用于伪原子替换的 Jupyter Notebook。
在笔记本开头的指定单元格中,输入 sdf 输入文件的完整路径和所需 sdf 输出文件的完整路径,均以字符串形式表示。重启笔记本内核并运行所有单元格,即可在指定的输出文件夹中获得具有所需名称的 sdf 文件。类似地,打开 Anaconda 命令行窗口,用于氨基酸 N 端和 C 端的封端处理。
导航至包含 Jupyter Notebook 的文件夹,并激活 RDKit 环境。打开用于氨基酸封端的 Jupyter Notebook。在笔记本起始位置的指定单元格中,以字符串形式输入输入 sdf 文件的完整文件路径以及期望输出的 sdf 文件的完整文件路径。
重启笔记本内核并运行所有单元,以在指定的输出文件夹中生成具有所需名称的 sdf 文件。为了生成描述符,请将所有需要计算描述符的 sdf 文件放入同一个文件夹中。然后下载 PaDEL 描述符软件,解压并将其提取到该文件夹中。
打开命令提示符,导航至包含 PaDEL 描述符 jar 文件的文件夹,并对收集的 sdf 文件运行 PaDEL 描述符。此处展示了所有经筛选的氨基酸文库的化学空间。黑色标记代表来自不含硫文库的氨基酸,黄色标记代表来自富硫文库的氨基酸。
此处,VAIL 和 VAIL_S 文库用圆形表示,DEST 和 DEST_S 文库用方形表示,脯氨酸和 Pro S 文库用三角形表示,星形代表编码的氨基酸。
即使在明确不含亲水性侧链的氨基酸库中,可能的log P值范围也会随着分子体积的增加而增大。具有烃类侧链的编码氨基酸比各自氨基酸库中其他体积相近的大多数氨基酸更具疏水性。与VAILS库中其他体积相似的成员相比,甲硫氨酸的情况也是如此。
具有羟基侧链的编码氨基酸是DEST文库中体积最小的成员之一,其中天冬氨酸仅略大于三个丙氨酸。图中显示了含硫与不含硫文库的平均范德华体积。在所有文库中,硫的取代导致分子体积略有增加。
此处展示了含硫与不含硫的化合物库的平均分配系数值。硫原子取代对log P的影响不如对体积的影响那样均一。代表性图像显示了三价伪原子对Maygen结构生成的影响。
在结构生成过程中使用伪原子,可将生成的结构数量减少约三个数量级,同时将生成这些结构所需的总时间缩短一至两个数量级。遵循本方案,未来可根据研究人员的需求集成更多功能。例如,可将子结构过滤功能整合到 Maygen 中,以避免后续处理步骤。
文库构建、整理与修饰。该通用流程在具备一定编程知识的前提下,可适用于其他分子结构和修饰类型,从而帮助研究人员探索除α氨基酸以外的计算文库。本方案将有助于研究人员提升在生命起源领域的计算研究工作。
开源工具包将极大地促进这些工作。
本方案概述了使用开源软件创建和管理小分子结构库的方法。它强调了在药物发现领域中为研究人员提供灵活性和可及性的重要性。
开源计算化学库的整理可实现早期药物发现中虚拟筛选化合物集合的快速、低成本扩展。灵活的结构生成与整理工作流程支持基于假设的化合物筛选和组合多样化。该能力通过提供定制化、高质量的化合物库用于计算机模拟评价,从而提高预测可信度并加速先导化合物的识别。
本方案整合了早期发现与先导化合物鉴定的衔接环节,既支持基于假设的探索性研究,也具备可扩展的高通量筛选准备能力。