2021年9月25日
本教程介绍了一种构建深度学习算法的简单方法,用于对宏基因组数据进行二分类序列分类。
多种生物序列分类任务,例如物种分类、基因功能分类和宿主分类,是许多宏基因组数据分析中的预期流程。由于宏基因组数据包含大量新物种和新基因,许多研究需要高性能的分类工具。生物学家在为特定任务寻找合适的序列分类与注释工具时常面临挑战,且由于缺乏必要的数学与计算知识,通常无法自行构建相应的分类模型。
深度学习技术近年来已成为一个热门话题,并在许多分类任务中展现出显著优势。迄今为止,已开发出许多高度封装的深度学习软件包,使得生物学家能够根据自身需求构建深度学习框架,而无需深入了解生物体的细节。在本教程中,我们提供了一套指导方案,用于构建一个易于使用的序列分类深度学习框架,整个过程无需具备充足的数学知识或编程技能。
以下视频展示了如何使用虚拟机进行生物序列分类。用户需要从教程主页下载虚拟机文件,然后下载 VirtualBox 软件。该虚拟机已压缩为一个 seventy 文件。
使用当前的压缩软件(如 WinRar、Winzip 和 7-Zip)可以轻松解压 seventy 文件。我们使用 7-Zip 解压了该虚拟机。解压过程可能需要一些时间。
请等待一段时间。解压后,用户需要安装 VirtualBox 软件。创建一个文件夹以安装 VirtualBox。
创建一个 VirtualBox 安装包。选择您自己创建的文件夹。然后在每一步中单击“下一步”按钮来安装 VirtualBox 软件。
安装可能需要一些时间,请耐心等待片刻。打开 VirtualBox 软件。创建一个新的按钮以创建虚拟机。
在名称框中输入您自己指定的虚拟机名称。在类型框中选择操作系统为 Linux。在版本框中选择 Ubuntu,然后点击下一步按钮。
如果可能,为虚拟机分配更多的内存。选择“使用现有的虚拟硬盘文件”。然后选择从教程主页下载的虚拟机文件。
然后点击创建按钮。点击开始按钮以启动虚拟机。启动虚拟机可能需要一些时间。
请等待片刻后再进行下一步操作。然后,用户需要在物理主机和虚拟机中创建共享文件夹以交换文件。在您的物理主机上,创建一个名为 shared host 的共享文件夹;在虚拟机的桌面上,创建一个名为 shared VM 的共享文件夹。在虚拟机的菜单栏中,依次单击设备、共享文件夹、共享文件夹设置。
单击右上角的按钮。选择您在物理主机上创建的共享文件夹。选择自动挂载选项。
单击“确定”按钮,然后重新启动虚拟机。重新启动虚拟机可能需要一些时间。
请在进行下一步之前稍等片刻。在虚拟机桌面上单击右键,打开终端。在终端中输入以下命令。
输入 sudo,按空格键,输入 mount,按空格键,输入 bar T,按空格键,输入 vboxsf,按空格键,输入 shared host,按空格键,输入点斜杠,输入 desktop,输入斜杠,输入 shared VM。当提示输入密码时,输入密码并按回车键。将训练和测试过程所需的全部四个序列文件以 faster 格式复制到物理主机的 shared host 文件夹中。这样,所有文件也将出现在虚拟机的 shared VM 文件夹中。
然后将共享的虚拟机文件夹中的文件复制到虚拟机的深度学习文件夹中。右键单击并打开终端,输入以下命令以执行独热编码:点斜杠,独热编码,指定用于训练和测试的文件。
然后指定序列类型。接着输入以下命令以启动趋势分析过程:Python 空格键,train.py。随后,趋势分析过程将开始。
此过程可能需要数小时或数天,具体取决于您的数据集大小。当过程完成后,测试数据的预测结果将显示在 predict.dot.csv 文件中。在我们之前的研究中,我们开发了一系列用于宏基因组数据的序列分类工具,所采用的方法与此教程类似。
例如,我们开发了一种工具,旨在从测序数据中识别完整和不完整的原核病毒病毒颗粒蛋白;同时还开发了一种工具,旨在从宏基因组数据中识别噬菌体DNA片段与细菌染色体DNA片段。本教程脚本所展示的工具性能如图a和图b所示。
总之,本教程为生物学研究者及生物体设计初学者提供了如何构建一个易于使用的深度学习框架的概述,用于宏基因组数据中的生物序列分类。本教程旨在帮助读者直观理解深度学习,并解决初学者在启动深度学习工具包以及为生物体编写代码时常遇到的困难。对于一些简单的分类任务,用户可直接使用我们的框架来完成分类工作。
查看完整文字稿并访问数千部科学视频
本教程演示了生物学家如何构建并使用深度学习框架来执行生物序列分类任务,例如物种分类、基因功能预测以及病毒宿主分类,特别是在宏基因组数据分析中的应用。该方案专为不具备高级数学或编程技能的用户设计,通过使用预配置的虚拟机以简化操作流程。
宏基因组数据中生物序列的高效分类对于生物制药领域的早期发现和靶点验证至关重要&D. 该虚拟机平台使非计算背景的科研人员能够部署用于序列分类的深度学习模型,降低了技术门槛,加快了数据驱动的科学发现。通过普及对高级分析工具的访问,该方法支持全组合范围内的假设检验和机制层面的风险评估。
这种基于虚拟机的深度学习工作流程整合了从早期发现到先导化合物鉴定及临床前研究的各个环节,支持在多个分析流程阶段进行假设检验和数据标注。