2017年5月9日
本方案概述了一种比较方法 从头合成 面向初学者的生物信息学转录组组装与注释工作流程。该工作流程完全通过 CyVerse 免费提供,并通过数据存储系统进行连接。流程中使用命令行和图形用户界面,但所需全部代码均可直接复制粘贴使用。
本实验的总体目标是从原始 FASTQ 文件出发,通过从头转录组学(De Novo transcriptomics)对差异基因表达进行评估、组装、注释和比较。该方法有助于回答比较生物学和分子生物学中的诸多问题,例如生物体内包含哪些转录本、这些转录本在生物体内的功能是什么,以及不同实验条件之间存在哪些差异。该技术的主要优势在于提供了一个交互式分析环境。
它提供按需计算资源,使研究人员能够立即开始分析其RNA-Seq数据。该方法特别适用于在同一生物体内部比较涉及多种组织、条件或时间点的实验,以理解生物系统如何变化。该方法主要针对无基因组的非模式生物,但也可应用于已有基因组组装的生物体,即使其基因组组装包含数万至数十万个 Scaffold。
首先,在 Discovery Environment 中获取对 Atmosphere 的访问权限。通过访问注册页面申请免费的 CyVerse 账户。请使用机构邮箱注册账户。
接下来,导航至应用程序与服务选项卡,并申请访问 Atmosphere。对 Discovery Environment 的访问权限将自动授予。登录 Discovery Environment(简称 DE),然后选择“数据”选项卡,以打开包含数据存储中所有文件夹的菜单。
创建一个主项目文件夹,用于存放与该项目相关的所有数据。在数据窗口顶部找到工具栏,选择“文件”菜单中的“新建文件夹”。在文件夹名称或任何输入输出文件名称中,请勿使用空格或特殊字符。
相反,应在适当位置使用下划线或连字符。将原始 FASTQ 序列文件及文件夹 1_Raw_Sequence 上传至一个名为 Folder A_Raw_Reads 的子文件夹中。对于小于两吉比特的文件,可通过点击主 DE 桌面中的 Data 按钮,进入数据窗口工具栏,使用数据存储的简单上传功能进行上传。
选择“上传”,然后选择“从桌面简单上传”。接着,点击“浏览”按钮,导航至本地计算机上的原始 FASTQ 测序文件。使用 DE 中的 FastQC 工具评估已上传的原始测序读段。在 DE 主桌面点击“应用程序”按钮,打开一个窗口,其中包含 DE 中所有可用的分析应用程序。在窗口顶部的搜索工具栏中搜索 FastQC 工具。
如果存在多个 FASTQ 文件,请打开多文件版本。选择文件并创建一个新文件夹,然后将该文件夹选为输出文件夹。将 FASTQ 测序文件加载到名为“选择输入数据”的工具窗口中,然后选择“启动分析”。
在DE中搜索可编程的Trimmomatic应用程序并打开。将原始FASTQ读取文件的文件夹上传到设置部分。选择测序文件是单端还是双端。
通过点击“浏览”按钮并粘贴文件路径到查看框中,选择所提供的标准控制文件。选择 Trimmomatic 控制文件并启动分析。对于序列读段的质量修剪,请在 DE 中搜索并打开 Sickle 应用程序。选择经修剪的 FASTQ 读段作为输入读段,并重命名输出文件。
在选项中包含质量设置。通过访问 wiki 页面打开最新版本的 Atmosphere 实例。选择 Trinity 和 Trinotate 镜像最新版本的链接。
点击“登录以启动”按钮,然后为 Atmosphere 实例命名。选择 medium3 或 large3 的实例规格。启动实例并等待其构建完成。
如果 Atmosphere 镜像无法启动,可以尝试申请较小的实例,或者向 Jetstream 申请更大的资源配额。所有详细信息均位于配套的 Wiki 页面中。将 Trinity 输出文件移至桌面环境(DE)中的 3_Assembly 文件夹,并将该文件夹命名为 A_Trinity_de_novo_assembly。
运行 Trinity 需要具备命令行知识,并且可能需要数天甚至数周时间才能完成大规模分析。维基页面上提供了相关的免费资源链接,有助于理解命令行操作。将每个组装得到的转录组分别存放在 A_Trinity_de_novo_assembly 文件夹内的独立子文件夹中。
使用包含每个转录组相关生物体的科学名称和处理方法的唯一名称,然后在 3_Assembly 文件夹中创建另一个名为 Folder B_rnaQUAT_Output 的子文件夹。打开名为 De Novo rnaQUAST 的应用程序。为分析命名,并选择 Folder B_rnaQUAST_Output 作为输出文件夹。
在 Discovery Environment 中搜索 transcript decoder,并对从头 Trinity 组装输出的 fasta 文件运行 TransDecoder。在 DE 中打开 DESeq2 应用程序。命名分析并将输出文件夹选择为 4_Differential_Expresssion。在输入部分,选择来自 Trinity 组装运行的计数表文件。
同时,选择包含重叠群名称的列。输入计数数据表文件中的列标题,以确定需要比较的列。各条件之间需用逗号分隔。
不要包含含有重叠群名称的第一列标题。对于重复样本,使用相同的名称。在第二行中,提供要比较的两个条件的名称。
匹配第一行中提供的列标题名称。此处展示的是在每个预处理步骤后对测序读段进行的系统性比较。经过修剪后,读段的 GC 含量和序列组成应更加均衡,并且具有较高质量得分的读段比例应更高。
高质量的测序读段对于从头组装转录组至关重要。快速质量控制的结果取决于所测序的生物体和样本。预处理读段的主要目标是确保所有待比较样本之间的一致性。
rnaQUAST 利用 boost 代码,基于分类群中的已知核心基因生成有关组装结果的汇总统计信息。通过每条转录本的错配数量以及与经典基因匹配的转录本数量,可以揭示组装工具的准确性。此处展示的最后四个子图提供了关于重叠群(contig)和异构体长度的汇总统计信息,以及预期异构体的覆盖情况。
NAx 表示长度超过 y 轴所示长度的重叠群所占的百分比。组装片段比例是指最长的单个组装转录本与其长度的比值。而覆盖比例是指根据 BUSCO 中核心原核或真核基因预期的完整组装转录本异构体所占的百分比。
观看本视频后,您应能充分理解如何组装和分析转录组。此外,本实验方案可帮助您检测两种条件下基因表达的差异。通常情况下,人们在使用生物信息学软件包时会遇到困难,原因是这类软件包数量众多,各自包含大量设置和变量,而且通常需要掌握命令行操作知识才能实际运行。
标注并整理数据输入和分析输出非常重要,以便其他研究人员能够理解所进行的操作。应包含步骤的执行顺序、程序版本和样本信息。此外,文件夹或文件名称中不得包含空格。
新工具及工具的新版本正在不断集成,同时旧版本的工具也会予以保留。所有变更都将在配套的 Wiki 页面上进行记录。通过遵循此流程,还可执行其他生物信息学分析方法,如网络分析、GO 富集分析和代谢通路鉴定,以帮助回答表型变异、导致表达谱变化的条件,以及功能基因组学中目标基因的筛选等问题。
本方案概述了一种从头转录组组装与注释的工作流程,专为生物信息学初学者设计。该流程通过CyVerse提供一个用于分析RNA-Seq数据的交互式环境。
该工作流程可帮助生物制药研发团队从非模式生物中生成高质量的转录组数据,支持在尚未充分研究的生物系统中进行靶点验证。通过提供用于从头组装和差异表达分析的交互式云环境,该方法降低了早期发现阶段机制性去风险化的障碍。该方法在研究生物体特异性对实验扰动的响应时,可提高预测的可信度,从而为项目组合的优先级排序提供依据。
该方法适用于早期发现阶段,可在先导化合物筛选之前支持假设验证和通路阐明。