2023年12月1日
本文介绍了一种生物信息学分析流程的安装与使用方案,用于分析嵌合RNA测序数据,该数据应用于相关研究中 体内 RNA:RNA 相互作用
本方案涵盖了用于分析嵌合非编码RNA与靶RNA相互作用高通量测序数据的计算流程的安装及实际操作步骤。构建嵌合RNA的分子策略是一项相对较新的技术,与以往的生物信息学预测工具相比,在明确解析全基因组范围内非编码RNA与靶RNA相互作用图谱方面具有优势。对于刚采用该策略的研究人员而言,由嵌合RNA高通量测序所产生的数据可能带来分析上的挑战。
我们已建立一个开源、跨平台的计算流程,具有高度注释化的特点,可使初级用户能够分析其嵌合非编码 RNA 和靶向 RNA 测序实验的数据。在后续实验中,Meffert 实验室计划在我们正在进行的研究所产生的数据集上应用 SCRAP 计算分析方法,以研究哺乳动物神经系统中的转录后调控机制,并将在我们的 GitHub 页面持续更新维护 SCRAP 工具。在 Mac OS X 平台上开始安装 SCRAP 之前,请在终端中执行命令 git,以确认 Git 是否已存在。
要验证 Miniconda 是否安装成功,请在终端中输入命令 which conda。如需安装 Miniconda,请参考 Meffert-Lab GitHub 仓库中的平台 SETUP markdown 文件,其中包含在 Windows、macOS 和 Ubuntu 系统上的安装说明。对于 Mac 系统,可使用 Home Brew 包管理器,通过执行命令 brew install miniconda 来安装 Miniconda。
要安装 Conda,请运行 conda init 命令,并指定正在使用的 shell,然后关闭并重新打开 shell。安装成功后,终端会话中将显示已激活的 base 环境。接下来,运行指定的 git clone 命令以获取 SCRAP 源代码的最新副本。
安装 Mamba,这是 Conda 的一个改进型包求解器。使用以下命令,从 SCRAP_environment.yml 将 SCRAP 的所有依赖项安装到其独立的 Conda 环境中。
接下来,使用针对待分析sncRNA和mRNA相互作用的生物体特异性bash脚本进行SCRAP分析。提供SCRAP源代码文件夹的目录路径,并利用fasta和annotation文件夹中的文件执行安装步骤。确保目录路径完整,且以正斜杠结尾。
请参考 readme.md 中的表格以获取正确的基于 Mir 的物种缩写。对于最新的参考基因组,请使用 UCSC 基因组浏览器或 NCBI 基因组数据枢纽。
检查 SCRAP 源文件夹的注释目录中对应的物种注释文件(species.annotation.bed)。如果需要分析其他物种,请提供指定的文件。
在安装依赖项和SCRAP后,使用指定的脚本来按照规定的命令结构启动SCRAP分析。列出样本目录的完整路径,不得使用任何缩写形式,并确保样本目录的文件夹名称与样本名称相匹配。需特别强调,所列出的路径应指向包含所有样本文件夹的目录,而非指向某个单独的样本文件夹或文件。
接下来,列出接头文件的完整路径。确认接头文件中的样本名称与前述文件夹名称和文件名称一致。指定样本类型,为双端测序或单端测序,并说明针对pre-miRNA、tRNA的RNA筛选选项,以及可选的RNA清洁步骤。
列出参考目录的完整路径、miRBase 缩写和参考基因组缩写。运行 SCRAP 后,使用指定的脚本命令进行 Peak_Calling。列出包含样本文件夹的目录和接头文件的完整路径。
然后定义峰识别(Peak_Calling)的标准,包括测序读段的最小数量以及识别一个峰所需的独立测序文库数量。指明峰是否必须由同一家族的小非编码RNA(sncRNA)贡献,这对于具有相同种子序列、可结合重叠基因靶标的miRNA尤为重要。随后,指明参考数据库目录的完整路径、miRBase缩写以及参考基因组的缩写。
在完成峰识别(Peak_Calling)后,运行峰注释(Peak_Annotation)脚本。将峰识别结果生成的 peaks.bed 文件的完整路径、参考目录路径以及所需的注释物种提供给该脚本。
使用 samtools merge 将所有目标 BAM 文件合并,以方便进行联合可视化。然后使用 samtools sort 对合并后的 bam 文件进行逐行排序。
使用 samtools index 对已排序的 .bam 文件进行索引,生成二进制的 samtools 格式索引文件,该文件是基因组可视化工具所必需的。最后,在 Integrative Genomics Viewer 中打开已排序的文件。
bam 并按文件索引。将 SCRAP 的修改版本应用于先前发表的测序数据集,揭示了 miRNA 与内含子区域相互作用的减少。
通过使用 SCRAP 进行 Peak_Calling 以分离高置信度相互作用后,观察到了该降低现象。
查看完整文字稿并访问数千部科学视频
本研究介绍了一种开源生物信息学分析流程的安装与实际应用方案,该流程旨在分析嵌合RNA测序数据,有助于深入理解体内RNA:RNA相互作用。
全基因组范围内绘制小非编码RNA(sncRNA)与靶标RNA相互作用图谱,对于降低靶点验证风险并阐明早期发现阶段的调控机制至关重要。SCRAP计算分析流程可帮助生物制药团队从嵌合RNA测序文库中提取具有可操作性的定量相互作用数据,相较于仅依赖预测的方法,显著降低了结果的不确定性。该能力有助于提升预测的可信度,并在RNA靶向治疗药物发现的关键转折点上为项目组合的优先级筛选提供决策依据。
SCARP 流程整合了发现生物学与数据分析之间的接口,将高通量测序与可操作的靶点验证结果相结合。