2022年2月18日
核糖体在翻译过程中以每密码子三个核苷酸的规律解码生成肽链。核糖体沿mRNA移动的过程通过核糖体谱型分析(ribosome profiling)得以捕获,产生具有典型三联体周期性的足迹信号。本实验方案介绍如何利用RiboCode从核糖体谱型数据中解析这一显著特征,从而在全转录组水平上鉴定处于活跃翻译状态的开放阅读框。
核糖体谱分析实验产生的测序数据的解读对于定量测量核糖体在mRNA上的翻译活性以及研究翻译调控机制至关重要。在本方案中,我们将描述利用核糖体谱分析数据及RiboCode(一种命令行工具)在全基因组尺度和单核苷酸分辨率下解码mRNA翻译的计算流程。该方法可用于搜索来自已注释蛋白质编码基因以外基因组区域的新肽段,并提供量化mRNA翻译速率的机会。
首先,打开一个 Linux 终端窗口,通过执行命令创建一个 conda 环境。切换到所创建的环境,并通过执行命令安装 RiboCode 及其依赖项。为获取参考序列的基因组参考文件,请访问 Ensembl 网站,然后点击下载,接着选择 FTP 下载。
在网站页面的表格中,点击“DNA FASTA”列中的 FASTA 选项,并选择物种为 human 的那一行。在 Ensembl 网站页面中,按照文中所述复制链接,然后在终端中执行命令以下载并解压文件。对于参考注释,右键单击最后一个打开网页中“gene sets”列下的 GTF。
复制链接,并使用命令下载。要获取rRNA序列,请打开UCSC基因组浏览器,然后点击工具,在下拉列表中选择表格浏览器。在UCSC基因组浏览器页面上,将进化分支(clade)设为哺乳动物(mammal),基因组(genome)设为人类(human),分组(group)设为所有表格(all tables),表格(table)设为R mask,区域(region)设为基因组(genome)。
对于筛选器,点击“创建”进入新页面,并将重复类别设置为匹配 rRNA。点击提交,然后将输出格式设置为序列,输出文件名设置为 HG38_rRNA.FA。最后,点击获取输出,然后选择获取序列以提取 rRNA 序列。
从序列读取档案中获取核糖体谱型数据集,下载 si-eIFe 处理组的重复样本,并通过执行命令重命名。然后下载对照组的重复样本,并通过执行命令重命名。为去除核糖体 RNA 污染,通过执行命令开始对核糖体 RNA 参考序列进行索引。
索引完成后,通过执行命令将测序读段比对至rRNA参考序列,以排除来源于rRNA的读段。首先通过执行命令创建基因组索引。然后通过执行命令将不含rRNA污染的干净读段比对至所构建的参考序列,并通过执行命令对比对文件进行排序和索引。
通过执行命令来制备转录本注释。选择特定长度的核糖体保护片段,并通过执行命令确定其P位点位置。编辑每个样本的配置文件并将其合并。
然后通过执行命令运行 RiboCode。读段长度的频率分布显示,大多数核糖体保护片段对应于 25 至 35 个核苷酸。通过分析这些片段五端与注释的起始密码子和终止密码子之间的距离,确定了不同长度核糖体保护片段的 P 位点位置。
定位结果表明,有10,394个基因编码已注释的开放阅读框。此外,509个和168个基因分别编码上游和下游开放阅读框,另有939个基因编码的开放阅读框位于已知注释开放阅读框的上游或下游区域,并与之重叠。此外,68个蛋白质编码基因和2,601个非编码基因编码新型开放阅读框。
长度分布显示,上游、下游、新发现的以及重叠的开放阅读框均短于已注释的开放阅读框。计算了每个开放阅读框的相对核糖体保护片段数,结果显示,在eIF3e缺陷细胞中,上游开放阅读框的核糖体密度显著高于对照细胞。通过全基因分析发现,大量核糖体在起始密码子下游第25至75个密码子之间停滞,提示在eIF3e缺陷细胞中,翻译延伸可能在早期即受到阻断。
分析了PSMA6基因上游开放阅读框和SENP3-EIF4A1基因下游开放阅读框的P位点密度分布图,展示了核糖体保护片段的周期性模式及其密度特征。为了评估不同长度reads的周期性特征,有必要检查已知蛋白质编码区起始密码子和终止密码子周围的reads分布位置。RiboCode与另一款命令行工具RiboMiner结合使用,还可进行质量控制以及多种分析,例如对预测的开放阅读框上的核糖体占据情况进行定量和可视化分析。
该计算工具提供了一种高通量方法,可利用核糖体谱分析数据在特定生理背景下识别非常规翻译事件,以及翻译如何响应刺激而发生调控。
查看完整文字稿并访问数千部科学视频
本研究探讨了核糖体谱分析数据的计算解读方法,以加深对mRNA翻译调控的理解。利用RiboCode,研究人员能够在全基因组水平上鉴定出活跃翻译的开放阅读框(ORFs),揭示非经典肽段及其翻译动态的相关见解。
核糖体谱分析能够实现对活跃翻译的开放阅读框进行全基因组范围的检测,通过揭示依赖于特定环境的翻译事件,支持靶点验证。RiboCode 提供了一种可扩展的计算工作流程,用于鉴定新肽段并量化核糖体占据情况,有助于在早期发现阶段降低机制相关风险。该方法通过将翻译活性与生理刺激相联系,提高了先导化合物筛选中的预测可信度。
RiboCode 通过提供全基因组范围的翻译读出结果,融入从早期靶点验证到先导化合物鉴定的发现全过程。