2021年9月18日
提供了用于RNA测序的差异表达分析方法的详细方案:limma、EdgeR、DESeq2。
用于RNA测序的三种差异表达分析方法:limma、EdgeR 和 DESeq2。打开 RStudio 程序,然后加载R文件DEGs。该文件可从补充文件一中获取。
数据下载与预处理。1.1 从癌症基因组图谱(The Cancer Genome Atlas)下载胆管癌的高通量测序计数数据。此步骤可通过以下代码轻松实现。
单击运行以安装 R 软件包。单击运行以加载 R 软件包。设置工作目录。
选择癌症类型。运行 GDCquery 文件中的 R 代码以下载数据。GDCquery 文件可从补充文件/脚本中获取。
执行后,可下载胆管癌RNA测序计数数据,并将其命名为CNT,其中行代表ensemble基因ID,列代表样本ID。请注意样本ID中第14至15位的数字:数字01至09表示肿瘤组织,10至19表示正常组织。
将基因集ID转换为基因符号。根据注释文件的存储路径将其导入R。注释文件可从补充文件中获取。
运行来自 gtf v22 文件的 R 代码,该文件可从补充文件/脚本中获取。应用函数将 ensemble 基因 ID 转换为基因符号。1.3。
过滤低表达基因。点击运行以安装 edgeR 软件包“点击运行以加载 R 软件包 edgeR”运行以下 R 代码,保留至少在两个样本中每百万计数(counts per million)大于 1 的基因。二、通过 limma 进行差异表达分析“点击运行以安装 R 软件包 limma”点击运行以加载 R 软件包 limma“edgeR”运行以下 R 代码以创建设计矩阵。
提取组别信息。将01设为肿瘤组织。将11设为正常组织。
创建设计矩阵。创建 DGEList 对象。对数据进行标准化。
运行以下 R 代码以执行基于 limma-trend 方法的差异表达分析。计算 CPM 值。单击“运行”以拟合线性模型来预测数据或推断变量之间的关系。
基于贝叶斯方法计算 T 值、F 值和对数似然比。提取结果表格。差异表达分析的结果保存在 res_limma 中,其中包含 log2 倍数变化值。
该基因在实验中的平均 log2 表达水平。经修正的 T 统计量、P 值、经错误发现率校正的 p 值以及差异表达基因的 log-odds 值。识别差异表达基因。
因此,调整后的 P 值小于 0.05,且 log 倍数变化的绝对值大于或等于 2,是筛选差异表达基因的阈值。res limma 结果显示,与正常组织相比,胆管癌组织中有 1,443 个基因上调,1,880 个基因下调。将结果表格输出至文件。
单击“运行”以安装 R 软件包 ggplot2。“单击运行以加载 R 软件包 ggplot2”。运行火山图文件中的 R 代码以生成火山图,该火山图文件可从补充文件中获取。基因可根据其 log2 倍数变化和校正后的 P 值映射到不同的位置。因此,上调的差异表达基因以红色显示。
下调的差异表达基因以绿色显示。点击“导出”以保存火山图。三、通过 edgeR 进行差异表达分析:点击“运行”以加载 R 软件包 edgeR,运行以下 R 代码以创建设计矩阵。
单击“运行”以创建 DGEList 对象并标准化数据。单击“运行”以估计基因表达值的离散度。单击“运行”以对计数数据进行模型拟合。
进行统计检验。提取结果表格。结果保存在 res edgeR 中,包括对数倍数变化值、logCPM、F 值、p 值以及经错误发现率校正的 p 值。
鉴定差异表达基因。edgeR 分析结果表明,与正常组织相比,胆管癌组织中有 3,121 个基因上调,1,578 个基因下调。将结果表格输出至文件。
创建火山图。点击导出以保存火山图。四、通过 DESeq2 进行差异表达分析。
单击“运行”以安装 R 软件包 DESeq2”“单击“运行”以加载 R 软件包 DESeq2”运行以下 R 代码以确定分组因子。创建 DESeq2 数据集对象。执行分析。
生成结果表格。结果保存在 res DESeq2 中,包括标准化读段数的均值、log 倍数变化值、log 倍数变化标准误、检验统计量、原始 P 值以及校正后的 P 值。识别差异表达基因(DEGs)。
DESeq2 分析结果显示,与正常组织相比,胆管癌组织中有 2938 个基因上调,1616 个基因下调。将结果表格输出至文件,并绘制火山图。
单击导出以保存火山图。五、维恩图。单击运行以安装 R 软件包 venn diagram。
单击“运行”以加载R软件包venn diagram。绘制上调差异表达基因的维恩图。单击“导出”以保存维恩图,绘制下调差异表达基因的维恩图。
单击导出以保存维恩图。六、代表性结果。图一展示了通过limma、edgeR和DESeq2获得的所有基因的火山图。
负对数 p 值对数倍数变化作图。红色点表示上调的差异表达基因,绿色点表示下调的差异表达基因。Limma 鉴定出胆管癌组织中一千八百八十个下调的差异表达基因和一千四百四十三个上调的差异表达基因。
EdgeR 鉴定出 1578 个下调的差异表达基因,以及 3121 个上调的差异表达基因。DESeq2 鉴定出 1616 个下调的差异表达基因,以及 2938 个上调的差异表达基因。图 2 的维恩图展示了 limma、edgeR 和 DESeq2 分析结果之间的重叠部分。
比较这三种方法的结果,共有1431个上调的差异表达基因和1531个下调的差异表达基因存在重叠。七、结论。在本方案中,我们提供了利用R软件包limma、edgeR和DESeq2对高通量测序计数数据进行多种差异分析的详细操作流程。这三种方法在分析流程中具有相似性与共通之处。
这三种药物的作用在一定程度上存在重叠。三种药物各自具有其优势,具体选择仅取决于您的数据采集时间。
如果有我的当前数据,应优先使用 limma;但对于测序数据,则优先使用 edgeR 和 DESeq2。
查看完整文字稿并访问数千部科学视频
本文介绍了一种适用于RNA测序的差异表达分析方法的详细实验方案。所讨论的方法包括limma、EdgeR和DESeq2,这些方法对于基因表达数据的分析至关重要。
RNA-seq 数据的差异表达分析是肿瘤治疗领域中靶点验证和生物标志物发现的基础步骤。可靠地识别肿瘤组织与正常组织之间差异表达基因的能力,有助于降低治疗假设的机制性风险,并支持早期发现阶段基于数据的立项/终止决策。limma、EdgeR 和 DESeq2 的标准化应用可提高靶点优先排序工作流程中的可重复性及跨部门协作的一致性。
该方法可融入从靶点鉴定到先导化合物优化的药物发现全过程,支持肿瘤药物发现中的假设验证、检测准备以及基于数据的决策制定。