2017年8月16日
我们提供了一种标准化的转录组数据基因集富集分析方案,用于确定适用于转化研究的理想小鼠模型。
该方案可用于DNA微阵列和RNA测序数据,若有相应数据,亦可进一步扩展至其他组学数据。
本实验的总体目标是为转化研究问题确定合适的动物模型。该方法有助于回答转化研究中的一个关键问题,即:针对我想要研究的特定人类疾病,如何选择合适的动物模型?该技术的主要优势在于,能够比较动物模型与人类疾病研究之间的全基因组数据。
因此,这种方法避免了与单个基因比较相关的有偏解释。尽管该方法可为小鼠模型在炎症性疾病中的适用性提供见解,但也可应用于其他疾病模型。GSEA 有助于深入探究基因表达研究中的通路调控机制。
每种动物模型和疾病研究的结果是进行进一步比较的基础。首先按照文本方案中的描述,下载软件和数据,并进行数据处理和格式化。然后打开GSEA软件工具。
单击主窗口左侧的“加载数据”按钮。将打开一个新标签页以导入所需的数据文件。在新标签页中,浏览并选择基因表达数据文件和表型文件。
如果 GSEA 无法连接互联网,则还需加载已下载的分子特征数据库文件和 DNA 芯片注释文件。成功导入的数据将显示在数据加载部分。单击主窗口左侧的“运行 GSEA”按钮。
将打开一个新标签页以设置分析参数。该标签页分为三个部分:必填字段、基本字段和高级字段。在必填字段中,首先选择表达数据集。
然后从已连接的网站或手动导入的基因集文件中选择基因集数据库。编辑表型标签,以选择需要相互比较的样本组。例如,疾病组与健康对照组。
接下来,选择“将数据集折叠为基因符号”为“true”,以将表达数据集中的探针标识符转换为基因集数据库中使用的官方 HUGO 基因符号。如果表达数据集已包含 HUGO 基因符号,则选择“false”。将置换次数设置为默认的 1,000 次。
将置换类型更改为基因集,因为表型置换仅在每种表型包含超过七个样本时推荐使用。最后,从所连接的网站或手动导入的DNA芯片注释文件中选择用于生成基因表达数据的芯片平台。在基本参数区域,编辑分析名称以及结果保存文件夹。
此外,还可以更改其他统计参数。有关参数和高级字段部分的更多详细信息,请参阅 GSEA 用户指南。如果应用了外部计算的基因表达数据分组指标,请使用 GSEA 预排序工具。
该分析基于一个简单的基因列表进行,这些基因已预先分配给预先计算的分组指标,用于对基因进行排序。加载替代的基因表达文件后,转到主导航栏,点击 Tools(工具),然后选择 GseaPreranked(GSEA 预排序)。同样,将打开一个新标签页以设置分析参数。
接下来,单击窗口右下角的“运行”按钮。在 GSEA 报告部分中,单击已成功完成的分析以打开分析结果。然后,单击 Excel 格式的详细富集结果,将分析结果导出到电子表格中。
分别导出两种表型的结果。在 Excel 中将结果数据合并到一个电子表格文件中。为便于后续比较多个研究的基因表达数据,至少应保留基因集名称、标准化富集评分及其 FDR 值。
对第二项研究以及所有需要相互比较的后续研究重复进行基因集富集分析。应纳入尽可能多的人类临床研究和不同的小鼠模型,以确定最适合该转化研究问题的小鼠模型。为了鉴定能够最佳模拟人类情况的动物模型,需将所有研究的GSEA结果相互进行比较。
利用富集分数和FDR值将通路分类为激活、抑制或无显著变化。对于多个需要比较的研究,建议使用R脚本。针对每两个研究之间的比较,统计由3×3列联表所示的九种可能通路调控组合各自出现的次数。
通过计算阳性预测值和阴性预测值来评估两项研究之间的相关性,其中阳性预测值和阴性预测值定义为在两项研究中显示相同调控方向的通路部分。同时,估计仅因偶然因素而预期相关的通路部分,以偶然阳性预测值(ppv chance)和偶然阴性预测值(npv chance)表示。然后计算信息增益。
所有计算均可使用电子表格程序完成,但建议使用 R 函数。利用一对研究的列联表,通过卡方检验计算 P 值,例如可使用 R 函数卡方检验或电子表格程序。将列联表的数据存储于矩阵 X 中。接下来,比较所选用于分析的研究之间所有组合的 GSEA 结果。
按信息增益对所有组合进行排序。在比较多个数据集时,使用矩阵并通过彩色热图可视化结果。选择信息增益最高的动物模型。
为了评估信息增益的重要性,还需考虑卡方检验。此处展示了人类与小鼠研究之间通路比较的相关性矩阵。通路调控的重叠部分表示从一项研究中获得的信息增益,可用于预测另一项研究中的效应。
蓝色表示数据之间相关性低,红色表示数据之间相关性高。人类与小鼠数据集的比较揭示出一组小鼠模型与人类研究具有高度相关性。因此,这些小鼠模型最适合用于模拟人类情况。
相比之下,第七、第八和第九项研究未显示出与人类疾病研究的相关性。一旦掌握,只要操作得当,该技术可在数天内完成。具体耗时取决于数据量及数据的可获得性。
在进行该实验操作时,重要的是要牢记,结果的有效性取决于所选数据的质量和相关性。观看本视频后,您应能够充分理解如何根据转录组数据为特定的人类疾病选择合适的动物模型。
查看完整文字稿并访问数千部科学视频
本文介绍了一种用于转录组数据基因集富集分析(GSEA)的标准化方案,旨在识别适用于转化研究的小鼠模型。该方法通过比较动物模型与人类疾病研究之间的全基因组数据,为多种疾病的模型选择提供依据。
选择合适的动物模型在转化研究中仍然是一个关键挑战,模型不匹配会导致后期研究的失败。本方案通过利用小鼠模型与人类疾病数据的转录组一致性进行系统性评估,减少对主观基因筛选的依赖。通过提供基于GSEA的标准化框架,该方法可在发现早期支持对模型选择的预测信心,并为“继续/终止”决策提供依据。
该方法适用于从靶点验证到临床前模型筛选的整个发现流程,可在对筛选或药效研究进行大量投入之前,利用转录组学数据指导动物模型的选择。