本方案概述了一种利用TCGA和GEO数据集识别子宫内膜癌中与烟酰胺代谢相关基因的计算方法。为促进生物标志物的发现并提高子宫体子宫内膜癌的风险评估能力,本研究描述了差异表达分析、通路富集分析、预后模型构建及评估流程。
研究文章
本方案概述了一种利用TCGA和GEO数据集识别子宫内膜癌中与烟酰胺代谢相关基因的计算方法。为促进生物标志物的发现并提高子宫体子宫内膜癌的风险评估能力,本研究描述了差异表达分析、通路富集分析、预后模型构建及评估流程。
子宫内膜癌(EC)在全球范围内属于发病率最低的妇科肿瘤之一,但由于人口老龄化和肥胖问题,其发病率呈上升趋势。在子宫体子宫内膜癌(UCEC)中,淋巴结转移仍较为常见,因此需要新的预后生物标志物来指导治疗。本研究分析了癌症基因组图谱(TCGA)中的UCEC数据,并利用基因表达综合数据库(GEO)对结果进行验证。共鉴定出18个与烟酰胺代谢相关的差异表达基因(NMRDEGs)。基因集富集分析(GSEA)表明,这些基因在氧化应激、缺氧、糖酵解和凋亡过程中发挥重要作用。单变量Cox回归分析筛选出6个关键基因(AURKA、CDKN3、FOXM1、CDKN2A、TK1和CDK1),并基于此构建了风险预测模型。蛋白质-蛋白质相互作用(PPI)分析进一步揭示了其他枢纽基因,如CDK2、CCNA2、TP53和FOXM1。这6个关键基因具有较强的预后价值,且本研究建立的风险模型可为临床决策提供参考。研究发现,烟酰胺代谢与EC的进展显著相关。本研究为理解烟酰胺代谢在EC中的作用提供了新视角,并提示了潜在的治疗发展方向。
子宫内膜癌(EC)在女性患者中较为常见1。EC可分为激素依赖型和激素非依赖型2。2020年,子宫内膜癌患者管理指南的更新纳入了分子标志物检测和分子分型,显著影响了EC术后的辅助治疗及临床预后3。EC的发病机制复杂,涉及多个癌基因和/或抑癌基因的突变或缺失,以及多条信号通路的异常,这些因素均可影响疾病的进展和结局。寻找新的生物标志物并确定有效的治疗靶点至关重要。这一研究方向旨在深入理解EC的发病机制及潜在的预后生物标志物,为早期诊断和靶向治疗奠定基础。
烟酰胺与烟酸结构相似,在脂肪吸收和糖原分解过程中发挥重要作用。作为人体内重要的辅酶组分,烟酰胺是维持正常生理功能所必需的。烟酰胺代谢包括人体吸收、转化和利用烟酰胺的全过程。
烟酰胺代谢始于吸收。它可通过食物摄入或体内氨基酸转化获得,并由肠黏膜上皮细胞吸收。随后转化为更复杂的分子形式,参与多种生物化学过程。此外,烟酰胺还可转化为其他化合物,包括代谢产物1-甲基烟酰胺。 通过 烟酰胺腺嘌呤二核苷酸甲基转移酶(NMT)。这些转化过程可能影响多种代谢性疾病的起始与进展。据报道,补充烟酰胺具有多种有益作用,包括肿瘤的预防与治疗4目前的实验证实,它可下调肺癌细胞中STAT3Y705的磷酸化水平5一项研究发现,单独使用烟酰胺可抑制高危患者的侵袭性非黑色素瘤膜肿瘤6. Kourtzidis 等7 发现补充烟酰胺可抑制大鼠体重增加,增强转酮醇酶(TK)和红细胞 Na+-K+-ATP 酶的活性,并影响机体能量代谢。先前的研究已将烟酰胺 N-甲基转移酶(NNMT)——一种甲基转移酶——视为癌症相关成纤维细胞活性中的一个重要因素。8此外,烟酰胺磷酸核糖转移酶已被证明在复发性急性髓系白血病干细胞区室中参与维奈托克耐药的发生9因此,本研究旨在全面识别与子宫内膜癌(EC)风险相关的NAD+代谢相关基因(NMRGs)。
访问受限。请登录或开始试用以查看此内容。
本研究使用了来自癌症基因组图谱(The Cancer Genome Atlas)和基因表达综合数据库(Gene Expression Omnibus)的公开、去标识化的临床及转录组学数据。所有原始研究均已获得机构审查委员会的批准并取得知情同意。由于仅对匿名化数据进行了二次分析,因此无需额外的伦理审批。所使用的数据库和软件列于材料表中。
1. 数据下载
本研究采用了子宫内膜癌(TCGA-子宫体子宫内膜癌(TCGA-UCEC))数据集10,该数据集包含589个样本,其中包括554份来自UCEC患者的肿瘤组织样本(UCEC组)以及35份相邻正常组织的测序数据(正常组)。通过UCSC Xena数据库获取相应的临床资料11,并排除了临床信息不完整的样本。最终共有577个带有临床数据的样本可用于分析。详细的基线信息见表1。
使用 GEOquery 软件包13下载了与 EC 相关的其他数据集 GSE115810 和 GSE6367812。将 GSE115810 数据集与 GSE63678 合并,以构建联合数据集用于进一步分析(表 2)。
NAD+代谢相关基因(NMRGs)位于GeneCards记录之后14 以及相关文献15使用 "烟酰胺代谢" 在 GeneCards 中以该搜索词进行检索,共鉴定出 345 个相关性评分高于 4 的 NMRGs。将文献中发现的 42 个 NMRGs 合并并去除重复项后,共获得 371 个 NMRGs(补充表1)。临床数据以.tsv表型文件形式获取,数据以HTSeq-FPKM格式下载。若样本的临床数据缺失超过20%,则予以排除。FPKM值进行log转换2-经转换并计算为每百万转录本(TPM)。对于GEO数据集,将探针ID映射至基因符号,重复探针的数值取平均值。
2. 烟酰胺代谢差异表达基因
研究首先应用 R 的 sva 包16 对 GSE115810 和 GSE63678 数据集进行去批次处理,得到一个包含 31 个子宫内膜癌(UCEC)样本和 8 个相邻正常样本的整合数据集。随后,利用 limma 包17 对 TCGA-UCEC 数据集进行差异基因表达分析。
通过将TCGA-UCEC分析得到的差异表达基因(DEGs)与337个烟酰胺代谢相关基因(NMRGs)取交集,以确定与烟酰胺代谢相关的差异表达基因。由此获得一组烟酰胺代谢相关差异表达基因(NMRDEGs),并以维恩图进行可视化展示。ggplot2 R软件包18用于展示差异表达分析的结果,同时使用pheatmap软件包19生成NMRDEGs的热图。通过ComBat(经验贝叶斯法)进行批次校正,以消除不同数据集之间的批次差异。差异表达基因分析采用limma经验贝叶斯线性模型框架。明确应用的差异表达阈值如下:
|log2FC| ≥ 1
FDR 小于 0.05。
NMRG 列表仅与同时满足两个条件的差异表达基因相交。使用 ggplot2 和 pheatmap 绘制火山图和热图。
3. NMRDEGs 功能(GO)与通路(KEGG)富集分析
GO20 和 KEGG21 富集分析通过 clusterProfiler 软件包22 完成。两项分析的显著性阈值均设定为 p. adjust< 0.05 和 FDR(q 值)< 0.25。本研究还将 logFC 值整合到富集分析中,并以环形图和弦图展示结果。富集显著性阈值:校正 p 值 < 0.05,FDR < 0.25(q 值)。GO 和 KEGG 分析均使用 Cluster Profiler 进行。基因表达方向性通过整合 log2 倍数变化数据的弦图和环形图展示。
4. 基因集富集分析(GSEA)
利用GSEA23可鉴定出对表型贡献最大的可遗传因子集合。在本分析中,TCGA-UCEC数据集根据logFC值进行排序,并使用clusterProfiler软件包进行富集分析。关键参数设置包括随机种子值为2022,以及进行10,000次置换检验。分析中采用了MSigDB基因集"c2.all.v2022.1.Hs.symbols.gmt"24。通过山形图可视化了最显著富集的通路,包括Manalo低氧诱导基因、氧化应激诱导的衰老、糖酵解以及凋亡通路。在进行GSEA之前,基因按log2倍数变化值进行排序。分析中使用了10,000次置换检验。c2.all.v2022.1.Hs.symbols.gmt为所使用的MSigDB基因集集合。为保证结果可重复性,采用了固定的随机种子值(2022)。显著性通路的筛选标准为p < 0.05且q < 0.25。
5. Cox 模型构建及相关预后分析
为了确定与烟酰胺代谢相关的差异表达基因(NMRDEGs)在子宫内膜癌(UCEC)中的预测价值,研究人员采用单变量Cox回归分析首先筛选候选遗传因素;将危险比(HR)>1且p值<0.1的因素确定为适用于多变量Cox相对风险模型。
单变量Cox筛选标准:p < 0.10 和 HR > 1. 日志2- 在多变量Cox模型中采用了TPM标准化的表达值。Cox系数的线性组合 × 利用基因表达确定风险评分。在列线图校准中采用了1年、3年和5年的总生存(OS)概率。在时间依赖性ROC分析中采用了1年、3年和5年的AUC值。采用surv_cutpoint最大统计量法确定生存截断值。KM分析和ROC分析使用相同的阈值。
根据多变量Cox模型构建了列线图,以评估其准确性或预测能力,并计算1年、3年和5年总生存率的概率。采用校准曲线评估预测概率与实际结果之间的一致性,同时使用决策曲线分析(DCA)来衡量该模型的临床实用性25。
mRNA 表达水平通过 DESeq2 软件包确定,以每百万条归一化 log₂ 转换后的 TPM(Transcripts Per Million)值表示。TPM 值对测序复杂性和基因检测量进行了校正,从而在样本间提供稳健且无偏的表达水平估计。
根据多变量Cox模型的系数,确定每位患者的预后风险评分如下:
风险评分 = Σi 系数(基因i)* mRNA 表达量(基因i) (1)
采用Kaplan-Meier(KM)生存曲线评估基于确定风险评分划分的高风险组与低风险组的整体生存情况。通过时间依赖性受试者工作特征(ROC)曲线在1年、3年和5年时间点对预测模型的效能进行评价26,27。
为了通过高表达和低表达组对基因表达进行分类以实现生存分层,可使用 survminer R 软件包中的 surv_cutpoint 函数。该函数通过最大化标准化的对数秩统计量来确定最佳截断值,从而提供一个无偏且统计上最优的截断点。
每个预后基因的截断值在ROC曲线中以虚线表示。本研究在所有生存和ROC分析中均应用了相同的阈值。
从TCGA下载HTSeq-FPKM格式的RNA-seq数据;临床数据以TSV表型文件形式导入;将FPKM转换为TPM并进行log₂转换;利用平台注释将GEO数据集从探针ID映射到基因符号;同一基因的重复探针取平均值作为单一基因值;排除临床信息缺失超过20%的样本;使用ComBat(经验贝叶斯法)对GSE数据集进行批次校正;通过PCA和箱线图验证批次校正效果;采用标准表达转换技术进行TPM标准化;以数据集来源作为批次变量,使用ComBat进行批次校正;利用limma线性模型(肿瘤 vs. 正常设计矩阵)计算差异表达;根据log₂倍数变化生成排序基因列表,用于GSEA输入;并使用生存分析工具进行单变量和多变量Cox回归分析
6. 基因集变异分析(GSVA)
采用GSVA28评估各聚类间的通路富集情况。在TCGA-UCEC数据集中,50条 hallmark 通路得到富集,其中41条在二元分组间显示出显著差异。使用hallmark基因集进行GSVA分析,以获得每个样本的通路活性;将STRING蛋白相互作用数据导入Cytoscape;采用MCC算法识别枢纽基因;风险评分通过将基因表达值与其Cox回归系数相乘后求和计算得出;利用生存时间ROC分析程序生成时间依赖性ROC曲线。对每个样本,GSVA计算其通路水平的富集得分。采用Wilcoxon秩和检验评估hallmark通路活性的差异。在50条特征性通路中,有41条差异显著(校正后p < 0.05)。
7. 蛋白质-蛋白质相互作用(PPI)系统
使用 STRING 数据库29 并设定相互作用值阈值为 0.70(表示高置信度),构建了一个包含关键基因(AURKA、CDKN3、FOXM1、CDKN2A、TK1 和 CDK1)的蛋白质-蛋白质相互作用(PPI)系统。该网络通过 Cytoscape30 构建,突出了可能在子宫体子宫内膜癌(UCEC)发病机制中发挥关键作用的分子相互作用。采用最大团中心性(Maximal Clique Centrality, MCC)方法31,根据基因在网络中的相互作用得分对其进行排序。识别出相互作用得分最高的前 10 个蛋白序列,包括 CDK2、CDK4、CCNA2、CCNB1、CCNE1、CDK1、TP53 和 FOXM1。进一步分析了这些基因在关键生物学过程中的参与情况。同时利用 GeneMANIA 平台32 预测额外的蛋白质相互作用,以更全面地阐释这些关键基因在 UCEC 进展中的作用。STRING 置信度评分阈值:>0.70(高置信度)。Cytoscape 用于展示该网络。采用最大团中心性(MCC)方法对枢纽基因进行排序。根据 MCC 排序结果确定了相互作用最强的基因(如 CDK2、CCNA2、TP53 等)。使用 GeneMANIA 进行额外的相互作用预测。
8. 技术路线图
本研究采用的整体工作流程与方法总结于图1所示的技术路线图中。该路线图概述了从数据集获取和差异表达分析,到构建预后模型及进行富集分析的各个步骤。
9. 统计学分析
数据处理和统计分析使用 R 程序(v4.3.0)完成。两组间比较采用 Mann-Whitney U 检验或独立样本 t 检验;三组及以上组别比较则采用 Kruskal-Wallis 检验。分类数据通过卡方检验或 Fisher 精确检验进行评估。此外,还进行了 Spearman 相关性分析和 Kaplan-Meier 生存分析;以 p < 0.05 为差异具有统计学意义。
根据数据分布选择相应的统计检验方法:正态分布数据采用学生t检验;非正态分布数据采用Mann-Whitney U检验;多于三组时采用Kruskal-Wallis检验;分类数据采用Fisher精确检验和卡方检验。统计学显著性定义为p < 0.05。
数据可靠性通过预处理检查点来维持,其中箱线图应显示各样本间一致的表达方差,主成分分析(PCA)图应在ComBat校正后显示无批次特异性聚类。热图应体现肿瘤与正常组织的分组情况,火山图应清晰展示基因的上调与下调,这是差异表达基因(DEG)验证的必要条件。对于Cox预测模型,校准图应显示预测生存率与实际生存率的一致性,ROC曲线下面积(AUC)值应大于0.65,Kaplan-Meier(KM)曲线必须显示出显著的生存差异。基因集变异分析(GSVA)应展示不同风险组之间通路活性的差异,且应与已知机制(如增殖或细胞周期通路)相符。为验证网络的稳健性,蛋白质-蛋白质相互作用(PPI)网络中高度连接的节点应位于中心位置,且由MCC算法确定的枢纽基因应与生理上重要的调控因子相一致。
访问受限。请登录或开始试用以查看此内容。
合并 GEO 数据集的校正
研究使用SVA R软件包对合并的GSE115810和GSE63678数据集进行批次效应校正,生成了一个统一的数据集,称为Combined-Datasets。通过箱线图(图2A、B)和主成分分析(PCA)图(图2C、D)验证了分组结果的消除效果,结果表明批次效应已基本消除。在标准化之后,PCA图应能清晰区分肿瘤样本与正常样本,表明批次校正有效且样本聚类均匀。
差异表达分析
共有499个差异表达基因(DEG)满足筛选标准,其中184个基因上调,315个基因下调(图3A、B)。通过将337个公共NMRG与4...
访问受限。请登录或开始试用以查看此内容。
能量代谢在癌细胞微环境中的作用近年来受到广泛关注。研究表明,参与烟酰胺代谢的基因与多种恶性肿瘤的发生发展密切相关。烟酰胺被机体吸收后可转化为NAD和NADP,二者在众多与癌症相关的过程中发挥关键作用。因此,NAD代谢正成为肿瘤治疗的一个有前景的靶点。它在多种细胞活动中至关重要,包括转录后调控、细胞存活、能量代谢、细胞周期进程、凋亡、DNA修复、昼夜节律、染色体动态以及端粒酶激活。越来越多的证据表明,源自NAD代谢的基因特征在不同类型的癌症中(包括卵巢癌和宫颈癌)具有较强的预测能力33,34。特别是,已有研究指出,在子宫内膜腺癌中Nampt的表达水平显著高于正常子宫内膜组织,提示其可能参与了子宫内膜癌(EC)的发生发展35。此外,既往一项研究鉴定出六个NMRG(SLC22A13、CYP8B1、NMRK1、NAXE、NT5E和NT5M),可作为EC患者可遗传预后标志中的预测因子36。这些发现凸显了NMRG在预测EC预后及指导治疗策...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| clusterProfiler 软件包 | Bioconductor | v4.8.0 | GO 和 KEGG 富集分析 |
| Cytoscape | Cytoscape 联盟 | v3.9.1 | PPI 网络可视化 |
| DESeq2 软件包 | Bioconductor | v1.40.0 | 标准化与表达分析 |
| GeneCards 数据库 | GeneCards 套件 | N/A | 烟酰胺代谢相关基因来源 |
| GeneMANIA 平台 | genemania.org | N/A | 基因功能与相互作用预测 |
| GEO 数据集 (GSE115810, GSE63678) | 基因表达综合数据库 (GEO) | N/A | 子宫内膜癌公共基因表达数据集 |
| ggplot2 软件包 | CRAN | v3.4.2 | 数据可视化 |
| limma 软件包 | Bioconductor | v3.54.0 (示例) | 差异表达分析 |
| pheatmap 软件包 | CRAN | v1.0.12 | 热图绘制 |
| R 软件 (v4.3.0) | 统计计算基金会 R | Version 4.3.0 | 数据分析平台 |
| STRING 数据库 | STRING (string-db.org) | v11.5 | 蛋白质-蛋白质相互作用分析 |
| survminer 软件包 | CRAN | v0.4.9 | 生存分析 |
| sva 软件包 | Bioconductor | v3.46.0 | 批次效应去除 |
| TCGA-UCEC 数据集 | 癌症基因组图谱 (TCGA) | N/A | UCEC 患者的转录组与临床数据 |
| UCSC Xena | 加州大学圣克鲁兹分校 | N/A | 临床/基因组数据下载平台 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可