$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
分析工作流程概述
本研究的转录组学与基于机器学习的分析整体设计如图1所示,涵盖以下关键步骤:肾素-血管紧张素系统相关基因(RASRGs)的收集;从高血压数据集中筛选与肾素-血管紧张素系统相关的差异表达基因(RASRDEGs);功能富集分析(GO/KEGG/GSEA);免疫浸润分析(CIBERSORT);蛋白质-蛋白质相互作用(PPI)及调控网络的构建;基于机器学习的关键基因筛选(逻辑回归、随机森林[RF]);以及高血压诊断模型的评估。本研究中使用的所有软件、数据库和在线工具的完整列表见材料表。
数据下载
高血压数据集 GSE753608 和 GSE74144(Homo sapiens)通过 R 软件包 GEOquery9 从 GEO 数据库10 获取。GSE75360 来源于外周血单个核细胞(平台:GPL10558),包含 10 个高血压样本和 11 个对照样本;GSE74144 来源于白细胞(平台:GPL13497),包含 14 个高血压样本和 8 个对照样本(表 1)。最初通过 GeneCards11(关键词:“肾素-血管紧张素系统”)和 PubMed(关键词:“肾素-血管紧张素系统”)12,13 鉴定出 1,264 个编码蛋白的 RAS 相关基因(RASRGs)。将这些 RASRGs 与 GSE75360/GSE74144 中的基因取交集,最终获得 1,159 个 RASRGs14。由于两个数据集基于不同的微阵列平台生成,因此分别进行处理。探针注释依据相应的 GPL 平台注释文件进行,下游分析使用标准化后的基因表达矩阵。通过箱线图比较标准化前后表达分布情况。
高血压相关的肾素-血管紧张素系统差异表达基因
GSE75360 数据集中的样本被分为高血压组和对照组。采用 limma 软件对两组之间进行差异基因表达分析14,差异表达基因(DEGs)的筛选阈值为 |logFC| > 0.45 且 p 值 < 0.05。差异分析结果通过火山图进行可视化(使用 R 软件包 ggplot2 生成)。
为了获得RAS相关差异表达基因(RASRDEGs),将满足上述阈值(|logFC| > 0.45,p值 < 0.05)的差异表达基因(DEGs)与RAS相关基因(RASRGs)进行比对,其交集结果通过维恩图展示。随后,利用R软件包pheatmap将所鉴定的RASRDEGs的表达模式以热图形式可视化,并使用R软件包RCircos生成染色体图谱以展示RASRDEGs的染色体定位15。
差异表达基因验证与ROC曲线分析
构建组间图以分析GSE75360数据集中高血压/对照组之间RASRDEG的表达差异16,使用R软件包pROC绘制ROC曲线并计算AUC(0.5–0.7:低准确性;0.7–0.9:中等;>0.9:高),评估RASRDEG的诊断效能。
相关性分析
在GSE75360中对RASRDEG的表达进行了Spearman相关性分析;结果通过热图可视化(R软件包ggplot2)(|r| < 0.3:无/弱相关性;0.3–0.5:弱相关;0.5–0.8:中等相关;>0.8:强相关)。
GO 与 KEGG 富集分析
GO(基因本体,2024年版本,http://geneontology.org/)是广泛用于大规模功能富集分析的资源,涵盖三个领域:生物过程(BP)、细胞组分(CC)和分子功能(MF)17。KEGG(京都基因与基因组百科全书,版本109.0,2024年,https://www.genome.jp/kegg/)存储了关于基因组、生物通路、疾病和药物的数据18。
使用R软件包clusterProfiler对RASRDEGs进行GO注释和KEGG通路富集分析19。富集检验方法:超几何检验;多重检验校正方法:Benjamini-Hochberg(BH)法。筛选标准:校正后p值 < 0.05。
基因集富集分析(GSEA)
对于队列水平的基因集富集分析(GSEA),GSE75360 差异表达分析中所有检测的基因均按照 logFC 值降序排列,并作为输入基因列表用于 clusterProfiler19。在 GSEA 前未对差异表达基因(DEG)进行预筛选。基因集来源于 MSigDB 的 c2 基因集集合20。参数设置:seed = 2022,每基因集包含 10–500 个基因;筛选标准:校正后 p 值 < 0.05(Benjamini-Hochberg,BH 法),FDR < 0.2521。
高血压诊断模型的构建
为了鉴定与高血压相关的关键基因,我们采用了两种机器学习算法:逻辑回归和随机森林(RF)。逻辑回归(二分类因变量:高血压/对照)筛选出RASRDEGs,其p值<0.05。随机森林(RF,R软件包randomForest)的参数设置为set.seed(520),ntree = 1000;提取MeanDecreaseGini(变量重要性指标),并选取排名前15的RASRDEGs。RASRDEGs的筛选标准为p值<0.05。
采用 R 软件包 randomForest22(参数:set.seed(520),ntree = 1000)应用了属于 Bagging 类别(集成多个决策树)的随机森林(Random Forest, RF)算法。提取特征基因的平均 Gini 重要性降低值(MeanDecreaseGini,反映节点分裂过程中平均纯度降低程度以衡量变量重要性),筛选出前 15 个 RASRDEGs。最后,绘制通过逻辑回归和随机森林筛选出的基因的维恩图,以鉴定与高血压相关的关键基因。
高血压诊断模型的验证
基于关键基因构建了逻辑回归模型;线性预测值(η)的计算公式如下:
![figure-protocol-1 基因表达模型方程,η = 截距 + Σ [基因系数 × 基因的mRNA表达量]。](/files/ftp_upload/71252/71252eq1.jpg)
采用 R 软件包 pROC16 绘制 ROC 曲线,并评估模型在预测高血压风险方面的效能。通过 R 软件包 rms23 构建列线图,以可视化各关键基因在逻辑回归模型中的贡献(反映关键基因与高血压风险之间的关联)。生成校准曲线以评估预测的高血压概率与实际概率之间的一致性;并利用决策曲线分析(DCA,R 软件包 ggDCA24)评估该模型在中国台湾 GSE75360 和 GSE74144 数据集中的临床应用价值(净获益)。
单基因 GSEA
基因集富集分析(GSEA)通过分析特定基因的表达情况,探索与该基因相关的基因在生物过程/通路/疾病中的作用,有助于理解该基因的功能角色。对于GSE75360中的每个目标基因,样本按中位数分为高表达组和低表达组。随后对所有检测的基因进行差异表达分析,并将全基因组范围的logFC值从高到低排序,再进行基于clusterProfiler19的GSEA分析。GSEA分析前未对差异表达基因(DEG)进行预筛选。参数设置:seed = 2020,每基因集包含10–500个基因(来自MSigDB21的c2基因集集合)。筛选标准:p < 0.05(经BH方法校正的调整后p值)。
免疫浸润分析(CIBERSORT)
CIBERSORT 算法25(基于线性支持向量回归)对转录组矩阵进行去卷积,以估算混合样本中的免疫细胞组成(选择免疫细胞富集评分> 0 的数据)。GSE75360 的最终免疫细胞浸润矩阵通过比例条形图进行可视化。采用斯皮尔曼相关性分析免疫细胞与免疫细胞之间以及关键基因与免疫细胞之间的关联,结果分别以相关性热图(R 软件包 pheatmap)和相关性气泡图(R 软件包 ggplot2)呈现。
蛋白质-蛋白质相互作用(PPI)网络
蛋白质-蛋白质相互作用(PPI)网络是由通过相互作用调控生物学过程的相互连接的蛋白质组成的系统。利用 STRING 数据库26,构建了关键基因的 PPI 网络(最低相互作用评分:0.150,低置信度)。通过筛选相互作用基因,选出与肾素-血管紧张素系统相关的枢纽基因。GeneMANIA 数据库27利用基因组和蛋白质组数据集识别功能相似的基因,被用于预测关键 RAS 基因的功能相似基因,并构建蛋白质相互作用网络。
调控网络的构建
mRNA-TF 网络:转录因子(TFs)通过与靶基因的转录后相互作用来调控基因表达。靶向枢纽基因的转录因子及其调控关系从 ChIPBase 数据库中获取28,并使用 Cytoscape 可视化 mRNA-TF 网络29。
mRNA-miRNA 相互作用网络:miRNA 调控多个靶基因(单个靶基因可能被多个 miRNA 共同调控)。采用 StarBase v3.030 鉴定与 RASRDEGs 相关的 miRNA,并利用 Cytoscape 可视化 mRNA-miRNA 相互作用网络。
mRNA-药物网络:利用毒理基因组学数据库31预测枢纽基因的直接/间接药物靶点。采用Cytoscape可视化mRNA-药物网络(展示基因-药物相互作用),以完成网络构建。
Ang II 诱导的 HUVEC 模型
人脐静脉内皮细胞(HUVECs)在37°C、含5% CO2的湿化培养箱中培养。细胞培养于完全内皮细胞培养基中,培养基中添加胎牛血清和抗生素,具体成分按照供应商说明书配制。为建立体外高血压相关内皮损伤模型,将HUVECs用血管紧张素II(Ang II;100 nM)处理48小时。以溶剂处理的细胞作为对照组。
在基因干预实验中,使用商品化转染试剂,按照制造商说明书将靶向CST3或FURIN的小干扰RNA(si-CST3和si-FURIN)、相应的阴性对照小干扰RNA(si-NC)、CST3或FURIN过表达质粒(oe-CST3和oe-FURIN)以及相应的空载体对照(oe-NC)转染至HUVECs细胞中。转染后,细胞经血管紧张素II(Ang II)处理,随后收集用于表达验证和功能检测。通过qRT-PCR和蛋白质印迹法(western blotting)确认基因敲低和过表达效率。
qRT-PCR
采用标准RNA提取试剂从HUVECs中提取总RNA,并使用逆转录试剂盒合成互补DNA。qRT-PCR检测采用SYBR Green染料法。LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1 和 eNOS 的表达水平以 GAPDH 为内参进行标准化,并通过2−ΔΔCt法计算。
蛋白质印迹法
进行蛋白质印迹分析时,使用 RIPA 裂解缓冲液提取蛋白质,并通过 BCA 法测定蛋白浓度。等量蛋白质经 SDS-PAGE 分离后转移至 PVDF 膜。封闭后,将膜与针对 CST3、FURIN、TBXAS1 或 GAPDH 的一抗孵育,随后与相应的二抗孵育。通过化学发光法检测条带,条带密度经 GAPDH 标准化。培养上清液中分泌的 CST3 采用 ELISA 试剂盒按照制造商说明书进行定量。
细胞活力
采用细胞计数试剂盒-8(CCK-8)检测细胞活力。简言之,将转染并经血管紧张素II(Ang II)处理的人脐静脉内皮细胞(HUVECs)接种于96孔板中,分别在加入CCK-8试剂后的0、24、48和72小时测定450 nm处的吸光度。细胞迁移能力通过Transwell小室实验进行评估。经指定干预处理后,将细胞接种至Transwell上室,对迁移至下室膜表面的细胞进行固定、染色,并在显微镜下随机选取视野进行计数。
炎症检测
为评估炎症活化、氧化应激及内皮功能,采用qRT-PCR检测IL-6, TNF-α, VCAM1, ICAM1和eNOS的mRNA水平。使用商用NO检测试剂盒测定培养上清液中一氧化氮(NO)的含量,并根据试剂说明书,通过DCF荧光法检测细胞内活性氧(ROS)水平。
统计分析
转录组数据的处理与建模在 R 软件中进行。连续变量的正态性通过 Shapiro-Wilk 检验进行评估。对于两组比较,正态分布变量采用独立样本 t 检验,非正态分布变量则采用 Wilcoxon 秩和检验。对于三组或更多组的比较,若满足正态性和方差齐性假设,则采用单因素方差分析并辅以适当的事后检验;否则采用 Kruskal-Wallis 检验。CCK-8 时间序列数据采用双因素方差分析进行分析。关联性分析计算 Spearman 相关系数。除非另有说明,实验结果均以均值 ± 标准差表示,双侧 p < 0.05 被认为具有统计学显著性。