这项双向双样本孟德尔随机化研究利用欧洲人群的全基因组关联研究(GWAS)数据,评估了多发性硬化症(MS)与血液系统恶性肿瘤(HM)之间的因果关系。遗传易感性与MS相关的个体患霍奇金淋巴瘤和未特指类型白血病的风险增加;但在其他亚型或反向分析中未发现显著关联。
研究文章
这项双向双样本孟德尔随机化研究利用欧洲人群的全基因组关联研究(GWAS)数据,评估了多发性硬化症(MS)与血液系统恶性肿瘤(HM)之间的因果关系。遗传易感性与MS相关的个体患霍奇金淋巴瘤和未特指类型白血病的风险增加;但在其他亚型或反向分析中未发现显著关联。
观察性研究已报道多发性硬化症(MS)与血液系统恶性肿瘤(HM)之间的关联,但研究结果仍不一致。我们利用公开的全基因组关联分析汇总统计数据,对MS(n = 115,803)和HM(n = 218,792)进行了双向双样本孟德尔随机化(MR)分析。主要因果效应估计采用逆方差加权(IVW)法,并通过预先设定的敏感性分析对异质性和多效性进行补充评估。遗传预测的MS易感性与白血病(未指定亚型)风险升高相关(比值比[OR] 1.311,95%置信区间[CI] 1.002–1.716,P = 0.048),也与霍奇金淋巴瘤(HL)风险升高相关(OR 1.224,95% CI 1.052–1.425,P = 0.009),但与其他白血病、淋巴瘤或浆细胞肿瘤亚型均无显著关联(所有P > 0.05)。检验结果显示,白血病(未指定亚型)和HL分析中无显著异质性或定向多效性。这些结果提供了遗传学证据,支持具有较高遗传易感性的个体患某些HM亚型的风险升高;然而,该信号应谨慎解读,并需在更大规模、多祖先背景的数据集以及更多因果分析框架下进一步验证。
多发性硬化症(MS)是一种中枢神经系统的慢性自身免疫性疾病,其特征为炎症性脱髓鞘以及复发-缓解病程,可能导致残疾以及沉重的社会和家庭负担1。血液系统恶性肿瘤(HM)是一组起源于造血或淋巴组织的异质性肿瘤,在全球范围内约占所有肿瘤的6.5%2。尽管靶向治疗和免疫疗法已显著改善了许多患者的预后,但部分患者预后仍然较差3。多年来,MS与HM之间的关系已被广泛研究,但结果存在分歧4,5。一项纳入6,883例MS患者和37,919名匹配对照的挪威登记研究显示,MS与血液系统癌症风险之间无统计学显著关联。类似地,一项丹麦研究报道,与普通人群对照相比,MS患者中HM的发病率仅略有升高,但无统计学意义。相比之下,一些队列研究提示在特定背景或亚型中风险更高:一项韩国前瞻性研究报道,MS患者中淋巴瘤的发病率高出4.52倍6;一项大规模队列分析(29,617例MS患者 vs. 296,164例非MS个体)发现,MS组的整体HM风险更高7。然而,其他研究并未观察到已确诊MS患者中非霍奇金淋巴瘤(NHL)或霍奇金淋巴瘤(HL)的风险增加8,9。总体而言,关于两者关联性的证据——特别是针对HM亚型层面——仍不明确。
孟德尔随机化(Mendelian randomization, MR)利用生殖系遗传变异作为可改变暴露因素的替代指标,其原理在于等位基因的分配相对于许多环境混杂因素而言实际上是随机的10。通过使用与特定暴露强烈相关的遗传工具,MR 可增强因果推断能力,并减少混杂因素或反向因果关系带来的偏倚11。
本研究采用双向双样本孟德尔随机化(MR)框架,从遗传学角度评估多发性硬化症(MS)与主要血液系统恶性肿瘤类别——白血病、淋巴瘤和多发性骨髓瘤(MM)——之间潜在的因果关系。原创性声明:据我们所知,这是首个采用双向MR方法系统探究亚型特异性MS与血液系统恶性肿瘤关系的研究,同时预先设定操作参数(工具变量阈值、连锁不平衡剔除、数据协调及敏感性诊断),以确保研究的完全可重复性。
访问受限。请登录或开始试用以查看此内容。
本研究分析了公开可获取的、去标识化的全基因组关联研究(GWAS)汇总水平统计数据。根据数据存储库的政策以及原始研究者所获得的批准,本次二次分析无需新的机构审查委员会批准或额外的个体知情同意。所有参与的GWAS研究均在其原始发表文献中报告了伦理审批和知情同意程序。所有分析均遵循机构指南和《赫尔辛基宣言》的规定进行。
概述与原理
本研究采用双向双样本孟德尔随机化(Mendelian randomization, MR)框架,仅限于欧洲血统的汇总统计学数据,以评估多发性硬化症(multiple sclerosis, MS)与血液系统恶性肿瘤(hematologic malignancies, HM)之间潜在的因果关系。该设计遵循孟德尔随机化的三个核心假设:工具变量相关性、与混杂因素的独立性以及排他性限制。因此,分析流程包括:(i)数据集的获取与整理,(ii)在全基因组显著性水平上选择工具变量并进行连锁不平衡(linkage disequilibrium, LD)剪枝,(iii)利用PhenoScanner进行混杂因素筛查,(iv)等位基因的整合与对称性变异的明确处理,(v)使用Steiger检验¹²评估因果方向性,(vi)采用互补方法进行主要MR效应估计,(vii)全面的敏感性分析诊断,以及(viii)在多重检验校正下生成标准化的图表。后续各实验方案小节将详细描述上述每一步骤,并在图1中展示整个分析流程的概览。
材料、软件和资源识别号(RRIDs)
分析使用 R 4.3.1 版本(RRID:SCR_001905)和 RStudio/Posit 2023.12+(RRID:SCR_000432)进行。本地执行的连锁不平衡剪枝(LD clumping)使用 PLINK v1.9(构建版本 2.3;RRID:SCR_001757)13。孟德尔随机化(MR)估计和数据提取使用 R 程序包 TwoSampleMR v0.5.7 10;对潜在混杂因素的工具变量查询使用 phenoscanner v1.0;异常值的检测与校正使用 MRPRESSO v1.0。对于无 RRID 的程序包,报告了确切版本号。
数据来源与访问
多发性硬化症(MS)的汇总统计学数据来自国际多发性硬化症遗传学联盟的一项荟萃分析,该分析包含15个队列中经过统一质量控制的47,429例MS病例和68,374名对照。血液系统恶性肿瘤(HM)的汇总统计学数据来自FinnGen研究(总样本量 n = 218,792;>1600万个变异位点),包括霍奇金淋巴瘤(HL)、弥漫性大B细胞淋巴瘤(DLBCL)、滤泡性淋巴瘤(FL)、成熟T/NK细胞淋巴瘤(MTNKL)、其他或未特指的非霍奇金淋巴瘤(NHL)、淋巴样白血病、髓系白血病、细胞类型未特指的白血病,以及多发性骨髓瘤/浆细胞肿瘤14。数据集通过IEU OpenGWAS平台使用已公开的访问编号获取15。因此,本研究的所有分析均完全基于这些公开可用的汇总水平全基因组关联研究(GWAS)数据集;未使用或生成任何内部机构队列或个体水平的患者数据。由于我们未能识别出具有统一MS与血液系统恶性肿瘤亚型定义的其他GWAS研究,无法对整个分析流程进行完整重复,因此未执行基于独立外部数据集的验证,这一点被承认是一项局限性。本方案的撰写方式使其可直接应用于未来的GWAS数据集,以实现独立验证。
仪器选择与LD聚类
对于每次暴露,使用 TwoSampleMR 中的 extract_instruments 函数在 OpenGWAS 数据集上筛选全基因组显著性的单核苷酸多态性(SNPs)(P < 5 × 10-8)。为确保工具变量的独立性,随后使用 TwoSampleMR 内置的连锁不平衡(LD)剪枝工具或本地 PLINK 软件,基于欧洲血统参考面板进行 LD 剪枝,r² 阈值设为 0.001,物理窗口设为 10,000 千碱基。当使用 PLINK 时,命令行参数设置为主要显著性阈值为 5 × 10-8,r² = 0.001,窗口大小为 10 Mb,以确保剪枝后的工具变量严格符合这些标准。工具变量强度通过暴露效应估计值及其标准误计算的 F 统计量进行评估(F ≈ β²/SE²);F 值 < 10 的变异位点从最终的工具变量集合中剔除,其余 SNPs 进入 PhenoScanner 筛查阶段。
使用 PhenoScanner 进行混杂因素筛选
为通过已知风险因素最小化水平多效性,使用 phenoscanner R 软件包(v1.0)在 PhenoScanner V2 中查询每个候选工具变量在全基因组关联研究(GWAS)目录中的信息16,17。对于每个 SNP,我们检索了所有在 P < 1 × 10⁻5 水平具有显著关联的报道结果,并手动检查返回的性状。若发现 SNP 与已知的血液系统恶性肿瘤风险因素(如吸烟相关暴露或肥胖/人体测量学性状,例如体重指数、腰围和体脂指标)存在关联,或与血液系统恶性肿瘤表型直接相关,则将该 SNP 从工具变量集合中剔除18。排除标准所依据的性状类别基于既往证据,即肥胖和吸烟与白血病、淋巴瘤或骨髓瘤风险之间的关联18,19,20。查询过程中使用了广泛的关键词词干(例如 smoke、cigarette、BMI、obesity、waist、adiposity、hematologic malignancy、lymphoma、leukemia、myeloma)。所有剔除记录均在跟踪电子表格中存档,包括触发剔除的 PhenoScanner 性状信息,清理后的工具变量列表随后进入数据整合步骤。
标准化与回文处理
使用 TwoSampleMR 软件包(v0.5.7,R)中的 harmonise_data 函数,对每个 SNP 的暴露数据集和结局数据集中的效应等位基因进行了整合。我们将所有结局的等位基因与暴露的效应等位基因对齐,以确保正的 beta 系数在两个数据集中始终对应相同的等位基因。在 OpenGWAS 参考面板中,对于具有中间效应等位基因频率(0.42–0.58)的回文变异(A/T 或 C/G),被视为链模糊变异,并通过将整合操作设置为剔除模糊 SNP 而自动移除。效应等位基因频率超出该范围的回文 SNP 则根据报告的等位基因频率予以保留并进行对齐。由于等位基因的可用性及回文状态在不同 FinnGen 结局间略有差异,因此对每种 HM 表型分别独立运行了数据整合过程,最终进入各结局特异性分析的工具变量数量从整合后的 R 对象中提取,并在表格中报告。
方向性评估(Steiger 滤波)
使用TwoSampleMR软件包中的steiger_filtering函数所实现的Steiger方法评估方向性。对于每个SNP,该函数首先根据GWAS的beta系数、标准误和样本量计算其在暴露和结局中解释的方差(R²)。随后,研究剔除了在结局中R²大于暴露中的工具变量,以排除效应方向可能相反的情况。Steiger过滤针对每个结局数据集分别进行,保留下来的工具变量(steiger_dir == TRUE的行)被保存并用于后续的孟德尔随机化(MR)分析。每个结局的Steiger过滤后工具变量数量被记录,并与MR估计结果一并报告。
主要 MR 估计与多重检验校正
主要因果效应估计通过TwoSampleMR软件包中的mr函数,采用固定效应模型下的逆方差加权(IVW)孟德尔随机化(MR)方法获得,指定的方法包括"mr_ivw"、"mr_egger_regression"和"mr_weighted_median"。对于每个HM结局,将经过数据协调和Steiger筛选的工具变量输入mr函数,提取对数比值比及其标准误,并进行指数化处理,以获得二分类性状的比值比(OR)及其95%置信区间(CI)21。为评估在轻微违反无多效性假设情况下的结果稳健性,我们额外应用了加权中位数法和MR-Egger回归估计量22,23,这些方法也在同一软件包中实现。当Cochran's Q检验(来自mr_heterogeneity)提示存在显著异质性(P < 0.05)时,研究进一步拟合了乘法随机效应IVW模型,并同时报告固定效应和随机效应的结果。在九个HM结局上的整体家族误差率通过Bonferroni校正进行控制,α = 0.05/9 = 5.56 × 10-3;P值低于此阈值的关联被认为具有统计学显著性,而P值介于0.0056 ≤ P < 0.05之间的关联则视为提示性关联,并予以谨慎描述。
敏感性诊断:异质性、多效性与异常值
采用Cochran's Q统计量评估IVW和MR-Egger模型中仪器变量间的异质性,该分析通过TwoSampleMR软件包中的mr_heterogeneity函数实现。使用MR-Egger截距检验(mr_pleiotropy_test)以及MR-PRESSO软件包中的全局检验来评估方向性水平多效性24。MR-PRESSO24在R中按照推荐设置运行(NbDistribution ≥ 5,000,SignifThreshold = 0.05),以检测具有显著影响的异常值,并通过比较剔除异常值前后的IVW估计值来量化潜在的偏差程度25。对每一对暴露-结局变量进行了留一法分析(mr_leaveoneout),以判断是否存在某个单一SNP对总体估计值产生不成比例的影响。为确保透明性和可重复性,所有诊断结果均从R中导出,并与经过数据协调、Steiger筛选及MR-PRESSO异常值剔除后的相应仪器变量数量一并报告。
仪器强度与 NOME 评估
使用 I2GX 统计量来量化 MR-Egger 的工具变量强度,该统计量的计算方法为:1 减去 SNP-暴露关联的平方标准误均值,再除以各工具变量间的方差26。该值越接近 1,表示越符合无测量误差(NOME)假设;较低的值则提示可能存在回归稀释,需谨慎解读 MR-Egger 的结果。针对每项特定结局的分析,均计算并报告了 I2GX 值。
反向孟德尔随机化
通过将每种HM亚型作为暴露因素,而MS作为结局,反向重复了完整的分析流程。当某一HM暴露因素缺乏全基因组显著性的工具变量时,允许采用较宽松的选择阈值(P < 5 × 10-6),同时保持相同的LD剪枝参数、PhenoScanner筛选、数据协调步骤、Steiger过滤及敏感性诊断方法。使用宽松阈值的分析在相应的表格和图注中均被明确标注。
可视化与图形导出
散点图、森林图、漏斗图和留一法图均生成图例并置于图面板下方,同时调整字体大小以确保标签不会遮挡绘图数据。对于可比较的结果,坐标轴范围进行了标准化处理,以便于视觉比较。图像以不低于300 dpi的分辨率导出为无损格式,如TIFF或PNG。所有绘制的数值均与报告的估计值进行交叉核对,以确保文字、表格和图像之间的一致性。
可重复性与数据共享
在适用情况下固定了随机种子,记录了软件版本,并将分析脚本及中间对象归档,以便重新运行所有步骤。记录了数据集登录标识符和表型定义,并按照期刊指南要求,准备了各过滤阶段(包括聚类后、数据协调后、Steiger 过滤后以及 MR-PRESSO 分析后)的仪器列表,以上传为电子表格文件。
访问受限。请登录或开始试用以查看此内容。
仪器变体的选择
采用全基因组显著性阈值 P < 5×10⁻8,最初筛选出与多发性硬化(MS)相关的 22,466 个 SNP。在 PLINK 中进行连锁不平衡 clumping 分析(r² < 0.001,窗口大小 10,000 kb)后,保留 72 个 SNP 作为工具变量,每个 SNP 的 F 统计量均 > 10(范围为 30–1,044)。为通过已知风险通路最小化多效性影响,利用 PhenoScanner V2 剔除了与潜在血液系统恶性肿瘤(HM)混杂因素相关的 11 个 SNP(例如体重指数、腰围、体重、臀围、体脂百分比、脂肪质量、一年前至今的体重变化、出生体重、基础代谢率、皮肤癌、卵巢癌)。此外,由于 rs12365699 既往与非霍奇金淋巴瘤(NHL)相关,因此在 NHL 亚型(FL、DLBCL、MTNKL 及其他/未明确分类 NHL)的分析中将其排除。在 MS 与每种 HM 结局之间的数据协调过程中,针对每种结局剔除了四个具有中间等位基因频率的回文 SNP(rs12434551、rs124785...
访问受限。请登录或开始试用以查看此内容。
这项针对欧洲血统人群的双样本孟德尔随机化(MR)研究提供了遗传学证据,表明遗传上更易患多发性硬化症(MS)的个体,其霍奇金淋巴瘤(HL)和细胞类型未明确的白血病风险可能更高;但与其他类型的白血病亚型、非霍奇金淋巴瘤(NHL)亚型或多发性骨髓瘤/浆细胞肿瘤之间未发现有说服力的关联27。在全基因组误差控制(Bonferroni α = 0.0056)下,HL和细胞类型未明确的白血病的信号仅为提示性而非确凿结论,应结合诊断背景和研究局限性进行解读28。方向性检验(Steiger过滤)仅保留了对各结局具有方向有效性的工具变量;MR-PRESSO分析显示,HL的估计结果在剔除单个强影响变异体后仍保持稳健(剔除前后的估计值相似);I2GX值(≈0.93–0.95)表明MR-Egger分析中工具变量强度可接受。反向分析(HM → MS)结果均为阴性,提示在所考察条件下可排除反向因果关系29。
关于多发性硬化症(MS)与继发性淋巴瘤的...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
我们感谢FinnGen研究和IEU OpenGWAS项目的参与者与研究人员,以及原始全基因组关联研究(GWAS)的作者们,公开提供了 汇总统计结果。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 邦弗罗尼校正(Bonferroni Correction)α = 0.0056) | 统计学方法参考 | BC-0056 | 多重检验校正方法以控制假阳性率 |
| 科克伦Q统计量 | Cochran, 1954 | Q-001(https://www.jstor.org/stable/2334368) | 用于评估MR仪器间的异质性 |
| F统计量 | TwoSampleMR 文档 | F-049 (https://cran.r-project.org/web/packages/TwoSampleMR/vignettes/perform_mr.html) | 评估孟德尔随机化中工具变量强度的指标 |
| HM汇总统计(全基因组关联研究) | FinnGen | https://www.finngen.fi/zh-cn | 血液系统恶性肿瘤(n = 218,792)的基因组数据,包括霍奇金淋巴瘤(HL)、非霍奇金淋巴瘤(NHL)、白血病等 |
| I2GX 统计量 | 鲍登等,2016 | I2GX-074 (https://academic.oup.com/ije/article/44/2/512/753845) | 评估依从性的统计指标 "无测量误差" 假设 |
| LD clumping 参数 | PLINK | https://www.cog-genomics.org/plink/1.9 | 确保遗传工具独立性的LD聚类参数 |
| MR-PRESSO v1.0 | MR-PRESSO | 1445 (https://github.com/rondolab/MR-PRESSO) | 用于异质性与异常值检测及校正的软件 |
| 全基因组关联研究(GWAS)汇总统计资料 | 国际多发性硬化症遗传学联盟 | https://imsgc.net | 多发性硬化症(MS)的基因组数据(n = 115,803),来自欧洲队列 |
| PhenoScanner V2 | PhenoScanner | 1550(http://www.phenoscanner.medschl.cam.ac.uk) | 用于筛选遗传工具与已知混杂因素(如吸烟、BMI)关联的数据库 |
| PLINK v1.9 | PLINK | SCR_001757 (https://www.cog-genomics.org/plink/1.9) | 用于全基因组关联分析和连锁不平衡(LD)剪枝的软件 |
| R 版本 4.3.1 | R 基金会 | SCR_001905(https://www.r-project.org) | 开源统计计算软件 |
| 斯泰格测试 | TwoSampleMR 方法学 | STG-001(https://cran.r-project.org/web/packages/TwoSampleMR) | 孟德尔随机化中方向性检验的统计方法 |
| TwoSampleMR v0.5.7 | RStudio / CRAN | 1134 (https://cran.r-project.org/package=TwoSampleMR) | 用于两样本孟德尔随机化(MR)分析的 R 软件包 |
| 加权中位数与MR-Egger | 孟德尔随机化方法 | WM-026(https://cran.r-project.org/package=MendelianRandomization) | MR中用于敏感性分析的替代估计量 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可