$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
NHANES 方案已获得国家卫生统计中心(NCHS)研究伦理审查委员会的批准,并已从所有参与者处获得书面知情同意。本研究为去标识化的公开数据的二次分析,因此无需额外的机构伦理审批。所有作者均阅读并批准了最终稿件。
1. 研究设计与数据来源
本研究作为NHANES的二次分析进行,NHANES是由美国疾病控制与预防中心实施、国家卫生统计中心研究伦理审查委员会监督的一系列横断面、全国代表性调查。公开使用的NHANES数据集已完全去标识化,可供二次分析使用。本研究采用了1999–2000年、2001–2002年、2003–2004年和2005–2006年周期的数据。
每个周期的公开 NHANES 组件文件均已下载,包括:(i) 包含参与者标识符(SEQN)和调查设计变量的人口统计学文件,(ii) 包含子宫内膜异位症自报信息的生殖健康问卷文件,以及 (iii) 用于计算综合指数所需的实验室文件(C-反应蛋白、甘油三酯和空腹血浆葡萄糖)。在分析比较指数时,额外获取了体检/人体测量文件(如体重指数)以及所需的实验室检测指标(如中性粒细胞、淋巴细胞、血小板)。在每个两年周期内,使用 SEQN 合并各组件文件,并检查合并后的数据集以确保每个 SEQN 对应唯一一条记录。随后将各周期的数据集进行纵向合并,构建出 1999–2006 年的综合分析文件。
分析样本限定为20至54岁的女性。如果子宫内膜异位症状态信息缺失、任何复合指数组成部分(C反应蛋白、甘油三酯或空腹血浆葡萄糖)数据缺失,或在完整病例策略下完全调整模型所需的必要协变量缺失,则排除该参与者。保留复杂的调查设计变量(分层和初级抽样单位),以及包含空腹检测指标分析所需的空腹实验室子样本权重。当合并多个NHANES周期时,根据NHANES分析指南创建多周期权重,即将2年子样本权重除以合并的周期数,并在所有分析中应用由此生成的权重、分层和PSU变量。参与者的纳入与排除步骤已在流程图中记录(图1)。
2. 子宫内膜异位症的定义
子宫内膜异位症的状态根据生殖健康问卷中的条目定义:“您是否曾被医生或其他医疗专业人员告知患有子宫内膜异位症?” 回答“是”的参与者被归类为子宫内膜异位症病例,回答“否”的参与者被归类为对照组。由于该定义基于自我报告,而非腹腔镜或组织病理学确认,研究的局限性中已说明可能存在分类错误的情况。
3. 复合指数(CTI)的定义
C反应蛋白-甘油三酯-葡萄糖复合指数被用于共同反映全身性炎症和代谢紊乱。C反应蛋白(mg/L)、甘油三酯(mg/dL)和空腹血浆葡萄糖(mg/dL)的实验室检测值均提取自NHANES实验室文件。甘油三酯-葡萄糖指数通过以下公式计算:[甘油三酯 × 空腹血浆葡萄糖 / 2] 的自然对数。CTI采用如下公式计算:CTI = 0.412 × ln(CRP) + TyG。较高的CTI值表示低度炎症与胰岛素抵抗的联合负担更高8。
若C反应蛋白数值在进行对数转换前需特殊处理(例如等于或低于检测限的数值),则在所有周期中统一应用一条预先规定的规则,并予以记录以确保可重复性(例如,将非正值替换为对数转换前观察到的最小正值)。四分位数切点根据完整分析样本的加权分布确定,并在所有分类分析中保持一致,其中以第一四分位组作为参照类别。
4. 协变量
根据流行病学推理和既往文献,预先指定了协变量以减少混杂因素的影响。人口统计学变量包括年龄、种族/民族、教育水平和婚姻状况。生活方式变量包括吸烟史(终生吸烟≥100支与<100支)和饮酒情况(每年饮酒≥12杯与<12杯)。合并症病史包括自我报告的高血压、糖尿病、中风、冠心病和癌症。人体测量和实验室变量包括体重指数、血红蛋白、中性粒细胞计数、淋巴细胞计数和血小板计数;这些指标在适用情况下还用于计算比较用的炎症指数(例如中性粒细胞与淋巴细胞比值、血小板与淋巴细胞比值、全身免疫-炎症指数、全身炎症反应指数)。在所选周期中若数据可用,则纳入生殖相关变量(如妊娠次数和分娩次数),并根据NHANES文档进行编码。在进入模型前,分类协变量被转换为指示变量。
由于C反应蛋白是复合指数的组成部分,为避免过度校正和共线性问题,未将其作为独立协变量纳入多变量回归模型。相反,在区分度分析中,将C反应蛋白和甘油三酯-葡萄糖指数作为比较标志物进行评估。
5. 统计分析
所有分析均考虑了 NHANES 复杂的调查设计,以生成具有全国代表性的估计值。通过将多周期子样本权重、分层和初级抽样单位(PSU)变量与分析数据集关联,确定了调查设计。连续变量以加权均值及其标准差进行汇总,分类变量以加权频数和百分比进行汇总。使用适用于 NHANES 的加权调查分析方法比较病例组与对照组之间的基线特征,基线特征汇总见表 1。
采用加权调查的 Logistic 回归分析复合指数与子宫内膜异位症之间的关联。拟合了三个逐步调整的模型:未调整模型、调整年龄和种族/民族的模型,以及完全调整模型(包括人口统计学因素、生活方式变量、共病史、人体测量/实验室协变量和生殖史变量)。复合指数分别以连续形式(每增加 1 个单位)和分类形式(四分位数,以第一四分位数为参照)进行分析,回归估计结果汇总于表 2。通过为每个四分位数分配其加权中位数值,并将该变量作为连续项建模,检验四分位数间的线性趋势。
使用加权调查的限制性三次样条法(预设节点位置)评估非线性剂量-反应关系,样条曲线绘制于图 2。通过比较分段模型与单斜率模型的拟合优度,采用加权调查的分段(分段线性)Logistic 回归评估阈值效应,并在表 3中报告估计的拐点及拐点两侧的斜率参数。
进行亚组分析以探讨预设因素(如年龄组、种族/民族、教育水平、婚姻状况及选定的生活方式因素)对效应的修饰作用。在加权调查分析框架内,通过在模型中引入复合指数连续变量与亚组指示变量的交叉乘积项来检验交互作用,亚组关联结果汇总于图 3。
基于加权调查 Logistic 模型得出的预测概率,采用受试者工作特征(ROC)分析评估判别效能。计算复合指数、常用炎症指数及各组成标志物的曲线下面积(AUC)估计值,AUC 汇总结果见补充表 1;扩展的 ROC 比较结果见补充 图 1。
在排除子宫内膜异位症状态缺失、复合指数组分缺失或完全调整模型所需关键协变量缺失的参与者后,采用完整病例分析处理缺失数据。当进行稳健性评估时,在预设的插补模型下对存在缺失的协变量进行多重插补,并将插补后的估计结果与完整病例分析结果进行比较。
分析使用 R(版本 4.4.1)及材料表中列出的其他统计软件完成。记录了用于调查推断、样条建模、分段回归和 ROC 估计的关键软件包,并保留了会话信息(操作系统及 R 会话详情),以支持结果的可重复性。
6. 实验步骤终点与结果输出
分析流程在根据预先规定的纳入/排除标准构建出协调的多周期数据集后即视为完成图1),复合指数和协变量根据既定规则生成,并在相同的调查设计设定下执行预先指定的加权回归分析、非线性/阈值评估、亚组分析和区分度分析。该工作流程的主要输出结果被整理为基线汇总数据 (表1)),在连续调整模型中的回归估计值(表2),阈值模型参数 (表3)),样条可视化(图2),亚组汇总可视化 (图3))和区分总结(补充表1 和 补充图1).
7. 内部独立验证
通过根据NHANES周期将合并数据集划分为推导队列和非重叠验证队列,进行了内部独立验证。1999–2000年和2001–2002年周期的参与者被分配至推导队列,而2003–2004年和2005–2006年周期的参与者被分配至验证队列。在每个队列中均独立应用相同的纳入/排除标准、复合指数计算方法、协变量编码规则以及调查加权策略。
在推导队列中,采用完全校正的设定拟合了经调查加权的逻辑回归模型。在推导队列中应用了主分析中所用的非线性及阈值评估方法,并基于模型预测概率,采用ROC/AUC方法评估区分度。随后,在验证队列中重复了相同的建模策略,变量定义、编码规则和加权设定均未作修改。推导队列与验证队列的估计结果以关联估计值的队列间比较(图4)以及推导队列与验证队列ROC曲线的比较(图5)进行总结,相应的数值摘要见表4。