本研究旨在开发并对外部验证一个整合了机器学习模型的基于网络的系统,用于肺炎相关急性呼吸窘迫综合征(ARDS)的早期诊断和临床表型分型,以促进精准治疗。
研究文章
本研究旨在开发并对外部验证一个整合了机器学习模型的基于网络的系统,用于肺炎相关急性呼吸窘迫综合征(ARDS)的早期诊断和临床表型分型,以促进精准治疗。
急性呼吸窘迫综合征(ARDS)是一种高度异质性的疾病,其临床表现可能与重症肺炎重叠,给准确鉴别诊断带来挑战。因此,迫切需要对ARDS患者进行早期预测和床旁快速亚型聚类。本研究旨在开发一个基于网络的系统,该系统包含经过验证的床旁早期诊断模型和临床亚组分类模型,用于预测肺炎相关ARDS的发生及其表型。诊断模型和亚组分类模型基于两个大型数据库——重症监护医疗信息集市IV(Medical Information Mart for Intensive Care IV, MIMIC-IV)和远程重症监护病房数据库(Telehealth Intensive Care Unit, eICU)进行构建与验证,并整合至一个基于网络的预测系统中。研究分析了2008年至2019年间因肺炎住院超过24小时的患者数据。MIMIC-IV推导队列纳入24,987例肺炎患者(其中14,121例为肺炎相关ARDS);eICU验证队列纳入20,676例肺炎患者(其中9,946例为肺炎相关ARDS)。在诊断性能方面,机器学习的堆叠方法在MIMIC-IV推导队列中表现最佳,其AUC为0.919,准确率为70.00%,精确率为69.88%,召回率为82.27%;在eICU验证队列中,AUC、准确率、精确率和召回率分别为0.915、70.87%、69.70%和69.70%。肺炎相关ARDS被分为三种具有不同临床特征和预后的临床表型,且对治疗反应各异。在0型和1型聚类患者中,接受早期糖皮质激素治疗者的院内死亡率高于未接受者;而在2型聚类患者中,接受糖皮质激素治疗者的院内死亡率低于未接受者。我们实现了肺炎相关ARDS诊断预测与临床亚组分类的网络化转化。 本研究所建立的基于网络的肺炎相关ARDS床旁早期诊断与临床亚组分类模型,可辅助临床医生进行疾病诊断与治疗决策,推动个体化精准治疗的实施。
急性呼吸衰竭,尤其是肺部感染后发生的急性呼吸窘迫综合征(ARDS),是危重患者中常见的严重问题。研究表明,重症监护病房(ICU)患者中ARDS的发病率高达10%1,病死率约为40%2,3。重症肺炎被广泛认为是导致ARDS的主要原因4。由于重症肺炎与ARDS的临床症状相似,临床上常难以区分两者。因此,对肺炎患者发生ARDS的早期预测可能有助于降低ARDS的发病率和死亡率5。此外,由于ARDS是一种高度异质性的疾病6,对ARDS进行早期且准确的亚型分类有助于实现精准医疗。这种分类也是全球呼吸系统危重症研究的主要方向之一7,其目标是提高针对不同亚组干预措施的有效性。
目前,急性呼吸窘迫综合征(ARDS)的独立危险因素已被广泛研究8,但针对肺炎患者发生ARDS的预测研究较少。此外,尚无研究关注肺炎相关ARDS的特定临床表型;大多数表型研究均基于全部ARDS患者人群。Calfee等9将ARDS分为高炎症性和低炎症性两种生物学表型。定义这些生物学表型需依赖血浆生物标志物作为分类判别变量,但此类检测在临床床旁并不易获得。一项研究曾利用易于获取的临床指标将ARDS分为三种临床表型,并评估了这些表型对随机干预措施的反应,但该研究同样基于全部ARDS患者人群10。根据不同的病因(如肺炎)来定义ARDS的临床表型,可能获得更为精细和准确的结果。
本研究旨在利用机器学习,基于早期临床数据构建肺炎相关急性呼吸窘迫综合征(ARDS)的预测模型;利用早期且易于获取的临床数据将肺炎相关ARDS分为不同的临床表型,并探讨其临床特征、预后及治疗反应的差异;同时将预测模型与分类模型开发为基于网络的应用程序,以辅助临床医生对肺炎相关ARDS的诊断与治疗,并推动进一步的研究。
访问受限。请登录或开始试用以查看此内容。
本研究使用了重症监护医疗信息集市IV(MIMIC-IV)数据库11(版本 1.0,PhysioNet:https://physionet.org/content/mimiciv/1.0/)和远程医疗重症监护病房(eICU)数据库12(版本 2.0,PhysioNet: 在完成“保护人类研究参与者”考试(记录ID:44151052)后,访问了 https://physionet.org/content/eicu-crd/2.0/。本研究遵循《赫尔辛基宣言》(2013年版)的原则进行,患者已同意将其数据纳入这两个数据库。由于eICU和MIMIC-IV数据库中的数据已完全匿名化(未保留任何个人身份信息),本研究免除了伦理审批要求。
材料与工具
数据来源:MIMIC-IV 数据库:版本 1.0,单中心开放访问注册数据库,包含 76,540 次重症监护室(ICU)住院记录(2008–2019 年),通过 PhysioNet 获取。eICU 数据库:版本 2.0,多中心数据库,包含 >来自美国208家医院的335个单位的200,000份电子病历(2014–2015年),通过PhysioNet获取。软件 & 执行环境:RapidMiner Studio:版本 9.10.001(执行环境:Windows 10 Pro 64 位),用于模型构建(分类/聚类)和特征选择;IBM SPSS Statistics:版本 23.0(执行环境:Windows 10 Pro 64 位),用于统计分析和缺失值填补;Java 开发工具包(JDK):版本 Java SE 8u381(执行环境:Windows 10 Pro 64 位),用于 Web 应用程序开发;支持的集成开发环境:Eclipse IDE 2023-09;Apache Tomcat:版本 9.0.85,用于部署基于 Web 的应用程序。
研究设计与研究环境
本研究的概念如补充图1所示。本研究分析了两个大型数据源——重症监护医学信息库IV(Medical Information Mart for Intensive Care IV, MIMIC-IV)和远程重症监护病房(Telehealth Intensive Care Unit, eICU)数据库的数据,以构建肺炎相关急性呼吸窘迫综合征(ARDS)的预测模型,并根据临床表型对受影响患者进行分类。本研究遵循个体预后或诊断多变量预测模型透明报告规范(Transparent Reporting of a Multivariable Prediction Model for Individual Prognosis or Diagnosis, TRIPOD)指南。
研究样本
本研究的训练和测试数据来源于 MIMIC-IV。外部验证数据来源于多中心 eICU 数据库。本研究采用国际疾病分类(第九和第十版)提取肺炎及与肺炎相关的急性呼吸窘迫综合征(ARDS)患者的资料。住院时间少于 24 小时的患者被排除。
预测因子
在评估 MIMIC-IV 和 eICU 数据集的数据可获得性以及临床变量缺失率后,本研究选取了52个与肺炎相关急性呼吸窘迫综合征(ARDS)相关的变量作为机器学习的候选训练变量,包括患者的人口学特征、实验室检查结果以及疾病严重程度评分。本研究采用基于变量与结局之间相关性权重的加权相关性算法(weight-by-correlation algorithm),从52个候选变量中筛选出关键预测因子(即最终纳入模型的变量),并从这些关键预测因子中选择亚组聚类因素。
为此,打开 RapidMiner Studio,创建一个新流程,然后通过点击 流程 > 操作符 > 特征选择 > 基于相关性赋权 添加“基于相关性赋权”操作符。设置参数:相关性阈值 = 0.04(保留权重 > 0.04 的变量)。为了使模型能够考虑疾病早期阶段及时间因素,提取了患者入院后24小时内实验室指标的最大值和最小值。由于 eICU 数据库未包含急性生理评分 III(APSIII),因此采用急性生理与慢性健康状况评估 IV(APACHE IV)评分作为替代。本研究在构建预测模型和亚表型分类模型时,对数据进行了清洗,并采用多重插补法对缺失值进行插补,同时对输入变量进行了标准化处理。
统计分析
打开 SPSS 23.0,导入预处理后的数据集,选择 分析 > 描述统计 > 探索。勾选带检验的正态图,以对连续变量进行 Kolmogorov-Smirnov 检验。偏态分布的变量以中位数(四分位间距,IQR)表示;分类变量以例数(百分比,%)表示。组间连续变量的比较根据情况采用 Mann-Whitney U 检验或 Kruskal-Wallis 检验。组间分类变量的比较根据情况采用 Pearson 卡方检验或 Fisher 精确检验。
模型开发与网页展示
在模型开发过程中,本研究将MIMIC-IV推导队列分为训练集(占完整样本的90%,随机选取用于模型开发和超参数调优)和测试集(占完整样本的10%,随机选取用于内部验证);本研究在eICU中进行了外部验证。本研究采用五种机器学习方法:决策树、逻辑回归、朴素贝叶斯、堆叠法(基学习器为逻辑回归、朴素贝叶斯和随机森林方法;堆叠学习器为决策树方法)以及随机森林。决策树:点击 Process > Operators > Modeling > Classification > Decision Tree,设置算法为C4.5,最小叶节点大小为5。逻辑回归:点击 Process > Operators > Modeling > Classification > Logistic Regression ,设置正则化强度为0.1,最大迭代次数为100。朴素贝叶斯:点击 Process > Operators > Modeling > Classification > Naive Bayes ,设置核函数类型为高斯分布。随机森林:点击 Process > Operators > Modeling > Classification > Random Forest ,设置树的数量为100,最大深度为20。堆叠法:点击 Process > Operators > Modeling > Ensemble > Stacking ,设置基学习器为逻辑回归 + 朴素贝叶斯 + 随机森林;堆叠学习器为决策树。本研究通过计算受试者工作特征曲线下面积(AUC)、准确率、精确率和召回率来评估所开发模型的预测性能。
在构建肺炎相关急性呼吸窘迫综合征(ARDS)临床亚组的分类时,本研究采用关键预测因子进行 k-均值聚类分析。为确定最优聚类数 k,研究考察了 Gap 统计量图中的 Gap 统计量值,该值提示了最优聚类数量。本研究分析了不同表型患者的临床特征和结局,并比较了接受与未接受早期低至中等剂量糖皮质激素治疗的不同聚类患者之间的院内死亡率差异。
在 RapidMiner Studio 中,选择 文件 > 导出模型,并将诊断预测模型和亚组分类模型保存为 .model 文件。使用 JDK Java SE 8u381 和 Eclipse IDE 2023-09 以 Java 语言编写网页;将 .model 文件导入项目中。本研究采用 Java 语言开发了一个网页,将诊断模型和临床亚组聚类模型嵌入其中,并将模型上传至网络。
访问受限。请登录或开始试用以查看此内容。
参与者
MIMIC-IV 数据库纳入了 24,987 例肺炎患者的数据,其中 14,121 例患有肺炎相关急性呼吸窘迫综合征(表 1)。eICU 数据库纳入了 20,676 例肺炎患者的数据,其中 9,946 例患有肺炎相关急性呼吸窘迫综合征(补充表 1)。
肺炎相关急性呼吸窘迫综合征预测模型的建立与验证
我们利用 MIMIC-IV 队列的数据构建了肺炎相关急性呼吸窘迫综合征(ARDS)的诊断模型,并使用 eICU 队列的数据进行外部验证。将 MIMIC-IV 队列中的患者随机分为训练队列(n = 22,488 [90%])和测试队列(n = 2499 [10%])。我们采用基于相关性的权重算法,在输入变量中筛选出18个权重较高(>0.04)的关键预测因子(补充图2):APSIII评分;阴离子间隙、碳酸氢盐、葡萄糖、钾、钠和血红蛋白的最大值;吸入氧浓度分数(FiO2);血...
访问受限。请登录或开始试用以查看此内容。
众所周知,这是首个利用机器学习报告肺炎患者急性呼吸窘迫综合征(ARDS)的诊断模型及临床亚组分类模型,也是迄今为止报道肺炎相关ARDS诊断与临床亚组分类的最大规模研究。本研究建立并验证了两个基于机器学习的模型,并将其转化为基于网页的应用程序,以用于临床实践和后续研究。在eICU验证队列中,该模型预测肺炎患者是否会发展为肺炎相关ARDS的曲线下面积(AUC)为0.915,准确率为70.87%,精确率为69.70%,召回率为69.70%。我们还利用简单且快速获取的临床预测因子,对肺炎相关ARDS患者进行了临床亚组聚类分析。这三种表型对早期低至中等剂量糖皮质激素治疗的反应各不相同。
本研究中用于机器学习的堆叠方法本质上是一种k折交叉验证模型。该模型的第一层包含多个基础分类器,它们将预测结果(元特征)提供给第二层(堆叠模型学习器);在第二层分类器中,第一层分类器的结果被用于特征拟合并输出最终的预测结果。与传统分析方法相比,堆叠方法的独特工作原理在于其能够考虑具有复杂关系的多因素疾病,且具有良好的敏感性和特异性13。在诊断模型...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何竞争利益。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Apache Tomcat | Apache 软件基金会 | 版本 9.0.85 | |
| Eclipse IDE | Eclipse | 2023-09 | |
| Java Development Kit | Java | 版本 Java SE 8u381 | |
| RapidMiner Studio | Altair Engineering Inc. | 版本 9.10.001 | |
| SPSS Statistics | IBM | 版本 23.0 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可