本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。
研究文章
本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。
可解释的人工智能(XAI)正日益被视为在医疗保健领域构建可信人工智能系统不可或缺的工具,因为在临床决策过程中,透明性以及解释决策的能力是至关重要的组成部分。本文介绍了一种可重复的实验方法,用于开发和评估面向医疗数据分析的可解释人工智能系统。所构建的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流,可同时适用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上表现出较强的预测性能,而深度学习模型则擅长从医学影像数据中学习复杂的模式。SHAP、LIME 和 Grad-CAM 等技术提供了全局和局部解释,有助于模型的理解。该框架的定量评估涵盖多种不同指标,包括准确率、精确率、召回率、F1 分数、ROC-AUC、解释性指标、保真度和稳定性。结果表明,在控制实验条件的情况下,该框架在所评估的实验条件下表现出更优的预测性能和解释质量。作为一份以实验方案为导向的文档,本研究支持其他研究者对方法进行可重复和可扩展的持续实施。这种透明且易于理解的人工智能模型,是临床决策支持系统和医疗数据分析系统获得广泛信任与应用的基础。
人工智能(AI)通过支持疾病诊断、预后评估、风险分层、医学影像分析和临床决策,已成为现代医疗保健的重要组成部分1。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,其预测性能通常可达到甚至超过传统统计方法2。尽管取得了这些进展,许多AI模型仍以复杂的黑箱系统方式运行,导致临床医生和医疗利益相关者难以理解预测结果的生成过程3。这种缺乏透明性的问题可能限制高风险医疗环境中对AI的信任、采纳和责任追溯能力4,5。
可解释性人工智能(XAI)已成为提高机器学习模型透明度和可解释性的有前景方法6。广泛应用的解释技术包括SHAP(Shapley加性解释)、LIME(局部可解释的模型无关解释)和梯度加权类激活映射(Grad-CAM),这些技术通过特征归因和可视化解释机制揭示模型行为7,8,9。这些方法 increasingly 被应用于医疗健康领域,以支持临床解释、模型审计和决策支持10,11。然而,仅具备可解释性并不能保证模型的可靠性、可重复性或临床实用性。近期研究指出了与解释结果不稳定性、对扰动敏感、临床医生验证有限以及解释输出与模型真实推理之间存在不一致等相关挑战12,13,14,15。
除了可解释性方面的挑战外,可重复性在医疗机器学习研究中仍然是一个重要的问题16,17,18。许多已发表的研究在预处理流程、软件环境、超参数配置、验证策略和实现工作流方面提供的信息有限,导致独立重复实验十分困难19,20,21。此外,医疗人工智能研究往往侧重于预测性能,而在解释质量评估、以临床医生为中心的评价以及实际实施考虑方面提供的指导较为有限22。这些局限性可能会阻碍可解释人工智能系统从研究环境向真实世界医疗场景的转化23,24,25,26,27。
当前医疗健康领域的可解释人工智能(XAI)工作流程通常孤立地评估单个解释方法或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为中心的评估以及可重复性资源的标准化协议28,29,30,31。因此,研究人员和实践者在不同医疗健康数据集和应用领域中重复工作流程、比较解释方法或评估可解释人工智能系统的实际效用时,可能会遇到困难。因此,亟需一种全面且可重复的协议,以促进医疗健康可解释人工智能工作流程的一致实施、评估和报告32,33,34,35。
本文提出了一种可重复的协议,用于在医疗健康数据分析中开发、评估和解释可解释的人工智能系统。该协议在一个统一的工作流程中整合了数据预处理、预测建模、使用SHAP、LIME和Grad-CAM进行可解释性评估、以临床医生为中心的评估、验证程序以及可重复性资源。其目标是提供一个标准化框架,以支持在不同医疗健康数据集上实现透明的模型开发、解释质量评估和可重复的实施36,37,38,39。本研究的方法学贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合到单一协议中,适用于医疗健康人工智能领域的研究、教育及面向部署的研究项目40,41,42,43。
本研究的主要贡献并非开发一种新的可解释性算法。
相反,本研究提供了一种标准化、可重复且经过实验验证的方案,将预测建模、可解释性评估、可视化、结果评价以及以人为中心的解释整合为统一的工作流程,适用于医疗健康数据分析及 JoVE 平台的方案传播。本研究的主要目标并非提出一种全新的预测算法,而是为在医疗健康数据分析中实施可解释人工智能工作流程提供一套标准化、可重复且经过实验验证的方案。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源整合为一个统一的框架,便于被采纳、复制和用于教学传播。
本研究中使用的所有数据集均来自公开且完全匿名的数据库,包括UCI机器学习库、PhysioNet MIMIC-III数据库以及NIH胸部X光片数据集。未访问任何可识别的患者信息。本研究符合机构科研伦理指南中关于公开可用的去标识化数据二次分析的规定。由于未直接招募人类受试者,也未使用任何受保护的健康信息,因此无需正式的机构审查委员会批准。
1. 实验框架概述
2. 计算环境与系统配置
| 组件 | 参数 | 数值 | 描述 |
| 随机森林 | n_estimators | 100 | 树的数量 |
| 随机森林 | max_depth | 无 | 树的深度 |
| XGBoost | learning_rate | 0.01 | 学习率 |
| XGBoost | n_estimators | 100 | 提升轮数 |
| CNN | epochs | 25 | 训练轮数 |
| CNN | batch_size | 32 | 批次大小 |
| CNN | optimizer | Adam | 优化算法 |
| MLP | hidden_layers | 2 | 隐藏层数量 |
| MLP | activation | ReLU | 激活函数 |
| 通用 | train_split | 70% | 训练数据比例 |
| 通用 | validation_split | 15% | 验证集比例 |
| 通用 | test_split | 15% | 测试集比例 |
表1:实现细节与超参数配置。
本表格总结了在所提出的可解释人工智能框架的实验评估过程中,所使用的计算环境、软件库、机器学习与深度学习模型配置、优化设置、学习率、批量大小、训练参数以及超参数值。
3. 数据集准备与预处理
| 数据集 | 类型 | 样本数 | 特征数 | 目标变量 |
| Breast Cancer | 表格型 | 569 | 30 | 良性/恶性 |
| Diabetes | 表格型 | 768 | 8 | 糖尿病结果 |
| MIMIC-III | 电子健康记录 | ~60,000 | 临床变量 | 死亡率 |
| Chest X-ray | 影像 | ~112,000 | 图像 | 疾病标签 |
表2:数据集特征与医疗保健应用场景。
本表总结了研究中使用的医疗保健数据集,包括数据集类型、样本数量、特征数量、目标变量、医疗保健应用领域以及相关临床应用场景。这些数据集涵盖结构化临床记录、电子健康记录和医学影像数据,以展示该框架在多种医疗保健分析场景中的适用性。
| 数据集 | 样本量 | 类别分布 | 划分策略 | 数据泄露预防 | 超参数搜索 | 交叉验证 | 外部测试 |
| Breast Cancer (UCI Wisconsin) | 569 | 357 良性 / 212 恶性 | 70/15/15 | 仅训练集预处理 | 网格搜索 | 5折分层交叉验证 | 独立保留集 |
| Pima Indians Diabetes | 768 | 500 非糖尿病 / 268 糖尿病 | 70/15/15 | 仅训练集预处理 | 网格搜索 | 5折分层交叉验证 | 独立保留集 |
| MIMIC-III EHR | 5274 | 按结局分层的队列 | 70/15/15 患者水平 | 患者水平分离 | 随机搜索 | 5折患者水平交叉验证 | 独立保留集 |
| NIH Chest X-ray | 112120 | 肺炎/正常分层 | 70/15/15 | 图像水平分离 | 随机搜索 | 5折分层交叉验证 | 独立保留集 |
表3:数据集层面的验证与实验设计。
本表格总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试集划分策略、数据泄露预防措施、超参数优化方法、交叉验证设计以及外部测试协议。这些措施的实施旨在确保方法学的严谨性、可重复性以及无偏倚的模型评估。

图1:数据预处理流程的验证。
模型开发前关键预处理操作的验证结果。(A)代表性医疗健康特征的缺失值分析。(B)数值变量在异常值处理前后的分布情况。(C)使用标准化方法进行特征缩放的验证。(D)分类变量编码的验证。(E)预处理后的类别分布。(F)训练集-验证集-测试集数据划分的验证。这些结果证实了数据集的预处理和准备工作已成功完成,可用于后续的预测建模与可解释性分析。请点击此处查看该图的高清版本。
4. 可解释人工智能框架的系统架构

图 2:用于医疗数据分析的可解释人工智能框架的系统架构。 请点击此处查看此图的放大版本。
5. 工作流程执行

图3:可解释人工智能流程的端到端工作流程。 请点击此处查看此图的放大版本。
6. 模型评估与可解释性评估
7. 以人为中心的评估
| 参数 | 数值 |
| 专家 | 12 |
| 医师 | 6 |
| 放射科医生 | 3 |
| 临床数据分析师 | 3 |
| 评审病例数 | 100 |
| 评估设计 | 随机化(仅预测 vs 预测+解释) |
| 调查工具 | 5点李克特量表 |
| 信任度评估 | 可解释性、信任度、可用性 |
| 统计检验 | 配对t检验(p 0.05) |
| 评分者间信度 | Fleiss Kappa |
| 客观指标 | 决策一致性、评审时间 |
表4:以人为中心的评估方案与临床医生评估设计。
本表格展示了用于评估可解释人工智能系统在可解释性、可信度和可用性方面的临床医生评估框架。内容总结了参与者人口统计学信息、病例审查方法、调查设计、统计分析流程、评分者间信度评估以及客观评估指标。
8. 验证与可重复性评估
9. 可重复性资源
| 资源 | 描述 |
| 源代码 | 用于数据预处理、模型训练、可解释性分析和评估的 Python 实现脚本 |
| 环境文件 | 包含软件包依赖关系及版本的 requirements.txt 文件 |
| 配置文件 | 模型结构设置、超参数和实验配置 |
| 固定随机种子 | 使用 Seed = 42 以确保实验可重复 |
| 数据集访问说明 | 获取公开医疗数据集的链接和操作流程 |
| 预处理脚本 | 用于数据清洗、归一化、编码和特征选择的脚本 |
| 图表生成脚本 | 用于重新生成所有论文图表的脚本 |
| 表格生成脚本 | 用于复现报告中所有表格和指标的脚本 |
| 示例输入 | 样本数据集和输入文件 |
| 示例输出 | 预测结果、解释性分析结果和评估报告 |
表5:可重复性资源与实验资源。
本表格总结了为支持实验可重复性而提供的资源,包括源代码、预处理脚本、配置文件、环境配置说明、数据集访问指南、固定的随机种子设置、图表生成脚本,以及重现报告结果所需的示例输入/输出文件。
我们对整个流程中的可解释人工智能组件进行了全面评估,考察了其在不同类型医疗数据上的预测表现,包括结构化临床数据和医学图像。结果表明,在所评估的数据集中,模型的预测性能具有一致性。在测试的模型中,梯度提升模型的准确率最高,达到97.4%;随机森林模型次之,准确率为94.2%。应用于图像数据集的深度学习方法准确率为91.3%,而多层感知机模型的结果略低,为90.8%。这表明,基于集成的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构在影像任务中更具优势。表6详细列出了预测功能的各项性能指标,包括准确率、精确率、召回率和F1分数,以及可解释性指标如保真度和稳定性。这些性能数值是通过五折交叉验证得出的,并以均值(含95%置信区间)形式呈现。置信区间不仅反映了模型的不确定性,还使预测性能的比较更加可靠,同时考虑了数据集的记忆效应以及模型架构之间的差异。
| 模型 | 准确率 (%) | 精确率 | 召回率 | F1 分数 | 保真度 | 稳定性 | 95% 置信区间 |
| 随机森林 | 94.2 | 0.93 | 0.92 | 0.92 | 0.85 | 0.82 | 93.1–95.3 |
| XGBoost | 97.4 | 0.96 | 0.95 | 0.95 | 0.92 | 0.89 | 96.5–98.3 |
| MLP | 90.8 | 0.89 | 0.88 | 0.88 | 0.80 | 0.78 | 89.6–92.0 |
| CNN(成像) | 91.3 | 0.90 | 0.91 | 0.90 | 0.88 | 0.86 | 90.1–92.5 |
表6:预测模型与可解释性方法的比较性能。
本表对机器学习与深度学习模型进行了比较评估,采用的预测性能指标包括准确率、精确率、召回率、F1分数和ROC曲线下面积(ROC-AUC)。此外,还报告了可解释性指标,如保真度、稳定性、可理解性及人类信任评分,以全面评估模型的预测有效性与可解释性。
结果表明,梯度提升算法达到了最高的整体预测性能(准确率为97.4%),比随机森林高出3.2个百分点,比深度学习模型高出6个百分点以上。这一观察结果表明,基于集成的学习方法在本研究包含的结构化医疗数据集上尤为有效。卷积神经网络(CNN)与多层感知机(MLP)模型之间较小的性能差异表明,在所评估的实验条件下,仅增加模型复杂性并不一定转化为更优的预测性能。
为展示我们所提出框架在多种医疗数据分析任务中的实用性,我们在表7中列出了各数据集的预测性能结果。
特定数据集分析。
由于特征复杂性、样本量、类别分布和数据模态的差异,不同数据集上的性能表现存在差异。乳腺癌数据集取得了最高的预测准确率,这可能归因于特征可分性良好。在MIMIC-III和NIH胸部X光数据集上的性能略低,反映了纵向临床记录和医学影像数据具有更高的复杂性。这些结果表明,框架的性能受到数据集特征和临床背景的影响。
| 数据集 | 准确率 (%) | 精确率 (%) | 召回率 (%) | F1 分数 (%) |
| Breast Cancer | 97.4 | 97.2 | 97.6 | 97.1 |
| Diabetes | 94.2 | 93.9 | 94.4 | 94 |
| MIMIC-III | 91.3 | 91 | 91.5 | 91.1 |
| NIH Chest X-ray | 90.8 | 90.4 | 91.2 | 90.6 |
表7:特定数据集的预测性能结果。
所提出的可解释人工智能框架在四个代表性医疗数据集上的预测性能。准确率、精确率、召回率和F1分数以百分比(%)形式报告于独立测试集上。数值越高表示分类性能越好。
为评估预测性能,本研究在四个具有代表性的医疗数据集上评估了四种机器学习与深度学习模型,分别为梯度提升(Gradient Boosting)、随机森林(Random Forest)、卷积神经网络(CNN)和多层感知机(MLP)。模型性能通过准确率、精确率、召回率、F1分数以及ROC曲线下面积(ROC-AUC)等指标进行评估,数据划分采用70:15:15的训练-验证-测试分割方式,并结合五折交叉验证在独立测试集上完成。通过在相同的预处理和验证条件下比较各模型的评估指标,确定预测性能的提升情况。
为了阐明不同模型在各类方法中的性能差异,图4以图示方式展示了集成学习模型、神经网络模型和深度学习模型各自的优缺点。

图4:机器学习与深度学习模型在医疗预测任务中的性能比较。 (A) 梯度提升、随机森林、卷积神经网络(CNN)和多层感知机(MLP)模型在测试数据集上的准确率比较。 (B) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的F1分数比较。 (C) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的精确率比较。 (D) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的召回率比较。数值越高,表示预测性能越好。梯度提升模型在所有评估指标中均取得最高性能,其次为随机森林。请点击此处查看该图的高清版本。
可解释性性能的解读。
在所评估的可解释性方法中,SHAP 始终取得了最高的保真度和稳定性评分,表明其生成的解释与底层模型预测之间具有更强的一致性。LIME 表现出相对较低的稳定性,提示其对局部扰动和采样变异性更为敏感。Grad-CAM 能为基于图像的模型提供视觉上可解读的解释,但其保真度略低于 SHAP。这些结果表明,解释质量既取决于所选择的解释方法,也与底层预测模型的架构相关。
管道中集成的可解释性技术已从定量和定性两个方面对其性能进行了评估。具体而言,特征归因方法在不同数据集上均能较为一致地揭示模型的内部逻辑。
本研究考虑的所有方法中,SHAP在所评估的可解释性方法中取得了最高的保真度(0.92)和稳定性(0.89)。简而言之,这些解释非常准确地反映了模型实际做出的预测。局部解释方法就像一扇窗口,使我们能够观察某一项具体预测,并理解模型做出该决策所依据的依据。
通过以人为中心的评估获得的保真度、稳定性、可理解性以及临床医生信任评分,对可解释性性能进行了评价。使用相同的数据集和训练好的模型,比较了SHAP、LIME和Grad-CAM三种解释方法。通过比较不同可解释性方法在解释质量指标和临床医生评分方面的表现,评估了可解释性的提升情况。适用于图像数据的深度学习模型可视化技术本质上生成的是热图,用以标识对模型预测最具相关性的图像区域。不同方法之间的特征重要性分布及可解释性性能比较如图5所示。

图5:可解释性性能评估。该图通过保真度和稳定性指标展示了可解释性方法的性能。SHAP在保真度(0.92)和稳定性(0.89)方面表现领先,反映出其解释结果与模型预测之间具有良好的一致性。LIME则在单个样本的可解释性方面表现最佳。另一方面,Grad-CAM输出的是主要用于成像模型的可视化热图,能够粗略显示对模型预测起关键作用的区域,从临床角度来看,这一点可能具有重要意义。请点击此处查看此图的放大版本。
在评估预测模型及可解释性技术后发现,模型的准确性与其解释的可靠性之间存在非常强的相关性。事实上,那些在预测性能上表现出提升的模型,在正确应用可解释性技术时,其结果的解释也展现出更高的稳定性与一致性。集成模型在配合特征归因方法时表现出最强的可解释性,而深度学习模型则更适合采用基于可视化 的可解释方法。预测准确性与解释可靠性之间的关联可参见图6,该图详细阐述了模型与可解释性之间的概念性动态关系。

图6:模型与可解释性方法的比较分析。该图表详细比较了多种模型的准确性和可解释性度量,包含一个展示准确性与解释稳定性之间相关性的散点图、一个性能的表格化对比,以及一个适用性矩阵,概述了不同的可解释性方法(SHAP、LIME 和 Grad-CAM)及其在不同类型模型中的有效性。该可视化结果清晰表明,集成模型结合 SHAP 能够提供优异的可解释性,而深度学习模型则可通过可视化技术实现可解释性。请点击此处查看此图的放大版本。
以人为中心的评估证实了所提出系统在医院及其他临床机构中的实际应用价值。医疗专业人员对有解释和无解释的模型输出结果进行了评审。结果显示,提供解释显著提高了用户的信任度和可解释性;平均信任值从1到5分的评分标准下从3.1分上升至4.7分。信任评分从3.1提升至4.7,代表相对改善幅度约为51.6%。较高的评分者间一致性(Fleiss' κ = 0.81)进一步表明临床医生对解释有用性的评估具有一致性。这些发现表明,可解释性输出可能增强用户对系统的信心,并促进对人工智能辅助临床决策的理解。专业人员表示,他们对模型输出的理解更清晰,对人工智能支持的临床判断更具信任,这凸显了可解释性在医疗健康实际应用中的重要意义。
我们通过消融分析进一步验证了框架的稳健性。移除通过可解释性方法判定为关键的特征后,预测性能显著下降。因此,该结果表明这些特征不仅相关,而且对预测任务具有重要意义。此外,在解释不同输入样本时,可解释性方法的结果始终仅表现出微小差异,从而体现了可解释性方法的稳定性和可靠性。
为了检验该流程在实际应用中的可行性,我们测量了其计算速度。引入可解释性技术导致计算时间有所增加,尤其是在特征归因和生成可视化结果的阶段。然而,总体执行时间仍然在可接受范围内,并不算过长。图7展示了计算时间在流程各个阶段的分布情况,包括预处理、模型训练、可解释性生成、评估以及可视化。

图7:流程执行时间的分解。 该图表展示了可解释人工智能流程中各个阶段(如预处理、模型训练、可解释性生成、评估和可视化)所占用的计算时间分布情况。数据显示,大部分时间消耗在模型训练阶段,其次是可解释性处理阶段。相比之下,预处理和报告阶段所花费的时间非常少。请点击此处查看该图的放大版本。
我们还通过消融分析检验了所提出框架的强度。移除通过可解释性方法发现的关键特征后,预测性能明显下降,这清楚表明这些特征不仅相关,而且非常重要。此外,即使输入样本发生轻微变化,解释结果的输出也相当稳定,这证明了可解释性技术的一致性和可靠性。
简而言之,通过结合预测性能评估、可解释性分析以及以用户为中心的验证,结果表明所提出的框架是有效的。该系统不仅能够做出高度准确的预测,而且保持了高度的可解释性和易用性。引入可解释性方法使整个过程透明化,同时并未牺牲模型的性能。我们在预测准确性和可解释性方面观察到的改进不仅是在严格的实验控制下实现的,而且具有统计学显著性,这说明了所提出方法的稳健性与真实性。在不同预测模型之间进行的成对比较,采用了交叉验证折间的配对t检验。梯度提升模型与竞争模型之间存在统计学上的显著差异(p < 0.05),证实了所提出配置的优越性。
总体发现。
综合来看,研究结果表明,预测性能、解释质量以及临床医生的信任度可以在一个统一且可重复的工作流程中进行评估。该框架在多个医疗数据集上保持了稳定的性能,同时通过SHAP、LIME和Grad-CAM解释方法支持透明的模型解读。然而,这些发现应结合所选数据集和验证设置的具体背景加以理解,在实际应用之前仍需进行额外的外部验证。
数据可用性:
本研究所使用的数据集来自公开资源,可在知名的数据存储库中获取。例如,与乳腺癌和糖尿病相关的数据可从加州大学欧文分校机器学习存储库下载,网址为:https://archive.ics.uci.edu/ml/index.php
可通过 PhysioNet 获取电子健康记录数据集(MIMIC-III):
https://physionet.org/content/mimiciii/1.4/
胸部X光成像数据来自NIH胸部X光数据集,可在以下网址获取:https://www.kaggle.com/datasets/nih-chest-xrays/data
本研究中所使用的全部数据集均已匿名化并公开提供。研究过程中产生的预处理步骤、训练好的模型及可解释性输出结果,可在提出合理请求的情况下通过通讯作者获取。源代码、预处理脚本、配置文件及可重复性相关资源将在稿件被接收后存入公共仓库。
本研究开发并评估了一种可重复的、可解释的人工智能(XAI)工作流程,用于医疗数据分析。该流程在一个统一的协议中集成了预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源。结果表明,在所评估的结构化医疗数据集上,基于集成的机器学习模型(特别是梯度提升和随机森林)表现出最高的预测性能,而深度学习模型则更适用于基于图像的分析。这些发现强调了应根据数据特征选择模型架构的重要性,而非假设更复杂的模型总会带来更优的性能。本研究的一个关键贡献在于,将预测建模、可解释性评估、以人为中心的评估以及可重复性实践整合到一个标准化的工作流程中。与孤立评估可解释性技术的研究不同,所提出的框架提供了一种以协议为驱动的方法论,支持在多种医疗数据集上进行透明且可重复的实验。
可解释性分析在所评估的方法之间显示出可测量的差异。在所评估的实验条件下,SHAP 实现了最高的保真度和稳定性得分,表明其生成的解释与模型预测之间具有更紧密的一致性。LIME 提供了有用的局部解释,但表现出较低的稳定性,而 Grad-CAM 为影像数据生成了直观的可视化解释。这些发现表明,解释质量取决于所选择的可解释性方法以及底层的预测模型。以人类为中心的评估进一步表明,提供解释能够提升临床医生的信任度和可理解性。信任度评分的显著提升以及较高的评分者间一致性(Fleiss’ κ = 0.81)表明,参与者对解释有用性的评估具有一致性。这些发现支持了可解释性方法在提升医疗决策支持系统透明度和用户接受度方面的潜在价值。
在解释结果时应考虑若干局限性。首先,该框架仅使用了数量有限的公开数据集进行评估,可能无法充分代表真实临床环境中遇到的变异性。其次,临床医生的评估涉及的参与者队列相对较小,这可能限制其结果的普适性。第三,本研究中探讨的可解释性方法属于事后解释技术,因此仍受制于已知的局限性,包括对扰动的敏感性以及解释结果与模型真实推理过程之间可能存在差异。最后,跨独立医疗机构的外部验证超出了本研究的范围。
未来的研究应探讨整合临床记录、医学影像、生理信号和可穿戴传感器数据的多模态医疗健康分析。还需进一步研究因果及反事实解释方法、不确定性量化、公平性评估、校准分析以及前瞻性临床验证。此类研究可能进一步提升可解释人工智能系统在医疗健康领域的透明度、可靠性和适用性。
除了性能评估之外,还应考虑若干实际实施挑战和协议修改,以确保在不同医疗环境中稳健部署所提出的可解释人工智能框架。
可解释性方法的局限性
SHAP、LIME 和 Grad-CAM 虽然能够提供有关模型行为的有益见解,但也存在若干缺点。文献中已指出,这些工具在重复运行时可能不稳定,对扰动非常敏感,不同数据集之间的结果可能存在差异,有时无法准确反映模型做出决策的真实原因。因此,事后解释应仅被视为补充性证据,而非因果决策机制的真实写照。在将其应用于具有重大影响的临床场景之前,对解释的可信度进行充分验证仍然是至关重要的步骤。
这与近期生物医学人工智能研究的发现一致,这些研究强调在临床环境中实施前,必须对可靠性验证进行解释。在心脏骤停预测系统中,可解释性的引入已成为验证的关键方面,以提高系统的透明度并获得临床预测的信任41。同样,利用可视化驱动的可解释性技术进行肝脏超声图像分割,旨在提升模型的可解读性,同时并未忽视事后解释存在局限性的事实。这些研究证实,解释一致性检查、解释鲁棒性测试以及具有临床意义的可解释性输出验证,对于达到最高级别的临床应用就绪状态是必不可少的42。
校准、公平性、鲁棒性与外部泛化
该框架的未来版本将包括通过校准曲线和Brier评分对概率校准进行评估,采用贝叶斯方法和基于集成的方法估计不确定性,对人口学亚组进行公平性审计,以及在存在噪声数据和变化的领域条件下进行鲁棒性检验。这些分析在医疗环境中尤为重要,因为模型的置信度、公平的性能表现以及在不断变化的临床环境下的可靠性会直接影响患者安全和临床应用。近期基于人工智能的科学框架同样强调了可信、透明且可靠的决策支持系统的重要性,这超出了传统预测性能评估的范畴43。
故障排除与实验方案修改
在成功实施所提出的可解释人工智能框架时,需要考虑若干实际问题。一个典型的问题是过拟合,例如在相对较小的医疗数据集上训练深度学习模型时。可通过应用交叉验证、早停法、Dropout 正则化、数据增强以及充分的超参数优化来减少过拟合。在训练过程中监控验证集性能,是避免模型过于复杂而泛化能力差的有效方法。
医疗数据集中的另一个非常重要的问题是类别不平衡,即阳性临床结果远少于阴性病例。为解决这一问题,建模流程中应包含分层抽样、类别权重调整、合成少数类过采样技术,以及使用F1分数和ROC-AUC等平衡的评估指标。忽略类别不平衡可能导致生成的性能指标无法真实反映模型效果,并导致临床预测出现偏差。
医学影像数据集通常并非完美,可能受到噪声、采集伪影、质量不一致等因素的影响。这些因素还随成像设备类型的不同而变化。此类问题可能对模型的预测性能产生负面影响,并影响可解释性输出的结果。因此,应采用标准化的预处理步骤、图像归一化、质量控制检查以及数据增强技术,以确保模型的鲁棒性和可靠性。
SHAP 能够推导出具有高度信息量的特征归因解释。然而,不能忽视其存在不稳定的可能,尤其是在特征高度相关或模型输出对输入数据的微小变化非常敏感的情况下。为了提高解释的一致性和可靠性,建议多次生成解释、通过多次运行评估稳定性、采用特征分组策略,并与其他可解释性方法(如 LIME)进行对比验证。
在处理大规模医疗数据和庞大的深度神经网络架构时,GPU 内存限制可能成为主要制约因素之一。通过调整批量大小、采用混合精度训练、模型剪枝、降低特征维度以及使用高效的数据加载方法,可显著降低内存需求。此外,在低资源系统上部署该框架的研究人员还可考虑使用云计算环境或分布式训练。
所提出的框架采用模块化设计,可根据不同的医疗应用轻松进行调整。根据具体的临床任务,科研人员可更改一个或多个独立的预测模型,添加新的解释方法,联合使用不同类型的医疗数据,或引入不确定性量化与校准模块,而无需改变整体工作流程。这种灵活性使得该框架能够适用于差异较大的医疗分析场景,同时仍保持可重复性和可解释性。
监管与伦理考量:
可解释性更强的人工智能系统可为医疗保健带来巨大帮助。但这并不足够。必须满足监管机构对透明度、问责制、隐私保护和患者安全的要求。即使可解释性可能提升信任度和可理解性,单靠它也无法确保临床有效性。负责任的实施需要前瞻性临床验证、公平性评估、监管审查以及部署后的持续监测。此外,在未来部署该框架时,还应考虑患者隐私保护、临床医生的监督,以及在不同人口群体中表现的公平性。为了融入真实世界的临床工作流程,人工智能系统与医疗专业人员之间必须实现无缝协作。因此,可解释性信息应整合到现有的电子健康记录系统和临床决策支持平台中,而不应作为仅能独立运行的孤立工具。最终的决策必须由医生做出,而可解释人工智能仅是一种辅助技术,旨在增强透明度、支持循证推理,并促进医护人员与患者之间的沟通。
本文提出了一种可重复的协议,用于开发、评估和解释医疗健康数据分析中的可解释人工智能系统。该贡献以方法学和工作流程为导向,为研究人员和临床医生提供了一个标准化的框架,可在多种医疗健康应用中复制、调整和扩展。该框架以统一的方式整合了数据预处理、预测建模、可解释性方法和性能评估等多个方面。在多个医疗健康数据集上的实验表明,该方法具有较强的预测性能。在结构化数据分析中,模型集成方法表现最佳,而深度学习模型在医学影像任务中表现出很高的有效性。此外,通过使用解释技术,用户能够更轻松地理解模型,因为它提供了对预测结果的全局和局部解释。因此,这不仅提高了临床医生对模型的信任度,也增强了模型的可用性。研究结果表明,可解释的人工智能有助于构建透明且可解释的医疗健康分析系统,在模型准确性与可解释性之间取得平衡,这对于可靠且值得信赖的医疗健康分析至关重要。因此,本文提出的方法是一种高效且直接的医学数据分析工具,可帮助医疗专业人员使用他们信任的人工智能技术。本文提供了一种可重复的协议,用于开发、评估和解释医疗健康数据分析中的可解释人工智能模型。通过在一个统一的工作流程中整合数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源,该协议为透明的医疗人工智能研究提供了实用的框架。该工作流程可适用于多种医疗健康数据集和应用领域,支持可重复地实现、评估和报告可解释的机器学习系统。
作者声明,他们对本研究不存在任何竞争性财务利益或相关利益冲突。本研究独立开展,未涉及任何可能被视为潜在利益冲突的商业或财务关系。
人工智能使用披露
在手稿撰写过程中,使用了人工智能工具进行语言润色、语法检查和编辑辅助。所有科学内容、实验设计、数据分析、结果解释以及最终手稿的核实均由作者完成。作者对所有人工智能辅助生成的内容进行了审阅和验证,以确保其准确性、完整性和符合期刊投稿指南。
作者感谢各自机构为开展本研究提供了必要的基础设施和科研支持。作者还感谢使用了公开可用的数据集和开源工具,这些资源促进了所提出的可解释人工智能框架的开发与评估。特别感谢领域专家在以人为中心的评估阶段提供的宝贵见解。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| GPU 工作站 | Manufacturer dependent | NA | 训练深度学习模型 |
| Jupyter Notebook | Project Jupyter | Latest stable release | 交互式实验执行 |
| LIME | LIME | Version 0.2.0 | 局部可解释性分析 |
| Matplotlib | Matplotlib Project | Version 3.9 | 数据可视化 |
| MIMIC-III 数据库 | PhysioNet | Version 1.4 | 电子健康记录分析 |
| NIH 胸部 X 光数据集 | NIH 临床中心 | Public Dataset | 胸部疾病分类 |
| NumPy | NumPy 开发者团队 | Version 1.26 | 数值计算与数组操作 |
| OpenCV | OpenCV 基金会 | Version 4.10 | 图像预处理 |
| Pandas | Pandas 开发团队 | Version 2.1 | 数据处理与预处理 |
| Pima 印第安人糖尿病数据集 | UCI 机器学习知识库 | Public Dataset | 糖尿病风险预测 |
| Python 3.11 | Python 软件基金会 | Version 3.11 | 主要编程环境 |
| Scikit-learn | scikit-learn | Version 1.5 | 机器学习算法与评估 |
| Seaborn | Seaborn | Version 0.13 | 统计可视化 |
| SHAP | SHAP | Version 0.46 | 特征归因与可解释性分析 |
| TensorFlow | TensorFlow | Version 2.15 | 深度学习模型开发 |
| Windows / Ubuntu Linux | Microsoft / Canonical | NA | 操作系统 |
| 威斯康星乳腺癌数据集 | UCI 机器学习知识库 | Public Dataset | 乳腺癌诊断 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可