研究文章

一种可重复的协议:用于开发和评估医疗数据分析中的可解释人工智能框架

DOI:

10.3791/71999

2026年7月31日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文介绍了一种可重复的协议,用于开发和评估面向医疗数据分析的可解释人工智能模型。该工作流程整合了数据预处理、预测建模、基于SHAP、LIME和Grad-CAM的可解释性分析、定量评估以及以人为中心的验证,以支持透明且可信的临床决策。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

可解释的人工智能(XAI)正日益被视为在医疗保健领域构建可信人工智能系统不可或缺的工具,因为在临床决策过程中,透明性以及解释决策的能力是至关重要的组成部分。本文介绍了一种可重复的实验方法,用于开发和评估面向医疗数据分析的可解释人工智能系统。所构建的流程将数据预处理、预测建模、解释生成和评估等步骤整合为一个无缝的工作流,可同时适用于结构化临床数据和医学影像数据集。集成机器学习模型在结构化表格数据集上表现出较强的预测性能,而深度学习模型则擅长从医学影像数据中学习复杂的模式。SHAP、LIME 和 Grad-CAM 等技术提供了全局和局部解释,有助于模型的理解。该框架的定量评估涵盖多种不同指标,包括准确率、精确率、召回率、F1 分数、ROC-AUC、解释性指标、保真度和稳定性。结果表明,在控制实验条件的情况下,该框架在所评估的实验条件下表现出更优的预测性能和解释质量。作为一份以实验方案为导向的文档,本研究支持其他研究者对方法进行可重复和可扩展的持续实施。这种透明且易于理解的人工智能模型,是临床决策支持系统和医疗数据分析系统获得广泛信任与应用的基础。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工智能(AI)通过支持疾病诊断、预后评估、风险分层、医学影像分析和临床决策,已成为现代医疗保健的重要组成部分1。机器学习和深度学习的进步使医疗系统能够处理大量结构化和非结构化数据,其预测性能通常可达到甚至超过传统统计方法2。尽管取得了这些进展,许多AI模型仍以复杂的黑箱系统方式运行,导致临床医生和医疗利益相关者难以理解预测结果的生成过程3。这种缺乏透明性的问题可能限制高风险医疗环境中对AI的信任、采纳和责任追溯能力4,5

可解释性人工智能(XAI)已成为提高机器学习模型透明度和可解释性的有前景方法6。广泛应用的解释技术包括SHAP(Shapley加性解释)、LIME(局部可解释的模型无关解释)和梯度加权类激活映射(Grad-CAM),这些技术通过特征归因和可视化解释机制揭示模型行为7,8,9。这些方法 increasingly 被应用于医疗健康领域,以支持临床解释、模型审计和决策支持10,11。然而,仅具备可解释性并不能保证模型的可靠性、可重复性或临床实用性。近期研究指出了与解释结果不稳定性、对扰动敏感、临床医生验证有限以及解释输出与模型真实推理之间存在不一致等相关挑战12,13,14,15

除了可解释性方面的挑战外,可重复性在医疗机器学习研究中仍然是一个重要的问题16,17,18。许多已发表的研究在预处理流程、软件环境、超参数配置、验证策略和实现工作流方面提供的信息有限,导致独立重复实验十分困难19,20,21。此外,医疗人工智能研究往往侧重于预测性能,而在解释质量评估、以临床医生为中心的评价以及实际实施考虑方面提供的指导较为有限22。这些局限性可能会阻碍可解释人工智能系统从研究环境向真实世界医疗场景的转化23,24,25,26,27

当前医疗健康领域的可解释人工智能(XAI)工作流程通常孤立地评估单个解释方法或预测模型,很少提供整合数据准备、预测建模、可解释性评估、以人为中心的评估以及可重复性资源的标准化协议28,29,30,31。因此,研究人员和实践者在不同医疗健康数据集和应用领域中重复工作流程、比较解释方法或评估可解释人工智能系统的实际效用时,可能会遇到困难。因此,亟需一种全面且可重复的协议,以促进医疗健康可解释人工智能工作流程的一致实施、评估和报告32,33,34,35

本文提出了一种可重复的协议,用于在医疗健康数据分析中开发、评估和解释可解释的人工智能系统。该协议在一个统一的工作流程中整合了数据预处理、预测建模、使用SHAP、LIME和Grad-CAM进行可解释性评估、以临床医生为中心的评估、验证程序以及可重复性资源。其目标是提供一个标准化框架,以支持在不同医疗健康数据集上实现透明的模型开发、解释质量评估和可重复的实施36,37,38,39。本研究的方法学贡献在于将预测分析、可解释性评估、临床医生验证和可重复性实践整合到单一协议中,适用于医疗健康人工智能领域的研究、教育及面向部署的研究项目40,41,42,43

本研究的主要贡献并非开发一种新的可解释性算法。

相反,本研究提供了一种标准化、可重复且经过实验验证的方案,将预测建模、可解释性评估、可视化、结果评价以及以人为中心的解释整合为统一的工作流程,适用于医疗健康数据分析及 JoVE 平台的方案传播。本研究的主要目标并非提出一种全新的预测算法,而是为在医疗健康数据分析中实施可解释人工智能工作流程提供一套标准化、可重复且经过实验验证的方案。该方案将数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源整合为一个统一的框架,便于被采纳、复制和用于教学传播。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究中使用的所有数据集均来自公开且完全匿名的数据库,包括UCI机器学习库、PhysioNet MIMIC-III数据库以及NIH胸部X光片数据集。未访问任何可识别的患者信息。本研究符合机构科研伦理指南中关于公开可用的去标识化数据二次分析的规定。由于未直接招募人类受试者,也未使用任何受保护的健康信息,因此无需正式的机构审查委员会批准。

1. 实验框架概述

  1. 开发一种可重复、可解释的人工智能(XAI)流程,用于透明的医疗健康数据分析。将工作流程划分为数据层、预处理层、建模层、可解释性层、评估层和可视化层。
  2. 将这些模块集成到一个统一的工作流程中,能够处理结构化临床数据、电子健康记录和医学影像数据集。
  3. 确保每个模块都有助于实现可重复性、可解释性、可扩展性以及标准化的实验执行。
  4. 设计模块化架构以支持连续的数据流,并确保流程中的每个阶段在整个实验工作流程中均有助于实现可重复性、可解释性和可扩展性。

2. 计算环境与系统配置

  1. 在执行工作流程之前,打开命令行终端并运行以下命令,以安装所需的软件依赖项:
    pip install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. 在进行数据预处理和模型开发之前,验证所有软件包是否成功安装,并确认其与材料表中列出的软件版本兼容。
  3. 使用 Python 3.11 作为主要编程环境。安装并配置 NumPy 1.26 和 Pandas 2.1,用于数据处理和特征工程任务。安装 Scikit-learn 1.5,用于机器学习模型的开发与评估。
  4. 安装 TensorFlow 2.15,用于深度学习模型的训练与推理。安装 SHAP 0.46 和 LIME 0.2.0,用于可解释性分析。安装 OpenCV 4.10,用于图像处理任务。安装 Matplotlib 3.9 和 Seaborn 0.13,用于数据可视化和结果报告。有关可重复性所需的完整软件规格和实现细节,请参见材料表
  5. 使用配备多核处理器、图形处理单元(GPU)加速以及充足内存资源的工作站配置计算环境,以支持大规模医疗数据集和深度学习工作负载。
  6. 为数据划分、模型初始化和训练过程设置固定的随机种子,以确保多次实验运行之间的可重复性。启用日志记录机制,以记录整个工作流程中的数据预处理操作、模型配置、超参数设置、训练过程及评估结果。
  7. 根据表1中汇总的规范,配置模型架构、优化参数、学习率、批量大小、训练设置和超参数值。在复现实验过程中遵循这些设置,以确保与报告结果的一致性。
  8. 预期输出——一个完全配置好且可重复的计算环境,包含所有必需的软件包、硬件资源、日志记录机制以及模型配置设置,可用于后续的数据预处理、模型开发、可解释性分析和评估流程。
组件参数数值描述
随机森林n_estimators100树的数量
随机森林max_depth树的深度
XGBoostlearning_rate0.01学习率
XGBoostn_estimators100提升轮数
CNNepochs25训练轮数
CNNbatch_size32批次大小
CNNoptimizerAdam优化算法
MLPhidden_layers2隐藏层数量
MLPactivationReLU激活函数
通用train_split70%训练数据比例
通用validation_split15%验证集比例
通用test_split15%测试集比例

表1:实现细节与超参数配置。

本表格总结了在所提出的可解释人工智能框架的实验评估过程中,所使用的计算环境、软件库、机器学习与深度学习模型配置、优化设置、学习率、批量大小、训练参数以及超参数值。

3. 数据集准备与预处理

  1. 选择公开可用的医疗保健数据集,以确保实验流程的透明性和可重复性。
  2. 使用四个具有代表性的医疗保健场景来验证所提出的框架:(i) 使用威斯康星乳腺癌数据集进行乳腺癌诊断,(ii) 使用美国印第安人皮马糖尿病数据集进行糖尿病风险预测,(iii) 使用MIMIC-III电子健康记录进行临床结局预测,(iv) 使用NIH胸部X光数据集进行胸科疾病分类。选择这些数据集以评估该框架在结构化临床记录、纵向电子健康记录以及医疗影像模态中的适用性,这些模态常见于医疗决策支持系统中。
  3. 将每个数据集导入Python环境,并将记录分离为输入特征和目标变量。针对疾病预测任务组织结构化临床数据,针对纵向结局分析整理电子健康记录,针对诊断分类任务处理医学影像数据集。在进行预处理操作前,验证每个数据集的完整性。
  4. 采用适当的填补技术识别并处理缺失值。通过特征缩放和归一化方法对数值型特征进行标准化,以确保变量间的可比性。
  5. 根据数据集特征,使用合适的编码方法对分类变量进行编码。通过相关性分析和基于模型的特征重要性度量进行特征选择,识别最相关的变量并降低数据维度。
  6. 在模型训练前将所有医学图像调整为224 × 224像素。根据所选深度学习架构的要求对像素强度值进行归一化。应用数据增强技术,包括图像旋转和水平翻转,以提高模型泛化能力并减少过拟合。验证图像质量,并确保整个数据集中图像尺寸的一致性。
  7. 通过评估数据集完整性、一致性以及特征与标签的对齐情况来评估数据完整性。验证所有记录是否正确分配至其对应的目标类别。审查数据集特征,包括样本量、特征数量和数据模态,如表2中所总结。
  8. 实施针对各数据集的验证程序,以确保方法学的严谨性和可重复性。记录每个数据集的样本量、类别分布、训练-验证-测试划分策略、防泄漏措施、超参数优化流程、交叉验证设计以及外部测试协议。将这些验证程序总结于表3中。
  9. 通过评估缺失值处理、异常值剔除、特征缩放、分类变量编码、类别分布保持以及数据集划分程序,执行预处理质量控制检查。验证预处理操作在所有数据集中是否一致应用。
  10. 确认在数据集划分过程中不存在显著的数据泄露。审查图1中展示的预处理验证结果,确保已生成标准化数据集,用于后续的机器学习与可解释性分析。
  11. 预期输出——生成经过清洗和标准化的数据集,其中缺失值已适当处理,分类变量已完成编码,数值特征已完成归一化,并将记录划分为训练、验证和测试子集。确保数据集特征、类别分布和验证程序与表2表3中报告的内容一致,并确认如图1所示的预处理验证已成功完成。
数据集类型样本数特征数目标变量
Breast Cancer表格型56930良性/恶性
Diabetes表格型7688糖尿病结果
MIMIC-III电子健康记录~60,000临床变量死亡率
Chest X-ray影像~112,000图像疾病标签

表2:数据集特征与医疗保健应用场景。

本表总结了研究中使用的医疗保健数据集,包括数据集类型、样本数量、特征数量、目标变量、医疗保健应用领域以及相关临床应用场景。这些数据集涵盖结构化临床记录、电子健康记录和医学影像数据,以展示该框架在多种医疗保健分析场景中的适用性。

数据集样本量类别分布划分策略数据泄露预防超参数搜索交叉验证外部测试
Breast Cancer (UCI Wisconsin)569357 良性 / 212 恶性70/15/15仅训练集预处理网格搜索5折分层交叉验证独立保留集
Pima Indians Diabetes768500 非糖尿病 / 268 糖尿病70/15/15仅训练集预处理网格搜索5折分层交叉验证独立保留集
MIMIC-III EHR5274按结局分层的队列70/15/15 患者水平患者水平分离随机搜索5折患者水平交叉验证独立保留集
NIH Chest X-ray112120肺炎/正常分层70/15/15图像水平分离随机搜索5折分层交叉验证独立保留集

表3:数据集层面的验证与实验设计。

本表格总结了每个数据集所采用的验证方法,包括样本量、类别分布、训练-验证-测试集划分策略、数据泄露预防措施、超参数优化方法、交叉验证设计以及外部测试协议。这些措施的实施旨在确保方法学的严谨性、可重复性以及无偏倚的模型评估。

数据预处理步骤:缺失值分析、特征缩放、异常值处理、分类变量编码。
图1:数据预处理流程的验证。
模型开发前关键预处理操作的验证结果。(A)代表性医疗健康特征的缺失值分析。(B)数值变量在异常值处理前后的分布情况。(C)使用标准化方法进行特征缩放的验证。(D)分类变量编码的验证。(E)预处理后的类别分布。(F)训练集-验证集-测试集数据划分的验证。这些结果证实了数据集的预处理和准备工作已成功完成,可用于后续的预测建模与可解释性分析。请点击此处查看该图的高清版本。

4. 可解释人工智能框架的系统架构

  1. 采用分层架构组织框架,以实现模块化处理,提高工作流程的透明度,并支持可重复的实施。配置数据层以接收和管理原始医疗数据集。在启动预处理操作之前,将所有输入数据集通过数据层进行路由。
  2. 在预处理层中执行数据清洗、转换、归一化、特征工程和编码操作。确保所有预处理操作在模型开发之前完成。
  3. 在建模层中使用机器学习和深度学习算法开发预测模型。利用经过预处理的数据集和优化的超参数配置,训练梯度提升(Gradient Boosting)、随机森林(Random Forest)、多层感知机(MLP)和卷积神经网络(CNN)模型。
  4. 在可解释性层中应用可解释性技术以解读模型预测结果。对结构化数据集使用SHAP和LIME生成特征归因解释。对基于图像的模型生成Grad-CAM热图,以可视化对模型预测有贡献的区域。
  5. 在评估层中评估预测性能和可解释性性能。计算准确率、精确率、召回率、F1分数、ROC-AUC、保真度、稳定性以及面向临床医生的评估指标。记录所有评估输出,用于后续分析和报告。
  6. 在可视化层中生成临床可解读的可视化输出。创建性能对比图、特征重要性可视化图、SHAP汇总图、LIME解释图、Grad-CAM热图以及面向临床医生的报告仪表盘。存储所有可视化输出,以便纳入最终实验报告。
  7. 在执行工作流程之前,请先审阅 图2 中所示的完整框架架构。
  8. 预期输出——生成完全训练好的机器学习和深度学习模型,包括梯度提升、随机森林、CNN和MLP架构。存储模型配置、优化后的超参数、训练日志、检查点文件、可解释性输出以及可视化产物,用于后续的评估和可解释性分析。

数据处理示意图;从结构化数据到可视化:清洗、建模、可解释性。
图 2:用于医疗数据分析的可解释人工智能框架的系统架构。 请点击此处查看此图的放大版本。

5. 工作流程执行

  1. 从公开可用的数据库获取医疗健康数据集,并将数据集存储为适用于机器学习和深度学习分析的结构化格式。在启动实验流程之前,先查看 图3 中所示的完整工作流程。
  2. 根据第3节所述的步骤进行数据清洗和预处理。使用适当的缩放方法对数值变量进行归一化处理。采用合适的编码技术对分类变量进行编码。根据数据集特定的填补策略识别并填补缺失值。在进入模型开发之前,验证数据质量、特征与标签的对齐性以及数据集的完整性。
  3. 将每个数据集划分为训练集、验证集和测试集,以支持无偏的模型评估。在数据集划分过程中保持类别分布,并在适用时实施防止数据泄露的措施。测试集应专门保留用于最终模型评估。
  4. 在结构化数据集上使用基于集成的算法(包括梯度提升和随机森林)训练机器学习模型。在影像数据集上使用能够学习空间图像特征的卷积神经网络(CNN)架构训练深度学习模型。在训练过程中迭代更新模型参数,并在每个训练周期后监控验证性能。当验证性能下降或未能根据预定义的停止标准改善时,应用早停机制。
  5. 使用系统化的搜索策略(包括网格搜索和随机搜索)优化模型超参数。根据验证性能调整学习率、估计器数量、树深度、批量大小、训练周期数以及其他模型特定参数。基于预测性能和在不同验证数据集上的泛化能力选择最终模型。
  6. 在完成模型训练后应用可解释性方法。使用特征归因技术生成全局解释,以识别对模型预测贡献最大的变量。生成局部解释以分析单个预测案例,并在样本层面评估模型行为。为图像分类模型生成Grad-CAM热图,以突出图像中对预测结果有贡献的区域。保存所有解释输出,供后续分析和报告使用。
  7. 使用准确率、精确率、召回率、F1分数以及受试者工作特征曲线下面积(ROC-AUC)评估预测性能。使用保真度和稳定性指标评估解释质量,以衡量解释的可靠性和一致性。比较不同数据集和可解释性方法下的模型性能,以评估框架的鲁棒性和泛化能力。
  8. 生成可视化输出和分析报告,以临床可解释的方式传达结果。创建性能对比图表、特征重要性图、SHAP汇总可视化、LIME解释输出、Grad-CAM热图以及其他临床相关的可视化内容。在报告前审查所有可视化输出,确保其清晰性和一致性。
  9. 记录所有预处理操作、模型配置、超参数设置、可解释性方法、验证策略和评估结果。保留详细的实验记录,以促进结果的可重复性和工作流程的独立复现。通过多次实验运行验证结果的一致性,并归档所有工作流程产物以供未来参考。
  10. 预期输出——生成一个具有优化超参数的完全训练好的预测模型,包含保存的模型权重、训练日志、性能指标以及可解释性输出,包括SHAP解释、LIME解释和Grad-CAM热图。存储所有模型产物、评估报告和可视化输出,用于后续分析和可重复性评估。

数据处理工作流程图:层次包括预处理、建模、评估、临床输出。
图3:可解释人工智能流程的端到端工作流程。 请点击此处查看此图的放大版本。

6. 模型评估与可解释性评估

  1. 使用标准分类指标评估预测模型的性能,包括准确率、精确率、召回率、F1分数以及受试者工作特征曲线下面积(ROC-AUC)。计算准确率以衡量整体分类的正确性。
  2. 计算精确率以评估正确识别的阳性预测所占的比例。计算召回率以评估模型识别阳性样本的能力。计算F1分数以平衡精确率和召回率。计算ROC-AUC以评估模型在不同分类阈值下的区分能力。
  3. 在所有数据集和模型架构上一致地应用这些评估指标,以便进行客观的性能比较。记录所有指标数值,并保存评估结果,用于后续的统计分析和报告。
  4. 使用保真度和稳定性指标评估可解释性性能。计算保真度以确定生成的解释在多大程度上准确反映了模型的预测结果和决策行为。
  5. 通过比较相似输入样本生成的解释,并量化解释输出的一致性来计算稳定性。在解释模型的可解释性结果之前,验证保真度和稳定性数值是否满足预定义的质量标准。
  6. 比较SHAP、LIME和Grad-CAM输出的可解释性性能。
  7. 预期输出——生成定量评估结果,包括准确率、精确率、召回率、F1分数、ROC-AUC、保真度和稳定性指标。生成适用于科学报告、可重复性评估和临床解释的可解释性输出及可视化结果。

7. 以人为中心的评估

  1. 招募12名医疗专业人员,包括6名医师、3名放射科医生和3名临床数据分析师。选择具有临床决策、医学影像解读、医疗数据分析或电子健康记录审查经验的参与者。在开始评估程序之前,须获得所有参与者的知情同意。
  2. 在完成模型训练和可解释性分析后,从测试数据集中随机选取100个病例。为每个病例生成两种评估条件:
    1. 仅提供预测结果的输出,以及
    2. 提供预测结果并附带可解释性信息。随机化病例和评估条件的呈现顺序,以最小化呈现偏差和学习效应。
  3. 准备包含预测结果、解释输出和评估问卷的标准化评估表。通过基于计算机的评估界面,逐一向参与者展示病例。
  4. 指导参与者独立审阅每个病例,不得与其他评估者讨论其回答。允许参与者在相同的实验条件下完成所有评估。
  5. 采用改编自已发表的可解释人工智能评估研究的五点李克特量表问卷。指导参与者对每个审阅病例的信任度、可解释性和可用性进行评分。以电子方式记录问卷回答,并在进行统计分析前核实所有调查项目的完成情况。
  6. 在评估过程中测量临床实用性的客观指标。通过将参与者决策与相应参考标签或真实结果进行比较,记录决策一致性。将决策一致性计算为参与者决策与参考结果一致的百分比。
  7. 通过测量病例呈现至最终响应提交之间的时间间隔,记录每个病例的审阅时间。分别计算仅预测条件和预测加解释条件下的平均审阅时间。
  8. 计算所有参与者和评估病例的平均信任度、可解释性和可用性评分。比较仅预测条件与预测加解释条件下获得的评分。
  9. 在完成所有参与者评估后,进行配对t检验,以确定信任度、可解释性、可用性、决策一致性和审阅时间的差异是否具有统计学显著性。所有统计比较采用 p < 0.05 作为显著性阈值。
  10. 在收集所有参与者的响应后,计算Fleiss Kappa以评估评估者间的一致性。使用汇总的参与者评分确定不同评审者之间评估结果的一致性。根据既定的同意度指南解释Fleiss Kappa值,并记录相应的同意度统计结果。
  11. 表4中汇总参与者人口统计信息、评估方法、问卷设计、统计分析流程、客观性能指标以及评估者间一致性结果。
  12. 在两种评估条件下审查模型输出,并比较不同条件下的参与者响应。验证解释信息是否在不影响决策质量的前提下提升了信任度、可解释性和可用性。
  13. 使用计算得到的Fleiss Kappa统计量确认参与者评估结果的一致性。记录所有评估结果,用于后续报告和可重复性评估。
  14. 预期输出——生成临床医生信任评分、可解释性评分、可用性评分、决策一致性指标、审阅时间统计、配对t检验结果以及评估者间一致性统计。提供定量证据,描述该可解释人工智能框架在临床上的实用性、可解释性和可信度。
参数数值
专家12
医师6
放射科医生3
临床数据分析师3
评审病例数100
评估设计随机化(仅预测 vs 预测+解释)
调查工具5点李克特量表
信任度评估可解释性、信任度、可用性
统计检验配对t检验(p 0.05)
评分者间信度Fleiss Kappa
客观指标决策一致性、评审时间

表4:以人为中心的评估方案与临床医生评估设计。

本表格展示了用于评估可解释人工智能系统在可解释性、可信度和可用性方面的临床医生评估框架。内容总结了参与者人口统计学信息、病例审查方法、调查设计、统计分析流程、评分者间信度评估以及客观评估指标。

8. 验证与可重复性评估

  1. 进行验证与消融实验,以评估所提出框架的稳健性与可靠性。利用选定的可解释性方法识别具有高重要性评分的特征。逐步移除重要特征,并在每次移除特征后重新训练预测模型。
  2. 在每次消融实验后,使用准确率、精确率、召回率、F1分数和ROC-AUC等指标评估模型性能。将所得性能值与基线模型性能进行比较,以确定各个特征对预测结果的贡献。
  3. 通过SHAP、LIME和Grad-CAM方法对相似输入样本生成解释,以评估解释的稳定性。在多次重复评估中比较解释结果,并使用预定义的稳定性指标量化一致性。验证在输入发生微小变化及多次实验重复运行时,解释结果仍保持稳定。
  4. 在整个工作流程中记录所有实验步骤。详细记录数据预处理操作、数据集划分方法、模型架构、超参数设置、训练配置、可解释性方法、验证策略及评估指标。将所有配置参数和实验结果以结构化格式存储,以支持结果的可重复性与独立验证。
  5. 审查所有实验记录,确保其完整性与一致性。确认所记录的流程、配置文件及软件规格足以实现工作流程的复现。保持模块化的工作流程结构,以便未来研究中对该方案进行调整,并支持将其转化为符合JoVE方法学要求的视频实验方案。

9. 可重复性资源

  1. 使用固定的随机种子执行所有实验,以确保在重复运行中结果的可重复性。将源代码、预处理脚本、配置文件、环境规格、模型参数和可视化脚本保存在公开可访问的代码仓库中。
  2. 提供详细的数据集获取、预处理、实验执行、模型训练、可解释性生成、验证流程以及所有报告表格和图表再生的操作说明。归档独立复现所需的全部工作流程组件,包括软件规格、预处理流程、配置文件、数据集访问说明、模型检查点和可视化资源。
  3. 表5中总结本框架所使用的软件资源、预处理流程、配置文件、数据集访问说明及可重复性相关资源。
  4. 预期输出- 生成一个完整的可重复实验包,包含预处理脚本、配置文件、训练好的模型、模型检查点、可解释性输出结果、验证报告、可视化产物、软件规格说明以及实现独立复现和验证所提出框架所需的全部文档。
资源描述
源代码用于数据预处理、模型训练、可解释性分析和评估的 Python 实现脚本
环境文件包含软件包依赖关系及版本的 requirements.txt 文件
配置文件模型结构设置、超参数和实验配置
固定随机种子使用 Seed = 42 以确保实验可重复
数据集访问说明获取公开医疗数据集的链接和操作流程
预处理脚本用于数据清洗、归一化、编码和特征选择的脚本
图表生成脚本用于重新生成所有论文图表的脚本
表格生成脚本用于复现报告中所有表格和指标的脚本
示例输入样本数据集和输入文件
示例输出预测结果、解释性分析结果和评估报告

表5:可重复性资源与实验资源。

本表格总结了为支持实验可重复性而提供的资源,包括源代码、预处理脚本、配置文件、环境配置说明、数据集访问指南、固定的随机种子设置、图表生成脚本,以及重现报告结果所需的示例输入/输出文件。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们对整个流程中的可解释人工智能组件进行了全面评估,考察了其在不同类型医疗数据上的预测表现,包括结构化临床数据和医学图像。结果表明,在所评估的数据集中,模型的预测性能具有一致性。在测试的模型中,梯度提升模型的准确率最高,达到97.4%;随机森林模型次之,准确率为94.2%。应用于图像数据集的深度学习方法准确率为91.3%,而多层感知机模型的结果略低,为90.8%。这表明,基于集成的机器学习模型在结构化医疗数据上表现最佳,而深度学习架构在影像任务中更具优势。表6详细列出了预测功能的各项性能指标,包括准确率、精确率、召回率和F1分数,以及可解释性指标如保真度和稳定性。这些性能数值是通过五折交叉验证得出的,并以均值(含95%置信区间)形式呈现。置信区间不仅反映了模型的不确定性,还使预测性能的比较更加可靠,同时考虑了数据集的记忆效应以及模型架构之间的差异。

模型准确率 (%)精确率召回率F1 分数保真度稳定性95% 置信区间
随机森林94.20.930.920.920.850.8293.1–95.3
XGBoost97.40.960.950.950.920.8996.5–98.3
MLP90.80.890.880.880.800.7889.6–92.0
CNN(成像)91.30.900.910.900.880.8690.1–92.5

表6:预测模型与可解释性方法的比较性能。
本表对机器学习与深度学习模型进行了比较评估,采用的预测性能指标包括准确率、精确率、召回率、F1分数和ROC曲线下面积(ROC-AUC)。此外,还报告了可解释性指标,如保真度、稳定性、可理解性及人类信任评分,以全面评估模型的预测有效性与可解释性。

结果表明,梯度提升算法达到了最高的整体预测性能(准确率为97.4%),比随机森林高出3.2个百分点,比深度学习模型高出6个百分点以上。这一观察结果表明,基于集成的学习方法在本研究包含的结构化医疗数据集上尤为有效。卷积神经网络(CNN)与多层感知机(MLP)模型之间较小的性能差异表明,在所评估的实验条件下,仅增加模型复杂性并不一定转化为更优的预测性能。
为展示我们所提出框架在多种医疗数据分析任务中的实用性,我们在表7中列出了各数据集的预测性能结果。

特定数据集分析。
由于特征复杂性、样本量、类别分布和数据模态的差异,不同数据集上的性能表现存在差异。乳腺癌数据集取得了最高的预测准确率,这可能归因于特征可分性良好。在MIMIC-III和NIH胸部X光数据集上的性能略低,反映了纵向临床记录和医学影像数据具有更高的复杂性。这些结果表明,框架的性能受到数据集特征和临床背景的影响。

数据集准确率 (%)精确率 (%)召回率 (%)F1 分数 (%)
Breast Cancer97.497.297.697.1
Diabetes94.293.994.494
MIMIC-III91.39191.591.1
NIH Chest X-ray90.890.491.290.6

表7:特定数据集的预测性能结果。
所提出的可解释人工智能框架在四个代表性医疗数据集上的预测性能。准确率、精确率、召回率和F1分数以百分比(%)形式报告于独立测试集上。数值越高表示分类性能越好。

为评估预测性能,本研究在四个具有代表性的医疗数据集上评估了四种机器学习与深度学习模型,分别为梯度提升(Gradient Boosting)、随机森林(Random Forest)、卷积神经网络(CNN)和多层感知机(MLP)。模型性能通过准确率、精确率、召回率、F1分数以及ROC曲线下面积(ROC-AUC)等指标进行评估,数据划分采用70:15:15的训练-验证-测试分割方式,并结合五折交叉验证在独立测试集上完成。通过在相同的预处理和验证条件下比较各模型的评估指标,确定预测性能的提升情况。
为了阐明不同模型在各类方法中的性能差异,图4以图示方式展示了集成学习模型、神经网络模型和深度学习模型各自的优缺点。

机器学习模型的比较图表:准确率、F1分数、精确率、召回率性能。
图4:机器学习与深度学习模型在医疗预测任务中的性能比较。 (A) 梯度提升、随机森林、卷积神经网络(CNN)和多层感知机(MLP)模型在测试数据集上的准确率比较。 (B) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的F1分数比较。 (C) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的精确率比较。 (D) 梯度提升、随机森林、CNN和MLP模型在测试数据集上的召回率比较。数值越高,表示预测性能越好。梯度提升模型在所有评估指标中均取得最高性能,其次为随机森林。请点击此处查看该图的高清版本。

可解释性性能的解读。
在所评估的可解释性方法中,SHAP 始终取得了最高的保真度和稳定性评分,表明其生成的解释与底层模型预测之间具有更强的一致性。LIME 表现出相对较低的稳定性,提示其对局部扰动和采样变异性更为敏感。Grad-CAM 能为基于图像的模型提供视觉上可解读的解释,但其保真度略低于 SHAP。这些结果表明,解释质量既取决于所选择的解释方法,也与底层预测模型的架构相关。

管道中集成的可解释性技术已从定量和定性两个方面对其性能进行了评估。具体而言,特征归因方法在不同数据集上均能较为一致地揭示模型的内部逻辑。
本研究考虑的所有方法中,SHAP在所评估的可解释性方法中取得了最高的保真度(0.92)和稳定性(0.89)。简而言之,这些解释非常准确地反映了模型实际做出的预测。局部解释方法就像一扇窗口,使我们能够观察某一项具体预测,并理解模型做出该决策所依据的依据。

通过以人为中心的评估获得的保真度、稳定性、可理解性以及临床医生信任评分,对可解释性性能进行了评价。使用相同的数据集和训练好的模型,比较了SHAP、LIME和Grad-CAM三种解释方法。通过比较不同可解释性方法在解释质量指标和临床医生评分方面的表现,评估了可解释性的提升情况。适用于图像数据的深度学习模型可视化技术本质上生成的是热图,用以标识对模型预测最具相关性的图像区域。不同方法之间的特征重要性分布及可解释性性能比较如图5所示。

可解释性技术比较:条形图、LIME 分析、Grad-CAM X光可视化。
图5:可解释性性能评估。该图通过保真度和稳定性指标展示了可解释性方法的性能。SHAP在保真度(0.92)和稳定性(0.89)方面表现领先,反映出其解释结果与模型预测之间具有良好的一致性。LIME则在单个样本的可解释性方面表现最佳。另一方面,Grad-CAM输出的是主要用于成像模型的可视化热图,能够粗略显示对模型预测起关键作用的区域,从临床角度来看,这一点可能具有重要意义。请点击此处查看此图的放大版本。

在评估预测模型及可解释性技术后发现,模型的准确性与其解释的可靠性之间存在非常强的相关性。事实上,那些在预测性能上表现出提升的模型,在正确应用可解释性技术时,其结果的解释也展现出更高的稳定性与一致性。集成模型在配合特征归因方法时表现出最强的可解释性,而深度学习模型则更适合采用基于可视化 的可解释方法。预测准确性与解释可靠性之间的关联可参见图6,该图详细阐述了模型与可解释性之间的概念性动态关系。

预测性能与可解释性;集成模型在指标和稳定性方面的比较。
图6:模型与可解释性方法的比较分析。该图表详细比较了多种模型的准确性和可解释性度量,包含一个展示准确性与解释稳定性之间相关性的散点图、一个性能的表格化对比,以及一个适用性矩阵,概述了不同的可解释性方法(SHAP、LIME 和 Grad-CAM)及其在不同类型模型中的有效性。该可视化结果清晰表明,集成模型结合 SHAP 能够提供优异的可解释性,而深度学习模型则可通过可视化技术实现可解释性。请点击此处查看此图的放大版本。

以人为中心的评估证实了所提出系统在医院及其他临床机构中的实际应用价值。医疗专业人员对有解释和无解释的模型输出结果进行了评审。结果显示,提供解释显著提高了用户的信任度和可解释性;平均信任值从1到5分的评分标准下从3.1分上升至4.7分。信任评分从3.1提升至4.7,代表相对改善幅度约为51.6%。较高的评分者间一致性(Fleiss' κ = 0.81)进一步表明临床医生对解释有用性的评估具有一致性。这些发现表明,可解释性输出可能增强用户对系统的信心,并促进对人工智能辅助临床决策的理解。专业人员表示,他们对模型输出的理解更清晰,对人工智能支持的临床判断更具信任,这凸显了可解释性在医疗健康实际应用中的重要意义。

我们通过消融分析进一步验证了框架的稳健性。移除通过可解释性方法判定为关键的特征后,预测性能显著下降。因此,该结果表明这些特征不仅相关,而且对预测任务具有重要意义。此外,在解释不同输入样本时,可解释性方法的结果始终仅表现出微小差异,从而体现了可解释性方法的稳定性和可靠性。

为了检验该流程在实际应用中的可行性,我们测量了其计算速度。引入可解释性技术导致计算时间有所增加,尤其是在特征归因和生成可视化结果的阶段。然而,总体执行时间仍然在可接受范围内,并不算过长。图7展示了计算时间在流程各个阶段的分布情况,包括预处理、模型训练、可解释性生成、评估以及可视化。

机器学习流程、饼图、阶段:预处理、训练、可解释性、评估、报告。
图7:流程执行时间的分解。 该图表展示了可解释人工智能流程中各个阶段(如预处理、模型训练、可解释性生成、评估和可视化)所占用的计算时间分布情况。数据显示,大部分时间消耗在模型训练阶段,其次是可解释性处理阶段。相比之下,预处理和报告阶段所花费的时间非常少。请点击此处查看该图的放大版本。

我们还通过消融分析检验了所提出框架的强度。移除通过可解释性方法发现的关键特征后,预测性能明显下降,这清楚表明这些特征不仅相关,而且非常重要。此外,即使输入样本发生轻微变化,解释结果的输出也相当稳定,这证明了可解释性技术的一致性和可靠性。

简而言之,通过结合预测性能评估、可解释性分析以及以用户为中心的验证,结果表明所提出的框架是有效的。该系统不仅能够做出高度准确的预测,而且保持了高度的可解释性和易用性。引入可解释性方法使整个过程透明化,同时并未牺牲模型的性能。我们在预测准确性和可解释性方面观察到的改进不仅是在严格的实验控制下实现的,而且具有统计学显著性,这说明了所提出方法的稳健性与真实性。在不同预测模型之间进行的成对比较,采用了交叉验证折间的配对t检验。梯度提升模型与竞争模型之间存在统计学上的显著差异(p < 0.05),证实了所提出配置的优越性。

总体发现。
综合来看,研究结果表明,预测性能、解释质量以及临床医生的信任度可以在一个统一且可重复的工作流程中进行评估。该框架在多个医疗数据集上保持了稳定的性能,同时通过SHAP、LIME和Grad-CAM解释方法支持透明的模型解读。然而,这些发现应结合所选数据集和验证设置的具体背景加以理解,在实际应用之前仍需进行额外的外部验证。

数据可用性:
本研究所使用的数据集来自公开资源,可在知名的数据存储库中获取。例如,与乳腺癌和糖尿病相关的数据可从加州大学欧文分校机器学习存储库下载,网址为:https://archive.ics.uci.edu/ml/index.php

可通过 PhysioNet 获取电子健康记录数据集(MIMIC-III):
https://physionet.org/content/mimiciii/1.4/

胸部X光成像数据来自NIH胸部X光数据集,可在以下网址获取:https://www.kaggle.com/datasets/nih-chest-xrays/data

本研究中所使用的全部数据集均已匿名化并公开提供。研究过程中产生的预处理步骤、训练好的模型及可解释性输出结果,可在提出合理请求的情况下通过通讯作者获取。源代码、预处理脚本、配置文件及可重复性相关资源将在稿件被接收后存入公共仓库。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究开发并评估了一种可重复的、可解释的人工智能(XAI)工作流程,用于医疗数据分析。该流程在一个统一的协议中集成了预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源。结果表明,在所评估的结构化医疗数据集上,基于集成的机器学习模型(特别是梯度提升和随机森林)表现出最高的预测性能,而深度学习模型则更适用于基于图像的分析。这些发现强调了应根据数据特征选择模型架构的重要性,而非假设更复杂的模型总会带来更优的性能。本研究的一个关键贡献在于,将预测建模、可解释性评估、以人为中心的评估以及可重复性实践整合到一个标准化的工作流程中。与孤立评估可解释性技术的研究不同,所提出的框架提供了一种以协议为驱动的方法论,支持在多种医疗数据集上进行透明且可重复的实验。

可解释性分析在所评估的方法之间显示出可测量的差异。在所评估的实验条件下,SHAP 实现了最高的保真度和稳定性得分,表明其生成的解释与模型预测之间具有更紧密的一致性。LIME 提供了有用的局部解释,但表现出较低的稳定性,而 Grad-CAM 为影像数据生成了直观的可视化解释。这些发现表明,解释质量取决于所选择的可解释性方法以及底层的预测模型。以人类为中心的评估进一步表明,提供解释能够提升临床医生的信任度和可理解性。信任度评分的显著提升以及较高的评分者间一致性(Fleiss’ κ = 0.81)表明,参与者对解释有用性的评估具有一致性。这些发现支持了可解释性方法在提升医疗决策支持系统透明度和用户接受度方面的潜在价值。

在解释结果时应考虑若干局限性。首先,该框架仅使用了数量有限的公开数据集进行评估,可能无法充分代表真实临床环境中遇到的变异性。其次,临床医生的评估涉及的参与者队列相对较小,这可能限制其结果的普适性。第三,本研究中探讨的可解释性方法属于事后解释技术,因此仍受制于已知的局限性,包括对扰动的敏感性以及解释结果与模型真实推理过程之间可能存在差异。最后,跨独立医疗机构的外部验证超出了本研究的范围。

未来的研究应探讨整合临床记录、医学影像、生理信号和可穿戴传感器数据的多模态医疗健康分析。还需进一步研究因果及反事实解释方法、不确定性量化、公平性评估、校准分析以及前瞻性临床验证。此类研究可能进一步提升可解释人工智能系统在医疗健康领域的透明度、可靠性和适用性。

除了性能评估之外,还应考虑若干实际实施挑战和协议修改,以确保在不同医疗环境中稳健部署所提出的可解释人工智能框架。

可解释性方法的局限性

SHAP、LIME 和 Grad-CAM 虽然能够提供有关模型行为的有益见解,但也存在若干缺点。文献中已指出,这些工具在重复运行时可能不稳定,对扰动非常敏感,不同数据集之间的结果可能存在差异,有时无法准确反映模型做出决策的真实原因。因此,事后解释应仅被视为补充性证据,而非因果决策机制的真实写照。在将其应用于具有重大影响的临床场景之前,对解释的可信度进行充分验证仍然是至关重要的步骤。

这与近期生物医学人工智能研究的发现一致,这些研究强调在临床环境中实施前,必须对可靠性验证进行解释。在心脏骤停预测系统中,可解释性的引入已成为验证的关键方面,以提高系统的透明度并获得临床预测的信任41。同样,利用可视化驱动的可解释性技术进行肝脏超声图像分割,旨在提升模型的可解读性,同时并未忽视事后解释存在局限性的事实。这些研究证实,解释一致性检查、解释鲁棒性测试以及具有临床意义的可解释性输出验证,对于达到最高级别的临床应用就绪状态是必不可少的42

校准、公平性、鲁棒性与外部泛化

该框架的未来版本将包括通过校准曲线和Brier评分对概率校准进行评估,采用贝叶斯方法和基于集成的方法估计不确定性,对人口学亚组进行公平性审计,以及在存在噪声数据和变化的领域条件下进行鲁棒性检验。这些分析在医疗环境中尤为重要,因为模型的置信度、公平的性能表现以及在不断变化的临床环境下的可靠性会直接影响患者安全和临床应用。近期基于人工智能的科学框架同样强调了可信、透明且可靠的决策支持系统的重要性,这超出了传统预测性能评估的范畴43

故障排除与实验方案修改

在成功实施所提出的可解释人工智能框架时,需要考虑若干实际问题。一个典型的问题是过拟合,例如在相对较小的医疗数据集上训练深度学习模型时。可通过应用交叉验证、早停法、Dropout 正则化、数据增强以及充分的超参数优化来减少过拟合。在训练过程中监控验证集性能,是避免模型过于复杂而泛化能力差的有效方法。

医疗数据集中的另一个非常重要的问题是类别不平衡,即阳性临床结果远少于阴性病例。为解决这一问题,建模流程中应包含分层抽样、类别权重调整、合成少数类过采样技术,以及使用F1分数和ROC-AUC等平衡的评估指标。忽略类别不平衡可能导致生成的性能指标无法真实反映模型效果,并导致临床预测出现偏差。

医学影像数据集通常并非完美,可能受到噪声、采集伪影、质量不一致等因素的影响。这些因素还随成像设备类型的不同而变化。此类问题可能对模型的预测性能产生负面影响,并影响可解释性输出的结果。因此,应采用标准化的预处理步骤、图像归一化、质量控制检查以及数据增强技术,以确保模型的鲁棒性和可靠性。

SHAP 能够推导出具有高度信息量的特征归因解释。然而,不能忽视其存在不稳定的可能,尤其是在特征高度相关或模型输出对输入数据的微小变化非常敏感的情况下。为了提高解释的一致性和可靠性,建议多次生成解释、通过多次运行评估稳定性、采用特征分组策略,并与其他可解释性方法(如 LIME)进行对比验证。

在处理大规模医疗数据和庞大的深度神经网络架构时,GPU 内存限制可能成为主要制约因素之一。通过调整批量大小、采用混合精度训练、模型剪枝、降低特征维度以及使用高效的数据加载方法,可显著降低内存需求。此外,在低资源系统上部署该框架的研究人员还可考虑使用云计算环境或分布式训练。

所提出的框架采用模块化设计,可根据不同的医疗应用轻松进行调整。根据具体的临床任务,科研人员可更改一个或多个独立的预测模型,添加新的解释方法,联合使用不同类型的医疗数据,或引入不确定性量化与校准模块,而无需改变整体工作流程。这种灵活性使得该框架能够适用于差异较大的医疗分析场景,同时仍保持可重复性和可解释性。

监管与伦理考量:

可解释性更强的人工智能系统可为医疗保健带来巨大帮助。但这并不足够。必须满足监管机构对透明度、问责制、隐私保护和患者安全的要求。即使可解释性可能提升信任度和可理解性,单靠它也无法确保临床有效性。负责任的实施需要前瞻性临床验证、公平性评估、监管审查以及部署后的持续监测。此外,在未来部署该框架时,还应考虑患者隐私保护、临床医生的监督,以及在不同人口群体中表现的公平性。为了融入真实世界的临床工作流程,人工智能系统与医疗专业人员之间必须实现无缝协作。因此,可解释性信息应整合到现有的电子健康记录系统和临床决策支持平台中,而不应作为仅能独立运行的孤立工具。最终的决策必须由医生做出,而可解释人工智能仅是一种辅助技术,旨在增强透明度、支持循证推理,并促进医护人员与患者之间的沟通。

本文提出了一种可重复的协议,用于开发、评估和解释医疗健康数据分析中的可解释人工智能系统。该贡献以方法学和工作流程为导向,为研究人员和临床医生提供了一个标准化的框架,可在多种医疗健康应用中复制、调整和扩展。该框架以统一的方式整合了数据预处理、预测建模、可解释性方法和性能评估等多个方面。在多个医疗健康数据集上的实验表明,该方法具有较强的预测性能。在结构化数据分析中,模型集成方法表现最佳,而深度学习模型在医学影像任务中表现出很高的有效性。此外,通过使用解释技术,用户能够更轻松地理解模型,因为它提供了对预测结果的全局和局部解释。因此,这不仅提高了临床医生对模型的信任度,也增强了模型的可用性。研究结果表明,可解释的人工智能有助于构建透明且可解释的医疗健康分析系统,在模型准确性与可解释性之间取得平衡,这对于可靠且值得信赖的医疗健康分析至关重要。因此,本文提出的方法是一种高效且直接的医学数据分析工具,可帮助医疗专业人员使用他们信任的人工智能技术。本文提供了一种可重复的协议,用于开发、评估和解释医疗健康数据分析中的可解释人工智能模型。通过在一个统一的工作流程中整合数据预处理、预测建模、可解释性评估、以临床医生为中心的评估以及可重复性资源,该协议为透明的医疗人工智能研究提供了实用的框架。该工作流程可适用于多种医疗健康数据集和应用领域,支持可重复地实现、评估和报告可解释的机器学习系统。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们对本研究不存在任何竞争性财务利益或相关利益冲突。本研究独立开展,未涉及任何可能被视为潜在利益冲突的商业或财务关系。

人工智能使用披露

在手稿撰写过程中,使用了人工智能工具进行语言润色、语法检查和编辑辅助。所有科学内容、实验设计、数据分析、结果解释以及最终手稿的核实均由作者完成。作者对所有人工智能辅助生成的内容进行了审阅和验证,以确保其准确性、完整性和符合期刊投稿指南。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢各自机构为开展本研究提供了必要的基础设施和科研支持。作者还感谢使用了公开可用的数据集和开源工具,这些资源促进了所提出的可解释人工智能框架的开发与评估。特别感谢领域专家在以人为中心的评估阶段提供的宝贵见解。

材料

本文使用的材料清单
姓名公司目录编号评论
GPU 工作站Manufacturer dependentNA训练深度学习模型
Jupyter NotebookProject JupyterLatest stable release交互式实验执行
LIMELIMEVersion 0.2.0局部可解释性分析
MatplotlibMatplotlib ProjectVersion 3.9数据可视化
MIMIC-III 数据库PhysioNetVersion 1.4电子健康记录分析
NIH 胸部 X 光数据集NIH 临床中心Public Dataset胸部疾病分类
NumPyNumPy 开发者团队Version 1.26数值计算与数组操作
OpenCVOpenCV 基金会Version 4.10图像预处理
PandasPandas 开发团队Version 2.1数据处理与预处理
Pima 印第安人糖尿病数据集UCI 机器学习知识库Public Dataset糖尿病风险预测
Python 3.11Python 软件基金会Version 3.11主要编程环境
Scikit-learnscikit-learnVersion 1.5机器学习算法与评估
SeabornSeabornVersion 0.13统计可视化
SHAPSHAPVersion 0.46特征归因与可解释性分析
TensorFlowTensorFlowVersion 2.15深度学习模型开发
Windows / Ubuntu LinuxMicrosoft / CanonicalNA操作系统
威斯康星乳腺癌数据集UCI 机器学习知识库Public Dataset乳腺癌诊断

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

233 233 XAI

相关文章