研究文章

一种可解释的隐私保护多模态集成框架用于皮肤病变分类

DOI:

10.3791/71472

2026年6月12日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究旨在通过整合深度学习特征、临床元数据和可解释人工智能技术,开发并评估一种可解释且保护隐私的多模态集成框架,以实现准确的皮肤病变分类,提高诊断准确性、透明度以及早期皮肤癌检测的可靠临床决策支持。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

在皮肤科疾病中,皮肤癌是最具生命威胁的疾病之一。早期且准确的诊断对于改善患者的预后至关重要。然而,传统的基于人工智能的诊断方法面临诸多挑战,包括隐私问题、可解释性有限,以及多类别皮肤病变数据集中严重的类别不平衡问题。为克服这些挑战,本文提出了一种注重隐私保护、具备可解释性的多模态皮肤病变分类模型,该模型结合了复杂的深度学习模型、集成建模方法以及可解释的人工智能技术。实验评估采用公开的 HAM10000 多类别皮肤病变分类基准数据集,该数据集可通过 Kaggle Hub 获取,包含七种具有重要临床意义的病变类别(akiec、bcc、bkl、df、mel、nv、vasc)。为实现数据平衡,采用了类别平衡技术以增强少数类别的样本代表性。采用 EfficientNet B4、DenseNet201 和 MobileNetv2 提取深层特征表示,并进一步结合显著的临床元数据,构建稳健的多模态特征空间。这些多模态特征用于训练 XGBoost、LightGBM 和深度神经分类器(DNC),其分类准确率分别为 92%、90% 和 94%。通过应用堆叠集成策略融合 XGBoost、LightGBM 和深度神经分类器(DNC)的输出,使分类准确率提升至 96%。模型可解释性技术提供了特征层级的解释,增强了模型的透明度。实验结果验证了所提出框架在效率方面的实用性,能够实现符合临床需求的皮肤病变真实场景分类。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

皮肤癌是全球重要的公共卫生负担,全球范围内的发病率呈上升趋势1。人工辐射被认为是导致皮肤癌的主要因素之一,可引发基因突变,导致皮肤细胞不受控制地增殖并形成肿瘤1,2皮肤癌是一类疾病的统称,包括黑色素瘤、鳞状细胞癌和基底细胞癌(BCC)。这些疾病的病因、临床表现及预后因素各不相同3。由于皮肤病变在像素级别上具有高度相似性,皮肤疾病已成为医学诊断中的障碍4。2022年,全球估计有331,722例黑色素瘤病例(58,667例死亡)和120万例非黑色素瘤皮肤癌(NMSC)病例(69,416例死亡)。黑色素瘤的年龄标化发病率(ASR)峰值出现在大洋洲(29.78/10万)、北美(16.3)和欧洲(10.43)。然而,非洲(0.35)和亚洲(0.30)的死亡率与发病率之比高于北美和大洋洲(均为0.02),这可能反映出更差的预后1。在皮肤科领域,皮肤病变的诊断与监测主要依赖于肉眼观察和其他非侵入性评估方法。由于侵入性方法可能损伤病灶,妨碍对病变生长的临床随访,因此通常不予采用5。根据HAM10000数据集的定义,皮肤病变可分为多种类型:黑色素瘤(MEL)、皮肤纤维瘤(DF)、日光性角化病和上皮内癌(AKIEC)、基底细胞癌(BCC)、良性角化病(BKL)、黑色素细胞痣(NV)以及血管性病变(VASC)5。皮肤镜图像分类面临的主要挑战包括毛发、墨迹、标尺标记、彩色斑块、反光、液滴、油泡、血管、色素沉着区域和/或炎性病灶的存在6。此前已有研究探讨特征选择与深度学习在医学影像及皮肤病变分类中的应用7,8

基于计算机视觉的皮肤癌诊断方法以及手工特征与深度特征的融合也已得到研究9,同时研究了特征融合策略以提升分类性能10。近期进展进一步强调了机器学习在医疗系统中的集成以及安全的医学数据处理框架11,12 由先进计算算法驱动的人工智能医疗应用有望提供个性化且高效的综合护理方案,尤其有利于远程和家庭护理环境中的患者13。通过利用大规模的皮肤镜图像数据集,深度学习模型——特别是卷积神经网络(CNNs)——可被训练用于准确识别和分类各种皮肤病变。在皮肤病变分割方面,多种技术表现出良好效果,包括全卷积网络(FCNs)、CNNs、深度卷积神经网络(DCNNs)、全卷积残差网络(FCRNs)以及U-Net架构。由于深度神经网络(DNNs)具有高度复杂的结构,因此难以解释,其决策过程不易理解14,15。医学图像分析的最新进展表明,深度卷积神经网络(CNNs)在皮肤病变分类任务中显著提高了效率。针对HAM10000等皮肤镜数据集的多项研究表明,基于CNN的架构(如ResNet、DenseNet和EfficientNet)通过从病变图像中学习分层特征表示,实现了优异的多类别分类性能。混合特征融合方法通过结合多个CNN主干网络,整合互补的深度表示,进一步提高了诊断准确性16。此外,当前研究还探索了混合CNN-Transformer模型在医学图像分析中的应用。配备视觉Transformer和CNN特征提取器的模型已被证明在皮肤病变分类任务中表现更优,因其能够更好地提取局部纹理信息以及全局上下文关系17。这类混合设计也因具备均衡的表征学习能力,被视为医学影像领域的先进方法。

在医学的其他领域,特征融合策略已在皮肤科以外得到了广泛应用。基于卷积神经网络(CNN)的混合系统也被用于组织病理学图像分析,通过增强的特征表示和空间学习动态,实现了对肺癌和结肠癌更准确的分类16。同样,在眼科领域,利用基于融合特征表示训练的深度学习模型,已在眼底图像的糖尿病视网膜病变分期中成功应用,在多类别分级任务中表现出更强的鲁棒性和更高的分类准确性18 。这些领域的多模态融合方法均表明,异构特征表示能够带来更好的泛化能力和分类性能,尤其是在不平衡的医学数据中19

尽管已取得这些改进,当前的方法通常仍局限于多模态而非真正集成,难以有效解决类别不平衡问题,且对临床决策帮助有限。为克服这些问题,本文提出一种可解释的皮肤病变分类模型,该模型注重隐私保护,并整合了多种模型可解释性方法。此类可解释性方法可用于解释模型的预测结果,揭示哪些特征最为重要,并突出皮肤镜图像中的关键区域,从而增强临床操作的清晰度与信心,提升临床透明度,建立信任,并支持人工智能系统在临床实践中的安全应用。HAM10000 数据集存在显著的类别不平衡问题,少数类别样本数量远少于其他类别。为解决此问题,采用合成少数类过采样技术(即类别平衡技术),为样本不足的类别生成合成样本。类别平衡技术可使数据集分布趋于均衡,使模型能够更好地学习少数病变类型,提高敏感性,从而更可靠地预测临床上重要但发生频率较低的皮肤癌类别。  将 EfficientNet-B4、DenseNet201 和 MobileNetV2 的深度特征与临床元数据相结合,以形成对每种皮肤病变更具信息量的表征。这种双模态特征有助于我们提取皮肤镜图像的视觉模式以及患者的其他相关信息,实现更深入的分析。随后,这些特征被输入至多种分类器(包括 XGBoost、LightGBM 和深度神经网络)进行训练,以增强皮肤病变分类模型的能力与性能。采用堆叠集成(stacking ensemble)技术对多个模型进行集成,构建一个综合模型,充分利用各个基模型的优势,整合所有模型的预测结果,同时弥补单个模型的局限性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究使用了公开可获取的完全匿名化皮肤镜数据集,未涉及直接的人体参与,因此无需伦理委员会批准。材料表包含本研究中使用的所有材料或工具的详细信息。表1列出了硬件和软件环境的详细信息,包括处理器类型、内存、操作系统和软件框架。表2列出了每类皮肤病变的类别特异性精确率、召回率、F1分数和支持数量。

所提出的多模态皮肤病变分类框架的整体工作流程

本研究的总体目标是建立一个精确且易于理解的皮肤病变多分类方案。该工作流程首先收集并预处理 HAM10000 数据集,随后利用深度学习架构进行特征提取,并整合临床元数据。接着,训练并优化多种机器学习分类器,并通过集成策略融合其结果。最后,采用可解释性技术对模型的预测结果进行解读,并评估该模型在真实临床决策支持中的有效性。

为了提高所提出系统的预测准确性,采用了一种多模态机器学习流程,该流程结合了基于图像的特征和临床元数据(如图1所示)。该模型能够将皮肤镜图像的视觉输出与患者相关信息相结合,以识别与各种皮肤病变相关的更细致的模式。通过这种组合,系统可以做出更准确的预测,从而提升皮肤病变分类的质量和实用性。通过神经网络(EfficientNet-B4、DenseNet201 和 MobileNetV2)提取三种预训练的卷积深度特征:这些网络能够捕捉皮肤镜图像中多种互补的模式。这些架构可学习皮肤病变外观的高层模式,例如颜色和纹理的变化以及结构特征。随后,特征融合模块将深度特征与临床特征及人口统计学数据相结合,生成丰富的多模态特征。合并后的数据被划分为训练集、验证集和测试集,以确保模型评估的合理性。接着,再次使用特征融合模块将深度特征与临床特征及人口统计信息融合,生成一个丰富的多模态特征表示。该数据随后被划分为训练集、测试集和验证集,用于模型评估。采用集成策略进一步提升预测准确性,该方法通过对多个模型的结果进行平均,并基于这些平均概率得出最终预测,从而增强模型的泛化能力并降低单个模型可能带来的方差。此外,还集成了可解释性方法,例如模型可解释性技术,以进一步阐明模型的决策过程。模型可解释性方法通过量化输入变量的贡献程度提供特征层面的解释,而另一类模型可解释性技术则在像素级别上识别皮肤镜图像中影响预测结果的关键区域。这些技术共同作用,使模型更具可解释性,帮助临床医生理解系统做出决策的依据。因此,所提出的流程构建了一个可理解且注重隐私的系统,提高了透明度与信任度,从而在真实世界的医疗环境中实现更可靠的皮肤癌诊断。

数据集描述及制备

本文使用 HAM10000(人类对抗机器,含 10,000 张训练图像)数据集作为多类皮肤病变分类的主要数据集。该数据集包含来自多种医疗来源的超过 10,000 张皮肤镜图像,涵盖不同的临床来源和人群,是皮肤科图像分析领域应用最广泛的基准数据集之一。数据集中的每张图像均附有重要的临床元数据,包括图像标识符、诊断标签、患者年龄、性别以及病变的解剖位置。该数据集涵盖七个诊断类别:日光性角化病(akiec)、基底细胞癌(bcc)、良性角化病(bkl)、皮肤纤维瘤(df)、黑色素细胞痣(nv)、血管病变(vasc)和黑色素瘤(mel)。

临床元数据预处理

分类流程中添加的辅助特征包括临床元数据,例如年龄、性别以及病变在患者体内的位置。对于存在缺失或未知值的情况,采用了一种确定性的预处理方法进行处理。针对年龄变量(数值型),使用训练集上计算得到的中位年龄来填补缺失值。选择中位数填补的原因在于其对异常值和偏态数据具有较强的鲁棒性,而这类情况在临床数据中较为常见。对于性别和病变位置(类别型变量),未将缺失或未指明的值予以剔除,而是将其归入一个标记为“unknown”的特殊类别。该方法保留了所有可用样本,并允许模型自行判断缺失本身是否具有预测意义。随后,对类别型变量应用独热编码(one-hot encoding),以使其能够与机器学习模型兼容。所有预处理操作(如填补、编码等)均仅在训练集上进行,并将相同的变换应用于验证集和实验集,以避免数据泄露。没有任何样本仅因临床元数据缺失而被排除,从而确保了数据的最大化利用以及方法学上的一致性。

使用人工智能进行皮肤病变分类的流程图;数据集准备、特征提取、融合。
图1:用于皮肤病变分类的多模态系统。本研究方法结合皮肤镜图像特征与患者元数据,利用集成深度学习模型对皮肤病变进行分类。该框架包括预处理、特征提取、多模态融合和分类,可提高诊断性能与可解释性。请点击此处查看此图的放大版本。

该工作流程展示了基于HAM10000皮肤病变数据集的皮肤镜图像和临床元数据所建议的分类流程。采用EfficientNet-B4、DenseNet201和MobileNetV2对图像进行预处理并提取深层特征。临床元数据经过编码后,通过特征融合技术将图像特征与临床元数据相结合。为解决类别不平衡问题,类别平衡技术应用于融合后的多模态特征空间,而非原始图像或独立的特征流中,从而生成的合成样本能够保持视觉特征与临床特征的组合,避免产生不真实的样本。随后,将融合后的特征输入至XGBoost、LightGBM以及深度神经分类器等分类模型中进行训练。

皮肤科分析;皮肤病变图像 A-G;临床检查;黑色素瘤检测研究。
图 2 HAM10000 数据集中的七个不同诊断类别的皮肤镜图像示例。 图像展示了用于自动分类的典型视觉特征。(A)日光性角化病(akiec),表现为表面粗糙且色素分布不规则。(B)基底细胞癌(bcc),形态不规则并可见异常血管。(C)类良性角化病变(bkl),具有角化特征,表面呈浅棕色。(D)皮肤纤维瘤(df),中央呈瘢痕样外观并伴有色素沉着。(E)黑素细胞痣(nv),良性,形态相对对称。(F)血管性病变(vasc),因血管分布呈现红紫色外观。(G)黑色素瘤(mel),表现为形态不规则、不对称且多色素的病灶。请点击此处查看该图的高清版本。

这些皮肤镜图像揭示了皮肤病变在色素沉着、纹理和结构形态上的视觉异质性。这些差异对自动化分类系统构成了巨大挑战,也凸显了基于深度学习的系统的重要性。特征提取技术需能够敏感地揭示细微的诊断模式。在数据集描述之后,图2展示了 HAM10000 数据集中包含的七类皮肤病变,这些类别在皮肤科诊断成像研究中常被广泛研究。这些类别包括日光性角化病(akiec)、基底细胞癌(bcc)、良性角化病(bkl)、皮肤纤维瘤(df)、黑色素细胞痣(nv)、血管性病变(vasc)以及黑色素瘤(mel)21。所有这些类型的病变都具有独特的视觉特征,如图3所示,包括色素模式的变化、表面纹理、颜色分布以及病灶边缘的异常。所有这些病变的视觉特征各不相同,其特点表现为色素沉着模式、表面纹理、颜色分布以及病灶边界的异常等方面的差异。这些是皮肤科医生在临床检查时会重点关注的特征,因此机器学习模型必须能够准确建模这些特征,才能实现正确的分类。尽管存在这些区分性特征,许多病变在外观上几乎完全相同,仅通过皮肤镜图像进行区分十分困难。某些类型病变之间的区别通常极为细微但具有重要的临床意义,这使得自动分类极具挑战性。因此,迫切需要构建强大的人工智能模型,能够训练以学习病灶类别之间精细的视觉图像和细微差异。通过恰当的特征描述,不仅可以增强模型对不同类型病变的判别能力,还有助于更早地诊断一些危险疾病,例如黑色素瘤。最终,这将提高诊断准确性,辅助临床医生做出决策,从而改善患者的治疗结局,并支持更优的临床决策。

皮肤癌类别分布柱状图,可视化每种类型的图像数量:NV、MEL、BCC等。
图3:HAM10000 数据集中皮肤病变的类别分布。 该图展示了本研究中涉及的七类病变的分布情况:日光性角化病(akiec)、基底细胞癌(bcc)、良性角化病样病变(bkl)、皮肤纤维瘤(df)、黑色素细胞痣(nv)、血管性病变(vasc)以及黑色素瘤(mel)。此图说明了各类病变之间存在的类别不平衡现象。请点击此处查看该图的放大版本。

数据分析结果显示,不同类型皮肤病变的类别之间存在不平衡现象。其中,痣细胞痣(Melanocytic Nevi, nv)是最常见的类型,样本数约为6,705例,其次为黑色素瘤(1,113例)和良性角化病(1,099例)。相反,某些具有重要临床意义的病变类型则显著样本不足,例如皮肤纤维瘤(115例)和血管性病变(142例)。这种数据分布不均对机器学习模型构成了挑战,因为模型可能倾向于偏向多数类别,而难以有效识别虽罕见但具有临床意义的病变类型。为解决这一问题并提升模型在所有类别上的训练效果,需要采用高级预处理策略,包括有针对性的数据增强和类别平衡方法。可通过类别平衡技术及类别权重调整,促使模型更好地学习少数类别的显著特征。XGBoost和LightGBM所使用的超参数主要采用默认配置,并根据初步实验进行微调。对于深度神经分类器,网络结构与训练参数(如层数、神经元数量、学习率、批量大小和训练轮数)则通过验证数据集进行经验性选择。完整的超参数设置详见表3。总体而言,本研究共使用了10,015张皮肤镜图像,这一数量为模型的训练与测试提供了丰富的数据资源,虽处理过程繁琐,但具有重要的评估价值。本文旨在评估所提出的皮肤病变分类系统的有效性。

数据预处理

预处理流程通过标准化图像、提取深度特征、整合临床元数据以及解决类别不平衡问题,为 HAM10000 数据集的多模态学习做好准备。

图像标准化:所有皮肤镜图像均被调整为 224 × 224 像素,并使用 z-score 标准化进行归一化处理。

静态平衡;公式 I_norm=I_μ/σ;方程;统计分析;教育用途。 (1)

其中,I 代表原始图像,µ 表示像素级均值,σ 为标准差。

深度特征提取:采用三种预训练的卷积神经网络——Efficient-Net B4、DenseNet201 和 MobileNetV2,提取互补的深度特征。每个网络将归一化后的图像映射为一个特征向量。

图像分类方程、神经网络函数、符号、研究公式分析。(2)

将提取的特征进行拼接,以形成统一的表示形式:

FFusion=FEffB4 ||FDense ||FMobV2 (3)

(其中 || 表示连接)

临床元数据整合:对年龄、性别以及病灶定位等临床属性进行清洗、标签编码,并采用最小-最大缩放法进行归一化处理:

缩放公式,\(x_{\text{scaled}} = \frac{x - x_{\text{min}}}{x_{\text{max}} - x_{\text{min}}}\),方程。 (4)

处理后的元数据向量 Mclinical 与图像特征融合,以构建最终的多模态输入:

Fcombined=FfusionMclinical (5)

数据集划分:采用分层划分方法以保持类别分布

Dtrain,Dtest=Split(Fcomibed,0.8) (6)

类别不平衡处理:HAM10000 数据集存在严重的类别不平衡问题,其中“痣”(NV)样本占主导地位,而其他少数类别(如 DF 和 VASC)则样本不足。为缓解这一问题,采用了“合成少数类过采样技术”(SMOTE,一种类别平衡技术)。具体方法如下:通过该技术生成新的合成样本:

xnew=x+ λ(xzi - xi) (7)

概率论方程中的 λ~U(0,1) 符号;均匀分布概念。

其中,xi 为少数类样本,xzi 是其最近邻之一,λ 是从 0 到 1 之间的均匀分布中随机抽取的值。如图 4所示,合成样本沿连接 xi 与 xzi 的线段生成。

分类分布图显示应用SMOTE前后的数据不平衡情况;柱状图展示样本数量。
图4:HAM10000数据集在应用类别平衡技术前后的类别分布情况。A)类别平衡前,各病变类别的样本分布不均。(B)在组合特征空间中进行类别平衡后,所有类别的样本数量相等,以避免分类器训练过程中的偏差。请点击此处查看该图的放大版本。

为解决 HAM10000 数据集中存在的类别不平衡问题,采用合成少数类过采样技术(类别平衡技术)。该类别平衡技术通过在现有数据点之间进行插值,为少数类生成合成样本,从而有助于增加代表性不足的病变类别的样本数量。通过对这些少数类生成更多样本,最终使所有七种病变类型的总体数据集更加均衡。这种均衡的样本分布将使分类模型能够更好地学习每一类别的特征,并减少对多数类别的偏差。因此,模型在分类时更加公平且敏感,尤其能够更好地识别那些罕见但具有重要临床意义的皮肤病变。

隐私保护学习框架

该建议的系统提出了一种多模态的皮肤病变自动化分类方法,具有隐私保护和可解释性。该系统的最终目标是提升诊断性能,同时在整个训练过程中保护敏感的患者信息。在医疗实践中,患者隐私是一项基本需求,因为医疗数据隐私法规和伦理考量在医疗环境中至关重要。因此,所提出的模型将采用基于联邦学习理念的去中心化学习模型。在这种去中心化环境中,模型训练在一组分布式客户端上完成,而非将所有患者数据集中到单一中心位置。所有参与的客户端均在本地数据上进行本地模型训练,原始患者数据不会离开本地环境。作为替代方案,仅将模型更新或参数发送至中央服务器进行聚合。这种协作式学习方法使得各个医疗机构或数据来源能够在不损害数据隐私的前提下共同参与模型训练。

wt(k) 为第 k 个客户端在第 t 次迭代时的模型参数,nk 为该客户端的样本量。全局模型的更新计算如下:

静态平衡方程,公式 ΣK=1^K (nk/N) Wt^(k);数学示意图。 (8)

这种聚合策略确保拥有较大数据集的客户端对全局模型的贡献相应更大,同时仍允许较小的客户端参与学习过程。通过实现无需交换原始患者数据的协作训练,所提出的框架在保持隐私的同时,仍能受益于跨数据集的分布式知识。

联邦实验设置

设计了一个基于 HAM10000 数据集的模拟联邦学习系统,以验证所提出的隐私保护框架的有效性。数据被划分为三个客户端,以模拟真实世界中数据非独立同分布(non-IID)的多机构环境。每个客户端包含不同比例的病变类别,反映了临床中心之间的实际差异。在每个客户端本地独立运行相同的多模态特征提取流程(EfficientNet-B4、DenseNet201、MobileNet V2 和临床元数据)。在训练过程中,各客户端独立更新其本地模型,仅将学习到的参数上传至中央服务器,由 FedAvg 算法进行聚合。通过比较联邦学习模型与集中式训练方法在预测准确率与隐私保护之间的权衡,评估各自性能。如图5所示的测试结果表明,联邦学习模型表现具有竞争力,相较于集中式学习仅准确率略有下降,但数据隐私性显著提升。

HAM10000 数据集分布图;病变类别;非独立同分布;样本数量;机器学习分析。
图5:HAM10000 数据集按客户端的分布情况。 该图展示了皮肤病变数据在各客户端之间的分配情况,体现了数据分布的多样性。这反映了客户端之间数据的异质性,是联邦学习中的一个关键特征。请点击此处查看该图的放大版本。

在 HAM10000 中形成的客户端异质性(非独立同分布)数据分布被分为三组,以模拟真实临床条件。每个客户端内不同类别病变的分布各不相同,尤其是痣(nv)类别,在各客户端之间的分布极不均匀。这种设置反映了联邦学习在现实世界中的挑战,即各医疗机构的数据分布并不均匀。

性能比较:集中式学习与联邦学习

为了评估所提出的联邦学习框架的有效性,使用 HAM10000 数据集对集中式与联邦式训练策略进行了比较分析,如图6所示。在集中式设置中,所有数据样本被聚合到一个统一的训练池中。表现最优的集中式模型——堆叠集成模型——整体准确率达到96%。相比之下,在联邦式设置中,数据集被分布在三个客户端上,且数据呈非独立同分布(non-IID)状态,各客户端在本地训练模型,并仅通过 FedAvg 方法共享模型参数。联邦模型的整体准确率约为94%,与集中式方法相比性能差异为2%,如表4所示。由于去中心化优化以及客户端之间数据分布的异质性,这一微小的性能下降是可预期的。

尽管发生了这一微小变化,联邦模型在预测方面仍然表现良好。在集中式训练中,按类别分析的行为显示,大多数类别(如痣(nv)(F1分数 = 1.00))保持稳定,而少数类别(如皮肤纤维瘤(df)(F1分数 ≈ 0.65–0.66))对分布不平衡更为敏感,这可能会进一步影响联邦学习的性能。值得注意的是,联邦结构最大限度地减少了暴露敏感患者信息的可能性,因为它不需要在客户端之间共享原始医疗数据。

性能比较图表:集中式学习与联邦学习;准确率百分比结果。
图6:联邦学习与集中式学习的比较。 本图通过准确率、精确率、召回率和F1分数等性能指标对两种学习范式进行比较。结果表明,联邦学习在保护隐私的同时,能够实现与传统学习方法相当的性能。请点击此处查看该图的放大版本。

表4 的结果表明,联邦学习模型具有较强的竞争力,与集中式模型相比,准确率仅略微下降约2%。这种轻微的性能下降可归因于去中心化的优化过程以及非独立同分布(non-IID)的数据分布。然而,联邦学习模型在隐私保护方面具有显著优势,因为敏感的患者信息不会在各个客户端之间共享。为了对联邦模型与集中式堆叠集成模型进行公平比较,联邦模型采用了相同的架构和超参数进行测试。本研究中讨论的隐私保护特性属于概念性探讨,旨在强调未来工作中将联邦学习等技术进行潜在整合的可能性。当前实现中并未对隐私保护机制进行实验验证。

多模态特征融合

皮肤病变的诊断通常包括皮肤观察和临床病史。在大多数情况下,皮肤科医生不仅考虑皮肤镜图像,还会结合患者信息(年龄、性别和病变部位)进行诊断判断。该系统的设计灵感来源于这一临床工作流程,采用多模态学习方法,整合基于图像的数据与临床数据。卷积神经网络(CNN)在已有的皮肤镜图像深度特征上进行训练,能够识别复杂的视觉模式,包括颜色变化、病变形态、结构异常以及纹理特征。然而,图像特征可能不足以全面反映病变的临床状况,因此在学习过程中也纳入了与每幅图像相关的临床元数据。系统将构建一个特征融合模块,用于整合深度图像特征与处理后的临床属性及人口统计学信息。这种复合表征构成了一种集成的多模态特征表示,包含了每个病变的视觉信息和上下文信息。该模型能够融合多种数据来源,获取互补的模式,从而提升整体分类能力。多模态表征使系统能够更有效地鉴别视觉上相似的病变,并纳入临床指标进行综合判断。由于更贴近皮肤科医生在临床实践中分析病变的方式,该模型在临床上更具意义且更为有效。

堆叠集成学习
本研究提出的框架采用堆叠集成学习策略,以进一步提升系统的预测能力。集成学习是一种复合预测方法,通过结合两个或更多预测模型来增强泛化能力,并减少单一模型可能出现的预测误差。该方法不依赖单一分类器,而是对多模态特征表示独立训练多个基础学习器。每个基础学习器均提供某一特定样本属于某一病变类别的可能性估计。这些概率预测随后在元层进行聚合。每个基础学习器被赋予一个权重,以体现其对最终预测结果的相对重要性。采用 softmax 激活函数计算聚合输出,从而生成归一化的类别概率。堆叠集成方法具有多项优势:首先,由于融合了多个模型,可降低预测方差,从而提升泛化性能;其次,不同模型能够捕捉数据中的不同趋势,从而增强模型整体的预测能力;第三,集成学习有助于改善少数病变类别的分类效果,尤其在医学数据中,某些具有临床意义的疾病类型往往较为罕见。

可解释人工智能的整合

医学人工智能系统除了需要具备高预测准确性外,还应对其决策提供清晰的解释。为了使临床医生能够信任人工智能系统并有效应用于临床实践,他们必须能够理解模型如何得出其所给出的诊断结论。为满足这一需求,所提出的框架整合了可解释性人工智能(XAI)方法,如图7所示。

比较分类模型的混淆矩阵:XGBoost、LightGBM、DNN、堆叠集成模型。
图7:用于多类别皮肤病变分类的不同分类模型的混淆矩阵。A)XGBoost,(B)LightGBM,(C)深度神经分类器,以及(D)堆叠集成模型。每个混淆矩阵展示了真实类别(行)与预测类别(列)之间的关系,涵盖七种皮肤病变类型:akiec、bcc、bkl、df、mel、nv 和 vasc。XGBoost 和 LightGBM 模型在 nv 和 bkl 类别上表现良好,但在 mel 与 nv 之间存在一定程度的混淆。深度神经分类器改善了 bkl 和 df 的分类效果,并减少了非对角线上的混淆。堆叠集成模型表现出最高的分类一致性,其对角线元素愈发显著。请点击此处查看该图的高清版本。

该系统包含两种主流的可解释性方法(模型可解释性技术(SHapley Additive Explanations)和模型可解释性技术(Local Interpretable Model-agnostic Explanations)),以揭示模型的预测机制。模型可解释性方法通过衡量每个输入特征对整体预测结果的贡献程度,从特征层面解释模型的决策依据。该方法有助于确定哪些临床变量或视觉特征对分类结果影响最大,使研究人员和临床医生能够观察模型在整个数据集上的总体行为。另一方面,模型可解释性技术则针对单个预测提供局部解释,重点突出皮肤镜图像中对模型决策影响最大的区域。这些像素级的可视化解释使临床医生能够直观地检查影响分类结果的病灶区域。所提出的框架实现了全局与局部的可解释性,这是通过整合模型可解释性技术实现的。双重解释机制增强了模型的透明度,使临床医生能够评估模型是否关注具有医学意义的模式。

临床决策支持潜力

隐私保护学习、多模态特征融合、集成建模和可解释人工智能是构建一体化且稳健的皮肤病变自动分类系统的关键组成部分。理想情况下,该系统不仅应具备强大的预后能力,还应具有透明性和安全性,如图8所示,这两点是医疗系统中的两个关键因素。

ROC 曲线分析;多分类器;图表比较;性能的 AUC 指标。
图 8:堆叠集成模型的受试者工作特征(ROC)曲线。A–C)展示了七种皮肤病变类型的 ROC 曲线,横轴为假阳性率(1-特异性),纵轴为真阳性率(敏感性)。曲线下面积(AUC)表示堆叠集成模型在区分各类别方面的性能。请点击此处查看该图的放大版本。

该系统可提供可解释的预测结果并保护隐私。因此,它对其他皮肤科诊断系统具有积极意义。该系统使医疗从业者/皮肤科医生能够评估皮肤病变的可疑程度,提高诊断准确性,从而帮助医疗从业者/皮肤科医生在患者可能患有更严重疾病(例如黑色素瘤)的早期阶段进行诊断。本质上,如图9所示,该系统旨在将高科技人工智能(AI)系统的应用与现实世界中的实际应用相结合,以帮助皮肤科医生更准确、更自信地诊断患者,同时确保患者的隐私、安全及其舒适性。

机器学习特征重要性分析;示意图和图表;预测概率;数据比较。
图9:使用模型可解释性技术进行多类别皮肤病变分类的可解释性结果。A)SHAP图,显示影响良性与恶性病变预测的特征贡献。(B)BCC预测的LIME解释,展示对分类结果产生正向和负向影响的特征。(C)AKIEC预测的LIME解释,突出模型决策过程中最具影响力的特征。这些可解释性可视化结果展示了显著影响模型预测的区域和提取的特征,有助于提高皮肤病变评估中分类过程的透明度与理解。 请点击此处查看该图的高清版本。

评估策略

为避免抽样偏差并保持所有皮肤病变类别中原有的类别分布,数据集按80:20的比例划分为训练集和测试集。随后,训练子集进一步按90:10的比例划分为训练集和验证集,用于调整超参数并优化模型。测试集在训练过程的任何阶段均未被使用,仅在训练结束后作为最终测试,以避免数据泄露,确保性能评估的无偏性。所有模型均在相同的设置下进行预处理和训练,数据以相同方式划分和增强,评估协议也以一致的方式实施和遵循,从而实现了公平且可重复的比较。模型的评估基于准确率、精确率、召回率、F1分数和AUC,并对各类别结果进行了详细分析,以评估其对主要类别和少数类别病变的鲁棒性。这一标准化的验证工具将有助于提高所提出方法的可靠性、透明度和泛化能力,并克服性能报告中潜在的不一致性问题。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

评估了四种分类方法(XGBoost、LightGBM、深度神经分类器和堆叠集成模型)在多类别皮肤病变分类中的性能。这些模型的整体准确率分别为92%、90%、94%和96%,表明

各类别性能

提供了按类别详细评估的结果,包括每种病变类别的精确率、召回率和 F1 分数。对于 akiec 类别(样本数 = 65),堆叠集成模型的精确率为 0.72,召回率为 0.73,F1 分数为 0.72,相较于 XGBoost(F1 = 0.70)、LightGBM(F1 = 0.68)和深度神经分类器(F1 = 0.71)略有提升。 对于 bcc 类别(样本数 = 103),堆叠集成模型的精确率 = 0.87,召回率 = 0.84,F1 分数 = 0.85,与 XGBoost(F1 = 0.83)和 LightGBM(F1 = 0.81)相当,略高于深度神经分类器(F1 = 0.84)。 对于 bkl 类别(样本数 = 220),堆叠集成模型的...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案概述了一种可重复的流程,用于构建一个可解释、注重隐私保护的多模态框架,以实现皮肤病变的自动分类。该方案遵循通过模型透明性提升诊断性能的系统性模式,将皮肤镜图像分析与临床元数据及可解释的机器学习方法相结合。HAM10000皮肤病变数据集公开可用,支持该领域皮肤病图像研究的标准化评估,并促进后续研究的可重复性16。图像预处理与归一化步骤是本方案中最重要的步骤之一,其作用在于确保皮肤镜图像在特征提取和模型训练前已完成标准化。皮肤镜图像中可能存在的伪影包括光照不均、毛发遮挡或背景噪声,这些因素可能影响模型性能。将图像调整至固定分辨率并进行归一化处理,可减少此类差异,从而使模型能够从临床角度专注于感兴趣的病变特征,如色素分布模式、不规则边界和不对称性。基于深度学习的皮肤科系统需要适当的预处理才能实现可靠的性能,这一点已在早期的自动化皮肤癌分类研究中得到证实2.

基于多种卷积神经网络(CNN)架构的深度特征提取流程也是该过程的重要组成部分。在此过程中,采用 EfficientNet-B4、DenseNet201 和 M...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。我们不存在利益冲突。作者声明,人工智能工具仅用于语言编辑和格式整理。所有科学内容、分析及解释均由作者独立完成并验证。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢帕尔瓦尔的 MVN 大学提供的学术指导和研究支持。作者还感谢公开可用的 HAM10000 皮肤病变数据集,该数据集被用于本研究的实验评估。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
DenseNet201 卷积神经网络架构IBMhttps://arxiv.org/abs/1608.06993用于图像分类的深度学习模型
EfficientNet-B4 卷积神经网络架构Googlehttps://arxiv.org/abs/1905.11946用于图像分类的深度学习模型
Google Colaboratory 平台Googlehttps://colab.research.google.com基于云的计算环境
HAM10000 皮肤病变数据集哈佛 Dataversehttps://doi.org/10.7910/DVN/DBW86T皮肤镜图像数据集
Keras 深度学习 APIGoogle版本 2.x神经网络 API
LIME 可解释性库LIME 项目版本 0.x模型可解释性技术
MobileNetV2 卷积神经网络架构Googlehttps://arxiv.org/abs/1801.04381用于图像分类的深度学习模型
Matplotlib 可视化库Matplotlib 开发团队版本 3.x用于生成图表和性能可视化
NVIDIA GPUNVIDIARTX 系列模型训练用计算硬件
NumPy 数值计算库NumPy 开发者版本 1.x数据分析软件
OpenCV 图像处理库OpenCV 基金会版本 4.x图像处理库
Pandas 数据分析库Pandas 开发团队版本 1.x数据分析软件
Python 编程环境Python 软件基金会版本 3.9+数据分析软件
SHAP 可解释性库SHAP 项目版本 0.x模型可解释性技术
SMOTE 过采样技术imbalanced-learn 项目版本 0.x用于处理不平衡数据集的类别平衡技术
Scikit-learn 机器学习库scikit-learn 项目版本 1.x机器学习库
TensorFlow 深度学习框架Google版本 2.x深度学习框架

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

EfficientNet B4 XGBoost

相关文章