本研究提出了一种基于轻量级注意力机制的深度学习框架,利用MobileNetV2、EfficientNetV1和Inception-ResNet-V2的迁移学习方法,实现对MRI图像中四类脑肿瘤的分类。该模型在降低计算复杂度的同时实现了高分类准确率,适用于资源受限的临床决策支持应用。
研究文章
本研究提出了一种基于轻量级注意力机制的深度学习框架,利用MobileNetV2、EfficientNetV1和Inception-ResNet-V2的迁移学习方法,实现对MRI图像中四类脑肿瘤的分类。该模型在降低计算复杂度的同时实现了高分类准确率,适用于资源受限的临床决策支持应用。
本研究旨在利用磁共振成像(MRI)数据,开发一种轻量级且高精度的深度学习框架,用于将脑肿瘤分为四类——胶质瘤、脑膜瘤、垂体瘤和健康脑组织。所提出的方法结合迁移学习与三种预训练的卷积神经网络模型——MobileNetV2、EfficientNetV1 和 Inception-ResNet-V2,并引入一种注意力机制,模拟人类视觉系统对图像中临床相关区域的聚焦能力。这种基于注意力的策略在增强肿瘤定位的同时,抑制了无关的背景信息。该框架在一个大规模公开的脑部 MRI 数据集上进行评估,该数据集包含数千张标注图像,涵盖上述四类样本。研究采用标准的预处理、数据增强和训练流程,以确保所提方法可被直接复现。实验结果表明,EfficientNetV1 实现了最高的分类性能,其准确率优于 MobileNetV2 和 Inception-ResNet-V2。本研究得出结论:所提出的轻量级、基于注意力的框架在分类准确性和计算复杂度之间实现了有效平衡,特别适用于资源受限环境下的实时和移动医疗应用。
利用磁共振成像(MRI)对脑肿瘤进行准确分类在临床诊断、治疗规划和预后评估中起着关键作用1。脑肿瘤包括胶质瘤、脑膜瘤和垂体瘤,具有不同的病理特征和治疗反应,因此早期且可靠的识别对于改善治疗效果、延缓疾病进展至关重要。由于MRI具有优异的软组织对比度、无创性以及能够在多个解剖平面上显示肿瘤形态的能力,已成为评估脑肿瘤的首选方法。然而,MRI图像的手动解读通常耗时较长,且高度依赖放射科医生的专业经验,尤其是在肿瘤边界不规则或不同肿瘤类型在影像上表现相似的情况下。因此,自动化的计算机辅助诊断系统在帮助放射科医生实现准确、高效的肿瘤分类方面正变得越来越重要。
基于深度学习(DL)的图像分析技术在生物医学和计算机视觉应用中显著推动了疾病自动分类的发展2,3。在神经肿瘤学领域,机器学习和迁移学习技术在肿瘤检测、分割和分类任务中已展现出良好的性能4。特别是卷积神经网络(CNN)在直接从MRI扫描中自动提取分层图像特征方面表现出卓越能力,无需依赖人工设计的特征工程。CNN架构能够从影像数据中学习到具有区分性的肿瘤相关表征,从而在分类性能上优于传统的机器学习方法。近年来深度学习的进步使得高性能图像分类系统的开发成为可能,这些系统能够以更高的精度处理大规模影像数据集,并减少人为干预。
尽管取得了这些进展,传统的深度卷积神经网络(CNN)架构通常需要大量的计算资源,包括高内存消耗、参数复杂度增加以及漫长的训练时间5。此类计算需求限制了其在资源受限的临床环境和移动医疗系统中的应用。此外,轻量级卷积神经网络架构因其较低的计算复杂度以及适用于低资源应用场景的特性,正受到越来越多的关注5。近年来多项研究探索了优化的CNN策略、高效的特征提取机制以及轻量化的部署框架,以在不显著降低预测准确率的前提下提升分类效率6,7,8。然而,在基于MRI的脑肿瘤分析中,如何在计算效率与强大的多类别肿瘤分类性能之间实现平衡,仍然是一个主要挑战9。
基于注意力的深度学习框架已成为改进医学图像分析中特征表示的有效解决方案10。注意力机制使神经网络能够有选择性地增强具有诊断意义的图像区域,同时抑制无关的背景信息。受人类视觉系统的启发,注意力引导的网络架构通过将计算重点集中在肿瘤特异性的空间区域和上下文特征上,从而提升判别性特征的学习能力。这类机制在脑肿瘤MRI分析中尤为有益,因为肿瘤组织通常表现出异质性的强度模式、不规则的形态以及不同肿瘤类别之间重叠的视觉特征。因此,将注意力模块整合到基于卷积神经网络(CNN)的架构中,可提高分类准确性并改善特征定位性能。
最近几项研究已证明深度学习框架在脑肿瘤自动化诊断及基于磁共振成像(MRI)的肿瘤分类方面具有巨大潜力11,12。Gao 等人开发并验证了一种利用 MRI 数据进行脑肿瘤诊断的深度学习模型,展示了其在自动化神经影像分析中强大的分类能力11。类似地,Abdusalomov 等人研究了基于深度学习的脑肿瘤检测方法,并使用 MRI 扫描报告了具有良好前景的诊断性能12。尽管这些研究在分类准确性方面取得了提升,但与数据集多样性、模型泛化能力以及计算需求相关的局限性仍未解决。在许多情况下,训练数据集规模有限,或来源于受限的临床资源,从而增加了过拟合的风险,并降低了在异质性患者群体中的鲁棒性。
为了提高肿瘤的可视化效果和特征提取能力,研究人员也探索了多模态磁共振成像(MRI)分析与重建技术13,14。Sun 等人研究了基于多模态 MRI 的胶质瘤评估方法,该方法结合深度学习重建框架与去噪策略13。他们的工作证明了图像质量提升对于提高胶质瘤检测准确性的关键作用。类似地,Srinivas 和 Rao 提出了一种基于深度学习的分割框架,用于多模态 MRI 脑肿瘤亚区分析14。该方法改善了肿瘤亚区的边界勾画,有助于个体化治疗方案的制定。然而,多模态框架通常需要大量的预处理步骤、更高的计算资源消耗,以及不同成像模态之间的精确图像配准,这可能限制其在实际临床环境中的应用。
为提高分割准确性和MRI特征融合,研究人员也提出了基于注意力机制的多模态融合方法15,16,17,18。Zhou 等人提出了一种基于注意力机制的融合框架,用于多模态脑肿瘤分割15。该研究通过上下文特征学习实现了更优的分割性能,但该方法主要关注分割任务,而非轻量化的肿瘤分类。类似地,Zhou 与 Du 提出了一种用于加速MRI重建的三维多模态网络16,而 Huang 等人开发了AMF-Net,一种用于多模态脑肿瘤诊断的自适应多序列融合网络17。Zhou 等人进一步提出了用于多模态加速MRI重建的MLMFNet18。尽管这些方法在重建质量和特征融合能力方面有所提升,但它们严重依赖多种MRI模态、深层网络结构以及计算成本较高的融合操作。这些需求可能限制其在资源有限的医疗系统和基于边缘的诊断平台中的实际部署可行性。
已有其他研究专门探讨了利用磁共振成像(MRI)图像对胶质瘤、脑膜瘤和垂体瘤进行分类的深度学习框架19。Mokri 等人开发了一种基于深度学习的分类系统,用于通过 MRI 扫描识别三种主要类型的脑肿瘤19。尽管该研究表现出令人鼓舞的性能,但该模型依赖于相对较小的数据集,且缺乏与轻量级迁移学习框架的比较。基于 Transformer 的架构近年来也因其能够建模长距离特征依赖性和上下文关系而在医学影像领域受到关注20。Feng 等人提出了一种用于加速磁共振图像重建的多模态 Transformer 框架20。与传统方法相比,该方法提升了重建性能;然而,Transformer 架构通常需要大量的计算资源和大规模训练数据集,这可能限制其在资源受限的医疗系统中的实际应用。
基于迁移学习的轻量级卷积神经网络架构在降低计算复杂度的同时保持分类准确率方面已展现出显著潜力21,22,23。Rahman 等人通过结合先进的预处理方法和微调策略,利用 MobileNetV2 在脑肿瘤分类任务中实现了性能提升21。由于 MobileNetV2 采用了深度可分离卷积、参数数量较少以及高效的特征提取能力,因此特别适用于轻量级医学图像应用。类似地,基于 EfficientNet 的框架通过复合缩放策略同时优化网络深度、宽度和输入分辨率,在多类别分类任务中表现出色22。与传统卷积神经网络相比,EfficientNet 架构在保持较低计算开销的同时实现了更高的分类效率。此外,Inception-ResNet 架构将残差学习与高效的特征提取机制相结合,从而提升了图像分类性能23。这类混合架构能够在保持计算效率的同时,实现有效的梯度传播和更深层次的网络表征学习。
尽管在基于磁共振成像的脑肿瘤分类方面已取得显著进展,但仍存在若干尚未解决的局限性。许多现有方法侧重于分类准确率,并采用计算密集型的网络架构,却未能充分考虑部署效率或计算资源的限制。其他研究主要关注分割、多模态重建或多特征融合,而非直接的四类脑肿瘤分类任务。此外,目前较少有框架将轻量级迁移学习架构与注意力引导的特征学习相结合,用于实现高效的多类别脑肿瘤分类。因此,在资源受限的临床环境中,仍亟需一种计算高效、兼顾分类准确性、轻量化部署能力以及判别性特征提取能力的综合框架。
因此,本研究提出一种轻量级注意力引导的迁移学习框架,用于基于MRI图像的四类脑肿瘤分类。该框架将MobileNetV2、EfficientNetV1和Inception-ResNet-V2与注意力机制相结合,能够选择性地增强具有诊断意义的肿瘤区域,同时抑制无关的背景特征。该框架旨在提升特征判别能力与分类性能,同时降低计算复杂度。通过将轻量级迁移学习主干网络与注意力引导的特征提取方法相结合,所提出的方法旨在为资源受限的临床决策支持环境中的自动化MRI脑肿瘤分类提供一种高效且可扩展的解决方案。
访问受限。请登录或开始试用以查看此内容。
本研究使用了一个公开可获取的匿名数据集,因此无需获取知情同意。所提出的方法包含六个组成部分:预处理、卷积模块、注意力模块、卷积模块与注意力模块的整合,以及全连接(FC)层。图1展示了本方法的完整工作流程。
数据集获取
标注的脑部 MRI 图像来自公开可用的 Kaggle 数据集,该数据集包含四种肿瘤类别和正常组织。
数据预处理
将图像调整为统一的分辨率,并进行强度归一化。可选地应用数据增强(如旋转、翻转、缩放)以提高模型泛化能力。数据集被划分为训练集(70%)和测试集(30%)。
模型架构
采用三种在 ImageNet 上预训练的骨干卷积神经网络——MobileNetV2、EfficientNetV1 和 Inception-ResNet-V2,利用 MRI 图像将脑肿瘤分为四类。MobileNetV2 和 EfficientNetV1 的输入维度设置为 224 × 224 像素,而 Inception-ResNet-V2 所需的输入尺寸为 299 × 299 像素。在迁移学习过程中,初始卷积层在训练初期被冻结,以保留通用的图像特征,而上层网络则进行微调,使模型适应脑肿瘤分类任务。每个骨干网络均连接一个轻量级分类头,包含全局平均池化(Global Average Pooling)、全连接层、用于正则化的 Dropout 层,以及 Softmax 激活函数,以预测四种类别。引入 Dropout 机制旨在减轻过拟合,提升模型泛化能力。所设计的架构有效结合了高效的特征提取能力与较低的计算需求,既实现了精确分类,又适用于资源受限环境及概念验证场景的部署。
基于注意力的特征提取
输入图像首先经过初始卷积层处理,随后进入自定义的注意力模块。通过并行的最大池化和平均池化捕获显著特征和上下文特征,这些特征被拼接后经卷积进一步优化,以突出与肿瘤相关的区域。
卷积主干网络与特征融合
经过注意力加权的特征被送入预训练的主干网络(MobileNetV2、EfficientNetV1 或 Inception-ResNet-V2)。高层卷积层在逻辑上进行融合,以减少内存访问并提升计算效率。
分类
展平后的特征通过具有 ReLU6 激活函数和 dropout 的全连接层,生成紧凑表示,用于最终的四分类 softmax 分类。
评估
使用准确率、精确率、召回率、F1分数和混淆矩阵在测试集上评估模型性能。
框架开发
所提出的解决方案使用 Python 实现,并采用 Keras 进行执行。表 1 列出了超参数。数据集按照 70:30 的比例划分为训练集和测试集。对每种数据集,采用五种不同的随机划分方式划分训练集和测试集,以展示最终的平衡性能。
预处理
由于所提出的解决方案以 MobileNetV2 框架为基础,因此必须对输入图像进行预处理。为了从照片中提取高分辨率特征,使用预训练的 MobileNetV2 模型及其输入维度。随后,每幅输入图像被缩放至 224×224 像素,并归一化到 [-1, 1] 范围内。
卷积模型
MobileNetV2 通过采用一种高效的卷积神经网络(CNN)架构来提升图像识别能力,该架构旨在最小化计算需求。尽管传统 CNN 能够实现高准确率,但通常需要大量的内存和处理能力。MobileNetV1 引入了深度可分离卷积的概念,将标准卷积分解为两个独立的操作:用于过滤输入的深度卷积和用于整合特征的逐点卷积。MobileNetV2 在此基础上进一步发展,引入了包含扩展层、深度卷积、投影层和残差连接的瓶颈残差模块。其中,投影层用于压缩特征通道,而残差连接则有助于网络中信息的更有效流动。为了提高稳定性并增强学习性能,在卷积操作之后应用了 ReLU6 激活函数和批归一化(batch normalization)。
本研究中,采用在 ImageNet 上预训练的 MobileNetV2 作为骨干模型以提取特征,在实现高效高级语义表征的同时,保持较低的计算成本,用于脑肿瘤分类。在每个卷积层之后,均设有一个 ReLU6 激活层,该层是 ReLU 激活函数的一种变体,其输出值在六处达到上限,同时还包含一个批归一化层。对剩余的 17 个瓶颈块应用常见的 1×1 卷积、平均池化和分类层,从而构成完整的 MobileNetV2 架构。我们使用在 ImageNet 上预训练的 MobileNetV2 作为骨干网络。在此情况下,卷积特征图是通过 MobileNetV2 卷积层后,从最后一个残差块中获得的。较低层级的残差块生成尺寸较小的特征图,这些块对本研究无贡献,因其无法为整体图像识别收集高层级数据。在模型构建与训练过程中,保留生成 7 × 7 三维特征图的卷积层之前的所有层保持不变。用数学形式表示如下,见公式(1):
F1(I) = Conv(I) (1)
此处,F1(I) 表示从输入图像 I 中提取的卷积特征。
聚焦模块
人脑的注意力机制意味着,人们会自然地更关注显著的视觉输入,而非图像中的每个细节,这一机制构成了该变换网络设计的基础。由于这一理念,深度学习研究中已开发出大量基于注意力的模型。所提出的注意力机制突出了脑肿瘤表征中观察到的空间相关性。区域注意力单元识别磁共振成像(MRI)图像中最具信息量的区域,而通道注意力模块则捕获跨特征通道中最关键的肿瘤相关信息。通过采用结构化注意力方法,所提出的聚焦单元专注于包含判别性肿瘤信息的区域。
为了提升特征表示能力,在空间特征检测阶段之前,采用了诸如顶部激活池化(Top Activation Pooling)和平衡特征提取等技术。该策略增强了模型突出临床显著性肿瘤区域的能力,同时最小化无关的背景细节,从而提高分类准确性和特征学习效率。第二种方法是将最大池化张量与平均池化张量进行拼接。最后,将使用sigma激活函数结合7×7卷积核,以激活视觉图像中的视觉刺激。聚焦模块的不同阶段在公式(2)和(3)中予以说明,其中平衡池化Pool(F) ∈ RH×W×1表示平均池化操作,MaxPool(F) ∈ RH×W×1描述最大池化操作。
F2(I) = [AvgPool(F);MaxPool(F)] (2)
这两个元素图谱可以在三维空间中结合,以生成一个元素分布图
F2(I) = ∈ RHxwx1. F3(I) = σ(f7x7(F2(I))) (3)
其中,σ 是表示 sigmoid 的激活函数。注意力特征由一个高度(H)、宽度(W)和通道数(C)编码的张量(V)表示,即 F3(I),而 f7x7 表示卷积操作的滤波器尺寸(7×7)。
注意力机制与卷积模型的融合
与依赖单一编码器的网络相比,多模态融合单元能够为绝大多数模态提取更高效且更全面的信息。该融合模块旨在引导获取最大程度的关键跨模态特征,从而精确定位肿瘤区域提取中的注意力区域。虽然简单的特征拼接可以合并各个潜在表征,但会导致部分信息丢失。因此,我们通过结合卷积模块与观测模块的特征图,采用 Sitaula 等人提出的基础特征拼接方法生成了一个联合对象图。由于这两个特征图捕捉了图像不同属性之间的差异,我们决定采用简单的拼接方法,而非基于最大值、最小值或求和的策略。这种方法在计算上也比使用双线性方法作为张量积计算的替代方案更为轻量。当这两种特征被合并时,所得结果称为特征张量。字符 T 的聚合张量输出的数学表达式如公式 (4) 所示。
[F1(I), F3(I)] = T(I) (4)
其中 F1(I) ∈ RH×W×1 且 F2(I) ∈ RH×W×1280。这些是具有相同宽度(W)和高度(H)的三维张量。此外,它们可以在三维空间中进行拼接以生成三维张量 T(I),其中 T(I) ∈ RH×W×1281。
全连接层(FC)
在特征融合之后,我们使用一系列全连接层,将重塑为线性特征向量的体积张量进行转换。分类头包括全局平均池化层、全连接密集层、dropout 正则化以及 Softmax 输出层。激活函数采用 ReLU6,包含 128 个神经元,dropout 概率为 50%。
访问受限。请登录或开始试用以查看此内容。
采用MRI图像对三种预训练的深度学习模型(即MobileNetV2、EfficientNetV1和Inception-ResNet-V2)进行了四类脑肿瘤分类的评估。
所使用的数据集
所提出的框架使用从 Kaggle 平台获取的公开可用的脑肿瘤 MRI 数据集进行评估。该数据集包含 835 张正常脑部 MRI 图像、826 张胶质瘤图像、822 张脑膜瘤图像和 827 张垂体瘤图像。数据集中的代表性 MRI 样本如图 2所示。
MobileNetV2
MobileNetV2 模型总共包含 2,263,108 个参数,其中包括 2,228,996 个可训练参数和 34,112 个不可训练参数。分类性能指标如表2所示。该模型的整体分类准确率达到 97%,宏平均 F1 分数与加权平均 F1 分数表现相当。如表3所示的混淆矩阵...
访问受限。请登录或开始试用以查看此内容。
基于准确率、召回率、F1分数和精确率的性能评估表明,MobileNetV2 和 Inception-ResNet-V2 在脑肿瘤分类任务中表现相当,各自的总体准确率和加权平均准确率均达到 97–98%。相比之下,EfficientNet 表现优于其他模型,在宏平均和加权平均指标上均实现了 99% 的准确率,这得益于其增强的泛化能力和复合缩放策略。这些发现与先前研究结果一致,表明 EfficientNet 架构在多类 MRI 肿瘤分类和计算高效的特征学习方面具有显著有效性22。类似地,基于迁移学习的 MobileNetV2 框架此前已在轻量级脑肿瘤分类任务中展现出优异性能,同时保持较低的计算复杂度21。
EfficientNetV1 性能的提升可能归因于其对网络深度、宽度和输入分辨率的平衡扩展,从而能够高效地提取具有区分性的肿瘤相关特征。关于复合扩展策略优势的类似观察结果在此前的卷积神经网络优化研究中已有报道7,
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
本研究未获得外部资金支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 脑部 MRI 数据集 | IEEE | https://dx.doi.org/10.21227/q2vt-tf46 | 该数据集通过机构权限下载。MRI 数据集包含四类:胶质瘤、脑膜瘤、垂体瘤和正常脑组织 |
| CNN 加速器(层融合) | 拟议工作 | — | 融合顶层卷积层以减少内存访问并提升计算效率 |
| 自定义注意力模块 | 拟议工作 | — | 结合最大池化与平均池化的注意力机制以突出肿瘤相关区域 |
| EfficientNetV1 | 谷歌 | 预训练(ImageNet) | 可扩展的卷积神经网络架构,提供最佳准确率–效率权衡 |
| Google Colaboratory | 谷歌 | https://colab.research.google.com/ | 支持 GPU 的用于模型训练、评估和实验的基于云的环境 |
| Inception-ResNet-V2 | 谷歌 | 预训练(ImageNet) | 结合 Inception 模块与残差连接的深度混合卷积神经网络架构 |
| Keras | 谷歌 | v2.6.0 | 基于 TensorFlow 的高级神经网络 API,用于快速模型原型设计 |
| Matplotlib | Matplotlib 开发者 | v3.4.3 | 用于绘制训练曲线、混淆矩阵和性能指标的可视化库 |
| MobileNetV2 | 谷歌 | 预训练(ImageNet) | 适用于移动端与边缘计算部署的轻量级卷积神经网络骨干网络 |
| NumPy | NumPy 开发者 | v1.21.4 | 用于数值运算的核心科学计算库 |
| Pandas | Pandas 开发团队 | v1.3.4 | 用于数据集组织和元数据处理的数据处理与操作库 |
| Python | Python 软件基金会 | v3.8.10 | 用于数据预处理、模型开发与评估的主要编程语言 |
| Scikit-learn | Scikit-learn 开发者 | 最新稳定版 | 用于评估性能指标,如精确率、召回率、F1分数和混淆矩阵 |
| 海藻 | Seaborn 开发者 | 最新稳定版 | 用于增强图形分析的高级统计可视化库 |
| TensorFlow | 谷歌 | v2.6.0 | 用于实现卷积神经网络主干和注意力模块的端到端深度学习框架 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可