本文提出了一种少样本多模态深度学习框架,用于基于磁共振成像序列对腮腺肿瘤进行准确分类。
研究文章
本文提出了一种少样本多模态深度学习框架,用于基于磁共振成像序列对腮腺肿瘤进行准确分类。
准确区分腮腺肿瘤的良恶性对患者的预后至关重要。然而,由于腮腺肿瘤具有高度异质性,且影像学数据有限,术前诊断仍面临重大挑战。为解决这一问题,本研究提出一种基于小样本学习的多模态深度学习框架。该框架整合了多序列磁共振成像(MRI)信息,并引入多尺度空间注意力机制,以在样本量有限的情况下提升特征提取与分类性能。研究采用回顾性收集的198例经组织病理学确诊的原发性腮腺肿瘤患者队列(良性107例,恶性91例)对模型进行系统评估,所有患者均在我院接受了完整的术前MRI检查(包括T1加权、T2加权及扩散加权成像),且腮腺病灶未接受过任何前期治疗。采用分层随机抽样方法,在患者层面将队列划分为训练集(70%)、验证集(15%)和测试集(15%),以保持良恶性比例一致,确保各子集之间相互独立,避免数据泄露。该模型的曲线下面积(AUC)达到0.9822,表明其在区分良恶性肿瘤方面具有优异能力。此外,与经验丰富的放射科医生相比,该模型在诊断准确性方面展现出显著优势,凸显其在腮腺肿瘤术前良恶性鉴别及临床决策支持中的潜在应用价值。
流行病学数据显示,腮腺肿瘤的发病率呈上升趋势。腮腺是人体最大的唾液腺1,也是头颈部肿瘤的高发部位之一。尽管腮腺肿瘤相对少见,约占头颈部肿瘤的5%,但良性病变远多于恶性病变,约占所有腮腺肿瘤的80%2,3。良性和恶性腮腺肿瘤在生物学行为、治疗策略及预后方面存在显著差异。良性肿瘤通常生长缓慢,呈膨胀性生长,极少发生转移;通过完整的手术切除后预后良好。相比之下,恶性肿瘤表现出明显的侵袭性生长模式,常侵犯周围组织,如面神经、皮肤和骨骼,并可能发生远处转移,导致预后较差4,5。
然而,术前区分腮腺肿瘤的良恶性仍是临床诊断中的一大挑战。由于缺乏特异性的临床表现,大多数腮腺肿瘤(无论良恶性)的首发症状均为无痛性肿块,仅凭体征或症状难以鉴别6,7。尽管疼痛或面瘫等症状常被视为恶性肿瘤的潜在提示,但在早期恶性病变中并不常见。相反,某些伴有炎症反应的良性肿瘤也可能出现类似表现。腮腺肿瘤的术前评估主要依赖影像学检查,这是最主要的无创性评估手段。然而,需注意的是,每种影像学方法均有其局限性。磁共振成像(MRI)因其优异的软组织分辨率,被认为是评估腮腺肿瘤的最佳方法,研究显示其在区分良恶性病变方面的最高准确率可达93%8。但常规序列在信号特征上存在显著重叠9。CT主要用于评估骨质受累情况,但在区分良恶性肿瘤方面的敏感性低于MRI10,11。超声可用于浅表病变的初步评估,但其有效性高度依赖操作者的经验12。PET-CT具有高代谢敏感性,但因其成本较高且假阳性率较高,限制了其在初诊中的应用,更适用于恶性肿瘤的分期和随访。因此,单一影像学方法往往难以实现精确诊断,术前对良恶性病变的鉴别通常需依赖多模态信息的综合分析。
近年来,人工智能(AI)领域,特别是以卷积神经网络(CNNs)为代表的深度学习(DL)技术,在肿瘤影像诊断的进步中发挥了重要作用,这得益于这些技术强大的图像特征提取和模式识别能力。深度学习模型通过多层神经网络自动提取复杂的多尺度特征,显著减少了对人工特征设计的依赖,同时提升了诊断性能。大量研究已验证了其在多模态医学影像中的应用潜力。Gu Jionghui 等人13开发了一种整合乳腺超声与磁共振成像(MRI)的多模态深度学习系统,有效预测了新辅助化疗的治疗反应,表现优于传统方法。Lu G 等人14通过结合超声、乳腺X线摄影和MRI图像,并采用迁移学习策略,实现了良恶性乳腺肿瘤的精确区分,AUC达到0.947。Horasan A 等人15利用3D CNN结合ResNet和Inception架构对前列腺多参数MRI(mpMRI)进行融合分析,准确率约为91.3%。在腮腺影像方面,Zhang G 等人16构建了一个整合超声与临床数据的深度学习模型,用于良恶性鉴别;Hu X 和 Wang H.17基于CT图像采用aResNet50模型实现了92.3%的分类准确率(AUC=0.96)。这些研究的综合证据表明,采用深度学习模型分析腮腺及其他实体瘤影像具有显著优势。
然而,传统的深度学习方法通常依赖于大规模数据集才能实现最佳性能。腮腺癌作为一种低发病率的肿瘤,其数据相对有限18。此外,腮腺肿瘤在影像上表现出高度异质性,其信号强度、形态结构以及与周围腺体组织的关系存在复杂的变异。这些特征跨越多个空间尺度——例如,整体肿瘤形态和边界定义,以及内部信号异质性和浸润模式等局部特征——使得单尺度或简单的特征提取方法难以充分捕捉良性和恶性病变之间的关键差异。此外,以往的研究通常仅依赖单一的磁共振成像序列(例如,仅结构成像或功能成像),这限制了对肿瘤特征进行全面表征的能力,正如先前研究报道的那样19,20。
为应对这些挑战,我们提出,一种整合多序列磁共振成像(MRI)与多尺度空间注意力机制的小样本多模态深度学习框架,可在数据有限的条件下有效区分腮腺良恶性肿瘤,并优于传统方法及放射科医生的评估。具体而言,该框架采用少样本学习21策略,从有限数量的代表性良性和恶性病例中学习判别性特征。模型利用空间注意力机制聚焦于病灶关键区域,从而提高区分腮腺良恶性肿瘤的准确性。本研究在本机构回顾性收集的198例经病理证实为腮腺肿瘤的患者队列上对模型进行了评估。研究整合了结构成像(T1WI、T2WI)和功能成像(DWI)MRI序列,以提供形态学与功能信息。所提出的框架旨在辅助术前对腮腺良恶性肿瘤进行鉴别诊断。
访问受限。请登录或开始试用以查看此内容。
本研究中使用的所有患者数据均 exclusively 在无锡市人民医院收集,共包括198例经病理确诊的腮腺肿瘤病例。本研究已获得无锡市人民医院伦理审查委员会批准(IRB编号:KY24068),并严格遵循机构指南和国际伦理标准进行。所有数据在分析前均已完全匿名化。
MRI 图像采集
所有磁共振成像序列(T1加权成像、T2加权成像和扩散加权成像)均在3.0特斯拉磁共振扫描仪(Siemens MAGNETOM Verio或Prisma)上使用16通道头颈部线圈获取。采集参数如下:T1加权图像采用TR/TE = 500/15 ms,层厚 = 3 mm,矩阵 = 256 × 256,视野 = 240 mm;T2加权图像采用TR/TE = 4000/90 ms,层厚 = 3 mm,矩阵 = 320 × 320,视野 = 240 mm;扩散加权图像采用TR/TE = 5000/80 ms,b值 = 0和1000 s/mm2,层厚 = 3 mm,矩阵 = 128 × 128,视野 = 240 mm,并自动生成表观扩散系数图。所有序列均在轴位平面采集,无层间间隙。
研究设计
本项回顾性研究分析了198例经组织病理学确诊为原发性腮腺肿瘤患者(其中良性107例,恶性91例)的术前MRI数据。所有患者均在我院接受了完整的腮腺MRI检查,包括T1加权成像、T2加权成像和扩散加权成像序列,且腮腺病变未接受过任何前期治疗。以手术切除标本或粗针穿刺活检结果作为参考标准。纳入标准为:经组织病理学确诊的原发性腮腺肿瘤、在我院完成包含所有必要序列的术前MRI检查,且未接受过针对腮腺病变的手术、放疗、化疗或消融治疗。排除标准包括:转移至腮腺的肿瘤、存在显著运动伪影或序列不完整导致图像无法用于诊断,以及既往治疗后复发的肿瘤。总体队列包括男性118例(59.6%)和女性80例(40.4%),年龄范围为26至89岁(平均值±标准差为53.0±12.8岁)。按肿瘤类型分层的人口学特征如下:良性组(n=107)包括男性59例(55.1%)、女性48例(44.9%),年龄范围28–87岁(平均值±标准差为54.2±12.1岁);恶性组(n=91)包括男性59例(64.8%)、女性32例(35.2%),年龄范围26–89岁(平均值±标准差为51.6±13.4岁)。采用分层随机抽样方法将198例患者划分为训练集(70%,n=138)、验证集(15%,n=30)和测试集(15%,n=30),同时在所有子集中保持良恶性比例一致(验证集和测试集各包含16例良性病例和14例恶性病例)。数据划分在患者层面进行,而非按图像切片或单幅图像层面进行,确保训练集、验证集和测试集之间完全互斥,无患者信息重叠,从而避免数据泄露,并实现对模型泛化能力的无偏评估。
数据预处理
本研究通过四个主要步骤对所有MRI图像实施了标准化预处理:图像配准与重采样、去噪、数据增强和归一化。为解决MRI扫描协议和患者体位的差异,所有T1WI、T2WI和DWI图像首先以T1WI序列为参考空间进行刚性配准,并使用三线性插值重采样至各向同性的1 mm3分辨率。随后,对所有配准后的图像体积采用非局部均值(Non-Local Means, NLM)算法进行去噪22,平滑参数自动设置为估计噪声标准差的0.8倍,搜索窗口为21×21×21体素,相似性窗口为7×7×7体素。该方法在有效降低随机噪声的同时,保留了重要的结构细节。接着,为了扩大有效训练样本量、提高模型泛化能力并缓解在有限数据集上的过拟合问题,在每个训练周期中仅对训练集图像动态应用多种数据增强策略,包括随机旋转(±15°)和随机缩放(0.9–1.1)23,24,所有变换均使用固定的随机种子42生成,以确保完全可重复性;验证集和测试集保持未增强状态,以保证模型评估的客观性。最后,为消除不同扫描设备和扫描会话间信号强度的系统性差异,对每个图像体积进行Z-score归一化处理,即减去均值并除以标准差,随后将归一化的像素值线性缩放到[0, 1]区间,以满足PyTorch深度学习框架的输入要求25。
模型架构
本研究提出了一种基于少样本学习的多模态深度学习框架,该框架整合了多种磁共振成像序列(T1加权成像、T2加权成像和扩散加权成像)的互补信息,并引入多尺度空间注意力机制,以在样本有限的条件下增强特征表示能力和分类性能。所有MRI体积数据均在同一台扫描仪上以轴向平面采集;在输入模型前,这些数据经过刚性配准以确保各序列之间的空间对齐,配准质量由资深放射科医生手动验证,并将包含腮腺病灶的完整3D体积裁剪为标准化的兴趣区域,重采样至各向同性分辨率,并调整至统一尺寸。通过结合少样本学习范式、多尺度空间注意力模块以及通道级联方式的跨模态特征融合,该框架解决了数据稀缺环境下模型泛化能力的挑战,能够在少量标注样本的基础上稳健地学习判别性特征,完整架构如图1所示。尽管数据集包含198例患者,但由于腮腺肿瘤在影像上具有高度异质性,且相对于任务复杂度而言,标注的体积多模态数据仍相对有限,因此采用少样本学习方法,以更好地模拟临床中标签样本稀缺的真实场景;同时,本文也评估了传统的监督训练方法作为对比,少样本配置的优势在结果部分的消融实验中得以体现。骨干网络采用R3D-1826(一种具有全时空卷积的3D ResNet-18变体),该网络在Kinetics-400数据集上进行了预训练,作为各MRI序列共享权重的特征提取器;在适配过程中,使用原型网络头部进行少样本分类,多尺度空间注意力模块插入在每个模态特异性分支的卷积阶段之后,随后进行跨模态融合和共享分类器处理。所提出的多尺度空间注意力机制的创新之处在于其采用并行的卷积路径,卷积核大小分别为1×1、3×3和5×5,每条路径独立生成具有不同感受野的空间注意力图,随后通过softmax归一化,并通过加权求和的方式自适应地与输入特征融合;该设计显式地捕捉了从精细局部细节(如内部信号异质性)到更广泛上下文结构(如肿瘤边界及其与周围组织的界面)等多个空间尺度上的病灶特征,相较于传统注意力模块表现出更优性能。微调策略分为两个阶段:首先,冻结预训练的R3D-18骨干层以保留通用的时空表征,仅训练注意力模块、融合层和原型网络头部;随后,解冻每个骨干网络的最后两个残差块(layer3和layer4),以实现对MRI特异性体积特征的端到端适配。训练过程采用Adam优化器,初始学习率为0.0001,每20个训练周期按步进衰减策略降低为原来的十分之一;模型共进行100个周期的阶段性训练,批量大小为8个阶段(每个阶段包含支持集和查询集),遵循标准的少样本协议,采用2类K样本配置(主元训练与评估期间K=5);所有实验均在配备24 GB显存的高性能GPU上完成,数据划分、权重初始化和数据增强过程中均使用固定的随机种子42,以确保实验结果的完全可重复性。
腮腺肿瘤分类的少样本学习任务范式
鉴于高质量标注的腮腺肿瘤数据有限,且此类病变的影像学异质性较高,本研究采用基于度量的少样本学习范式,尽管整体数据集包含198例患者。通过使用支持集–查询集任务结构,模拟临床实践中仅能获得少量代表性样本的罕见或异质性肿瘤亚型的诊断推理过程。每个训练任务均以N类K样本格式定义(N=2,对应良恶性分类),使模型能够从少量样本中学习具有判别性的特征表示。具体而言,对于每个任务,支持集每类包含K个多模态样本(T1加权成像、T2加权成像和扩散加权成像),用于构建类别原型,而查询集则包含待分类的样本。模型通过计算查询样本特征与嵌入空间中类别原型之间的距离度量来做出分类决策。该学习机制的优势在于可使模型摆脱对大规模标注数据的依赖,从而更适用于数据稀缺的临床实际场景。为进行直接比较,还评估了一种使用完整训练集且不进行 episodic 少样本采样的传统监督训练方法,结果部分的消融研究定量展示了少样本配置在小样本条件下在泛化能力和稳定性方面的优势。
在分类阶段,本研究采用原型网络作为分类器。对于支持集中的每个类别 c,原型向量 p_c 通过计算嵌入后的支持样本的均值得到:
(1)
其中 f(·) 表示嵌入函数(特征提取器),
是类别 c 的第 i 个支持样本,K 表示每个类别的样本数量(每类几样本)。
对于给定的查询样本 x,通过负欧几里得距离的 Softmax 函数计算其属于类别 c 的概率:
(2)
其中 d(·, ·) 表示欧几里得距离函数。
基于多模态特征融合的架构
为了充分挖掘多序列磁共振成像(MRI)数据的互补价值,本研究设计了一种三分支特征融合网络,分别处理T1加权成像(T1WI)、T2加权成像(T2WI)和扩散加权成像(DWI)序列。每个序列首先使用在Kinetics-400数据集上预训练的共享权重R3D-18模型进行特征提取,该模型权重来源于官方PyTorch TorchVision实现;在适配过程中,采用两阶段微调策略:初始阶段保持预训练主干网络的所有层固定,以保留通用的时空表征,仅训练多尺度空间注意力模块、跨模态融合层及原型网络头部;随后解冻每个主干网络的最后两个残差块(layer3和layer4),进行端到端的适配以学习MRI特有的体素特征,而前层(layer1和layer2)在整个训练过程中始终保持冻结。该网络采用在空间和时间维度上滑动的三维卷积核,有效捕捉肿瘤的体积形态及空间上下文信息。在特征融合阶段,采用基于拼接的跨模态策略,将三个模态经注意力增强后的特征表征沿通道维度拼接,形成综合的多模态特征向量。该融合方法保留了各模态的独特信息——T1WI的解剖结构清晰性、T2WI对组织成分的敏感性以及DWI对细胞密度的功能性反映——同时实现了诊断信息的有效互补,从而显著增强了特征表达的丰富性与判别能力。
多尺度空间注意力机制
本研究引入了一种多尺度空间注意力模块,用于捕捉不同空间尺度下的病灶特征。如 图2所示,该模块采用卷积核大小分别为1×1、3×3和5×5的并行卷积路径。每条路径独立生成一个空间注意力图,并通过softmax进行归一化,然后通过加权求和的方式自适应地与输入特征融合。该设计使模型能够聚焦于对区分良恶性病灶更具相关性的区域,同时降低无关背景区域的影响。生成的注意力图有助于突出图像中的感兴趣区域。
数据可用性:
本研究队列中一组具有代表性的完全匿名多模态磁共振成像序列(T1WI、T2WI、DWI)已公开发布在Zenodo数据库中,网址为:https://doi.org/10.5281/zenodo.17744149(版本v1)。这些数据依据知识共享署名4.0国际许可协议(CC-BY 4.0)共享,无访问限制。完整的匿名数据集目前尚未公开,将在本稿件正式发表后,经机构和伦理审批通过,于该数据库的后续版本中发布。
访问受限。请登录或开始试用以查看此内容。
模型性能概述
为了评估模型的诊断性能,采用了一组标准指标,包括准确率、精确率、召回率和 F1 分数。在 2 类 5 样本的设定下,基于 R3D-18 的多模态少样本学习模型在腮腺肿瘤分类的测试集上取得了以下结果:准确率为 96.88%,精确率为 97.50%,召回率为 96.88%,F1 分数为 96.83%。图 3A 所示的混淆矩阵表明,该模型在测试集中正确分类了 93.75% 的良性病例和 100% 的恶性病例。这对应于良性病例的假阳性率为 6.25%,恶性病例的假阴性率为零。97.50% 的精确率反映了在阳性预测中假阳性所占比例较低,而 96.88% 的召回率表明在实际阳性样本中真阳性所占比例较高。96.83% 的 F1 分数综合衡量了精确率与召回率的平衡表现。混淆矩阵的对角线元素显著大于非对角线元素,这与观察到的整体分类准确率一致。 图 3B 所示的 ROC 曲线下面积(AUC)为 0.9...
访问受限。请登录或开始试用以查看此内容。
本研究假设,一种多模态少样本深度学习框架,通过结合多序列磁共振成像(T1加权、T2加权和扩散加权成像)与多尺度空间注意力机制,可在标注数据有限的条件下准确区分腮腺良性和恶性肿瘤,并优于传统深度学习方法及经验丰富的放射科医生。
实验结果有力地支持了该假设。在独立测试集上,所提出的框架在2类5样本的设定下,AUC达到0.9822,准确率为96.88%,精确率为97.50%,召回率为96.88%,F1分数为96.83%。这些指标显著优于传统的3D主干网络和最先进的少样本学习方法,直接证明了多模态融合与多尺度注意力设计的优越性。从1样本到5样本设置下性能的逐步提升,进一步验证了少样本学习范式在利用有限样本方面的有效性。此外,独立运行的AI模型表现优于初级放射科医生(AUC 0.8242)和资深放射科医生(AUC 0.8555);当作为辅助工具使用时,可将两者的诊断准确率分别提升至90.62%和93.75%,且对恶性病例无一例假阴性。消融实验表明,整合结构模态(T1WI、T2WI)与功能模态(DWI)序列,以及采用所提出的多尺度空间注意力模块而非现有注意力机制时,模型性能均保持一致提升。通过...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何竞争性财务或非财务利益。
本研究由国家自然科学基金(编号:82473200)、江苏省卫生健康委员会重点医学研究项目(编号:K2023061)以及江苏省卫生健康委员会老年健康项目(编号:KLM2023019)资助,资助对象为YJH
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Grad-CAM | https://github.com/jacobgil/pytorch-grad-cam | ||
| NumPy 1.25 | NumPy 开发团队 | https://numpy.org/ | |
| pandas 2.1 | Pandas 开发团队 | https://pandas.pydata.org/ | |
| Pycharm | JetBrains | https://www.jetbrains.com/zh-cn/pycharm/ | |
| Python 3.10 | Python 软件基金会 | https://www.python.org/ | |
| PyTorch 2.1 | Meta Platforms, Inc. | https://pytorch.org/ | |
| scikit-learn 1.3 | Scikit-learn 开发团队 | https://scikit-learn.org/ | |
| SHAP | https://github.com/slundberg/shap | ||
| 西门子 MAGNETOM Prisma 3.0T 磁共振成像系统 | 西门子医疗 | https://www.siemens-healthineers.cn/magnetic-resonance-imaging/3t-mri-scanner/magnetom-prisma |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可