为了提高从X光片中识别膝关节骨关节炎的能力,本研究提出了一种基于迁移学习的改进型XceptionNet深度学习模型——OsteoXceptionNet。该模型可增强特征提取能力,降低人工解读误差,实现更精确的自动化分类。
研究文章
为了提高从X光片中识别膝关节骨关节炎的能力,本研究提出了一种基于迁移学习的改进型XceptionNet深度学习模型——OsteoXceptionNet。该模型可增强特征提取能力,降低人工解读误差,实现更精确的自动化分类。
膝骨关节炎(KOA)影响全球数以百万计的个体,目前尚无已知的治愈性治疗方法,因此成为一项严峻的全球性健康问题。其疾病进展的管理依赖于早期发现,而X射线成像是基本的诊断技术。然而,由于放射科医生经验水平的差异,人工解读X射线图像会增加结果的变异性及潜在的不准确性。近年来,机器学习与深度学习技术的进步推动了膝关节骨关节炎放射学自动识别系统的开发。但对于早期阶段的检测,进一步提高预测准确性仍然至关重要。通过利用大规模数据集中获取的知识,采用迁移学习可使在较小、特定领域数据集上训练的模型表现更优。由于其网络深度和高效性,XceptionNet特别适用于医学图像解读任务。与以往研究相比,本方法通过采用类别平衡策略、整合定制化的预处理流程,并对XceptionNet引入定制化的结构改进,有效解决了数据集类别不平衡问题,从而提升了早期KOA识别能力。借助这些先进方法,所提出的方法在从膝关节X光影像中准确识别骨关节炎方面展现出良好潜力,达到了97%的预测准确率、97.8%的精确率、97.6%的召回率以及97.6%的F1分数。此外,所构建模型的Cohen's kappa值达到95.94%,表明具有良好的一致性。本研究支持进一步开发可靠、自动化的疾病检测技术,以改善患者预后并促进更高效的医疗服务体系。
膝骨关节炎(KOA)是一种影响全球大量人群的重大公共卫生问题,给患者和医疗机构带来了沉重负担。该疾病中,膝关节的关节软骨逐渐退化。其病因复杂且呈多因素性,包括年龄、肥胖、关节创伤、生物力学因素以及遗传易感性等多种因素的共同作用1。
结构完整性的丧失会导致软骨变薄、开裂并最终发生侵蚀,从而暴露其下方的骨骼。膝骨关节炎(KOA)的症状表现差异较大,且常随时间推移而逐渐加重,从轻微不适发展至难以忍受的疼痛及功能丧失2。膝关节疼痛的主要特征通常在负重运动或长时间活动后加剧。常见体征包括僵硬(尤其在休息期间)、水肿、关节弹响和活动范围减小3。这些症状严重影响日常功能,导致活动受限,并降低患者的生活质量。
本研究验证的假设是:基于自动化深度学习的模型能够达到与专业放射科医生相当的诊断水平,并利用Kellgren-Lawrence分级系统,从影像数据中准确诊断膝骨关节炎(KOA)的严重程度。
本研究的目的源于传统膝骨关节炎诊断与分级方法所固有的局限性。传统上,放射影像学检查,尤其是膝关节X光片分析,被用于评估关节损伤程度。然而,这些影像的目视检查易受主观差异影响,且耗时较长4。深度学习与机器学习(ML)领域的进步为实现膝骨关节炎(KOA)检测与分级的自动化并提高其准确性提供了有前景的途径,从而提供一种更为标准化和高效的方法。这一点在疾病早期尤为关键,因为在疾病进展过程中,早期干预可显著影响患者生活质量的改变。
机器学习方法:最早尝试自动化识别膝骨关节炎(KOA)的方法基于经典机器学习技术。诸如K近邻、支持向量机和决策树等策略依赖于从膝关节X光图像中手工提取的特征。尽管这些方法实现了一定程度的自动化,但手动提取特征的质量和相关性在很大程度上决定了其有效性。这通常导致模型泛化能力差且性能不佳5。
深度学习(DL)方法:卷积神经网络,即深度学习的出现,是该领域的一个重要里程碑。由于其在自动特征提取方面的优势,卷积神经网络(CNNs)在膝骨关节炎(KOA)图像分析中的应用日益广泛。与传统的机器学习技术相比,这些算法在准确性以及直接从图像中识别复杂模式的能力方面均表现出显著提升6,7。
迁移学习(Transfer Learning, TL):该方法使模型在大规模通用数据集上进行预训练后,能够针对需要医学影像分析的任务进行定制化调整,在近期研究中受到广泛关注8。这一方法在医学领域尤为有效,因为该领域通常面临数据量小且高度专业化的数据集。
TL通过从更大规模任务中学习到的通用特征,并将其针对医学图像分析的特定细微之处进行调整,从而凸显了在膝骨关节炎严重程度分类中更优的诊断效果9,10。
近年来,针对利用放射影像进行膝骨关节炎(KOA)识别与分级,已研究了多种自动化技术,尤其是深度学习模型11,12。然而,当前许多模型要么未能充分解决数据集不平衡和可解释性问题,要么在早期阶段的检测准确性不足。本文提出的方法在此框架基础上进行了三项重要改进:对XceptionNet模型进行结构优化以提升特征提取能力,采用类别平衡技术以增强模型可靠性,以及设计定制化的预处理流程以强化膝关节特征。这些改进共同实现了比传统迁移学习方法更精确、更可靠的KOA分类效果。
尽管深度学习(DL)和机器学习(ML)在分析膝骨关节炎(KOA)方面已取得显著进展,但仍面临诸多挑战,主要体现在实现精确分类、提高可解释性以及处理数据不平衡等方面。本研究在先前研究13,14,15,16,17,18,19,20,21,22的基础上,提出了更为全面、透明且公平的评估方法,从而拓展了当前自动化KOA诊断与分级所能达到的边界。表1概述了目前在骨关节炎检测领域所开展的研究分析。
| 研究 | 目标 | 摘要 | |||
| Hu et al.13 | 开发 DeepKOA 模型,利用磁共振(MR)图像预测膝骨关节炎的进展。 | DeepKOA 展现出良好的膝骨关节炎预测能力,凸显了深度学习在临床环境中的潜力,但仍需进一步验证。 | |||
| Guida et al.14 | 通过整合X光、MRI和临床数据,提升骨关节炎严重程度的分类效果。 | 融合模型显著提高了骨关节炎分类的准确性,体现了多模态方法的优势;未来研究应关注其泛化能力。 | |||
| Bensalma et al.15 | 通过多模态分析,识别膝骨关节炎患者中多种因素之间的关联。 | 该研究揭示了膝骨关节炎中多个因素之间的相互关系,为靶向干预和进一步研究提供了方向。 | |||
| Koppold et al.16 | 探讨长期改良禁食对骨关节炎症状的影响。 | 改良禁食在骨关节炎患者中显示出显著的症状改善,表明其作为治疗策略的潜力;但仍需更多研究,尤其是随机对照试验。 | |||
| Jain et al.17 | 提出 OsteoHRNet 模型,用于从X光片评估膝骨关节炎的严重程度。 | OsteoHRNet 在从X光片进行膝骨关节炎严重程度分类方面实现了更高的准确性,显示出其临床应用潜力;建议进一步在更多数据集上验证。 | |||
| Afroze et al.18 | 评估基于机器学习的方法在多种影像模态下检测骨关节炎(OA)的效果。 | 该综述指出了基于机器学习的骨关节炎检测中存在的关键空白,强调需要标准化方法和实证模型。 | |||
| Teoh et al.19 | 开发一种多任务模型,用于从放射影像中实现骨关节炎的详细诊断。 | 多任务模型通过预测个体骨关节炎特征和疼痛强度,提高了诊断准确性,显示出实现精准干预的潜力;鼓励进一步研究以拓展这些发现。 | |||
| Zhang et al.20 | 构建一种用于MRI中膝关节软骨损伤多层级分类的模型。 | 该模型在利用MRI进行膝关节软骨损伤分类方面具有高准确性,显示出作为无创诊断工具的前景;建议进行跨人群的进一步验证。 | |||
| Li et al.21 | 探讨多视角图像和先验信息的影响,以及深度学习模型利用X光片识别和分类膝骨关节炎的能力。 | 深度学习模型成功识别并分类了膝骨关节炎(KOA)的KL分级;此外,先验知识和多视角X光图像提升了分类效果。 | |||
| Ratna et al.22 | 探讨机器学习在膝骨关节炎研究中的应用,以更好地理解疾病进展并实现早期诊断。 | 该研究强调了机器学习在骨关节炎研究中的影响,特别是在早期诊断和疾病发展理解方面,并建议开展更多研究以促进其在临床中的整合。 | |||
表1:膝骨关节炎检测近期研究工作概述。
本研究的主要贡献包括OsteoXceptionNet——一种用于膝关节骨关节炎分级的改进型XceptionNet架构,以及采用专门设计的预处理流程以提高诊断准确性。研究使用骨关节炎倡议(Osteoarthritis Initiative, OAI)数据集进行训练,并采用多种基线模型进行评估。在回顾相关文献之后,本文后续部分将详细介绍数据集及预处理方法。随后概述实验结果并讨论其临床意义,深入探讨所提出的模型架构,最后总结主要发现并提出未来研究方向。
数据集与实验配置
本研究使用的OAI数据集公开可用,包含从多个临床地点长期收集的数千张标注膝关节X光图像。本研究所用的9786张膝关节X光图像代表了五种Kellgren-Lawrence(KL)分级的膝关节骨关节炎:健康(3857张图像)、可疑(1770张)、轻度(2578张)、中度(1286张)和重度(295张)。在预处理阶段,所有图像均使用双线性插值统一缩放至224 × 224像素。在实验设置中,采用所提出的OsteoXceptionNet框架,自动分割膝关节结构,并将其分类至KOA严重程度等级。
为尽可能实现类别平衡,该数据集被划分为训练集(80%)、验证集(10%)和测试集(10%)。尽管该数据集具有实用性,但仍存在若干缺陷,例如类别不平衡,其中严重组(Severe group)的样本数量少于其他组。此外,该数据集仅包含放射影像图像,缺乏磁共振成像(Magnetic Resonance Imaging, MRI)或临床信息等多模态输入,这可能限制其泛化能力。另一个显著的缺点是人口统计学偏差,由于数据主要代表北美人群,限制了其对其他种族群体的适用性。尽管在可行的情况下采用了类别加权损失函数和数据增强方法以减轻这些限制,但在分析模型性能时,这些因素仍需作为关键考虑点。
根据影像学结果,分级方法(如Kellgren-Lawrence(KL)分级系统)将膝骨关节炎(KOA)的严重程度分为五类:0级(正常)、1级(可疑)、2级(轻度)、3级(中度)和4级(重度)23。不同KL分级的影像见图1。

图1:膝关节影像的KL分级。根据放射学结果,膝关节骨关节炎(KOA)的严重程度分为五类:0级(健康)、1级(可疑)、2级(轻度)、3级(中度)和4级(重度)。请点击此处查看该图的放大版本。
访问受限。请登录或开始试用以查看此内容。
本部分介绍了一种综合方法,旨在通过使用改进的XceptionNet模型来提高膝骨关节炎的诊断与分级水平。所提出的方法基于精细的数据预处理、全面的模型架构定制以及强有力的评估技术,所有这些均旨在解决与膝骨关节炎影像相关的复杂问题。在图2中,展示了该模型的流程。

图 2:模型的工作流程。 请点击此处查看此图的放大版本。
数据集描述
本研究所使用的数据集包含来自 OAI 数据集的 9,786 张膝关节 X 射线图像,这些图像已根据 KL 分级方法被分配了 OA 等级。该数据集涵盖了膝关节骨关节炎(KOA)各个阶段的大量样本,对于所提出模型的训练与评估至关重要24。所有图像均采用双线性插值法进行缩放。选择该方法是因为其在计算效率与图像质量保持之间取得了良好平衡,这对于保留膝关节骨关节炎分类所需的关键解剖特征至关重要。数据集中等级分为 0 至 4 级,其中 0 级表示健康膝关节,4 级表示重度骨关节炎。该分级体系提供了疾病进展的复杂谱系,使模型能够学习各阶段之间细微差异。
此外,该数据集被划分为测试集、验证集和训练集。这种划分对于评估模型性能以及确保模型能够有效泛化而不对训练集过拟合至关重要。测试集用于对最终模型的效果进行客观评估,同时也用于调整模型的权重。此外,验证集有助于在训练过程中对超参数进行微调以及评估模型表现。表2提供了数据分布的简要概述,图3则对相同内容进行了可视化展示。
| 类别 | 自动测试 | 测试 | 训练 | 验证 |
| 0 | 604 | 639 | 2286 | 328 |
| 1 | 275 | 296 | 1046 | 153 |
| 2 | 403 | 447 | 1516 | 212 |
| 3 | 200 | 223 | 757 | 106 |
| 4 | 44 | 51 | 173 | 27 |
表2:数据集简要说明。

图3:数据集分布。 数据集被划分为测试集、验证集和训练集。请点击此处查看此图的放大版本。
数据预处理
此步骤至关重要,旨在通过提高输入数据的质量来提升模型性能。预处理包含以下阶段。
图像缩放:对每张X射线图像应用标准尺寸,以确保整套图像的一致性。此步骤对于模型一致且有效地处理图像至关重要。该过程使用公式1。
新图像尺寸 = 调整大小(原始图像,标准尺寸) (1)
归一化:对图像中的像素值进行标准化处理,使其均值为零、标准差为一。此类归一化可确保输入值处于相似的数值范围内,从而加快模型在训练过程中的收敛速度。该归一化步骤采用公式2实现。
(2)
数据增强:采用数据增强策略以解决数据不足的问题,并提升模型的泛化能力。这些方法包括翻转、缩放、旋转和平移,通过引入有意添加到训练数据集中的新图像来实现。该增强过程的实现使用了公式3。
增强图像 = 应用变换(原始图像) (3)
采用了多种增强技术,以增加训练集的多样性,从而提高模型的鲁棒性并最小化过拟合。训练数据增强包括0.2的剪切范围、0.8到1.2的缩放范围(对应缩放因子为0.2)以及-30°至+30°的随机旋转范围。允许以0.5的概率进行水平和垂直翻转,以增强模型的泛化能力。对于垂直和水平剪切,均采用了0.1的剪切因子,即±10%的形变。
类别平衡:由于数据集可能存在类别不平衡(某些骨关节炎类别的图像数量多于其他类别),因此采用了类别加权算法。为了防止模型偏向更常见的类别,该方法为样本较少的类别分配更大的权重。此过程使用了公式4。权重的确定基于以下数值:健康类:3857,可疑类:1770,轻度类:2578,中度类:1286,重度类:295,以上为总计9786个样本、5个类别的各类别分布情况。
(4)
训练-验证集划分:采用传统的80:20比例将数据集划分为验证集和训练集。对数据进行划分可使模型从训练数据中学习,并定期使用验证集评估其性能。这有助于识别过拟合现象,并评估模型的泛化能力。
数据管道优化:建立了改进的数据管道,以确保模型训练期间高效的数据处理。该管道采用批处理、预取和并行数据提取技术,以减少输入/输出瓶颈并提升计算性能。为提高训练效率和吞吐量,对输入数据管道进行了开发。为保证内存使用和计算负载的均衡,采用了32的批处理大小。为提高数据输入效率,在map函数中使用num_parallel_calls=4,以实现数据加载和预处理的并行化。此外,为最小化I/O延迟,采用了TensorFlow的prefetch(buffer_size=tf.data.AUTOTUNE),以实现预取缓冲区大小的自动调整。这有效地将数据预处理与模型执行过程重叠起来。
在图4中,展示了经过基本预处理后不同类别的若干图像实例。

图4:数据集中的示例。 该图展示了经过基本预处理后不同类别图像的一些实例。请点击此处查看此图的放大版本。
通过这些细致的预处理步骤,数据集被转化为训练改进型XceptionNet模型的坚实基础,为准确可靠的膝骨关节炎检测与分级奠定了基础。
模型架构
基础模型:由 François Chollet 创建的 XceptionNet 模型因其独特设计而脱颖而出,该设计采用深度可分离卷积,在计算效率与模型复杂度之间实现了最佳平衡25。公式 5 被用于实现深度可分离卷积。
深度可分离卷积(x) = 逐点卷积(深度卷积(x)) (5)
这一点对该研究尤为重要,原因有以下几方面。首先,该网络架构以从图像中提取精细且具有层次结构的特征而著称,这在医学图像分析中至关重要,因为细微的特征可能提示疾病的不同阶段。其次,所提出的模型基于XceptionNet架构,该架构在多项图像分类任务中表现出卓越的有效性,旨在实现膝关节骨关节炎的检测与分级26。
所提出的 OsteoXceptionNet 是 XceptionNet 架构的一种定制版本,专门用于从 X 射线图像中自动分类膝关节骨关节炎。重要改进包括增加了三个额外的卷积模块(滤波器数量:512、256 和 128),以增强针对膝关节结构的特征提取能力;此外,在入口、中间和出口流中采用了滤波器尺寸为 3×3 且滤波器数量从 32 到 1024 不等的卷积层。每个卷积层后均接有批归一化和 ReLU 激活函数,并添加了 Dropout 层以最小化过拟合。模型输入采用 224×224 像素的标准尺寸。
精细调整与修改
修改内容:XceptionNet 模型已在多个方面进行了有针对性的修改,以使其适用于膝骨关节炎(KOA)的分级与检测。
微调:解冻预训练的 XceptionNet 模型的顶层,使模型能够学习针对膝关节 X 射线图像的高级特征。模型微调按照公式 6 进行。
(6)
其中,θfine-tuned 表示微调后的参数;θpre-trained 表示预训练参数;λ 为学习率;∇θpre-trainedLoss 表示损失函数相对于预训练参数的梯度。
附加卷积层:在模型的最后阶段引入了附加的卷积层。这些层采用较小的卷积核尺寸,以专注于提取与不同骨关节炎(OA)分级相关的更精细特征。该过程使用公式7实现。
卷积输出 = 卷积(输入, 卷积核) (7)
批归一化:在每个新增的卷积层之后,应用批归一化以稳定学习过程并加快收敛速度。其使用公式 8 进行实现。
(8)
其中
为归一化输出;x 为批归一化层的输入;μ 为输入批次的均值;σ² 为输入批次的方差;ϵ 为用于保证数值稳定性的极小常数。
激活函数:在辅助层中使用ReLU激活函数引入非线性,从而使模型能够捕捉数据中更复杂的结构。ReLU的计算采用公式9。
ReLU(x) = max(0,x) (9)
其中,x 是 ReLU 激活函数的输入。
Dropout:为了防止过拟合,在模型中引入了 Dropout 层,特别是在新增加的层之后,以确保模型在未见过的数据上仍具有良好的泛化能力。该操作通过公式 10 实现。
输出 = 输入 × 掩模 (10)
输出层配置
输出层:原始的 XceptionNet 模型在输出层中采用 Softmax 激活函数,用于多类别分类。在本改进模型中,输出层被定制为表示膝关节骨关节炎的五个等级,即从 0 级到 4 级,对应从健康到重度病变的程度。具体而言,该层包含五个神经元,每个神经元对应一个 OA 等级。本层采用 Softmax 激活函数,生成五个类别上的概率分布,从而使所提出的模型能够预测给定膝关节 X 光图像的相应 OA 等级。该方法使模型输出与临床分级标准直接对应,便于医疗专业人员对模型预测结果进行直观且实用的解读。
XceptionNet 架构经过专门调整——该架构最初在 ImageNet 数据集上进行了预训练——旨在实现本研究的目标,即对膝关节骨关节炎的严重程度进行分类。该模型利用了 ImageNet 预训练权重,从而借助大规模且多样化数据集中学到的特征,为其提供了坚实的基础。为了将基础 XceptionNet 模型定制化用于本研究,添加了多个新层。
首先,将不同数量滤波器和卷积核尺寸的二维卷积层进行组合,每个卷积层均通过ReLU激活函数和批归一化引入非线性。这些额外的层旨在捕捉并增强与膝关节骨关节炎严重程度相关的特征。随后,通过添加全局平均池化二维(GAP)层,模型进入最终的分类阶段,该层在保留重要数据的同时压缩特征图。具体而言,GAP操作通过将每个特征图的空间维度缩减为单个值而保持其深度不变,从而实现降维并最小化数据损失,例如将特征图尺寸从7 × 7 × 1024缩减至1 × 1 × 1024。GAP层的输出被送入Softmax激活函数,该函数通过将logits转换为概率实现多类分类。公式11、12、13、14、15、16和17分别用于全局平均池化、Softmax激活、特征图计算、学习率降低、模型编译、类别权重调整和多类分类损失。
(11)
其中,xi,j 表示特征图第 i 行第 j 列的激活值;H 为特征图的高度;W 为特征图的宽度。
(12)
其中,xi 是类别 i 的 Softmax 函数输入;n 为类别数量。
特征图 = σ(卷积(输入, 卷积核) + 偏置) (13)
其中,卷积(Convolution)为卷积操作;i 为激活函数;Input 为输入至该层的输入张量;Kernel 为卷积核;Bias 为偏置项。
新学习率 = 学习率 × 因子 (14)
模型 = 编译(架构,损失函数,优化器,评估指标) (15)
(16)
其中,Weightclass 表示分配给某一类的权重;Total Samples 为数据集的样本总数;Number_of_Classes 为数据集中不同类别的数量;Sample in Class 为某一特定类别中的样本数量。
(17)
其中,yi 是类别 i 的实际概率分布;pi 是类别 i 的概率分布预测值;N 为类别数量。
最后,该模型采用了改进的XceptionNet架构并添加了自定义层,经过编译后可用于预测每个类别的概率。通过这些改进,旨在提升模型对不同严重程度膝骨关节炎相关细微特征的识别能力,从而增强其在特定分类任务中的性能。
为实现稳定且有效的收敛,采用 Adam 优化器训练模型,学习率为 0.0001,dropout 率设为 0.5 以最小化过拟合。为限制模型复杂度并提升泛化能力,同时采用了 L1 和 L2 正则化策略。对于具有整数标签的多分类问题,稀疏分类交叉熵(Sparse Categorical Crossentropy)是适用的损失函数。训练共进行 50 个轮次(epochs)。Softmax 作为最终的激活函数,用于生成类别概率分布。此外,训练时采用 64 的步长(step size)。
训练:训练过程是一个非常重要的阶段。在此阶段,改进的XceptionNet模型学习在放射影像中准确检测和分级膝骨关节炎(KOA)。采用Keras 2.6.0版本和TensorFlow后端2.6.0版本实现XceptionNet模型。以下是训练阶段关键组件的详细信息,包括损失函数、优化器、回调函数、批量大小和训练轮数。
损失函数:对于多分类任务,采用分类交叉熵(categorical cross_entropy)。该损失函数特别适用于每个样本应被分配到一组类别中且仅属于一个标签的问题27。它通过生成介于0和1之间的概率得分来评估模型的性能。由于当预测概率与真实标签不一致时,该损失值会增大,因此被用作有效训练本模型以准确预测膝骨关节炎(KOA)严重程度的指标。
优化器:采用 Adam 优化器,该优化器以其高效性及动态学习率特性而著称。Adam 融合了 AdaGrad 和 RMSProp 算法的优点,提供了一种能够有效处理噪声环境下稀疏梯度问题的优化算法28。
Adam 优化器的关键参数
学习率:采用 0.0001 的学习率,使优化器在初始阶段能够对权重进行较大幅度的调整,从而优化学习过程。
Beta1 和 Beta2:这两个参数分别用于调节平方梯度和先前梯度移动平均值的衰减速率。默认值采用 beta1 为 0.9,beta2 为 0.999。
Epsilon:该参数用于防止实现过程中出现除以零的情况,设为一个接近零的很小的数值。
回调函数:在训练过程中使用回调函数来监控模型性能并进行调整。所采用的回调函数如下:
早停法:用于监控模型的验证损失,并在损失在预定义的训练轮数(称为“耐心值”)内不再下降时停止训练过程。当验证数据不再显示模型性能的提升时,训练过程将被终止,从而有助于防止过拟合。
降低 Plateau 上的学习率:该回调函数在验证损失不再改善时降低学习率,从而实现对权重更精细的调整,有可能提升模型的整体性能29。
模型检查点:该回调函数以特定时间间隔保存模型,以便在训练过程结束后能够获取模型的最佳版本。通常,它会监控验证准确率或损失,并在检测到性能提升时保存模型权重。
批量大小与训练轮数:
批量大小:32 是常用的批量大小,用于平衡模型收敛稳定性与计算效率的需求。批量大小为 32 可在充分利用计算优化的同时,仍保持足够小,以提供稳定的梯度估计。
训练轮数:模型设置最多训练 50 轮,但如果触发了 EarlyStopping 回调函数,训练可能会提前停止。50 轮的设置为权重调整和模型收敛提供了足够的迭代次数,而 EarlyStopping 可确保训练不会不必要地持续进行。
通过仔细设置这些参数并利用回调函数,优化了训练过程,以确保模型能够有效学习并对未见数据具有良好的泛化能力。为了保证所有类别在模型预测中得到公平且准确的表示,采用了多种方法来解决数据不平衡问题。首先,为弥补某些类别样本不足的问题,在整个训练阶段使用了类别加权方法,对样本数量较少的类别赋予更大的权重。为进一步减轻训练过程中类别不平衡的影响,还使用了 Keras 的 ImageDataGenerator,以确保每个批次中模型都能接触到多样化的类别30。
评估指标
在评估所开发模型的有效性时,使用了多种参数,如下所述。
准确率(ACC):该统计量用于衡量准确预测的观测值占所有观测值的比例。当目标类别分布均匀时,该指标较为适用。其计算基于公式18。
(18)
精确率(PR):模型的精确率用于衡量其在所有预期阳性样本中正确识别阳性病例的能力。在假阳性率较高时,该指标尤为重要。其计算基于公式19。
(19)
召回率(R):召回率也称为灵敏度,用于量化正确检测出的真阳性样本所占的百分比。在忽略阳性样本可能带来严重后果的情况下,该指标尤为重要。其计算方法见公式20。
(20)
F1分数:它是精确率(PR)与召回率(R)的调和平均数,在类别分布不均的情况下能够提供较为公正的评估。其计算涉及公式21。
(21)
ROC AUC:受试者工作特征曲线下面积(ROC AUC)用于量化模型区分不同类别能力的指标。较高的AUC值表示模型性能更优。其计算基于公式22。
(22)
Cohen's Kappa (CK):该指标用于评估两名评估者将 N 个样本划分为 C 个互斥类别时的一致性。与准确率相比,它在处理类别不平衡问题时具有更强的稳健性。其计算过程涉及公式 23。
(23)
指标平均绝对误差(MAE)、均方根误差(RMSE)和均方误差(MSE):尽管这些参数通常用于回归任务,但在分类场景中,特别是有序分类中,它们也能提供有价值的参考信息。它们用于计算真实值与预测值之间的差异。这些指标分别通过公式24、25和26进行计算。
(24)
(25)
(26)
F2 分数:F2 分数更重视召回率而非精确率,这在忽略阳性预测所造成的代价高于产生假阳性时的场景中具有重要价值。其计算涉及公式 27。
(27)
精确率与召回率曲线:该图表展示了在不同水平下召回率与精确率之间的平衡关系。曲线下面积越大,表示召回率和精确率的水平越高。
选择上述参数是为了全面评估模型在所有维度上的性能,特别是在数据集存在不平衡以及准确识别不同等级膝骨关节炎具有重要意义的背景下。
访问受限。请登录或开始试用以查看此内容。
在模型验证阶段,采取了多项重要措施,以确保其能够泛化到尚未观测到的数据。首先,将数据集划分为训练集和验证集。这是评估模型在未参与训练的数据集上性能的常用方法。通过为训练和验证提供独立的数据集,这种划分方式避免了过拟合,并实现了对模型效能的全面评估。
采用数据增强方法进一步改进训练并防止过拟合。这些方法通过对训练数据进行增强,向图像中添加旋转、平移和翻转操作。通过扩展训练数据的多样性,模型能够更好地泛化输入数据中的变异情况,即使这些变异在原始数据中并不明显。在训练过程中,使用模型检查点定期保存模型权重。通过该方法,可根据验证准确率确定性能最优的模型,确保最终模型持续保持最佳性能。
除了使用模型检查点外,还采用了早停准则,以便在模型在验证数据上的性能不再提升时终止训练。通过在理想点停止训练过程(此时继续迭代不会带来明显的性能提升),可避免过拟合。降低学习率是训练过程中另一项关键策略。当预设的验证集指标(如验证损失或准确率)停止改善时,学习率会相应降低。这种自适应调整使模型在训练过程中能够进行更精确的参数更新,可能有助于跳出局部极小...
访问受限。请登录或开始试用以查看此内容。
该研究提出了一种基于深度学习的自动化方法,用于利用X射线图像对膝骨关节炎(KOA)进行分级。该模型采用XceptionNet架构,在多种评估指标下表现出显著的鲁棒性和准确性,表明其在临床环境中具有应用潜力。
除了当前的方法之外,还可利用外部数据集验证来进一步证实假设,并评估模型在不同成像条件和人口统计学数据下的泛化能力。通过前瞻性研究,可以评估该模型在临床实时操作中的有效性,从而为其适用性提供有价值的信息40,41。此外,可通过消融实验确定预处理和模型流程中各个组成部分的具体贡献。通过整合多模态数据(如放射影像)以及临床或人口统计学数据,可能提高预测准确性,并提供更全面的评估。最后,为进一步验证所提出方法的稳健性,采用集成学习策略或传统机器学习分类器(如支持向量机SVM或随机森林Random Forest)进行比较分析,可能是有效的技术手段。
研究的意义
临床应用价...
访问受限。请登录或开始试用以查看此内容。
作者声明,本论文的发表不存在任何利益冲突。本研究、研究结果或结论未受到任何财务或个人关系的影响。
本研究未从公共、商业或非营利机构的任何资助组织获得特定资助。
作者贡献:
概念化,SHK;方法论,SHK;软件,SHK;验证,SMB;数据管理,SHK;资源,SHK;撰写-原始稿件准备,SHK;撰写-审阅与修改,SHK;可视化,SMB;监督,SMB;项目管理,SMB。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Jupyter Notebook/Colab | Project Jupyter / Google | N/A | 用于交互式地开发和试验模型。 |
| Matplotlib(版本:3.4.3)& Seaborn(版本:0.11.2) | 社区 | N/A | 用于数据可视化和结果绘图。 |
| Mendeley/Kaggle 数据集 | Elsevier;社区 | N/A | 数据集来源:膝关节骨关节炎严重程度分级数据集 |
| OpenCV(版本:4.5.5) | Intel | N/A | 用于X射线图像的预处理(调整大小、CLAHE、高斯滤波)。 |
| Python(版本:3.8) | Python软件基金会 | N/A | 用于模型开发的编程语言。 |
| scikit-learn(版本:1.0.2) | 社区 | N/A | 用于数据划分、性能评估指标以及基本的机器学习工具。 |
| TensorFlow/Keras | Google/社区 | N/A | 用于实现和训练基于XceptionNet的深度学习模型。TensorFlow版本:2.6.0,RRID:SCR_018932。Keras版本:2.6.0,RRID:SCR_018961 |
| Ubuntu操作系统 | Canonical | N/A | 用于与所有软件工具兼容的操作系统。推荐版本:20.04。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可