本研究介绍了一种基于深度学习的工作流程,利用预处理的眼底图像和优化的卷积神经网络架构实现糖尿病视网膜病变的早期检测,能够准确进行疾病分类,并提供可解释的病灶定位,适用于可扩展的临床应用。
方法文章
本研究介绍了一种基于深度学习的工作流程,利用预处理的眼底图像和优化的卷积神经网络架构实现糖尿病视网膜病变的早期检测,能够准确进行疾病分类,并提供可解释的病灶定位,适用于可扩展的临床应用。
糖尿病视网膜病变(DR)是全球范围内视力丧失的主要原因之一,尤其在血糖控制不佳的糖尿病患者中更为显著。通过自动化图像分析实现早期检测,已成为支持及时干预的一种可扩展解决方案。基于深度学习的模型,特别是卷积神经网络(CNN),在利用眼底图像进行DR检测方面已展现出巨大潜力。本研究旨在:(i)开发一种基于EfficientNetB0和DenseNet121的集成深度学习框架,用于五阶段DR分类;(ii)系统评估眼底图像预处理对诊断性能的影响;(iii)引入基于Grad-CAM的可视化解释以实现病灶定位;(iv)在保证计算效率的同时实现高诊断准确率,以适用于大规模筛查。研究整合了一个包含53,412张眼底图像的数据集,来源包括EyePACS、APTOS 2019以及中国 一家三级医疗中心。预处理步骤包括限制对比度自适应直方图均衡化(CLAHE)、伪影去除和归一化处理。采用迁移学习方法,以EfficientNetB0和DenseNet121为骨干网络,随后进行混合集成。模型评估指标包括准确率、宏平均AUC(macro-AUC)、敏感性、特异性和F1分数。使用Grad-CAM可视化病灶定位情况。该混合集成模型达到了91.2%的准确率、0.961的宏平均AUC、92.1%的敏感性以及0.913的F1分数。预处理使模型性能提升了3%-4%,而集成方法的表现优于单一CNN模型。Grad-CAM叠加图证实了病灶定位的准确性。模型性能同时在五阶段DR分级和二分类可转诊DR检测任务中进行了评估,以反映临床筛查的实际需求。本研究提出了一种具有临床可行性且具备可解释性的深度学习DR检测模型。未来的工作将包括在独立数据集上的外部验证、前瞻性真实世界评估,以及针对移动设备和即时检测筛查应用的模型优化(如剪枝和量化)。
糖尿病视网膜病变(DR)是糖尿病的一种微血管并发症,至今仍是全球可避免性视力障碍的主要原因之一1。慢性高血糖会损害视网膜毛细血管,导致血管通透性增加、微动脉瘤形成、出血、渗出,而在晚期阶段则出现新生血管增殖。若不及时干预,这些病变可能进展为玻璃体出血、牵拉性视网膜脱离以及不可逆的视力丧失1,2。流行病学研究估计,约35%的糖尿病患者存在某种程度的DR,其中近10%的患者每年发展为威胁视力的视网膜病变2。全球趋势表明,在过去二十年中,DR的患病率显著上升。一项具有里程碑意义的荟萃分析报告指出,DR的患病率从21世纪初的13.6%上升至2020年的20%以上2。同样,威胁视力的DR和糖尿病性黄斑水肿的发病率也呈上升趋势,尤其在低收入和中等收入地区更为明显3。在农村及经济落后地区,眼科筛查服务获取受限,导致诊断和治疗延误5。
糖尿病视网膜病变(DR)的早期检测至关重要,因为在非增殖期阶段采取干预措施,例如局部或全视网膜激光光凝、玻璃体内抗血管内皮生长因子(anti-VEGF)治疗以及玻璃体切除术,可有效防止病情进展至视力丧失6。然而,传统的筛查项目通常依赖经过培训的专业人员对彩色眼底照片进行人工分级,这一过程资源消耗大,限制了筛查的可扩展性和及时覆盖能力5。远程眼科学项目在一定程度上弥补了这些不足,但仍受限于专家资源的短缺以及标准化成像协议的普及程度7。人工智能(AI)尤其是深度学习(DL)技术的进步,已催生出能够以高准确率和高速度从眼底图像中自动检测和分级DR的解决方案。卷积神经网络(CNN)可提取微动脉瘤、出血和渗出物等层次化特征,在基准数据集上的敏感性和特异性已超过90%8,9。Gulshan et al. 和 Ting et al. 的标志性研究证明,深度学习算法在识别需转诊的DR方面可达到甚至超过专家级水平,为自主筛查系统的监管批准铺平了道路8,9。后续研究进一步探索了迁移学习、集成建模以及混合卷积神经网络-循环神经网络架构,以提升模型在不同成像条件和患者人群中的泛化能力10,11。
尽管这些结果令人鼓舞,但基于深度学习的糖尿病视网膜病变(DR)筛查在临床转化方面仍面临若干挑战。首先,实现稳健的模型性能需要大规模、标注良好的数据集,以涵盖成像设备、种族差异和疾病表现形式的多样性12。不同标注人员之间的标注不一致性进一步增加了模型训练与评估的复杂性。其次,图像预处理步骤(如通过CLAHE进行对比度增强、去噪和颜色归一化)会显著影响细微病灶的可见性,从而影响特征提取的可靠性13。第三,模型的可解释性仍是当前研究的热点;临床医生需要具备透明决策支持功能的工具,能够突出显示驱动算法预测的关键图像区域14。最后,尚需建立监管框架并开展成本效益分析,以指导人工智能工具在现有筛查路径中的整合,尤其是在资源有限的环境中15。本研究提出了一种综合性的深度学习框架,用于早期DR检测,该框架整合了优化的眼底图像预处理、最先进的卷积神经网络(CNN)架构以及迁移学习策略,以应对上述挑战。我们采用CLAHE和自动伪影去除方法来增强病灶对比度,随后对预训练的CNN主干网络进行微调,以利用大规模自然图像中的特征。因此,本研究提出了一种可解释的深度学习框架,用于早期DR检测,该框架将优化的眼底图像预处理与高效的集成CNN架构相结合(图1)。本研究的主要贡献包括对预处理策略的系统性评估、计算高效的混合集成模型的设计,以及引入视觉可解释性以支持临床解读。通过同时解决准确性、透明性和可部署性问题,本研究旨在推动人工智能辅助DR筛查的实际应用。DR根据临床标准分为五个阶段:无DR、轻度、中度、重度非增殖性DR和增殖性DR。早期阶段以微动脉瘤和轻度出血为特征,而晚期阶段则表现为广泛的血管损伤、新生血管形成以及视力丧失的风险。患者在疾病晚期之前通常无明显症状,因此自动化筛查对于早期干预至关重要。

图1:本文所述工作的图示 请点击此处查看此图的放大版本。
为应对这些挑战,本研究提出了一种用于糖尿病视网膜病变(DR)检测的结构化深度学习方案,该方案在一个统一的工作流程中整合了标准化的眼底图像预处理、优化的卷积神经网络训练以及可解释的模型输出。该方案通过明确描述预处理策略、模型架构和训练配置,旨在提高研究的可重复性和方法学透明度。通过强调计算高效的轻量级集成模型,并引入基于Grad-CAM的可视化解释,所提出的方法构建了一个实用且可解释的框架,可用于在异质性、多中心的视网膜影像数据集上进行一致性的评估。
访问受限。请登录或开始试用以查看此内容。
本研究涉及一项回顾性分析。根据机构和国家规定,由于未获取或使用任何可识别的患者信息,正式的伦理委员会批准和知情同意被豁免。
1. 数据来源与获取

图 2:显示糖尿病视网膜病变不同阶段的代表性彩色眼底照片。 请点击此处查看该图的放大版本。
2. 预处理(CLAHE、归一化、伪影去除)
3. 模型架构(CNN 变体,优化的层级)
4. 模型训练与优化(迁移学习、超参数)
5. 评估指标与验证(AUC、准确率、灵敏度/特异度)
访问受限。请登录或开始试用以查看此内容。
数据集概述与预处理影响
经过整理的数据集包含53,412张彩色眼底图像,分布于五类糖尿病视网膜病变(DR)严重程度:无DR(0)占39.2%,轻度(1)占18.4%,中度(2)占22.5%,重度(3)占12.1%,增殖性DR(4)占7.8%。数据来源于EyePACS、APTOS 2019以及一家中国三级眼科中心,确保了种族、成像条件和相机规格的多样性。
预处理显著增强了病灶的可见性。在绿色通道上应用对比度受限自适应直方均衡化(CLAHE)提高了局部对比度,特别是对微动脉瘤和出血的显示效果更佳。通过掩膜和阈值分割进行背景伪影去除,成功消除了超过94%的黑色边框和光照晕影。归一化处理实现了不同数据集间一致的像素强度分布,降低了设备间的差异性。
通过翻转、旋转、缩放以及亮度/对比度抖动,数据增强将训练集规模扩大了3.5倍。这一步骤对于提升模型的泛化能力并在训练过程中减少过拟合至关重要。
访问受限。请登录或开始试用以查看此内容。
在本研究中,我们开发并严格评估了一种结合 EfficientNetB0 与 DenseNet121 的混合集成模型,该模型通过迁移学习进行微调,并结合经典预处理步骤(CLAHE、伪影去除和强度归一化),用于五类糖尿病视网膜病变(DR)分级。该集成模型表现出卓越的性能:在可转诊 DR 检测中,准确率达到 91.2%,宏平均 AUC 为 0.961,F₁ 分数为 0.913,敏感度为 92.1%(见第6节)。这些指标显著优于基线 CNN 模型(准确率约 83.4%,宏平均 AUC 约 0.88)以及单独使用的 ResNet50、EfficientNetB0 和 DenseNet121 等骨干模型。我们的结果与 Gulshan 的标志性研究相比具有优势。 等 在 JAMA,该研究在 EyePACS 和 Messidor-2 数据集上使用基于超过 128,000 张图像训练的十个 InceptionV3 架构卷积神经网络集成模型进行可 referral 糖尿病视网膜病变检测,报告 AUC ≈ 0.99,灵敏度和特异性达到人类水平16尽管我们的混合模型尚未达到这种...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何经济利益冲突。
本工作由2024年温州市基础研究项目资助(项目编号:Y20240360)。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 眼底相机(Topcon,Canon,Zeiss) | 拓普康 / 佳能 / 蔡司 | 用于在不同照明条件下拍摄高分辨率彩色眼底照片 | |
| NVIDIA Tesla V100 GPU | NVIDIA 公司 | Tesla V100 | 32 GB VRAM;用于训练深度学习模型 |
| Python(OpenCV、imgaug 库) | 开源社区 | 图像预处理,包括CLAHE、伪影去除、归一化、数据增强 | |
| TensorFlow 2.10 + Keras | 谷歌大脑 | 用于卷积神经网络模型构建与训练的深度学习框架 | |
| EfficientNetB0 &和使用预训练骨干网络的 DenseNet121 | 开源(TensorFlow/Keras Applications) | 用于糖尿病视网膜病变分类的基于ImageNet预训练的迁移学习骨干网络 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可