本研究提出了一种基于深度学习的流程,用于通过条件生成对抗网络(cGAN)预处理、分割、图卷积网络(GCN)、自适应空间特征优化(ASFO)和Transformer建模,从术中显微镜视频中预测手术风险。该方法在CaDIS和SICS-105数据集上实现了高性能,但由于标签为间接标注,临床有效性受到一定限制。
研究文章
本研究提出了一种基于深度学习的流程,用于通过条件生成对抗网络(cGAN)预处理、分割、图卷积网络(GCN)、自适应空间特征优化(ASFO)和Transformer建模,从术中显微镜视频中预测手术风险。该方法在CaDIS和SICS-105数据集上实现了高性能,但由于标签为间接标注,临床有效性受到一定限制。
玻璃体切除术后的并发症仍然是手术中面临的重要挑战,常导致视力预后不良和需要重复干预。本研究提出了一种基于深度学习的框架,通过从术中显微镜视频中提取时空特征来预测手术风险。在预处理阶段,采用包括运动稳定、光照归一化以及基于条件生成对抗网络(cGAN)的伪影抑制在内的视频增强技术,以提高输入质量。采用轮廓自适应分割方法界定相关手术区域,随后利用图卷积网络进行结构感知的特征提取。集成自适应向日葵优化算法以优化特征选择,并采用基于Transformer的模型捕捉时间依赖性,实现最终的风险预测。该框架在两个公开数据集CaDIS和SICS-105上进行了评估。在CaDIS数据集上,模型达到了98.9%的准确率、97.5%的精确率、98.2%的召回率、97.9%的F1分数以及98.1%的AUC值。此外,分割模块实现了98.9%的像素准确率、98.5%的类别平均准确率和96.6%的平均交并比(mIoU)。在SICS-105数据集上,模型达到了99.1%的准确率、98.5%的F1分数、98.7%的灵敏度、98.7%的特异度以及99.10%的ROC曲线下面积(AUC)。这些结果表明,与基线模型相比具有持续的性能提升。总体而言,结合GAN增强的预处理、基于图的特征学习、优化策略与Transformer建模,显著提高了预测的可靠性。该方法凸显了术中视频分析在实现实时临床决策支持和改进术后风险分层方面的潜力。
玻璃体切除术(pars plana vitrectomy, PPV)是治疗多种玻璃体视网膜疾病(包括视网膜脱离、糖尿病性视网膜病变、黄斑裂孔和玻璃体积血)外科手术的基础1。尽管手术器械和可视化技术不断进步,术后并发症仍是重要的致病因素,其后果从轻微的视觉干扰到威胁视力的事件不等,例如复发性视网膜脱离、眼内炎或无法控制的眼内压2。在临床实践中,识别具有较高并发症风险的患者仍是一项尚未满足的重要需求,因为这有助于制定更科学的手术计划、实施个体化的术后护理以及及时干预3。传统上,PPV的风险评估依赖于静态的术前因素(如合并症和术前眼部状况)以及术者主观的术中判断4,5,6,7。此外,近年来的玻璃体切除手术通常以高分辨率手术显微镜视频形式被广泛记录,这些视频提供了丰富但尚未充分利用的数据来源。这些录像不仅捕捉了解剖和病理特征,还记录了术者与组织的相互作用、术中事件以及手术操作动作,而这些信息可能对后续并发症具有预测价值8,9,10,11。
深度学习在眼科多个领域均表现出卓越的性能,包括眼底图像分类、手术技能自动化评估以及光学相干断层扫描(OCT)分析12。此外,一些研究已系统性地利用术中视频数据来预测术后结果。手术视频具有时空特性,带来了独特的挑战:高维数据、不同外科医生之间的差异性、时间依赖性、患者解剖结构以及医疗器械的影响13,14,15,16。然而,要实现临床领域的有效整合,不仅需要准确或精确的预测,还需具备在不同手术场景下实时运行的鲁棒性、可解释性及泛化能力17。
在眼科和外科数据科学领域18,机器学习(ML)和深度学习(DL)近年来变得非常流行。其应用包括预后预测、手术技能评估和诊断成像19。基于深度学习的术中手术情境理解框架已在多项研究中得到探索。例如,Nespolo20提出了一种用于玻璃体视网膜手术中组织与器械语义解析的深度学习流程,展示了跨任务的通用性。为进一步实现客观的性能评估,该方法被进一步扩展,以提取有关手术技术及器械–组织相互作用的全面数据。类似地,Nespolo 等人21通过开发一种利用术中显微镜图像和实例分割网络(YOLACT++)的实时检测与分割模型,验证了手术引导的可行性。
此外,人工智能驱动的方法已被认为是改进工作流程、培训及手术评估的有用工具22,23这些技术能够实现相位分割、实时器械追踪,并提高眼科显微手术的安全性。Mueller 等人进行的一项系统综述进一步证明了机器学习(ML)在术中手术录像分析中日益广泛的应用。23,这也凸显了当前在临床转化和可靠性方面存在的问题。已有若干研究采用深度学习模型结合影像学与临床数据来预测术后结果。例如,基于光学相干断层扫描(OCT)和临床特征的模型已被用于预测特发性黄斑前膜病例的视力预后24,类似方法已在多中心数据集中显示出预测黄斑裂孔患者术后预后的有效性25其他研究则聚焦于利用多模态深度学习框架评估增殖性玻璃体视网膜病变的严重程度26,以及利用超广角成像预测视网膜脱离的复发。27此外,通过整合人口统计学、临床和手术变量的机器学习模型,已用于预测玻璃体视网膜疾病的视觉预后及潜在病因。28,29,30.
尽管已有这些进展,目前大多数方法对术中动态关注较少,主要依赖术前数据或静态的术后影像。尽管一些研究利用手术视频分析进行分割和评估20,21,22,23,但并未直接整合时空性的术中数据以预测并发症发生概率。因此,在利用术中显微视频数据进行预测建模方面仍存在显著空白。为了建立精确且具有临床意义的术后玻璃体切除术并发症预测框架,必须填补这一空白。
本研究提出了一种新颖的多模态深度学习框架,该框架将从术中玻璃体切除手术视频中提取的时空特征与结构化临床元数据相结合,用于预测术后并发症的风险。通过采用先进的视频编码器(如卷积架构和基于变换器的架构)以及元数据融合策略18,该方案旨在识别高风险的术中事件,提供校准后的并发症概率,并为医生生成可解释的可视化结果。通过多中心评估、可解释性分析及对比研究,验证了将术中视频作为手术预后预测生物标志物的可行性18。本项目的主要目标是开发一种强大的深度学习框架,利用术中显微镜记录的时空数据来预测玻璃体切除术后的并发症。在预测准确性和泛化能力方面,所提出的集成方法结合了基于cGAN的预处理、基于GCN的特征提取、基于ASFO的优化以及基于变换器的建模,预期将优于现有方法。
本研究高效利用术中显微镜视频,提出一种用于预测术后玻璃体切除并发症的综合性深度学习框架。与当前主要依赖静态成像模式或术前临床数据的方法不同,本方法以一种新颖的方式将先进的机器学习技术与时空视频分析相结合。具体而言,该方法采用图卷积网络(GCNs)捕捉手术场景中的结构与关系信息,利用轮廓自适应分割(CAS)实现精确的区域划分,并通过基于条件生成对抗网络(cGAN)的视频增强模块抑制伪影。此外,为提升模型的收敛性与判别能力,引入自适应向日葵优化(ASFO)算法,在特征选择过程中平衡探索与开发。最后,采用基于Transformer的架构结合时空注意力池化机制,对手术序列中的时间动态特征进行建模。相较于现有流程,本方法在预处理、分割、基于图的特征学习、优化及注意力驱动预测方面的全面整合,实现了更精确、可靠且具有临床意义的风险预测。本研究采用CaDIS和SICS-105数据集作为替代性视觉数据集,用于学习术中时空特征,尽管这两个数据集的主要用途是白内障手术分析。研究并未使用明确标注的并发症标签,而是利用这些特征来建模并推断术后玻璃体切除并发症的风险。
访问受限。请登录或开始试用以查看此内容。
本研究使用的 CaDIS 和 SICS-105 数据集为公开数据集,最初在获得机构审查委员会批准并取得知情同意后收集,相关信息见于各自发表的文献。本研究仅对完全匿名化的数据进行二次分析,因此无需额外的伦理审批或知情同意。
该建议的模型旨在通过利用术中显微镜视频中的时空模式来预测术后玻璃体切除术并发症。该流程包括四个主要阶段:预处理、分割、特征提取、特征优化和分类,如图1所示。
术中对术后并发症风险的评估是本研究的预测目标。由于CaDIS和SICS-105数据集缺乏纵向随访数据,该模型无法预测特定时间窗口内经临床确认的术后事件。相反,它利用术中手术模式来推断可能出现问题的概率。在此背景下,“"并发症"的操作性定义包括异常的手术阶段转换、异常的器械-组织交互以及与更高手术复杂性相关的手术流程变异。为确保可解释性和可靠评估,该预测任务被设计为一个二分类问题,将病例分为低风险和高风险两组。这种设计使所提出的框架并非作为直接的临床诊断系统,而是作为术中决策支持工具发挥作用。
数据集描述:
该模型在两个数据集上进行了评估:数据集A(CaDIS,用于图像分割的白内障数据集)和SICS-105(小切口白内障手术)数据集。
(i)CaDIS31:该数据集专为白内障手术视频中的分割任务而开发,旨在补充公开可用的CATARACTS挑战数据集,从而推动用于手术视频分析的深度学习(DL)方案的发展。该数据集包含25个视频记录,共4,670个带注释的帧,涵盖白内障手术的多个阶段(补充图1)。每一帧均经过细致标注,提供训练和评估分割方案所需的像素级标签。该数据集可作为评估深度学习模型在手术视频上性能的基准。
(ii)SICS-105(小切口白内障手术)数据集32:该数据集包含由外科医生在2023–2024年期间6个月内完成的105例手术录像,由四名眼科医生进行标注,涵盖20个手术阶段(补充图2)。视频总时长为22小时39分钟,分辨率为1920 × 1080像素(下采样至960 × 540),帧率为30 fps。平均每段视频长度为12分钟57秒(σ=4:31分钟)。该数据集已公开发布于Zenodo数据库,网址为:https://doi.org/10.5281/zenodo.13847781。代表性输入样本见补充图1和补充图2。尽管CaDIS和SICS-105数据集最初是为白内障手术中的手术阶段识别与分割而设计,但其关于术后玻璃体切除并发症的信息有限。为弥补术后玻璃体切除并发症信息的不足,我们提出了一组基于视频序列中术中视觉模式和事件的风险代理标签。数据集中的帧和视频序列根据临床理解启发的一系列启发式规则,标注了三个层级的风险信息(低、中、高),包括器械-组织交互复杂性、手术时长异常、阻塞、不稳定以及异常运动等。所提出的框架并未使用临床结局作为标签,而是将其作为潜在术后并发症风险信息的代理标签。
使用条件生成对抗网络方法进行预处理
通常,原始帧会因光照变化、模糊和镜面伪影而质量下降。为解决这一问题,采用条件生成对抗网络(cGAN)对视频进行增强。原始帧是指直接从术中显微镜视频记录中提取的未经处理的原始图像帧,在任何增强或归一化操作之前获取。这些帧通常包含诸如光照变化、运动模糊、镜面反射以及由手术器械和相机移动引起的噪声等伪影。生成器负责恢复清晰的帧,而判别器则确保生成结果的视觉真实性。该方法通过整合像素重建损失、对抗损失和时间一致性损失的目标函数,确保生成无伪影且稳定的视频序列,以便后续分析。
在时间步 t 的退化帧 It 作为生成器的输入,而增强后的帧 Yt = G(It) 为其输出。在给定输入 It 的条件下,判别器被训练以区分生成的输出与真实清晰帧 Yt。训练目标结合了多个损失函数以确保高质量的重建效果:(i)对抗损失,用于增强生成结果的真实性;(ii)像素级重建损失(L1 损失),用于保持强度保真度;(iii)感知损失,利用深度特征表示来维持结构一致性;(iv)时间一致性损失,用于确保连续帧之间的平滑过渡并防止闪烁伪影。
为了确保特征提取的高质量输入,术中显微镜视频首先通过条件生成对抗网络(cGAN)进行增强。每个原始帧It*被视为一个干净帧的退化观测结果。生成器G学习一种映射 G(It) = It,以恢复增强后的帧,而判别器D则用于区分真实样本与生成样本。训练目标结合了对抗损失 Ladv、感知损失 Lperc 、基于像素的重建损失Ll1以及时间一致性损失Ltemp。该模型在抑制模糊、镜面伪影和噪声的同时,保持了时间与结构上的连贯性,从而为后续分析提供稳定且无伪影的视频序列。生成对抗网络(GAN)的数学表达式见《补充文件1》中的公式[1-6]。
使用轮廓自适应分割(CAS)进行分割
在此,分割通过一种轮廓自适应分割模型实现。该模型为显微镜图像中受影响的玻璃体切除图像定义了初步的分割轮廓,从而降低能量函数,如补充文件1中公式[7-12]所示。较低的能量值可确保对高风险区域进行精确表征和局部评估。这反过来实现了对受影响区域的精确分割,进而为后续章节中的特征提取提供了便利。
使用动态时空图卷积网络(dGCN)进行特征提取
预处理阶段完成后,下一步是提取具有区分性的时空特征。为此,采用图卷积网络(GCN),因为它能够有效捕捉结构化依赖关系。所采用的模型由堆叠的GCN层构成,并引入非线性激活函数,通过归一化机制缓解过拟合问题并解决梯度消失问题。GCN的公式基于图卷积的一阶谱近似,适用于大规模半监督学习任务。此外,其线性化表示简化了优化过程,从而确保参数学习的有效性。简化版GCN的操作在补充文件1的公式[13–15]中给出。实际应用中,GCN能够高效地从术中视频数据中提取更高层次的结构化表征。随后,通过一种辅助优化的特征选择机制,仅保留最相关或最合适的特征,该机制将在下一节中详细描述。
基于自适应向日葵的特征优化(ASFO)进行特征优化
自适应向日葵优化算法(ASFO)是经典向日葵优化方法(SFOA)的改进版本。在所提出的模型中,这一受生物启发的过程通过数学建模,用于处理高维数据集中的特征优化与特征选择。具体而言,该方法旨在提高收敛速度,平衡探索与开发以保持解的多样性,并缓解早熟收敛问题。ASFO 的数学表达式见于补充文件1中的公式[16–21]。该机制在解接近最优时可加速收敛过程。补充文件1中提供了详细的算法描述。在所提出的流程中,ASFO 被用于基于变换器的特征融合之后对特征向量进行优化。所选择的特征包括基于纹理、颜色与强度、形态与结构、运动与时间、高维特征以及注意力加权区域描述符。其目标是最小化特征相关性损失函数,从而通过减少冗余来选择并加权有助于提升分类准确率的特征。
基于 Transformer 的时空注意力池化分类头
采用基于变换器的模型来捕捉手术视频序列中的时间依赖性。该模型配置了多头自注意力机制、位置编码以及全连接层,以实现最终的风险预测。通过ASFO进行超参数优化。集成的流程结合了预处理、特征提取、优化和基于变换器的分类,从而实现精确的手术风险预测。
访问受限。请登录或开始试用以查看此内容。
为了评估所提出模型的有效性,使用真实世界玻璃体切除术数据集进行了大量实验。性能评估涵盖了预处理、特征提取效果以及预测准确率等方面。
性能分析与比较评估
采用准确率、精确率、召回率、F1分数、平均交并比(mIoU)、像素准确率(PA)、类别准确率(PAC)、灵敏度、特异度、受试者工作特征曲线(ROC)和曲线下面积(AUC)等指标,将所提出的 methodology 与基线模型进行了比较。通过真阳性(TP)、真阴性(TN)、假阳性(FP)和假阴性(FN)率来解释分类结果,其中 TP 表示被正确识别的高风险病例,FN 表示被漏诊的高风险病例,这在临床环境中至关重要。
基于 Transformer 的分类头与时空注意力池化——数据集 A 的性能比较
在数据集A上进行了性能评估,并使用多种指标将所提出方法获得的结果与基线技术进行了比较。在三个风险类别(低风险、...
访问受限。请登录或开始试用以查看此内容。
在 CaDIS 和 SICS-105 数据集上的实验评估验证了所提出模型相较于传统方法的鲁棒性与优越性。ResNet-50、LSTM-CNN 以及基于分割的网络(UNet、DeepLabV3+、UPerNet、HRNetV2)等基线模型表现尚可,但受限于术中视频固有的变异性,包括光照变化、遮挡、运动模糊以及器械与组织的交互作用22,23。这些局限性导致在少数类别上准确率下降、召回率偏低以及预测不稳定。通过引入先进的预处理策略(运动稳定化、光照归一化和基于生成对抗网络的伪影抑制),所提出的方案确保了输入数据的一致性与高质量,从而显著减少了后续阶段的误差累积11,12。引入图依赖的时空特征表示方法,能够有效建模手术过程中的动态变化13,14,
访问受限。请登录或开始试用以查看此内容。
作者声明无利益冲突。
作者谨此感谢川北医学院提供的必要机构支持与资源。特别感谢广元市中心医院的临床工作人员在收集术中显微镜视频过程中给予的协助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 高性能工作站 | NVIDIA Corporation, USA | RTX-A6000 | 用于模型训练;配备48 GB显存的GPU,搭载Intel Core i9 CPU和128 GB内存 |
| Python (v3.10) | Python软件基金会 | 开源 | 模型开发与实验的核心编程语言 |
| TensorFlow (v2.15) | Google Research | 开源 | 用于实现cGAN预处理和Transformer分类器的框架 |
| PyTorch (v2.2.0) | Meta AI | 开源 | 用于实现GCN和自适应向日葵优化模块 |
| CUDA Toolkit (v12.1) | NVIDIA Corporation | CUDA-12.1 | 为所有深度学习计算提供GPU加速支持 |
| 条件生成对抗网络(cGAN) | 改编自Pix2Pix框架 | 无 | 用于预处理阶段的视频增强和伪影去除 |
| 光流估计器(RAFT) | Teed & Deng (ECCV 2020) | 无 | 确保预处理过程中帧间的时间一致性 |
| 轮廓自适应分割(CAS)模型 | 自定义实现 | 无 | 改进的主动轮廓模型,用于玻璃体切除术视频中的精确边界分割 |
| 动态图卷积网络(GCN) | 自定义实现(基于Kipf & Welling, 2017) | 无 | 提取视频特征节点之间的时空关系 |
| 自适应向日葵优化算法(ASFO) | 自定义实现 | 无 | 用于优化特征选择和降维 |
| Transformer编码器模型 | 自定义实现(基于Vaswani等, 2017) | 无 | 结合时空注意力池化,用于术后并发症的最终分类 |
| Matplotlib (v3.8) | Python软件基金会 | 开源 | 用于性能指标和图表的可视化 |
| Seaborn (v0.13) | Python软件基金会 | 开源 | 用于高级可视化和统计图形绘制 |
| Adam优化器 | TensorFlow内置 | 无 | 用于模型训练;学习率 = 1e-4,β1=0.9,β2=0.999 |
| 损失函数套件(L_adv, L_l1, L_perc, L_temp, L_G) | 自定义实现 | 无 | 定义GAN训练中的对抗损失、感知损失、像素损失和时间损失 |
| 操作系统 | Ubuntu Linux 22.04 LTS | 无 | 深度学习实验的基础环境 |
| 评估指标包 | scikit-learn (v1.5.0) | 开源 | 用于计算准确率、精确率、召回率、F1分数、AUC和mIoU |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可