本研究提出一种节能的去噪方法,该方法结合图像预处理以提高医学图像质量、降低计算成本,并支持可持续的诊断实践。该方法可提升低剂量和老旧扫描图像的清晰度,从而在减少辐射暴露、能源消耗和电子废弃物的同时,实现远程诊断。
研究文章
本研究提出一种节能的去噪方法,该方法结合图像预处理以提高医学图像质量、降低计算成本,并支持可持续的诊断实践。该方法可提升低剂量和老旧扫描图像的清晰度,从而在减少辐射暴露、能源消耗和电子废弃物的同时,实现远程诊断。
传统的深度学习模型已展现出去噪潜力,但面临计算负载大、能耗高和训练时间长等挑战。本研究提出一种节能型去噪方法,将图像增强与K均值聚类作为预处理技术相结合,以在应用神经网络之前提升输入质量。该方法提出了一种节能去噪流程,在应用卷积自编码器之前,先利用锐化卷积核进行图像增强,并通过K均值聚类实现图像分割。这些预处理步骤使模型能够识别解剖边界并分离受噪声影响的区域,从而提高输入质量并加快训练收敛。预处理可锐化图像关键特征并区分受噪声影响的区域,实现自适应阈值分割,并以更低的计算成本实现更有效的去噪。所提出的模型在公开可用的CT和MRI数据集上进行了评估。性能指标包括峰值信噪比(PSNR)、结构相似性指数(SSIM)和分类准确率。结果表明,PSNR从21.52 dB提升至28.14 dB;SSIM从0.7619提高到0.8690,验证准确率也有所提升。集成的预处理使训练时间减少了约20%,并降低了GPU利用率,从而支持在计算资源受限环境中的可重复性和部署。该方法通过减少辐射暴露、降低重复扫描次数以及延长老旧成像设备的使用寿命,支持可持续的医学成像实践。该流程通过减少辐射暴露、减少重复扫描以及延长传统成像设备的使用寿命,促进可持续医学成像的发展。此外,该方法适用于远程诊断,可增强资源有限环境下的远程医疗工作流程。该方法还支持远程诊断,适用于资源匮乏地区的远程医疗应用。
医学影像通过提供对内部解剖结构和生理状况的无创性观察,在疾病诊断和治疗规划中发挥着关键作用。多种成像方式,如X射线、计算机断层扫描(CT)、磁共振成像(MRI)、超声以及正电子发射断层扫描(PET),在临床实践中被常规用于检测异常、监测疾病进展以及引导干预措施1,2,3。每种成像方式都具有独特的优势,但也容易受到由仪器限制、采集环境以及重建算法等因素引起的各类图像质量退化的影响4。
图像质量常因噪声而下降,噪声可能由热效应、低剂量协议、电子干扰、患者移动或校准不当引起5,6,7。例如,CT图像常因光子计数限制而表现出泊松噪声,而MRI扫描则易受高斯噪声和瑞利噪声影响,这些噪声源于磁场不一致性和重建伪影8,9。此类噪声可能掩盖细微的解剖结构和病理征象,导致误诊或需要重复成像,进而增加辐射暴露和医疗成本。图1、图2和图3展示了医学图像中噪声的成像模态、类型及其成因。

图1:医学影像采集技术。 本图展示了最常用的医学影像成像方式,包括X射线、MRI、CT、PET和超声。每种成像方式具有独特的诊断用途,并易受不同类型的噪声伪影影响。例如,MRI和CT特别容易受到运动以及基于重建的失真影响。 请点击此处查看该图的放大版本。

图2:图像噪声的类型。 展示了影响医学成像的各种图像噪声类型,包括高斯噪声、椒盐噪声、斑点噪声和泊松噪声。每种噪声类型对像素强度和图像结构的影响各不相同,从而影响去噪效果。请点击此处查看该图的放大版本。

图3:图像噪声的成因。 本图总结了医学成像系统中噪声的主要来源,包括传感器误差、电子干扰、信噪比(SNR)过低、患者运动以及低剂量扫描。了解这些噪声来源有助于选择合适的预处理和去噪技术。请点击此处查看该图的放大版本。
为了克服这些挑战,已采用多种去噪技术。基于滤波器的经典方法(如中值滤波、高斯滤波和维纳滤波)计算效率较高,但常常导致重要图像细节的丢失。模型驱动的技术(如小波阈值法、BM3D 和各向异性扩散)在结构保持方面有所改进,但在高噪声情况下可能对参数调节敏感或表现不佳10,11,12。
随着深度学习的发展,卷积神经网络(CNN)通过学习噪声图像与干净图像之间的复杂映射关系,在医学图像去噪方面表现出卓越的性能。然而,深度网络通常需要较高的计算资源和较长的训练时间,这引发了人们对能源效率的担忧,尤其是在资源受限的临床环境中13,14,15。
为解决这些局限性,近期研究集中于将预处理技术与神经网络相结合的混合去噪框架,以降低复杂性并提升性能。图像增强和基于K均值聚类的分割等技术在分离相关解剖结构和减轻学习算法负担方面已显示出良好前景16,17,18。
除了去噪之外,多模态图像融合技术已取得进展,通过整合来自不同成像模式的数据来提高诊断细节。近期研究强调了医学图像处理领域持续不断的创新19,20,21,22,23。
图4 展示了噪声如何降低图像清晰度,并可能妨碍临床判读。这些局限性凸显了对能够保持临床相关性的节能、高保真去噪方法的需求。

图 4:噪声对诊断质量的影响。 展示了噪声如何在 MRI 和 CT 扫描中掩盖解剖细节。原始图像与含噪声图像的对比显示视觉清晰度下降,尤其在器官边界和软组织界面处更为明显。请点击此处查看该图的高清版本。
本研究提出了一种新颖的去噪流程,该流程结合了基于锐化的增强方法、K均值分割与基于卷积神经网络的自编码器,可在降低噪声的同时提高计算效率。所提出的模型通过标准指标和基准数据集进行了验证。此外,我们评估了其在远程医疗、老旧设备利用以及可持续计算中的适用性,弥补了传统深度学习解决方案中的不足24,25,26。
访问受限。请登录或开始试用以查看此内容。
本研究 exclusively 采用公开可用的、去标识化的 CT 和 MRI 影像数据集。未涉及任何活体人类或动物受试者。因此,无需获得机构审查委员会(IRB)或伦理委员会的批准。
方法概述
本方案提供了一种可重复的能量高效型医学图像去噪流程。该方法结合了预处理技术(包括锐化滤波器和K均值聚类)与基于卷积神经网络(CNN)的自编码器,以实现图像去噪。这种集成方法在提升图像质量的同时,减少了训练时间和硬件能耗,有助于实现可持续的医学诊断19,20,21,22,23。图5总结了端到端的框架结构。

图5:提出的去噪框架架构。该图概述了完整的流程:数据采集、预处理(锐化 + K均值分割),随后进行基于卷积神经网络(CNN)的自编码器去噪。该框架强调采用混合方法,在降低能耗的同时保持结构保真度。请点击此处查看该图的放大版本。
完整的流程如图5所示,展示了从数据集建立、预处理(锐化和K均值聚类)、CNN自编码器去噪到测试的整个序列。
软件与环境设置
选项 A - Google Colab(推荐用于可重复性):访问 colab.research.google.com,点击 新建笔记本。选择 运行时 > 更改运行时类型 > 硬件加速器:GPU > 保存。点击 文件 > 上传笔记本 以上传提供的笔记本文件和数据集 .zip 文件(或通过点击 文件 > 挂载云端硬盘 连接 Google Drive)。在第一个代码单元格中安装依赖项(笔记本中已包含):pip install opencv-python scikit-image scikit-learn tensorflow matplotlib numpy pandas。点击 运行时 > 全部运行。确认您看到以下内容:(i) 包含软件包版本的环境摘要,(ii) GPU 名称(在单元格输出中),以及 (iii) 实验文件夹 runs/YYYY-MM-DD/ 的创建。
选项 B - 本地(conda):打开 Anaconda 命令提示符/终端 并运行:

将您的数据集放在 data/raw/ 目录下,脚本放在 code/ 目录下。运行:python code/train_autoencoder.py --data_root data --img_size 256 --k_values 3 5 --epochs 100 --batch 32 --lr 0.001。确认看到以下内容:环境输出信息、检测到的 GPU,以及日志目录 runs/YYYY-MM-DD/。
数据集准备
CT 和 MRI 扫描的公开数据集来源于医学影像数据库。这些数据集包含典型的真实临床扫描噪声,并根据机构和伦理标准进行了去标识化处理8,9。每幅图像被调整为 256 × 256 像素,并以 PNG 或 DICOM 格式存储以确保兼容性。数据集被随机划分为以下部分:70% 用于训练,15% 用于验证,15% 用于测试,以确保成像模态和噪声水平的分层分布⁶。去噪前通过平均像素方差测量噪声统计特征。
整理文件夹:按照以下说明创建一个文件夹:

添加图像时,将去标识化的 CT/MRI 图像复制到 data/raw/CT 和 data/raw/MRI 文件夹中(支持 PNG、JPG 或 DICOM 格式)。建议使用 Python 标准化图像尺寸:运行笔记本单元格“Resize & convert”。该程序将加载每张图像,根据需要转换为灰度图像,并将其调整为 256 × 256。

另一种方法是使用图形用户界面(ImageJ/Fiji 替代方案),具体操作如下:点击 文件 > 导入 > 图像序列(或单张图像),然后依次选择 图像 > 类型 > 8 位,图像 > 调整 > 大小… > 256 × 256,最后选择 文件 > 另存为 > PNG ,保存至 data/preproc/ 目录下。
创建数据划分:运行笔记本单元格“训练/验证/测试划分 (70/15/15)”;该操作将对文件名进行随机打乱,并将其复制到 data/splits/train|val|test/ 目录中。控制台将打印各类别的数量(例如,训练集:700,验证集:150,测试集:150)。检查点(观察):打开 data/splits/train/ 目录,确认图像尺寸为 256 × 256 且为灰度图(1 个通道)。保留一个小型的 CSV 清单文件(splits.csv),其中列出文件路径、模态信息及划分标签。
图像预处理
使用 3 × 3 锐化核。 使用锐化核进行图像增强。在分割前,采用锐化卷积核以增强解剖边界:

该滤波器通过增强高频成分来突出重要结构4,5。每幅图像均使用 Python 的 OpenCV 库(cv2.filter2D())进行卷积处理,以生成增强后的图像。图6展示了处理前后的对比结果。

图6:不同k值下的验证准确率图。 柱状图展示了在k均值聚类步骤中使用不同K值(K=2、3、4、5)所达到的验证准确率。准确率在K=3时达到峰值,表明解剖结构与噪声区域之间实现了最佳分离。量表:归一化准确率值(0–1)。请点击此处查看该图的放大版本。
使用以下代码应用(Python/OpenCV)。

或者通过点击“Process > Filters > Convolve”使用图形界面替代方法(ImageJ/Fiji)。粘贴上方的 3 × 3 矩阵,然后点击OK > File > Save As > PNG,将结果保存至 data/preproc/enhanced/ 目录下。观察检查点:边缘和器官边界应变得更加清晰;若出现过度锐化产生的光晕现象,可将卷积核中心权重从 5 降至 4.5 后重新运行。图7 展示了去噪前后的对比结果。去噪前的图像明显存在噪声和模糊现象,而去噪后的图像清晰度提高,解剖结构边界更锐利,对比度增强,表明所提出的去噪流程具有显著效果。

图7:卷积神经自编码器网络结构。展示了自编码器的架构:输入层、编码器(卷积层 + 池化层)、瓶颈层、解码器(上采样层 + 转置卷积层)。每一层均标注了尺寸和功能。请点击此处查看该图的放大版本。
用于分割的K均值聚类
使用NumPy将增强后的图像重塑(image.reshape(-1, 1)),并利用sklearn.cluster.KMeans(n_clusters=3或5)进行聚类。将分割后的输出结果重新重塑为二维形式(np.reshape(clustered_array, image.shape)),以可视化解剖区域与噪声区域的区分14。表1列出了分割设置。
| 序号 | k 值 | 准确率 |
| 1 | 3 | 0.761 |
| 2 | 5 | 0.869 |
| 3 | 7 | 0.75 |
表1:不同k值及其对应的验证准确率。 该表格展示了在去噪流程的K均值分割步骤中,使用不同聚类参数k时所获得的验证准确率。结果表明,当k = 5时准确率最高,为最优聚类参数的选择提供了依据。
K-均值分割:使用以下代码通过 Python/scikit-learn 进行重塑和聚类。

执行颜色预览(可选),并将标签映射到颜色以进行视觉质控,叠加来自锐化图像的边缘。通过运行 K=3 和 K=5 来选择 K 值;在下游计算验证准确率(表1列出了设置参数;图6显示了准确率与 K 的关系)。此为一个检查点;需观察是否存在由噪声主导的像素形成明显聚类的情况;解剖区域应保持连续。若出现细小斑点,应应用解剖边界进行修正。
基于神经网络的去噪
架构描述:编码器-瓶颈-解码器示意图参见图8。使用 TensorFlow/Keras 构建了一个基于卷积神经网络(CNN)的自编码器。该架构包括:输入层:256 × 256 灰度图像;编码器包含三个卷积层(卷积核:3 × 3,步长:1,激活函数:ReLU),每个卷积层后接最大池化层;瓶颈层为全连接的潜在表示;解码器包含三个上采样层,采用转置卷积;输出层为 Sigmoid 激活层,用于生成去噪后的图像。表2提供了各层架构参数的完整信息。

图 8:去噪过程的可视化结果。并列展示原始含噪图像、预处理后的图像以及最终去噪输出结果,用于定性评估。结果显示了边缘保持效果及伪影抑制能力。请点击此处查看该图的高清版本。
| 序号 | 编译属性 | 编译属性值 |
| 1 | 优化器 | Adam |
| 2 | 损失函数 | Categorical Cross-entropy |
| 3 | 评估指标 | 准确率 |
表2:神经网络的编译参数。 本表详细列出了用于训练卷积自编码器模型的关键编译参数。这些设置在TensorFlow中实现,包括优化器、损失函数、评估指标、训练轮数(epochs)和批量大小(batch size)。
训练配置:训练参数包括:损失函数为均方误差(MSE),优化器为Adam(学习率 = 0.001),批量大小为32,训练轮数为100,并采用早停策略(耐心值 = 10)。
培训的简要概述如下。通过进入 Colab 并点击 运行时 > 全部运行 来启动训练;确认已列出 GPU(例如 Tesla T4)。使用命令 python code/train_autoencoder.py --data_root data --epochs 100 --batch 32 --lr 0.001 --early_stop 10。通过控制台输出监控训练过程,输出内容包括当前轮次(epoch)、训练损失(train_loss)、验证损失(val_loss)以及每轮耗时(time/epoch)。若连续 patience=10 轮未见性能提升,则触发早停机制。最佳模型将保存至 runs/.../checkpoints/best.h5。该文件为模型检查点,可通过 model.summary() 查看其网络层结构;参数数量应与 表 2 一致。若出现内存溢出(OOM)错误,可将批次大小减小至 16,或将输入尺寸设置为 224 × 224。
中间检查点与故障排除
在完成尖锐化和分割后,预览每个分割的三幅图像,并确认:(i) 边缘已增强,(ii) 簇掩模与解剖结构对齐。训练过程中,应确保验证损失下降且不发散。如果去噪输出显得过度平滑,可减小核中心值(4.5),或以更低的学习率(例如 5e-4)增加 10 个训练轮次。
性能评估:采用以下定量指标:峰值信噪比(PSNR)、结构相似性指数(SSIM)以及去噪图像分类的验证准确率。
与文献7,16中提出的基线模型相比,该方法将峰值信噪比(PSNR)从21.52提升至28.14 dB,结构相似性(SSIM)从0.76提升至0.86。能效通过监测GPU使用情况(NVIDIA-SMI日志)和训练时间进行记录。表3总结了去噪结果。
| 序号 | 指标 | 基线模型 |
| 1 | 平均每个训练周期时间(秒) | 25.8 |
| 2 | 总训练能耗(kWh) | 0.52 |
| 3 | GPU 利用率(%) | 85% |
| 4 | 每张图像推理时间(ms) | 18.7 |
| 5 | 验证准确率(%) | 76.19% |
| 6 | 峰值信噪比(PSNR,dB) | 21.52 |
| 7 | 结构相似性(SSIM) | 0.7619 |
表3:基线方法与所提出方法的性能评估指标。 本表格从多个性能指标对所提出的去噪流程与基线模型进行了比较,包括训练时间、GPU利用率以及质量度量(PSNR、SSIM和验证准确率)。结果表明,所提出的方法在能效和图像质量方面均有提升。
计算 PSNR/SSIM 和能耗。对于 PSNR/SSIM(scikit-image),使用以下代码。

为了计算能耗/GPU 使用情况,在训练期间运行该单元格,以将 nvidia-smi --query-gpu=power.draw,utilization.gpu --format=csv -l 1 的日志记录到 runs/.../gpu_log.csv 中(已在笔记本中提供)。在第二个终端中,运行以下代码:

解析 CSV 文件以计算平均功率(W),并对训练时间进行积分以估算能量(Wh = kWh)。该笔记本将 PSNR、SSIM、验证准确率、每轮训练时间及能量汇总至 results_table3.csv,便于直接引用。
可持续性评估与远程医疗模拟
为评估设备硬件的可持续性,我们引入高斯噪声和泊松噪声以模拟设备老化导致的图像质量下降。该模型能够将这些退化图像恢复至接近诊断级质量,验证了其鲁棒性27,28,29。在远程医疗模拟中,去噪后的图像通过 Python 套接字模拟 256 Kbps 带宽进行传输。图像视觉清晰度得以保持,支持远程诊断应用30,31,32。
对于设备老化模拟,将高斯噪声(σ=10-30)和泊松噪声应用于干净图像(细胞老化模拟),并保存至 data/simulated/aged/ 目录。在 aged/ 输入上运行训练好的模型,并将输出结果保存到 results/aged_denoised/。观察图像视觉质量应接近诊断级保真度;与基线方法比较峰值信噪比(PSNR)和结构相似性(SSIM)。
进行远程医疗带宽测试时,将去噪后的图像以85%-95%的质量压缩为PNG或JPEG格式,并使用提供的Python套接字测试程序(telemed_sim.py)通过模拟的256 kbps链路发送。测量往返时间及文件完整性哈希值,确认未引入任何影响诊断的伪影。观察图像视觉清晰度是否得以保留,且文件大小是否适用于低带宽工作流程。
实验方案终点
完成时,您应获得以下结果:(i) 预处理后的增强图像位于 preproc/enhanced/ 目录中,(ii) 预处理后的分割图像位于 preproc/segmented/ 目录中,(iii) 在 runs/.../checkpoints/ 目录中包含最佳模型文件 best.h5 的已训练自编码器,(iv) 测试图像和老化图像的去噪输出结果位于 results/ 目录中,(v) 汇总的指标文件(results_table3.csv),其中包含峰值信噪比(PSNR)、结构相似性(SSIM)、验证准确率、每轮训练时间及估算能耗的汇总数据。
访问受限。请登录或开始试用以查看此内容。
预处理与分割结果
初始预处理阶段在增强关键解剖边界可见性的同时,降低了背景干扰。如图7所示,经过锐化的图像显示出更清晰的边缘定义,有助于后续的分割处理。采用K均值聚类方法(K = 3 和 K = 5)生成的分割图像成功地将噪声密集的像素与具有诊断意义的区域分离开来33。该步骤获得的分割图像在保持结构保真度的同时,最大限度地减少了噪声的影响33,34。
基于自编码器的去噪性能
该基于卷积神经网络(CNN)的自编码器在预处理后的图像上进行训练,表现出稳定的训练动态,并因采用早停机制而在100个训练周期内即收敛。与在原始图像上训练的模型相比,借助预处理的流程实现了约20%的更快收敛速度,同时GPU使用量也相应降低了同等比例16...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种混合去噪方法,该方法将图像预处理与卷积自编码器相结合,旨在提升诊断图像质量的同时,优化能耗和计算性能。
该方法在预处理阶段结合了锐化滤波器和K均值聚类,以增强边缘清晰度并减少无关噪声,随后采用基于卷积神经网络的自编码器实现自适应去噪。这种混合流程减少了不必要的计算操作,并加速了训练过程中的收敛。
通过在峰值信噪比(PSNR)(从 21.52 dB 提升至 28.14 dB)、结构相似性(SSIM)(从 0.76 提升至 0.869)以及验证准确率(从 0.76 提升至 0.869)方面取得的显著改进,该模型展现了良好的诊断效能。此外,GPU 占用率和训练时间均减少了约 20%,进一步支持了人工智能在临床环境中的可持续应用。
尽管该方法具有优势,但它可能对图像模态和噪声分布较为敏感。K均值分割假设聚类分布是均匀的,而这一假设可能并不适用于所有类型的医学图像。此外,如果锐化核配置不当,可能会导致过度平滑,从而掩盖细微的病理特征。
访问受限。请登录或开始试用以查看此内容。
无任何利益冲突需要声明。
作者谨向印度浦那的维什瓦卡玛大学(VU)以及维什瓦卡玛技术学院(VIT)计算机工程系致以诚挚的感谢,感谢其为本研究提供了必要的基础设施、数据集和计算资源。特别感谢参与本研究的学生实习生在数据准备和初步测试中给予的支持。本研究未获得来自公共、商业或非营利性资助机构的任何专项资助。
作者贡献:
Vidula Meshram 参与了方法的概念化、预处理与去噪模型的设计,以及论文的监督工作。Vishal A. Meshram 负责算法的实现,开展训练、测试和能量评估实验,并参与论文的撰写与修改。Pallavi Rege 支持数据整理、文献综述及引文核验。Gandharpa Thite 参与了自编码器架构的编码工作,生成图表,并协助性能评估。Kailas Patil 和 Shrikant Jadhav 担任通讯作者,参与技术验证、论文修改,并最终完成投稿。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Google Colaboratory | N/A | 用于模型训练和测试的云平台 | |
| Keras (v2.x) | Open-source | N/A | 用于神经网络实现的 TensorFlow 高级 API |
| Matplotlib (v3.4 或以上) | Open-source | N/A | 用于图像和结果的可视化 |
| Microsoft Excel 365 | Microsoft | N/A | 用于结果的制表与分析 |
| NumPy (v1.21 或以上) | Open-source | N/A | 用于矩阵运算和数值计算 |
| NVIDIA Tesla T4 GPU | NVIDIA | N/A | 用于加速训练和推理的图形处理器 |
| 公开可用的医学影像数据集(CT 和 MRI 图像) | Open Source Databases | N/A | 用作模型训练、验证和测试的源数据 |
| Python (v3.8 或以上) | Python Software Foundation | N/A | 用于模型实现的编程语言 |
| Scikit-learn (v0.24 或以上) | Open-source | N/A | 用于 K 均值聚类和预处理 |
| TensorFlow (v2.x) | table | N/A | 用于卷积神经网络模型开发的深度学习库 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可