方法文章

基于稀疏特征卷积网络的交互式多尺度注意力融合用于卫星图像变化检测

DOI:

10.3791/69815

2026年3月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种结合稀疏特征卷积网络的交互式多尺度注意力融合模型,以提升卫星图像变化检测的性能。该方法利用多尺度特征提取、选择性注意力聚焦以及稀疏卷积,在降低计算复杂度的同时,有效检测并定位双时相卫星图像中的变化区域。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

利用双时相卫星影像进行变化检测是地球监测中的一个重要问题,旨在识别和定位两个时相影像之间的地表变化,并区分由季节循环、大气因素或人为开发引起的虚假变化。当前的深度学习方法在时间建模方面通常存在单向偏差,限制了大规模空间关系的有效利用,从而影响对变化模式的准确刻画。尽管最近基于Transformer的技术具有较高的精度,但其计算需求也相当大,限制了其在资源受限任务中的应用。针对这些局限性,本文提出了一种基于Ghost模块的稀疏特征卷积(SFC)的交互式多尺度注意力融合(IMAF)网络,以实现高效的多尺度特征提取。该网络采用先进的编码器-解码器架构,并在不同尺度上引入交互式注意力模块。网络通过互补的前向与后向注意力流协同工作:前者记录渐进的时间变化,后者则通过反向时间分析验证变化的一致性。这种交互机制能够在计算代价可控的前提下,有效表征时间关系的双向模型,显著提升对真实地表覆盖变化与噪声干扰所致伪变化的区分能力。本文在两个基准数据集上进行了实验:Onera卫星变化检测数据集(OSCD)和SZTAKI AirChange数据集。在OSCD数据集上的实验结果表明,所提出方法仅使用2.13M参数和19.6G FLOPS的计算量,即达到了58.14%(13通道)和50.68%(3通道)的竞争性F1分数,参数量仅为ChangeFormer的1/19,推理速度提升5.6倍。在SZTAKI数据集的Szada/1和Tiszadob/3测试样本上,F1分数分别达到74.29%和92.86%,表明该方法适用于边缘设备、实时分析以及大规模制图系统,其中运行能耗直接取决于计算能耗。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

全球环境中的城市化水平空前提高,环境资源不断流失,以及气候变化导致的地表景观改变,直接引发了对一种精确、及时且自动化监测系统的迫切需求,该系统能够识别并量化地球表面的变化。卫星遥感已成为大规模环境监测的基本支柱,因为它能够提供持续的时间和空间覆盖,并在全面分析地表变化过程中发挥关键作用。双时相卫星影像变化检测是指对同一地理区域在两个连续时间点获取的影像之间地表变化的识别与表征。然而,这一过程十分复杂,原因在于存在多种干扰因素,包括季节变化、天气状况、传感器特性、几何畸变以及可能掩盖或模拟真实地表覆盖变化的现象性改变。目前使用的人工解译卫星影像方法耗时较长、主观性强,难以应对当前卫星星座持续产生的海量地球观测数据。这一根本性局限推动了自动化变化检测解决方案的发展。传统的基于像素1和基于对象的变化检测方法2通常难以在上述复杂条件下有效运行,且在应用于多种地理单元和时间尺度时鲁棒性较差。深度学习架构,特别是卷积神经网络及其变体,能够提取代表低层次光谱细节和高层次语义模式的分层特征,有助于区分真实变化。深度学习变化检测模型已被证明在捕捉遥感数据中潜在的时空变化、识别真实地表覆盖变化与由外部因素引起的伪变化方面具有高度前景。这些端到端的学习方法充分利用了特征提取与分类可同时最优完成的优势。尽管在变化检测精度方面已取得显著进展,但大多数现有方法在现实世界运行环境中的部署仍面临困难。基于Transformer的方法3虽然在全球上下文建模方面效率较高,但参数量大、计算复杂度呈二次增长、推理延迟高且能耗大。而基于Siamese CNN的架构虽然效率更优,但感受野较小,且在很大程度上缺乏全局上下文建模能力,从而显著降低了检测性能。这些限制在大规模且资源受限的环境中进一步加剧,其中可扩展性和运行成本是关键考量因素。在应急响应场景中,可扩展性、能效以及推理速度通常至关重要,亟需开发能够在性能与可部署性之间取得平衡的解决方案。因此,在以精度为导向但计算密集的模型与现实部署的实际需求之间,仍存在明显差距。

为解决上述问题,本文提出一种结合稀疏特征卷积(SFC)网络的交互式多尺度注意力融合(IMAF)方法,其重点在于设计一个高效且可部署的变化检测框架,而非仅仅优化检测精度。该方法主要针对卫星获取的光学遥感影像对,通常是RGB影像或高分辨率多光谱影像(分辨率为0.5–30 m),例如来自Landsat、Sentinel-2或WorldView卫星的影像。该技术要求双时相影像对实现精确的几何配准,因为配准误差也会显著影响检测结果。本方法适用于二值变化检测(而非多类别语义变化检测),无法区分不同类型的地表变化。此外,该方法采用经过辐射校正的影像,以减少季节性、大气条件和光照变化带来的影响,避免将这些因素误判为地表覆盖变化。与传统Siamese CNN4通过简单拼接处理双时相影像的方式不同,所提出的IMAF模块能够实现全局与局部特征的多尺度上下文融合。近年来基于Transformer的方法,如BIT5和ChangeFormer3,取得了优异的检测效果,但其自注意力机制具有O(N2)的计算复杂度。本文提出的框架通过双向注意力机制捕捉细微变化,在降低计算复杂度的同时减少了推理延迟。此外,所提出的设计具有稀疏性感知能力,优于UNet++6,7和SNUNet8等密集多尺度融合结构。结合Ghost模块的稀疏特征卷积使浮点运算量(FLOPs)减少了约50%,同时保持了良好的特征表达能力。因此,该框架在精度与效率之间实现了良好权衡,适用于资源受限环境下的可靠部署。

本研究的主要贡献包括:(i)一种轻量级变化检测器,与基于变换器的方法相比,参数数量减少19倍,但仍达到具有竞争力的F1分数。(ii)一种交互式多尺度注意力融合模块,能够在不产生传统自注意力机制二次计算成本的情况下获取全局上下文信息。(iii)一种基于Ghost模块的特征稀疏卷积方案,使浮点运算量减少49.4%,同时特征表示质量无任何下降。(iv)在大量基准数据集上进行了广泛的实验验证,展现出更优的效率与精度权衡,以及在现实世界实际应用中的合理可行性。

本文其余部分包含以下章节:第2节全面综述了二值变化检测方法领域的近期研究工作,特别关注深度学习解决方案及其在标准基准上的实现。第3节介绍了所提出方法的理论基础与结构设计,包括时间融合机制和注意力模块的数学表达,以及实验设置特征、数据集、评估指标和实现细节,以确保研究的可重复性。第4节展示了详细的实验结果,包括消融实验,以及与最新的二值变化检测算法的对比,分析了在OSCD和SZTAKI Airchange数据集中不同地理区域的检测能力。第5节总结了研究结论,指出现有方法的局限性,并探讨了变化检测领域未来的研究方向。

遥感领域中的变化检测算法发展已从基于像素的方法显著演变为深度学习框架。早期的变化检测方法主要依赖于代数运算,如图像差值法、图像比值法和变化向量分析,这些方法直接对像素值进行操作以检测时间上的变化9,10。随后发展出另一种方法——分类后比较法,该方法首先对每一时相的图像独立分类,然后通过交叉制表进行比较11。基于对象的变化检测技术则引入了空间上下文信息,并有效缓解了像素级噪声问题,标志着该领域的重要进展2,12

深度学习技术的出现彻底改变了遥感变化检测领域,并为克服传统方法中的诸多限制开辟了道路。近年来,卷积神经网络(CNN)已成为自动特征提取与变化分类的标准架构13,14。用于变化检测的Siamese NestedUNet14和Siamese Swin-Unet15因其密集连接的Siamese网络拓扑结构而成为重要创新,该结构有助于在网络层级中有效保留定位信息。

由于多种混杂因素的存在,高分辨率光学遥感中的双时相变化检测问题仍然难以解决,为此已提出基于注意力机制的多尺度Transformer网络,并采用精心设计的特征融合策略16。所提出的EGMT-CD框架引入了针对异构图像对的边缘引导多模态Transformer,以应对因云层覆盖而无法获取同源图像的情况17。DASUNet等架构通过改进的梯度流,在CDD数据集上相较SNUNet-24提升了0.85%的F1指数,突破了全尺度特征融合中人工深度学习的瓶颈18。混合型CNN-Transformer模型通过在特征学习中额外增强频率分量的代价,以更高成本处理假阴性问题19。然而,混合U形Transformer网络20在局部-全局特征融合以及小尺度周期性变化区域的检测方面仍存在困难。相较于二分类任务,多任务语义变化检测以及精确的位置定位与类别识别更为复杂21,22。双时相相关性可通过交叉注意力机制成功建模,且无需对网络结构进行显著修改14,23。基于视角-语言范式的表达方式也是近期前沿方向,基于CLIP的设计将文本解释融入变化对应关系24,半监督模式则减少了对标注数据的依赖25。Change Mamba提出了时空模型的状态空间模型26,27。多种专用注意力方法的应用已得到验证:包括高光谱异常检测28、多区域目标分类29或有限标签分割30,展示了注意力机制在遥感分析中的灵活性。

作者方法/架构技术规格关键创新 & 结果 / 数据集性能
Singh, A. [8]传统方法基于像素的差值法,CVA数字变化检测框架,多数据集,准确率:65-80%
Mas, J.F. [10]分类后处理独立时间分类比较方法学分析,热带影像,开放获取:72-85%
Lu 等 [9]传统方法代数运算,典型变量分析,主成分分析全面的技术对比,多源数据,准确率:70-88%
Benedek & Szirányi [23]混合马尔可夫模型多层条件框架概率变化建模,Sztaki AirChange,DA:92.1%
Blaschke, T. [2]基于对象的基于分割的分析空间上下文信息融合,多种高分辨率影像,SA:85-92%
Chen 等 [11]基于对象的多尺度分割分层目标分析,高分辨率影像,目标分析准确率:87.3%
詹 et al. [12]孪生卷积神经网络5层卷积神经网络,卷积核尺寸为3×3用于变化检测的深度孪生网络架构,航空影像,F1:0.847,IoU:0.735
Daudt 等 [4]暹罗FCNFC-EF,FC-Siam-diff,FC-Siam-conc早期/晚期融合策略,OSCD,F1:0.431,IoU:0.276
彭等[26]UNet++嵌套U型网络,密集跳跃连接多尺度特征聚合,高分辨率卫星影像,F1:0.753,IoU:0.604
Chen & Shi [25]时空注意力注意力模块,时序建模时空特征学习,LEVIR-CD,F1:0.887,IoU:0.797
方等人 [7]SNUNet-CD暹罗嵌套UNet,密集连接信息传输优化,LEVIR:F1:0.897,WHU:F1:0.904
Chen 等 [5]BIT-CDResNet18 + Transformer 编码器二值时间特征学习,OSCD:F1:0.635,LEVIR:F1:0.919
班达拉 & Patel [3]ChangeFormer分层变换器编码器多尺度变换器注意力,OSCD:F1:0.654,LEVIR:F1:0.905
宋等人 [27]ACANet轴向注意力 + CNN 主干网络高效的注意力计算,LEVIR:F1:0.901,WHU:F1:0.913
Shi 等[28]综述论文全面的人工智能方法调查系统性分析人工智能方法,已分析50多个数据集
Li 等 [14]AMST-Net多尺度变换器,金字塔注意力自适应多尺度特征提取,高分辨率光学图像,mIoU:0.823
向等人 [15]EGMT-CD边缘引导的多模态架构跨模态特征对齐,异质样本对,F1:0.756
Miao 等 [16]DASUNet密集监督,全尺度融合所有解码器层级的深度监督,CDD:相较于 SNUNet 的 F1 分数提升 0.85%
唐等[29]暹罗Swin-UNetSwin Transformer 与 Unet 融合分层窗口注意力,LEVIR:F1:0.923,WHU:F1:0.925
吴等 [18]混合U型变换器UNet++ 骨架 + Transformer 模块全局-局部特征融合,高分辨率图像,IoU:0.851,F1:0.919
董等人 [20]ChangeCLIP基于CLIP的视觉-语言多模态语义理解,遥感影像对,语义准确率:94.1%
李等人 [21]SemiCD-VL半监督视觉-语言标注需求减少、标签有限、F1:0.889
Chen 等 [22]ChangeMamba状态空间模型(SSMs)线性复杂度时间建模,遥感图像,效率:速度快3倍

表1:遥感中变化检测方法的概述 请点击此处下载该表格。

先前研究的汇总见表1。传统方法依赖人工设计的特征,难以适应复杂的时空变化31,而深度学习架构(如UNet、FPN、PSPNet)则涉及计算成本较高的密集卷积。现有模型缺乏高效的多尺度融合机制和动态注意力系统。为弥补这些不足,本研究提出一种稀疏特征卷积网络下的交互式多尺度注意力融合方法,旨在捕捉跨尺度的细微变化,同时在遥感任务中保持较高的计算效率,尤其适用于城市及人工建筑结构变化检测。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 伦理声明

  1. 本研究使用的 Onera 卫星变化检测(OSCD)和 SZTAKI AirChange 数据集均包含公开可用的 RGB 和多光谱图像,覆盖多样的地理特征。这些数据集不包含任何受限或敏感数据,因此本研究无需伦理审批。

2. 材料与仪器

  1. 在配备 Intel Core i7 10870H 处理器、NVIDIA GeForce GTX 1650 Ti 显卡(4GB 显存)和 32GB 内存的 Windows 11 计算机上进行测试。
    注:编程环境为 Python 3.8,依赖 PyTorch 框架(版本 1.12.1)和 Torchvision(版本 0.13.1)实现深度学习。
  2. 下载并安装包含机器学习工具的 scikit-learn 库(版本 1.0.2)以及包含数值运算功能的 NumPy 库(版本 1.21.0)。
  3. 请确保安装 NVIDIA Corporation 提供的 CUDA Toolkit 11.3 版本和 cuDNN 8.2 版本,以便能够利用显卡的加速能力。
  4. 使用公开可用的 OSCD 和 SZTAKI Airchange 数据集进行模型训练与性能评估。

3. 数据集准备

  1. 选择由光学RGB卫星航拍图像和多光谱图像组成的OSCD4数据集,每个图像尺寸为600 x 600像素,分辨率为10 m;同时选择由13对光学航拍图像组成的SZTAKI AirChange32数据集,每对图像尺寸为952 x 640像素,分辨率为1.5 m/像素,作为基准数据集。
  2. 将OSCD数据集中的24个城市划分为固定的、预定义的14个城市用于训练,10个城市用于测试。
  3. 按照常规基准设置,将SZTAKI AirChange数据集中固定的、非随机选取的Szada/1和Tiszadob/3图像对分配至测试集,其余图像对作为训练集。
  4. 在测试集上执行变化检测,并利用各数据集中带标注的图像对,通过单次运行量化模型性能。

4. 预处理

  1. 应用基于图像块的预处理。
    1. 在时间序列图像上,于相同位置独立地实时提取图像块,以高效管理高分辨率卫星图像。
    2. 将每幅图像划分为大小为 128 × 128 像素的重叠图像块,步长为 64 像素。
    3. 对相邻图像块之间的重叠区域进行对齐,以保持边界一致性并保留边缘信息。
  2. 执行按类别划分的数据增强。
    1. 在训练过程中,根据变化像素所占比例,对图像对中的两个图像块同时应用差异性增强,以处理“变化”与“无变化”区域之间的类别不平衡问题。
    2. 对变化图像块对(即变化像素占比 > 1% 的图像块对)进行六次增强,采用以下变换:水平和垂直翻转、90° 旋转、颜色抖动(亮度、对比度和饱和度 ±30%)、仿射变换(旋转 ±15°、平移 ±10 像素、缩放 95–105%)。
    3. 对无变化图像块对仅进行一次增强,以防止数据集不平衡。
      注:这种基于类别的增强策略可在变化与无变化区域之间提供均衡的训练。
  3. 归一化并增强图像质量。
    1. 使用 ImageNet 的均值和标准差对所有图像块进行归一化:均值 = (0.485, 0.456, 0.406),标准差 = (0.229, 0.224, 0.225)。
      1. 在 LAB 色彩空间(仅 L 通道)中使用限制对比度自适应直方图均衡化(CLAHE),设置剪裁限制值 = 2.0,分块网格大小 = 8 × 8,以增强低对比度区域的对比度,使图像中的特征更易区分,像素强度归一化至 [0,255] 范围。
      2. 清除尺寸小于 128 × 128 像素的图像块,并对较小的图像块进行填充,使其尺寸与较大图像块一致,从而在模型训练过程中保持其空间完整性。

5. 模型构建

  1. 定义输入与输出。
    1. 所提出的框架以一对在不同时间点获取的共配准卫星图像 I1, I2∈ RH×W×C 作为输入,并生成一个二值变化图 M ∈ RH×W×2,以精确划分发生变化与未发生变化的区域。
  2. 所提出的框架
    1. 将所提出的框架处理为三阶段处理流程。在第一阶段,对输入序列进行时间注意力建模,以捕捉随时间发生的变化。
    2. 在时间注意力建模阶段,使用交互式交叉注意力来捕捉双时相特征之间的对称时间依赖性。
    3. 在第二阶段,使用基于稀疏特征的编码器架构从经过时间建模的图像中提取相关特征的层次化表示,其中空间分辨率逐渐降低,而特征维度逐渐增加。
    4. 在重建阶段,使用带有跳跃连接的解码器和自适应上采样生成高分辨率变化图,同时保留小尺度的空间细节。
      注:图1展示了从输入的双时相卫星图像到共享编码器、中间交叉注意力处理模块和解码器的整体数据流,所有这些组件共同生成变化检测图。
  3. 稀疏特征编码器
    1. 构建一个由Ghost卷积块(ratio=2)组成的轻量级编码器,并依次应用批归一化(Batch Normalization)和ReLU激活函数,以在保持表示质量的同时降低计算复杂度。
    2. 按顺序由以下三种类型的模块组装编码器。
      模块1Ghost(in_channels → 32) → BN ReLU Ghost(32 → 64) → BN ReLU MaxPool(2×2)
      模块2Ghost(64 → 96) → BN ReLU Ghost(96 → 128) → BN ReLU MaxPool(2×2)
      模块3Ghost(128 → 128) → BN ReLU
    3. 连接这些模块以在编码器中保持平滑的特征流动,并为后续阶段保留空间分辨率。
      注:该方法的核心创新在于交互式交叉注意力机制,该机制实现了双时相图像之间的对称特征交互。对于每一对图像,提取深层特征 F1,F2∈RB×C×H'×W',其中 H' = H/4, W' = W/4, C = 128 表示特征维度。这些空间特征被重塑为序列格式 数学表达式 F1, F2 ∈ R^B×N×D;方程细节 N = H'×W'。 表示空间序列长度,D = C 表示特征维度。
  4. 时间注意力建模
    1. 使用标准的缩放点积注意力公式实现交叉注意力操作,如 图2 所示
      注意力机制公式,序列处理中机器学习的关键概念。
      其中 Q、K 和 V 分别表示查询、键和值矩阵,dk 表示键向量的维度。
      注:在每个尺度上独立使用具有 h = 8 个头的多头注意力,以同时捕捉不同类型的时间关系。每个注意力头处理特征表示的不同子空间,使模型能够关注时间变化的各个方面。
    2. 将多头注意力输出计算为:
      MultiHead (Q,K,V) = Concat (head1,…,headh ) WO
      其中每个 注意力机制公式;Q, K, V 矩阵;张量维度 RDxdK;数学符号。 为可学习的投影矩阵。
  5. 对称交互注意力
    1. 交互注意力策略通过前向和后向操作(如 图3 所示)捕捉对称变化信息。前向注意力允许第一时相图像的特征关注第二时相图像的特征,计算方式如下:
      交叉注意力方程,A₁→₂=CrossAttention(F₁',F₂',F₂''),神经网络模型,示意图。
      其中第一时相特征作为查询,第二时相特征提供键和值。
    2. 相反,后向注意力使第二时相图像的特征能够关注第一时相图像的特征,其公式为:
      神经网络中注意力机制的CrossAttention公式示意图。
      将两个方向的注意力特征进行拼接,并通过线性变换投影以生成最终的注意力表示:
      线性变换方程,Fattemded = Linear([A1→2; A2→1]),神经网络公式。
      注:该交互机制确保时间关系被对称地捕捉,使网络对输入图像的顺序具有不变性,这对于变化检测应用至关重要,因为时间顺序不应影响检测结果。
  6. 解码器与变化图重建
    1. 通过跳跃连接将注意力特征与编码器输出进行融合,以保留空间细节。
    2. 在所有解码器阶段应用具有相同参数的双线性插值进行自适应调整大小,以确保跳跃连接之间的完美对齐。
    3. 在第一阶段,通过 H/4×W/4 尺度的Ghost卷积将通道数从256减少至96,并上采样至 H/2×W/2,然后与对应的编码器特征融合。
    4. 在第二阶段,使用Ghost卷积处理特征,将通道数从160减少至64,并上采样至全分辨率 H×W,再与编码器层级的跳跃特征整合。
    5. 最后,应用Ghost卷积将通道数减少至32,并使用最终的1×1卷积生成双通道二值变化图。
    6. 通过以下算法框架总结完整的处理流程,该框架将所有架构组件整合为一个连贯的变化检测系统。
      注:符号说明:Eki 表示来自图像 i ∈ {1,2} 在第 k 层的编码器特征;Fi 为最终编码特征;静力平衡方程;ΣFi=0;示意图;力的平衡;物理概念;教学用途。 为其展平形式;静力平衡方程 ΣFx=0, ΣFy=0;矢量图,力平衡分析。 为注意力增强特征;A 为注意力矩阵;Dj 为解码器输出;ϕkj 为编码器/解码器模块;[·;·] 表示通道维度上的拼接;Wout 为输出层卷积核。
      参见 补充文件 算法1 中的“基于交互多尺度注意力融合的变化检测”

神经网络模型示意图;共享编码器、双向注意力机制、特征拼接。
图1:提出的方法 请点击此处查看此图的放大版本。

Transformer 机制,展示带有查询、键、值的注意力过程;神经网络示意图。
图 2:交叉注意力架构 请点击此处查看此图的放大版本。

交叉注意力示意图,通过QKV机制将T1/T2特征与被注意特征关联,实现数据融合输出。
图3:交互式交叉注意力架构 请点击此处查看此图的放大版本。

6. 训练程序

  1. 损失函数
    注意:训练过程采用焦点 Tversky 损失函数,以应对变化检测数据集中常见的类别不平衡问题。
    1. 将损失函数表述如下:设 pi ∈ [0,1] 为像素 i 的预测概率,gi ∊ {0,1} 为其对应的真实标签。Tversky 指数(TI)定义为:
      TI 公式方程;统计方法;数据分析过程;数学表示。
      其中 α 和 β 分别控制对假阳性与假阴性的惩罚程度,ε 为平滑项。
    2. 随后将焦点 Tversky 损失表示为:
      以数学符号格式表示的 FFTL 损失函数方程。
      其中 γ 用于调节对难以分类像素的关注程度。
  2. 超参数配置
    1. 在训练集上应用基于 5 折交叉验证的系统性网格搜索,以选择最优参数值。
    2. 将变化检测任务的损失权重系数设置为 α = 0.3,β = 0.7,γ = 1.0,ε = 1.0。这些取值更强调减少漏检而非控制假阳性,这对于变化相对稀少的不平衡数据集尤为重要。
      ​注意:采用 β > α 的非对称权重可提高召回率,即假阴性比假阳性受到更重的惩罚,这符合设计需求,尤其适用于灾害监测等应用场景。
  3. 优化器与学习策略
    1. 采用 AdamW 优化器,权重衰减设为 1×10⁻⁴,以增强正则化效果并防止过拟合。
    2. 初始学习率设为 1×10⁻³,并采用余弦退火调度策略,确保训练过程中收敛平稳且稳定。
    3. 使用批大小为 8,以适配 4 GB GPU 显存环境。
  4. 训练计划
    1. 分别在 OSCD 数据集上进行模型训练,该数据集包含 14 组预定义的训练图像对和 10 组测试图像对;随后在 SZTAKI Airchange 数据集上训练,其中 Szada/1 和 Tiszabob/3 作为标准测试集基准。
    2. 将训练图像对划分为五折,在每次迭代中使用其中一折作为验证集,并最多训练 100 个训练轮次。
    3. 在每折结束时监控验证损失,当收敛趋于稳定后,若连续 10 个训练轮次内无进一步改善,则触发早停机制,以防止过拟合并减少不必要的计算开销。
    4. 根据所有折上的最佳平均验证性能来确定最终的超参数。
    5. 在测试集上执行变化检测,并利用各数据集提供的标注图像对评估单次运行的性能。
  5. 内存优化
    1. 启用梯度检查点技术,通过在反向传播过程中重新计算中间激活值,将 GPU 显存占用降低约 40%。
    2. 启用混合精度训练,在数值稳定的情况下使用 FP16 运算,从而提升训练速度并减轻显存负担。
    3. 采用自适应批大小缩放策略,动态调整内存使用,以实现 GPU 资源利用的最大化效率。

7. 评估

  1. 确保训练或验证过程中不包含来自测试城市的样本块,以防止数据泄露。
  2. 组织图像样本块及其对应的真值图,用于按批次进行评估。
  3. 加载根据验证损失确定的最佳训练轮次的模型权重。
  4. 选择0.5作为阈值,将概率图转换为二值变化图。
  5. 计算像素级评估指标以衡量变化检测性能10
    精确率(P):预测为变化像素中实际为变化像素的比例。
    召回率(R):被正确检测出的真实变化像素所占的比例。
    F1得分:精确率与召回率的调和平均值。
  6. 在训练和评估模型时实时生成图像样本块,尺寸为128 × 128像素,步长为64像素。
    注:此类动态生成方式可保证内存使用效率以及边界的连续性。
  7. 通过检查代表性样本块(如可解释的中间层特征图像)来验证预处理和样本块放置的正确性。
    注:由基于CNN的编码器生成的编码特征表示以张量形式存储在内存中,供后续阶段使用,这些存储内容在特征验证时可作为检查点。生成的变化图以常规图像文件格式(如PNG或TIFF)保存,以便通过视觉观察评估所识别的变化。
  8. 记录模型训练过程中的收敛指标(损失曲线、准确率指标),并检查模型是否在指定间隔保存了检查点,以便整个训练过程可被重复、优化或恢复。
    注:明确展示输出格式、验证步骤和检查点细节有助于提高透明度,使验证能够逐步进行,并允许其他研究人员复现和验证该方案。本方案详细阐述了数据集准备、预处理、网络构建、训练及评估的完整工作流程。遵循这些步骤,可在指定条件下以可重复的方式实现所提出的方法。该流程的结果见下文“结果”部分。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

通过两个公开可用的基准数据集,将所提出的变更检测方法与已建立的基线方法进行了比较,以评估其在不同光谱分辨率和环境条件下的性能。实验结果表明,该方法在平衡检测精度与误报控制方面具有显著改进,尤其在保持高召回率的同时,相较于传统方法大幅提升了精确度。

...
数据网络精确率 (%)召回率 (%)F1 (%)
OSCD-3 ch.Siam. [11]21.5779.433.85
OSCD-3 ch.EF [11]21.5682.1434.15

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种基于交互式多尺度注意力融合的网络,用于检测双时相卫星图像中的变化。该方法通过引入双向注意力机制,与单向方法不同,实现了具有互补前向和后向注意力信号的完整跨时相特征间交互。前向注意力流通过注意力差异捕获时间上的渐进变化,即从较早到较新的时相数据;而后向获取系统则通过识别突现特征来检验变化的一致性。这种双路径特征已被证明在区分真实地表覆盖变化与噪声方面更为有效,而这一问题正是业务化变化检测系统长期面临的主要挑战之一。

在两个具有挑战性的基准数据集上的实验测试证实了所提出方法在多种地理环境和空间分辨率下的实用性与可行性。在OSCD样本上,该方法实现了36.44%的精确率、79.67%的召回率和50.68%的F1分数,这一结果在需要全面变化检测的场景中尤为突出,因为在这些场景中,漏检真实变化所带来的运行成本远高于误报。较高的召回能力表明,网络在保持合理精确水平的同时,对微小变化的敏感性得到了提升,这一特性在环境监测和灾害评估过程中尤为重要,因为在这些应用中必须检测出每一次变化的发生。对SZTAKI AirChange数据集的评估进一步证明了该网络的多功能性及其在不同复杂程度...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明不存在利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
CUDA ToolkitNVIDIA CorporationVersion 11.3深度学习计算的 GPU 加速
cuDNNNVIDIA CorporationVersion 8.2优化的 GPU 深度学习库
Intel  处理器Intel CorporationCore i7 10870H用于训练和评估所提出深度学习模型的计算平台
NumPy开源Version 1.21.0数值数组处理
NVIDIA GeForce NVIDIA CorporationGTX 1650 Ti (4 GB VRAM)用于加速模型训练的图形处理器
Onera 卫星变化检测(OSCD)数据集ONERA公开可用的光学 RGB 和多光谱图像数据集,用于训练和评估。https://rcdaudt.github.io/oscd/
PythonPython 软件基金会Version 3.8用于算法实现的编程语言
PyTorchMeta AI(开源)Version 1.12.1开源深度学习框架,用于开发和训练所提出的模型
Scikit-learn开源Version 1.0.2性能评估指标
SZTAKI 空中变化基准数据集SZTAKI公开可用的光学 RGB 航拍图像数据集,用于训练和评估。http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html
TorchvisionMeta AI(开源)Version 0.13.1数据集加载与图像变换
Windows 操作系统Microsoft11操作系统 

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ahmed, O. S., Franklin, S. E., Wulder, M. A., White, J. C. Characterizing stand-level forest canopy cover and height using Landsat time series, samples of airborne lidar, and the random forest algorithm. ISPRS J Photogramm. Remote Sens. 101, 89-101 (2015).
  2. Blaschke, T. Object based image analysis for remote sensing. ISPRS J. Photogramm. Remote Sens. 65 (1), 2-16 (2010).
  3. Bandara, W. G. C., Patel, V. M. A. transformer-based Siamese network for change detection. IGARSS. , 207-210 (2022).
  4. Daudt, R. C., Le Saux, B., Boulch, A., Gousseau, Y. Urban change detection for multispectral earth observation using convolutional neural networks. Proc. IEEE Int. Geosci. Remote (IGARSS). , 2115-2118 (2018).
  5. Chen, H., Qi, Z., Shi, Z. Remote sensing image change detection with transformers. IEEE Trans. Geosci. and Remote. 60, 1-14 (2021).
  6. UNet++: A nested U-Net architecture for medical image segmentation. Zhou, Z., Siddiquee, M. M. R., Tajbakhsh, N., Liang, J. Proc. Int. Workshop Deep Learn. Med. Image Anal. Multimodal, 11045, 3-11 (2018).
  7. Peng, D., Zhang, Y., Guan, H. End-to-end change detection for high resolution satellite images using improved Unet++. Remote Sens. 11 (11), 1382(2019).
  8. Fang, S., Li, K., Shao, J., Li, Y. SNUNet-CD: A densely connected Siamese network for change detection of VHR images. IEEE Geosci. Remote Sens. Lett. 19, 1-5 (2021).
  9. Singh, A. Digital change detection techniques using remotely-sensed data. Int. J. Remote Sens. 10 (6), 989-1003 (1989).
  10. Lu, D., Mausel, P., Brondizio, E., Moran, E. Change detection techniques. Int. J. Remote Sens. 25 (12), 2365-2401 (2004).
  11. Mas, J. F. Monitoring land-cover changes: a comparison of change detection techniques. Int. J. Remote Sens. 20 (1), 139-152 (1999).
  12. Chen, G., Hay, G. J., Carvalho, L. M., Wulder, M. A. Object-based change detection. Int. J. Remote Sens. 33 (14), 4434-4457 (2012).
  13. Zhan, Y., Fu, K., Yan, M., Sun, X., Wang, H., Qiu, X. Change detection based on deep Siamese convolutional network for optical aerial images. IEEE Geosci. Remote Sens. Lett. 14 (10), 1845-1849 (2017).
  14. Pacifici, F., Del Frate, F. Automatic change detection in very high-resolution images with pulse-coupled neural networks. IEEE Geosci. Remote Sens. Lett. 7 (1), 58-62 (2009).
  15. Tang, Y., Cao, Z., Guo, N., Jiang, M. A Siamese Swin-unet for image change detection. Sci. Rep. 14 (1), 4577(2024).
  16. Liu, W., Lin, Y., Liu, W., Yu, Y., Li, J. An attention-based multiscale transformer network for remote sensing image change detection. ISPRS J. Photogramm. Remote Sens. 202, 599-609 (2023).
  17. Xiang, Y., Tian, X., Xu, Y., Chen, Z. EGMT-cd: Edge-guided multimodal transformers change detection from satellite and aerial images. Remote Sens. 16 (1), 86(2023).
  18. Miao, R., et al. DASUNET: A deeply supervised change detection network integrating full-scale features. Sci. Rep. 14, 12464(2024).
  19. Yang, J., Wan, H., Shang, Z. Enhanced hybrid CNN and transformer network for remote sensing image change detection. Sci. Rep. 15 (1), 10161(2025).
  20. Wu, H., Yuan, M., Zhan, T. A hybrid U-shaped and transformer network for change detection in high-resolution remote sensing images. IET Image Process. 18 (5), 1373-1384 (2024).
  21. Wang, Y., Zhao, L., Hu, Y., Dai, H., Zhang, Y. Multitask semantic change detection guided by spatiotemporal semantic interaction. Sci. Rep. 15 (1), 16003(2025).
  22. Wang, G., Li, B., Zhang, T., Zhang, S. A network combining a transformer and a convolutional neural network for remote sensing image change detection. Remote Sens. 14 (9), 2228(2022).
  23. Song, L., Xia, M., Weng, L., Lin, H., Qian, M. Axial cross attention meets cnn: Bibranch fusion network for change detection. IEEE J. Sel. Top. Appl. Earth Obs. Remote Sens. 16, 21-32 (2022).
  24. Dong, S., Wang, L., Du, B., et al. Changeclip: Remote sensing change detection with multimodal vision-language representation learning. ISPRS J. Photogramm. Remote Sens. 208, 53-69 (2024).
  25. Li, K., Cao, X., Deng, Y., et al. SemiCD-VL: Visual-language model guidance makes better semi-supervised change detector. IEEE Trans. Geosci. Remote Sens. 63, 1-13 (2025).
  26. Chen, H., et al. Changemamba: Remote sensing change detection with spatio-temporal state space model. IEEE Trans. Geosci. Remote Sens. 62, 1-20 (2024).
  27. Chen, H., Shi, Z. A spatial-temporal attention-based method and a new dataset for remote sensing image change detection. Remote Sens. 12 (10), 1662(2020).
  28. Zhang, L., et al. Improved central attention network-based tensor RX for hyperspectral anomaly detection. Remote Sens. 14 (22), 5865(2022).
  29. Liu, H., et al. Multiarea target attention for hyperspectral image classification. IEEE Trans. Geosci. Remote Sens. 61, 1-16 (2023).
  30. Liu, H., et al. SegHSI: Semantic segmentation of hyperspectral images with limited labeled pixels. IEEE Trans. Image Process. 33, 6469-6482 (2024).
  31. Shi, W., Zhang, M., Zhang, R., Chen, S., Zhan, Z. Change detection based on artificial intelligence: State-of-the-art and challenges. Remote Sens. 12 (10), 1688(2020).
  32. Benedek, C., Szirányi, T. Change detection in optical aerial images by a multilayer conditional mixed markov model. IEEE Trans. Geosci. Remote Sensing. 47 (10), 3416-3430 (2009).
  33. Liu, J., Gong, M., Qin, K., Zhang, P. A deep convolutional coupling network for change detection based on heterogeneous optical and radar images. IEEE Trans. Neural Networks Learn. Syst. 29 (3), 545-559 (2018).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

Ghost

相关文章