本研究提出了一种结合稀疏特征卷积网络的交互式多尺度注意力融合模型,以提升卫星图像变化检测的性能。该方法利用多尺度特征提取、选择性注意力聚焦以及稀疏卷积,在降低计算复杂度的同时,有效检测并定位双时相卫星图像中的变化区域。
方法文章
本研究提出了一种结合稀疏特征卷积网络的交互式多尺度注意力融合模型,以提升卫星图像变化检测的性能。该方法利用多尺度特征提取、选择性注意力聚焦以及稀疏卷积,在降低计算复杂度的同时,有效检测并定位双时相卫星图像中的变化区域。
利用双时相卫星影像进行变化检测是地球监测中的一个重要问题,旨在识别和定位两个时相影像之间的地表变化,并区分由季节循环、大气因素或人为开发引起的虚假变化。当前的深度学习方法在时间建模方面通常存在单向偏差,限制了大规模空间关系的有效利用,从而影响对变化模式的准确刻画。尽管最近基于Transformer的技术具有较高的精度,但其计算需求也相当大,限制了其在资源受限任务中的应用。针对这些局限性,本文提出了一种基于Ghost模块的稀疏特征卷积(SFC)的交互式多尺度注意力融合(IMAF)网络,以实现高效的多尺度特征提取。该网络采用先进的编码器-解码器架构,并在不同尺度上引入交互式注意力模块。网络通过互补的前向与后向注意力流协同工作:前者记录渐进的时间变化,后者则通过反向时间分析验证变化的一致性。这种交互机制能够在计算代价可控的前提下,有效表征时间关系的双向模型,显著提升对真实地表覆盖变化与噪声干扰所致伪变化的区分能力。本文在两个基准数据集上进行了实验:Onera卫星变化检测数据集(OSCD)和SZTAKI AirChange数据集。在OSCD数据集上的实验结果表明,所提出方法仅使用2.13M参数和19.6G FLOPS的计算量,即达到了58.14%(13通道)和50.68%(3通道)的竞争性F1分数,参数量仅为ChangeFormer的1/19,推理速度提升5.6倍。在SZTAKI数据集的Szada/1和Tiszadob/3测试样本上,F1分数分别达到74.29%和92.86%,表明该方法适用于边缘设备、实时分析以及大规模制图系统,其中运行能耗直接取决于计算能耗。
全球环境中的城市化水平空前提高,环境资源不断流失,以及气候变化导致的地表景观改变,直接引发了对一种精确、及时且自动化监测系统的迫切需求,该系统能够识别并量化地球表面的变化。卫星遥感已成为大规模环境监测的基本支柱,因为它能够提供持续的时间和空间覆盖,并在全面分析地表变化过程中发挥关键作用。双时相卫星影像变化检测是指对同一地理区域在两个连续时间点获取的影像之间地表变化的识别与表征。然而,这一过程十分复杂,原因在于存在多种干扰因素,包括季节变化、天气状况、传感器特性、几何畸变以及可能掩盖或模拟真实地表覆盖变化的现象性改变。目前使用的人工解译卫星影像方法耗时较长、主观性强,难以应对当前卫星星座持续产生的海量地球观测数据。这一根本性局限推动了自动化变化检测解决方案的发展。传统的基于像素1和基于对象的变化检测方法2通常难以在上述复杂条件下有效运行,且在应用于多种地理单元和时间尺度时鲁棒性较差。深度学习架构,特别是卷积神经网络及其变体,能够提取代表低层次光谱细节和高层次语义模式的分层特征,有助于区分真实变化。深度学习变化检测模型已被证明在捕捉遥感数据中潜在的时空变化、识别真实地表覆盖变化与由外部因素引起的伪变化方面具有高度前景。这些端到端的学习方法充分利用了特征提取与分类可同时最优完成的优势。尽管在变化检测精度方面已取得显著进展,但大多数现有方法在现实世界运行环境中的部署仍面临困难。基于Transformer的方法3虽然在全球上下文建模方面效率较高,但参数量大、计算复杂度呈二次增长、推理延迟高且能耗大。而基于Siamese CNN的架构虽然效率更优,但感受野较小,且在很大程度上缺乏全局上下文建模能力,从而显著降低了检测性能。这些限制在大规模且资源受限的环境中进一步加剧,其中可扩展性和运行成本是关键考量因素。在应急响应场景中,可扩展性、能效以及推理速度通常至关重要,亟需开发能够在性能与可部署性之间取得平衡的解决方案。因此,在以精度为导向但计算密集的模型与现实部署的实际需求之间,仍存在明显差距。
为解决上述问题,本文提出一种结合稀疏特征卷积(SFC)网络的交互式多尺度注意力融合(IMAF)方法,其重点在于设计一个高效且可部署的变化检测框架,而非仅仅优化检测精度。该方法主要针对卫星获取的光学遥感影像对,通常是RGB影像或高分辨率多光谱影像(分辨率为0.5–30 m),例如来自Landsat、Sentinel-2或WorldView卫星的影像。该技术要求双时相影像对实现精确的几何配准,因为配准误差也会显著影响检测结果。本方法适用于二值变化检测(而非多类别语义变化检测),无法区分不同类型的地表变化。此外,该方法采用经过辐射校正的影像,以减少季节性、大气条件和光照变化带来的影响,避免将这些因素误判为地表覆盖变化。与传统Siamese CNN4通过简单拼接处理双时相影像的方式不同,所提出的IMAF模块能够实现全局与局部特征的多尺度上下文融合。近年来基于Transformer的方法,如BIT5和ChangeFormer3,取得了优异的检测效果,但其自注意力机制具有O(N2)的计算复杂度。本文提出的框架通过双向注意力机制捕捉细微变化,在降低计算复杂度的同时减少了推理延迟。此外,所提出的设计具有稀疏性感知能力,优于UNet++6,7和SNUNet8等密集多尺度融合结构。结合Ghost模块的稀疏特征卷积使浮点运算量(FLOPs)减少了约50%,同时保持了良好的特征表达能力。因此,该框架在精度与效率之间实现了良好权衡,适用于资源受限环境下的可靠部署。
本研究的主要贡献包括:(i)一种轻量级变化检测器,与基于变换器的方法相比,参数数量减少19倍,但仍达到具有竞争力的F1分数。(ii)一种交互式多尺度注意力融合模块,能够在不产生传统自注意力机制二次计算成本的情况下获取全局上下文信息。(iii)一种基于Ghost模块的特征稀疏卷积方案,使浮点运算量减少49.4%,同时特征表示质量无任何下降。(iv)在大量基准数据集上进行了广泛的实验验证,展现出更优的效率与精度权衡,以及在现实世界实际应用中的合理可行性。
本文其余部分包含以下章节:第2节全面综述了二值变化检测方法领域的近期研究工作,特别关注深度学习解决方案及其在标准基准上的实现。第3节介绍了所提出方法的理论基础与结构设计,包括时间融合机制和注意力模块的数学表达,以及实验设置特征、数据集、评估指标和实现细节,以确保研究的可重复性。第4节展示了详细的实验结果,包括消融实验,以及与最新的二值变化检测算法的对比,分析了在OSCD和SZTAKI Airchange数据集中不同地理区域的检测能力。第5节总结了研究结论,指出现有方法的局限性,并探讨了变化检测领域未来的研究方向。
遥感领域中的变化检测算法发展已从基于像素的方法显著演变为深度学习框架。早期的变化检测方法主要依赖于代数运算,如图像差值法、图像比值法和变化向量分析,这些方法直接对像素值进行操作以检测时间上的变化9,10。随后发展出另一种方法——分类后比较法,该方法首先对每一时相的图像独立分类,然后通过交叉制表进行比较11。基于对象的变化检测技术则引入了空间上下文信息,并有效缓解了像素级噪声问题,标志着该领域的重要进展2,12。
深度学习技术的出现彻底改变了遥感变化检测领域,并为克服传统方法中的诸多限制开辟了道路。近年来,卷积神经网络(CNN)已成为自动特征提取与变化分类的标准架构13,14。用于变化检测的Siamese NestedUNet14和Siamese Swin-Unet15因其密集连接的Siamese网络拓扑结构而成为重要创新,该结构有助于在网络层级中有效保留定位信息。
由于多种混杂因素的存在,高分辨率光学遥感中的双时相变化检测问题仍然难以解决,为此已提出基于注意力机制的多尺度Transformer网络,并采用精心设计的特征融合策略16。所提出的EGMT-CD框架引入了针对异构图像对的边缘引导多模态Transformer,以应对因云层覆盖而无法获取同源图像的情况17。DASUNet等架构通过改进的梯度流,在CDD数据集上相较SNUNet-24提升了0.85%的F1指数,突破了全尺度特征融合中人工深度学习的瓶颈18。混合型CNN-Transformer模型通过在特征学习中额外增强频率分量的代价,以更高成本处理假阴性问题19。然而,混合U形Transformer网络20在局部-全局特征融合以及小尺度周期性变化区域的检测方面仍存在困难。相较于二分类任务,多任务语义变化检测以及精确的位置定位与类别识别更为复杂21,22。双时相相关性可通过交叉注意力机制成功建模,且无需对网络结构进行显著修改14,23。基于视角-语言范式的表达方式也是近期前沿方向,基于CLIP的设计将文本解释融入变化对应关系24,半监督模式则减少了对标注数据的依赖25。Change Mamba提出了时空模型的状态空间模型26,27。多种专用注意力方法的应用已得到验证:包括高光谱异常检测28、多区域目标分类29或有限标签分割30,展示了注意力机制在遥感分析中的灵活性。
| 作者 | 方法/架构 | 技术规格 | 关键创新 & 结果 / 数据集性能 |
| Singh, A. [8] | 传统方法 | 基于像素的差值法,CVA | 数字变化检测框架,多数据集,准确率:65-80% |
| Mas, J.F. [10] | 分类后处理 | 独立时间分类 | 比较方法学分析,热带影像,开放获取:72-85% |
| Lu 等 [9] | 传统方法 | 代数运算,典型变量分析,主成分分析 | 全面的技术对比,多源数据,准确率:70-88% |
| Benedek & Szirányi [23] | 混合马尔可夫模型 | 多层条件框架 | 概率变化建模,Sztaki AirChange,DA:92.1% |
| Blaschke, T. [2] | 基于对象的 | 基于分割的分析 | 空间上下文信息融合,多种高分辨率影像,SA:85-92% |
| Chen 等 [11] | 基于对象的 | 多尺度分割 | 分层目标分析,高分辨率影像,目标分析准确率:87.3% |
| 詹 et al. [12] | 孪生卷积神经网络 | 5层卷积神经网络,卷积核尺寸为3×3 | 用于变化检测的深度孪生网络架构,航空影像,F1:0.847,IoU:0.735 |
| Daudt 等 [4] | 暹罗FCN | FC-EF,FC-Siam-diff,FC-Siam-conc | 早期/晚期融合策略,OSCD,F1:0.431,IoU:0.276 |
| 彭等[26] | UNet++ | 嵌套U型网络,密集跳跃连接 | 多尺度特征聚合,高分辨率卫星影像,F1:0.753,IoU:0.604 |
| Chen & Shi [25] | 时空注意力 | 注意力模块,时序建模 | 时空特征学习,LEVIR-CD,F1:0.887,IoU:0.797 |
| 方等人 [7] | SNUNet-CD | 暹罗嵌套UNet,密集连接 | 信息传输优化,LEVIR:F1:0.897,WHU:F1:0.904 |
| Chen 等 [5] | BIT-CD | ResNet18 + Transformer 编码器 | 二值时间特征学习,OSCD:F1:0.635,LEVIR:F1:0.919 |
| 班达拉 & Patel [3] | ChangeFormer | 分层变换器编码器 | 多尺度变换器注意力,OSCD:F1:0.654,LEVIR:F1:0.905 |
| 宋等人 [27] | ACANet | 轴向注意力 + CNN 主干网络 | 高效的注意力计算,LEVIR:F1:0.901,WHU:F1:0.913 |
| Shi 等[28] | 综述论文 | 全面的人工智能方法调查 | 系统性分析人工智能方法,已分析50多个数据集 |
| Li 等 [14] | AMST-Net | 多尺度变换器,金字塔注意力 | 自适应多尺度特征提取,高分辨率光学图像,mIoU:0.823 |
| 向等人 [15] | EGMT-CD | 边缘引导的多模态架构 | 跨模态特征对齐,异质样本对,F1:0.756 |
| Miao 等 [16] | DASUNet | 密集监督,全尺度融合 | 所有解码器层级的深度监督,CDD:相较于 SNUNet 的 F1 分数提升 0.85% |
| 唐等[29] | 暹罗Swin-UNet | Swin Transformer 与 Unet 融合 | 分层窗口注意力,LEVIR:F1:0.923,WHU:F1:0.925 |
| 吴等 [18] | 混合U型变换器 | UNet++ 骨架 + Transformer 模块 | 全局-局部特征融合,高分辨率图像,IoU:0.851,F1:0.919 |
| 董等人 [20] | ChangeCLIP | 基于CLIP的视觉-语言 | 多模态语义理解,遥感影像对,语义准确率:94.1% |
| 李等人 [21] | SemiCD-VL | 半监督视觉-语言 | 标注需求减少、标签有限、F1:0.889 |
| Chen 等 [22] | ChangeMamba | 状态空间模型(SSMs) | 线性复杂度时间建模,遥感图像,效率:速度快3倍 |
表1:遥感中变化检测方法的概述 请点击此处下载该表格。
先前研究的汇总见表1。传统方法依赖人工设计的特征,难以适应复杂的时空变化31,而深度学习架构(如UNet、FPN、PSPNet)则涉及计算成本较高的密集卷积。现有模型缺乏高效的多尺度融合机制和动态注意力系统。为弥补这些不足,本研究提出一种稀疏特征卷积网络下的交互式多尺度注意力融合方法,旨在捕捉跨尺度的细微变化,同时在遥感任务中保持较高的计算效率,尤其适用于城市及人工建筑结构变化检测。
访问受限。请登录或开始试用以查看此内容。
1. 伦理声明
2. 材料与仪器
3. 数据集准备
4. 预处理
5. 模型构建
表示空间序列长度,D = C 表示特征维度。
为可学习的投影矩阵。

![figure-protocol-6 线性变换方程,Fattemded = Linear([A1→2; A2→1]),神经网络公式。](/files/ftp_upload/69815/69815eq9.jpg)
为其展平形式;
为注意力增强特征;A 为注意力矩阵;Dj 为解码器输出;ϕk,ψj 为编码器/解码器模块;[·;·] 表示通道维度上的拼接;Wout 为输出层卷积核。
图1:提出的方法 请点击此处查看此图的放大版本。

图 2:交叉注意力架构 请点击此处查看此图的放大版本。

图3:交互式交叉注意力架构 请点击此处查看此图的放大版本。
6. 训练程序


7. 评估
访问受限。请登录或开始试用以查看此内容。
通过两个公开可用的基准数据集,将所提出的变更检测方法与已建立的基线方法进行了比较,以评估其在不同光谱分辨率和环境条件下的性能。实验结果表明,该方法在平衡检测精度与误报控制方面具有显著改进,尤其在保持高召回率的同时,相较于传统方法大幅提升了精确度。
...| 数据 | 网络 | 精确率 (%) | 召回率 (%) | F1 (%) |
| OSCD-3 ch. | Siam. [11] | 21.57 | 79.4 | 33.85 |
| OSCD-3 ch. | EF [11] | 21.56 | 82.14 | 34.15 |
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种基于交互式多尺度注意力融合的网络,用于检测双时相卫星图像中的变化。该方法通过引入双向注意力机制,与单向方法不同,实现了具有互补前向和后向注意力信号的完整跨时相特征间交互。前向注意力流通过注意力差异捕获时间上的渐进变化,即从较早到较新的时相数据;而后向获取系统则通过识别突现特征来检验变化的一致性。这种双路径特征已被证明在区分真实地表覆盖变化与噪声方面更为有效,而这一问题正是业务化变化检测系统长期面临的主要挑战之一。
在两个具有挑战性的基准数据集上的实验测试证实了所提出方法在多种地理环境和空间分辨率下的实用性与可行性。在OSCD样本上,该方法实现了36.44%的精确率、79.67%的召回率和50.68%的F1分数,这一结果在需要全面变化检测的场景中尤为突出,因为在这些场景中,漏检真实变化所带来的运行成本远高于误报。较高的召回能力表明,网络在保持合理精确水平的同时,对微小变化的敏感性得到了提升,这一特性在环境监测和灾害评估过程中尤为重要,因为在这些应用中必须检测出每一次变化的发生。对SZTAKI AirChange数据集的评估进一步证明了该网络的多功能性及其在不同复杂程度...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| CUDA Toolkit | NVIDIA Corporation | Version 11.3 | 深度学习计算的 GPU 加速 |
| cuDNN | NVIDIA Corporation | Version 8.2 | 优化的 GPU 深度学习库 |
| Intel 处理器 | Intel Corporation | Core i7 10870H | 用于训练和评估所提出深度学习模型的计算平台 |
| NumPy | 开源 | Version 1.21.0 | 数值数组处理 |
| NVIDIA GeForce | NVIDIA Corporation | GTX 1650 Ti (4 GB VRAM) | 用于加速模型训练的图形处理器 |
| Onera 卫星变化检测(OSCD)数据集 | ONERA | 公开可用的光学 RGB 和多光谱图像数据集,用于训练和评估。 | https://rcdaudt.github.io/oscd/ |
| Python | Python 软件基金会 | Version 3.8 | 用于算法实现的编程语言 |
| PyTorch | Meta AI(开源) | Version 1.12.1 | 开源深度学习框架,用于开发和训练所提出的模型 |
| Scikit-learn | 开源 | Version 1.0.2 | 性能评估指标 |
| SZTAKI 空中变化基准数据集 | SZTAKI | 公开可用的光学 RGB 航拍图像数据集,用于训练和评估。 | http://web.eee.sztaki.hu/remotesensing/airchange_benchmark.html |
| Torchvision | Meta AI(开源) | Version 0.13.1 | 数据集加载与图像变换 |
| Windows 操作系统 | Microsoft | 11 | 操作系统 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可