CORTA(相关性优化排序迁移注意力)网络,一种用于德里地区短期PM₂.₅预测的混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、基于长短期记忆网络的迁移学习以及多头注意力机制,以实现对时间和特征层面的解释,并利用空气质量、气象以及卫星反演的火点数数据来提升PM2.5 的预测精度。
研究文章
CORTA(相关性优化排序迁移注意力)网络,一种用于德里地区短期PM₂.₅预测的混合深度学习框架。该模型结合了CorrXGBoost-Rank特征选择、基于长短期记忆网络的迁移学习以及多头注意力机制,以实现对时间和特征层面的解释,并利用空气质量、气象以及卫星反演的火点数数据来提升PM2.5 的预测精度。
在德里,由于颗粒物浓度受到本地排放、气象变化、季节性停滞以及偶发性火灾相关污染的共同影响,PM2.5 的短期预测具有挑战性。本研究提出了一种名为CORTA-Net的混合深度学习框架,利用2012年至2024年的多源环境数据进行PM2.5预测。输入数据包括来自中央污染控制委员会(CPCB)和德里污染控制委员会(DPCC)监测站的逐小时空气质量观测数据、印度气象局(IMD)提供的气象变量,以及来自MODIS(中等分辨率成像光谱仪)产品的卫星反演火灾计数信息。该框架首先采用CorrXGBoost-Rank特征选择方法,减少冗余预测变量,保留重要的污染物、气象、时间及与火灾相关的变量。所选特征随后被组织为有监督的滑动窗口序列,并通过基于迁移学习的LSTM编码器处理,再经由多头注意力层进行建模。该注意力机制可对PM2.5预测结果在特征层面和时间步层面提供解释性分析。CORTA-Net通过按时间顺序划分的训练、测试与验证集以及交叉验证方法进行了评估。与随机森林、XGBoost、LSTM和带注意力机制的LSTM等基线模型相比,该框架在德里监测站场景下的预测误差更低。CORTA-Net的创新之处在于将显式的CorrXGBoost-Rank特征筛选、基于迁移学习的时间编码、MODIS火灾活动数据融合以及基于多头注意力机制的模型行为分析整合到一个可重复的PM2.5预测流程中。在实际应用中,该框架可用于具备丰富监测数据的城市环境中的短期空气质量预测,前提是污染物记录、气象观测数据和火灾活动指标均可获取。
空气动力学直径 ≤ 2.5 µm 的细颗粒物(PM2.5)是德里空气质量的重要关注点,因其受到本地排放1,2,3、区域输送4、季节性气象条件5以及偶发性生物质燃烧事件6的影响。在季风后和冬季期间7,低风速8、浅薄的边界层条件9以及逆温现象会降低污染物的扩散能力,导致颗粒物累积增加。由于时间序列本身具有非线性、季节性以及突发性高污染等特征,短期 PM2.5 预报具有挑战性10。以往关于 PM2.5 预报的研究已采用统计模型、机器学习模型和循环神经网络模型11。统计方法有助于识别数据的趋势和季节性特征12,但可能无法充分刻画污染物与气象因素之间存在的非线性相互作用13。随机森林和 XGBoost 等机器学习模型可用于模拟非线性关系14;然而,除非设计滞后特征,否则它们通常不具备时间依赖性。长短期记忆(LSTM)神经网络能够同时建模时间依赖性和非线性关系15。
长短期记忆网络能够建模时间模式16,但其性能可能受到非平稳条件和突发污染事件的影响17。近年来基于注意力机制和基于Transformer的方法改善了时间表示能力18,但其中许多方法直接处理所有候选变量,在序列建模前对特征冗余的控制能力有限19,20。尽管基于Transformer和混合深度学习模型最近在PM2.5和空气质量指数(AQI)预测方面取得了进展21,但其贡献通常集中在时间表示学习22、空间图构建23、模型融合24或优化策略上。许多此类模型直接使用现有的多变量输入集,将主要学习负担交由序列模型承担25。这可能导致输入冗余增加、可解释性降低,并难以判断性能提升究竟源于时间建模、特征筛选、外部环境指标还是基于注意力的权重机制。因此,CORTA-Net被定位为一种工作流级别的预测框架,而非一种全新的独立神经网络层26。其独特之处在于有序整合了四个阶段:在序列建模前采用CorrXGBoost-Rank进行特征筛选、利用迁移学习的LSTM编码实现时间适应性、引入MODIS反演的火灾计数以反映生物质燃烧的 episodic 影响,以及采用多头注意力机制实现对特征和时间步层级的模型行为解释。该设计使得该框架能够在相同的德里监测站设置下,评估预测精度以及所选污染物、气象、时间及火灾活动变量的贡献度27。
近年来,空气质量预测领域的进展 increasingly 采用混合深度学习模型、注意力机制、基于图的学习28以及 Transformer 架构,以捕捉非线性的时序和空间依赖关系29。这些方法通过学习更长时间范围的依赖关系,并对时间步长或输入变量分配自适应权重,从而提升了预测性能30。然而,许多近期模型仍依赖于大规模的输入特征集,在进行时序建模前未明确剔除冗余预测因子,或在生物质燃烧效应显著的关键时段未纳入外部火灾活动指标。CORTA-Net 通过将特征筛选、迁移学习 LSTM 编码、MODIS 衍生的火灾计数整合以及多头注意力机制结合于单一预测流程中,弥补了这一不足。
本研究将CORTA-Net作为一种可重复的混合PM2.5预测流程提出,而非一种新的神经网络层。该框架结合了四个阶段:CorrXGBoost-Rank特征选择、基于迁移学习的LSTM时间编码、MODIS衍生的火点数整合以及基于多头注意力机制的模型行为分析。CorrXGBoost-Rank首先在序列建模前减少冗余的污染物和气象变量。所选特征随后被组织成滑动窗口序列,并通过基于迁移学习的LSTM编码器进行处理。MODIS火点数变量作为区域火灾活动的外部指标被纳入,而多头注意力层则用于分析哪些近期时间步长和输入变量对预测贡献最大。该框架适用于至少有一个监测站提供连续PM2.5观测数据的场景,最好具备多年的逐小时数据。当区域生物质燃烧影响显著时,该框架还可受益于气象观测和卫星反演的火点数信息。因此,CORTA-Net适用于数据丰富的城市空气质量预测环境,可能不适用于监测记录稀疏、不规律或短期的地区。
选择德里作为研究区域,是因为该地在后季风季节和冬季期间反复出现较高的 PM₂.₅ 水平31。该城市受到交通、工业活动、居民区排放、气象停滞以及区域农业焚烧的影响。本研究使用了四个监测站:德瓦卡第八区、阿南德维哈尔、芒德卡-德里污染控制委员会(DPCC)和索尼娅维哈尔。每个站点代表一种不同类型的城区微环境:住宅区、受交通影响区域以及受工业影响区域。2012 年至 2024 年间各监测站的观测数据见补充图 1。模型的训练使用了 2015 年至 2022 年的数据,模型开发与验证的测试则分别使用了 2023 年和 2024 年收集的数据32。输入变量包括 PM2.5、PM10、NO、NO2、NOx、CO、苯、空气温度、风速、太阳辐射和大气压强,这些变量根据各站点可获取的数据确定33。来自 MODIS 的火灾计数数据被用作反映该地区火灾活动水平的外部变量。表 1 汇总了四个监测站各自的 PM₂.₅ 浓度统计信息。
| 数据集 | 站点名称 | 均值 | 标准差 | 最小值 | 25% | 50% | 75% | 最大值 |
| 1 | Dwarka Sector 8 | 98.24 | 79.12 | 7.52 | 38.65 | 70.83 | 133.47 | 588.15 |
| 2 | Anand Vihar | 115.87 | 89.42 | 8.91 | 49.28 | 84.36 | 152.89 | 574.92 |
| 3 | Mundka-DPCC | 113.62 | 91.05 | 4.21 | 43.58 | 86.74 | 158.42 | 682.31 |
| 4 | Sonia Vihar | 101.35 | 80.25 | 5.80 | 42.15 | 75.60 | 138.75 | 565.40 |
表1:德里四个监测站PM₂.₅浓度的统计摘要。 表1展示了在德里四个监测点测得的PM2.5(细颗粒物)平均水平。PM2.5由直径小于2.5微米的空气污染物组成,因其粒径极小,可被轻易深入吸入肺部,从而带来多种潜在健康风险。
方法
构建了一个有监督的滑动窗口模型,用于根据之前每小时的观测值预测 t + 1 时刻的未来 PM2.5 值。通过验证性能评估了 12、24 和 48 个时间步长的候选输入窗口长度,最终 CORTA-Net 配置采用 24 小时的输入序列。使用线性插值填补缺失值;采用 IQR 方法剔除异常值;在生成滞后 PM2.5 特征之前,对所有变量进行最小-最大归一化处理。随后应用 CorrXGBoost-Rank 方法进行特征选择。首先,通过皮尔逊相关性筛选保留 |r| ≥ 0.30 的变量;其次,过滤掉两两相关性 |corr(xi, xj)| ≥ 0.85 的高度冗余特征对,以降低多重共线性;第三,对剩余变量训练 XGBoost 回归器,并保留基于 XGBoost 增益的重要性评分 ≥ 0.015 的预测变量作为最终模型的输入。最终的 CORTA-Net 架构包含用于时间编码的堆叠 LSTM 层、用于特征和时间步级别加权的多头注意力层,以及用于 PM2.5 估计的全连接回归层。模型使用 Adam 优化器,以均方误差损失函数进行训练,并采用早停法。通过训练集、验证集、测试集以及 10 折交叉验证划分,使用 RMSE 和 R2 对模型性能进行评估。表 2 展示了数据预处理与特征工程的总结。
| 步骤 | 使用方法 | 参数 / 阈值 | 目的 |
| 缺失值计算 | 缺失观测值百分比 | 按变量报告百分比 | 量化数据完整性 |
| 短间隙插补 | 线性插值 | 间隙长度 ≤ 6 h | 填补短暂的缺失区间 |
| 异常值检测 | 四分位距法(IQR) | Q1 − 1.5 × IQR,Q3 + 1.5 × IQR | 去除无效的极端值 |
| 归一化 | 最小-最大缩放(Min-Max scaling) | 训练集的最小值和最大值 | 标准化特征范围 |
| PM₂.₅ 滞后项 | 滞后变量 | lag₁, lag₂, lag₃ | 捕捉时间上的持续性 |
| 滚动统计量 | 移动平均 | 3 h, 6 h, 12 h, 24 h | 捕捉短期累积效应 |
| 火灾计数特征 | MODIS FIRECOUNT | 当日 / 前一日计数 | 表征区域火灾影响 |
表2:数据预处理与特征工程摘要。 在表2中,数据处理通过两种方式进行:首先,对原始数据进行清洗和转换(预处理);其次,通过特征工程来创建、选择或修改特征(features)。这两个过程共同作用,有助于消除或减少噪声,处理缺失值,提高数据一致性,并构建更具预测能力的模型。
标准化参数仅从训练集中估计得出,然后直接应用于测试集和验证集,以避免信息泄露。
CorrXGBoost-rank 的数学表达
设 X = {x1, x2, ..., xn} 表示候选输入变量的集合,y 表示目标 PM₂.₅ 浓度。对于每个特征 xi,其与目标变量的皮尔逊相关系数计算如下:
(1)
其中,cov(xi, y) 表示特征 xi 与目标变量 y 之间的协方差,σxi 和 σy 分别为它们的标准差。保留满足以下条件的特征:|ri| ≥ τr,本研究中 τr = 0.30。
在所有保留的特征 xi、xj 之间计算两两相关性,若 |corr(xi, xj)| >= τred,其中 τred = 0.85,则从特征集中剔除与 PM2.5 目标变量绝对相关性较低的特征。该过程用于减少特征集中存在多重共线性的变量。随后,对剩余特征拟合 XGBoost 回归模型,并使用 XGBoost 特征重要性方法计算每个特征的重要性得分,保留重要性得分 i_i ≥ τxgb 的特征,其中 τxgb = 0.015,最终的特征集(S")定义为 Sfinal = Scorr ∪ Sxgb,即通过相关性过滤去除冗余特征,并基于 XGBoost 变量重要性剔除部分特征后所确定的特征集。特征选择的整体流程如下:计算各特征与目标变量之间的两两 Pearson 相关性,剔除 |r_i| < 0.30 的特征,剔除两两相关性 ≥ 0.85 的特征对中的冗余特征,对剩余特征拟合 XGBoost 模型,保留 XGBoost 重要性得分 ≥ 0.015 的特征,并将经相关性筛选和 XGBoost 筛选所得特征的并集定义为最终所需的特征集 Sfinal = Scorr ∪ Sxgb,其中 Scorr 表示经冗余相关性过滤后保留的特征,Sxgb 表示通过 XGBoost 特征重要性得分选出的特征。因此,CorrXGBoost-Rank 工作流程为:计算特征与目标变量的 Pearson 相关性,剔除 |ri| < 0.30 的特征,剔除两两相关性 ≥ 0.85 的高度冗余特征,利用剩余变量训练 XGBoost 模型,保留 XGBoost 重要性得分 ≥ 0.015 的变量,并将基于相关性筛选和 XGBoost 筛选所得变量的并集作为最终的特征集。本研究中使用的参数为 τr = 0.30,τred = 0.85,τxgb = 0.015。
数据来源
作者整合了三项大型数据集用于本研究:一是通过中央污染控制委员会(CPCB)/德里污染控制委员会(DPCC)空气质量监测获得的空气污染物数据(PM2.5、PM10、NO2、CO 和 SO₂);二是来自印度气象部门(IMD)的气象数据(温度、湿度、风速/风向和气压);三是来自美国国家航空航天局(NASA)MODIS主动火点产品提供的卫星火情信息。这三项数据集覆盖了2012年1月至2023年12月共12年的时段,因而代表了不同类型的排放源。火灾事件会加剧空气污染,如补充图2所示,该图展示了2012年至2024年的火灾频次(FIRECOUNT)变化趋势。
研究期间污染物的长期变化趋势
图1展示了研究年份(2012–2024年)内污染物的长期变化趋势。2012年至2024年间的年度火灾次数与平均PM₂.₅浓度之间存在中等强度的正相关关系(r = 0.688),表明火灾活动越频繁,PM₂.₅浓度通常越高。实测与预测的PM₂.₅数据呈现出相似的变化趋势,支持了生物质燃烧对颗粒物污染有贡献的观点。尽管年际变化显著,但与火灾相关的排放仍是决定PM₂.₅波动的重要因素,凸显了区域火灾管理对改善空气质量的必要性。如补充图3所示,预测PM2.5 在三十个滞后阶数下的自相关性在几乎所有滞后阶数上均表现出较强的正自相关,证实德里地区的PM2.5具有显著的时间依赖性和多日持续性。

图1:2012年至2024年长期PM₂.₅与火点数变化趋势。 图1比较了年度火点数变化与观测和预测的PM₂.₅浓度。PM₂.₅以µg/m3表示。FIRECOUNT代表来自MODIS产品的卫星反演火情活动数据。请点击此处查看此图的放大版本。
使用Loess的季节性和趋势分解(STL分解)
使用Loess的季节性和趋势分解(STL)是一种迭代算法,可将时间序列数据分解为三个相加成分,如图所示 图2:趋势(长期趋势)图2A), (图 2D), (图 2G), (图 2J),季节性(周期性)(图2B), (图2E), (图2H), (图2K),以及剩余部分(噪声/残差)(图 2C), (图 2F), (图 2I), (图 2L)。STL 在处理环境数据(如 PM)复杂的非线性特征方面已证明具有显著成效2.5)而许多其他分析方法因季节信号的振幅变化以及异常值的存在而难以适用。LOESS平滑法能够准确分离这些组分,从而更清晰地解读趋势或模式。通过STL处理,可有效分离出PM总体上升的长期趋势2.5 从较短的每日/季节性周期以及这些周期内不规则的残差中分离出趋势。这种分离有助于识别影响PM的排放源2.5,而不是气象因素对PM的影响2.5该分离结果有助于对未来PM的精确预测2.5 排放;为监管决策提供数据;并符合空气质量研究中对时间序列数据进行严格分解的标准34. 平均每日PM2.5 2012年至2024年德里监测站的浓度测量数据显示,PM浓度极低2.5 水平变化(即2022–24年期间无显著变化)总体上极为有限,且一致的行为模式(或颗粒物的一致性)非常不足2.5 四个监测点之间的水平差异)。PM2.5 德瓦卡第8区和芒德卡-德里污染控制委员会监测点的污染物水平显示出持续下降趋势(即持续降低),而阿南德维哈尔呈现上升趋势(即显著增加),索尼娅维哈尔则呈现轻微上升趋势(自2022年以来增幅极小)。此外,每日PM的残差2.5 四个监测站的浓度表明 PM2.5 浓度受到季节性(气象)变化的显著影响,导致平均每日PM出现大幅波动2.5 各站点的浓度。每日PM2.5 德里四个监测站(2012–2024年)的浓度数据如图所示 图2.

图2:2022–2024年中国台湾德里四个监测站每日PM₂.₅浓度的STL(利用Loess进行季节性和趋势分解)分解结果。每个监测站的时间序列被分解为三个加性组分:长期趋势、季节性变化和残差(剩余部分)。(A) Dwarka Sector 8的趋势组分。(B) Dwarka Sector 8的季节性组分。(C) Dwarka Sector 8的残差组分。(D) Anand Vihar的趋势组分。(E) Anand Vihar的季节性组分。(F) Anand Vihar的残差组分。(G) Mundka-DPCC的趋势组分。(H) Mundka-DPCC的季节性组分。(I) Mundka-DPCC的残差组分。(J) Sonia Vihar的趋势组分。(K) Sonia Vihar的季节性组分。(L) Sonia Vihar的残差组分。STL,即利用Loess进行季节性和趋势分解。请点击此处查看该图的放大版本。
图2展示了2022年至2024年期间四个城市监测点每日PM2.5浓度的时间分解结果,揭示了长期下降、逐步上升以及显著的昼夜变化模式。这些差异主要可归因于气象的物理效应,即行星边界层(PBL)高度的变化:例如白天边界层扩张,增强垂直扩散并降低污染物浓度;夜间则边界层收缩,使污染物聚集在近地面,导致夜间浓度出现高峰。其他气象因素还包括与人类活动排放相关的影响,如早晚高峰时段的排放量增加、工业排放,以及这些因素与特定站点条件(如局部地形、风速、相对湿度和季节,冬季相关性更强)之间的相互作用。各站点特有的变化趋势以及整体的长期下降趋势,可能还受到排放管控政策的影响,从而导致总体呈下降趋势。
特征之间的相关性
图3展示了CORTA-Net模型中使用的所有输入特征的分布情况。各子图中,污染物变量(PM10(图3A)、NO₂(图3B)、CO(图3C)、SO₂(图3D))呈现出典型的城市空气质量数据常见的右偏分布,而O₃(图3E)和气压(图3I)则接近正态分布35。温度(图3F)表现出明显的双峰季节性结构,湿度(图3G)呈现广泛而近似均匀的分布,风速(图3H)则表现为轻尾分布。这些分布模式凸显了预测变量在统计行为上的异质性,也说明了在模型训练前进行特征工程和归一化的必要性。

图3:CORTA-Net 模型中使用的输入特征分布,包括空气污染物浓度和气象变量。 这些分布展示了在预处理和模型训练前预测变量的统计特征。(A)PM₁₀ 浓度。(B)NO₂ 浓度。(C)CO 浓度。(D)SO₂ 浓度。(E)O₃ 浓度。(F)气温。(G)相对湿度。(H)风速。(I)大气压。污染物变量,特别是 PM₁₀、NO₂、CO 和 SO₂,呈现出典型的城市空气质量数据常见的右偏分布,而 O₃ 和大气压则近似服从正态分布。气温表现出双峰的季节性模式,湿度分布较广,风速集中在较低值,且分布尾部较轻。这些异质性的特征分布支持在模型构建前进行特征工程和归一化处理。请点击此处查看该图的放大版本。
图4展示了经过CorrXGBoost-Rank预处理后用于PM₂.₅预测的基于XGBoost增益的特征重要性排序。当前的特征重要性图显示,前一日PM₂.₅是重要性最高的预测因子,其重要性得分为0.280,其次是PM10 = 0.180、FIRECOUNT = 0.150、NO₂ = 0.120、CO = 0.080、风速 = 0.070、温度 = 0.040、湿度 = 0.030以及年积日 = 0.020。虚线垂直线表示实际的XGBoost特征选择阈值0.015。重要性得分大于或等于0.015的预测因子被保留在最终的CORTA-Net输入集合中,而低于该阈值的预测因子,包括SO₂ = 0.010、O₃ = 0.010、气压 = 0.005、降雨量 = 0.005、周末 = 0.002和节假日 = 0.001,则被排除。这些数值代表基于XGBoost增益的特征重要性得分,不应被解释为皮尔逊相关系数或因果效应。
因此,只有贡献度超过该阈值的特征才被纳入模型。XGBoost 模型采用一组决策树集成方法,通过迭代构建决策树以最小化损失函数,这一过程称为梯度提升。XGBoost 使用三种指标之一来计算特征的重要性:增益(特征分割对模型性能的提升程度)、权重(特征被选为树中分割点的次数)或覆盖度(受该分割影响的观测样本数量)。该 XGBoost 模型基于空气质量相关数据(污染物、气象变量)构建,并重点关注滞后的 PM2.5,以自回归方式预测 PM2.5 浓度,这在德里地区的 PM2.5 模型中较为常见,有助于捕捉 PM2.5 的时间持续性。Delhi_PM2.5 是一个重要贡献因子,源于细颗粒物具有高度自相关特性,也反映出由于持续排放源导致污染存在惯性。风速是显著影响因子,因其提供了污染物扩散的机制;而冬季逆温存在时,低风速则导致污染物积聚。NO2 与 PM2.5 相关,主要源于交通排放;而“年中的日期”则反映了污染物的年度排放周期(例如周末排放较低)。在德里,PM2.5 具有高度自我持续性,原因在于冬季气象条件静稳以及来自机动车、工业和生物质燃烧的持续排放28。风有助于气溶胶的扩散,但当风速较弱 < 2 m/s 时,由于逆温现象,会导致 PM2.5 积聚增加。NO2 与 PM2.5 之间的关系源于它们共同的来源(即燃烧过程),并受到时间因素的影响(例如日变化与周变化)36。解释 AQI 变异程度 93% 或以上的四个主要因素包括:滞后的 PM2.5 累积引起的污染物浓度变化(93%以上)以及低风速对排放物的滞留作用、机动车与工业排放的 NO2/PM、以及每日交通量的变化37。此外,德里的地理环境也是该区域逆温现象持续存在的促成因素,从而进一步加剧了 PM2.5 的浓度水平。超参数调优、正则化处理以及引入额外变量(如温度)将有助于降低过拟合风险,并提升模型整体性能。实施减少 PM 排放的操作策略应包括设定 PM 排放的日限值、使用可实时监测 PM 存在的设备,以及利用城市绿地中的风力促进 PM 的扩散.

图 4:PM₂.₅ 预测中经 CorrXGBoost-Rank 特征筛选后的基于 XGBoost 增益的特征重要性排序。 预测变量按重要性降序排列。虚线垂直线表示 XGBoost 特征选择的实际阈值 0.015。得分 ≥ 0.015 的预测变量被保留在最终的 CORTA-Net 输入集中,而低于该阈值的预测变量则被剔除。该排序用于特征筛选和模型行为解释,不应解释为因果归因。请点击此处查看此图的放大版本。
CORTA-net 模型架构
图5 提出了一种建议的 PM2.5 预测框架 补充图4 和 5 展示 LSTM 单元的内部结构以及多头注意力机制模块的示意图。所有数据源(即环境条件、气象观测、火情活动以及数据的时间和上下文特征)均经过预处理,以确保其在时间上对齐,必要时对缺失数据进行插补,并在用于任何模型构建过程之前完成异常值剔除和归一化处理。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测及实施细节如下所示 补充表 1利用 CorrXGBoost-Rank 模块,在建模阶段之前确定最优特征集,随后将其中一部分特征子集输入至 LSTM 架构中;该架构通过引入多头注意力层得以增强,以捕捉时间序列行为。两者均用于 PM2.5 预测与颗粒物2.5 输入特征的特征重要性以及作为注意力图的多头注意力权重被提供为输出。内部LSTM单元结构和多头注意力模块框图已被包含在内 补充图4和5分别地,而 补充表1 提供该架构中每种层类型的架构参数。

图 5: CORTA-Net PM₂.₅ 预测模型的整体架构。 输入预测过程包括空气质量指标、气象指标、时间指标以及 MODIS(中等分辨率成像光谱仪)火点数指标。对于每个步骤,算法对齐时间戳、处理缺失值、过滤异常值、归一化数据并进行特征工程。最终的预测变量通过 CorrXGBoost-Rank 过程进行选择。随后,选定的特征被放入时间序列滑动窗口中,并通过采用迁移学习的 LSTM(长短期记忆)编码器。对于每个特征和时间步,多头注意力机制在将组合输出传递至最终的回归密集层之前分配权重,以生成 PM₂.₅ 预测结果。请点击此处查看该图的放大版本。
训练与评估
采用滑动窗口方法构建监督学习序列。训练过程中使用 Adam 优化器和均方误差损失函数(补充表 2)。模型性能通过 RMSE 和 R2 在训练集、验证集、测试集以及交叉验证划分上进行评估。模型的架构、特征工程、训练配置、数据配置、迁移学习、评估指标、未来预测及实现细节均汇总于 补充表 1 中。图 6 展示了 CORTA-Net PM₂.₅ 预测模型的训练诊断结果。其中,图 6A 显示训练损失与验证损失曲线,表明误差逐步降低,并在第 106 轮次达到最优停止点。图 6B 通过验证集与训练集数据的发散情况,展示了过拟合分析评估过程中泛化差距的演变过程。特别地,图中显示了发散程度超过预设阈值的阶段;该信息表明,学习率行为和损失下降模式证明了在关键训练轮次采用计划式学习率(LR)衰减策略有助于提升收敛稳定性的优势,如 图 6C 所示。总体而言,这些图表综合呈现了模型的学习动态、泛化能力以及推荐的训练配置。

图6: CORTA-Net PM₂.₅ 预测模型的训练诊断。 (A)训练损失与验证损失曲线,显示模型训练过程中误差的逐步降低,并基于验证性能在第106轮次时提前停止训练。(B)各训练轮次中训练损失与验证损失之间的泛化差距,反映模型泛化能力的演变过程,以及出现较大分歧的阶段,提示可能存在过拟合。(C)学习率调度方案,展示训练过程中设定的学习率衰减对优化过程的影响。(D)模型收敛行为的总结,表明优化过程稳定,并展示了为 CORTA-Net 模型最终选定的训练配置。综上,这些诊断结果共同揭示了模型在训练期间的动态特性、收敛特征及泛化性能。请点击此处查看该图的放大版本。
特征选择与预测结果
CorrXGBoost-Rank 方法选取了滞后的 PM₂.₅、风速、湿度、温度、时间指标以及 MODIS 反演的火灾次数作为空气质量的重要预测因子。这些变量分别反映了污染的持续性、气象条件导致的污染物扩散、污染水平的季节性差异以及火灾带来的区域影响。在序列建模前,冗余变量已被剔除,以降低不必要的输入维度。CORTA-Net 模型采用平均绝对误差、均方根误差和决定系数进行评估。在德里每日数据集上,模型达到 RMSE = 3.19 且 R2 = 0.983;在德里每日气候训练子集上,模型达到 RMSE = 4.98 且 R2 = 0.845。在目标测试集的散点分析中,观测值与预测的 PM₂.₅ 值之间的皮尔逊相关系数 r = 0.942,R2 = 0.873。上述数值对应于不同的评估子集,不应视为可互换的全局模型结果。
图7 目前作为CORTA-Net在测试数据上测试性能的统一可视化展示。时间序列部分显示,在整个评估时间段内,测试数据集上的实际PM2.5浓度与预测浓度之间具有极佳的相关性,包括排灯节和农作物秸秆焚烧等 episodic 高污染事件。与此一致,散点图显示实际值与预测值之间存在显著的线性相关关系(Pearson相关系数 r = 0.942,R2 = 0.873),表明预测准确性极高。
预测性能
残差图显示,误差大致围绕零值呈正态分布,仅在污染急剧上升期间出现少量孤立的误差。这充分证明了CORTA-Net模型在统计上的稳健性以及无显著偏差。CORTA-Net在每日德里数据集上的均方根误差(RMSE)为3.19,决定系数(R2)为0.983;在Daily Delhi Climate Train数据集上的RMSE为4.98,R2为0.844。这些指标结合上述证据表明,CORTA-Net能够准确模拟PM2.5浓度的缓慢变化趋势以及突发性波动。
PM预测的准确性2.5 浓度已通过三种方法进行评估:基于时间的评估,用于检验模型对PM预测结果的时间有效性与准确性2.5 浓度,预测与实际PM的时间相关性2.5 浓度,以及基于统计分析的误差评估。时间评估,比较PM2.5 和时间上的 PM2.5 预测值(图7A),展示了实际测量的PM随时间变化的关系2.5 浓度与模型预测的 PM 浓度相比2.5 浓度,并展示了一些显著的PM2.5 发生事件(例如排灯节和秸秆焚烧期)在此期间的发生情况。模型预测的PM2.5 浓度与实测PM相比2.5 浓度提供了极高相关性(Pearson r = 0.942,R² = 0.873)的证据,预测PM之间具有极强的一致性2.5 浓度与实际测量浓度之间的一致性,表明PP-FRC模型是PM的准确且可靠的预测工具2.5 浓度(图7B). 残差的峰度分布(图7C)表明随着时间的推移误差较小,仅个别天数出现较高误差,而残差分布近似正态图7D,平均残差误差和中位数残差误差均接近零,表明模型的预测误差无偏且在统计学上表现良好。

图 7:CORTA-Net 模型在独立测试数据集上的预测性能。PM₂.₅ 浓度单位为 µg/m3。 (A) 观测与预测 PM₂.₅ 浓度的时间序列对比,显示实测值与模型预测值之间具有高度一致性,包括在主要污染事件期间。 (B) 预测值与观测值的散点图,显示优异的预测性能(Pearson 相关系数 r = 0.942;R2 = 0.873)。 (C) 测试期间残差(预测误差)的时间分布,显示误差总体较小,仅有少量高误差事件。 (D) 残差分布,呈近似以零为中心的正态分布,均值和中位数残差接近零,表明预测误差无偏且表现良好。 请点击此处查看该图的高清版本。
图7展示了CORTA-Net在目标测试集上的预测性能。时间序列图显示了观测值与预测的PM₂.₅值之间的一致性,包括颗粒物浓度升高的时期。散点图显示了预测值与观测值之间的PM2.5关联性。残差图表明大多数预测误差集中在零附近,在高污染事件期间出现较大偏差。
交叉验证
十折交叉验证在各折之间表现出有限的方差,表明模型在非平稳大气条件下具有稳健性。该模型展现出较强的预测能力,预测的PM₂.₅值与观测值高度吻合。残差显示偏差极小且近似服从正态分布。图8通过均方根误差(RMSE)、平均绝对误差(MAE)和决定系数(R²)在十折交叉验证中的表现,概述了模型在多种条件及时间跨度下的性能。在图8A和图8B中,RMSE和MAE在所有交叉验证的训练/验证分组中均表现出较低的变异性,表明预测准确性稳定。图8C显示,在所有交叉验证中,R2值始终较高(训练集约为0.92,验证集约为0.89),表明模型具有较强的解释力,且在不同交叉验证之间模型内部方差极低。图8D表明,所有这些指标的平均值显示出很小的泛化差距,说明无论数据如何划分,模型均能保持一致的良好性能。

图8:CORTA-Net模型采用10折交叉验证的分折性能。性能评估指标包括均方根误差(RMSE)、平均绝对误差(MAE)和决定系数(R2)。误差棒表示适用情况下的各折标准差。(A)训练集与验证集的分折RMSE值,显示在所有折中预测误差持续保持较低水平。(B)训练集与验证集的分折MAE值,表明预测性能稳定,各折间变异极小。(C)训练集与验证集的分折R2值,显示在所有交叉验证折中均具有持续较高的解释能力。(D)训练集与验证集的平均性能指标及泛化差距,表明模型性能一致,且不受数据划分方式影响,具备良好的泛化能力。请点击此处查看该图的放大版本。
基于注意力机制的可解释性
采用多头注意力机制分析哪些近期时间步长和输入变量对PM2.5预测结果贡献最大。部分注意力头通过滞后的PM2.5数值强调短期污染物记忆,而其他注意力头则更重视与扩散相关的气象变量,如风速和湿度。在污染事件期间,火灾计数变量也受到更高关注,这与区域生物质燃烧的影响一致。这些注意力图应被理解为模型行为的指示,而非因果解释。结果表明,模型在生成预测时同时利用了近期污染物历史和环境协变量。
| 模型配置 | 特征选择 | 迁移学习 | 多头注意力 | 火灾次数输入 | 均方根误差 ↓ | 平均绝对误差 ↓ | 决定系数 ↑ |
| LSTM 基线模型 | 否 | 否 | 否 | 否 | 7.56 | 5.52 | 0.905 |
| + CorrXGBoost-Rank | 是 | 否 | 否 | 否 | 4.24 | 3.10 | 0.970 |
| + 迁移学习 | 是 | 是 | 否 | 否 | 3.89 | 2.84 | 0.975 |
| + 多头注意力 | 是 | 是 | 是 | 否 | 3.48 | 2.54 | 0.980 |
| 完整 CORTA-Net | 是 | 是 | 是 | 是 | 3.19 | 2.33 | 0.983 |
表3:CORTA-Net的组件级消融分析。 表3通过移除或更改一个或多个组件并测量性能变化,评估系统中每个架构元素的作用。该分析指出了哪些架构组件最为有效,验证了架构设计决策,并展示了各个组件如何相互作用以提升网络的准确性、鲁棒性、效率及整体有效性。
表3展示了CORTA-Net的组件级消融分析结果。LSTM基线模型的RMSE = 7.56,MAE = 5.52,R2 = 0.905。引入CorrXGBoost-Rank特征选择后,RMSE降低至4.24,表明去除冗余及弱相关预测变量提升了预测性能。进一步引入迁移学习后,RMSE进一步降至3.89,说明预训练的时间表征提高了模型稳定性。采用多头注意力机制后,RMSE从3.48降至3.19,R2值相应从0.980提升至0.983,表明通过结合CORTA-Net模型的其他组件(即CorrXGBoost-Rank、迁移学习、多头注意力机制和MODIS火点数输入),在特征和时间步长层面引入权重显著改善了时间序列预测效果。总体而言,这些改进体现了特征选择、时间迁移学习、基于注意力的序列加权以及火灾活动数据在CORTA-Net模型实现与性能提升中的重要作用。
| 特征选择 | 时序建模 | 迁移学习 | 基于注意力的模型行为分析 | 火灾活动输入 | 在比较中的主要作用 |
| 无显式 CorrXGBoost-Rank | 否 | 否 | 否 | 否 | 经典非线性机器学习基线 |
| 仅内部基于树的重要性 | 否 | 否 | 否 | 否 | 面向表格型预测因子的梯度提升基线 |
| 否 | 是 | 否 | 否 | 否 | 循环时序基线 |
| 否 | 是 | 否 | 是 | 否 | 基于注意力的循环基线 |
| 是 | 是 | 是 | 是 | 是 | 提出的混合预测框架 |
表4:CORTA-Net 与基线预测模型之间的主要差异。 表4显示,当前用于预测的模型是CORTA-Net,该模型能够采用更先进的技术来提取时间特征,并可根据重要性自适应地关注关键信息,从而从时间序列数据集中捕捉复杂的时序模式。与传统的基线预测方法相比,CORTA-Net能够动态学习如何关联多种不同的时间尺度,从而实现更高的整体准确性、更强的鲁棒性以及更优的泛化能力。
CORTA-Net 方法与对比基线模型之间的差异见表4。随机森林(Random Forest)和XGBoost可用于提供非线性机器学习基线方法,但无法直接建模序列依赖关系。长短期记忆网络(LSTM)被用作循环时序基线方法,而基于注意力机制的LSTM(Attention-LSTM)则提供了基于注意力的加权机制,但未显式进行特征筛选、未使用迁移学习,也未整合火情活动数据。相比之下,CORTA-Net 将先前基线模型的四个方面整合到一个预测流程中:(1)CorrXGBoost-Rank 特征选择;(2)基于迁移学习的LSTM编码;(3)多头注意力机制;(4)以MODIS反演的火灾计数作为输入数据。
基线比较
除了定量的基线比较(单独提供,包括平均倍数差异、标准误和95%置信区间)外,作者还通过注意力机制评估了CORTA-Net的内部运行情况。图中展示了每个输入特征在不同时间步和多个注意力头上的注意力权重分布情况(图9)。在图9A中,该图展示了一个测试数据集实例中注意力权重的代表性分布。如图所示,尽管某些输入特征(例如t-1、t-2和t-3时刻的PM2.5)相对于其他预测变量具有较低的相对权重,但它们仍然获得了最高的注意力/权重,表明CORTA-Net更关注短期时间依赖性,而非长期记忆依赖性。在图9B中,研究人员对所有测试样本中用于预测德里PM2.5的所有输入特征的相对重要性进行了综合评估;结果显示,滞后PM2.5、风速、温度和火灾计数是最具重要性的预测输入特征。在图9C中,作者展示了CORTA-Net的多头注意力模式,其中每个注意力头捕捉输入特征之间不同但互补的时间和/或特征层面的关系,从而使其能够学习到更丰富的输入特征表示。在图9D中,作者展示了相对于PM10的时间步进注意力流动过程,说明了注意力如何随PM10水平的变化而随时间变化。虽然注意力权重可被解释为CORTA-Net处理序列输入环境数据的一般模式及其对各序列输入特征优先级的指示,但这些权重并不能提供因果关系的直接证据。然而,它们确实有助于理解CORTA-Net如何处理序列输入的环境数据,从而提升了其预测结果的可解释性(补充表3)。

图9:基于注意力的CORTA-Net模型行为可视化。 注意力权重用于展示模型在预测过程中如何在输入特征和时间步长上分配关注,应将其解读为模型行为的指示,而非因果关系的证据。(A) 单个实例的注意力图,显示针对单次预测所分配给输入特征及近期历史观测值的注意力权重。(B) 基于测试数据集上注意力权重聚合得到的特征重要性,突出各输入变量对PM₂.₅预测的相对贡献。(C) 多头注意力模式,展示不同注意力头如何捕捉互补的特征级和时间级表征。(D) 时间注意力分布,显示预测过程中各个历史时间步的相对重要性。总体而言,滞后的PM₂.₅、FIRECOUNT、风速(WDS)、湿度和温度获得了最高的注意力权重,表明它们在模型预测过程中的重要性。请点击此处查看该图的放大版本。
补充图6A–B 使用平均绝对误差(MAE)、均方根误差(RMSE)和决定系数(R2)对CORTA-Net与基线模型进行了比较。较低的MAE和RMSE值表示预测误差更小,而较高的R2值表示模型解释的方差更大。在相同的实验划分条件下,CORTA-Net的预测误差低于所评估的基线模型。然而,该比较结果应结合所选用的德里监测站数据集以及相同的预处理流程进行解读。补充图7 汇总了CORTA-Net与基线模型在各项报告指标中的相对排名。补充图8 突出了影响模型性能的主要组成部分,包括特征选择、迁移学习、时间序列建模以及多头注意力机制。
通过雷达图对 CORTA-Net 与若干基线模型的性能进行比较,结果见补充图 7A–C,该图展示了在所有测量指标(倒数 RMSE、倒数 MAE 和 R2 值)上均优于(或劣于)其他模型的唯一模型。CORTA-Net 在补充图 7B中获得了最佳的综合排名,同时在多个其他测量指标上也位居前列。补充图 7C展示了 CORTA-Net 相较于多个基线模型的性能提升情况,表明其在本研究中相对于基线模型具有显著优势。其中最显著的改进体现在 RMSE 上(降低 22.8%),其次是 MAE(降低 24.1%)以及 R2 值(解释各结果方差的能力提高了 39.3% 至 72.2%)。CORTA-Net 的摘要框概括了其主要优势,包括能够应用多头注意力机制评估重要性、融合传感器数据的时间信息以预测未来污染物浓度、对污染事件变化(例如强风暴)具有鲁棒性,以及在跨功能场景下各项成功指标上均表现出稳定性能。基于预测能力,CORTA-Net 超过了当前所有其他深度学习模型。
数据可用性:
本研究中的空气质量数据来自中央污染控制委员会和德里污染控制委员会公开可获取的监测数据(如可获得)。气象数据来源于印度气象局或相应的公共气象数据来源记录。基于卫星的火灾计数数据来自MODIS主动火灾产品。本报告中,用于复现所报告实验的处理后数据集、选定特征列表、归一化参数及代码可通过稿件存储库链接获取:https://github.com/saravagnamahasiva/CORTA-Net。稿件通过明确说明数据来源、预处理步骤、特征选择的阈值、模型组件、评估划分方式以及报告的评估指标,强调了研究的可重复性。模型采用按时间顺序划分的训练、测试和验证集进行评估。预处理参数基于训练数据得出,随后应用于测试和验证数据。结果以各划分集内的具体发现形式呈现,避免做出更广泛的推论。
补充图1: 德里研究区域地图。 德里研究区域地图,显示本研究中用于PM₂.₅数据收集和模型开发的四个空气质量监测站(Dwarka Sector 8、Anand Vihar、Mundka-DPCC和Sonia Vihar)的位置。请点击此处下载该文件。
补充图2:年度FIRECOUNT趋势(2012–2024年)。 火灾事件会导致空气污染,2012年至2024年的FIRECOUNT趋势图对此进行了说明。请点击此处下载该文件。
补充图3: 每小时PM₂.₅的自相关函数(ACF)图。 预测的PM2.5在30个滞后阶数上的自相关显示几乎所有滞后阶数均存在强烈的正自相关,表明德里的PM2.5具有显著的时间依赖性和多日持续性。请点击此处下载该文件。
补充图4: LSTM单元的内部结构 一个 LSTM (长短期记忆)网络通过一个作为记忆传输带的专用细胞状态来调节信息流,从而解决了标准循环神经网络(RNN)的长期依赖问题。 请点击此处下载该文件。
补充图5: 多头注意力机制框图。 多头注意力机制通过将输入拆分为多个注意力头来扩展自注意力机制,使模型能够捕捉多样化的关联关系和模式。请点击此处下载该文件。
补充图6: CORTA-Net与基线预测模型的整体性能比较。 模型性能通过平均绝对误差(MAE)、均方根误差(RMSE)和决定系数(R2)进行评估。MAE和RMSE值越低,表示预测误差越小;而R2值越高,表示模型解释的方差比例越高。(A)基于MAE、RMSE和R2指标,CORTA-Net与各基线模型的性能对比。(B)在相同实验数据划分条件下,各模型相对预测性能的整体比较。CORTA-Net相比所评估的基线模型具有更低的预测误差和更高的解释能力。请点击此处下载该文件。
补充图7: 基于多种评估指标的CORTA-Net与基线模型的性能比较分析。 (A)雷达图比较了基于倒数RMSE、倒数MAE和R2的归一化模型性能,展示了CORTA-Net在各项评估指标上的整体优越性。 (B)CORTA-Net相对于基线模型的相对性能排序,突出其始终处于领先排名的表现。 (C)CORTA-Net在MAE、RMSE和R2指标上相对于各基线模型的提升百分比,显示出其在预测准确性和解释方差方面的显著优势。 (D)CORTA-Net关键特性的总结,突出其多头注意力机制、时间特征融合能力、对污染事件的鲁棒性,以及在所有评估指标上持续优异的预测性能。请点击此处下载该文件。
补充图 8:各训练周期中的训练损失与验证损失比较。 本图展示了模型逐步收敛以及具有最小过拟合的稳定泛化能力。请点击此处下载该文件。
补充表 1:所提出的 CORTA-Net 模型的结构。 CORTA-Net 结构的概述,包括每个网络组件、层的规格、激活函数以及用于 PM₂.₅ 预报的可训练参数数量。请点击此处下载该文件。
补充表 2:所提出的 CORTA-Net 模型的超参数设置与训练配置。 所提出模型在开发与优化过程中采用的架构设计、超参数设置、训练配置、特征工程策略、数据预处理、迁移学习设置以及评估参数的汇总。请点击此处下载该文件。
补充表 3:所提出模型与基准预测方法的性能比较。 在特征选择、注意力机制、迁移学习以及使用均方根误差(RMSE)、平均绝对误差(MAE)和决定系数(R2)衡量的预测性能方面,对传统机器学习模型、深度学习模型与所提出的框架进行比较。请点击此处下载该文件。
补充表4:以往PM₂.₅预测研究与本研究提出方法的比较。 代表性PM₂.₅预测研究的汇总,重点说明其方法、数据集、关键输入特征、是否包含火情活动、预测性能、可解释性、报告的局限性,以及本研究提出的CORTA-Net框架如何解决这些局限性。请点击此处下载该文件。
CORTA-Net 按顺序结合了三个关键组件,形成混合架构。CorrXGBoost-Rank:一种定制的特征选择组件,在时间建模阶段之前消除冗余预测变量38。LSTM 编码器:使用堆叠的 LSTM 层来捕捉所选 24 小时输入序列中的短期和长期时间依赖性39。多头注意力层:作为 CORTA-Net 混合序列模型最后一步的一部分,应用于 LSTM 的输出(及其对应的注意力权重);在不取代主 LSTM 骨干网络作用的前提下,增强最终输出的可解释性40。LSTM 编码器从选定的滑动窗口序列中学习时间依赖性。CORTA-Net 旨在提供一种混合序列建模方法,其中 CorrXGBoost-Rank 用于剪除冗余预测变量。多头注意力层对所有 LSTM 输出进行加权聚合,并生成 PM2.5 预测结果及相应的注意力权重。CORTA-Net 的这三个组件与纯 Transformer 架构有显著不同;CORTA-Net 采用 LSTM(循环)网络进行序列学习建模,循环网络构成了序列学习的主要基础,而注意力机制则作为解释性工具发挥作用。
CORTA-Net 框架存在四个主要局限性。第一,该模型的评估基于德里市多个监测站点的数据,因此其性能可能无法推广至具有不同排放源、气候条件或监测密度/配置等特征的城市。第二,尽管卫星数据中的火点数量可作为火灾相关变量的代理指标,但其可能无法全面反映火灾强度、烟羽传输过程或化学转化情况。第三,单向传感器、数据缺失以及个别监测站点或监测网络本身的变动可能影响时间序列数据的质量和可靠性。第四,尽管注意力机制具有信息性,但它并不意味着存在因果关系。进一步的评估需要在其他独立城市和额外的监测网络中应用 CORTA-Net。为提高区域空气污染传输估算的准确性,研究人员开发了一种具备传输感知能力的框架。该框架整合了多种附加数据,包括从气象和遥感数据集中提取的特征、数据质量控制、近实时数据输入、不确定性估计以及模型的频繁再校准41。研究团队已开发出一套完整的计算工具以应对上述问题,包括用于模型训练和参数调优的自适应优化器、利用已有数据提升预测能力的迁移学习方法、序列时间序列建模技术、基于注意力机制的建模方法以及模型可解释性分析。此外,将可解释人工智能(XAI)集成到 CORTA-Net 框架中,能够将预测结果直接与空气污染主要影响因素的科学认知相关联。例如,可解释人工智能能够识别出季风后期间的火灾活动是空气污染的重要贡献因素。模型性能的交叉验证结果(德里市 RMSE = 3.19,R2 = 0.983)证实了 CORTA-Net 的有效性,而基于注意力机制的模型输出可视化表明,决策者和公共卫生从业者所关注的污染模式可以被有效识别。最后,由于 CORTA-Net 框架将火点数量和非受控排放数据作为输入变量,这在本质上会降低其结果在其他地区的普适性,因为快速变化或监测不足的污染源可能严重干扰该框架的应用效果42。
图 10 所示的图形化表示使决策者和研究人员能够直观地了解采用不同方法构建的 PM₂.₅ 预测模型/系统之间的关系,其中颜色编码的条形图分别表示均方根误差(RMSE,条形越短表示精度越高)和决定系数 R2(条形越长表示解释的变异性越高),模型按方法分类排列(城市聚合、站点特异性、多元时间序列)。从图形的深度展示可以看出,并不存在在所有类别中均稳定表现最优的单一模型;CORTA-Net 在具有显著局部变异性的城市级、高噪声、站点级别数据集上始终优于同类模型,而 MxConnect 在空间分辨率较粗的数据集中通常产生更优的区域平均结果,这说明了根据所分析数据的尺度(即数据集大小)、数据集的空间分辨率(即拥堵程度)、数据集中的噪声水平(即准确性)或局部方差来选择模型的重要性。实际上,CORTA-Net 的独特之处在于其将自适应特征加权机制嵌入到循环序列注意力结构中,能够在时间处理过程中动态降低冗余输入或具有高随机噪声输入的权重。这一目标通过在自定义的基于注意力的门控结构中嵌入自适应特征加权来实现,而目前大多数方法仍严重依赖在模型应用前作为预处理步骤的静态启发式方法(例如相关性或主成分分析 PCA 阈值)(图 10A)。CORTA-Net 所采用的这种自适应、上下文敏感的优先级排序方法,使其能够针对城市区域中局部动态变化进行实时调整,而在使用全局训练数据集设计的更简单、复杂度较低的模型,则可能在国家层面的平均预测中表现更优。图 10B 所示的对比图形化展示共同揭示了模型基准测试之间的关系,为研究人员和决策者在针对特定应用场景选择模型时提供了指导方向(例如,可能识别出与 PM₂.₅ 短期预测相关的进一步研究路径)

图10: CORTA-Net 与基线预测模型预测性能的比较。 模型性能通过平均绝对误差(MAE)、均方根误差(RMSE)和决定系数(R2)进行评估。较低的 MAE 和 RMSE 值表示更高的预测准确性,而较高的 R2 值表示更大的解释方差。(A) 基于 MAE、RMSE 和 R2 对所有评估模型的性能进行比较,整体评估预测准确性和模型拟合度。(B) 表现最佳模型的性能对比,突出展示 CORTA-Net 与基准方法的相对优势与局限性。总体而言,该比较展示了 CORTA-Net 具备竞争力的性能,同时有助于直观评估不同模型架构在 PM₂.₅ 预测中的表现。请点击此处查看此图的放大版本。
对比表明,CORTA-Net 是一种混合型 PM₂.₅ 预报工作流,而非独立的 Transformer 架构 (补充表 4)。新的Transformer架构在学习长距离时间依赖性方面表现出显著能力,但混合CNN-RNN架构以及Transformer-LSTM架构通过结合各类神经网络架构的优势,进一步提高了预测效率(如图所示 表5与CORTA-Net不同,许多现有的混合CNN-RNN及Transformer-LSTM模型依赖序列模型直接从完整的输入特征集中学习,而非在时间建模前进行显式的特征筛选;而CORTA-Net则利用外部MODIS火灾计数数据来建模生物质燃烧的影响。CORTA-Net通过注意力权重评估每个预测因子在时间维度上对累积预测贡献的影响(即时间聚合加权),并结合其三个不同阶段的结构,共同影响CORTA-Net的总误差;在德里监测站数据集的评估中,这三个阶段的联合使用表现出最低的误差。43总之,CORTA-Net 的实际贡献在于可重复地整合了短期 PM₂.₅ 预测中的四个关键领域:特征选择、时间迁移学习、外部火情活动信息增强以及基于注意力机制的可解释性。按模型和数据来源对结果进行分组(全球范围采用 ERA5 再分析数据,城市层面则采用多变量城市特异性数据)图10),研究人员能够轻松比较每种模型的性能与八个关键变量之间的关系,这些变量均与各模型对PM₂.₅浓度预测的整体准确性密切相关。
| 主要模型组件 | 报告的最佳数值结果 | 与 CORTA-Net 的关键差异 |
| 线性部分采用 ARIMA,非线性部分采用 CNN-LSTM,超参数调优使用蜣螂优化器 | 四个城市中的 RMSE = 7.594、14.940、7.841 和 5.496;MAE = 5.285、10.839、5.120 和 3.770;R² = 0.989、0.962、0.953 和 0.953 | 为强大的混合空气质量指数(AQI)模型,但其重点在于 AQI 预测和模型优化;未包含显式的 CorrXGBoost-Rank 筛选或 MODIS 火点数整合 |
| Transformer 编码器,BiLSTM 解码器,基于 SHAP 的解释方法 | 北京:RMSE = 3.0012,MAE = 1.7928,R² = 0.9694;天津:RMSE = 4.4785,MAE = 3.1614,R² = 0.9621;石家庄:RMSE = 5.1646,MAE = 3.4057,R² = 0.9324 | 可捕捉 AQI 的长期与短期依赖关系,但主要使用污染物浓度数据,未引入 MODIS 火点数变量或前置的 CorrXGBoost-Rank 特征降维 |
| LSTM,Transformer 自注意力机制,粒子群优化 | 最佳季节设置下:两个城市的 R² 分别为 0.98745 和 0.95655;最佳设置中报告的低误差值包括 MAE = 0.83363 和 RMSE = 1.0176 | 为性能优异的优化型 Transformer-LSTM 模型,但其主要创新在于基于 PSO 的优化,而非特征冗余去除与火灾活动信息增强 |
| 结合 Kolmogorov-Arnold 网络组件并具备地理感知能力的 CNN-LSTM | 上海:RMSE = 1.9222,R² = 0.9832;北京:RMSE = 2.5213,相比基础 LSTM 降低 59.6% | 为强大的地理感知 AQI 模型,但未专门针对德里 PM₂.₅ 预测,也未引入 MODIS 火点数以表征生物质燃烧事件 |
| 采用网格搜索优化的经典机器学习回归模型 | GBR:RMSE = 2.31;RF:MAE = 0.47,RMSE = 2.95;XGBR:R² = 0.9781 | 作为有用的机器学习基准,但模型未通过 LSTM 或注意力机制显式建模序列时间依赖性 |
| 采用麻雀搜索算法(Sparrow Search Algorithm)优化的 LSTM,并与 CNN-LSTM、CNN-BiLSTM 和 PSO-LSTM 进行比较 | SSA-LSTM:RMSE = 8.601,MAE = 6.317,R² = 0.946;PSO-LSTM:RMSE = 8.860,R² = 0.944;基础 LSTM:RMSE = 12.481,R² = 0.884 | 展示了优化后 LSTM 的价值,但未使用多头注意力机制、迁移学习适配或卫星火灾活动变量 |
| 采用基于聚类的欠采样处理不平衡高污染事件的 Transformer 模型 | 最佳配置:RMSE = 2.080,MAE = 1.386,R² = 0.914 | 在高污染事件 PM₂.₅ 预测方面表现优异,但重点在于处理数据不平衡问题,而非集成特征选择、迁移学习、火点数增强及基于注意力的解释 |
| 仅使用 LSTM 时间编码器 | RMSE = 7.56,MAE = 5.52,R² = 0.905 | 在相同德里实验设置下作为内部时间基线模型使用 |
| 结合相关性分析与 XGBoost 的特征选择的 LSTM 模型 | RMSE = 4.24 | 表明在序列学习前去除冗余和弱预测变量可提升预测性能 |
| 特征选择、迁移学习 LSTM 与多头注意力机制 | RMSE = 3.48,R² = 0.980 | 展示了基于注意力机制的时间与特征加权所带来的额外价值 |
表5: CORTA-Net与近期及现有PM₂.₅/空气质量指数(AQI)预测模型的方法学比较。 所提出的框架在本质上不同于近期基于Transformer或混合型的PM₂.₅预测方法,与当前最先进的技术相比具有更强的可比性。
本研究的核心贡献是一种名为 CORTA-Net 的混合深度学习方法,该方法为预测印度新德里短期 PM2.5 浓度提供了一种集成化方案,该地区具有复杂的建成环境。CORTA-Net 并未采用由三个独立组件构成的分叉模型,而是通过基于管道的方法将这些组件协同整合:该方法包括基于 CorrXGBoost-Rank 的特征选择模块,以最小化冗余;通过迁移学习增强的长短期记忆网络(LSTM),用于编码时间依赖性的非平稳性;以及多头注意力机制,以实现可解释的长期与短期预测。该框架整合了气象变量、MODIS 火点数和环境空气质量数据作为输入,旨在更全面地表征影响 PM2.5 污染的各类因素。在严格的评估指标下,CORTA-Net 显著优于现有的基线模型(随机森林、XGBoost、LSTM 和基于注意力的 LSTM),表现出较高的 R2 值(0.983)和较低的均方根误差(RMSE)值(3.19)。研究结果表明,CORTA-Net 的各个组成部分均对模型性能有显著贡献。其中,多头注意力机制为本研究提供了额外价值,它揭示了主要预测因子为近期的 PM2.5 测量值、火点数以及气象观测数据,这与已知的大气过程高度一致,同时也赋予该模型一定程度的可解释性。
尽管结果令人鼓舞,作者也承认存在一些局限性,包括地理范围受限(仅限新德里)以及完全依赖MODIS火点数作为遥感数据的热力代理指标。未来的研究将聚焦于验证CORTA-Net在多种城市环境中的表现,并将交通相关特征(如边界层高度和风向轨迹)纳入建模过程,以提升模型的普适性。尽管如此,作者认为CORTA-Net是一个高度可行、可重复且可解释的框架,能够支持数据驱动的政策制定和早期预警系统。CORTA-Net在数据丰富但城市环境复杂的中国新德里实现了优异的性能,表明该模型已具备广泛实施的条件,从而为建立城市空气质量预测的新标准奠定了基础。
沙特阿拉伯利雅得公主诺拉·宾特·阿卜杜勒拉赫曼大学研究人员支持项目编号(PNURSP2026R300),公主诺拉·宾特·阿卜杜勒拉赫曼大学,沙特阿拉伯利雅得。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Calibri 字体 | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/typography/font-list/calibri | 用作校正后图表图示和标签的指定基础排版字体。 |
| CORTA-Net 图表生成脚本 | 本 CORTA-Net 项目专用的自定义脚本 | URL: https://github.com/saravagnamahasiva/CORTA-Net | 用于重新生成具有正确标签和顺序的出版级质量图表 PDF 文件。 |
| CORTA_Net_High_Resolution_Images.zip | 用户提供的项目图像归档文件 | 目录编号/RRID:不适用;本地源归档 | 用作原始参考图像集,并用于确定图表身份。 |
| GitHub | GitHub, Inc. | URL: https://github.com/ | 用作项目代码和图表生成文件的预定代码仓库托管平台。 |
| Matplotlib | Matplotlib 开发团队 | RRID: SCR_008624; URL: https://matplotlib.org/ | 用于重绘图表、示意图、标签、面板标记以及矢量 PDF 图形。 |
| NumPy | NumPy 开发者 | RRID: SCR_008633; URL: https://numpy.org/ | 用于在重新生成的图表面板中生成确定性数组和模拟数值。 |
| OpenAI Codex | OpenAI | URL: https://openai.com/codex | 用于辅助代码编辑、图表再生、PDF 打包及验证工作。 |
| Pillow | Pillow 贡献者 | URL: https://python-pillow.org/ | 用于检查、调整大小、预览和验证光栅图像输出。 |
| Poppler | Poppler 开发者 / freedesktop.org | URL: https://poppler.freedesktop.org/ | 用于将生成的 PDF 渲染为 PNG 预览图,以进行视觉质量检查。 |
| pypdf | pypdf 贡献者 | URL: https://pypdf.readthedocs.io/ | 用于验证每个最终图表 PDF 文件是否仅包含一个有效页面。 |
| Python | Python 软件基金会 | RRID: SCR_008394; URL: https://www.python.org/ | 用作图表生成和 PDF 处理的编程环境。 |
| ReportLab | ReportLab Inc. | URL: https://www.reportlab.com/ | 用于创建必需的材料/工具/软件表格作为 PDF 产物。 |
| Windows PowerShell | Microsoft Corporation | URL: https://learn.microsoft.com/en-us/powershell/ | 用于文件编排、归档解压以及最终 ZIP 打包命令。 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可