$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
本研究未涉及人类参与者或脊椎动物实验对象。所使用的所有数据均为来自SMM的公开商品价格序列,无需伦理审批。因此,本研究无需也不曾申请伦理批准。
本部分阐述了为实证检验核心假设而实施的全面且严谨的研究设计。内容详细说明了所评估的十三种深度学习模型的数学表达形式与架构细节、精确的训练方案以及正式的评估指标。整体方法学流程在图1中以图示形式进行了概括。

图 1:研究方法的示意图概述。 该图展示了完整的实验流程,包括数据划分、仅在铜价格序列上进行模型训练、在铜测试集上进行评估,以及在独立的铝和锌序列上进行样本外验证。虚线反馈回路表示为分析各个架构组件的贡献而进行的结构化消融实验。请点击此处查看该图的放大版本。
该示意图展示了完整的实验流程。整个过程首先仅使用铜(Cu)价格序列进行模型开发。该序列按时间顺序被划分为训练集(80%)、验证集(10%)和测试集(10%)。随后,十三种不同的深度学习架构仅在铜(Cu)训练数据上进行训练,并通过验证集监控早停机制,实现超参数优化。主要基准是评估这些模型在独立保留的铜(Cu)测试集上的表现。关键的是,为了评估模型的泛化能力,将完全相同的已训练模型不加修改地应用于预测完全独立的铝(Al)和锌(Zn)价格序列,以此构成严格的样本外测试。最后,通过结构化的消融实验(虚线反馈回路),分解并分析各个架构组件(例如注意力机制、双向处理和卷积层)对性能的贡献。
模型架构与数学表达
我们设计并实现了一系列共13种深度学习模型,其架构复杂性从简单的循环网络逐步提升至复杂的多组件混合模型。所有模型均具有相同的核心目标:学习一个从长度为 L = 30 的历史价格窗口 Xt = [Pt−L, Pt−L+1, …, Pt−1] 到后续价格 yt = Pt 的映射关系
。
模型家族定义如下:
基线循环模型
GRU:一种简化的循环网络,通过更新门(zt)和重置门(rt)调节信息流。隐藏状态 ht 的计算方式如下:
(1)
(2)
(3)
(4)
其中 X 为Sigmoid激活函数,
表示哈达玛积,xt 为时刻 t 的输入。最终的隐藏状态 hL 经过一个线性输出层。公式1–4 改编自 Cho 等人14。
LSTM:利用输入门(it)、遗忘门(ft)和输出门(ot)来维持细胞状态(Ct),从而对长期记忆实现更明确的控制。
双向模型(BiGRU 和 BiLSTM)
这些模型包含两个独立的循环层,分别以正向和反向处理序列。在每个时间步的最终隐藏表示是拼接结果
,理论上可捕获固定输入窗口内来自过去和未来的上下文信息。
基于注意力增强的模型(GRU-注意力与LSTM-注意力)
在由最终循环层生成的隐藏状态序列 H = [h1, h2, …, hL] 上应用加性注意力机制。上下文向量被定义为加权和:
(5)
(6)
(7)
其中,αi 表示分配给第 i 个历史时间步的注意力权重。包含相关历史自适应摘要的上下文向量 c 被输入到最终的预测层。公式 5–7 改编自 Bello 等人47。
CNN–混合模型(CNN–GRU 和 CNN–LSTM)
在循环层之前添加一个带线性整流单元(ReLU)激活函数的一维 CNN 层。
复杂混合模型
这些架构结合了多个组件(例如 CNN–BiGRU–Attention、CNN–BiLSTM–Attention)。它们在复杂性方面代表了当前最先进的水平,旨在将局部模式提取(CNN)、双向上下文建模以及自适应时间加权(注意力机制)整合到一个统一的框架中。
所有模型均采用一致的隐藏状态维度(循环层为128个单元,CNN层为64个滤波器),并以单个线性输出层作为最终结构。这种受控设计确保了性能差异源于架构选择,而非模型容量调参的不一致。因此,可训练参数的数量在此谱系中显著增加。
训练方案、超参数与消融研究设计
表1总结了适用于全部十三个模型的统一且严格的实验配置,以确保公平比较并减轻过拟合。所有模型均仅使用指定的Cu训练集从零开始训练。采用Adam优化器以最小化均方误差(MSE)损失。在Cu验证集上监控的早停(early stopping)关键技术被统一应用,确保训练在模型对未见Cu数据达到最佳泛化性能时终止,从而防止模型对训练噪声过拟合。
| 参数类别 | 规格 / 数值 | 描述 |
| 核心任务与数据 |
| 预测目标 | 次日价格 | 标准的单步向前预测。 |
| 输入窗口长度(L) | 60个交易日 | 在充分的历史上下文与模型复杂性及训练稳定性之间取得平衡。 |
| 模型开发 |
| 训练集(仅Cu) | 前80%(约2081个观测值) | 用于通过反向传播学习模型参数。 |
| 验证集(仅Cu) | 接下来的10%(约260个观测值) | 用于超参数调优和早停机制;对防止过拟合至关重要。 |
| 测试集(仅Cu) | 最后10%(约260个观测值) | 对模型在样本内(Cu)性能进行最终独立评估。 |
| 模型架构 |
| RNN隐藏单元数 | 128 | 提供足够的表征能力;在所有基于RNN的模型中保持恒定。 |
| CNN滤波器数量 | 64 | 混合模型中CNN层的特征图数量。 |
| 训练过程 |
| 优化器 | Adam | 自适应学习率优化器,可实现稳定且高效的收敛。 |
| 初始学习率 | 1 × 10⁻³ | Adam优化器的标准起始学习率。 |
| 损失函数 | 均方误差(MSE) | 回归任务中的标准损失函数。 |
| 批大小 | 32 | 高效的迷你批训练方式。 |
| 最大训练轮数 | 80 | 训练迭代次数的上限。 |
| 早停耐心值 | 10轮 | 若验证损失在连续10轮内未改善,则停止训练;恢复至最佳轮次的模型权重。 |
| 评估与验证 |
| 主要评估指标 | MAE、RMSE、R² | 从误差幅度和解释方差角度提供互补的评估视角。 |
| 泛化能力测试 | 在完整的Al和Zn序列上进行预测(各2602个观测值) | 模型在Cu数据上训练完成后即冻结。这是在完全不同商品上的纯严格样本外测试。 |
| 消融实验设计 | GRU → BiGRU → BiGRU–Attention → CNN–BiGRU–Attention | 系统性地分离出双向结构、注意力机制和CNN组件的独立影响。 |
表1:关键实验参数与配置。 所有模型所采用的实验设置汇总,包括数据划分、模型架构参数、训练设置以及评估指标。
为了剖析每个结构组件的贡献,设计了一项系统的消融研究。从性能最优的基线模型(GRU)出发,构建了一个逐步递增的“复杂性链”。图2 直观地展示了该复杂性链,呈现了各组件逐步添加的过程。这种逐步递进的方法使得任何预测性能变化均可直接归因于双向性、注意力机制,以及最终引入的卷积神经网络层的逐项增加。该链中每个节点的性能指标为每项复杂性组件在金属价格预测这一特定任务中的价值或负面影响提供了明确的实证依据。

图2:消融研究中使用的复杂性递增链。 该示意图展示了模型结构组件的逐步增加过程,依次从GRU发展到BiGRU、BiGRU–Attention,再到CNN–BiGRU–Attention。这一序列代表了模型复杂度的系统性提升,用于评估各个组件对预测性能的影响。请点击此处查看该图的放大版本。
性能评估指标
模型性能通过三种标准回归指标进行严格量化,以提供关于预测准确性和解释能力的互补性见解。
平均绝对误差(MAE)
衡量误差的平均绝对大小,提供一种稳健且易于解释的偏差度量尺度。
(8)
均方根误差(RMSE)
由于采用了平方运算,对较大的误差更为突出,因此对异常值和重大误差更为敏感。
(9)
决定系数(R2)
表示可由模型预测的目标变量变异所占的比例。
(10)
其中
为真实值的均值。R2 值越接近 1,表示模型对数据中大部分方差具有解释能力。公式 8–10 为标准的回归评估指标48。评估分为两个独立且连续的阶段,以分别评估模型在样本内的基准表现和样本外的泛化能力。(1)阶段一(主要基准测试):全部十三个模型在铜(Cu)数据上完成训练并应用早停法后,在预留的铜测试集上进行评估。(2)阶段二(泛化能力测试):完全相同的模型(参数保持冻结)被直接用于生成铝(Al)和锌(Zn)完整独立价格序列的预测结果,未进行任何重新训练或调整。
可重复性:详细的实验设置
A级铜、铝、锌的日度现货价格(人民币/吨)数据来源于SMM公开平台(https://www.smm.cn/),时间范围为2015年1月5日至2025年9月12日。原始数据及处理后数据已公开存储于公共知识库中(DOI: 10.5281/zenodo.19976985)。数据文件包含date、Cu、Al和Zn四列。日期已转换为datetime格式,并按升序排列。缺失值采用先向前填充再向后填充的方法进行处理。特征变量使用仅在训练集上拟合的z-score标准化方法进行标准化(均值μj,标准差σj,
);相同的均值和标准差被直接应用于验证集和测试集,不再重新拟合。目标变量(Cu、Al或Zn)则分别使用其对应训练集的统计量进行独立缩放。
使用滑动窗口构建输入-输出序列,输入长度为 L = 30 个交易日,预测时域 h = 1(即次日预测)。对于目标指数(0 = Cu,1 = Al,2 = Zn),每个样本定义为 Xi = V[ t - L : t, : ](形状为 30 × 3)和 yi = V[ t + h , k](标量)。为保持时间顺序,不进行数据打乱。数据集按时间顺序划分,无随机性:训练集包含索引 0–2080(共 2,081 个观测值,占 80%),验证集包含索引 2081–2340(共 260 个观测值,占 10%),测试集包含索引 2341–2601(共 261 个观测值,占 10%)。对应的时间范围分别为:2015 年 1 月 5 日至 2023 年 7 月 31 日(训练集)、2023 年 8 月 1 日至 2023 年 10 月 19 日(验证集)、2023 年 10 月 20 日至 2025 年 9 月 12 日(测试集);仓库中的文件提供了具体细节。
随机种子设置如下:主实验种子 = 42,Python、NumPy 和 TensorFlow 的种子均设为 42。权重初始化对输入核使用 Glorot 均匀分布,对循环核使用正交初始化,偏置项初始化为零。软件环境包括 Python 3.10.19、TensorFlow 2.20.0/Keras、NumPy 1.26.4、pandas 2.3.3、scikit-learn 1.7.2 和 Matplotlib 3.10.6。实验在一台配备 Intel Core i7(2.20 GHz)处理器和 32 GB 内存的 Windows 11 电脑上运行,未使用 GPU。
采用 Adam 优化器,学习率 learning_rate = 1×10-3,β1 = 0.9,β2 = 0.999,
,且 weight_decay = 0。损失函数为均方误差(MSE)。使用 ReduceLROnPlateau 学习率调度器监控验证损失,衰减因子为 0.5,耐心值为 5,最小学习率为 1 × 10-5。早停机制的监控指标为 val_loss,耐心值为 10,restore_best_weights = True,min_delta = 0。每个训练周期包括对训练批次的前向传播、MSE 损失计算、反向传播以及 Adam 参数更新。每个周期结束后计算验证损失,并根据该值触发早停或学习率降低。最终恢复验证损失最低的模型用于测试。批量大小为 32,样本按时间顺序输入,不进行打乱(shuffle = False)。
对于CNN混合模型,使用一个包含64个滤波器、kernel_size = 3、stride = 1、padding = 'same'以及使用线性整流单元(ReLU)激活函数的Conv1D层,随后接MaxPooling1D(pool_size = 2)和Dropout(0.15)。在引入注意力机制的模型中,循环神经网络返回完整隐藏序列H,其形状为B × T × C。一个含单个神经元的全连接层生成得分,再通过时间维度上的softmax函数将这些得分转换为注意力权重,上下文向量定义为c = ∑t αt ht。随后是一个包含64个神经元并使用ReLU激活的全连接层、Dropout(0.15)层,以及输出层全连接层。双向模型将前向和后向的隐藏状态(每个64维)进行拼接,得到128维输出;当使用注意力机制时,设置return_sequences = True以保留完整序列(B × T × 128)。
评估采用直接的单步前向预测(非递归)。在计算 MAE、RMSE 和 R2 之前,所有预测值均被逆变换回原始价格尺度。在对铝(Al)和锌(Zn)进行泛化性测试时,输入缩放器使用在铜(Cu)上拟合的结果且不做任何修改,而每种目标金属各自拥有在其自身训练目标上拟合的目标缩放器。在消融研究中,链中所有非架构参数(数据、划分方式、缩放方法、随机种子、训练轮数、批量大小、优化器、学习率、损失函数、早停机制、学习率调度器、dropout)均保持一致,仅改变模型架构。完整的源代码和可复现说明已在 Zenodo 公开提供(10.5281/zenodo.19976985)。所有图表均使用提供的脚本通过 Matplotlib 3.10.6 生成,输出保存为 PDF、SVG 和高分辨率 PNG(600 dpi)格式。所有模型最多训练 80 轮。采用早停机制(容忍轮数 = 10,监控验证损失),所有模型均在达到最大轮数前触发早停。例如,GRU 模型在第 37 轮停止训练(最佳轮次为第 27 轮,最佳验证损失为 0.0040),而结构最复杂的混合 CNN–BiLSTM–Attention 模型在第 23 轮停止(最佳轮次为第 13 轮,最佳验证损失为 0.0072)。全部 13 个模型的停止轮次、最佳轮次及最佳验证损失的完整列表可在 Zenodo 仓库中获取,以确保完全透明和可重复性,同时避免在正文中插入表格造成信息过载。理论讨论部分(Lipschitz 界限、样本复杂度、Rademacher 复杂度、偏差-方差分解、注意力熵以及互信息)是对实验结果的概念性解释,不会改变训练目标或模型实现方式。最后,为评估稳定性,主要实验使用五个不同的随机种子(1、7、21、42 和 2024)重复进行;这些运行中 RMSE 的均值与标准差已在结果部分报告,其中 GRU 模型表现出具有竞争力的平均 RMSE 和较低的方差,表明其在不同随机初始化下具有稳定的性能。