研究文章

深度学习模型复杂度在有色金属价格预测中的比较评估

DOI:

10.3791/71032

2026年6月5日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

对13种金属价格预测架构的系统性重新评估表明,一种简单的门控循环单元优于更复杂的混合模型。在铜数据上训练并在铝和锌数据上测试的模型表现出持续较高的预测准确性,支持在大宗商品价格预测中采用简约方法。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究探讨了增加模型架构复杂性是否能够提高基于深度学习的金融模型的预测准确性。使用2015年1月至2025年9月期间上海有色金属市场铜(Cu)、铝(Al)和锌(Zn)的每日现货价格数据,应用了标准化的预处理流程,包括z-score归一化和滑动窗口序列构建(窗口长度=30,预测步长=1)。系统评估了共十八种模型,包括门控循环单元(GRU)、长短期记忆网络(LSTM)、卷积神经网络–双向LSTM–注意力机制混合模型(CNN–BiLSTM–Attention),以及传统计量经济学模型(自回归积分滑动平均模型和广义自回归条件异方差模型)、机器学习模型(随机森林和极端梯度提升)和基于Transformer的模型。所有深度学习模型均仅在Cu数据上进行训练,并在独立的Al和Zn数据集上进行评估,以检验其泛化能力。结果表明,标准GRU模型在Cu测试集上取得了最低的误差率(平均绝对误差[MAE] = 1032.85;均方根误差 = 1344.30)和最高的解释力(决定系数[R2] = 0.907),同时在Al(MAE = 167.51,R2 = 0.918)和Zn(MAE = 254.23,R2 = 0.952)上也表现出色。消融分析显示,添加注意力机制、双向层和卷积模块等架构组件会降低预测准确性。采用Diebold–Mariano检验进行的统计测试表明,大多数性能差异具有显著性(p < 0.05)。这些发现凸显了不必要的模型复杂性的局限性,并支持在大宗商品价格预测中采用更简单且稳健的方法。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

全球有色金属市场——包括铜(Cu)、铝(Al)和锌(Zn)——是世界经济的关键支柱。这些金属在建筑、制造、交通以及快速发展的绿色能源基础设施中具有基础性作用1,4。因此,其价格动态表现出高度波动性,受宏观经济力量、地缘政治紧张、供应链中断、投机性金融活动以及与能源市场的关联等多重复杂因素共同驱动3,4。准确的价格预测不仅具有学术意义,更是各国政府(战略资源安全)、矿业公司(生产规划)、工业用户(采购决策)和金融机构(风险管理与交易)面临的迫切实际需求5,6

对预测准确性的追求推动了方法论的演进。传统的计量经济学方法——自回归积分滑动平均模型(ARIMA)和广义自回归条件异方差(GARCH)模型——长期以来被用于捕捉线性依赖关系和波动率聚集效应7,8。然而,这些方法在处理非线性、非平稳以及高频噪声时往往表现不佳9。机器学习(ML)技术,如支持向量机和随机森林,通过建模复杂的非线性关系且无需严格的分布假设,实现了显著进步10,11。然而,它们在捕捉长期时间依赖性方面的能力仍然有限。真正的范式转变来自于深度学习(DL)12,尤其是循环神经网络(RNNs)。长短期记忆(LSTM)网络13及其简化版本门控循环单元(GRU)14,15,有效缓解了梯度消失问题,已成为金融时间序列预测(包括金属价格预测)的事实标准16,17,18,19。大量研究已将这些深度学习方法应用于有色金属市场,结果表明其预测精度优于经典基准模型20,21,22,23,24,25,26,27

然而,后续研究在很大程度上追求提升模型架构的复杂性,这一趋势受到其他人工智能(AI)领域创新的推动。该发展路径可归纳为三个协同并进的趋势。首先,与一维卷积神经网络(CNN)相结合,在时间序列建模之前提取局部多尺度特征(例如,CNN–LSTM 或 CNN–GRU)28,29,30。其次,采用双向处理机制(双向LSTM [BiLSTM] 和双向GRU [BiGRU]),通过同时正向和反向处理序列以捕获更丰富的上下文信息31,32。第三,引入注意力机制,使模型能够动态调整历史时间步长的重要性权重33,34。其逻辑上的最终形式是多组件“超级混合”模型,例如 CNN–BiLSTM–Attention 或 CNN–BiGRU–Attention35,36。贯穿这些研究的一个普遍且常为隐含的假设是:架构复杂性等同于预测准确性的提升,从而导致在AI驱动的金融研究文献中出现“复杂性军备竞赛”现象37

这一假设需要进行严格的审视。模型复杂性的增加伴随着显著的成本:可训练参数急剧增多,过拟合风险升高——尤其是在有限且含有噪声的金融数据集上,对计算资源的需求更大,训练时间更长,且可解释性降低38,39。新兴的批评观点已开始报告,在将过于复杂的模型应用于含噪声的中等规模数据集时,会出现收益递减甚至性能下降的现象40,41。注意力机制虽然在自然语言处理等具有清晰语义结构的领域表现强大,但在混乱的价格序列中可能难以学习到有意义的权重分配方案,有可能学习到虚假的相关性,或无法收敛42。尽管存在这些担忧,针对多金属价格预测任务中复杂性与性能之间权衡关系的系统性、直接的实证评估,在现有文献中仍明显缺失。

最近的研究利用多种深度学习方法推进了商品价格预测。有研究提出了一种基于模体的图表示学习方法,用于分析交易图以预测加密货币价格43。基于图神经网络的时间序列深度学习模型被开发用于金融资产价格预测44。时间序列深度学习模型已应用于金融市场的配对交易45。超图神经网络被用于捕捉股票之间的高阶关系,以预测股价走势46。总体而言,这些研究凸显了人们对模型选择日益增长的兴趣,但并未在相同的实验条件下,对简单架构与一系列复杂的混合模型进行系统性比较——本研究正是针对这一空白展开工作。

我们还承认近期基于Transformer的时间序列模型(例如Informer、Autoformer、Temporal Fusion Transformer和PatchTST)。这些模型在长序列预测方面已展现出潜力,但通常需要大量数据。在我们的初步实验中,一个标准的Transformer模型(仅编码器)在相同数据集(2,602个日观测值,窗口长度=30)上训练时表现不佳,在三种金属上的R2值均为负数。这一结果与现有观点一致,即Transformer模型对数据量要求较高,可能不适用于数据受限的大宗商品市场场景。鉴于我们的研究重点是现实中的中频预测环境,我们未将先进的Transformer变体纳入主基准比较,但指出在更大规模数据集上测试这些模型仍是未来重要的研究方向。

本研究通过严格检验“较简单的深度学习架构在预测铜(Cu)、铝(Al)和锌(Zn)日价格方面可优于更复杂的对应模型”这一假设,直接填补了现有研究的空白。我们设计并实施了一个全面的基准测试框架,涵盖十三种最先进的模型——从基础的GRU和LSTM,到CNN–BiGRU–Attention和CNN–BiLSTM–Attention等先进混合架构。分析基于上海有色金属市场(SMM)从2015年1月到2025年9月的大量数据集。关键的是,所有模型仅使用铜价格数据进行训练,而铝和锌数据集则严格保留用于独立的样本外验证,以检验模型的泛化能力。我们还开展了结构化的消融实验,以分离并量化在基础循环模型中引入注意力机制、双向层和卷积模块各自及组合带来的影响,从而直接评估每种复杂性组件的实际价值。

本研究的贡献主要体现在三个方面。首先,本文为基于深度学习的金属价格预测提供了全面的实证基准,给出了清晰、基于证据的模型性能排序。其次,本文对相关领域提出了实质性的批判性观点,挑战了对模型结构复杂性的盲目追求,并指出了过拟合与低效率所带来的显著风险。第三,本文为研究人员、分析师及行业从业者提供了切实可行的指导建议,倡导简约性原则:对于某些金融预测任务而言,结构简单且调优良好的模型(例如门控循环单元GRU)可能不仅足够,甚至更为优越,能够在准确性、速度、鲁棒性和透明度之间实现更优的平衡。本文其余部分结构如下:实验方案部分详细说明了研究方法,包括数据来源、预处理流程、模型结构、训练协议以及评估指标;结果部分展示了实证结果,包括主要的基准测试、消融实验和泛化能力检验;讨论部分则探讨了理论与实践意义、研究局限性以及未来研究方向。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未涉及人类参与者或脊椎动物实验对象。所使用的所有数据均为来自SMM的公开商品价格序列,无需伦理审批。因此,本研究无需也不曾申请伦理批准。

本部分阐述了为实证检验核心假设而实施的全面且严谨的研究设计。内容详细说明了所评估的十三种深度学习模型的数学表达形式与架构细节、精确的训练方案以及正式的评估指标。整体方法学流程在图1中以图示形式进行了概括。

多变量序列预测;CNN-RNN 模型示意图;包含铜、铝、锌的预测输出。
图 1:研究方法的示意图概述。 该图展示了完整的实验流程,包括数据划分、仅在铜价格序列上进行模型训练、在铜测试集上进行评估,以及在独立的铝和锌序列上进行样本外验证。虚线反馈回路表示为分析各个架构组件的贡献而进行的结构化消融实验。请点击此处查看该图的放大版本。

该示意图展示了完整的实验流程。整个过程首先仅使用铜(Cu)价格序列进行模型开发。该序列按时间顺序被划分为训练集(80%)、验证集(10%)和测试集(10%)。随后,十三种不同的深度学习架构仅在铜(Cu)训练数据上进行训练,并通过验证集监控早停机制,实现超参数优化。主要基准是评估这些模型在独立保留的铜(Cu)测试集上的表现。关键的是,为了评估模型的泛化能力,将完全相同的已训练模型不加修改地应用于预测完全独立的铝(Al)和锌(Zn)价格序列,以此构成严格的样本外测试。最后,通过结构化的消融实验(虚线反馈回路),分解并分析各个架构组件(例如注意力机制、双向处理和卷积层)对性能的贡献。

模型架构与数学表达
我们设计并实现了一系列共13种深度学习模型,其架构复杂性从简单的循环网络逐步提升至复杂的多组件混合模型。所有模型均具有相同的核心目标:学习一个从长度为 L = 30 的历史价格窗口 Xt = [PtL, PtL+1, …, Pt−1] 到后续价格 yt = Pt 的映射关系 函数映射,\(f: \mathbb{R}^L \to \mathbb{R}\),数学方程,向量空间概念。

模型家族定义如下:

基线循环模型
GRU:一种简化的循环网络,通过更新门(zt)和重置门(rt)调节信息流。隐藏状态 ht 的计算方式如下:

RNN 更新门方程,zt=σ(Wz·[ht-1, xt]+bz),神经网络计算公式。   (1)

循环神经网络方程,\( r_t = \sigma(W_r \cdot [h_{t-1}, x_t] + b_r) \)。   (2)

神经网络方程,隐状态更新公式,tanh 激活函数。  (3)

循环神经网络方程,h_t=(1−z_t)⊙h_(t−1)+z_t⊙h̃_t,展示更新机制。    (4)

其中 X 为Sigmoid激活函数,静态平衡;ΣFx=0,ΣFy=0,力矩平衡 MA=0;物理示意图;工程分析。 表示哈达玛积,xt 为时刻 t 的输入。最终的隐藏状态 hL 经过一个线性输出层。公式1–4 改编自 Cho 等人14

LSTM:利用输入门(it)、遗忘门(ft)和输出门(ot)来维持细胞状态(Ct),从而对长期记忆实现更明确的控制。

双向模型(BiGRU 和 BiLSTM)
这些模型包含两个独立的循环层,分别以正向和反向处理序列。在每个时间步的最终隐藏表示是拼接结果 动态系统中向量分量的方程,显示公式 ht=[RightArrowht;LeftArrowht]。,理论上可捕获固定输入窗口内来自过去和未来的上下文信息。

基于注意力增强的模型(GRU-注意力与LSTM-注意力)
在由最终循环层生成的隐藏状态序列 H = [h1, h2, …, hL] 上应用加性注意力机制。上下文向量被定义为加权和:

注意力机制公式,\(e_i = v_a^T \tanh(W_a h_i + b_a)\),神经网络概念。 (5)

Softmax函数公式,αi=exp(ei)/Σexp(ej),数学方程。 (6)

静态平衡;求和公式 Σαihi;教育用途 (7)

其中,αi 表示分配给第 i 个历史时间步的注意力权重。包含相关历史自适应摘要的上下文向量 c 被输入到最终的预测层。公式 5–7 改编自 Bello 等人47

CNN–混合模型(CNN–GRU 和 CNN–LSTM)
在循环层之前添加一个带线性整流单元(ReLU)激活函数的一维 CNN 层。

复杂混合模型
这些架构结合了多个组件(例如 CNN–BiGRU–Attention、CNN–BiLSTM–Attention)。它们在复杂性方面代表了当前最先进的水平,旨在将局部模式提取(CNN)、双向上下文建模以及自适应时间加权(注意力机制)整合到一个统一的框架中。

所有模型均采用一致的隐藏状态维度(循环层为128个单元,CNN层为64个滤波器),并以单个线性输出层作为最终结构。这种受控设计确保了性能差异源于架构选择,而非模型容量调参的不一致。因此,可训练参数的数量在此谱系中显著增加。

训练方案、超参数与消融研究设计
表1总结了适用于全部十三个模型的统一且严格的实验配置,以确保公平比较并减轻过拟合。所有模型均仅使用指定的Cu训练集从零开始训练。采用Adam优化器以最小化均方误差(MSE)损失。在Cu验证集上监控的早停(early stopping)关键技术被统一应用,确保训练在模型对未见Cu数据达到最佳泛化性能时终止,从而防止模型对训练噪声过拟合。

参数类别规格 / 数值描述
核心任务与数据
预测目标次日价格标准的单步向前预测。
输入窗口长度(L)60个交易日在充分的历史上下文与模型复杂性及训练稳定性之间取得平衡。
模型开发
训练集(仅Cu)前80%(约2081个观测值)用于通过反向传播学习模型参数。
验证集(仅Cu)接下来的10%(约260个观测值)用于超参数调优和早停机制;对防止过拟合至关重要。
测试集(仅Cu)最后10%(约260个观测值)对模型在样本内(Cu)性能进行最终独立评估。
模型架构
RNN隐藏单元数128提供足够的表征能力;在所有基于RNN的模型中保持恒定。
CNN滤波器数量64混合模型中CNN层的特征图数量。
训练过程
优化器Adam自适应学习率优化器,可实现稳定且高效的收敛。
初始学习率1 × 10⁻³Adam优化器的标准起始学习率。
损失函数均方误差(MSE)回归任务中的标准损失函数。
批大小32高效的迷你批训练方式。
最大训练轮数80训练迭代次数的上限。
早停耐心值10轮若验证损失在连续10轮内未改善,则停止训练;恢复至最佳轮次的模型权重。
评估与验证
主要评估指标MAE、RMSE、R²从误差幅度和解释方差角度提供互补的评估视角。
泛化能力测试在完整的Al和Zn序列上进行预测(各2602个观测值)模型在Cu数据上训练完成后即冻结。这是在完全不同商品上的纯严格样本外测试。
消融实验设计GRU → BiGRU → BiGRU–Attention → CNN–BiGRU–Attention系统性地分离出双向结构、注意力机制和CNN组件的独立影响。

表1:关键实验参数与配置。 所有模型所采用的实验设置汇总,包括数据划分、模型架构参数、训练设置以及评估指标。

为了剖析每个结构组件的贡献,设计了一项系统的消融研究。从性能最优的基线模型(GRU)出发,构建了一个逐步递增的“复杂性链”。图2 直观地展示了该复杂性链,呈现了各组件逐步添加的过程。这种逐步递进的方法使得任何预测性能变化均可直接归因于双向性、注意力机制,以及最终引入的卷积神经网络层的逐项增加。该链中每个节点的性能指标为每项复杂性组件在金属价格预测这一特定任务中的价值或负面影响提供了明确的实证依据。

从GRU到BiGRU的结构示意图;包含双向性和注意力层的神经网络模型架构。
图2:消融研究中使用的复杂性递增链。 该示意图展示了模型结构组件的逐步增加过程,依次从GRU发展到BiGRU、BiGRU–Attention,再到CNN–BiGRU–Attention。这一序列代表了模型复杂度的系统性提升,用于评估各个组件对预测性能的影响。请点击此处查看该图的放大版本。

性能评估指标
模型性能通过三种标准回归指标进行严格量化,以提供关于预测准确性和解释能力的互补性见解。

平均绝对误差(MAE)
衡量误差的平均绝对大小,提供一种稳健且易于解释的偏差度量尺度。

平均绝对误差公式 MAE = 1/N Σ|yi - ŷi|;数学公式示意图。 (8)

均方根误差(RMSE)
由于采用了平方运算,对较大的误差更为突出,因此对异常值和重大误差更为敏感。

均方根误差公式;数学方程;数据分析指标;统计计算 (9)

决定系数(R2
表示可由模型预测的目标变量变异所占的比例。

决定系数公式,\( R^2 \) 方程,回归分析,统计方法。 (10)

其中 静态平衡,ΣF=0,平衡示意图,受力图解,力学概念,教育物理。 为真实值的均值。R2 值越接近 1,表示模型对数据中大部分方差具有解释能力。公式 8–10 为标准的回归评估指标48。评估分为两个独立且连续的阶段,以分别评估模型在样本内的基准表现和样本外的泛化能力。(1)阶段一(主要基准测试):全部十三个模型在铜(Cu)数据上完成训练并应用早停法后,在预留的铜测试集上进行评估。(2)阶段二(泛化能力测试):完全相同的模型(参数保持冻结)被直接用于生成铝(Al)和锌(Zn)完整独立价格序列的预测结果,未进行任何重新训练或调整。

可重复性:详细的实验设置
A级铜、铝、锌的日度现货价格(人民币/吨)数据来源于SMM公开平台(https://www.smm.cn/),时间范围为2015年1月5日至2025年9月12日。原始数据及处理后数据已公开存储于公共知识库中(DOI: 10.5281/zenodo.19976985)。数据文件包含date、Cu、Al和Zn四列。日期已转换为datetime格式,并按升序排列。缺失值采用先向前填充再向后填充的方法进行处理。特征变量使用仅在训练集上拟合的z-score标准化方法进行标准化(均值μj,标准差σj静态平衡;方程 ε=1×10⁻⁶;数学表达式;科学计算。);相同的均值和标准差被直接应用于验证集和测试集,不再重新拟合。目标变量(Cu、Al或Zn)则分别使用其对应训练集的统计量进行独立缩放。

使用滑动窗口构建输入-输出序列,输入长度为 L = 30 个交易日,预测时域 h = 1(即次日预测)。对于目标指数(0 = Cu,1 = Al,2 = Zn),每个样本定义为 Xi = V[ t - L : t, : ](形状为 30 × 3)和 yi = V[ t + h , k](标量)。为保持时间顺序,不进行数据打乱。数据集按时间顺序划分,无随机性:训练集包含索引 0–2080(共 2,081 个观测值,占 80%),验证集包含索引 2081–2340(共 260 个观测值,占 10%),测试集包含索引 2341–2601(共 261 个观测值,占 10%)。对应的时间范围分别为:2015 年 1 月 5 日至 2023 年 7 月 31 日(训练集)、2023 年 8 月 1 日至 2023 年 10 月 19 日(验证集)、2023 年 10 月 20 日至 2025 年 9 月 12 日(测试集);仓库中的文件提供了具体细节。

随机种子设置如下:主实验种子 = 42,Python、NumPy 和 TensorFlow 的种子均设为 42。权重初始化对输入核使用 Glorot 均匀分布,对循环核使用正交初始化,偏置项初始化为零。软件环境包括 Python 3.10.19、TensorFlow 2.20.0/Keras、NumPy 1.26.4、pandas 2.3.3、scikit-learn 1.7.2 和 Matplotlib 3.10.6。实验在一台配备 Intel Core i7(2.20 GHz)处理器和 32 GB 内存的 Windows 11 电脑上运行,未使用 GPU。

采用 Adam 优化器,学习率 learning_rate = 1×10-3β1 = 0.9,β2 = 0.999,静力平衡方程,\( \epsilon = 1 \times 10^{-7} \),用于物理计算的公式。,且 weight_decay = 0。损失函数为均方误差(MSE)。使用 ReduceLROnPlateau 学习率调度器监控验证损失,衰减因子为 0.5,耐心值为 5,最小学习率为 1 × 10-5。早停机制的监控指标为 val_loss,耐心值为 10,restore_best_weights = True,min_delta = 0。每个训练周期包括对训练批次的前向传播、MSE 损失计算、反向传播以及 Adam 参数更新。每个周期结束后计算验证损失,并根据该值触发早停或学习率降低。最终恢复验证损失最低的模型用于测试。批量大小为 32,样本按时间顺序输入,不进行打乱(shuffle = False)。

对于CNN混合模型,使用一个包含64个滤波器、kernel_size = 3、stride = 1、padding = 'same'以及使用线性整流单元(ReLU)激活函数的Conv1D层,随后接MaxPooling1D(pool_size = 2)和Dropout(0.15)。在引入注意力机制的模型中,循环神经网络返回完整隐藏序列H,其形状为B × T × C。一个含单个神经元的全连接层生成得分,再通过时间维度上的softmax函数将这些得分转换为注意力权重,上下文向量定义为c = ∑t αt ht。随后是一个包含64个神经元并使用ReLU激活的全连接层、Dropout(0.15)层,以及输出层全连接层。双向模型将前向和后向的隐藏状态(每个64维)进行拼接,得到128维输出;当使用注意力机制时,设置return_sequences = True以保留完整序列(B × T × 128)。

评估采用直接的单步前向预测(非递归)。在计算 MAE、RMSE 和 R2 之前,所有预测值均被逆变换回原始价格尺度。在对铝(Al)和锌(Zn)进行泛化性测试时,输入缩放器使用在铜(Cu)上拟合的结果且不做任何修改,而每种目标金属各自拥有在其自身训练目标上拟合的目标缩放器。在消融研究中,链中所有非架构参数(数据、划分方式、缩放方法、随机种子、训练轮数、批量大小、优化器、学习率、损失函数、早停机制、学习率调度器、dropout)均保持一致,仅改变模型架构。完整的源代码和可复现说明已在 Zenodo 公开提供(10.5281/zenodo.19976985)。所有图表均使用提供的脚本通过 Matplotlib 3.10.6 生成,输出保存为 PDF、SVG 和高分辨率 PNG(600 dpi)格式。所有模型最多训练 80 轮。采用早停机制(容忍轮数 = 10,监控验证损失),所有模型均在达到最大轮数前触发早停。例如,GRU 模型在第 37 轮停止训练(最佳轮次为第 27 轮,最佳验证损失为 0.0040),而结构最复杂的混合 CNN–BiLSTM–Attention 模型在第 23 轮停止(最佳轮次为第 13 轮,最佳验证损失为 0.0072)。全部 13 个模型的停止轮次、最佳轮次及最佳验证损失的完整列表可在 Zenodo 仓库中获取,以确保完全透明和可重复性,同时避免在正文中插入表格造成信息过载。理论讨论部分(Lipschitz 界限、样本复杂度、Rademacher 复杂度、偏差-方差分解、注意力熵以及互信息)是对实验结果的概念性解释,不会改变训练目标或模型实现方式。最后,为评估稳定性,主要实验使用五个不同的随机种子(1、7、21、42 和 2024)重复进行;这些运行中 RMSE 的均值与标准差已在结果部分报告,其中 GRU 模型表现出具有竞争力的平均 RMSE 和较低的方差,表明其在不同随机初始化下具有稳定的性能。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本部分根据第3节所述的严格方法,对13种深度学习模型及额外的基线模型进行了全面的实证评估。分析分为四个部分:(1)数据集的描述性概述;(2)在独立保留的铜(Cu)测试集上对模型性能进行主要基准测试,包括拟合情况和训练动态的可视化诊断;(3)详细的消融研究,以分解架构复杂性对模型性能的影响;(4)在独立的铝(Al)和锌(Zn)价格序列上对模型泛化能力进行关键性测试。

完整数据集包含 2,602 条每日观测记录(2015-01-05 至 2025-09-12)。时间序列划分如下:训练集 = 前 2,081 条观测记录(索引 0–2080,约 80%),验证集 = 随后的 260 条观测记录(索引 2081–2340,10%),测试集 = 最后的 261 条观测记录(索引 2341–2601,10%)。各划分部分的确切日期边界详见 Zenodo 仓库(https://doi.org/10.5281/zenodo.19976985)。所有划分均遵循时间顺序,未进行任何打乱处理。

表2展示了中国市场上三...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

所呈现的实证结果 结果 本节为我们的核心研究问题提供了清晰且一致的答案:在现实条件下数据有限(2,602个观测值、单变量输入、单步预测)的每日有色金属价格预测任务中,最简单的深度学习架构——门控循环单元(GRU)——持续且显著地优于一系列更为复杂的模型。这些模型包括混合卷积神经网络(CNN)、双向循环神经网络(RNN)、引入注意力机制的网络,以及多组件“超级混合”模型(如CNN–BiLSTM–Attention),同时也优于传统的计量经济学基线模型(ARIMA和GARCH)、机器学习方法(随机森林和XGBoost)以及标准Transformer模型。16,29,37. DM 检验确认了大多数比较的统计学显著性,且多种子稳健性分析(表7)表明,GRU模型在不同随机初始化下均实现了较低的平均均方根误差(RMSE),且方差较小。通过沿链式结构进行的系统性消融实验(GRU → BiGRU → ...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,他们不存在可能影响本研究工作报告的任何竞争性财务利益或个人关系。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究未获得外部资金支持。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
数据集每日铜(Cu)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Cu;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集每日铝(Al)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Al;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集每日锌(Zn)现货价格序列 – 三种目标金属之一;也作为多变量输入特征的一部分。上海有色金属市场(SMM),公开可获取SMM价格数据;列名 = Zn;价格类型 = 现货;频率 = 每日;单位 = 人民币/吨;日期范围 = 2015-01-05 至 2025-09-12;RRID:不适用
数据集预处理后的多变量金属价格数据集 – 经缺失值处理和滑动窗口构建(L = 30,h = 1)后,按时间顺序排序并清洗的Cu、Al、Zn序列。作者基于SMM数据生成存储于Zenodo知识库(DOI: 10.5281/zenodo.19976985);文件:Data.csv;RRID:不适用
软件Python编程语言 – 用于数据处理、模型实现、评估以及图表生成的主要语言。Python软件基金会 / AnacondaPython 3.10.19;Anaconda发行版;RRID: SCR_008394
软件TensorFlow/Keras – 用于实现GRU、LSTM、BiGRU、BiLSTM、CNN-混合、注意力机制和Transformer模型的深度学习框架。TensorFlow / KerasTensorFlow 2.20.0;RRID: SCR_016345
软件NumPy – 数值数组处理与矩阵运算。开源社区NumPy 1.26.4;RRID: SCR_008633
软件pandas – 数据加载、表格处理及CSV/Excel输出处理。开源社区pandas 2.3.3;RRID: SCR_018214
软件scikit-learn – 评估指标、预处理及机器学习工具。开源社区scikit-learn 1.7.2;RRID: SCR_002577
软件StandardScaler(z-score标准化) – 使用训练集统计信息进行的特征标准化。scikit-learn包含在scikit-learn 1.7.2中;RRID: SCR_002577
软件随机森林 – 机器学习基线实现(RandomForestRegressor)。开源社区scikit-learn 1.7.2;RRID: SCR_002577
软件statsmodels – ARIMA基线实现。开源社区statsmodels 0.14.6;RRID: SCR_016074
软件arch – GARCH基线实现。开源社区arch 8.0.0;RRID:不可用
软件XGBoost – XGBoost回归基线实现。开源社区XGBoost 3.1.2;RRID: SCR_025884
软件Transformer模型 – 用于对比的基线深度学习架构。TensorFlow / Keras基于TensorFlow 2.20.0实现;RRID: SCR_016345
软件Keras回调函数(ReduceLROnPlateau) – 训练过程中使用的学习率调度器。TensorFlow / Keras包含在TensorFlow 2.20.0中;RRID: SCR_016345
软件Matplotlib – 图表生成并导出为PDF/SVG/PNG格式。开源社区Matplotlib 3.10.6;RRID: SCR_008595
软件openpyxl – 支持Excel工作簿的生成与导出。开源社区openpyxl 3.1.5;RRID:不可用
代码GRU.py – 包含全部13种深度学习模型、Transformer对比、ARIMA/GARCH/XGBoost/随机森林基线、Diebold–Mariano检验及图表生成的完整实现。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
代码README_reproducibility.md – 可重复性说明与逐步操作协议。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
代码requirements.txt – 软件依赖项及精确版本说明。作者编写可在Zenodo获取(DOI: 10.5281/zenodo.19976985);RRID:不适用
硬件计算工作站 – 所有模型训练、验证、测试及图表/表格生成。华硕电脑股份有限公司(ROG Strix G634JZ_G634JZ)Windows 11 家庭版 10.0.26200 构建版本 26200;基于x64的个人计算机;RRID:不适用
硬件CPU – 用于训练和推理的中央处理器。IntelIntel64 家族 6 型号 183 步进 1,约 2.20 GHz;RRID:不适用
硬件内存(RAM) – 所有计算任务的物理内存。华硕工作站32,387 MB(约32 GB);RRID:不适用
硬件GPU加速 – 图形处理器使用状态。TensorFlow设备查询tf.config.list_physical_devices('GPU') 返回 [];未使用CUDA/cuDNN;RRID:不适用
试剂/模型随机种子(主实验) – 固定种子以确保随机元素的可重复性。Python random / NumPy / TensorFlow种子 = 42;RRID:不适用
试剂/模型随机种子(稳健性测试) – 用于多轮运行稳定性验证的额外种子。Python random / NumPy / TensorFlow种子 = {1, 7, 21, 42, 2024};RRID:不适用

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

LSTM CNN BiLSTM Transformer Z Diebold Mariano

相关文章