本文旨在评估时间加权、因果推断和层次归因对可解释性优化的影响。
研究文章
本文旨在评估时间加权、因果推断和层次归因对可解释性优化的影响。
近年来,由于数据驱动模型的显著进步,人们对透明性和可解释性的需求日益增强,从而催生了可解释人工智能(Explainable Artificial Intelligence, XAI)。目前已有多种传统的XAI方法被广泛应用,但这些方法在解释动态关系方面能力有限。本研究旨在通过提出一种新颖的集成SHapley Additive exPlanations(SHAP)框架来解决这一局限性,该框架聚焦于时间加权、因果推断、分层归因和可解释性优化,称为TCHSHAP。TCHSHAP通过指数衰减的时间加权机制,赋予当前信息比历史信息更高的优先级。此外,因果推断能够区分相关性与因果关系,从而获得更具实践意义的洞察。同时,分层归因支持在细粒度(区域层面)和聚合层面(特征组影响)进行深入分析。这些方法被整合在一起,以实现更具可解释性和可理解性的模型。为验证所提出模型的有效性,我们在来自Kaggle的作物产量数据集上开展实验。在实验评估之前,采用独热编码进行数据预处理,通过最小-最大缩放完成数据归一化,并利用四分位距法剔除异常值。在实验评估中,作者将SHAP XAI模型应用于随机森林算法。在评估所提出的TCHSHAP模型有效性时发现,传统SHAP的平均预测值为161.137,而在引入时间加权和因果推断后,该值提升至161.506,表明利用时间与因果重要性具有显著效果。此外,在分层归因过程中观察到,农业特征对目标变量具有最强的主导作用,其次依次为地理因素和环境因素。因此,所得结果证实了该方法在增强全局与局部可解释性方面的有效性,增强了用户对模型预测的信任。本研究提供了一种在不影响模型性能的前提下提升透明性与可解释性的途径。所建议的模型还能够在复杂的数据驱动应用中实现可解释且高效的回归建模,从而推动其在现实场景中的广泛应用。
回归分析在预测性分析中发挥着重要作用,涵盖气候建模、金融预测、医疗诊断以及农作物产量估计等多个领域1,2。然而,回归模型的结果往往难以解释,尤其是对于梯度提升机(Gradient Boosting Machines, GBMs)、随机森林(Random Forests)和深度神经网络(Deep Neural Networks, DNNs)等非线性且高容量的模型,这在需要透明度和可操作洞察的应用中构成了重大挑战。这一可解释性鸿沟可通过采用可解释人工智能(Explainable Artificial Intelligence, XAI)技术来弥补,但该技术目前仍处于初级阶段。当前,诸如SHAP和局部可解释模型无关解释(Local Interpretable Model Agnostic Explanation, LIME)等传统XAI框架仅能提供静态的特征解释3。现有的这些XAI方法尚无法解释涉及时间依赖性、层次化特征结构以及因果关系的回归任务的复杂性,从而开辟了新的研究方向4,5。由于未考虑上述因素,XAI有时可能得出错误结论。例如,传统的SHAP方法仅考虑属性与目标变量之间的相关性,而忽略了因果关系。假设有一个数据集包含两个二元输入特征:烟草消费和牙齿染色,目标变量为患癌概率。在此情况下,若计算输入特征与目标变量之间的相关性,则癌症将与这两个特征(烟草消费和牙齿染色)均呈现高度相关。然而,若据此得出“牙齿染色导致癌症”的结论则具有严重误导性,因为牙齿染色实际上是长期吸烟所致。因此可以总结为,尽管XAI领域已取得显著进展,但在回归任务背景下仍需解决的核心问题包括:
无法考虑时间依赖性会导致仅能提供静态解释,而这些解释在具有动态数据的场景中可能不适用。
传统SHAP方法的改进中未包含因果推断,导致产生虚假相关性,而非有价值的因果洞察。
对层次化解释缺乏关注,导致高层级聚合性解释不足。
为了解决上述问题,当前的研究工作旨在提出一种新颖的可解释人工智能(XAI)框架 TCHSHAP,该框架融合了时间加权、因果推断与分层归因,以提升现有 XAI 模型的可解释性与计算效率。为此,所提出的框架引入了一个时间加权因子 wt,该因子相较于历史值,赋予近期特征贡献更高的权重。该加权机制旨在确保在产量预测与销售预测等动态回归问题中,模型的可解释性能够与关键特征的时间重要性保持一致。此外,传统回归模型难以揭示变量间的因果关系,导致归因结果模糊不清6。为应对这一挑战,该框架采用结构因果模型(SCMs)来评估特征 Fi 对输出结果的因果影响。同时,实际数据集中的特征常表现出层次性关系(空间或类别层面),而现有 XAI 框架极少体现此类结构4,5,6。相比之下,所提出的 XAI 框架通过聚合个体特征(Fi)以获得更高层级的特征(Hj),从而实现解释结果的细粒度表达。
除了整合时间、因果和层次重要性之外,所提出的集成方法还旨在增强可解释性和可解释能力。这一目标旨在建立可解释性与准确性之间的权衡,确保从TCHSHAP获得的解释既准确又易于理解4。所建议的XAI框架可用如下数学方式描述,所用变量的说明见表1。特征的传统SHAP值按公式(1)计算5,6。
(1)
这种传统的SHAP方法在计算贡献值时,未考虑时间、因果或层次结构上的调整。
| 变量 | 定义 |
| Fi | 正在计算其 Shap 值的特征 |
| Shapi | 该特征的 Shap 值 |
| S | 所有特征的集合 |
| M | 所有特征的一个子集 |
| FT | 特征的总数 |
| P(M) | 仅使用 M 中的特征时的模型预测值 |
| λ > 0 | 衰减率 |
| T | 参考预测时间 |
| Y | 输出 |
表1:所用变量的说明。 本表描述了所使用各种变量的意义。
通过引入时间加权,对该传统的SHAP公式进行改进以处理动态依赖关系。时间加权通过引入权重系数 wt = e-λ |t - T| 实现,其中 λ 表示衰减因子(λ > 0)。如前所述,这种指数加权使近期值相比过去值获得更高的权重。引入这种指数衰减是基于以下认识:近期特征值比过去值具有更高的重要性。改进后的SHAP值(在纳入时间重要性后)由公式(2)给出。
(2)
这种时间信息对于预测产量或股票等动态回归任务非常重要。
此外,为了使解释更具稳健性,采用结构因果模型(SCM)来评估特征 Fi 对输出 Y 的因果影响。因果 SHAP 的数学表达式如公式(3)所示
(3)
其中 do(Fi) 表示对变化有贡献的特征。通过使用该方法,模型能够解释因果关系,而不仅仅是相关性。值得注意的是,基于结构因果模型(SCM)的因果效应计算可确保仅对具有直接因果影响的特征赋予重要性,从而消除虚假相关性。
此外,建议的模型中提出了层次结构,用于在不同层级上聚合属性。层次化 SHAP 的数学表达式见公式(4)。
(4)
在所建议的模型中引入层次结构,可确保解释的精细程度。所建议的框架如图1所示。

图 1:所提出框架中各个要素的示意图。 本图展示了所提出的 TCHSHAP 框架中包含的多个要素的示意图,包括时间加权、因果推断和分层归因。 请点击此处查看该图的放大版本。
所提出的模型TCHSHAP的新颖之处在于通过引入时间加权(赋予当前信息更高权重)、结构因果模型(SCM;用于评估因果效应)以及SHAP值的分层聚合(以获得多层次的洞察),来处理上述三种不一致性。因此,该集成方法突破了SHAP的静态限制,提供了一个面向回归优化的解释框架。
所提出的TCHSHAP在需要更好决策的实时应用场景中具有重要意义,因为它能够识别回归模型输出的详细解释,无缝连接建模与决策过程。总之,本文的主要贡献在于设计了一种新颖的框架,该框架结合了时间加权、因果推断和层次关系,以增强传统SHAP模型的可操作性解释能力。
相关工作
可解释人工智能(XAI)包含多种专门设计的方法,旨在增强不同机器学习模型的透明性和可解释性。这些XAI策略通过从结果中提供必要的洞察,建立对结果的信心。例如,LIME和SHAP等著名的XAI方法在金融、教育和医疗保健等多个领域显著提升了原本为“黑箱”模型的可解释性与透明度7。此外,XAI技术也被应用于软件分析、代码克隆检测以及即时缺陷预测等任务中8。Awal和Roy还指出了现有方法在生成解释时存在不一致的问题,并展示了其可靠性较低8。在此研究中,作者应用了细粒度评估指标以降低评估过程中的不一致性。XAI在医学领域也得到了广泛应用,用于识别影响分类任务结果的最关键因素,从而增强医疗从业者对基于人工智能诊断工具的信任9,10,11,12。此外,在比利时住宅租金预测等领域,XAI方法有助于解释复杂模型,进而提升质量控制并减少生产错误13。Bommer等人证明,在气候科学中,将XAI方法与梯度相结合,能够从鲁棒性、保真度、复杂性和随机化等方面提升XAI方法的性能14。许多研究人员尝试构建集成方法和混合技术。除了提出集成方法外,研究者还证明了这些混合技术在为复杂模型提供全面洞察方面的有效性15,16。各类技术、优化方法及其应用的详细综述见于表2,其中明确显示应用最广泛的技术是LIME和SHAP。未来的研究方向聚焦于探索这些方法的优化,以进一步提升模型的可解释性。延续这一研究脉络,当前研究工作的作者专注于通过引入因果推断、分层归因和时间加权来优化SHAP方法。
| 引用 | XAI 技术 | 优化 | 洞察 | 应用 | 未来研究方向 |
| (Anushree et al., 2024) | LIME | 未提供 | 增强金融、教育和医疗领域中黑箱模型的可解释性与透明度。 | · 在金融、教育和医疗领域中准确率与可解释性之间的权衡 | · 需要建立一套详细的评估指标,用于评价不同的XAI模型 |
| SHAP | |||||
| 扰动机制 | |||||
| 基于注意力的机制 | |||||
| (Awal & Roy, 2024) | PyExplainer | 细粒度评估指标,用于减少评估中的一致性问题。 | 突显了不同方法之间的差异,并表明其在生成解释时可靠性较低。 | · 与软件分析相关的任务 | · 需要先进的研究方法来提升XAI模型在软件分析任务中的可靠性 |
| LIME | · 克隆检测 | ||||
| · 即时缺陷预测 | |||||
| (Bommer et al., 2024) | 积分梯度 | 将XAI方法与梯度相结合 | 在气候科学中,XAI方法与梯度的结合提升了模型在鲁棒性、保真度、复杂性和随机化方面的性能。 | · 气候科学预测 | · 聚焦于气候科学中的任务特定评估 |
| 逐层相关性传播 | · 年平均温度图预测 | ||||
| 输入乘以梯度 | |||||
| 梯度、SmoothGrad、NoiseGrad 和 FusionGrad 等敏感性方法 | |||||
| (Bhatnagar & Agrawal, 2024) | LIME | XAI技术的集成 | 集成方法提供了全面的洞察,增强了复杂模型的可解释性与可解释能力。 | · 应用于道德数据集以增强结果的可解释性 | · 探索通过结合多种技术实现的混合XAI方法 |
| SHAP | · 针对不同用户需求,定制化多种XAI算法以适配特定模型 | ||||
| (Dias, 2024) | LIME | XAI技术的集成 | 提升可解释性与准确性 | · 有毒评论分类 | · 增强分类任务的性能 |
| Eli5 | |||||
| (Hajare et al., 2024) | SHAP | 未提供 | SHAP为急性冠脉综合征预测中的风险因素提供了详细洞察。 | · 急性冠脉综合征(ACS) | · 探索ACS预测中的新风险因素。 |
| (Hamida et al., 2024) | 对多种XAI技术的全面综述 | 未提供 | 提供了XAI在医疗领域应用的洞察,强调了理解AI决策结果时可解释性的重要性。 | · 医疗领域的可操作洞察 | · 增强XAI组件,包括可理解性、透明性、可解释性和可解释能力。 |
| · 为医疗领域开发定制化XAI技术,以获得更深入的领域洞察 | |||||
| (Ihongbe et al., 2024) | Grad-CAM(梯度加权类激活映射) | 梯度加权类激活映射 | 在肺炎和COVID-19诊断中具有更高的准确性。 | · 提高医学诊断的准确性 | 提高对XAI技术在现实应用中可用性的认识 |
| (Lenaers, & De Moor, 2023) | 6种XAI技术 | 在CatBoost模型上集成6种XAI技术 | 多种技术增强了租金预测中XAI的可解释性。 | · 比利时住宅租金预测 | XAI可用于决策支持 |
| (Makumbura et al., 2024) | SHAP | 集成RF、LightGBM、XGBoost与SHAP | SHAP揭示了评估和预测水质的各种影响因素。 | · 水质评估与预测 | 可用于决策支持 |
| (Schlegel & Keim, 2023) | 结合扰动分析的XAI技术 | 扰动分析 | 可有效应用于时间序列数据的分类任务 | · 金融、医疗和气候科学中的时间序列数据 | 结合多种XAI技术以增强可解释性。 |
| (Silva & Keller, 2023) | XAI | 未提供 | XAI模型在处理相关特征时存在解释结果的局限性。可用于地球与大气科学领域。 | · 大气科学 | XAI需要针对相关特征进行优化,以避免错误解释。 |
| 生物分子反应速率 | · 大气化学 | ||||
| (Y, S., & Challa, M. 2023) | SHAP | 未提供 | 本文比较了不同XAI模型在可解释性和识别重要特征方面的能力,结论指出SHAP和LIME最为有效。 | · 医学应用 | 提升高级医学应用中的可解释性 |
| LIME | |||||
| PDP | |||||
| GAM |
表2:对XAI技术各种优化方法的全面综述。 本表汇总了不同研究者提出的各类优化技术的系统性回顾。
访问受限。请登录或开始试用以查看此内容。
注意:本节讨论所提出的集成方法,包括如图1所示的所有改进措施。
数据准备
为了验证所提出框架的有效性,作者在从 Kaggle 收集的作物产量数据集上开展了一项实验17。该数据集包含1997年至2020年间多种作物的印度农业数据,并于2025年3月获取。该数据集包含多个特征,例如季节(season)、作物年份(crop_year)、化肥(fertilizer)、农药(pesticide)、作物(crop)以及产量(yield,目标变量)等。为提高效率,对所采用的数据集进行了预处理,使用独热编码(one-hot encoding)处理分类变量。季节(season)、作物(crop)和州(state)等分类特征均进行了独热编码。同时采用最小-最大缩放(MinMax scaling)将面积(area)、产量(production)、年降雨量(annual_rainfall)、化肥(fertilizer)和农药(pesticide)等数值型特征缩放到[0,1]区间。为处理异常值,采用了四分位距(Interquartile Range)法则,阈值设为 Q1 - 1.5 • IQR17。所有预处理步骤均设置随机种子为42,以确保结果的可重复性。进一步地,在完成预处理后,数据集被划分为训练集(80%)和测试集(20%)。
实验设置
实验在配备 CPU:双路 AMD Rome 7742、128 核、1TB 内存的 A100 GPU 服务器上,使用 Python 3.10 进行。用于仿真的库包括 scikit-learn 1.3.0、XGBoost 1.7.6、TensorFlow 2.13、SHAP 0.41.0、LIME 0.2.0.1 和 ELI5 0.13.0。
机器学习模型的评估
本研究中,作者采用了多种回归模型,包括LinearRegression()、Ridge(alpha=1,random_state=42)、Lasso(alpha=0.1,randomstate = 42)、Decision TreeRegressor(max_depth = 10, random_state = 42)、RandomForestRegressor(max_depth = 15, random_state = 42)、GradientBoostingRegressor(n_estimators = 200, learning_rate = 0.1, random_state = 42)、XGBoost以及CNN,以确定各类变量对目标变量产量(yield)的影响18。其中,XGBoost模型使用了300个估计器和0.05的学习率。在CNN模型中,采用了两个隐藏层、ReLU激活函数和Adam优化器,学习率为0.001。通过多种性能指标对这些模型的效率进行比较,并且这些模型均进行了超参数调优。例如,岭回归(Ridge regression)和套索回归(Lasso regression)分别在alpha等于1.0和alpha等于0.1的条件下进行训练。决策树(Decision Tree)和随机森林(Random Forest)的最大深度分别设置为10和15。梯度提升(Gradient Boosting)使用了200个估计器和0.1的学习率。这些模型的性能通过5折交叉验证,以均方误差(MSE)和R²系数进行评估。
XAI 模型的评估
如前所述,本研究使用了多种可解释人工智能(XAI)模型以比较结果。在此,作者对基于树的模型(随机森林、梯度提升和XGBoost)采用shap.TreeExplainer(model,data = crop_yield)。从训练数据集中随机选取100个样本作为背景数据集,以稳定归因结果。此外,对于非树模型(线性模型、岭回归、套索回归和卷积神经网络),使用shap.KernelExplainer(),并设置1000次扰动,以逼近SHAP值。为确保局部解释的稳定性,使用表格解释器(lime.lime_tabular.LimeTabularExplainer),在相同的背景数据集上对每个实例进行5000次扰动以运行LIME。核宽度根据特征特性设定,并利用模型的预测函数推断解释结果。通过调用explainer.explain_instance(x,model.predict)生成局部解释。ELI5被用作排列重要性方法,在验证集上重复10次以避免测试数据过拟合,并通过eli5.sklearn.PermutationImportance(estimator,random_state = 42)进行模拟。实验过程中展示了重复结果间的均值与方差显著性。最后,使用拟合后的模型在验证集上生成偏依赖图(Partial Dependence Plots, PDPs),其实现方式为PartialDependencyDisplay.from_estimator (model,X_val,features = [feature])。
TCHSHAP 框架的建立
随后,通过依次实施多个步骤来实现TCHSHAP。序列中的第一步是时间加权,该步骤采用衰减系数λ = 0.85的指数衰减函数,该系数是基于在不同λ值下进行的消融实验所选定的。
[0.7.0.95]。参考时间(T_current)被设定为数据集中最近的作物年度。这确保了模型解释能够考虑农业产量预测的动态特性,其中近期特征(如降雨量、化肥使用或农药使用)在决策中具有更高的重要性。在时间加权之后,采用结构因果模型(SCM)进行因果推断。所提出的方法利用点运算符模拟干预,并计算平均因果效应。因果推断通过 Python 实现。 doWhy 0.13 版本库。这有助于缓解由于生产与面积等输入变量之间的相关性而导致的误导性关联,从而实现真实的因果关系。管道中的最后一步是分层归因,其中特征被组织为更高层次的类别。对于当前数据集,共有 3 个分层特征,即农业投入(化肥,农药),地理因素(状态, 领域, 作物年份)和环境因素(年降雨量, 季节通过使用归一化求和对SHAP数据进行分组,可以获得两个层次(详细和总体)的解释。
综上所述,TCHSHAP 流程将时间调整、因果归因和层次分组三个步骤整合为一个统一的过程。该流程首先采用基础 SHAP 进行解释,随后依次引入三项改进。这种结构化的流程确保了 TCHSHAP 的输出具有一致性、可重复性,并能同时提供局部和全局解释。所提出框架的逐步描述详见下方的伪代码。
输入:
X:包含特征 X1、X2、X3、……、Xn 的数据集。
t:数据集中的时间变量
Tcurrent:参考时间
λ:衰减率
G:特征组
计算时间权重
对每个实例 i
X,计算 wt = e-λ|t-T|,
计算 Shap 值 Shapi
计算 ShapTemporal = Shapi × wt
计算因果推断
对每个特征 Xi
X
计算 ShapCausal = Shapi × 因果效应(Xj → Y)
分层归因
对每个特征 Xi
X
计算 Shap 值 Shapi
对每个 Gi
G

输出: 层次化聚合的SHAP值集合
用于辅助故障排查的定量检查点如下:在所有机器学习模型中,随机森林表现出最低的均方误差(MSE)和最高的R2。所获得的特征重要性顺序为:面积 > 农药 > 肥料,而季节和作物年份的影响最小。全局基线SHAP预测值为161.137。进一步地,当应用λ = 0.85后,作物年份和季节的贡献度增加。组级贡献的顺序为农业投入>地理因素>环境因素。
访问受限。请登录或开始试用以查看此内容。
本部分讨论了在实验研究中应用各种方法所获得的结果,包括以下若干小节:
数据收集与预处理
为了对所提出的框架进行实验评估,从 Kaggle19 收集了一个关于农作物产量的数据集。收集到的数据经过预处理,包括前文所述的标签编码、缩放以及异常值剔除等步骤。根据设定的目标,评估了各变量的特征重要性。所考虑数据集的特征重要性图如图2所示,该图明确表明肥料和农药与产量之间具有高度相关性。此外,为了评估数据规模对模型评估的影响,针对不同规模的数据集计算了MAE和R²得分,并将所得结果绘制在图3中。
访问受限。请登录或开始试用以查看此内容。
本研究的主要目标是在传统SHAP模型中引入时间权重、因果推断和层次重要性,从而构建TCHSHAP模型。将这些组件纳入可解释人工智能(XAI)技术的动机在于提升结果的可解释性。在时间权重方面,我们采用了指数衰减方法,使近期数值相比历史数值获得更高的权重。在因果重要性方面,作者试图评估各个特征对预测变量的直接影响。此外,输入参数还被划分为不同的层次化特征,以更深入地理解结果。为验证所提出方法的有效性,作者选用了Kaggle平台上的crop_yield数据集进行分析。所得结果明确表明,TCHSHAP中所提出的时间权重、因果推断和层次化归因机制通过克服传统SHAP模型的局限性,显著提升了其可解释性20,21。
然而,所提出的该方法也存在潜在的局限性。例如,目前该方法的有效性仅通过单一的作物产量数据集进行验证,而这一情况被认为具有一定的激励作用。为了进一步增强其有效性,所建议的方法需要在包括医疗保健、金融和教育在内的多种应用领域中进行测试2...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在利益冲突。
本工作由葡萄牙科学技术基金会(FCT – Fundação para a Ciência e a Tecnologia, I.P.)通过项目合同编号 UID/05105/2025 的国家资金资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| ELI5 | 0.13.0 | PyPI | |
| LIME | 0.2.0.1 | PyPI | |
| Nvidia DGX A100 GPU 服务器 | CPU 双路 AMD Rome 7742,共 128 核 | Nvidia | |
| 系统内存 1TB | |||
| Python | 3.1 | Python | |
| SHAP | 0.41.0 | PyPI | |
| scikit-learn | 1.3.0 | PyPI | |
| TensorFlow | 2.13 | Tensor Flow | |
| XGBoost | 1.7.6 | PyPI |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可