本研究开发了一种堆叠集成模型,结合XGBoost、CatBoost(梯度提升模型)、LightGBM(高效梯度提升模型)、AdaBoost和Extra Trees,利用Kaggle数据预测贷款审批结果。该模型准确率达到98%,识别出收入和信用评分等关键预测因子,有助于实现公平且高效的贷款批准或拒绝决策。
研究文章
本研究开发了一种堆叠集成模型,结合XGBoost、CatBoost(梯度提升模型)、LightGBM(高效梯度提升模型)、AdaBoost和Extra Trees,利用Kaggle数据预测贷款审批结果。该模型准确率达到98%,识别出收入和信用评分等关键预测因子,有助于实现公平且高效的贷款批准或拒绝决策。
数字借贷与金融科技的创新颠覆了传统的银行体系,改变了全球各国的金融包容性与信贷可获得性。本研究探讨了点对点(P2P)及数字借贷平台的发展,重点分析人工智能与机器学习等技术如何改变贷款审批方式。通过对现有文献的系统性综述,揭示了数字借贷生态系统中的机遇与挑战,包括算法风险评估、客户信任、金融排斥以及监管漏洞等问题。为应对上述问题,本文提出一种基于堆叠集成模型的强效机器学习方法,以精确预测贷款审批结果。研究采用公开的Kaggle数据集,包含申请人的 demographics(人口统计特征)、财务特征及信用历史,通过训练集-测试集划分、探索性分析及标签编码对数据进行预处理。该集成模型以XGBoost作为元学习器,基础学习器包括梯度提升模型(Gradient Boosting Model)、高效梯度提升(Efficient Gradient Boosting)、AdaBoost以及极端随机树(Extra Trees)分类器。模型评估指标包括准确率、精确率、召回率、F1分数以及误差指标(MAE-平均绝对误差、MSE-均方误差、RMSE-均方根误差),结果显示模型准确率达到98%。相关性分析表明,资产、收入及CIBIL评分等因素对贷款审批具有显著影响。该模型在两个类别上均表现出优于传统方法的平衡性与泛化能力。论文最后强调了此类模型在实现自动化、数据驱动型信贷决策中的实际应用价值。
在银行业的最新一轮技术转型中,来自传统银行体系之外的颠覆性新型金融服务提供商已进入市场1。大型科技公司(BigTech,主要专注于直接放贷或与金融机构合作放贷)和金融科技公司(FinTech,即金融技术,包括P2P借贷和在线信贷等替代传统银行的模式)正在大举进军金融领域,尽管银行已努力适应数字化环境,但仍对其构成挑战2。这一快速演变标志着金融生态系统的转变,非传统参与者正日益重塑金融服务的获取与提供方式3。数字借贷的兴起与银行信贷呈负相关关系,表明随着新贷款方进入市场,传统银行信贷可能逐渐被替代性数字信贷所取代4。2008年全球金融危机(GFC)进一步加速了这一转变,该危机严重削弱了客户对金融服务的信任,并推动了金融科技(Fintech)企业的扩张5。金融科技是指技术与金融的结合,即利用技术提供金融解决方案6。随着金融科技的成熟,其最具变革性的应用之一便是P2P借贷(又称在线借贷服务)的兴起7。P2P借贷的主要创新在于直接匹配出借人与借款人。借款人提交小额无担保贷款申请,多个投资者通过借贷平台评估并资助贷款请求8。P2P借贷的功能类似于银行,但通过互联网和前沿技术实现在线借贷与债务安排9。该模式的成功性与可扩展性在ZOPA.com的推出中得到充分体现——这是历史上首个P2P平台,于2005年在英国首次亮相。自那时起,在线借贷显著增长,到2015年规模已超过1000亿美元,并预计在2025年达到逾1万亿美元10。特别是在新兴经济体中,数字借贷随着金融科技的整合而进一步发展11。金融科技在数字借贷中的整合增强了金融包容性,尤其在新兴市场表现突出。移动支付和区块链解决方案支持P2P交易和微型贷款,降低了获得金融服务的门槛12。这一范式转变由区块链、人工智能(AI)、机器学习和数字支付系统等技术的融合所驱动,旨在构建更具包容性、高效且以客户为中心的金融环境13。数字借贷平台利用技术加快申请流程、节约成本并提升信用风险评估能力,使中小企业和个人能够更快获得融资14。它们运用大数据、区块链、AI和机器学习来改进借款人评估、降低运营成本并促进金融包容性15。其中,机器学习尤其通过利用替代性数据源彻底改变了风险管理16。该方法通过使用非传统数据超越了传统的信用评估方式,提升了借款人评级的准确性,并能预测经济趋势17。这种方法通过提高借款人评估的精确度并辅助预测经济变化,降低了违约风险18。数字借贷最重要的影响之一在于其解决金融包容性难题的能力,尤其是在新兴经济体和边缘化地区19。
为了利用结构化的 Kaggle 数据集高精度预测贷款申请的通过情况,本文提出了一种新颖的堆叠集成模型,该模型结合了梯度提升模型(Gradient Boosting Model)、高效梯度提升模型(Efficient Gradient Boosting Model)、AdaBoost、极限树(Extra Trees)和 XGBoost。与以往研究中常采用单一模型或传统分类器的方法不同,该方法通过将多种先进学习器与 XGBoost 作为元分类器相结合,以提升预测的适应性和泛化能力。该模型在贷款通过和贷款拒绝两类样本上均表现出色,准确率高达 98%。这一方法学上的进展为在数字借贷环境中自动化贷款审批决策提供了一种切实可行且可扩展的途径,尤其适用于正在发展的金融生态系统。
本研究旨在构建一个强大的堆叠集成模型,用于数字借贷领域,通过结合梯度提升模型、高效梯度提升模型、AdaBoost、极限树(Extra Trees)和XGBoost,准确预测贷款申请的接受情况。此外,本研究还旨在探讨人口统计学和财务变量(收入、资产价值以及CIBIL-印度信用信息局有限公司评分)对贷款决策的重要性,评估该集成模型相较于传统模型在分类和误差指标下的性能表现,并强调集成方法如何提升效率、泛化能力与公平性。主要目标是统计分析申请人特征对贷款审批的影响,并评估集成学习算法的性能。
P2P 和数字借贷正在持续改变全球金融格局,既带来机遇也带来挑战。
数字借贷正在迅速改变全球金融格局,为传统银行提供了一种替代方案20。这一全球视角凸显了不同区域背景如何独特地塑造数字借贷的发展成熟度。尽管数字借贷不断扩展,但其技术仍处于不成熟阶段;自动化和预测性评分虽提升了效率,但平台在背景核查方面仍严重依赖第三方系统,限制了整体稳健性21。尽管扩张迅速,全球范围内的金融排斥问题依然严峻,据估计,发展中国家约有44%的成年人无法获得正规金融服务,亟需改革、完善基础设施并推进数字素养教育。此类局限性也体现在其他融合领域的突出表现中,包括数据处理和系统集成方面持续存在的挑战22。随着数字化整合不断加深,金融科技领域的安全漏洞正在加剧。为应对这些问题,已有研究提出以安全为核心的框架,以保护数字交易23。类似情况也出现在其他新兴市场。在肯尼亚,尽管移动支付和数字贷款应用程序改善了金融可及性,但数据隐私仍是长期存在的问题,而近期出台的监管措施影响有限,表明需要更强有力的执行机制、正式审计以及明确 的发展指导方针24。这反映出一个更广泛的趋势:监管框架往往滞后于金融科技的创新。金融科技的监管环境与传统银行业不同。例如,除非贷款风险较高,执法机构对金融科技利率的影响较小25。尤其需要加强监管监督、运用数据分析技术,并更新监管政策,以遏制非法金融科技扩张和隐私泄露问题26。除监管外,数字借贷的成功还依赖于信任,因此信任在借贷决策中起着关键作用。对借款人的信任比对中介机构的信任更具影响力27。
印度的数字借贷生态系统也呈现出类似的并行发展趋势28。由于金融科技的进步、印度储备银行(RBI)实施的有利监管措施,以及新冠疫情暴发后消费者信任度的提升,数字借贷业务正在迅速扩张29。然而,创新也伴随着风险。尽管未经许可的数字借贷应用程序或平台提高了金融服务的可及性,但由于监管薄弱,它们给消费者带来了严重风险,例如骚扰、高利率以及数据滥用。因此,加强消费者保护 和 问责机制对于推动负责任的金融包容至关重要30。借款人违约和欺诈性贷款申请对数字借贷而言风险巨大;良好的消费者保护措施不仅能够保护消费者权益,还能通过提升数据安全性和透明度,积极影响财务绩效,改善资产回报率(ROA)和权益回报率(ROE)等盈利指标31。全球范围内,人们越来越重视运营改进,重点关注优化贷款发放系统、鼓励移动技术的应用,并制定明确策略以满足监管标准和消费者期望32。为应对这些风险,先进分析技术和人工智能正被越来越多地采用;利用违约贷款、还款周期和信用评分等指标进行异常值检测已被证明是有效的手段33。以社会技术模型为指导,我们发现风险既来源于利益相关方,也源于平台设计与组织要素之间缺乏相互依赖关系34。在解释用户采纳行为方面,UTAUT2等动态模型占据主导地位,其中信任被证实是借款意愿的关键预测因素35。基于机器学习的欺诈检测算法,如随机森林(Random Forest)和SVM模型,也被广泛应用36。研究结果表明,机器学习模型能够充分评估个人信用信息并判断贷款违约的可能性;其中深度神经网络表现最佳(准确率为0.94)37。一项使用朴素贝叶斯(Naïve Bayes)模型的研究准确率达到94%,发现利率、还款时间、描述、信用等级、贷款历史、性别和信用评分等特征对贷款成功具有显著影响38。与此同时,提前还款和违约风险的概率均存在,研究采用多元逻辑回归预测了导致贷款终止和债权人利润损失的重要事件,模型整体准确率为76.63%39。研究表明,通过使用高效梯度提升模型(Efficient Gradient Boosting Model)预测数字借贷平台上的违约风险,可将借贷俱乐部的收入提高68%的准确率40。与此同时,更复杂的AI模型正在不断发展,例如深度多视角学习(deep multiview learning),该方法整合多种变量(如应用使用情况和行为模式),在历史数据有限的情况下,其性能优于传统技术41。来自中国的研究证实,梯度提升模型和LGBM等模型在提升违约预测能力和金融包容性方面优于传统的基于信用的评估方法42;系统动力学建模也有助于模拟P2P平台上的利率波动,为不同条件下借款人与投资者行为提供洞察43。高效梯度提升模型已被证明可提高违约预测能力和平台盈利能力40,而 深度神经网络在充分训练后同样优于传统模型37,并通过更优的风险管理稳定数字市场44 。为确保可持续性,监管科技正日益受到关注,例如机器人流程自动化(Robotic Process Automation)可协助金融机构将监管要求与业务规划相协调,提升合规性和运营效率45。表1总结了若干关键研究,这些研究探讨了机器学习在数字借贷及贷款审批流程中的应用。
访问受限。请登录或开始试用以查看此内容。
数据收集
本研究使用了Kaggle平台上提供的贷款审批预测数据集。该数据集于2025年2月提取,包含4269条记录,旨在评估贷款数据并预测贷款审批结果。数据集共有12列,涵盖了申请人人口统计特征的详细信息,包括就业状况、受抚养人数、是否为自雇人士、贷款金额、贷款期限、CIBIL信用评分、财务背景以及与贷款相关的特定属性。通过Pandas库导入数据集后,使用df.head()函数进行可视化检查,以了解其结构和数据质量。
数据预处理
在数据预处理阶段,第一步是移除标识符列(loan_id),因为该列不具备预测价值,且可能为模型引入噪声。第二步是进行标签编码,将教育程度(education)、是否自雇(self-employed)和贷款状态(loan_status)等分类变量转换为数值形式。该转换通过 sklearn.preprocessing 模块中的 Label Encoder 实现。具体编码方式为:教育程度中“Graduate”编码为 0,“Not Graduate”编码为 1;是否自雇中“No”编码为 0,“Yes”编码为 1;贷款状态(目标变量)中“Not Approved”编码为 0,“Approved”编码为 1。这些转换对于确保与机器学习模型的兼容性至关重要,因为模型需要数值型输入,尤其是在数字信贷应用中。通过 X=df.drop(["loan_status"], axis=1) 和 y=df["loan_status"] 将特征变量与目标变量分离。该设置为基于历史贷款记录分析影响贷款审批决策的因素提供了全面的基础,并用于训练多个集成机器学习模型。这些模型通过结合多个分类器的预测优势,旨在提高整体的准确性和鲁棒性。
随后,使用 sklearn.model_selection 中的 train_test_split 函数将处理后的数据集划分为训练集和测试集,其中 80% 的数据用于训练,20% 保留用于测试。这确保了模型在足够大的数据子集上进行训练,同时保留了具有代表性的样本用于性能评估。在数据完成清洗、结构化和统计探索后,为构建一个旨在提高贷款审批分类预测准确性的稳健机器学习框架奠定了基础。模型开发采用了四种基于集成学习的机器学习算法:梯度提升模型(Gradient Boosting Model)、AdaBoost、高效梯度提升模型(Efficient Gradient Boosting Model)和极端随机树分类器(Extra Trees Classifier)。这些算法因其在处理结构化表格数据分类任务中的优异表现而被选用。梯度提升模型分类器(Gradient Boosting Model Classifier)通过 Gradient Boosting Model 库实现,采用默认参数初始化(iterations=1000,learning rate=0.1,depth=6,verbose=False),并使用 .fit(x_train, y_train) 进行训练,通过 .predict(X_test) 进行评估。尽管梯度提升模型可自动处理类别数据编码,但本研究未启用该功能,因为数据已事先进行标签编码。AdaBoost 分类器(Adaptive Boosting,可提升弱学习器性能)通过 sklearn.ensemble 实现,配置参数为 n_estimators=100 和 learning_rate=1.0,并以决策树桩作为默认基学习器。该模型以类似方式训练和评估,通过迭代调整误分类样本的权重来增强模型鲁棒性。高效梯度提升模型(Efficient Gradient Boosting)通过 Efficient Gradient Boosting Model 库(LGBMClassifier)实现,配置参数为 n_estimators=100、learning_rate=0.1 和 max_depth=-1(不限制树的深度)。该模型以速度快、效率高著称,尤其适用于高维特征的大规模数据集,采用优化的梯度提升决策树算法。
最后,使用了来自 sklearn.ensemble 的 ExtraTrees 分类器,其中 n_estimators=100,分裂策略采用 criterion="gini"。与随机森林不同,Extra Trees 通过随机选择分割点引入了更多的随机性,有助于降低模型方差并提升泛化能力。集成方法采用了 scikit-learn 的 Stacking 分类器,通过整合基学习器的预测结果来增强模型的泛化性能。每个模型均使用标准的分类评估指标进行评估,包括准确率、精确率、F1 分数、误差分析以及混淆矩阵。这些指标通过调用 sklearn.metrics 模块中的函数计算,以确保在所有模型之间实现标准化的性能比较。
基于准确率和F1分数表现最优的模型已使用Python库保存:dump(model, "best_model.pkl"),确保训练好的模型无需重新训练即可重复使用。为模拟真实应用场景,使用NumPy创建了一个包含11个特征的样本输入数组,并将其传入模型的.predict()函数。例如,输入向量[[0, 1, 1,4100000, 12200000, 8, 417, 2700000, 2200000, 8800000, 3300000]]返回的预测结果为1,表示贷款获批。所有实验均在Kaggle平台的Google Notebook上基于Python 3.10环境完成。模型的开发与评估采用了scikit-learn(v1.3)、Gradient Boosting Model和Efficient Gradient Boosting Model库。所有超参数均被明确记录,在适用情况下也清晰标明了默认值。编码流程遵循Pedregosa所述方法,并在scikit-learn46中实现。该方法全面且透明,确保实验方案完全可复现,并符合机器学习研究领域的严格学术标准。
建议方法的结构,包括数据准备特征部分、模型训练与评估阶段,如图1所示。
本研究介绍了一种堆叠集成学习框架,该框架整合了四种强大分类器的能力:梯度提升模型、AdaBoost、高效梯度提升模型和极端随机树,以基于历史财务记录预测贷款审批决策。通过在堆叠模型架构中结合提升(boosting)和装袋(bagging)策略46,该方法有效克服了这些模型各自的局限性,例如偏差和方差问题,从而提高了预测准确性和模型泛化能力。每个基学习器均贡献其独特优势:梯度提升模型在处理类别变量方面效率高,专为处理高基数类别特征而设计,并通过有序提升在内部执行目标编码47。这种方法通过确保仅使用历史数据计算统计量,避免了过拟合。在公式中
,
每个 ht (x) 表示在前一个模型的残差上训练的决策树,nt 表示特定步骤的学习贡献。AdaBoost(自适应提升)在训练过程中调整每个样本的权重,并重点关注之前被错误分类的数据点48。在公式中

αt 反映第 t 个弱学习器 ht(x) 的性能,对先前被错误分类的样本赋予更高的权重。高效梯度提升模型引入了基于梯度的单边采样(GOSS)和互斥特征捆绑策略,以提升运算速度。高效梯度提升在大规模数据上具有高运行速度和优异性能49。
![figure-protocol-3 梯度提升公式 ΣF(t)=Σ[l(yi, Ft-1(xi)+ft(xi))+Ω(ft)];方程,数据建模。](/files/ftp_upload/68832/68832eq3.jpg)
ft(xi) 表示为最小化损失函数 l(•) 而新增的决策树,而 Ω(ft) 是正则化项。与提升算法不同,Extra Trees 通过在决策树的分割过程中引入随机性来降低方差50。该方法基于装袋(bagging)原理,但在节点分割过程中进一步注入额外的随机性以构建其预测规则

对 M 棵独立训练的随机树的输出结果进行平均。在每次分裂时,极限树(Extra trees)为特征随机选择阈值,并从中选取最优者,从而降低方差并提升各棵树之间的多样性,进而改善模型的泛化能力。这些模型通过堆叠分类器(stacking classifier)进行集成,该分类器学习如何最优地组合它们的输出,以决定是否批准贷款申请。该框架通过常见的分类评估指标进行验证,并使用实时输入样本进行测试,证明了其在数字借贷环境中的实际应用价值51。这些模型通过堆叠分类器进行集体集成,该分类器学习如何理想地融合各模型的输出,以确定贷款审批结果。模型性能通过准确率、精确率、召回率、F1分数、AUC-ROC以及混淆矩阵等重要分类指标进行评估,以衡量其降低I类错误和II类错误的能力。为保持类别平衡,采用分层的80:20训练-测试划分方法,并结合5折交叉验证,以增强模型的稳健性并减少样本波动。此外,模型还在包含信用记录、收入、就业状况和贷款金额等信息的真实贷款申请人画像上进行了评估,输出二分类判断结果及概率评分。这一两阶段测试验证了模型在实时数字借贷场景中的有效性、公平性与实用性。本研究的创新之处在于针对信用评分任务设计的混合集成模型,使其成为适用于现代金融平台的一种稳健、可解释且可复现的模型52。
访问受限。请登录或开始试用以查看此内容。
特征相关性分析
特征相关性热图(图2)提供了有关不同属性之间相互关系的有用信息。收入、年度贷款金额与资产相关变量(如奢侈品资产价值和银行资产价值)之间存在较强的正相关性,表明申请人的财务状况在贷款评估中具有重要作用。有趣的是,CIBIL 评分与贷款状态之间存在显著的负相关(-0.77),说明信用评分较高的申请人获得贷款批准的可能性显著更高,这与典型的金融风险评估方法一致。
混淆矩阵评估
图3 展...
访问受限。请登录或开始试用以查看此内容。
用于贷款审批预测的堆叠集成模型在各项评估指标上均表现出色,展现出极高的准确性和可靠性。相关性热图显示,年收入、贷款金额和资产价值等财务指标之间存在强烈关联,凸显了它们在贷款评估中的重要性;而CIBIL评分与贷款状态呈显著负相关,进一步强化了其在信用评估中的关键作用。该模型的混淆矩阵显示错误率较低,854个样本中准确识别出839个,仅出现15次误分类。分类指标显示整体准确率达到98%,对于获批和拒批两类样本,精确率、召回率和F-1分数均持续达到或超过0.98,表明不存在显著的类别不平衡或偏差。MAE、MSE和RMSE等误差矩阵指标均较低,说明模型具有良好的稳健性和预测准确性。可视化指标进一步强调了模型在两类样本上的均衡且一致的表现。该集成模型采用梯度提升模型、高效梯度提升模型、极端随机树(Extra Trees)和AdaBoost作为基学习器,XGBoost作为元学习器,性能优于以往方法。凭借其强大的泛化能力以及通过SHAP或LIME等工具实现的可解释性潜力,该模型为现实世界中的金融决策提供了切实有效的解决方案。
本研究通过提出一种用于数字借贷中贷款审批预测的强效机器学习框架,推动了...
访问受限。请登录或开始试用以查看此内容。
作者声明本研究不存在利益冲突。
本研究由印度阿马拉瓦蒂的VIT-AP大学资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Kaggle | https://www.kaggle.com/ | ||
| Pandas | https://pandas.pydata.org/ | ||
| 模型库 | IBM | https://www.ibm.com |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可