本方案介绍了一种利用XGBoost和SHAP进行乳腺癌药物敏感性预测的机器学习流程。该工作流程包括数据预处理、混合建模、基于SHAP的解释、协同作用评分以及PCA聚类,旨在识别高效药物并深入理解影响治疗反应的关键生物学因素。
方法文章
本方案介绍了一种利用XGBoost和SHAP进行乳腺癌药物敏感性预测的机器学习流程。该工作流程包括数据预处理、混合建模、基于SHAP的解释、协同作用评分以及PCA聚类,旨在识别高效药物并深入理解影响治疗反应的关键生物学因素。
乳腺癌仍然是全球最常见的恶性肿瘤之一,由于肿瘤异质性和药物耐药性,其治疗面临重大挑战。本研究提出了一种可重复的、基于数据的机器学习方案,用于预测乳腺癌细胞系对药物的敏感性,旨在识别高效的单药治疗药物以及具有协同作用的药物组合。利用癌症药物敏感性基因组学(Genomics of Drug Sensitivity in Cancer, GDSC)数据库中的精选数据集,实施了两种预测方法:独立的XGBoost回归模型和混合型自编码器- XGBoost流程。预处理步骤包括标签编码、独热编码、Z分数标准化、缺失值填补以及通过主成分分析(PCA)进行降维。模型评估结果显示,XGBoost模型表现更优(均方误差 MSE = 1.3789,决定系数 R2 = 0.8145),优于混合模型(MSE = 4.0322,R2 = 0.4577)。通过使用SHapley加性解释(SHAP)方法提升模型可解释性,识别出TARGET_PATHWAY、DRUG_ID、TARGET和CELL_LINE_NAME为关键预测特征,这些结果与已知的药理学机制一致。通过整合模型输出与DrugComb及SynergyDB数据库信息,计算得出的协同作用评分揭示了若干有前景的药物组合,如硼替佐米 + 罗米地辛以及紫杉醇 + 硼替佐米。基于PCA的药理学聚类分析进一步支持了这些发现,揭示了具有相似作用机制的药物在生物学上合理的聚类分组。该方案为精准肿瘤学研究提供了一个透明且可灵活调整的框架,兼顾预测准确性与生物学可解释性。通过整合严格的预处理、模型验证、可解释性分析及药物协同作用评估,该工作流程为乳腺癌治疗中的转化药物发现与老药新用研究提供了可扩展的基础。
乳腺癌仍然是全球女性中最常见的癌症诊断类型,也是女性癌症相关死亡的第二大原因1。仅在美国,乳腺癌就占所有新发女性恶性肿瘤的近30%,每年新增病例超过28万例2。尽管在HER2阳性及激素受体阳性亚型的治疗方面取得了进展,但治疗耐药性和复发仍是临床上的关键挑战,尤其是对于三阴性乳腺癌(TNBC)等侵袭性亚型,目前尚缺乏靶向治疗手段3,4。这凸显了迫切需要基于精准医学的药物研发策略,以识别针对个体分子特征的高效治疗药物及其组合方案。传统的药物发现主要依赖实验和试错方法,而随着机器学习(ML)技术的引入,该领域已实现显著加速5,6。机器学习能够对高维生物医学数据中复杂的非线性关系进行建模,在靶点识别、生物标志物发现、药物敏感性预测以及联合治疗方案设计等方面提供支持7,8。然而,机器学习模型在肿瘤学中的实际应用仍面临诸多障碍,包括模型的可解释性、可重复性、在稀疏数据集上的过拟合问题,以及在不同癌症亚型间的泛化能力等9,10,11。
为了克服这些局限性,近期研究聚焦于将深度学习用于特征提取,并结合集成学习以实现稳健预测。在评估多种算法的研究中,人工神经网络(Artificial Neural Networks, ANN)等模型的准确率高达93.2%,优于朴素贝叶斯和决策树等传统分类器12。此外,整合的特征挖掘技术通过GEO(基因表达综合数据库)和GSE45827等数据库,已发现关键驱动基因和分子靶点,识别出多达1,700个差异表达基因,其中部分基因已知与药物存在相互作用13。进一步的药物重定位研究揭示,非肿瘤学化合物如骨化三醇在降低乳腺癌细胞活力方面的效果优于奈拉替尼等标准治疗药物,尤其是在HER2+细胞系中表现更为显著14。对Akt信号通路的研究也显示出克服曲妥珠单抗耐药性的潜力,提示靶向分子通路可能是替代受体靶向治疗的一种有效策略15,16。然而,尽管取得了上述进展,当前文献中仍缺乏一种系统化且可解释的框架,能够预测连续的药物反应值、对有效药物组合进行排序,并可视化药理学相似性。许多模型要么基于分类方法,要么在应用于真实世界药物基因组学数据集时缺乏转化层面的清晰性。
机器学习(ML)能够为高质量数据提供工具,从而改善药物发现和决策过程。药物发现的各个阶段,包括靶点验证、生物标志物识别以及临床试验分析,均可受益于机器学习的应用。然而,机器学习生成结果的可解释性和可重复性仍是当前面临的障碍17。通过解决这些问题并提高对验证变量的认识,可以降低失败率并加快研发进程。研究人员利用机器学习算法评估了处于不同癌症阶段的活检样本。结果显示,测试准确率较高:人工神经网络(ANN)为93.2%,朴素贝叶斯(NB)为90.4%,决策树(DT)为87.8%,随机森林(RF)为85.9%。Rakhshaninejad等人18通过整合GEO数据库,共鉴定出350个预测基因和164个差异表达基因。在合并数据集中,二进制灰狼优化与模拟退火集成算法(BGWO_SA_Ens)识别出1404个基因;而在GSE45827数据集中则识别出1710个基因。研究还发现了约35个优势基因,及其在关键通路中的作用,以及这些优势基因与抗癌药物之间的关系。Nagaraj等人19通过分子网络分析,旨在从表皮生长因子受体(EGFR)过表达信号通路及其相关家族成员中识别靶基因。一种名为calcitriol的药物(已获批用于治疗非癌症相关疾病)对四个受体均表现出强结合亲和力。体外细胞毒性研究表明,calcitriol以剂量依赖的方式降低了SK-BR-3细胞的存活率,表明其具有更强的细胞毒性,并较neratinib更有效地抑制乳腺癌细胞增殖。Jernström等人20提出,Akt信号通路具有活性且具备成药潜力:两种对曲妥珠单抗不敏感的细胞系对Akt1/2激酶抑制剂有响应。该研究建议在治疗决策中应关注Akt信号通路而非仅聚焦于HER2扩增或表达,并考虑分子层面的因素。在美国,乳腺癌占女性新发恶性肿瘤的30%,是女性中最常见的恶性疾病。Witt和Tollefsbol21的目标是开发一种基础性工具,以帮助研究人员在异种移植实验、癌症预防及表观遗传学研究等领域选择合适的乳腺癌细胞系。文中还讨论了特定乳腺癌细胞系的来源争议,以及使用患者来源异种移植模型(PDX)相较于细胞来源异种移植模型(CDX)的优势。Gruener等人22探讨了利用药物预测技术生成新药研发假设的方法,重点关注三阴性乳腺癌(TNBC)。基于细胞系转录组数据构建了药物反应的机器学习模型,并将其应用于患者肿瘤数据。结果表明,Wee1抑制剂AZD-1775在TNBC中具有优先作用,且其疗效与TP53突变密切相关。为了预测乳腺癌研究中未知的药物-靶点相互作用,Song等人23提出了一种基于特征的方法,称为“伪位置特异性理化性质衍生组成用于药物-靶点相互作用预测”(PsePDC-DTIs),该方法利用蛋白质序列、深度典型相关分析(DCCA)系数和分子指纹描述符。该技术采用随机森林分类器,在四个金标准数据集上预测DTIs,并使用SMOTE处理不平衡数据。此外,模型还结合全基因组遗传研究中的风险基因,探索乳腺癌治疗的新靶点。该模型通过提供十个潜在的DTIs,证明了其优越性和有效性。三阴性乳腺癌(TNBC)约占乳腺癌病例的10%至20%。尽管在HER2阳性及激素受体阳性乳腺癌治疗方面已取得进展,目前仍缺乏针对TNBC的靶向疗法24。尽管大多数患者表达EGFR,早期研究却未观察到明显疗效。然而,近期的研究发现和临床进展为TNBC未来的实验性治疗提供了新的方向25。
尽管机器学习在药物发现中的整合日益增多,但现有模型通常缺乏可解释性和可重复性,限制了其在转化研究中的应用。虽然以往研究已探索了分类准确性与基因挖掘,但很少有研究系统地使用混合可解释模型来预测连续的药物敏感性(如 LN_IC50)。此外,在乳腺癌治疗背景下,降维技术与强回归模型的结合仍鲜有研究。本研究通过引入并评估一种双通道策略——XGBoost 与自编码器-XGBoost——用于高保真度药物反应预测,并结合可解释性分析与协同作用图谱工具,以提升其在真实临床场景中的适用性。
访问受限。请登录或开始试用以查看此内容。
1. 数据集获取
2. 数据预处理
3. 建模框架

为对应的预测值,n 为观测总数。对于自编码器,其重构损失为:

为药物 1 的预测 LN_IC50 值。访问受限。请登录或开始试用以查看此内容。
本研究聚焦于利用先进的机器学习模型优化乳腺癌药物选择并预测联合用药的疗效。数据集包含经过精心筛选和过滤的乳腺癌细胞系、药物敏感性指标(LN_IC50、AUC、Z-Score)以及分子描述符,如拷贝数变异(CNA)、甲基化、基因表达、组织描述符和药物靶点。主要目标是预测单个药物在不同细胞系中的LN_IC50(半数抑制浓度的自然对数),识别具有协同作用的药物组合,并通过SHAP可解释性方法提供模型解释。研究采用独立的机器学习模型(XGBoost)以及混合型自编码器-XGBoost流程构建模型。整体工作流程如图1所示。
模型性能评估
XGBoost 模型在预测准确性和泛化能力方面均优于混合的自编码器-XGBoost 流程。XGBoost 模型的均方误差(MSE)为 1.3789,决定系数(R² 分数)为 0.8145,表明其在整个数据集上具有良好的预测性能,如表 5所示。相比之下,混合模型的 MSE 为 4.0322,R² 为 0.4577,这表明在此案...
访问受限。请登录或开始试用以查看此内容。
本研究提出了一种集成的机器学习流程,用于适应药物选择、预测协同作用的药物组合,并识别药物重定位的可能性。整合了GDSC数据库和协同作用数据库(如SynergyDB、DrugComb)的数据,构建了一个全面的药物-细胞系相互作用数据集,涵盖分子特征(如基因表达、拷贝数变异)和药理学反应31。本研究的主要目的是准确预测细胞系对药物的敏感性,利用已建立的模型(如ZIP、Bliss、Loewe和HSA)对最有效的药物进行排序,并评估有前景的药物组合的协同能力。
XGBOOST 模型表现出最佳的整体性能,其均方误差(MSE)为 1.3789,R2 为 0.8145,相较于 Hybrid Authen Koder-XGBOOST 流程(MSE = 4.0322,R2 = 0.4577)有所提升。XGBOOST 的更优表现表明其在处理高维、非线性生物医学数据方面具有优势32。散点图与残差图显示,预测的 LN_IC50 值与真实值高度吻合,残差分布中未见系统性...
访问受限。请登录或开始试用以查看此内容。
作者声明本研究不存在任何利益冲突。我们确认,在稿件撰写的早期阶段,有限地使用了大语言模型(LLM)技术(由 OpenAI 开发的 ChatGPT)。具体而言,ChatGPT 仅用于构思生成和概念框架的初步头脑风暴,相关内容随后均由作者进行完善、验证并完全重写。所有核心科学内容、数据分析、结果解释及最终文稿撰写均由作者独立完成。所有来自 ChatGPT 的输出内容在纳入前均经过严格审查,以确保其准确性、连贯性和完整性,符合期刊的透明度与伦理指南要求。所有作者均已审阅并同意本稿件的最终版本,并确认不存在可能影响本出版物内容的财务、个人或专业关系。
作者衷心感谢基督大学计算机科学系提供的机构支持,该支持为开展本研究提供了必要的计算资源和学术环境。我们还感谢同事和导师在整个研究过程中给予的合作指导与鼓励。
作者贡献:
Dyuti Banerjee 提出了研究构想,设计了研究方法,并对数据集进行了整理。Sivaneesan Bala Krishnan 和 Kamal Upreti 实现了机器学习模型并完成了计算分析。Sumegh Shrikant Tharewal 和 Uma Shankar 参与了数据预处理、特征工程及结果验证。Pravin Kshirsagar 进行了协同效应分析和基于主成分分析(PCA)的聚类分析。Manoj Kumar 协助完成了文献综述、研究结果的解读以及初稿撰写。所有作者均参与了稿件的修改,批准了最终版本,并同意对工作的各个方面承担责任。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 自编码器(深度学习模型) | TensorFlow (Google) | https://www.tensorflow.org | 用于药物反应建模的降维与特征编码 |
| Bortezomib | Selleck Chemicals | S1013 | 用于协同作用分析的药物 |
| Dactinomycin | Sigma-Aldrich | D1037 | 用于协同作用分析的药物 |
| Docetaxel | Sigma-Aldrich | D1080 | 用于基于机制聚类验证的药物 |
| Matplotlib 库 | Python 软件包索引 (PyPI) | https://matplotlib.org | Python 中的数据可视化与绘图 |
| NumPy 库 | Python 软件包索引 (PyPI) | https://numpy.org | 数值计算与矩阵运算 |
| Paclitaxel | Sigma-Aldrich | T7191 | 用于基于机制聚类验证的药物 |
| Pandas 库 | Python 软件包索引 (PyPI) | https://pandas.pydata.org | 数据操作与处理 |
| Python 3.10 | Python 软件基金会 | https://www.python.org | 主要编程语言 |
| Romidepsin | Selleck Chemicals | S3020 | 用于协同作用分析的药物 |
| Scikit-learn 库 | Python 软件包索引 (PyPI) | https://scikit-learn.org | 机器学习建模与预处理工具 |
| Seaborn 库 | Python 软件包索引 (PyPI) | https://seaborn.pydata.org | 数据可视化与统计绘图 |
| SHAP 库 | Python 软件包索引 (PyPI) | https://shap.readthedocs.io | 可解释人工智能模型的可解释性分析 |
| 协同作用数据(DrugComb) | FIMM, 芬兰 | https://drugcomb.fimm.fi | 药物协同作用参考数据集 |
| 协同作用数据(SynergyDB) | 格罗宁根大学 | https://synergy.bioinformatics.nl | 药物协同作用参考数据集 |
| TensorFlow 2.11 | https://www.tensorflow.org | 自编码器深度学习模型的实现 | |
| Vinblastine | Sigma-Aldrich | V1377 | 用于协同作用分析的药物 |
| XGBoost 库 | Python 软件包索引 (PyPI) | https://xgboost.readthedocs.io | 梯度提升回归建模 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可