方法文章

基于可解释性机器学习模型的乳腺癌数据驱动药物发现优化

DOI:

10.3791/68705

2025年9月12日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本方案介绍了一种利用XGBoost和SHAP进行乳腺癌药物敏感性预测的机器学习流程。该工作流程包括数据预处理、混合建模、基于SHAP的解释、协同作用评分以及PCA聚类,旨在识别高效药物并深入理解影响治疗反应的关键生物学因素。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌仍然是全球最常见的恶性肿瘤之一,由于肿瘤异质性和药物耐药性,其治疗面临重大挑战。本研究提出了一种可重复的、基于数据的机器学习方案,用于预测乳腺癌细胞系对药物的敏感性,旨在识别高效的单药治疗药物以及具有协同作用的药物组合。利用癌症药物敏感性基因组学(Genomics of Drug Sensitivity in Cancer, GDSC)数据库中的精选数据集,实施了两种预测方法:独立的XGBoost回归模型和混合型自编码器- XGBoost流程。预处理步骤包括标签编码、独热编码、Z分数标准化、缺失值填补以及通过主成分分析(PCA)进行降维。模型评估结果显示,XGBoost模型表现更优(均方误差 MSE = 1.3789,决定系数 R2 = 0.8145),优于混合模型(MSE = 4.0322,R2 = 0.4577)。通过使用SHapley加性解释(SHAP)方法提升模型可解释性,识别出TARGET_PATHWAY、DRUG_ID、TARGET和CELL_LINE_NAME为关键预测特征,这些结果与已知的药理学机制一致。通过整合模型输出与DrugComb及SynergyDB数据库信息,计算得出的协同作用评分揭示了若干有前景的药物组合,如硼替佐米 + 罗米地辛以及紫杉醇 + 硼替佐米。基于PCA的药理学聚类分析进一步支持了这些发现,揭示了具有相似作用机制的药物在生物学上合理的聚类分组。该方案为精准肿瘤学研究提供了一个透明且可灵活调整的框架,兼顾预测准确性与生物学可解释性。通过整合严格的预处理、模型验证、可解释性分析及药物协同作用评估,该工作流程为乳腺癌治疗中的转化药物发现与老药新用研究提供了可扩展的基础。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳腺癌仍然是全球女性中最常见的癌症诊断类型,也是女性癌症相关死亡的第二大原因1。仅在美国,乳腺癌就占所有新发女性恶性肿瘤的近30%,每年新增病例超过28万例2。尽管在HER2阳性及激素受体阳性亚型的治疗方面取得了进展,但治疗耐药性和复发仍是临床上的关键挑战,尤其是对于三阴性乳腺癌(TNBC)等侵袭性亚型,目前尚缺乏靶向治疗手段3,4。这凸显了迫切需要基于精准医学的药物研发策略,以识别针对个体分子特征的高效治疗药物及其组合方案。传统的药物发现主要依赖实验和试错方法,而随着机器学习(ML)技术的引入,该领域已实现显著加速5,6。机器学习能够对高维生物医学数据中复杂的非线性关系进行建模,在靶点识别、生物标志物发现、药物敏感性预测以及联合治疗方案设计等方面提供支持7,8。然而,机器学习模型在肿瘤学中的实际应用仍面临诸多障碍,包括模型的可解释性、可重复性、在稀疏数据集上的过拟合问题,以及在不同癌症亚型间的泛化能力等9,10,11

为了克服这些局限性,近期研究聚焦于将深度学习用于特征提取,并结合集成学习以实现稳健预测。在评估多种算法的研究中,人工神经网络(Artificial Neural Networks, ANN)等模型的准确率高达93.2%,优于朴素贝叶斯和决策树等传统分类器12。此外,整合的特征挖掘技术通过GEO(基因表达综合数据库)和GSE45827等数据库,已发现关键驱动基因和分子靶点,识别出多达1,700个差异表达基因,其中部分基因已知与药物存在相互作用13。进一步的药物重定位研究揭示,非肿瘤学化合物如骨化三醇在降低乳腺癌细胞活力方面的效果优于奈拉替尼等标准治疗药物,尤其是在HER2+细胞系中表现更为显著14。对Akt信号通路的研究也显示出克服曲妥珠单抗耐药性的潜力,提示靶向分子通路可能是替代受体靶向治疗的一种有效策略15,16。然而,尽管取得了上述进展,当前文献中仍缺乏一种系统化且可解释的框架,能够预测连续的药物反应值、对有效药物组合进行排序,并可视化药理学相似性。许多模型要么基于分类方法,要么在应用于真实世界药物基因组学数据集时缺乏转化层面的清晰性。

机器学习(ML)能够为高质量数据提供工具,从而改善药物发现和决策过程。药物发现的各个阶段,包括靶点验证、生物标志物识别以及临床试验分析,均可受益于机器学习的应用。然而,机器学习生成结果的可解释性和可重复性仍是当前面临的障碍17。通过解决这些问题并提高对验证变量的认识,可以降低失败率并加快研发进程。研究人员利用机器学习算法评估了处于不同癌症阶段的活检样本。结果显示,测试准确率较高:人工神经网络(ANN)为93.2%,朴素贝叶斯(NB)为90.4%,决策树(DT)为87.8%,随机森林(RF)为85.9%。Rakhshaninejad等人18通过整合GEO数据库,共鉴定出350个预测基因和164个差异表达基因。在合并数据集中,二进制灰狼优化与模拟退火集成算法(BGWO_SA_Ens)识别出1404个基因;而在GSE45827数据集中则识别出1710个基因。研究还发现了约35个优势基因,及其在关键通路中的作用,以及这些优势基因与抗癌药物之间的关系。Nagaraj等人19通过分子网络分析,旨在从表皮生长因子受体(EGFR)过表达信号通路及其相关家族成员中识别靶基因。一种名为calcitriol的药物(已获批用于治疗非癌症相关疾病)对四个受体均表现出强结合亲和力。体外细胞毒性研究表明,calcitriol以剂量依赖的方式降低了SK-BR-3细胞的存活率,表明其具有更强的细胞毒性,并较neratinib更有效地抑制乳腺癌细胞增殖。Jernström等人20提出,Akt信号通路具有活性且具备成药潜力:两种对曲妥珠单抗不敏感的细胞系对Akt1/2激酶抑制剂有响应。该研究建议在治疗决策中应关注Akt信号通路而非仅聚焦于HER2扩增或表达,并考虑分子层面的因素。在美国,乳腺癌占女性新发恶性肿瘤的30%,是女性中最常见的恶性疾病。Witt和Tollefsbol21的目标是开发一种基础性工具,以帮助研究人员在异种移植实验、癌症预防及表观遗传学研究等领域选择合适的乳腺癌细胞系。文中还讨论了特定乳腺癌细胞系的来源争议,以及使用患者来源异种移植模型(PDX)相较于细胞来源异种移植模型(CDX)的优势。Gruener等人22探讨了利用药物预测技术生成新药研发假设的方法,重点关注三阴性乳腺癌(TNBC)。基于细胞系转录组数据构建了药物反应的机器学习模型,并将其应用于患者肿瘤数据。结果表明,Wee1抑制剂AZD-1775在TNBC中具有优先作用,且其疗效与TP53突变密切相关。为了预测乳腺癌研究中未知的药物-靶点相互作用,Song等人23提出了一种基于特征的方法,称为“伪位置特异性理化性质衍生组成用于药物-靶点相互作用预测”(PsePDC-DTIs),该方法利用蛋白质序列、深度典型相关分析(DCCA)系数和分子指纹描述符。该技术采用随机森林分类器,在四个金标准数据集上预测DTIs,并使用SMOTE处理不平衡数据。此外,模型还结合全基因组遗传研究中的风险基因,探索乳腺癌治疗的新靶点。该模型通过提供十个潜在的DTIs,证明了其优越性和有效性。三阴性乳腺癌(TNBC)约占乳腺癌病例的10%至20%。尽管在HER2阳性及激素受体阳性乳腺癌治疗方面已取得进展,目前仍缺乏针对TNBC的靶向疗法24。尽管大多数患者表达EGFR,早期研究却未观察到明显疗效。然而,近期的研究发现和临床进展为TNBC未来的实验性治疗提供了新的方向25

尽管机器学习在药物发现中的整合日益增多,但现有模型通常缺乏可解释性和可重复性,限制了其在转化研究中的应用。虽然以往研究已探索了分类准确性与基因挖掘,但很少有研究系统地使用混合可解释模型来预测连续的药物敏感性(如 LN_IC50)。此外,在乳腺癌治疗背景下,降维技术与强回归模型的结合仍鲜有研究。本研究通过引入并评估一种双通道策略——XGBoost 与自编码器-XGBoost——用于高保真度药物反应预测,并结合可解释性分析与协同作用图谱工具,以提升其在真实临床场景中的适用性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 数据集获取

  1. 从 GDSC 下载药物敏感性数据(https://www.cancerrxgene.org/downloads/drug_data)。所用数据集的摘要见表 1。使用的文件包括 gdsc_drug_data.csv(药物反应数据)、gdsc_expression_data.csv(基因表达数据)和 gdsc_cell_metadata.csv(细胞系信息)。
    图 1 展示了本工作流程中所用数据集结构的示例。
  2. 使用 Python(Pandas 库)对数据集进行筛选,仅保留乳腺癌细胞系。
    1. 选择 TCGA_DESC 列等于 "Breast" 的记录。
    2. 提取对应的 CELL_LINE_NAME 值。
    3. 具体实现方法参见补充代码 1(补充文件 1)。
      注意:将数据集限制为乳腺癌细胞系可确保模型训练的领域特异性,并提高生物学有效性。本研究采用的数据集来自癌症药物敏感性基因组学(Genomics of Drug Sensitivity in Cancer, GDSC)数据库,其主要特征见表 2

2. 数据预处理

  1. 预处理流程:
    1. 使用 LabelEncoder 对 DRUG_ID、CELL_LINE_NAME 和 TARGET_PATHWAY 等分类变量进行编码,将其转换为适用于 XGBoost 输入的基于整数的格式。
    2. 使用 Z 分数标准化(StandardScaler)对基因表达数据、拷贝数变异(CNA)和甲基化特征等数值型特征进行归一化处理,以确保均值为零、方差为一。
    3. 剔除缺失特征超过 30% 的样本。
    4. 对剩余的缺失值,使用 SimpleImputer(strategy='median') 以各特征列的中位数进行填补。
    5. 使用 scikit-learn 中的 OneHotEncoder 对分类变量(DRUG_ID 和 TARGET_PATHWAY)进行独热编码。
    6. 对基因表达特征采用主成分分析(PCA)进行降维处理,在保留方差的同时减少特征空间维度。
    7. 使用 scikit-learn 中的 train_test_split 将最终清理后的数据集划分为训练集(80%)和测试集(20%),并保持药物-细胞对的分布一致性。
      注:各预处理步骤的详细依据及处理后数据集的维度将在讨论部分进行说明。
  2. 处理分类变量
    1. 使用 Pandas 识别分类变量(CELL_LINE_NAME、DRUG_NAME、TARGET_PATHWAY)。
    2. 使用 scikit-learn 的 LabelEncoder 对这些变量进行标签编码。
    3. 该步骤的程序实现见补充代码 2(Supplementary File 1)。
      注:机器学习算法需要数值型输入;标签编码将分类变量转换为整数格式,同时保留类别间的区分性。
  3. 标准化数值特征
    1. 识别基因表达、拷贝数变异(CNA)和甲基化特征中的数值型变量。
    2. 应用 StandardScaler 将特征标准化为均值为零、方差为一。
      注:标准化通过将所有数值特征重新缩放至均值为零、方差为一,确保各特征对模型的贡献程度一致。这可防止量纲较大的特征在模型训练中占据主导地位,并提升优化算法的收敛速度。
  4. 处理缺失值
    1. 检测所有特征中的缺失项。
    2. 剔除缺失数据超过 30% 的记录。
    3. 对剩余的缺失值采用中位数填补策略进行插补。
      注:不完整数据可能引入偏差并降低模型的鲁棒性。剔除缺失严重的记录可保证数据的可靠性,而中位数填补则提供了一种稳定且对异常值不敏感的方法,在不引入强分布假设的前提下保留可用信息。
  5. 划分数据集
    1. 使用自动化方法(例如 scikit-learn 中的 train_test_split)将最终清理后的数据集划分为训练集和测试集。
    2. 设定随机种子(例如 random_state=42)以确保结果可重复。
    3. 将 80% 的数据分配给训练集,20% 分配给测试集。
    4. 完整代码实现请参见补充代码 3(Supplementary File 1)。
      注:将数据划分为训练集和测试集可对模型的泛化能力进行无偏评估。

3. 建模框架

  1. 确定回归目标
    1. 将预测任务构建成一个回归问题,用于估计每种药物-细胞系组合的半数抑制浓度自然对数(LN_IC50)。
    2. 选择 LN_IC50 作为目标变量,以稳定方差并提升模型性能。
      ​注:将 IC50 转换为 LN_IC50 可减少数据偏度,从而改善模型表现。
  2. 训练 XGBoost 回归模型(模型 1)
    1. 选择 XGBoost 作为主要模型,因其在结构化药物基因组学数据集上表现优异,并能通过正则化建模非线性特征交互,防止过拟合。
    2. 使用 xgboost 库中的 XGBRegressor 类以编程方式初始化模型。指定通过交叉验证确定的调优超参数(学习率、最大深度、估计器数量和随机种子)。
    3. 在训练子集(X_train, y_train)上使用 fit() 方法训练模型。
    4. 在测试子集(X_test)上使用 predict() 方法生成预测结果。
    5. 使用均方误差(MSE)和 R² 分数评估模型性能,调用 scikit-learn 中的 mean_squared_error 和 r2_score 函数。
      注:完整实现请参见补充代码 4(补充文件 1)。
  3. 考虑替代模型
    1. 评估支持向量回归(SVR),因其在小样本、高维数据场景下具有较强的鲁棒性。
    2. 评估自编码器-XGBoost 混合模型,通过深度潜在特征提取与非线性建模,探索潜在的性能提升。
    3. 使用相同的评估指标和交叉验证方法比较各模型性能。
      注:由于 SVR 的预测准确性低于 XGBoost,未纳入最终结果;而自编码器-XGBoost 混合模型被保留,用于比较深度学习与机器学习方法。
  4. 模型 1:XGBoost 回归模型
    1. 选择 XGBoost 作为基线模型,因其在结构化生物医学数据上表现优异,能够建模非线性特征交互,并具备内置正则化机制以减少过拟合。
    2. 配置 XGBoost 模型的超参数:learning_rate = 0.05,max_depth = 6,n_estimators = 100。
    3. 使用网格搜索优化超参数,并通过 5 折交叉验证评估模型性能。
    4. 在预处理后的训练数据集(X_train, y_train)上训练模型。
    5. 使用均方误差(MSE)和 R² 分数评估预测性能,调用 scikit-learn 中的 mean_squared_error 和 r2_score 函数计算。
      注:已有研究26表明,XGBoost 在表格型生物医学数据集上的表现持续优于深度学习模型,且计算成本更低。
  5. 构建自编码器 + XGBoost 混合模型(模型 2)
    1. 设计一个用于无监督降维的自编码器
      注:编码器将输入特征压缩为低维潜在表示,解码器则重构输入以最小化重构误差。
    2. 在完整特征矩阵上训练自编码器,以提取潜在特征。
    3. 将编码器的输出(潜在特征)作为输入传递给 XGBoost 回归模型,如补充代码 5A(补充文件 1)所示。
    4. 在编码后的特征集上训练 XGBoost 回归模型,以 LN_IC50 为目标变量,如补充代码 5B(补充文件 1)所示。
    5. 使用与模型 1 相同的评估指标评估模型性能,以便直接比较。
      注:该混合方法结合了基于深度学习的表征学习能力与 XGBoost 强大的回归性能,在处理高维生物数据时具有优势。
  6. 模型评估
    1. 在测试数据集(X_test)上使用 predict() 方法预测目标值,以评估训练好的回归模型。
    2. 计算均方误差(MSE),以衡量预测值与实际 LN_IC50 值之间的平均平方差,使用 scikit-learn 中的 mean_squared_error(y_test, y_pred) 函数。
      注:这些模型共同结合了可解释性与精确性,为乳腺癌研究中的药物敏感性预测构建了一个稳健的框架27,28
      均方误差公式,MSE 计算,统计分析,方程。
      其中 yi 表示第 i 个药物-细胞对的真实 LN_IC50 值,静态平衡概念,ΣFx=0,示意图,展示物理学中的力平衡与力矩。 为对应的预测值,n 为观测总数。对于自编码器,其重构损失为:
      自编码器损失公式,数学方程,描述数据编码与解码过程。
      其中 X 为输入特征矩阵,E(·) 为将 X 映射到潜在表示的编码函数,D(·) 为从潜在空间重构 X 的解码函数。
    3. 计算 R2 分数,以确定模型解释目标变量方差的比例,使用 scikit-learn 中的 r2_score(y_test, y_pred) 函数。
    4. 记录计算得到的 MSE 和 R2 值用于报告。计算所得的 MSE 和 R² 值汇总于 表 3,以清晰展示并直接比较不同模型的性能。
    5. 解释评估指标:MSE 越低表示预测准确性越高,R2 分数越接近 1 表示模型的解释能力越强,泛化能力越好。
  7. SHAP 可解释性分析
    1. 安装并导入 SHAP 库(import shap)。为确保可重复性,请使用版本 0.41.0。
    2. 根据补充代码 6(补充文件 1)使用训练好的 XGBoost 模型初始化 SHAP 解释器。
    3. 计算测试数据集的 SHAP 值,以获得各特征的贡献分数。
    4. 生成全局特征重要性汇总图,以可视化哪些特征对预测结果贡献最大。
    5. 使用 SHAP 瀑布图对选定样本生成个体预测解释。
    6. 解读图表以识别影响预测的关键特征。如 表 4 所示,关键特征包括 TARGET_PATHWAY、DRUG_ID、CELL_LINE_NAME、TARGET 蛋白质和 Screen Medium,表明药物特性和细胞系特性显著影响药物反应预测。
      注:XGBoost 模型的 SHAP 值使用 shap.TreeExplainer() 计算。全局特征重要性通过 shap.summary_plot() 可视化,单样本解释由 shap.dependence_plot() 和 shap.waterfall_plot() 生成(SHAP v0.41.0)。如 表 4 所示,最具影响力的特征包括 TARGET_PATHWAY、DRUG_ID 和 CELL_LINE_NAME,表明药物特性和细胞系特性在决定药物反应中至关重要。其他重要贡献者为 TARGET 蛋白质和 Screen Medium,进一步强调了模型与癌症药物基因组学领域相关因素的一致性。
  8. 药物协同作用与聚类分析
    1. 下载协同作用数据
      1. 从公开可用的数据库下载药物组合协同作用数据:
        DrugComb: https://drugcomb.fimm.fi
        ​SynergyDB: https://synergy.bioinformatics.nl
    2. 将协同作用数据与预测响应值合并。
      1. 以药物-细胞系组合作为唯一键,将下载的协同作用评分(ZIP、Bliss、Loewe、HSA)与预测的药物响应值(LN_IC50)进行合并。
      2. 在合并前确保两个数据集中的药物标识符和细胞系名称对齐。
    3. 计算基于模型的协同作用评分。
      1. 对每对药物,使用个体模型预测的 LN_IC50 值的平均值计算组合预测疗效:
        静态平衡方程,Scomb 计算公式,物理学中的分析方法。
        其中,Scomb 表示药物对的组合预测 LN_IC50 评分,静态平衡方程 Σy=0,符号。 为药物 1 的预测 LN_IC50 值。
      2. 根据协同作用评分对药物组合进行排序。
      3. 识别协同作用评分最低(即预测效果最佳)的组合(例如 Bortezomib + Romidepsin、Vinblastine + Dactinomycin)。
        注:较低的协同作用评分反映更高的预测治疗潜力,这些药物对可作为进一步实验验证的候选。请参考补充代码 7A 和补充代码 7B(补充文件 1)中的步骤。
  9. 协同作用排序与基于 PCA 的聚类
    1. 按协同作用评分对药物对进行排序。
      1. 以药物-细胞系组合作为唯一键,将协同作用评分(ZIP、Bliss、Loewe、HSA)与预测的 LN_IC50 值进行合并。
      2. 使用预测的 LN_IC50 值的平均值计算每对药物的协同作用评分:
      3. 根据计算得到的协同作用评分对药物对进行排序。
      4. 将评分最低(最负)的药物对识别为潜在的协同组合(例如 Bortezomib + Romidepsin、Vinblastine + Dactinomycin)。
    2. 对药物响应矩阵进行主成分分析(PCA)。
      1. 使用预测的 LN_IC50 值构建药物响应矩阵,药物为行,细胞系为列,步骤如补充代码 8(补充文件 1)所示。
      2. 使用 z-score 标准化对矩阵进行标准化。
      3. 执行主成分分析(PCA),设置主成分数为 2(n_components = 2),以降低维度并捕捉主要方差。
    3. 可视化 PCA 聚类结果
      1. 使用 Matplotlib 或 Seaborn 绘制二维 PCA 投影图。
      2. 确认具有相似作用机制的药物(如 Docetaxel 与 Paclitaxel)在图中聚类在一起,验证模型捕捉生物学上有意义关系的能力。
    4. 模型稳定性与特征平衡
      1. 在编码过程中过滤出现频率较低的分类变量,以避免稀疏性问题。
      2. 调整自编码器的学习率,并加入 dropout 层,以防止收敛问题。
      3. 将 SHAP 分析限制在前 100 个特征,以减少内存开销并确保计算效率。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究聚焦于利用先进的机器学习模型优化乳腺癌药物选择并预测联合用药的疗效。数据集包含经过精心筛选和过滤的乳腺癌细胞系、药物敏感性指标(LN_IC50、AUC、Z-Score)以及分子描述符,如拷贝数变异(CNA)、甲基化、基因表达、组织描述符和药物靶点。主要目标是预测单个药物在不同细胞系中的LN_IC50(半数抑制浓度的自然对数),识别具有协同作用的药物组合,并通过SHAP可解释性方法提供模型解释。研究采用独立的机器学习模型(XGBoost)以及混合型自编码器-XGBoost流程构建模型。整体工作流程如图1所示。

模型性能评估
XGBoost 模型在预测准确性和泛化能力方面均优于混合的自编码器-XGBoost 流程。XGBoost 模型的均方误差(MSE)为 1.3789,决定系数(R² 分数)为 0.8145,表明其在整个数据集上具有良好的预测性能,如表 5所示。相比之下,混合模型的 MSE 为 4.0322,R² 为 0.4577,这表明在此案...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种集成的机器学习流程,用于适应药物选择、预测协同作用的药物组合,并识别药物重定位的可能性。整合了GDSC数据库和协同作用数据库(如SynergyDB、DrugComb)的数据,构建了一个全面的药物-细胞系相互作用数据集,涵盖分子特征(如基因表达、拷贝数变异)和药理学反应31。本研究的主要目的是准确预测细胞系对药物的敏感性,利用已建立的模型(如ZIP、Bliss、Loewe和HSA)对最有效的药物进行排序,并评估有前景的药物组合的协同能力。

XGBOOST 模型表现出最佳的整体性能,其均方误差(MSE)为 1.3789,R2 为 0.8145,相较于 Hybrid Authen Koder-XGBOOST 流程(MSE = 4.0322,R2 = 0.4577)有所提升。XGBOOST 的更优表现表明其在处理高维、非线性生物医学数据方面具有优势32。散点图与残差图显示,预测的 LN_IC50 值与真实值高度吻合,残差分布中未见系统性...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明本研究不存在任何利益冲突。我们确认,在稿件撰写的早期阶段,有限地使用了大语言模型(LLM)技术(由 OpenAI 开发的 ChatGPT)。具体而言,ChatGPT 仅用于构思生成和概念框架的初步头脑风暴,相关内容随后均由作者进行完善、验证并完全重写。所有核心科学内容、数据分析、结果解释及最终文稿撰写均由作者独立完成。所有来自 ChatGPT 的输出内容在纳入前均经过严格审查,以确保其准确性、连贯性和完整性,符合期刊的透明度与伦理指南要求。所有作者均已审阅并同意本稿件的最终版本,并确认不存在可能影响本出版物内容的财务、个人或专业关系。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢基督大学计算机科学系提供的机构支持,该支持为开展本研究提供了必要的计算资源和学术环境。我们还感谢同事和导师在整个研究过程中给予的合作指导与鼓励。

作者贡献:
Dyuti Banerjee 提出了研究构想,设计了研究方法,并对数据集进行了整理。Sivaneesan Bala Krishnan 和 Kamal Upreti 实现了机器学习模型并完成了计算分析。Sumegh Shrikant Tharewal 和 Uma Shankar 参与了数据预处理、特征工程及结果验证。Pravin Kshirsagar 进行了协同效应分析和基于主成分分析(PCA)的聚类分析。Manoj Kumar 协助完成了文献综述、研究结果的解读以及初稿撰写。所有作者均参与了稿件的修改,批准了最终版本,并同意对工作的各个方面承担责任。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
自编码器(深度学习模型)TensorFlow (Google)https://www.tensorflow.org用于药物反应建模的降维与特征编码
BortezomibSelleck ChemicalsS1013用于协同作用分析的药物
DactinomycinSigma-AldrichD1037用于协同作用分析的药物
DocetaxelSigma-AldrichD1080用于基于机制聚类验证的药物
Matplotlib 库Python 软件包索引 (PyPI)https://matplotlib.orgPython 中的数据可视化与绘图
NumPy 库Python 软件包索引 (PyPI)https://numpy.org数值计算与矩阵运算
PaclitaxelSigma-AldrichT7191用于基于机制聚类验证的药物
Pandas 库Python 软件包索引 (PyPI)https://pandas.pydata.org数据操作与处理
Python 3.10Python 软件基金会https://www.python.org主要编程语言
RomidepsinSelleck ChemicalsS3020用于协同作用分析的药物
Scikit-learn 库Python 软件包索引 (PyPI)https://scikit-learn.org机器学习建模与预处理工具
Seaborn 库Python 软件包索引 (PyPI)https://seaborn.pydata.org数据可视化与统计绘图
SHAP 库Python 软件包索引 (PyPI)https://shap.readthedocs.io可解释人工智能模型的可解释性分析
协同作用数据(DrugComb)FIMM, 芬兰https://drugcomb.fimm.fi药物协同作用参考数据集
协同作用数据(SynergyDB)格罗宁根大学https://synergy.bioinformatics.nl药物协同作用参考数据集
TensorFlow 2.11Googlehttps://www.tensorflow.org自编码器深度学习模型的实现
VinblastineSigma-AldrichV1377用于协同作用分析的药物
XGBoost 库Python 软件包索引 (PyPI)https://xgboost.readthedocs.io梯度提升回归建模

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

XGBoost SHAP

相关文章