结合多模态生物标志物的机器学习可增强疾病预测与监测能力,在多个领域为医疗进步带来希望,并通过精确的疾病预测改善医疗健康结局。
研究文章
结合多模态生物标志物的机器学习可增强疾病预测与监测能力,在多个领域为医疗进步带来希望,并通过精确的疾病预测改善医疗健康结局。
每年,全球都有许多人逐渐受到心脏病、呼吸道感染、神经功能障碍、认知压力、癌症、中风、糖尿病等严重健康问题的影响,这些疾病会导致严重的健康并发症及相关异常。因此,早期健康分析至关重要,因为它能够实现及时干预和靶向治疗,可能提供即时缓解并带来持久的长期益处,从而延缓疾病进展。由于各种健康状况涉及复杂的病理生理过程和异质性的临床试验,迫切需要高灵敏度的多模态生物标志物以及有效的研究方法,以准确检测和监测患者的健康结局。因此,人们考虑采用多种类别和技术的机器学习算法来预测结果,包括预后判断、风险评估、患者分层和疾病监测。本研究的工作流程分为三个阶段:第一阶段通过案例研究阐明医疗保健的重要性;第二阶段介绍传统的机器学习(ML)算法、传统的深度学习(DL)方法以及现代的深度学习技术(TabNet 和 AutoInt);最后在第三阶段开展实验以验证结果。本研究强调通过整合分子蛋白、化学和遗传生物标志物与新兴的机器学习特征,实现模态的分组。结果表明,采用所提出的方法在预测准确性方面有显著提升。
医疗系统正越来越多地利用预测分析来监测患者,并及时诊断健康结果,从而促进主动医疗并改善患者预后。通过将预测分析与生物标志物相结合,临床医生可以提高诊断准确性,识别有效治疗方法,监测治疗进展,并深入了解疾病机制,最终实现更科学、更有效的治疗决策。生物标志物是指存在于样本(如生物液体、组织、细胞、DNA、RNA、血液和尿液)中的生物分子特征或指标,用于测量人体内疾病的存在或进展情况,有助于评估治疗效果1。
分子生物标志物应用的进展在精准医疗中发挥着关键作用,通过精确测量特定分子来识别患者独特的健康问题,从而在疾病早期阶段即可实施靶向治疗策略2。未来,多模态方法将有助于整合复杂疾病的多种数据模式,利用先进的预测性分析技术,更准确地识别癌症和神经退行性疾病的预后情况3。这一前沿方法结合多组学数据、生物信息学和机器学习(ML)算法,用于发现新的生物标志物,从而实现对心血管疾病(CVDs)及其他复杂疾病的个体化风险评估和个性化治疗策略4。分子生物标志物与多组学方法的结合,有望提高神经系统疾病的诊断准确性和治疗分层水平5。
随着机器学习技术的进步,多模态分子生物标志物能够整合多种类型的数据,以识别各种健康状况下的新型疾病特征,从而实现更准确的诊断和个性化治疗策略。基于这一潜力,作者探讨了机器学习在医疗保健中的多种技术,用于预测疾病的诊断风险因素,并强调了其在不同医疗领域的重要性6。随着机器学习正在变革疾病的诊断与治疗,制药行业 increasingly 利用决策算法来分析患者的健康结果并满足其日常需求,从而实现更明智且高效的医疗护理7。鉴于多模态数据整合的潜在需求,本研究利用多模态数据(MRI 和遗传数据)开发生物标志物,以预测阿尔茨海默病的发生与发展。结果表明,在正常对照受试者中,遗传数据对未来的阿尔茨海默病进展具有更好的预测能力,而 MRI 数据则更优地刻画了稳定的轻度认知障碍;两者结合时,分类性能更佳8。
通过进一步推动多模态数据分析的应用,多模态深度学习利用基因表达数据识别靶向新型生物分子特定细胞系的药物,从而阐明基因组变异如何影响治疗反应9。随着多模态数据分析技术的进步,基于人工智能(AI)和机器学习(ML)指标评估的非侵入性生物标志物正成为具有前景的诊断工具,其特异性和敏感性特征因具体应用和数据背景而异,与侵入性生物标志物相比各有优劣10。随着多模态数据分析重要性的日益凸显,深度学习(DL)集成模型能够通过整合包括基因-蛋白相互作用在内的新型生物标志物,有效处理复杂数据,从而加强癌症研究并优化治疗策略11。随着深度学习集成模型在癌症研究中的不断推进,预测性分析通过整合来自多种来源的大规模综合数据(包括多种健康状况信息),在疾病诊断与治疗中发挥关键作用,可提供关于疾病状态的全面评估,例如风险评估和诊断结论12。
本方案的目标是实施基于机器学习(ML)和深度学习(DL)的算法,整合不同的生物标志物,以提高医疗健康数据分析的准确性。传统的生物标志物预测技术通常依赖单模态数据和线性统计模型,可能无法充分捕捉影响疾病发展和个体差异的复杂非线性关系。来自观察、电子健康记录、实验室检测结果、体格测量和临床评估的大量数据,为综合优化患者诊断中的风险评估提供了重要机遇13。生物标志物在精准医学中发挥着关键作用,能够实现适时的靶向治疗。尽管生物标志物本身具有复杂性,在测量疾病亚型和分子进展方面存在挑战,但在各种异常条件下评估毒性反应方面具有重要价值,从而促进进一步分析。在临床观察中利用生物标志物,医疗专业人员可以更准确地预测疾病进展并监测治疗反应。最终,将多模态分子生物标志物与人工智能结合应用于医疗健康分析,能够实现更有效的模式识别,匹配现有特征以减轻临床影响。
与现有先进技术相比,特别是Somepalli等人14的研究,该研究提出了针对基因组数据(如代谢组、表观遗传组和蛋白质组数据)的机器学习算法,并提出了选择机器学习算法的一般性指导原则,但在数据分析方面仍存在局限性。在已有研究15中,非监督整合方法被应用于组学数据,主要关注计算层面的挑战,然而这些方法在应用范围和分析深度上均存在局限。相比之下,Huang等人16综述了大多数用于分析多样化应用场景的深度学习方法,旨在理解大数据和计算框架的潜力,但其不足之处包括数据不平衡、过拟合以及结果解释性差等问题。本方案对于弥补整合性生物标志物研究中的关键空白至关重要,因为当前技术难以有效整合高维且异质性的生物数据。通过采用在模式识别、特征选择和多模态融合方面表现优异的先进机器学习与深度学习方法,本研究旨在识别出稳健的预测性特征,从而提升疾病的早期诊断、预后评估和个体化治疗方案。该方案通过构建一个全面、数据驱动的模型,直接解决了现有生物标志物评估方法割裂的问题,实现了可扩展、可解释且具有临床相关性的健康预测。
访问受限。请登录或开始试用以查看此内容。
1. 实验流程
图1 展示了一个有序且模块化的流程管线,旨在利用机器学习和深度学习技术将分子生物标志物分类为风险或诊断指示类别。以下是该过程的详细逐步说明:

图1:本研究提出的工作流程图。 本图展示了所提出问题的工作流程,步骤包括数据预处理、特征工程、模型开发、数据划分、使用评估指标进行模型评估以及生物标志物分析。请点击此处查看此图的放大版本。
2. 数据集描述
数据集名称为all_sequence_variants,扩展名为csv。数据集包含以下列:'id'、'variation'、'position'、'external_link'、'gene_symbol'、'entrez_gene_id'、'reference'、'conditions'、'indication_types',其中除'id'为整型(int)和'entrez_gene_id'为浮点型(float)外,其余列均为对象类型(object)。数据集共有42818行,9列。此外,variation、position、external_link、entrez_gene_id、reference、conditions和indication_types列中存在空值。该数据集来源于以下链接:https://markerdb.ca/downloads17
3. 数据集预处理
在此阶段,数据预处理首先收集数据集信息、描述,识别重复项,并定位缺失值或空值。通过相关系数衡量,外部链接(external_link)特征无影响,因此予以删除。分类列和数值列的空值分别使用中位数和均值填充。最终,输入与输出的数据集形状为 (42787, 6) 和 (42787,)。输入列为“id”、“variation”、“position”、“gene_symbol”、“entrez_gene_id”、“conditions”,目标列为 indication_types。
4. 生物标志物:分类、数据挑战及分子风险的作用
生物标志物是一种可量化的特征,用于指示正常或异常的生物学活动,或对各种暴露或干预措施的反应。生物标志物在性质上可以是分子、组织学、影像学或生理学的,通常分为七个主要类别:(1)诊断性生物标志物用于判断个体是否患有某种特定疾病或障碍,并确定其是否属于某一亚型;(2)监测性生物标志物用于反映疾病的进展情况及其对治疗的反应;(3)反应性生物标志物用于显示患者是否对某种药物或疗法产生反应,例如心率的变化;(4)预测性生物标志物可用于判断个体是否具有罹患某种疾病的风险,以及其对特定治疗可能产生的反应;(5)预后性生物标志物可在患者易感特定健康结局的情况下,提供有关疾病进展或复发可能性的信息;(6)风险性生物标志物用于评估患者在获得正式诊断前患某种疾病的潜在风险水平;(7)安全性生物标志物用于评估治疗过程中可能出现的毒性或不良反应风险。本研究主要关注与风险评估和诊断相关的分子生物标志物的分析,如图2所示。鉴于全球范围内可获取的大量临床数据,生物标志物在指导临床决策、推动科研进展以及促进个体化医学方面具有至关重要的作用。

图 2:用于临床决策的生物标志物类别。 本图展示了生物标志物所涉及的决策过程。根据对生物标志物所采用的分析方法,进行相应的临床决策,并实施机器学习算法。请点击此处查看该图的放大版本。
由于生物标志物的类型、特征和质量范围广泛,寻找并理解具有临床应用价值的生物标志物信息具有挑战性。过去二十年间生物标志物研究的迅速增长进一步加剧了获取全面且最新数据的难度,尤其是分子生物标志物方面的数据。这导致了诸如研究结果不一致、对已有生物标志物的重复发现、相互矛盾的结论,以及未能充分利用已确立的生物标志物等问题18。随着“组学”检测技术的出现,这一问题进一步恶化,临床检测和文献中涌现出大量新型分子生物标志物,使得有效获取和应用生物标志物知识变得愈发困难19。
MarkerDB 2.0 为实验目的提供了多种分子生物标志物的访问途径20。在临床研究和医疗应用中,各种生物标志物被用于疾病的诊断、预测和监测。其中,蛋白质生物标志物利用血清、血液、脑脊液(CSF)、腹膜液、羊水、血浆和尿液等生物液体,分析糖尿病、结核病、唐氏综合征以及肌病相关疾病等状况。类似地,遗传生物标志物则利用 LRP1、LPP、MAPT 和 SPI1 等基因符号,分析年龄相关性黄斑变性、过敏性疾病、阿尔茨海默病、癌症和哮喘等疾病。此外,多模态分子生物标志物有助于评估患者的疾病风险和诊断指标21。本研究强调了利用机器学习方法进行医疗健康数据分析的重要性,以提升疾病的诊断、预测能力以及实现个体化治疗。
5. 建立生物标志物发现的统计机器学习方法模型
机器学习方法的应用在诸多方面改变了医疗保健领域。具体而言,分子生物标志物已通过多种机器学习技术进行分析,包括主成分分析(PCA)、K均值聚类(KMA)、最近邻分析(NNA)以及神经网络算法22。这些模型能够从选定特征中识别复杂模式,处理不完整或不一致的数据,并支持对疾病进展的实时监测。除了疾病诊断外,机器学习算法还通过数据检验与可视化,为患者问题提供重要洞察,从而实现及时且精准的诊疗23。因此,这在异常情况下显著改善了患者的健康结局。此外,机器学习在推动各类疾病中生物标志物发现及治疗效果提升方面的潜力,包括对分子生物标志物的分析,正变得日益显著。
机器学习算法可分为五种主要类型,如图3所示。监督学习是指在带有标签的数据集上进行训练,以理解输入与输出之间的关系,适用于分类和回归等任务,例如决策树和支持向量机。无监督学习用于识别无标签数据中的模式,常用于聚类和降维,典型技术包括k均值聚类和主成分分析。半监督学习结合了有标签和无标签数据以生成预测结果。强化学习侧重于根据环境反馈进行决策,在游戏和机器人领域应用广泛,常用方法包括Q学习和深度强化学习网络。深度学习利用具有多层结构的人工神经网络来识别数据中的复杂模式。该技术有助于预测癌症、中风、阿尔茨海默病和帕金森病等常见疾病的生物标志物。目前已有多种经临床批准的应用采用了这一技术24,25。对恶性肿瘤患者的精确诊断通常依赖于组织样本的获取及其病理学分析,这些分析可提供有关组织学分级、亚型、分期以及多种其他肿瘤生物标志物的关键信息。

图3:用于临床决策的机器学习算法分类。 图示中的机器学习算法类型有助于理解所采用的方法学。请点击此处查看此图的放大版本。
统计学与机器学习是两个独立但经常交叉的学科。统计学涉及数据的收集、分析和解释,通常处理较小且结构明确的数据集,主要关注信息的比较与归纳总结。而机器学习是人工智能的一个子领域,旨在构建预测模型,通常处理大规模且复杂的数据集。尽管统计学在确证性研究和理解潜在机制方面具有重要作用,机器学习则在探索性研究、发现复杂模式以及处理缺失数据方面更具优势。诸如逻辑回归等方法既可被视为统计模型,也可视为有监督的机器学习模型,这体现了两个领域之间界限的模糊性。最终,研究人员需根据研究目标及数据特性,评估并选择最合适的方法。
6. 建立MLP及MLP变体的模型
MLP(多层感知机)是一种神经网络架构,其在输入层和输出层之间包含多个神经元层,如图4所示。MLP 于20世纪50年代被提出,并随着20世纪80年代反向传播算法的进步与发展而得到广泛应用,反向传播有助于最小化损失。MLP的基本学习原理包括神经网络、权重和偏置值,用于计算输出。最后,需确定激活函数和阈值,以在输出层获得输出结果。在本文提出的方法中,输入层、隐藏层和输出层中的节点分别对应临床和基因特征、采用ReLU激活函数的全连接层,以及采用Sigmoid激活函数的单个神经元,用于预测二分类结果(风险、诊断)类型。其主要优点是训练和解释简单。然而,简单的MLP无法处理大规模数据集,且对学习率敏感26。因此,为克服这些缺点,本文采用带学习率调度器的MLP,其架构如图3B所示。带学习率调度的MLP是一种强大的动态机制,包含陡峭衰减、指数衰减、逆时间衰减、ReduceLROnPlateau和余弦退火等策略。学习率不再采用固定值,而是根据模型性能和训练过程动态调整。

图 4:多层感知机建模及带学习率调度器的 MLP。(A)多层感知机:图中展示了 MLP 的结构,包括输入层、隐藏层和输出层。第一层接收输入,在第二层通过激活函数进行处理,最后一层获得输出。MLP 实现简单。(B)带学习率调度器的 MLP:该结构与 MLP 类似,但增加了学习率调度器以控制训练速度,从而获得更好的收敛速率。当训练进入平台期时,学习率会降低,从而减少越过最小值的情况。请点击此处查看此图的放大版本。
该方法在处理表格数据时更高效、可靠且有效。此外,其优势还包括在噪声数据上具有稳定的收敛性提升、更好的泛化能力以及减少超参数调优的工作量。然而,对于某些预测任务,可能会遇到一些困难,例如陷入局部极小值。此外,在图5所示的宽深MLP架构中,MLP引入了宽分支与深分支结构,以在相关性映射、规则记忆以及新模式学习方面表现更优,同时保持较高的泛化水平。通过将这些部分的输出整合至输出层,实现二分类输出的预测27。然而,该方法在未见特征的泛化能力方面存在局限性,并可能出现过度泛化现象。综上所述,结合批归一化(Batch Norm)与Dropout的MLP用于标准化训练过程,并通过Dropout机制实现对未知属性的学习与泛化。特别是,该技术适用于高维数据,并有助于防止过拟合。然而,该技术也存在批处理大小受限、内存消耗增加(由于批归一化层的引入)等缺点,且并非适用于所有情况的通用解决方案28,29。

图 5:MLP 宽与深网络建模。该示意图展示了 MLP 的深层路径,能够捕捉非线性关系,并通过 Sigmoid 单元将输出结果结合用于分类。该架构可用于异质性生物标志物数据的模式学习与知识提取。请点击此处查看该图的放大版本。
7. TabNet
TabNet 是由 Google Research 团队开发的一种名为“表格网络”(Tabular Network)的深度学习模型30。TabNet 模型的主要动机是调和针对图像、文本、语音的深度学习方法(如卷积神经网络 CNN、自编码器 Autoencoder、Transformer)与基于树的机器学习方法(如 XGBoost、随机森林 Random Forest、LightGBM)之间的差异。此外,深度学习方法的局限性对 TabNet 模型产生了重大影响,例如多层感知机(MLP)是一种参数化模型。最重要的是,深度学习方法在现实世界问题中的可解释性、自监督学习能力以及序列学习能力方面存在不足31。TabNet 模型目前主要应用于保险风险预测32、煤灰含量估计33、化学毒性预测34以及教育考试作弊检测35等场景。图6展示了 TabNet 的架构。

图 6:表格网络建模。 表格网络以表格形式接收输入特征,并在每个模块中按顺序应用转换器技术。GLU 模块(即门控线性单元模块)控制信息在网络中的前向流动,有助于特征选择和稳定学习。输出层呈现由累积输出生成的结果。请点击此处查看该图的放大版本。
根据上述架构图,该系统被划分为四个组成部分:输入模块、共享特征变换器、序列化决策步骤以及通过优化进行的损失计算。在类别特征中,特征在经过嵌入层后被转换为整数;与此同时,连续特征则保持原始形式直接输入。最终,这些特征被转换为一个统一的特征向量,其中 x ∈ Rd。下一步,通过带激活函数的全连接层对数据进行处理,随后进行变换以将数据转化为向量并做出决策。第三步依次使用注意力变换器、掩码机制、决策变换器以及预测累积。该步骤的目标是实现选择性注意力、序列化推理以及决策路径的构建。最后一步采用二元交叉熵或类似方法计算损失并优化数值,同时通过稀疏注意力机制进行正则化处理,以防止过拟合。
8. AutoInt
自动特征交互学习(Automatic Feature Interaction Learning)via 自注意力神经网络(AutoInt)是AutoInt的全称,最初提出用于点击率(CTR)预测36,随后被应用于多种场景,包括软件缺陷预测37、推荐系统38以及基因组检测39。现有的机器学习方法存在若干局限性,例如难以处理高维稀疏数据、高阶组合特征、难以理解特征在预测中的作用能力,以及需要人工进行特征工程。AutoInt模型以高效性、有效性和可解释性解决了上述所有挑战。在本研究提出的方法中,AutoInt的目标是预测给定的变异属于风险型还是诊断型指示。针对该数据集共提出七个步骤,如图6所示,并附有源代码。第一步为读取数据并进行预处理,将所有类别型特征编码为整数,并将标签分别映射为0(风险型)和1(诊断型)。第二步进行特征表示,构建嵌入矩阵,随后将该矩阵转换以对数值型特征进行归一化。接下来是交互层,在该层中,特征之间通过变换器自动学习其内在的交互关系,无需人工干预。此外,多个注意力头可学习不同类型的特征交互,最终将特征进行拼接,从而增强特征表示能力。模型中引入残差连接,以同时学习低阶和高阶特征交互,例如单个特征、两个特征、三个特征等的交互。最后,残差网络的输出被送入sigmoid函数进行二值化计算,如图7所示。

图7:AutoInt 网络建模。 AutoInt 网络可自动学习特征,其中嵌入层接收输入特征,并通过自注意力机制和残差连接将其映射到下一层。最后一个组件包含MLP层和激活函数,用于生成输出。请点击此处查看该图的放大版本。
访问受限。请登录或开始试用以查看此内容。
实验采用机器学习(ML)和深度学习(DL)方法,以比较其性能表现。同时,考虑构建结合监督学习与无监督学习机制的机器学习模型。本方法中使用的监督学习技术包括逻辑回归、决策树、随机森林、梯度提升、支持向量机以及K近邻算法。这些算法涵盖了从简单的统计模型到复杂的基于树的分析方法。另一方面,无监督机器学习算法包括K均值聚类、DBSCAN聚类和凝聚聚类技术。而所采用的深度学习技术则包括简单的多层感知机(MLP)、MLP结合批归一化与早停机制、宽深网络(表格数据混合模型)以及带学习率调度器(进阶)的MLP。在分析结果之前,使用基于模型的特征重要性评估、排列重要性以及SHAP(SHapley Additive exPlanations)和LIME(Local Interpretable Model-agnostic Explanations)方法计算特征重要性。此外,这些方法为AdaBoost技术提供了“黑箱”解释能力,有助于理解模型间的关系、识别冗余特征、提升模型性能并检测偏差。因此,通过多种技术测量特征重要性,并将结果在图8中进行可视化展示。
访问受限。请登录或开始试用以查看此内容。
本研究明确阐述了生物标志物在疾病识别、监测及其特征分析中的重要性。所提出的生物标志物研究方法基于四个关键步骤:细致的数据准备(包括数据清洗、编码及去除标识符);统一的目标编码(风险=0,诊断=1);特征归一化,以及为AutoInt37/TabNet等模型提供高质量的深度嵌入;以及严谨的评估流程保障(合理的训练集/测试集划分、准确的指标报告)。此外,借助机器学习(ML)和深度学习(DL)算法,实现了基于基因对疾病状态的预测。在数据集上实施了最常用的ML算法,算法与数据集之间的协调性和效率与前述部分的结果一致。另外,除MLP29、TabNet和AutoInt之外的新DL模型也被应用于该数据集分析,且模型运行情况与所采用数据集相匹配。结果表明,这些模型优于现有研究,实验结果支持这一结论。为确保可重复性,建议实施若干改进措施,例如对新的分类变量使用OrdinalEncoder,并引入Dropout/BatchNorm以减轻模型过拟合。采用动态学习率调度器可提升训练稳定性。故障排查应优先考虑避免数据泄露(如删除ID列)、解决过拟合问题(通过衰减策略),...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者未获得外部资助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| AutoInt 模型 | 北京大学 | https://github.com/shichence/AutoInt | 通过自注意力神经网络实现自动特征交互学习:一种高效算法,可自动学习(稀疏)分类和数值特征的高阶特征交互 |
| deepctr_torch.models | 开源 | https://github.com/shenweichen/DeepCTR-Torch | 基于深度学习的点击率(CTR)模型模块化且可扩展的工具包,便于轻松构建自定义模型 |
| Google Colaboratory | https://colab.research.google.com/ | 基于云的 环境,可通过浏览器编写和执行用于机器学习和数据分析的 Python 代码 | |
| Keras 2.6.0 | Keras | https://keras.io/ | 提供用于执行神经网络的 Python 接口,运行在 TensorFlow 之上 |
| MarkerDB 2.0 | MarkerDB | https://markerdb.ca/downloads | 公开可用的分子生物标志物数据库 |
| Matplotlib 3.4.3 | Matplotlib | https://matplotlib.org/ | Python 的可视化库 |
| Numpy 1.21.4 | Numpy | https://numpy.org/ | 用于 Python 科学计算的基础软件包 |
| Pandas 1.3.4 | Pandas | https://pandas.pydata.org/ | 功能强大、灵活且易于使用的开源数据分析与处理工具,基于 Python 编程语言构建 |
| Python 3.8.10 | Python 软件基金会 | https://www.python.org/ | 一种流行的编程语言,能更有效地集成深度学习系统 |
| pytorch_tabnet.tab_model | Pytorch | https://pypi.org/project/pytorch-tabnet/ | 用于实现二分类/多分类及回归问题 |
| Scikit-learn | Scikit-learn | https://scikit-learn.org/stable/ | 用于机器学习算法的 Python 模块 |
| Seaborn | Seaborn | https://seaborn.pydata.org/ | 高级数据可视化库,用于绘制美观且信息丰富的统计图形 |
| TabNet 模型 | https://github.com/dreamquark-ai/tabnet | TabNet 是一种端到端神经网络,专为直接处理表格数据而设计 | |
| Tensorflow 2.6.0 | https://www.tensorflow.org/ | 一个端到端的机器学习平台 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可