本研究在沙特阿拉伯的哮喘检测数据集上评估了多种机器学习算法。与采用机器学习进行哮喘临床诊断的现有先进技术相比,所提出的方案表现出更优的性能,在诊断准确率上提升了3.9%。
研究文章
本研究在沙特阿拉伯的哮喘检测数据集上评估了多种机器学习算法。与采用机器学习进行哮喘临床诊断的现有先进技术相比,所提出的方案表现出更优的性能,在诊断准确率上提升了3.9%。
研究表明,包括哮喘在内的慢性疾病发病率有所上升。由于气候条件和生活方式的影响,尤其是在后疫情时代,沙特阿拉伯哮喘患者人数已引起关注。迫切需要通过开发一种智能系统来实现哮喘的早期检测,从而减少感染,预防疾病或实现早期治疗。本研究利用机器学习技术开发了用于早期追踪哮喘症状的工具。尽管此前已有多种尝试应用机器学习预测哮喘的发生,但针对沙特阿拉伯地区背景下在症状出现前阶段识别该疾病的研究仍相对不足。本研究的数据集来自沙特阿拉伯达曼的法赫德国王大学医院,包含对患者进行的标准检测,如血液检测、病毒检测和生物化学检测。该数据集包含17个重要属性,涵盖328名哮喘患者的信息:其中165例为阳性,163例为阴性。本研究选用的方法包括随机森林(RF)、人工神经网络(ANN)、支持向量机(SVM)和朴素贝叶斯(NB),每种方法均基于其独特特征被选中。实验结果表明,RF、SVM和ANN方法均达到了94%的最高准确率,比现有技术水平提高了3.9%。值得注意的是,上述准确率仅使用了17个可能特征中的9个即得以实现。尽管RF、SVM和ANN达到了相同的准确率,但ANN的误差代价更高。因此,基于结果模式,RF和SVM表现更优,故建议将这两种方法用于解决该问题。
经过广泛研究,研究人员发现慢性疾病正变得越来越普遍1。哮喘是一种以反复发作的呼吸困难和喘息为特征的气道慢性炎症性疾病。全球范围内,儿童和成人哮喘的患病率差异较大,介于1%至20%之间,影响着全球数百万人2。这种大规模的变化与环境变化有关,包括不同国家的环境差异,以及哮喘评估工具的不同和流行病学定义的多样性。与其他一些众所周知的慢性疾病相比,哮喘的死亡率相对较低2。然而,有报告指出,沙特阿拉伯王国的哮喘发病率正在上升3,4。
哮喘是一种导致管腔狭窄的慢性炎症性疾病。气道狭窄是由于体液分泌增加,以及由水肿、上皮下纤维化和平滑肌肥厚引起的支气管壁增厚所致。多种细胞类型(包括免疫细胞)驱动的病理生理机制已被用于评估这些病变5。由于沙特阿拉伯气候恶劣,且居民主要为室内生活方式,哮喘已成为最普遍的慢性疾病之一。多项调查显示哮喘患病率极高6。该疾病已构成重大公共卫生问题,亟需建立早期响应系统,以减少发病次数,并使疾病在早期阶段得以干预、预防或治疗成为可能。
与个体相比,哮喘对社区和家庭具有深远的影响。如果未能得到有效控制,哮喘将对患者的生活造成严重限制,并阻碍他们参与许多日常活动。在沙特阿拉伯,恶劣的天气条件,包括炎热的气候、频繁的沙尘暴以及室内空调/制冷系统的过度使用,是导致哮喘的重要因素。沙特胸科学会(STS)已做出显著努力,为呼吸道感染提供最佳药物治疗7。然而,迫切需要采取主动的哮喘诊断措施,以降低感染率,尤其是在后疫情(COVID-19)背景下。进一步研究推断, 家族史、吸烟和过敏性鼻炎是沙特阿拉伯成年人群中引发哮喘的最重要危险因素之一。 建议开展更多研究,以探讨其他为本研究奠定基础的相关因素。
本研究基于既往关于哮喘诊断的研究,旨在提高诊断准确性。随机森林(RF)、人工神经网络(ANN)、支持向量机(SVM)和朴素贝叶斯(NB)等所提出的技术已在先前研究中被应用,并在诊断结果方面取得了显著改善。例如,研究人员已在研究中使用了ANN、SVM和NB8,9,10。在本研究中,探索了机器学习方法作为早期预警系统的应用,以在疾病最早阶段(症状前阶段)检测出哮喘的微小征兆。沙特阿拉伯地区哮喘疾病的流行率,尤其是在后疫情时代,受多种因素影响,如因极端天气条件导致的室内生活方式、空调管道以及沙尘暴等,均为主要诱因。然而,目前尚无显著研究探讨近年来出现的关键影响因素。为弥补这一研究空白,本研究旨在探究机器学习在沙特阿拉伯成年人群中早期检测哮喘的作用。此外,主要目标是以最少的特征实现尽可能高的准确率。尽管过去已有若干研究尝试利用机器学习预测哮喘疾病的存在8,9,10,但本研究首次采用来自沙特东部省份一家公立医院的沙特阿拉伯本地数据集,专注于疾病的早期诊断(前瞻性诊断)。机器学习(ML)被公认为是从收集的数据中提取知识的一种方法11,12。它通过多种机器学习技术,利用以往实例的学习过程,获得预测准确性。机器学习涵盖多种方法、算法和策略,广泛应用于医学领域的分析与预测问题,例如疾病的早期检测13,14。
已有多个研究采用不同技术对哮喘疾病进行预测。研究人员开发了一种人工神经网络(ANN),根据患者的动态和静态检测结果对哮喘进行分类。8肺活量测定、脉冲振荡法(IOS)、听诊、过敏检测结果以及症状信息等测量参数被用于人工神经网络(ANN)中。这些特定信息使人工神经网络能够建议相应的哮喘分类。同样,研究人员开展了一项研究,以应对胸肺疾病诊断中的挑战7支持向量机(SVM)和自适应支持向量机(ASVM)方法被用于诊断哮喘等胸部疾病。在所有胸部疾病的分类中,ASVM方法获得了最佳的分类准确率。研究人员采用了多种神经网络结构,例如具有一个和两个隐含层的多层神经网络(MLNN)及反向传播算法(BPA),以及概率神经网络 NN(PNN)、学习向量量化(LVQ)和通用 回归神经网络(GRNN)在胸部疾病诊断中的应用,包括哮喘病的诊断15此外,一些研究开展了利用人工免疫系统(AIS)诊断胸部疾病的比较研究。上述研究使用不同的数据集,构建了多种结构以解决胸部疾病的诊断问题。对于哮喘,采用AIS取得的最高诊断准确率达到90.91%16此外,研究人员探讨了深度神经网络(DNN)在提高哮喘诊断准确性方面的有效性,并比较了不同机器学习算法的预测性能,特别是逻辑回归和SVM。研究结果表明,利用哮喘体征模型进行的经验性测试在哮喘的准确诊断中更具成效。9另一项研究表明,利用选定的机器学习方法(如支持向量机和支持向量机和朴素贝叶斯)对远程监测数据进行分析,能够有效预测哮喘急性加重事件的发生。10.
此外,研究人员还采用了多种机器学习技术用于阿尔茨海默病(AD)的早期诊断,包括支持向量机(SVM)、k-近邻算法(k-NN)、自适应提升(AdaBoost)以及极端梯度提升(XGBoost)17研究人员还通过探讨四种机器学习方法——朴素贝叶斯(NB)、支持向量机(SVM)、K近邻(K-NN)和人工神经网络(ANN),对糖尿病进行了初步诊断研究。在沙特阿拉伯数据集中,排名前三的特征组合达到了68%的最高平均准确率。通过准确率、精确率、召回率和F1分数对各测量技术的性能进行比较,结果显示ANN的分类准确率最高,达到77.5%。18同样,该研究团队还实验了四种分类技术——即朴素贝叶斯(NB)、支持向量机(SVM)、K近邻(K-NN)和人工神经网络(ANN)——在沙特阿拉伯数据集上用于慢性肾病的早期诊断。19此外,作者采用四种机器学习技术——人工神经网络(ANN)、支持向量机(SVM)、随机森林(RF)和朴素贝叶斯(NB),对甲状腺癌进行了初步诊断研究。利用沙特阿拉伯数据集的14个特征,作者获得的最高平均准确率为95%。通过准确率、精确率、召回率和F1分数对各测量技术的性能进行比较,其中随机森林(RF)取得了最高的分类准确率,为90.91%。20研究人员还开展了两项研究,在类风湿性关节炎的主动诊断方面取得了显著成果。研究筛选并采用了多种机器学习技术,如支持向量机(SVM)、逻辑回归(LR)和AdaBoost,作为投票集成模型的候选技术。最初使用了一个数据集,并通过应用SMOTE方法对另一个数据集进行平衡处理。该新型投票集成技术通过两种序列特征选择方法进行测试,即前向选择和后向选择,以寻找能够为每种技术提供最高指标的最优特征子集。在使用原始数据的30个特征及序列前向特征选择技术的情况下,获得的结果令人鼓舞,准确率、召回率和精确率分别为94.03%、96%和93.51%21. 类似地,医学及相关领域的其他智能方法可在许多研究中找到22,23,24,25,26.
由于随机森林(RF)、支持向量机(SVM)、人工神经网络(ANN)和朴素贝叶斯(NB)在类似问题上表现出色,本研究采用了这些方法。在当前研究中,通过实验获得了相应结果。经过多种优化步骤和特征选择后,结果表明,所提出的方法在针对目标数据集的哮喘诊断中具有良好的应用前景。
访问受限。请登录或开始试用以查看此内容。
本节介绍了所提出的哮喘诊断方法中研究的机器学习算法。所提出方法的选择标准和依据基于全面的文献综述以及长期对多种慢性疾病进行先发性诊断的经验27,28,29,30,31。这些算法取得了有前景的结果。本研究中使用的所有材料和工具均列于材料表中。
支持向量机(SVM)
支持向量机(SVM)算法是模式识别与分类领域中最成功的算法之一32。该算法采用二分类方法,将训练向量集划分为两个类别。SVM属于监督学习算法家族,其期望输出是在监督条件下生成的32。与其他机器学习中的分类算法相比,SVM在分类性能方面表现更优。因此,它被广泛应用于语音识别、人脸识别和手写体识别等多种场景。此外,SVM还被应用于疾病预测和股票预测等多个领域。同时,由于SVM对噪声和过拟合不敏感,能够有效处理不平衡数据,这在医学诊断中尤为常见,例如阳性病例数量通常少于阴性病例的情况32。
在分类中,支持向量机(SVM)通过绘制决策边界来区分两个类别,从而通过区分一个或多个特征向量来预测标签32。该决策边界称为超平面,是距离每个类别最近的数据点最远的分隔面。这些数据点被称为支持向量。图1展示了线性可分数据中的一些候选超平面。公式1表示超平面方程,而公式2和公式3分别表示位于该平面之上和之下的元素32:
超平面方程 (1)
其中,w 是表示权重的向量,x 是表示输入的向量,而 b. 表示可能的偏置。
对所有 j,满足
= +1 (2)
对于所有满足
= -1 的 i (3)

图1:具有两个可分离类别的典型支持向量机(SVM)。本图展示了一个具有两个可分离类别的典型支持向量机。缩写:SVM = 支持向量机(support vector machine)。请点击此处查看本图的放大版本。
人工神经网络(ANN)
人工神经网络是一种软计算领域中的计算智能技术,可模拟人类大脑系统的功能。它包含大量相互连接的神经元33。人工神经网络属于监督式机器学习算法,能够从示例数据集中学习,并通过学习不断改进性能,从而生成有用的输出33。人工神经网络的结构由多个层次组成:输入层、隐藏层和输出层。每一层均由一组相互连接的神经元构成33。
从外部接收数据的神经元进行一些处理,然后将数据发送到另一个称为输入层的层级。输入层的目的不是对数据执行任何复杂处理,而仅仅是复制输入值并将其传递到下一层33。输出层包含为用户程序生成数据的神经元。在这两个层之间,可选地设置隐藏层以执行计算过程。隐藏层作为中间层,接收来自输入层神经元的输入,对其执行数学运算,然后将结果传递到下一个层级33。图2展示了人工神经网络(ANN)的架构。

图 2:典型人工神经网络结构中的前馈与反向传播。本图展示了典型人工神经网络(ANN)结构中带有反向传播的前馈网络。 缩写:ANN = artificial neural network(人工神经网络)。请点击此处查看该图的放大版本。
前馈神经网络是一种以正向方式存储输入数据的方法。而在反向过程中,反向传播通过反向更新神经网络的权重来获取梯度,该过程使用具有多个隐藏层的神经网络。这一过程的缺点是可能出现梯度消失或梯度爆炸问题。激活函数保持了人工神经网络(ANN)的非线性特性,使其能够学习输入与输出数据之间的复杂关系,正如其被称为通用逼近器所表明的那样。图3展示了人工神经网络的主要架构,同时说明了应用于每个神经元输出的激活函数,该函数表示所有输入权重的总和。偏置项包含所有权重的总和,并被纳入神经元的输入中33。

图3:人工神经网络中的典型单层感知器神经元。 本图展示了一个典型人工神经网络(ANN)中的单个感知器神经元。缩写:ANN = 人工神经网络。 请点击此处查看该图的高清版本。
随机森林(Random forest, RF)
随机森林是机器学习中一种重要的分类算法。它由多个独立的决策树组成,这些决策树作为一个集成模型协同工作,共同生成最终输出29。随机森林之所以性能优异,其基本原理在于它由大量弱相关性的决策树(构成“森林”)组成,这些树如同一个委员会共同决策,因此比各个独立运行的模型更加高效34。随机森林算法最初由一组研究人员提出35。要更好地理解随机森林的工作机制,首先需要理解决策树的基本原理35。该算法同样适用于离散型和连续型问题,分别对应分类、检测和回归任务36。森林中决策树的数量越多,结果越接近准确,但同时会增加计算复杂度36,如图4所示。

图 4:随机森林示意图。 本图展示了一个典型随机森林的示意图。请点击此处查看此图的放大版本。
朴素贝叶斯 (NB)
朴素贝叶斯 (NB) 是一种利用贝叶斯定理对对象进行分类的分类算法。它是一种在大多数医学领域广泛应用的非常流行的方法,尤其适用于症状诊断。该方法基于属性间相互独立的基本独立性假设,即各个属性之间的关系彼此独立。由于其“朴素”的特性,它属于机器学习中最简单的分类算法之一37。根据给定的数据集,NB 可确定某一特定输出结果的可能性。NB 模型易于构建,能够处理大量数据,是一种结构简洁且计算负担较轻的算法。此外,它能够处理数值型和标称型知识,表现出适中的功能。鲁棒性强以及学习解释简单也是 NB 分类器的潜在优势。若将其应用于少量数据,将可能导致相对不准确的结果。该方法依赖大量记录,其精度被认为较其他技术更低37。
统计分析
对数据集进行统计分析有助于可视化和理解数据集的分布模式,从而更好地进行数据预处理和建模。为此,执行了以下步骤。首先,为了检验年龄和性别等人口统计学特征在阳性组与阴性组之间是否存在不平衡,使用 SPSS 软件进行了统计分析。其次,若数据满足正态分布和方差齐性条件,则采用独立样本 t 检验对定量数据进行分析,否则采用 Mann-Whitney U 检验。最后,对分类数据采用卡方检验或 Fisher 精确检验进行分析38。
实施
数据集描述
本研究的数据集来自沙特阿拉伯达曼的法赫德国王大学医院,在获得机构审查委员会(IRB)批准后获取。所述数据是根据患者的标准检测程序收集的。哮喘通常通过患者的标准检测进行诊断,包括血液检测、病毒检测和生物化学检测。在本研究中,患者和健康对照组(HC)根据医院在科室医生建议下进行的标准分诊和病理检测结果进行招募和临床评估。临床纳入和排除标准由医生根据实验室结果确定。随后,提供经过资格审核和验证的数据用于本研究。该数据集包含十七个属性,这些属性在所有哮喘患者中均可获得。数据集共包含328个实例,其中165个为哮喘阳性,163个为哮喘阴性。阳性和阴性组中性别和年龄的分布列于表1中。
| 实例 | 阳性 | 阴性 | |
| 男性 | 145 | 107 | 38 |
| 女性 | 183 | 57 | 126 |
| 总计 | 328 | 164 | 164 |
表1:数据集的性别分布。该表格展示了数据集中的性别分布情况。
表2显示了两个班级之间的年龄分布。
| 年龄范围 | 年龄分布(类别 = 1) | 年龄分布(类别 = 0) |
| 1–10 | 0.059113 | 0 |
| 11–20 | 0.113301 | 0.060869 |
| 21–30 | 0.083743 | 0.177947 |
| 31–40 | 0.157632 | 0.164912 |
| 41–50 | 0.17734 | 0.164912 |
| 51–60 | 0.197044 | 0.099566 |
| 61–70 | 0.108374 | 0.047619 |
| 71–80 | 0.078817 | 0.025974 |
| 81–90 | 0.019704 | 0.012987 |
| 91–100 | 0.004926 | 0.012987 |
表2:数据集的年龄分布。 该表展示了数据集中年龄的分布情况。
年龄(在 Mann-Whitney U 检验中,p < 0.001)和性别(在卡方检验中,p < 0.001)在阳性组与阴性组之间分布不平衡。然而,招募过程本身并无偏倚。这种分布不平衡可能反映了该患者队列特有的年龄分布特征。纳入标准包括疾病存在与否的临床因素,以及性别、年龄和当地人群等人口学特征。此外,数据采集均在获得知情同意的前提下进行。如后文所述,年龄和性别被纳入特征集作为潜在特征。但基于年龄和性别的明确分析不在本研究范围内,将留待后续研究探讨。
数据集以数值形式存储。“类别”列包含数值 0 和 1,其中 0 代表“正常患者”,1 代表“哮喘患者”。
本研究使用了以下十七个属性:
类别:(0 = “正常”,1 = “哮喘患者”)
1. 年龄(岁)(AGE)
2. 性别(1 = 男性,0 = 女性):GENDER
3. 嗜碱性粒细胞(BASO)
4. 嗜酸性粒细胞(EOS)
5. 血细胞比容(HCT)
6. 血红蛋白(HGB)
7. 淋巴细胞(LYM)
8. 平均红细胞血红蛋白量(MCH)
9. 平均红细胞血红蛋白浓度(MCHC)
10. 平均红细胞体积(MCV)
11. 单核细胞(MONO)
12. 平均血小板体积(MPV)
13. 中性粒细胞功能(NEUT)
14. 血小板计数(PLATELET_COUNT)
15. 红细胞计数(RBC)
16. 红细胞分布宽度(RDW)
17. 白细胞(WBC)
数据集的统计特征
为了便于理解,下表展示了数据集的统计分析结果38。表3列出了该数据集的均值、中位数、标准差、最大值和最小值。
| 均值 | 中位数 | 标准差 | 最大值 | 最小值 | |
| AGE | 39.1 | 36 | 18.136 | 93 | 2 |
| GENDER | 0.442 | 0 | 0.4974 | 1 | 0 |
| BASO | 0.07 | 0.07 | 0.0701 | 0.72 | 0 |
| EOS | 0.231 | 0.229 | 0.2048 | 2 | 0 |
| HCT | 40.88 | 40.7 | 6.0313 | 56.5 | 3.4 |
| HGB | 13.67 | 13.45 | 4.3446 | 81.3 | 5.9 |
| LYMP | 2.595 | 2.33 | 2.1843 | 33.4 | 0.4 |
| MCH | 26.78 | 27 | 3.3177 | 34.5 | 2.6 |
| MCHC | 32.71 | 33 | 2.1017 | 43.1 | 15 |
| MCV | 81.15 | 82.8 | 9.4426 | 102 | 13 |
| MONO | 1.189 | 0.613 | 6.1198 | 95 | 0.2 |
| MPV | 9.217 | 9.217 | 1.7297 | 13.4 | 0 |
| NEUT | 4.23 | 4.23 | 2.3074 | 16 | 0.6 |
| PLATELET_COUNT | 279.7 | 272.5 | 85.473 | 685 | 0 |
| RBC | 5.677 | 5 | 11.615 | 215 | 2.1 |
| RDW | 14.72 | 13.4 | 15.769 | 296 | 0 |
| WBC | 6.777 | 6.505 | 3.5836 | 33.4 | 1.1 |
| Class | 0.5 | 0.5 | 0.5008 | 1 | 0 |
表3:数据集的统计特征。 该表格列出了数据的统计特征。
此外,表4展示了每个属性与类别属性之间获得的相关系数,其数值介于0(相关性最低)和1(相关性最高)之间。该系数作为初步的统计分析被添加进来,用于解释数据集的属性。MPV、性别、HGB、MCHC和年龄是最显著的特征之一。
| 属性对 | 相关系数 |
| AGE | 0.212473 |
| GENDER | 0.423584 |
| BASO | -0.33242 |
| EOS | 0.048184 |
| HCT | -0.376843 |
| HGB | 0.275277 |
| LYMP | 0.055856 |
| MCH | 0.128111 |
| MCHC | 0.272635 |
| MCV | 0.013022 |
| MONO | 0.055476 |
| MPV | 0.564992 |
| NEUT | 0.031185 |
| PLATELET_COUNT | 0.095253 |
| RBC | 0.030787 |
| RDW | 0.025979 |
| WBC | 0.148842 |
| Class | 1 |
表4:与类别属性的相关性。 该表格展示了各属性(特征)与类别属性之间的相关性。
实验设置
在本研究中,使用 Python 编程语言对收集的数据集进行预处理。由于人为错误,在数据录入和选择过程中存在特定值缺失的情况。已采用填补技术来处理数据集中的缺失值,具体方法是用属性的平均值替换缺失值。这种方法因其简单性、与模型的兼容性以及对样本均值的保持性而被选用,且已与医疗专业人员讨论确认。此外,使用相关系数进行特征选择,以对属性进行排序。选择相关性值较高的特征,与完整的特征集一起用于分析。所提出方法的实现、超参数调优及结果获取均利用了 Python 库。通过属性选择方法进行特征选择与剔除,以识别出具有最高准确率的特征组合。此外,使用 Python 通过 10 折交叉验证和直接划分比率评估方法(根据给定公式39,40)评估准确率。最后,计算所有评估方法输出结果的均值,以比较所使用的评估方法,并确定具有最佳平均准确率的方法38。此外,使用支持向量机(SVM)、人工神经网络(ANN)、随机森林(RF)和朴素贝叶斯(NB)的最优参数生成混淆矩阵。随后通过计算 F1 分数对假阳性(FP)、假阴性(FN)、真阳性(TP)和真阴性(TN)的比例进行比较,F1 分数是评估最优方法的有效指标41,42。
评估指标
为了评估所提出方法的性能,采用了四种广为人知的性能指标,即准确率(accuracy)、精确率(precision)、召回率(recall)和 F1 分数(F1-score)。分类准确率是主要的衡量标准,因为针对每个样本会计算正确分类样本所占的百分比。精确率表示所有预测为正类的样本中实际为正类的比例。召回率表示在所有实际为正类的样本中被正确识别的比例。F1 分数则用于衡量每个类别的综合性能。根据输出结果的能力,可得到以下指标43,44,45:
真阳性(TP):正确诊断为哮喘的结果。
假阳性(FP):被错误诊断为患有哮喘的结果。
真阴性(TN):正确诊断为非哮喘的病例结果。
假阴性(FN):被错误诊断为非哮喘的结果。
(4)
(5)
(6)
优化策略
为了确定每种所提出方法的最佳参数,采用了网格搜索技术。将特定参数的可能取值输入网格搜索方法中,从而能够实现精度提升的最佳性能。
图5–7展示了利用前十八个属性,在数据集上应用网格搜索技术对所提出的四种方法进行优化的结果及其实现过程。图5展示了支持向量机(SVM)在不同参数取值下获得的准确率。针对多种核函数类型,代价(Cost)和伽马(Gamma)参数的输入值如下:
核函数类型:线性、径向、Sigmoid 和多项式。
Gamma:0.001 和 0.0001。
成本:1、10、100 和 1000。

图5:不同成本与伽马类型的SVM。 本图展示了支持向量机在不同成本与伽马类型下的行为特征。缩写:SVM = 支持向量机。 请点击此处查看此图的放大版本。
对于射频(RF),系统输入的数值如图6所示,具体如下:
参数名称及其对应的值如下所示:
特征数量:'auto'、'sqrt'。
最大深度:1、3、5、7。
MIN 样本分裂数:2、3、4、5。
MIN 样品叶片:2、3、4、5。

图 6:不同深度值和最小样本叶节点的随机森林(RF)。 该图展示了随机森林在不同深度和最小样本叶节点取值下的表现。缩写:RF = 随机森林(random forest)。 请点击此处查看此图的放大版本。
对于人工神经网络(ANN),分析输入值如 图7所示。
参数名称及其对应的值如下:
隐藏层大小:(50, 50, 50)、(50, 100, 50) 和 (100)。
激活函数:'tanh' 和 'relu'。
优化器:'sgd' 和 'adam'。
Alpha:0.1、0.01、0.001、0.0001、0.5、0.005、0.0005 和 0.05。
学习率:'constant' 和 'adaptive'。

图7:具有不同 alpha 值和隐藏层大小的人工神经网络(ANN)。 该图展示了具有不同 alpha 值和隐藏层大小的人工神经网络(ANN)的行为。缩写:ANN = artificial neural network(人工神经网络)。请点击此处查看此图的放大版本。
| 分类器 | 参数 | 值 |
| SVM | Gamma | 0.0001 |
| 核函数类型 | 'rbf' | |
| 代价 ‘C’ | 10 | |
| 随机状态 | 42 | |
| RF | 最大深度 | 3 |
| 叶节点最小样本数 | 2 | |
| 内部节点再划分所需最小样本数 | 2 | |
| 随机状态 | 42 | |
| ANN | 激活函数 | 'relu' |
| alpha | 0.001 | |
| 隐藏层大小 | (50,50,50) | |
| 学习率 | 'constant' | |
| 优化器 | ‘adam’ | |
| 随机状态 | 42 |
表5:所提出分类器的最优参数汇总。 该表格总结了所提出分类器获得的最优参数。
访问受限。请登录或开始试用以查看此内容。
特征选择的影响
在本研究中,采用基于递归特征消除的相关系数法进行特征选择。相关系数用于根据特征的相关性值从高到低对特征进行排序。递归特征消除用于辅助选择适合模型的特征,其逐步剔除最弱的特征,直至仅剩一个特征为止。每一轮过程均使用四种选定的分类器进行10折交叉验证,以找出准确率最高的特征组合。以下是该剔除方法的具体流程:
首先,使用 N 个特征构建包括朴素贝叶斯(NB)、随机森林(RF)、支持向量机(SVM)和人工神经网络(ANN)在内的算法。其次,计算所有特征的相关系数,并选取排名前 N/2 的特征。第三步,重复第二阶段过程,直至仅剩一个特征。最后,通过直接划分法(Direct Partition)选择表现最优的特征集合。此外,为了确保性能评估的无偏性,在交叉验证过程的每一折中均独立进行特征选择。这是因为所选特征仅基于训练样本,而验证样本在整个过程中完全“未见”。采用一半的特征以获得平均结果,即使用九个特征。使用九个特征时,NB、RF、SVM 和 ANN 算法的平均准确率达到 91.29%。然而,ANN、RF 和 SVM 在使用九个特征时达...
访问受限。请登录或开始试用以查看此内容。
本研究采用了多种机器学习算法,包括支持向量机(SVM)、人工神经网络(ANN)、随机森林(RF)和朴素贝叶斯(NB)。经过多次实验、超参数调优和特征选择后得出结论:SVM、ANN 和 RF 表现出显著的诊断准确率,达到 94%,而 NB 相对较低,为 83.33%。结果通过 10 折交叉验证、优化的特征选择以及最佳数据划分比例进行了验证。根据所提供的数据,患者共十七项参数按其相关系数值进行了排序,结果显示低平均血小板体积(MPV)和性别(GENDER)与哮喘具有最高的正相关性。另一方面,红细胞压积(HCT)和嗜碱性粒细胞(BASO)表现出强烈的负相关,提示系统性炎症以及在呼吸应激下的细胞迁移。其他常见的免疫因子包括嗜酸性粒细胞(EOS),外周血嗜酸性粒细胞计数升高表明疾病严重程度。
与使用机器学习并基于临床数据集进行哮喘诊断的现有先进技术相比,本研究所提出的方案表现出更优的性能,在诊断准确率上提高了3.9%。值得注意的是,参考文献16,17中的研究均达到了90.91...
访问受限。请登录或开始试用以查看此内容。
该数据集已通过编号为 IRB-2020-09-429 的机构审查委员会批准从医院获取。作者声明,针对本研究不存在任何利益冲突需要报告。本研究已作为预印本提交至 Research Square 仓储,引用信息如下50。
作者贡献:
概念化由 S.O.、M.I.B.A. 和 A.R. 完成;监督由 S.O.、M.I.B.A. 和 J.A. 完成;初稿撰写由 S.S.A.、E.A. 和 Z.A. 完成;实施由 S.A.A.、Y.A. 和 R.A. 完成;验证由 J.A.、M.A. 和 S.D. 完成;数据管理由 A.B.、Y.A.、E.A. 和 Z.A. 完成;审阅与编辑由 A.R.、S.D. 和 A.B. 完成;项目管理由 A.R.、S.D. 和 M.A. 完成;经费获取由 A.B.、S.D. 和 A.R. 完成。
作者谨此感谢医疗专业人员在验证本研究结果方面所提供的支持。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Excel 365 | Microsoft | Excel 365 | 用于以 csv 格式存储原始数据 |
| 笔记本电脑/设备 | Dell | XPS9320 | 内存 16GB,第 12 代 Intel(R) Core(TM) i7-1260P 处理器 |
| Mlxtend 0.23.4 | Google colab Notebook | Mlxtend 0.23.4 | 用于模型构建与训练 |
| Numpy 2.0.2 | Google colab Notebook | Numpy 2.0.2 | 用于模型构建与训练 |
| Pandas 2.2.2 | Google colab Notebook | Pandas 2.2.2 | 用于模型构建与训练 |
| Python 3.12.12 | Google colab Notebook | Python 3.12.12 | 用于模型构建与训练 |
| Sklearn 1.6.1 | Google colab Notebook | Sklearn 1.6.1 | 用于模型构建与训练 |
| SPSS | IBM, USA | Version 26.0 | 用于统计分析 |
| XGbbost 3.1.2 | Google colab Notebook | XGbbost 3.1.2 | 用于模型构建与训练 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可