本文介绍了一种利用萨尔布吕肯数据库建立基于XGBoost的无创人工智能模型以诊断声带息肉的实验方案。
方法文章
本文介绍了一种利用萨尔布吕肯数据库建立基于XGBoost的无创人工智能模型以诊断声带息肉的实验方案。
随着人类社会交往的持续发展,患有嗓音障碍的人数也在不断增加。由于声学检测方法在病理性嗓音诊断中具有客观性和非侵入性等优势,利用语音信号分析进行病理性嗓音识别已成为研究热点。本文首先从德国SVD数据库中选取101段连续的元音/a/作为研究对象;其次,采用小波包技术进行时频分析,从子信号中提取近似熵、样本熵、模糊熵和排列熵这四个非线性动力学参数,作为病理性嗓音分类器的特征参数集;最后,选择机器学习算法XGBoost作为模式识别方法,建立病理性嗓音分类器,并通过五折交叉验证和ROC曲线验证分类性能。实验结果表明,XGBoost病理性嗓音分类器的准确率为0.857,F1分数为0.875,AUC值为0.944,均高于支持向量机(SVM)构建的分类器,说明XGBoost在病理性嗓音识别中具有更优的性能。
患有嗓音障碍的人数持续增加。据统计,一生中约有三分之一的人会出现嗓音问题1。对于歌手、教师等职业用声者而言,由于频繁过度或不当使用嗓音,其咽喉疾病的发病率更高。针对天津和乌鲁木齐教师群体的两项调查显示,嗓音障碍的发生率分别为33.81%和28.23%2,3。因此,临床上对病理性嗓音的检测与诊断日益受到重视。目前,临床主要采用主观评估、喉镜检查以及声学检测方法来诊断嗓音疾病4,5。声学检测方法将嗓音信号转化为数字信号进行分析,具有客观性强、检查过程中无创无痛的优点6。因此,声学检测已成为临床诊断中医生有效的辅助工具,相关研究也日益增多。
利用声学分析方法诊断病理性嗓音最重要的技术是特征提取和模式识别。自20世纪60年代以来,研究人员已开始提取一些传统声学参数用于病理性嗓音的研究,并发现了许多有效且稳健的声学特征参数,如基频扰动、振幅扰动以及梅尔频率倒谱系数(MFCC)7。近年来,研究人员不再局限于研究传统声学特征参数,非线性动力学参数也开始被应用于病理性嗓音识别领域8,并取得了良好的效果。随着机器学习的快速发展,涌现出更多运行速度快、分类性能优异的模式识别方法。目前应用于病理性嗓音识别的模式识别方法也越来越多,例如支持向量机(SVM)、随机森林、神经网络和深度学习9,10。XGBoost是近年来受到关注的一种模式识别方法11,它无需特征归一化,可自行进行特征选择,能够适应多种损失函数,并通过正则化项防止过拟合,具有速度快、可移植性强和容错性好的特点。因此,本文尝试将XGBoost方法应用于病理性嗓音识别,以期获得更优的识别效果。
访问受限。请登录或开始试用以查看此内容。
本研究的技术流程如图1所示。
1. 声音样本的采集
2. 语音数据的小波包分解13
3. 特征参数提取
(1)
(2)
(4)
(5)
(7)
(8)
(9)
(10)
(11)4. 模型建立
5. 模型性能评估
访问受限。请登录或开始试用以查看此内容。
本研究采用小波包分析对语音信号进行时频分解。通过整合非线性动力学参数——包括近似熵、样本熵、模糊熵和排列熵——系统表征了与声带息肉相关的病理性语音的复杂性与不规则性特征。随后,分别基于支持向量机(SVM)算法和XGBoost算法构建了两种病理性语音分类器。通过采用网格搜索方法,确定了每种模型的最优参数配置,详见表2。
如图3中的五折交叉验证结果所示,基于支持向量机(SVM)的分类器的评估指标表现出显著波动,而基于XGBoost的分类器的指标则相对稳定,表明基于XGBoost算法的病理性语音分类器具有更稳定的识别性能。
如表3所示,验证结果表明,基于XGBoost的病理性语音分类器的准确率为0.857,F1分数为0.875,AUC值为0.944。相比之下,基于SVM的病理性语音分类器的准确率为0.800,F1分数为0.786,AUC值为0.875。图4
访问受限。请登录或开始试用以查看此内容。
利用语音信号分析进行病理性嗓音诊断是一种无创且客观的方法19。因此,病理性嗓音分类已成为语音信号处理与识别领域的重要研究方向,展现出显著的临床应用价值和发展前景20。本研究采用从SVD中收集的语音样本作为实验语料库,通过语音信号处理与机器学习技术,构建了一种病理性嗓音分类器。
为确保局部信号特征的保留,采用小波包变换进行时频分析,从而实现对不同频率范围内特征参数的精确提取。此外,系统评估了小波基函数,并选用db3小波进行四级小波包分解(WPD)。本研究突破传统声学参数的局限,引入四种非线性动力学参数——近似熵、样本熵、模糊熵和排列熵,用于量化发声信号时间序列的复杂性,进而捕捉其内在的非线性成分15。采用XGBoost作为模式分类框架,并与支持向量机(SVM)进行比较,结果表明XGBoost具有更优的分类性能与有效性。
然而,由于主观因素和客观限制(例如时间限制)带来的局限性表明,该领域...
访问受限。请登录或开始试用以查看此内容。
作者声明不存在任何竞争利益。
本工作得到了江苏省 医院能力提升项目(JSPH-MC-2023-12)的支持。 作者谨此感谢南京航空航天大学经济与管理学院的李珊副教授,以及南京航空航天大学脑机智能技术教育部重点实验室的工作人员在方法学、数据分析和图表生成方面提供的指导。这些贡献保障了本研究的顺利推进。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| MATLAB | The MathWorks | R2023a | 用于数值计算和算法原型设计的主要软件平台。 |
| Python 软件 | Python 软件基金会 | Python 3.10 | 本研究中全程使用的核心编程语言。 |
| Saarbruecken 语音数据库,SVD | 萨尔兰大学语音学研究所 | Saarbrücken 语音数据库(SVD) | 一个公开可用的病理性与正常语音录音数据库,包含声带息肉等疾病患者以及健康对照者的元音持续发音和连续语音数据。根据其规定的访问条款,用于学术研究。 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可