研究文章

一种基于生成式人工智能的咳嗽音频信号新冠筛查框架

DOI:

10.3791/69874

2026年3月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种基于生成式人工智能的框架,该框架整合了生成对抗网络(GANs)、变分自编码器(VAEs)以及基于注意力机制的深度卷积网络,用于从咳嗽音频信号中检测新型冠状病毒肺炎(COVID-19),从而提升检测的鲁棒性、数据平衡性以及跨数据集的泛化能力,实现可扩展的无创筛查。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

咳嗽音频分析为开发支持新冠肺炎(COVID-19)疾病筛查的自动化工具提供了切实可行的途径。尽管相关研究日益增多,但许多现有方法仍对噪声、类别不平衡和数据集差异性较为敏感,限制了其可重复性。本研究提出一种基于结构化生成式人工智能的新冠肺炎检测方法,利用咳嗽声音录音进行识别。实验采用两个公开可用的数据集 COUGHVID 和 Virufy 进行,这两个数据集均包含标注的咳嗽样本。所提出的方案包括依次进行的预处理阶段,如咳嗽片段分割、去噪和信号归一化。随后通过梅尔频率倒谱系数、音色特征和频谱对比度特征提取声学特性。为提升表征学习能力并缓解数据不平衡问题,采用一种融合变分自编码器(Variational Autoencoders)与生成对抗网络(Generative Adversarial Networks)的混合生成框架,用于合成特征层级的样本。分类任务则通过深度卷积神经网络(Deep Convolutional Neural Networks)和基于注意力机制的 DCNN 模型实现。性能评估结果表明,引入生成式数据增强后,模型表现持续优于非生成式基线方法,在所评估的数据集上最高分类准确率达到 97.2%,AUROC 达 0.953。这些结果验证了生成式建模在提升基于咳嗽声音的新冠肺炎检测性能方面的有效性,并为未来在声学健康监测领域的研究建立了可重复的分析流程。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

呼吸声学 increasingly 被探索作为健康评估的非侵入性信息来源,特别是在感染性和肺部疾病背景下。信号处理和人工智能(AI)的进步使得咳嗽和呼吸声音的自动分析成为可能,支持其作为数字生物标志物的应用。最近的研究表明,使用智能手机、可穿戴设备或临床传感器中嵌入的麦克风采集的呼吸声音,可通过深度学习模型有效分析以检测 COVID-19 感染1,5。这些进展凸显了基于音频的筛查作为常规诊断程序的一种快速、无接触且可扩展的补充手段的潜力。由 SARS-CoV-2 病毒引起的 2019 冠状病毒病(COVID-19)主要影响呼吸系统,并引起气流动力学、肺功能和声道行为的可测量变化。尽管逆转录-聚合酶链式反应(RT-PCR)检测仍是诊断的参考标准,但其在物流上的限制和较长的周转时间限制了其在大规模或持续筛查中的适用性,从而推动了基于呼吸声音分析的替代方法的研究。

越来越多的研究文献探讨了利用咳嗽、呼吸和语音信号进行人工智能驱动的新冠肺炎检测。如表1所示,先前的研究探索了多种数据集、声学特征表示方法(例如MFCC、STFT、基于频谱图的特征)以及从经典机器学习模型到深度卷积、循环神经网络、基于注意力机制和Transformer架构等多种学习范式8,9,10,11,12,13,14,15,16,17,18,19,20,21,22,23,24,25,26,27˒43,44,45。一些研究已证明,使用众包和临床采集的呼吸音频可实现有前景的筛查性能。相比之下,其他研究则强调了迁移学习、数据增强和可解释人工智能在提升模型鲁棒性和可信度方面的重要性。本文不再逐项详细讨论各项研究,而是通过表1对这些代表性方法进行整合性的比较概述,便于直接对比各研究的数据集、方法学及报告结果。

尽管取得了这些进展,现有方法仍存在若干局限性,阻碍了其稳健性和实际应用能力。呼吸音频数据集通常在异质的录音条件下采集,导致设备、声学环境和受试人群之间存在显著差异2,3,4。许多公开可用的数据集依赖于自我报告的新冠病毒感染状态,从而引入了标签可靠性的不确定性7。此外,类别分布严重不平衡以及临床验证样本的可获取性有限,限制了仅基于观测数据训练的判别模型的泛化能力4,5。因此,在受控实验条件下报告的模型性能,并不能始终一致地转化为在多样化真实场景中的可靠部署。

综上所述,这些局限性凸显了一个关键的研究空白:目前尚缺乏一个能够同时应对数据稀缺、类别不平衡以及在异质数据集之间实现稳健泛化的统一框架。尽管已有研究探索了生成对抗网络(Generative Adversarial Networks, GANs)和变分自编码器(Variational Autoencoders, VAEs)等生成模型,用于学习潜在表征并合成逼真的生物医学信号6,7,但现有研究通常独立使用这些模型,并仅在单一数据集内进行评估。此外,这些模型与注意力增强型卷积架构的结合,以及在跨数据集条件下的评估,仍缺乏充分的研究。

为弥补这一不足,本研究提出一种基于生成式人工智能的咳嗽声音检测框架,用于辅助检测新型冠状病毒肺炎(COVID-19)。该框架结合声学特征提取、混合生成对抗网络–变分自编码器(GAN–VAE)模型以及基于注意力机制的深度卷积神经网络(DCNNs)。生成式组件通过结构化潜在表示学习和合成数据生成,缓解类别不平衡及样本数量有限的问题;判别模型则提升在异构数据集上的分类鲁棒性。与以往主要依赖数据集内验证的研究不同,本框架在独立数据集上进行跨数据集测试,从而更严格地评估其泛化性能。该框架旨在作为筛查导向的方法,而非独立的诊断工具,其设计明确考虑了录音差异性和标签不确定性,以支持可重复且可靠的部署应用。

本研究的创新性贡献主要体现在以下三个方面。首先,将一种统一的生成对抗网络(GAN)与变分自编码器(VAE)混合生成框架与基于注意力机制的深度卷积神经网络(DCNN)分类器相结合,共同应对基于咳嗽音的新冠肺炎筛查中所面临的类别不平衡、数据量有限以及鲁棒特征表示学习等挑战。其次,所提出的方法通过跨数据集验证进行了系统性评估,相较于传统的数据集内测试,能够更真实地反映模型的泛化能力。第三,本研究详细分析了在异质录音条件下生成式数据增强的影响,从而将该框架确立为一种可重复验证的概念性示范,适用于可扩展且具有实际应用价值的新冠肺炎筛查方案。

作者 & 年份数据集技术 / 使用的功能模型 / 分类器准确度 / 指标局限性 / 说明
Imran 等,20208众包咳嗽数据集(AI4COVID-19)MFCC、迁移学习、领域感知特征风险规避的多分类器(深度学习 + 机器学习集成)准确率:92.6%依赖于咳嗽质量;临床验证有限
Brown 等,20209众包呼吸音>7,000 名用户手工设计的音频特征,VGGish 嵌入浅层机器学习模型AUC > 80%众包数据中的标签噪声
Laguarta等,202010MIT Open Voice 数据集(5,320 名受试者)MFCC,声学生物标志物CNN(ResNet50,迁移学习)灵敏度:98.5%,特异性:94.2%需要大规模预训练数据集
夸尔蒂耶里 等,202011言语访谈(5名受试者,新冠前后)呼吸强度,F0,CPP,共振峰统计效应量分析在所有任务中实现超过 80% 的 AUC样本量极小
Hassan 等,202012呼吸音时间语音特征RNN咳嗽:97%,呼吸:98.2%,声音:88.2% 缺乏详细的数据集统计信息
Khamparia 等,201913ESC-10,ESC-50基于语谱图图像的特征CNN,TDSNCNN:77%(ESC-10),49%(ESC-50);TDSN:56%(ESC-10)仅使用环境声音;在复杂数据集上的性能较低
Aykanat 等,201714来自1,630名受试者的17,930条肺音数据(电子听诊器)MFCC 特征,频谱图图像支持向量机,卷积神经网络CNN/SVM:86%(健康 vs 病理),76%/75%(湿啰音–哮鸣音–正常),80%/80%(单一类型),62%/62%(所有类型)需要专用硬件;不针对特定疾病
Ponomarchuk 等,202215科斯瓦拉,维鲁菲MFCC、梅尔频谱图、小波特征CNN、RNN、集成模型AUC:0.93(内部),0.79(外部)跨数据集的泛化仍然具有挑战性
冯 et al., 202116科斯瓦拉,维鲁菲短时傅里叶变换,梅尔频率倒谱系数SVM(RBF),CNN准确率为 81.25%(AUC 为 0.79)数据集依赖性性能
Islam 等,202217临床咳嗽录音频谱与时间-频率特征深度神经网络准确率:89.2% 数据集有限
Manshouri, 202218Virufy光谱分析特征经典机器学习分类器准确率:95.86%小规模实验研究
黄等人,20201910名COVID-19患者的肺部声音时频呼吸音分析临床专家分析定性验证小数据集;无机器学习模型
W. D. Puja 等,202420Coswara、Virufy(咳嗽声音数据集)短时傅里叶变换、梅尔频谱图、梅尔频率倒谱系数、均方根能量、频谱带宽、频谱质心、频谱滚降点、过零率;基于卷积神经网络的深度特征提取一维卷积神经网络(特征提取器)+ 随机森林准确率:93%性能取决于咳嗽质量;适用于筛查而非临床诊断;数据来源于众包,存在变异性
Chadaga 等,202321众包咳嗽音频记录梅尔频谱图和时频声学特征卷积神经网络(CNN)准确率:84%,精确率:85%,召回率:84%,F1分数:84%性能受限于数据不平衡、自我报告的标签以及对录制条件的敏感性
Chadaga 等,202322轻度至中度 COVID-19 & 其他呼吸道疾病临床标志物特征选择(Pearson,PSO);关键标志物:嗜酸性粒细胞、白蛋白、总胆红素、碱性磷酸酶、丙氨酸氨基转移酶、天冬氨酸氨基转移酶、糖化血红蛋白、总白细胞计数堆叠集成;一维卷积神经网络、长短期记忆网络、深度神经网络、残差多层感知机准确率:89%排除重症病例;作为逆转录聚合酶链式反应的替代方法;应用可解释的人工智能
Dar 等,202423COVID-19 数据集SJHBO 优化(Jaya+HBO+SO),多种光谱特征深度Q网络(DQN)准确率:95.11%,灵敏度:95.06%,特异性:94.69%高复杂度;通过混合优化器提升调谐性能
Jing Quian 等,202024新冠肺炎患者的语音记录声学特征集;疾病严重程度、睡眠质量、疲劳、焦虑分析支持向量机(SVM)0.69(疾病严重程度)仅限音频特征;准确率中等;未说明数据集规模;仅考虑了四个健康方面
Sharma, J. 等. 202025UrbanSound8K,ESC-10,ESC-50多特征通道:MFCC、GFCC、CQT、Chromagram;混合数据增强具有空间可分离卷积和注意力模块的深度卷积神经网络UrbanSound8K:97.52%,ESC-10:94.75%,ESC-50:87.45%未在非基准或真实世界数据集上进行测试;由于更深的卷积神经网络和注意力模块,导致计算复杂度较高
Lella KK,等.202126 呼吸音;COVID-19、哮喘、健康数据增强;使用数据去噪自编码器(DDAE)提取深度特征而非梅尔频率倒谱系数(MFCC)一维卷积神经网络(1D CNN)~90%数据集信息有限;相比MFCC提升约4%;未验证泛化能力
Orlandic 等,202127COUGHVID(2.5万次以上咳嗽)梅尔频率倒谱系数,功率谱密度,频谱 & 时间特征XGBoostAUC 96.5%,精确率 95.5%自报新冠感染;专家对子集的标注
张 et al.,202343COVID-19疫苗接种后发生HLH的已发表病例报告(文献数据库)系统评价;临床特征整合;分子对接分析不适用(临床综述)描述性统计;临床结局罕见事件分析;样本量小;依赖报告病例可能导致报告偏倚
徐等人,202344文献报道的疫苗相关性VKH病病例回顾性病例分析;临床与影像学特征分析不适用(临床观察性研究)治疗反应与临床康复结局病例数量有限;缺乏对照组;无法明确建立因果关系
胡 et al.,202545中国SRDI医疗器械企业层面的母子公司数据(企信宝数据库)社会网络分析;空间网络指标;地理探测器分析不适用(网络) & 政策分析)网络密度、中心性、扩散指数横断面设计;企业权重相等;无直接的绩效或临床结果指标

表1: 现有基于音频的新冠肺炎检测研究汇总。 对以往咳嗽/音频筛查方法的比较概述,包括数据集、方法及报告的性能指标。请点击此处下载该表格。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

拟议方法

本研究提出了一种基于生成式人工智能的框架,用于通过咳嗽信号检测新型冠状病毒肺炎(COVID-19)。该框架将生成模型与判别分类器相结合,并在训练和评估过程中严格分离数据。图1展示了所提出的GAN–VAE–ADCNN框架的详细架构,显示了从音频预处理和特征提取,到通过变分自编码器(VAE)进行潜在表示学习,再利用生成对抗网络(GAN)生成合成特征,最终通过深度卷积神经网络(DCNN)和基于注意力机制的深度卷积神经网络(ADCNN)进行分类的完整流程。该图表明,生成组件仅在训练阶段使用,而分类则由判别模型完成。

用于 COVID-19 咳嗽检测的 VAE、GAN、ADCNN 音频信号处理示意图。
图 1:GAN–VAE–ADCNN 架构概述。所提出的混合流程示意图,其中源自咳嗽的声学特征通过变分自编码器(VAE)进行编码,利用基于生成对抗网络(GAN)的合成样本生成进行数据增强,并通过深度卷积神经网络(DCNN)及基于注意力机制的深度卷积神经网络(ADCNN)模型进行分类。请点击此处查看该图的放大版本。

模型架构与实现

本框架中使用的生成模型与判别模型均采用固定且可重复的网络结构。生成对抗网络(GAN)包含一个生成器和一个判别器:生成器具有三个全连接层(128、256 和 512 个神经元),激活函数为 ReLU;判别器同样具有三个全连接层(512、256 和 128 个神经元),激活函数为 LeakyReLU,最后接一个 sigmoid 输出层。

变分自编码器(VAE)的编码器包含两个全连接层,分别具有256和128个神经元,随后进行潜在均值和方差估计,潜在空间维度为64。解码器采用对称结构,并通过重构损失与Kullback–Leibler散度的组合进行训练,以学习一个结构化且具有概率特性的潜在空间。

DCNN 分类器包含四个卷积模块,其卷积核大小均为 3×3,滤波器数量分别为 32、64、128 和 256。每个模块后均接有批归一化、ReLU 激活函数和 2×2 的最大池化操作。ADCNN 在 DCNN 的基础上,在最后一个卷积模块之后引入了通道注意力机制。所有模型均采用 Adam 优化器进行优化,学习率为 0.0001,批量大小为 32。如图 1所示,VAE 和 GAN 仅在训练阶段运行,而 DCNN 和 ADCNN 用于分类任务。完整的训练与评估流程总结于算法 1 中。

算法 1:基于 GAN–VAE 的新冠肺炎检测框架

输入:预处理后的咳嗽音频记录

输出: 二分类标签(COVID-19 阳性/阴性)

训练与评估过程遵循一个固定的、可重复的流程。所有咳嗽音频记录均被重采样至 16 kHz,经过降噪处理并进行幅度归一化。将录音分割为固定长度的片段,并从中提取梅尔频率倒谱系数(MFCC)、色度(chroma)和频谱特征。从每个音频片段中提取了共 40 个梅尔频率倒谱系数(MFCCs),此外还计算了 12 个色度特征。由此形成的表示为每个咳嗽片段生成一个 52 维的特征向量。按受试者级别进行数据划分,将数据集分为训练集、验证集和测试集。变分自编码器(VAE)被用于学习概率性的潜在表示,所得的潜在向量被用于训练生成对抗网络(GAN),以生成合成特征。使用 GAN–VAE 生成的样本对训练数据集进行数据增强,而验证和测试过程则排除合成数据。深度卷积神经网络(DCNN)和注意力增强深度卷积神经网络(ADCNN)分类器在增强后的训练数据上进行训练,最终在独立保留的测试集上使用标准性能指标进行评估。

训练设置、数据划分与泄漏预防

所有实验均采用固定且可重复的训练配置进行。在音频分割之前,数据划分在受试者层面完成,以防止数据泄露。数据集按80:10:10的比例划分为训练集、验证集和测试集,确保来自同一录音的所有片段均被分配至同一个子集中。训练集用于模型学习和生成式数据增强,验证集用于超参数调优和早停策略,测试集则保留用于最终性能评估。由GAN–VAE框架生成的合成样本仅在训练过程中使用,严格排除在验证和测试之外,以确保评估的公平性。

模型最多训练 100 个轮次,根据验证损失进行早停,耐心值设为 10 个轮次。优化采用 Adam 优化器,学习率为 0.0001,批量大小为 32。分类任务使用二元交叉熵损失函数,而变分自编码器(VAE)和生成对抗网络(GAN)组件的训练则分别采用重构损失和对抗损失。该统一的训练与评估协议可确保结果可重复,防止数据泄露,并严格保持训练阶段与评估阶段之间的分离。

数据集描述

采用两个公开可用的咳嗽音频数据集——COUGHVID 和 Virufy,以在大规模声学多样性与临床参考标签之间取得平衡,并在训练和评估中明确划分各自角色。

COUGHVID 是一个众包收集的咳嗽录音数据集,包含部分专家标注和用户自报的元数据。为确保数据质量,研究团队根据预定义的质量控制标准筛选出 428 条录音,筛选标准包括最低信号持续时间、足够的信噪比、剔除损坏或模糊的样本,以及包含具有症状元数据的可识别咳嗽事件。经过预处理和分段后,这些录音共生成 1,719 个咳嗽片段,并统一转换为采样率为 16 kHz 的 WAV 格式。COUGHVID 被用于训练生成模型和判别分类器。

Virufy 包含由医师监督的咳嗽录音,这些录音被标注为 COVID-19 的 RT-PCR 检测阳性或阴性。所有 16 个可用的录音均被纳入研究,经分段后共得到 234 个咳嗽片段,并统一标准化为 16 kHz。Virufy 仅用于外部跨数据集评估,以评估模型的泛化性能,未用于训练、微调或生成式数据增强。

因此,该框架应被视为在受控实验条件下评估的概念验证筛选方法,而非经过临床验证的诊断系统。

数据预处理与分割

所有录音均被重采样至 16 kHz,转换为单声道,并进行静音去除、频谱降噪和幅度归一化处理。为防止数据泄露,在按受试者级别分割后进行分割处理。每段录音被划分为有重叠的 2–4 秒片段,并丢弃低能量或静音片段。

外部验证方案

通过跨数据集评估进行了外部验证。在COUGHVID上训练的模型在Virufy数据集上进行评估,以实现外部验证。该方案评估的是在不同条件下收集的数据集之间的泛化能力,而非前瞻性临床验证。图2从方案层面概述了该工作流程,展示了数据集使用、预处理、特征提取、分类器训练及评估场景。虽然图1侧重于模型内部结构,图2则强调训练与测试阶段的实验设计和数据流动。

新冠肺炎检测流程图;音频预处理、MFCC特征提取、DCNN分类。
图2:所提出的新冠肺炎咳嗽筛查框架的工作流程。完整处理流程示意图,包括预处理、特征提取(MFCC、chroma、频谱特征)、基于GAN–VAE的表示学习与数据增强(仅训练阶段)以及在受试者级别划分和跨数据集评估下的最终分类。请点击此处查看该图的放大版本。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

数据集构成与类别分布分析

经过预处理和分割后,COUGHVID 和 Virufy 数据集在数据集规模和片段密度方面均表现出显著差异。COUGHVID 提供了 444 条录音中的 428 条(96.4%),以及提取出的 1,953 个咳嗽片段中的 1,719 个(88.0%),证实其作为模型训练和生成式增强的主要数据集的作用(图 3)。相比之下,Virufy 仅贡献了 16 条录音(3.6%)和 234 个咳嗽片段(12.0%),专门保留用于外部跨数据集评估。值得注意的是,尽管 Virufy 规模较小,但其每条录音平均产生的片段数量高于 COUGHVID,反映出录音结构和分割结果的差异(图 3)。

除了数据集规模的差异外,类别分布分析还凸显了类别不平衡对训练稳定性和评估可靠性的影响。所评估的不平衡场景(平衡、轻度不平衡、基于医院和基于社区)表明,类别比例的偏斜可能降低有效学习的...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

结果表明,所提出的基于生成式人工智能的框架能够从异构数据集的咳嗽信号中检测出新冠肺炎。如表4表6所示,GAN-VAE混合模型表现最佳,准确率达到97.2%,AUROC为0.953,同时具有高精确率、高召回率、高F1分数和高特异性,表明其分类性能均衡。

当生成模型与判别分类器结合时,性能持续提升。GAN–DCNN 和 VAE–ADCNN 均优于各自的基线模型,表明生成式数据增强能够提升特征学习能力与泛化性能,尤其是在类别不平衡和临床验证数据有限的情况下。MFCC 特征在各数据集上均表现出最强的单独判别性能。尽管 chroma 和 spectral contrast 特征单独使用时性能较低,但将其与 MFCC 特征结合可提高在异质录音条件下的鲁棒性。

按数据集的评估证实了COUGHVID在训练中的作用与Virufy在外部验证中的作用具有互补性。个体、跨数据集及联合评估中稳定的结果表明模型具有合理的泛化能力。该系统应被视为一种非侵入性的筛查和决策支持工具,而非RT...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者未报告任何潜在的利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

我们诚挚感谢计算机科学与工程学院的教职员工和科研导师在本文撰写过程中提供的宝贵指导、持续支持和建设性意见。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
COUGHVID 数据集École Polytechnique Fédérale de Lausanne (EPFL)公开发布(2021年)一个通过众包方式收集的咳嗽音频数据集,包含自我报告的元数据和部分医生标注,主要用于模型训练和数据增强。
CUDA ToolkitNVIDIA11.3用于加速模型训练和推理的GPU加速框架。
LibROSA开源0.9音频分析库,用于重采样、分段、MFCC提取和频谱特征计算。
Linux 操作系统CanonicalUbuntu 20.04 LTS所有实验和模型训练所使用的操作系统。
Matplotlib开源3.5可视化库,用于绘制数据集分布和评估结果。
NumPy开源1.21数值计算库,用于数组操作和信号处理运算。
NVIDIA GPUNVIDIATesla / RTX 系列用于训练深度模型和生成模型的图形处理器。
Python 编程语言Python 软件基金会3.8核心编程环境,用于数据预处理、特征提取、模型开发与评估。
PyTorchMeta(Facebook AI Research)1.12深度学习框架,用于实现生成对抗网络(GAN)、变分自编码器(VAE)、深度卷积神经网络(DCNN)以及基于注意力机制的DCNN模型。
Scikit-learn开源1机器学习库,用于数据划分、类别加权和性能指标计算。
SciPy开源1.7科学计算库,用于音频预处理和信号变换。
Virufy 数据集Virufy公开发布(2021年)临床采集的咳嗽录音数据,附有经RT-PCR–验证的COVID-19标签,仅用于外部验证和跨数据集评估。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Aytekin, I., et al. COVID-19 detection from respiratory sounds with hierarchical spectrogram transformers. IEEE J. Biomed. Health Inform. 28 (3), 1273-1284 (2024).
  2. Walter, J. R., Lee, J. Y., Yu, L., et al. Use of artificial intelligence to develop predictive algorithms of cough and PCR-confirmed COVID-19 infections based on inputs from clinical-grade wearable sensors. Sci. Rep. 14, 8072(2024).
  3. Altae, A. A., Ehsani Rad, A., Mohebbi, K. Advanced COVID-19 detection using cough signals with space reconstruction and 3D deep convolutional neural networks. Sci. Rep. , (2025).
  4. Rao, S., Narayanaswamy, V., Esposito, M., Thiagarajan, J. J., Spanias, A. COVID-19 detection using cough sound analysis and deep learning algorithms. Intell. Decis. Technol. 15 (4), 655-665 (2021).
  5. Alkhodari, M., Khandoker, A. H. Detection of COVID-19 in smartphone-based breathing recordings: a pre-screening deep learning tool. PLoS One. 17 (1), e0262448(2022).
  6. Zhang, Y., et al. Research on a lung sound classification model based on a dual-channel CNN-LSTM algorithm. Biomed. Signal Process. Control. 94, 106257(2024).
  7. Askari Nasab, K., Mirzaei, J., Zali, A., Gholizadeh, S., Akhlaghdoust, M. Coronavirus diagnosis using cough sounds: artificial intelligence approaches. Front. Artif. Intell. 6, 1100112(2023).
  8. Imran, A., et al. AI4COVID-19: AI-enabled preliminary diagnosis for COVID-19 from cough samples via an app. Inform. Med. Unlocked. 20, 100378(2020).
  9. Brown, C., et al. Exploring automatic diagnosis of COVID-19 from crowdsourced respiratory sound data. Proc. KDD Health Day. , (2020).
  10. Laguarta, J., Hueto, F., Subirana, B. COVID-19 artificial intelligence diagnosis using only cough recordings. IEEE Open J. Eng. Med. Biol. 1, 275-281 (2020).
  11. Quartieri, T. F., Talker, T., Palmer, J. S. A framework for biomarkers of COVID-19 based on coordination of speech-production subsystems. IEEE Open J. Eng. Med. Biol. 1, 203-206 (2020).
  12. Hassan, A., Shahin, I., Alsabek, M. B. COVID-19 detection system using recurrent neural networks. Proc. CCCI. , 1-5 (2020).
  13. Khamparia, A., Gupta, D., Nguyen, N. G., et al. Sound classification using a convolutional neural network and a tensor deep stacking network. IEEE Access. 7, 7717-7727 (2019).
  14. Aykanat, M., Kilic, O., Kurt, B., et al. Classification of lung sounds using convolutional neural networks. J. Image Video Process. 65, (2017).
  15. Ponomarchuk, A., Burenko, I., Malkin, E., et al. Project Achoo: a practical model and application for COVID-19 detection from recordings of breath, voice, and cough. IEEE J. Sel. Top. Signal Process. 16 (2), 175-187 (2022).
  16. Feng, K., He, F., Steinmann, J., Demirkiran, I. Deep-learning based approach to identify COVID-19. Proc. SoutheastCon. , 1-4 (2021).
  17. Islam, R., Abdel-Raheem, E., Tarique, M. A study of using cough sounds and deep neural networks for the early detection of COVID-19. Biomed. Eng. Adv. 3, 100025(2022).
  18. Manshouri, N. M. Identifying COVID-19 by using spectral analysis of cough recordings: a distinctive classification study. Cogn. Neurodyn. 16 (1), 239-253 (2022).
  19. Huang, Y., et al. The respiratory sound features of COVID-19 patients fill gaps between clinical data and screening methods. medRxiv. , (2020).
  20. Puja, W. D., Sultana, S., Aowlad Hossain, A. B. M. COVID-19 detection from cough sound signal using random forest learning of deep spectral features. Proc. IEEE SPICSCON. , 1-4 (2024).
  21. Chadaga, K., Prabhu, S., Bhat, V., et al. COVID-19 diagnosis using clinical markers and multiple explainable artificial intelligence approaches: a case study from Ecuador. SLAS Technol. 28 (6), 393-410 (2023).
  22. Chadaga, K., Prabhu, S., Bhat, V., Sampathila, N., Umakanth, S., Chadaga, R. Artificial intelligence for diagnosis of mild-moderate COVID-19 using haematological markers. Ann. Med. 55 (1), 2233541(2023).
  23. Dar, J. A., Srivastava, K. K., Lone, S. A. Optimization-based deep learning for COVID-19 detection using respiratory sound signals. Cogn. Comput. 16 (4), 1927-1946 (2024).
  24. Qian, J., et al. An early study on intelligent analysis of speech under COVID-19: severity, sleep quality, fatigue, and anxiety. Proc. Interspeech. , (2020).
  25. Sharma, J., et al. Environment sound classification using multiple feature channels and an attention-based deep convolutional neural network. arXiv. , (2020).
  26. Lella, K. K., Pja, A. Automatic COVID-19 disease diagnosis using a 1D convolutional neural network and augmentation with human respiratory sound based on parameters: cough, breath, and voice. AIMS Public Health. 8 (2), 240-264 (2021).
  27. Orlandic, L., Teijeiro, T., Atienza, D. The COUGHVID crowdsourcing dataset, a corpus for the study of large-scale cough analysis algorithms. Sci. Data. 8, 156(2021).
  28. Lin, Y., et al. SympCoughNet: symptom-assisted audio-based COVID-19 detection. Front. Digit. Health. 7, 1551298(2025).
  29. Tena, A., Claria, F., Solsona, F. Automated detection of COVID-19 cough. Biomed. Signal Process. Control. 71, 103175(2022).
  30. Sharma, G., Umapathy, K., Krishnan, S. Audio texture analysis of COVID-19 cough, breath, and speech sounds. Biomed. Signal Process. Control. 76, 103703(2022).
  31. Hadjaidji, E., Korba, M. C. A., Khelil, K. COVID-19 detection from cough sounds using XGBoost and LSTM networks. Trait. Signal. 41 (2), 939-947 (2024).
  32. Despotovic, V., Ismael, M., Cornil, M., et al. Detection of COVID-19 from voice, cough, and breathing patterns: dataset and preliminary results. Comput. Biol. Med. 138, 104944(2021).
  33. Wang, W., Shang, Q., Lu, H. Automatic COVID-19 detection from cough sounds using multi-headed convolutional neural networks. Appl. Sci. 13, 6976(2023).
  34. Truong, T., Lenga, M., Serrurier, A., Mohammadi, S. Fused audio instance and representation for respiratory disease detection. arXiv. , (2023).
  35. Shati, A., Hassan, G. M., Datta, A. COVID-19 detection system: a comparative analysis of system performance based on acoustic features of cough audio signals. Proc. IEEE TrustCom. , 2706-2713 (2023).
  36. Pinkas, G., Karny, Y., Malachi, A., et al. SARS-CoV-2 detection from voice. IEEE Open J. Eng. Med. Biol. 1, 268-274 (2020).
  37. Hussain, S., et al. Cough2COVID-19 detection using an enhanced multi-layer ensemble deep learning framework and CoughFeatureRanker. Sci. Rep. 14, 25207(2024).
  38. Silva, L., Valadao, C., Lampier, L., et al. COVID-19 respiratory sound analysis and classification using audio textures. Front. Signal Process. 2, 986293(2022).
  39. Hamdi, S., Oussalah, M., Moussaoui, A., Saidi, M. Attention-based hybrid CNN-LSTM and spectral data augmentation for COVID-19 diagnosis from cough sound. J. Intell. Inf. Syst. 59 (2), 367-389 (2022).
  40. Banerjee, A., Nilhani, A. A residual network-based deep learning model for the detection of COVID-19 using cough sounds. Artificial Intelligence Strategies for Analyzing COVID-19 Pneumonia Lung Imaging. , IOP Publishing. (2022).
  41. Chowdhury, N. K., Kabir, M. A., Rahman, M. M., Islam, S. M. S. Machine learning for detecting COVID-19 from cough sounds: an ensemble-based MCDM method. Comput. Biol. Med. 145, 105405(2022).
  42. Chang, J., et al. UFRC: a unified framework for reliable COVID-19 detection on crowdsourced cough audio. arXiv. , (2022).
  43. Zhang, H. Q., et al. Analysis of reported cases of hemophagocytic lymphohistiocytosis after COVID-19 vaccination. Hum. Vaccin. Immunother. 19 (2), (2023).
  44. Xu, K., et al. Clinical features, diagnosis, and management of COVID-19 vaccine-associated Vogt-Koyanagi-Harada disease. Hum. Vaccin. Immunother. 19 (2), (2023).
  45. Hu, F., et al. Spatial networks of China's specialized, refined, distinctive, and innovative medical device firms based on parent-subsidiary contacts: implications for regional health policy. Front. Public Health. 13, 1676189(2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章