本文提出了一种挤压与激励变换器网络(SET-Net),该网络是一种混合型卷积神经网络-变换器网络,通过利用频谱图特征识别基于脑电图(EEG)的注意力与放松状态,识别准确率达到93.7%,且具有高度泛化能力,可用于脑机接口(BCI)应用。
研究文章
本文提出了一种挤压与激励变换器网络(SET-Net),该网络是一种混合型卷积神经网络-变换器网络,通过利用频谱图特征识别基于脑电图(EEG)的注意力与放松状态,识别准确率达到93.7%,且具有高度泛化能力,可用于脑机接口(BCI)应用。
脑机接口(Brain Computer Interface, BCI)技术被用作在人脑与外部环境之间建立直接通信通道的工具,广泛应用于辅助系统与交互式系统中。在BCI系统中,通常采用脑电图(Electroencephalography, EEG)非侵入式地采集神经活动信号。然而,由于EEG信号具有非平稳性和噪声干扰,对注意力和放松等认知状态进行有效分类仍存在困难。为克服这些局限性,本研究提出了一种新型混合深度学习架构,即“压缩-激励”变换网络(squeeze-and-excitation transformer network, SET-Net)。该方法对EEG信号进行预处理,并将其划分为时间窗口,以分析显著的频谱图特征。所提出的模型实现了93.7%的分类准确率,F1分数达到0.93,ROC-AUC为0.98,表明该混合深度学习模型在基于EEG的注意力-放松状态判别方面具有更强的能力。该系统为人类与计算机交互中的辅助技术提供了可扩展的实时BCI应用解决方案。
脑机接口(Brain–Computer Interfaces, BCIs)已成为一种颠覆性技术,能够实现人脑与外部设备之间的直接通信,而无需依赖传统的神经肌肉通路。由于具有非侵入性、便携性和成本效益高等优势,脑电图(Electroencephalography, EEG)是最常见且应用最广泛的技术1。基于EEG的脑机接口已被应用于医疗健康、神经康复、游戏娱乐以及针对神经系统障碍人群的辅助技术中,通过分析大脑活动实现功能支持2。其中最重要的应用之一是识别认知状态,包括注意力集中与放松状态,这些信息可用于构建自适应的人机交互系统和数字可访问性工具3。然而,由于EEG信号信噪比较低、个体间差异较大,以及注意力与放松状态之间存在复杂的时序动态关系,因此利用EEG对这两种状态进行分类具有较大挑战性4。传统的机器学习模型,如支持向量机(SVM)和随机森林,在该任务中表现出中等性能;但这些方法通常依赖于特征工程,难以充分挖掘EEG信号在空间–频谱–时间维度上的复杂结构5。近年来,深度学习技术的发展,特别是卷积神经网络(CNN)和Transformer模型,为EEG信号的自动特征提取与高精度分类提供了新的机遇6。
基于脑电图(EEG)的脑机接口(BCI)系统长期以来被广泛研究,作为认知状态监测、神经康复和交互系统的重要工具。其中,定义心理状态(例如放松与注意力状态)是最关键的挑战之一。针对这一问题,科研人员已提出多种解决方案,包括传统的特征工程方法以及先进的深度学习模型。经典机器学习方法主要依赖于在时间域、频率域或时频域中人工设计的特征。研究表明,将混合深度学习算法应用于基于EEG的注意力–放松状态分类的SET-Net系统,是一项重要的科研方向,有望提升适用于实际应用场景的BCI系统性能7,8。在过去十年中,卷积神经网络(CNN)、循环神经网络(RNN)以及Transformer等深度学习模型在EEG信号解码方面取得了显著进展9,10。这些进展推动了认知状态解码的准确性与效率提升,对于神经康复和辅助技术中的认知状态识别具有重要意义11,12。BCI系统的日益普及凸显了提高分类准确性的应用价值,近期研究结果表明,在运动想象和注意力任务中分类准确率可超过85%13,14。然而,尽管已有诸多进展,在多样化且噪声干扰严重的环境中实现高效实时分类仍面临挑战15,16。本研究关注的核心问题是:基于EEG的注意力–放松状态分类模型的精确性与外部有效性仍存在局限,尤其是采用SET-Net架构中混合深度学习结构的模型17,18。现有方法通常面临受试者间差异性大、信噪比低以及对时空特性的利用不足等问题19,20,21。部分方法侧重于卷积特征提取,另一些则聚焦于注意力机制或Transformer架构,导致关于最优模型设计的争议不断22,23,24。此外,由于缺乏大规模标注数据集,EEG模型的训练与验证较为困难25,26。这一知识缺口限制了BCI在真实环境中的应用,而实际应用中最关键的需求正是系统的灵活性与精确性27,28。理论上,该方向建立在融合空间、时间及基于注意力机制的特征提取方法之上,依托混合深度学习模型实现29,30,31。SET-Net框架体现了这一融合策略,通过卷积层提取局部特征,并结合自注意力机制学习全局依赖关系32。这种协同作用增强了EEG信号的表征能力,有助于更准确地分类放松与注意力状态。该理论基于一个事实:利用多尺度时空特征的优势以及领域自适应技术,可以有效消除EEG信号的个体差异与噪声干扰33。本综述旨在系统性地评估SET-Net架构下基于EEG的注意力–放松状态分类中混合深度学习方法在理论进展、分类精度及实际应用方面的研究成果34。通过整合最新进展并识别各类方法的优势与局限,本综述将为未来实验中构建更优、更具可解释性与泛化能力的BCI系统提供指导。这些研究空白的厘清将有助于推动BCI在现实世界中的应用发展,从而提升系统的用户体验与可靠性。本综述采用广泛的文献检索方法,纳入同行评审期刊中关于混合深度学习模型在EEG注意力–放松分类中的研究文献34。纳入标准聚焦于SET-Net或类似系统框架下卷积、循环及基于注意力机制的最新架构发展趋势35。分析内容涵盖模型结构设计、特征选择算法、分类准确率以及在真实环境中的可行性。研究结果按理论构建、实践应用及未来研究方向进行组织与阐述。
尽管近年来取得了一些进展,现有方法仍无法同时捕捉单通道脑电图(EEG)信号中的空间、光谱和长时程时间依赖性,导致在注意力–放松状态分类中的表现欠佳。 此外,现有方法依赖于人工添加的特征,或仅考虑了脑电信号的少数特征,因此难以在不同受试者之间以及实时条件下进行推广。因此,亟需一种统一的框架,能够充分建模多维脑电特征,并具备在实时环境下实现强健性和可研究性的能力。
为了克服这些缺点,本研究提出了一种混合深度学习模型,称为“压缩与激励变换网络”(Squeeze-and-Excitation Transformer Network, SET-Net)。具体而言,CNN 模块通过脑电图(EEG)谱图学习局部空间-光谱模式,克服了手工特征提取的局限性。SE 模块通过自适应调整通道重要性,提升特征表示能力,并增强对噪声和变异性的鲁棒性。变换器编码器(Transformer encoder)则建模了长距离时间依赖关系,突破了仅使用 CNN 模型的限制。此外,基于谱图的表示方法可有效进行时频分析,从而增强判别性特征的学习。为确保稳定的性能,研究采用了平衡训练和无数据泄露的验证策略,提升了模型在不同受试者间的泛化能力。
此外,该建议的结构在实际应用中得到了验证,其中分类的认知状态被转化为交互系统的控制指令。这表明该模型在辅助技术与数字可访问性方面具有实际应用价值,并可能用于脑机接口(BCI)的实际实现中。
本研究的主要成果是设计了一种新的SET-Net混合架构,该架构结合了卷积神经网络、压缩-激励注意力机制和Transformer编码器,以更有效地建模脑电图(EEG)信号。此外,采用基于频谱图的表示方法,成功地呈现了EEG信号的时频特性。所提出的框架能够对注意力和放松等认知状态进行准确分类。同时,该模型在实时脑-计算机接口应用中表现出良好的实际适用性。
本文分为若干部分,综述了将脑活动的注意力与放松状态分类应用于脑机接口(BCI)系统的研究。文章首先阐述BCI系统开发中存在的研究空白与挑战,随后介绍数据采集过程与方法,包括脑电图(EEG)信号的记录、预处理及特征表示。文中讨论了注意力与放松活动的重要性,以及从EEG数据中提取有意义特征的过程。接着,通过定量与比较分析,以及实际应用性能评估来呈现和评价研究结果。最后部分对研究发现、本研究的局限性以及未来研究方向进行了讨论。
访问受限。请登录或开始试用以查看此内容。
本研究遵循《赫尔辛基宣言》进行,并获得印度泰伦加纳邦瓦朗加尔SR大学机构伦理委员会的批准(批准号:007/2026)。在数据收集前,已从所有参与者处获得书面知情同意。
参与者选择
采集了11名健康参与者(年龄范围:25–45岁;平均年龄:28岁)的脑电图(EEG)数据,所有参与者均无神经系统或精神疾病病史。本研究共纳入1175个EEG片段,其中527个属于放松状态类别,648个属于注意力集中状态类别。若参与者的EEG记录中存在明显运动伪迹或信号质量较差,则被排除在研究之外。
脑电图采集设置
建议的基于脑电图(EEG)的脑-机接口系统的总体布局如图1所示,该图展示了信号采集、分类及实时应用的完整流程。脑电数据通过一个小型生物电势采集模块记录,并连接至基于微控制器的系统。凝胶电极根据国际10–20系统放置,具体为额前区Fp1和Fp2点,参考电极和接地电极置于耳垂,如图2所示。信号以128 Hz的采样率进行数字化,并通过自编写的Python采集脚本传输至计算机。为降低电极阻抗并提高信号质量,进行了充分的皮肤预处理并使用了导电凝胶。
实验步骤
根据标准化方案,在两种认知状态下进行脑电图(EEG)记录,即放松状态和注意力集中状态。在放松状态下,受试者坐在舒适、低噪声的环境中,要求保持静止,尽量减少身体活动。通过耳机播放舒缓的纯音乐,使用命令 python collect.py 启动脑电数据采集。每次记录持续 5 分钟,共进行四次记录。在注意力集中状态下,受试者需执行需要集中注意力的任务,例如互动游戏,同时保持与放松状态相同的采集设置。每次记录持续 5 分钟,同样重复四次。每位受试者总共参与 40 分钟实验,包括 20 分钟的放松状态和 20 分钟的注意力任务,从而实现对不同认知状态的可靠比较。
处理后的数据集被组织为带标签的片段,具体如下:放松状态(0);注意力集中状态(1)。每个片段持续时间为4 s,重叠50%,并使用短时傅里叶变换表示为频谱图。
信号处理、特征表示与模型实现
所获得的脑电图(EEG)信号经过预处理以消除噪声和伪迹。采用50 Hz陷波滤波器去除电源干扰,并使用四阶巴特沃斯带通滤波器对0.5至30 Hz之间的信号进行滤波,以选取相关的EEG频段。通过幅值阈值法和视觉检查识别受伪迹污染的信号片段,约8–12%的数据被剔除。添加高斯噪声、时间掩蔽和频率掩蔽是用于提高模型鲁棒性的数据增强方法。脑电图信号经滤波后被分割为4秒长的时间窗,相邻时间窗之间有50%的重叠。
各个脑电图片段被转换为时频表示形式(短时傅里叶变换),如公式(1)所示,以便提取其时间和频谱特征。
(1)
所得的频谱图经过归一化并调整至固定尺寸,作为分类模型的输入。为防止因重叠导致的数据泄露,数据集在分割前即被划分为训练集(70%)、验证集(10%)和测试集(20%),如 图3所示。此外,还采用了留一受试者出(leave-one-subject-out, LOSO)交叉验证方法以评估跨受试者的泛化能力,即每次将一名受试者的数据用于测试,其余数据用于训练。
如图所示,所提出的 SET-Net 架构 图4旨在捕捉多维度脑电图(EEG)特征。该模型整合了一个卷积神经网络(CNN)主干结构,用于提取空间-频谱表征,随后接入一个压缩-激励(squeeze-and-excitation, SE)模块,该模块可自适应地重新校准通道维度上的特征重要性,如公式(2)所述。CNN主干结构包含两个卷积层,卷积核大小为 3 中的 × 3,随后进行批归一化和指数线性单元(ELU)激活
(2)
SE模块的内部结构如图5所示。为了捕捉长距离时间依赖性,引入了Transformer编码器,其注意力机制在公式(3)中定义,并在图6中进行图示。
(3)
采用自适应平均池化层将特征图降维至固定的16 × 16尺寸。SE模块的压缩比为8,用于重新校准通道维度的特征响应。Transformer编码器包含四个层,每个层具有四个注意力头,前馈网络维度为256,模型嵌入大小为128。
最终分类通过全连接层完成,采用 Dropout 正则化和 Softmax 激活函数,以区分注意力集中与放松状态。所提出模型的详细分层结构如表 1所示。
模型使用 AdamW 优化器进行训练,初始学习率为 0.001,权重衰减为 1×10⁻4。采用余弦退火调度器以提高收敛性,并使用 32 的批量大小训练了 50 个周期。类别不平衡问题通过加权交叉熵损失函数解决,如公式(4)所述。
(4)
表2总结了训练配置,表3展示了所提出的基于脑电图(EEG)注意力-放松分类的SET-Net模型的超参数搜索结果。所选参数可确保训练过程的稳定性,增强模型泛化能力,并对脑电信号的变化具有较强耐受性。准确率、精确率、召回率、F1分数和ROC曲线下面积(ROC-AUC)被用于评估模型性能。所有包含预处理、模型训练和评估的流程均使用PyTorch框架通过Python编写,以确保可重复性。表4提供了详细的故障排除说明,用于指导并解决与脑电采集、预处理、模型训练及实时应用相关的问题。表5概述了脑电设备的材料清单,以便于构建实验框架和实验装置。本研究采用Python 3.8结合PyTorch深度学习框架实现所提出的SET-Net框架。信号预处理和特征提取使用NumPy、SciPy和Matplotlib等标准科学计算库完成。所有实验均在配备Intel i7处理器和16 GB内存的系统上进行,以加快模型训练速度。
数据可用性:
本研究期间生成并分析的匿名脑电图数据集已公开提供在Zenodo知识库中,访问链接如下: https://zenodo.org/records/19627795。
所有数据均已去标识化,以确保参与者保密,符合SR大学机构伦理委员会批准的机构伦理指南(批准号:007/2026)。
用于重现结果的处理后信息、模型设置和实施细节均在论文中提供,源代码可公开获取,网址为:https://github.com/Ravichanderj/SET-Net-EEG-BCI。
访问受限。请登录或开始试用以查看此内容。
基于频谱图的特征表示
本研究的主要目标是利用脑电图(EEG)信号对注意力和放松状态进行准确分类。将原始EEG信号转换为频谱图,使得有效提取具有区分性的特征成为可能。频谱图显示,在放松状态下α频段活动(8–13 Hz)增强,而在注意力集中状态下β频段活动(14–25 Hz)增强。这种在频域特性上的明显区分明确支持了本研究的目的,表明输入信号本身的表征已能显著区分这两种认知状态。
SET-Net 模型性能
表6总结了所提出的SET-Net模型的性能,表明其在注意力放松分类任务中取得了成功。该模型达到了93.7%的准确率、0.93的F1分数以及0.98的ROC-AUC值。这些指标均验证了模型的性能:准确率衡量整体预测的正确性,F1分数反映在类别分布下精确率与召回率的平衡水平,而ROC-AUC则衡量在不同决策阈值下两种认知状态之间的高区分能力。
访问受限。请登录或开始试用以查看此内容。
当前研究提出了一种基于脑电图(EEG)的注意力-放松状态分类的混合深度学习模型SET-Net。为学习EEG信号的空间、频谱和时间特征,该模型架构结合了卷积神经网络、压缩-激励注意力机制和Transformer编码器,如图5所示。研究结果表明,所提出的方法能够实现研究目标。准确率、F1分数和ROC曲线下面积(ROC-AUC)值(Table 6)较高,证明该模型具有可靠性,并在分类性能上实现了良好平衡。根据混淆矩阵(图8)显示,大多数预测结果准确,仅有少量误分类情况,这些误分类与过渡性认知状态之间的相似性相关。消融实验(Table 7)进一步证实,架构中的每个组成部分均对性能提升具有显著贡献。
本研究通过提供一种用于认知状态分类的强健且可解释的系统,丰富了当前关于脑机接口系统的知识体系。研究还整合了可解释性技术(图15),提高了系统的透明度,...
访问受限。请登录或开始试用以查看此内容。
作者声明,他们不存在任何已知的可能影响本研究工作的竞争性财务利益或个人关系。
作者感谢印度特伦甘纳邦瓦朗加尔的SR大学为开展本研究提供了必要的实验室设施和伦理批准。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 计算机 / 笔记本电脑 | 通用型 | 任何标准系统 | ≥建议 8 GB 内存 |
| 数据采集脚本 | 自定义 | collect.py | 基于 Python 的采集脚本 |
| 一次性凝胶电极 | 通用 | 预凝胶化 Ag/AgCl 电极 | 一次性,粘性 |
| 脑电图采集模块 | 倒置实验室 | BioAmp EXG Pill | 生物电位信号模拟前端 |
| 电极凝胶(若使用可重复使用的电极) | 通用型 | 导电凝胶 | 提高信号传导性 |
| 交互式应用程序(游戏) | 通用型 | 任何简单的游戏(例如,竞速类游戏) | 键盘控制界面 |
| 跳线 | 通用 | 男性–雌性连接器 | 标准面包板导线 |
| Matplotlib / Seaborn | 开源 | 最新版本 | 可视化文库 |
| 微控制器板 | Arduino | Uno / Maker Uno | 10位ADC,USB接口 |
| Python 编程环境 | Python 软件基金会 | Python ≥3.8 | 开源编程语言 |
| PyTorch 库 | Meta AI | 版本 ≥1.12 | 深度学习框架 |
| Scikit-learn | 开源 | 最新稳定版本 | 机器学习工具 |
| 信号处理库 | SciPy | 最新版本 | 滤波,短时傅里叶变换 |
| USB 数据线 | 通用型 | USB Type-A 转 Type-B | 数据传输线 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可