$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
情绪识别在人类互动与交流中具有重要意义。为了建立成功的人际关系,个体必须能够感知并理解情绪,这在心理学、神经学以及人机交互等多个领域均具有深远影响1。近年来,基于脑电图(EEG)的脑机接口(BCI)已成为研究人员用于检测情绪的重要工具。尽管基于EEG的BCI为研究人脑电活动提供了直接窗口,并成为探索情绪状态的合适研究手段,但通过机器学习技术与基于EEG的BCI实现情绪状态的自动且准确分类,从根本上改变了情绪识别领域2。
在以往的研究中,情感识别已被引入,并在医疗保健、人机交互和神经科学等多个领域展现出其重要性3。尽管已有显著进展,当前基于脑电图(EEG)的情感识别研究仍存在明显的研究空白。首先,文献中提出的方法通常采用单一领域的特征提取(例如频谱或时频特征),或仅使用可单独获取的非线性描述符,这些方法仅依赖于复杂且非平稳EEG信号的部分表征,难以充分建模。其次,尽管多种非线性特征已被证明具有较强的判别能力,但它们通常被独立使用,忽略了跨域特征之间的关联性。这一限制使得这些方法在建模与情绪脑激活相关的多尺度及源水平动态过程方面能力不足。第三,大多数深度学习方法旨在优化分类性能,却未充分考虑特征的可解释性、冗余度降低以及在类别不平衡情况下的鲁棒性。因此,在电极配置、采样率(128–256 Hz)和记录时长(30–60 s)不同的研究之间,跨数据集的泛化能力仍是一个尚未解决的问题。情感智能的主要维度如图1所示。
为了克服上述缺点,本文提出了一种联合加权特征拼接(Combined Weighted Feature Concatenation, CWFC)框架,该框架在一个统一架构中聚合多域非线性特征。与传统方法将独立成分分析(ICA)、离散小波变换(DWT)和快速傅里叶变换(FFT)视为独立的特征提取手段不同,我们通过加权相关性对源级分解(ICA)、多分辨率时间动态特征(DWT)和频谱功率表征(FFT)进行建模。该结构有助于模型利用互补的神经信息并减少冗余,从而提升判别能力。此外,本研究还结合了特征重要性排序和基于生成对抗网络(GAN)的数据增强方法,以在最少且不平衡的脑电图(EEG)样本上实现鲁棒性。通过长短期记忆网络(LSTM)分类器整合多模态特征关系和时间依赖性,该联合模型在不同EEG采集条件下表现出更优的泛化性能。因此,本研究的主要贡献在于解决了现有方法中非线性EEG表征缺乏整合以及泛化能力不足的问题,提出了一种系统化、可重复且稳定的、适用于真实生活场景脑机接口(BCI)应用的情感识别框架。

图1:情感智能的各个阶段。情感智能的各个阶段展示了如何从脑电信号中提取情绪识别信息,并进一步用于心理健康评估中情绪问题的诊断与监测。请点击此处查看此图的放大版本。
用于情绪识别研究的非线性脑电图(EEG)特征能够更深入地揭示情感加工过程中涉及的神经机制。作为一种无创、具有高时间分辨率且对快速神经动态敏感的技术,EEG已被广泛用于研究与情绪状态相关的脑活动。由于EEG信号具有非平稳性和复杂性,非线性方法尤其适用于其分析,能够更好地建模情绪过程中诱发和诱导的神经活动。在众多计算模型中,情绪通常依据现有的理论模型进行表征,例如基本情绪模型4(BEM)和环形模型5,6。其中,基本情绪模型认为存在一组基于生物学的基础核心情绪7,8(尤其是爱),而环形模型则将情绪按照两个基本维度进行组织:效价9(正性–负性)和唤醒度10,11(低–高)。如图2所示的效价–唤醒度框架在基于EEG的情绪识别研究中被广泛采用,主要因其与标准数据集一致,并适用于连续情绪状态的建模。这种基于维度的表征方式为将神经活动映射到情绪类别提供了系统且可量化的途径,从而有助于基于机器学习的情绪分类。

图2:效价-唤醒情绪表征。双轴示意图展示情绪状态,其中效价表示积极或消极情绪,唤醒度反映从低到高的情绪强度。请点击此处查看该图的放大版本。
唤醒度是指情绪的强度,具有正性或负性效价。近年来,情绪分析主要关注使用脑电图(EEG)来探究情绪的神经相关性。特征提取至关重要,它将脑电信号映射为时域、频域以及时频域中的量化指标。一些最常见的非线性特征包括小波熵12、相关维数13,而本研究提出的方法采用一种结合加权的策略,融合了离散小波变换(DWT)、独立成分分析(ICA)和快速傅里叶变换(FFT)13。标准的DEAP14和SEED15数据集可用于可重复性评估。传统的线性特征往往已不再充分,亟需设计非线性方法16。基于频带的情绪模式如图2所示,各脑电频段贡献权重列于表1中。
| 不同频率波段 | 频率波段范围(Hz) | 频率波段在情绪识别中的功能 |
| Gamma | 大于 30 Hz | Gamma 活动可能反映了情绪加工过程中情绪信息的整合以及多个脑区之间的同步化。 |
| Beta | 13 至 30 Hz 之间 | Beta 功率的变化可能是情绪唤醒以及与情绪表达相关的运动反应的标志。 |
| Alpha | 8 至 13 Hz 之间 | 情绪状态与 Alpha 功率的变化相关,尤其是 Alpha 不对称性。当情绪被唤醒并更加关注情绪输入时,常观察到 Alpha 功率降低。 |
| Theta | 4 至 8 Hz 之间 | 情绪体验可能与 Theta 功率升高相关,这可能有助于情绪记忆的编码与提取。 |
| Delta | 0.5–4 Hz | 在情绪检测背景下,Delta 活动增加可能提示一种放松或静息的情绪状态。 |
表1:情感识别中脑电频率波段的功能及其不同范围。 该表格概述了 commonly recognized 脑电(EEG)频率波段,明确了各自的频率范围,并描述了其在情感识别研究中的功能意义。重点阐述了每个波段如何与不同的认知和情感过程相关联,为解读情感状态分类中的脑电信号提供了基础。
基于脑电图的情绪识别技术的最新发展得益于深度学习和非线性信号处理领域的突破。基于卷积神经网络(CNN)的模型通过电极选择和超参数调优实现了高性能表现。17而采用动态微分熵的受试者无关CNN模型则增强了可穿戴性并降低了复杂度18但针对此问题的模型通常无法在不同受试者之间进行泛化。为了建模序列依赖性,研究提出了基于注意力机制的长短期记忆网络(LSTM)架构,并引入了领域自适应机制。19,20 这需要大量计算且缺乏可解释性。在深度网络之外,非线性方法和拓扑学方法也受到了广泛关注。通过采用基于持久同调的相空间分析,实现了对细微情绪状态的增强区分。21,22集成方法通过结合熵和分形输出,并采用多种特征选择,已被证实可提升预测性能。混合卷积神经网络-长短期记忆网络(CNN-LSTM)模型23 在DEAP数据集上优于直接的效价-唤醒度分类方法24 多列卷积神经网络有效利用了电极的空间分布25地形特征图26,27 基于拓扑特征图(TOPO-FM)和全息特征图(HOLO-FM)的特征表示在多个公开可用的数据集上进行了评估28,29,30尽管这些结果在分类准确率方面显示出显著进展,但模型在跨受试者泛化能力、可解释性以及对脑电图(EEG)采集条件异质性的鲁棒性方面仍存在挑战。作者31 对应用软计算领域中的主要挑战、方法及未来发展方向进行广泛综述,重点关注信号质量、特征提取和可扩展性问题。在一项相关研究中32,一种改进的功能连接性测量方法——跨不同脑电频率波段的校正振幅包络相关性,可用于识别不良驾驶状况,凸显了多波段连接性在实时行为监测中的优势。
在更广泛的神经影像学研究背景中33,36,多模态学习方法的综合概述结合了脑电图(EEG)与面部表情或生理数据等不同信号,以实现更可靠的 emotion 检测,并展示了模态融合在显著提升人工智能系统性能方面的潜力。除了 DEAP 和 SEED 数据集之外,DREAMER 数据集也是基于 EEG 的 emotion 识别研究中代表性基准数据集的最新补充。DREAMER 由 Katsigiannis 和 Ramzan37 提出,包含受试者在观看视听情绪刺激时通过低成本无线设备采集的 EEG 和 ECG 信号。该数据集的内容适用于基于效价(valence)、唤醒度(arousal)和支配度(dominance)层次结构的情绪维度建模,符合情感的环形模型(circumplex model of affect)。由于其设计严谨的实验范式,DREAMER 数据集已被广泛用于深度学习及被试无关 emotion 识别模型的评估。该数据集可用于与其他维度 emotion 表征数据库进行比较,并已证明其作为 cirrus dance、DEAP 和 SEED 数据集的补充,是一种有价值的替代选择。这些数据集在情感计算研究中被广泛使用,涵盖了在受控实验条件下、采用标准化情绪刺激所采集的 EEG 记录。本研究所分析的数据仅来自以下数据集:该数据集包含 32 名受试者在观看情绪性视频片段时采集的 32 导 EEG 信号,数据已标注效价和唤醒度信息;SEED:在基于电影的情绪诱发实验中,对受试者进行多会话 EEG 记录,并附有类别化 emotion 标签;DREAMER:在通过视听刺激诱发情绪过程中记录的 EEG 和 ECG 数据集。所有数据集最初均依据其原始发表文献中报告的标准化协议、硬件配置以及标签验证流程进行采集。本研究仅分析了来自这些数据集的 EEG 信号。