本方案描述了一种计算框架,该框架通过多模态方式整合生理信号与行为信号,利用基于相关性的特征学习和多模态融合技术,对用户情感体验进行建模。本方案在AMIGOS基准数据集上提出并测试了一种用于多模态情感建模的框架。
研究文章
本方案描述了一种计算框架,该框架通过多模态方式整合生理信号与行为信号,利用基于相关性的特征学习和多模态融合技术,对用户情感体验进行建模。本方案在AMIGOS基准数据集上提出并测试了一种用于多模态情感建模的框架。
本研究提出了一种可重复的计算协议,用于利用生理信号进行多模态情感建模。该协议的目标是通过统一的深度学习框架整合多种生物信号,实现离线情绪识别。所提出的工作包含五个步骤:数据采集、预处理、特征对齐、多模态融合和评估。本研究以公开可获取的AMIGOS数据中的脑电图(EEG)、心电图(ECG)和皮肤电反应(GSR)信号作为实验基线。生物信号经过预处理和归一化,以提取模态特异性特征。采用深度典型相关分析(Deep Canonical Correlation Analysis)对不同模态间的异构特征空间进行对齐,随后通过多模态融合网络对情感状态进行分类。该协议通过离线实验进行了评估,并使用准确率、精确率、召回率、F1分数和AUC等标准性能指标与传统的融合和分类模型进行了比较。本研究侧重于开发和验证一种用于多模态情感用户体验建模的计算框架,而非部署实时交互系统。在用户体验情感状态预测中准确率达到92.1%,在效价-唤醒度分类中的F1分数达到94.2%,结果在情感维度上持续优于基线模型。这些发现通过生理数据的基准测试,验证了所提出的多模态融合工作流在计算情感建模中的有效性。
思维、情感与行为之间的复杂相互作用决定了人们的思考与行动方式。情感计算通过融合神经科学、心理学和人工智能等跨学科知识,研究这些关系,旨在构建能够分析、理解并响应人类情绪的系统。该领域 increasingly 被应用于人机交互中,通过将表达性意识融入响应式人工智能结构,使技术不仅与用户的认知状态互动,也与其情感状态互动,从而实现更个性化且具备情感感知能力的用户体验。情绪是一种复杂的心理过程,反映了人类的感知,在人际交往中发挥着重要作用1。如今,大量人机交互(HCI)应用需要开展情绪识别相关研究2。人机交互系统所处的环境具有动态性和复杂性,在大多数情况下,系统需要与其用户的功能状态保持同步;因此,具备情感智能的上下文环境能够更好地适应此类氛围。因此,本研究探讨了通过多模态生理信号与行为信号对用户情感体验进行计算建模的方法3。本工作并非侧重于实际开发或验证交互系统,而是更致力于在多模态信号融合或情感推断的方法学方面做出贡献,其应用场景主要聚焦于沉浸式或展览式环境。为避免涉及概念过于宽泛,本研究集中关注两个核心内容:一是采用计算方法实现多模态情感建模框架,二是用于整合生理与行为数据的多模态数据融合技术。文稿中涉及的其他所有主题均仅作为背景引用,以说明所构建模型的相关性。
每种情绪表达方式都传递着关于个体情感的不同信息,这些信息无法从其他感觉系统中获得。从涉及整体身体运动模式的身体动作中提取情绪,具有识别个体非言语情感的优势4。言语和面部表情能够传达身体运动及人体信号所不具备的信息。人类会并行且组合地利用多种情绪表达方式。每种表达方式都有其局限性,也各有优势。为了准确检测情感,多模态情绪识别方法的识别性能可能优于单模态情绪识别。然而,在情绪发生变化时,面部表情线索、生物信号/生理信号以及语音信号往往比其他信号更早出现。因此,基于计算机视觉的情绪检测主要关注面部情绪表达5。
情感计算在儿童-机器人交互(CRI)中已得到全面研究;具备情绪感知能力的系统会根据用户的生理和行为信号调整其响应。这些研究证明了生物物理情绪感知与自适应交互的可行性。然而,大多数设计的CRI系统仅适用于结构化、以任务为导向以及特定参与者参与的情境。因此,CRI系统在动态、公开环境(如互动展览)中的可推广性有限。相关研究指出,情绪感知机器人对于提升用户动机至关重要,同时也有助于解决个性化等问题。参与度是影响儿童-机器人情感交互的关键因素,因为情绪响应型机器人能够提供更丰富且更有效的学习体验。作者6提出了一种基于任务特征和社会交互特征来检测用户参与度的框架。他们通过研究结果证明,识别包括面部表情和社会行为在内的情感线索,可使机器人动态调整其响应,从而增强用户交互与参与。长期CRI中的情感自适应仍是一项持续存在的挑战。7中的研究者展示了一段时间内儿童的情绪变化,强调机器人需要适应个体的情绪模式和学习风格。
由于脑电图(EEG)具有高时间分辨率以及对情绪状态的敏感性,该方法在EEG数据上也取得了良好的性能。近期的研究8,9,10采用深度学习方法,通过引入时空建模和基于图的注意力机制,提升了跨被试的鲁棒性。然而,大多数研究仍局限于单模态,仅有少数研究考虑了多个感觉通道之间的感知-情绪交互作用,因此在沉浸式用户体验(UX)场景中的适用性较低11,12,13。该模型在数据集上进行了评估,结果表明其性能优于当前最先进的技术。文献14中的作者提出了情绪依赖的关键节点选择算法,并分析了脑电功能连接网络特征的强度、聚类系数和特征向量中心性。文献15中的研究者探索了一种深度简单循环单元网络,以提取脑电信号中的时间特征,其实验结果优于现有文献中的相关工作16,17,18,19。收集大规模脑电信号数据集几乎不可能,但可以尝试其他方法,例如跨被试方法。
最近的研究20,21在利用极为先进的时空建模算法解决基于脑电(EEG)信号的跨被试情绪分类问题方面取得了显著进展。其中包括一种具有增强域自适应能力和动态图注意力机制的时空混合网络,用于处理由EEG信号进行情绪分类时的被试间差异性22。特别是通过采用时间建模机制以及结合动态注意力的空间脑区关系建模,显著提升了被试无关的情绪分类性能。另一项相关研究提出了一种时空同构的跨脑区交互网络23。该研究更加强调对时空不变特征的建模,以显著增强基于EEG信号进行情绪分类时的被试间鲁棒性。尽管这两项研究在仅依赖神经信号的情绪分类任务中均取得了优异的性能,但其局限在于仅使用了单模态信号,缺乏对多模态心理-情绪(P-E)交互作用的探索。相比之下,当前研究通过采用深度学习方法,将多种心理/情绪(P/E)模态利用深度相关性学习进行融合,从而超越了传统的单模态信号模型,提供了一种更为丰富的情感用户体验(affective UX)建模方案。
尽管当前的研究(包括利用生物物理信息构建具有表现性意识的儿童-机器人交互界面的项目)已证实了通过多模态生理信号提升情感识别的潜力,但这些研究仍受限于特定领域的约束。特别是,这些系统主要针对与儿童进行结构化、任务导向的交互而优化,难以推广至更为复杂和动态的环境,例如互动展览场景。此外,基线研究中所采用的特征融合技术缺乏可扩展性,通常依赖浅层融合方法,无法有效捕捉多感官用户体验(UX)环境中存在的复杂感知-情感交互关系。同时,该基线论文未采用最先进的深度学习技术,以在不同环境刺激下对高维多模态数据流(如脑电图(EEG)、面部表情和眼动追踪)进行对齐与融合。这揭示了一个根本性的知识空白:即尚缺乏一种高性能的计算范式,不仅能适应不同受众人群和刺激情境,还能通过深度典型相关分析(DCCA)和多模态融合网络(MMFN)架构来捕捉感知与情感之间的交互机制。弥合这一空白将显著提升对用户体验(UX)的情感理解水平。
本研究的主要目标是构建一个计算系统,通过多模态生物物理和行为感知,在交互式展览环境中实现情感自适应的用户体验。该框架基于儿童-机器人交互研究和情感计算中的情感建模基本原理,旨在根据脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情和眼动追踪等异构生理与行为线索,建模并记录用户的感知-情感交互过程。通过将深度典型相关分析(DCCA)与多模态融合网络(MMFN)相结合,该系统致力于学习跨模态的共同潜在情感表征,并将这些表征映射到情感用户体验(UX)状态中。该架构旨在克服浅层特征融合和年龄受限情感模型的局限性,支持在动态、公开环境中进行情境感知的情感推断和多感官整合。最终,本研究旨在推动开发更先进的智能且情感敏感的展览系统,使其能够响应用户实时的情感反馈和交互模式,从而进一步提升数字文化体验中的参与度、满意度以及认知-情感共鸣。
本文在以下几个方面对现有文献做出了贡献:提出了一种考虑生理与行为数据的多模态情感建模计算框架;提出了一种多模态融合方法,能够有效促进从多种数据源中学习感知与情感表征。本研究引入了一种新的计算范式,通过基于人工智能的多模态感知与多感官整合管道建模,刻画感知-情感交互过程,从而增强情感化的用户体验(UX)。主要贡献在于将深度典型相关分析(DCCA)与多模态融合网络(MMFN)相结合,以实现跨异构模态(如脑电图EEG、心电图ECG、皮肤电活动EDA、面部表情和眼动追踪)的强特征对齐与高层表征学习。该方法能够精确建模从感官感知到情感状态(如兴趣、投入、惊讶或无聊)的离线评估映射关系。在公开可用的AMIGOS数据集上的实验验证表明,所构建的DCCA+MMFN模型性能优于基线模型(例如1D-CNN、CNN-ResNet和LSTM-CNN),在效价-唤醒度情感状态分类中平均准确率达到89.4%,在离散情感类别分类中达到87.1%。
与以往研究仅对参与者施加压力、局限于以任务为中心的情境或采用表层特征融合技术不同,本文提出的方法引入了一种专为动态真实展览环境设计的深度学习框架。通过结合典型相关分析(DCCA)与多模态融合网络(MMFN),本研究提供了一种可扩展且抗噪声干扰的方法,能够理解异质用户群体中连续的感知–情绪变化。这种对高维生理、行为与环境信号的深度融合,是情感化用户体验(affective UX)建模的主要创新。本文提出一种由人工智能驱动的框架,通过多模态感知与多感官整合,对交互式展览中的情感化用户体验进行建模。该框架通过结合DCCA与MMFN,实现了对脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情和眼动等异质模态信号的稳健对齐与融合。不同于以往研究局限于用户中心或任务中心的设定,本方法支持在动态公共环境中进行连续的感知–情绪建模,因而成为情感化用户体验研究中的一项关键进展。
一种系统化、可重复的多模态计算方法的建立是本研究的主要创新,该方法在融合之前系统性地处理异质特征对齐问题,用于生理情感建模 本研究工作的贡献在于提出一种以基准为导向的端到端工作流程,通过在单一深度学习架构内标准化预处理、表征对齐、多模态融合与评估环节,实现可重复且与任务无关的生理信号情感建模,而非仅提出某一种算法层面的改进。该框架通过引入基于DCCA的中间跨模态潜在对齐阶段,强制实现脑电图(EEG)、心电图(ECG)和皮肤电反应(GSR)信号之间的关联表征学习,与传统多模态情感识别研究中依赖直接特征拼接或决策级融合的方法形成对比。通过在分类前确保模态间的一致性,这种基于对齐的融合方法增强了在不同情感维度上的泛化能力与鲁棒性。本研究中提出的框架旨在作为面向展览类体验的多模态情感建模的可行性与概念验证。为在受控环境中验证该建模方法,研究并未试图直接模拟真实多感官展览环境,而是采用AMIGOS数据集作为基准代理。
访问受限。请登录或开始试用以查看此内容。
本研究使用的 AMIGOS 数据集是公开可获取的,数据收集已获得机构审查委员会的批准并取得参与者的知情同意,具体信息见原始发表文献。本研究仅对数据集进行二次分析,无需额外的伦理审批。
本方法采用特征对齐和多模态融合方法处理多模态生理与行为数据,以描述感知–情绪之间的相关性。本研究提出了一种用于交互式展览中情感化用户体验(UX)的计算模型,结合多模态生物物理传感与基于人工智能的情绪建模技术。基于前期论文中的生物物理数据洞察,该方法从同步采集的脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、眼动追踪、面部表情及环境输入中,对用户状态进行数字化计算建模。文中“时空建模”一词的含义如下:空间维度指通过DCCA实现的多通道生理特征空间表征及跨模态相关性对齐;时间维度指通过BiLSTM进行序列编码,并在分段时间窗内保持时间依赖性。这些异构信号首先经过预处理与归一化,以消除不同模态间的时间与空间相关性干扰。针对每种模态独立学习特征向量,以捕捉与情绪相关的模式,如唤醒度、注意力和参与度。为了从异构数据流共享的情绪表征中有效学习,采用DCCA方法。DCCA将每种模态投影到一个潜在的公共子空间,在最大化相关特征的同时,通过增强的跨模态相关性保留各模态特有的信息。这些经过模态对齐的潜在嵌入随后输入至多模态融合网络(MMFN),该网络通过混合的BiLSTM与注意力机制层整合时间与上下文信息。该融合机制使系统能够生成高层级的情感状态,并将其转化为用户体验指标(例如:无聊、兴趣、不适)。最后,分类模块对情感化用户体验状态进行估计,并为展览内容的自适应调整提供反馈,例如在计算建模中调节视觉或听觉刺激。图1展示了所提出方法的整体架构。

图1:所提出方法的架构。 所提出的融合多模态输入的用户体验(UX)建模框架结构,多模态输入包括脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情和眼动,采用深度典型相关分析(DCCA)和多模态融合网络(MMFN)。缩写:UX = 用户体验;EEG = 脑电图;ECG = 心电图;EDA = 皮肤电活动;DCCA = 深度典型相关分析;MMFN = 多模态融合网络。 请点击此处查看此图的放大版本。
所提出的架构在 图1 展示了一种端到端的情感用户体验(UX)系统,该系统利用深度典型相关分析(DCCA)与多模态融合网络(MMFN),用于交互式展览中的感知-情绪交互建模。系统首先接收原始的多模态输入,包括脑电图(EEG)、心电图(ECG)和皮肤电活动(EDA)等生理信号;面部表情和眼动行为信号;以及视听信息和环境信息等上下文输入。这些信号随后被送入预处理与特征提取模块,在该模块中对各模态信号进行特定处理(如去噪、归一化、特征计算),以生成每种模态有意义的描述符。其次,DCCA模块将成对的模态投影到一个共同的潜在空间,并学习跨模态最大相关的嵌入表示,以编码内在的情绪模式。多个DCCA模块输出的高相关性特征随后由多模态融合网络(MMFN)进行融合,该网络通过深度学习层(可能包括双向长短期记忆网络BiLSTM、注意力机制或Transformer)对所学特征进行分层融合,生成紧凑且高层次的情感表征。该综合表征随后输入情绪与用户体验状态分类层,模型在此预测情感输出,如效价、唤醒度,或认知/情绪状态,如投入度、无聊或认知负荷。在处理流程末端可选地提供自适应用户体验反馈回路,使系统能够通过调整展览情境中的刺激或内容,对用户状态作出交互式响应。该可扩展且模块化的架构通过相关性感知的表征学习与深度多模态融合,确保了强大的情绪建模能力,非常适用于交互式或体验性环境中情感计算的计算建模。 关键词:情感用户体验,多模态融合网络,深度典型相关分析,生理信号,行为信号,情感计算,交互式展览,DCCA,MMFN,EEG,ECG,EDA
选择将DCCA与MMFN融合,是基于当前标准单模态和浅层融合模型存在的局限性。尽管CNN-ResNet和LSTM-CNN能够提取时间或空间特征,但在不同环境刺激下,对脑电图(EEG)、皮肤电活动(EDA)和面部表情等异质模态的平衡能力较差。DCCA通过最大化跨模态相关性,确保共享的潜在表征;而MMFN则利用分层融合和注意力机制,动态突出最具信息量的信号。二者结合后,为交互式多感官环境中的情感用户体验建模提供了一种更可靠、更易于理解且适用范围更广的方法。
数据采集
在用于互动展览的感知-情绪交互建议模型框架中,采用公开可用的 AMIGOS 数据集24作为多模态情感数据的基础。AMIGOS 数据集提供了人类参与者在接受诱发情绪的刺激(如视频片段)时所记录的详尽生理与行为测量数据。该数据包含同步的脑电图(EEG)、心电图(ECG)和皮肤电反应(GSR)信号、面部视频记录,以及以离散形式(例如:高兴、悲伤)和维度形式(效价/唤醒度)记录的自我报告情绪标签。这些模态与本研究提出的系统需求高度契合,该系统旨在推断用户在沉浸式、多感官展览互动过程中的情感用户体验(UX)状态。该数据集包含40名受试者的记录,每位受试者均经历了短时(视频片段 <150 秒)和长时(电影 >14 分钟)的情绪诱发刺激,实验条件模拟了现实生活中的媒体参与情境。在本建议工作的范围内,采用该数据集的一个预处理子集:来自30名受试者的无伪迹、高质量的 EEG、ECG 和 GSR 信号,以及完整的面部视频和标注文件。这些样本被选用于模拟基于展览情境下的多模态情绪动态。该学习数据集作为 DCCA + 多模态融合网络(MMFN)流程的训练与基准测试基础,探索诸如投入、无聊、困惑和唤醒等情感状态在模拟展览环境中对视觉、听觉和空间刺激的响应。表1展示了所提出方法的数据集描述。
| 参数 | 详细信息 | |
| 数据集名称 | AMIGOS(用于情感、个性与情绪研究的数据集) | |
| 参与者人数 | 总计40人(本研究采用其中30名具有完整多模态数据的参与者) | |
| 刺激类型 | 短片段和长视频片段(带有情感标注) | |
| 脑电通道 | 14通道 Emotiv EPOC 脑电头戴设备 | |
| 心电(ECG) | 心率传感器(用于心率变异性与唤醒度分析) | |
| 皮电反应(GSR) | 皮肤电导传感器(测量交感神经活动) | |
| 面部视频 | 高分辨率正面面部视频,用于表情分析 | |
| 情绪标签 | 自我评估的效价、唤醒度、支配度(1–9量表),以及离散情绪标签 | |
| 采样率 | 脑电:128 Hz,心电/皮电:1000 Hz | |
| 数据格式 | .mat 文件及同步时间戳日志 | |
| 多模态同步 | 是——所有传感器与视频之间均实现同步 | |
| 每次实验时长 | 短片段(<150 秒)和长电影(>14 分钟) | |
| 适用应用场景 | 情感化用户体验建模、多模态融合、实时感知-情绪映射 | |
表1:AMIGOS 数据集描述。 本文提出框架中所使用的 AMIGOS 数据集的说明,包括参与者信息、模态、采样率和实验设计。缩写:AMIGOS = 个体与群体情感、人格及情绪研究数据集。
本研究所采用的公开 AMIGOS 数据集包含来自 40 名参与者的多模态行为与生理数据,其中 33 名参与者因记录质量优异且完整而被选入本研究。该数据集记录了参与者对短片和长视频片段产生的情绪反应,包含多种信号:脑电图(EEG,来自 14 导联 Emotive 耳机)、心电图(ECG,用于心率变异性分析)、皮肤电反应(GSR,用于皮肤电导测量)以及高分辨率面部视频(用于表情分析)。情绪状态通过维度(效价、唤醒度、支配度)和离散类别两种方式进行自我报告。各模态数据之间具有良好的时间对齐性,采样率设置恰当——EEG 为 128 Hz,ECG 和 GSR 均为 1000 Hz。该配置使该数据集非常适合用于建模交互式展览中的用户体验(UX),从而能够利用基于人工智能的多模态感知技术精确追踪感知与情绪之间的交互过程。
数据预处理
所有涉及的预处理步骤、模型训练和评估均通过自行编写的 Python 脚本(Python 3.10,PyTorch 2.0)独立实现,每个模块分别对应信号预处理、基于 DCCA 的对齐、MMFN 训练及性能评估;关键参数设置和一些重要的计算配置汇总于表1。为了处理公开可用的 AMIGOS 数据集,以用于交互式展览中的情感用户体验建模,首先在生理和行为模态(如 EEG、ECG、GSR 和面部视频)上实施系统性的数据预处理流程。首先对每种模态进行标准化和同步,然后执行特定模态的预处理。目前,上下文信息仅从视频刺激内部的音视频线索中获取,例如面部表情、视觉运动模式以及语音韵律和背景音频等声学特征。
信号归一化与重采样
所有模态的原始生理信号 x(t) 被重采样至统一频率 fs=128 Hz,以实现跨模态的时间对齐:
(1)
重采样使用标准信号处理库函数完成,而非自定义算法。具体实现采用了 Python 信号处理生态系统(SciPy)中提供的重采样工具,该工具基于傅里叶方法进行插值,以将信号转换为目标采样频率。目标采样率 fs 的选择旨在确保在分割和特征提取之前,各模态具有统一的时间分辨率。随后,所有信号均进行 z 分数归一化,以消除受试者间的变异性:
(2)
其中 μx 和 σx 分别为信号在试验窗口内的均值和标准差。
脑电图预处理
从14个通道采集的脑电信号经过4–45 Hz的带通滤波,以保留与认知相关的频率成分:
(3)
功率谱用于确定信号中的频率模式,对于脑电信号而言,不同情绪类型下的功率谱可能有所不同,从而提供有关信号的有用信息。Welch 方法是一种优于周期图法(公式3)的技术,可估计频谱密度,并可用于生成频谱图。Welch 方法将时域信号分割为若干离散的时间段,对每一段构建频谱图,然后对所有频谱图进行平均,如公式4所示。与完整的FFT方法相比,该过程更为平滑,因此能够最大限度地提取信号中的功率信息。最后,采用Welch方法计算功率谱密度(Power Spectral Density, PSD)19,以捕捉信号在频域中的特征:
(4)
PSD 特征在五个频段上进行求和:Theta(4–8 Hz)、Alpha(8–13 Hz)、Beta(13–30 Hz)、低 Gamma(30–45 Hz)。
基于视频的面部特征
利用多通道脑电图(EEG)数据集或类似软件,从视频的每一帧中提取面部动作单元(AUs)和眼动向量,随后将其组合为时间序列:
(5)
情绪标签映射
AMIGOS 提供了效价-唤醒度评分和离散情绪标签。连续评分被归一化至 [0,1] 范围:
(6)
其中,V 是归一化前实际观测到的值,Vmin 是数据集中该变量的最小值,Vmax 是数据集中该变量的最大值,V' 是归一化后范围在 0 到 1 之间的值。这些标签被用作监督情感建模中的真实标签。这些标签被用作监督情感建模中的真实标签。
跨模态同步
所有模态均通过时间戳对齐或在必要时采用动态时间规整(DTW)进行同步:
(7)
然后将预处理后的特征丰富数据输入深度典型相关分析(DCCA)模块,该模块学习不同模态之间最大程度相关的表示。
使用 DCCA 进行特征提取
在面向交互式展览的情感用户体验建模框架中,采用深度典型相关分析(DCCA)来学习脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情和眼动数据等异构模态中的关联潜在特征。其目标是学习一个公共表征空间,在该空间中,尽管各模态信号本身可能存在噪声或具有模态特异性,但它们在感知情绪状态方面具有最大程度的相关性和语义一致性。在本研究中,DCCA 被应用于以下模态组合:i) EEG–ECG,ii) EEG–GSR,以及 iii) EEG–面部特征表征。选择这些组合旨在捕捉与情感参与相关的互补神经-生理和神经-行为关联。为了将 DCCA 扩展至多模态场景,首先计算每对模态的成对 DCCA 嵌入,然后利用所提出的多模态融合网络(MMFN)进行融合,从而在不改变 DCCA 核心公式的情况下实现对两个以上模态的有效整合。
在融合之前通过执行由相关性驱动的潜在对齐,DCCA 在结构上将表征对齐与决策融合分离开来,这与跨模态注意力或张量融合网络不同,后者直接作用于可能未对齐的表征。这种两阶段架构降低了冗余性,并提升了表征的一致性。此外,DCCA 直接优化跨模态统计依赖性,而不只是依赖共享损失函数,因此相较于多任务学习框架,更适用于异质生理数据。首先,采用 DCCA20 通过多层堆叠的非线性变换依次处理多种模态,以计算其表征。图 2 展示了本研究中所采用的 DCCA 构建方式。我们使用网格搜索方法确定用于构建深度学习模型的最优超参数。经过全面的实验分析,作者选择了随机梯度下降优化器、交叉熵损失函数以及 1e5 的正则化参数。随后,作者确定进行 15 次优化步骤,偏置向量初始化为全零,以验证集作为早停准则,并采用 Xavier 初始化器进行权重初始化。图 2 展示了 DCCA 的工作流程。

图2:DCCA的工作流程。DCCA的处理流程,展示从不同模态中提取特征并映射到一个共同的潜在空间,以最大化其相关性。
缩写;DCCA = 深度典型相关分析。 请点击此处查看该图的放大版本。
图2 直观展示了深度典型相关分析(Deep Canonical Correlation Analysis, DCCA)在两种不同模态——脑电图(EEG,模态A)与皮肤电活动(EDA,模态B)之间进行共享表征学习的内部工作机制。两种模态的数据分别输入各自对应的深度特征提取网络(特征提取器A和B),这些网络包含多个隐藏层,用于学习抽象的、模态特异性的特征。在融合之前,通过深度典型相关分析(DCCA)实现跨模态的潜在空间对齐。针对每一对模态组合(EEG–ECG、EEG–EDA 和 EEG–面部特征),构建了两个并行的深度投影网络。每个投影网络采用 ReLU 激活函数,由三个全连接层组成,维度分别为 [256, 128, 64]。对于共享潜在空间,最终的嵌入维度为 64。目标函数在 L2 正则化系数为 1e-5 的条件下最大化投影后模态嵌入之间的典型相关性,以确保数值稳定性。偏置向量初始化为零,权重则通过 Xavier 初始化方法设定。为了稳定对齐学习过程,DCCA 模块在多模态融合网络(MMFN)训练之前被独立训练。为保持对齐一致性,DCCA 与 MMFN 之间不进行端到端的微调。这些神经网络流水线并行但相互隔离地接收输入数据流。每个特征提取器的输出随后被投影到一个共同的潜在空间中,在该空间中,两种模态的特征被映射为结构上可比较的形式。投影过程根据 DCCA 的目标进行优化,即最大化 EEG 与 EDA 对应潜在表征之间的相关性。通过获取这一最大相关子空间,DCCA 确保输出的嵌入向量保留了来自两种模态的互补且具有语义意义的模式,这对于情绪识别或情感计算等下游应用至关重要。
在本研究中,特征通过 DCCA 进行转换,然后整合用于分类。如图2所示,DCCA 模型采用深度学习模型进行特征变换。CCA 层计算相关性,随后用于特征融合与分类。假设矩阵
存储脑电模态的试验数据,矩阵
包含面部视频片段模态的实验数据。在此情况下,脑电试验和面部视频片段中的特征维度分别由 n1 和 n2 表示,而试验总数由 MA 表示。对于每种模态,作者构建了如下深度神经网络,以非线性方式重新组织输入特征:
(8)
其中,非线性变换的参数表示为 HT1 和 HT2;每个神经网络后续提取的特征表示为
和
,DCCA 特征度量表示为 n。通过 DCCA 递归学习得到的参数 HT1 和 HT2,尽可能地增强了 ON1 与 ON2 之间的相关性:
(9)
通过反向传播算法训练了相互学习的参数,如 HT1 和 HT2。为了获得预期结果,按照建议对目标函数的梯度进行了近似。在两个神经网络训练完成后,经过调整的特征 ON1 和 ON2 ∈ SP 位于组合的超空间 SP 中。DCCA 的作者主要20并未特别提及使用调整后的特征。这些调整后的特征可根据用户具体应用需求以最合适的方式加以利用。在本研究中,作者从调整后的特征中获得了以下融合特征:
(10)
其中 α 和 β 表示权重,满足 α + β = 1。通过 DCCA 融合得到的特征被输入 SoftMax 分类器。情感识别任务用于训练该分类器。如前所述,构建 DCCA 以实现多种格式数据的融合具有一些优势。例如,为了观察模态特异性变换的特征与相关性,DCCA 在特征级融合过程中显式地为每种模态获取 ON1 和 ON2。此外,通过控制非线性映射函数 f1(·) 和 f2(·),可以保留基于情感的数据。此外,作者在加权和融合中对每种模态采用相等的权重。一个多模态融合网络(MMFN)接收这一联合空间,用于预测用户体验状态。对于多模态对齐,采用一种分层方法:首先通过对原始信号进行重采样和时间戳对齐实现时间上的对齐,然后通过深度典型相关分析(DCCA)实现来自不同模态的语义丰富信号之间的对齐。这确保了在 MMFN 中进行基于注意力的融合过程之前,模态感知的表示已被转换到一个共同的潜在空间中。
用于情感用户体验建模的多模态融合网络(MMFN)
MMFN 分别对每种模态进行编码,然后通过融合门和注意力机制将它们融合,以输出用于情绪预测的整合表征。
模态特异性编码
设 x(i)∈Rdi 为第 i 个模态(例如 EEG、EDA)的特征向量。每个模态通过一个神经编码器进行编码:
(11)
门控融合机制
为了调控来自每种模态的信息流,采用了一个融合门:
(12)
(13)
σ 是 sigmoid 激活函数。⊙ 表示逐元素运算。这使得网络能够动态地降低噪声模态的权重或提高有用特征的权重。
跨模态注意力融合
注意力层用于学习如何为每种模态的表征分配相应的权重:
(14)
(15)
α(i) 是注意力权重
融合后的最终表示。
情感状态预测
将融合向量输入输出层,以预测效价/唤醒度或用户体验状态:
22(16)
其中
可用于表示:离散情绪类别(高兴、中性、悲伤)、连续量表(效价/唤醒度)以及用户体验类别(投入、分心、超载)。

图3:MMFN的结构。 MMFN的结构,包含模态特异性编码器、门控融合机制以及基于注意力的整合模块,用于情感状态预测。
缩写;MMFN = 多模态融合网络。 请点击此处查看该图的放大版本。
图3展示了在情感计算框架中用于情绪和用户体验(UX)预测的多模态融合网络(MMFN)的工作流程。MMFN的分层融合架构由模态特异性编码器、门控融合层、基于注意力的整合模块以及最终的分类头组成。该架构说明了多种异构输入模态(如脑电图EEG(模态A)、皮肤电活动EDA(模态B)和面部表情(模态C))如何通过各自专用的编码器网络(编码器A、B和C)进行处理。每个模态(EEG、ECG、EDA和面部特征)首先由一个包含两个全连接层并采用ReLU激活函数的独立编码器处理,随后通过双向长短期记忆网络(BiLSTM)层捕捉时间依赖性。每个编码器学习得到一种模态特异性的特征表示,保留相应数据流中的关键情绪或生理特征。BiLSTM在每个方向上具有128个隐藏单元,为每个模态生成256维的上下文嵌入。为防止过拟合,在BiLSTM层后应用了dropout(丢弃率 = 0.5)。随后,采用基于sigmoid激活函数的门控融合方法,对编码后的模态表示进行动态调控,以控制各模态的贡献权重。接着,通过自注意力层计算跨模态的注意力权重,以抑制噪声信号并突出关键信息。最后,通过一个全连接层,以及针对效价-唤醒度回归任务的线性输出层或针对离散分类任务的Softmax输出层,将融合后的表示映射为最终输出。每个编码器的输出随后被输入至多模态融合层,该层对所有模态特征进行拼接,并应用注意力机制以增强信息丰富的信号并屏蔽噪声。此操作生成一个共同的潜在表示,将来自所有模态的情感信号整合为一个高层的密集向量。
应用于模态特异性序列嵌入的双向长短期记忆(BiLSTM)层可直接建模时间动态。BiLSTM通过捕获分段生理序列中的前向和后向时间依赖关系,实现对变化的情感状态的上下文建模。此外,随后的基于注意力的融合层能够在时间编码表示的基础上,实现对时间信息丰富特征的自适应加权。作者最近更新了文本,以更清晰地阐明序列构建、循环编码和注意力加权如何协同工作,从而支持时间建模。
拟议的伪代码1以可重复的形式展示了使用DCCA-MMFN进行情感用户体验建模的整体流程。首先,将多模态的生理和行为信号输入到一个独立的预处理步骤中,该步骤包括降噪和尺度归一化。随后,将提取的特征输入DCCA,在其中针对指定的模态对联合学习相关特征,旨在实现鲁棒的跨模态对齐。对齐后的特征随后被送入一个包含门控机制和注意力机制的MMFN中进行组合,以实现对特定模态的调节,目的在于增强信息丰富的模态并抑制噪声。最终的组合特征表示被用于训练分类器,以估计情感状态及与用户体验(UX)相关的状态,并基于标准指标进行整体性能评估。该拟议伪代码的分步特性确保了其透明性、可行性,任何具备技术背景并对本方案感兴趣的人员均可轻松复现。
该框架旨在通过 AMIGOS 数据集中的多模态生理与行为信号,预测用户情感体验(UX)状态,具体步骤如下:步骤 1:输入的多模态数据包括脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、眼动及面部表情信号。首先获取 AMIGOS 多模态数据集,并对每种模态进行信号预处理,包括噪声滤波和归一化,以确保数据质量与一致性。步骤 2:为保持各模态间的时间同步性,所有信号被重采样至统一标准频率。随后进行模态特异性的特征提取,以获得对应于每种信号类型的独特特征表示。步骤 3:为捕捉跨模态关联,采用深度典型相关分析(DCCA)处理选定的模态对(EEG–ECG、EEG–EDA 和 EEG–面部)。DCCA 网络被训练以学习成对模态之间的相关潜在表示,从而为每个模态对生成对齐的特征嵌入。这些对齐后的表示随后被融合,构建统一的多模态特征空间。步骤 4:将聚合后的对齐特征作为输入送入多模态融合网络(MMFN),利用注意力机制和门控融合策略,有效整合各模态间的互补信息。该融合过程生成全面的情感表征。步骤 5:利用带有标签的情绪数据训练分类器,基于所得表征预测情感 UX 状态。最后,采用准确率、精确率、召回率、F1 分数和曲线下面积(AUC)等标准指标评估模型性能。预测得到的情感 UX 状态作为该框架的最终输出结果。
基于所提出的 DCCA-MMFN 框架进行感知-情绪建模
在交互式展览的用户体验(UX)情感计算框架中,感知-情绪建模模块是连接用户对环境刺激的感知反应与其多模态生理行为所推导出的情绪状态的核心过程。该模块基于DCCA方法提取的生理与行为模态(如脑电图EEG、皮肤电活动EDA、心电图ECG、面部表情和眼动)的共性表征,以记录用户的情绪动态。同时,利用有关周围展览环境的元数据——包括视觉刺激、声景、交互模式及环境特征——来编码感知线索。通过多模态融合网络(MMFN)整合这些多模态表征,模型能够学习从感知刺激特征到情绪标签或维度(如效价、唤醒度、参与度)的精细非线性映射关系。该映射使系统能够持续识别用户对不同展览元素的情绪反应,并相应地调整内容或界面,以增强参与度、满意度或认知共鸣。最终,感知-情绪建模实现了对交互过程的情绪感知自适应,构成了计算建模与用户敏感型展览系统的核心。
首先,DCCA 模块被训练以学习每对模态之间的相关潜在表示。所得嵌入作为输入提供给 MMFN,并进一步按顺序训练以完成情感预测任务。为保持训练的稳定性,不进行端到端的微调。
| 类别 | 参数 | 数值 / 描述 |
| 信号预处理 | EEG 带通滤波器 | 4–45 Hz |
| 重采样频率 | 128 Hz | |
| 窗长 | 2 s | |
| 窗重叠 | 50% | |
| 归一化 | Z-score 归一化 | |
| DCCA 架构 | 隐藏层数量 | 每种模态 3 层 |
| 每层神经元数 | 128–64–32 | |
| 潜在空间维度大小 (n) | 32 | |
| 正则化参数 | 1 × 10⁻⁵ | |
| 优化器 | Adam | |
| 学习率 | 0.001 | |
| 批量大小 | 32 | |
| 最大训练轮数 | 150 | |
| 早停耐心值 | 15 轮 | |
| MMFN 配置 | 编码器类型 | BiLSTM |
| 隐藏单元数 | 64 | |
| Dropout 率 | 0.3 | |
| 融合策略 | 带注意力机制的门控融合 | |
| 注意力类型 | EEG, ECG, GSR, Video | |
| 训练与评估 | 损失函数 | 交叉熵损失 |
| 训练–测试划分 | 5 折交叉验证 | |
| 评估指标 | 准确率、精确率、召回率、F1 分数、Cohen’s Kappa、AUC–ROC | |
| 可重复性检查点 | EEG 输入张量形状 | 通道数 × 时间采样点(例如,每窗 14 × 256) |
| DCCA 输出表示 | 32 维共享潜在嵌入 | |
| MMFN 输出 | 情绪类别概率(效价–唤醒度或离散类别) | |
| 预期验证性能 | 85–90% 分类准确率 |
表2:所提出的DCCA–MMFN算法的参数。 所提出的用户体验情感建模框架中涉及的预处理、架构、融合、训练、评估和可重复性参数的汇总。缩写:DCCA = 深度典型相关分析;MMFN = 多模态融合网络;UX = 用户体验。
在表2中,列出了所提出的DCCA-MMFN框架中使用的所有参数,这些参数涵盖了信号预处理、深度结构设计、融合技术以及训练条件。生理信号被统一重采样并归一化,以使其在各自模态上同步。DCCA层配置为采用多层非线性变换,有助于学习最大相关性的潜在空间;而MMFN组件则使用带有门控注意力机制的双向长短期记忆(BiLSTM)编码器网络,以动态加权不同模态的重要性。训练与评估的要求被明确定义,以确保与现有方法进行公平比较。
该建议的框架旨在作为情感感知系统的计算基础,利用多个维度的行为和生理信息。尽管当前研究通过使用公开的 AMIGOS 数据集进行受控的离线实验来验证该模型,但该架构在概念上可适应于智能展览空间、自适应智能界面以及情感感知的人机交互系统等真实世界环境。该框架通过提供统一的融合技术、跨模态对齐和结构化预处理,可作为需要可靠情绪推断的应用中的基础模块。然而,本研究中所述的这些环境并非已实验部署的系统,而是作为可能的部署场景进行描述。
访问受限。请登录或开始试用以查看此内容。
对所提出系统的评估
为评估所提出的系统,研究在公开可用的 AMIGOS 数据集上进行了实验。该数据集提供了 40 名用户在接触情绪激发刺激时的脑电图(EEG)、心电图(ECG)、皮肤电反应(GSR)、视频和音频的同步测量数据。本研究使用了来自 33 名参与者的数据(经过预处理并剔除不完整的试验),在效价和唤醒维度上共获得 1,320 个有效样本。评估重点在于利用基于 DCCA 的表示学习层和多模态融合网络(MMFN)进行情绪分类和情感用户体验(affective UX)状态预测。结果表明,该系统在所有情感状态的预测准确性和鲁棒性方面均显著优于现有方法。MMFN 中的注意力增强融合过程对于突出每种情境下主导模态的作用至关重要。表 3展示了仿真环境。
| 组件 | 规格... |
访问受限。请登录或开始试用以查看此内容。
空间、环境和物理交互背景(例如空间布局、人群密度或周围环境条件)在 AMIGOS 数据集中并未明确提供。因此,当前实验中也未对这些因素进行直接建模。所提出的用于情感用户体验(UX)建模的计算框架,已远远超越了基础论文中关于用户、任务导向的儿童-机器人交互及生物生理情绪检测的初步概念。该模型将情感计算推广至动态、交互式的展览环境,从而扩展了应用范围、用户群体和使用条件。与基础论文中采用动态贝叶斯混合模型(DBMM)实现结构化交互和静态干预逻辑的方法不同,新框架整合了一种更具可扩展性和鲁棒性的架构,包含深度典型相关分析(DCCA)和多模态融合网络(MMFN)。这使得系统能够处理来自脑电图(EEG)、心电图(ECG)、皮肤电活动(EDA)、面部表情、眼动追踪以及情境环境信息等多种传感器模态的复杂感知-情绪动态,实现更精细、连续且可迁移的情感状态建模。从二元干预转向连续情感建模,代表了在真实沉浸式环境中建模情绪转变的理论突破。尽管 AMIGOS 数据集可用于严格评估多模态情感动态,但其数据采集于实验室环境中,依赖视听刺激,未能捕捉真实展览环境中的完整空间、多感官及社会复杂性。因此,本研究结果应被视为概念验证性的验证。尽管该研究受到沉浸式环境中情...
访问受限。请登录或开始试用以查看此内容。
作者感谢弘益大学空间设计学院和工业设计学院的支持。作者还感谢展览合作方和参与者为本研究做出的贡献。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 数据集 | AMIGOS 数据集 | 40 名参与者;脑电图(128 Hz)、心电图(1000 Hz)、皮肤电反应(1000 Hz)、面部视频、自我报告的情绪效价/唤醒度标签 | 用于情感状态建模的多模态真实数据 |
| 生理传感器 | 脑电图头戴设备 | Emotiv EPOC+(14 通道,128 Hz) | 采集与注意力、唤醒度和参与度相关的脑活动 |
| 心电图传感器 | Biopac MP150 或同等设备(1000 Hz) | 心率变异性与唤醒度 | |
| 皮肤电反应/皮电活动传感器 | Shimmer GSR+ 或同等设备(1000 Hz) | 以皮肤电导作为唤醒度的测量指标 | |
| 行为传感器 | 眼动追踪设备 | Tobii Pro X2-60 或同等设备 | 记录注视点与扫视眼动 |
| 面部表情记录 | 高分辨率视频摄像机;使用 OpenFace 分析(动作单元、视线向量) | 提取面部动作单元(AUs)和视线线索 | |
| 环境输入 | 音视频记录装置 | 麦克风 + 摄像机(与刺激同步) | 在展示过程中捕捉上下文刺激 |
| 软件/工具包 | OpenFace | 开源面部行为分析工具包 | 提取动作单元(AUs)、视线方向 |
| MATLAB / Python(NumPy, SciPy, scikit-learn) | 信号预处理(重采样、z-score 标准化、功率谱密度计算) | 数据预处理与特征提取 | |
| TensorFlowv2.13 / PyTorchv2.0 | 用于 DCCA 和 MMFN 的深度学习框架 | 模型实现与训练 | |
| 算法/模型 | 深度典型相关分析(DCCA) | 非线性特征对齐方法 | 学习跨模态的相关潜在表示 |
| 多模态融合网络(MMFN) | 双向长短期记忆网络 + 基于注意力的融合层 | 用于用户体验状态分类的异构模态层次化融合 | |
| 评估指标 | 准确率、精确率、召回率、F1 分数、Cohen’s Kappa、AUC-ROC、混淆矩阵 | 使用 scikit-learn / TensorFlow 指标实现 | 模型性能评估 |
| 计算硬件 | 工作站 / GPU 集群 | NVIDIA RTX 3080(10GB)或同等配置,32 GB 内存,Intel i9 处理器 | 模型训练与仿真 |
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可