本研究利用脑电图信号和音乐熟悉度构建了一个深度学习模型,用于预测音乐类型偏好。数据通过低成本的Muse S设备采集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提高了预测准确率,最高达到99%,显示出其在偏好预测中的重要价值。
研究文章
本研究利用脑电图信号和音乐熟悉度构建了一个深度学习模型,用于预测音乐类型偏好。数据通过低成本的Muse S设备采集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提高了预测准确率,最高达到99%,显示出其在偏好预测中的重要价值。
随着心理健康问题日益普遍,音乐治疗作为一种非药物干预手段受到关注,而深度学习技术在音乐情感识别与偏好预测方面也展现出良好前景。本研究构建了一种深度神经网络模型(CNN+RNN/EEGNet),以高效识别音乐类型偏好,并考察用户熟悉度对预测准确率的影响。脑电(EEG)信号通过四通道可穿戴设备Muse S采集,用户熟悉度评分被用作输入特征。研究遵循四个阶段的工作流程:准备、实验设计、模型构建与结果分析。在实验设计阶段,音乐被分为摇滚、抒情歌曲和民谣三类,并针对每类音乐采集脑电信号及熟悉度评分。数据采用CNN+RNN或EEGNet模型进行训练与测试,模型性能通过受试者层面的10折交叉验证进行评估。结果表明,仅使用脑电数据预测所有音乐类型的准确率为82.28 ± 3.42%。对于单个音乐类型,准确率分别为91.13 ± 3.60%(摇滚)、91.83 ± 2.07%(抒情歌曲)和87.87 ± 4.76%(民谣)。当将用户熟悉度作为特征并采用多级评分输出时,整体预测准确率提升至94.94 ± 1.61%,而各音乐类型的准确率分别达到99.15 ± 1.56%(摇滚)、98.51 ± 2.30%(抒情歌曲)和98.21 ± 2.60%(民谣)。这些结果表明,结合熟悉度特征与多级评分系统可显著提高音乐偏好预测的准确性。通过使用价格适中、可穿戴的Muse S脑电设备并利用用户熟悉度信息,本研究成功开发出一种高效的深度神经网络模型(CNN+RNN/EEGNet),用于识别音乐类型偏好。研究结果表明,整体及各类别音乐偏好的预测均因引入熟悉度信息而得到改善,凸显了该方法在个性化音乐推荐与音乐治疗应用中的潜力。
音乐在人类生活中扮演着重要角色,而在线平台的广泛使用使听音乐成为一种日常常规活动。除了娱乐功能外,音乐还作为一种治疗工具,能够促进放松、减轻疼痛,并帮助患有发育障碍的个体。音乐偏好直接影响治疗效果和情绪反应。以往研究表明,偏好的音乐可提升身体表现,例如耐力和短跑能力1,并减轻压力与疼痛2。对于老年人而言,音乐偏好也是一种重要的干预手段,个体偏好会影响治疗效果3,4。研究还发现,偏好的音乐能够降低心率和呼吸频率,促进放松状态。此外,音乐偏好可提高情绪预测的准确性5,增强情绪反应强度6,并提升机器学习模型的性能,使预测准确率从53.18%提高至71.09%。无论初始倾向如何,重复聆听会进一步增强音乐偏好7。
尽管有这些发现,目前关于音乐偏好预测的研究仍受限于样本量小、年龄范围狭窄以及对用户熟悉度考虑不足。这些局限性降低了模型的泛化能力和实际应用价值。将熟悉度等用户特异性因素纳入考量,仍是提升预测性能的一个有待深入探索的方向。
音乐情感识别(EMR)已成为一个活跃的研究领域,其准确性受到音乐偏好和熟悉度的影响8,9,10,11。当参与者接触其熟悉且偏好的音乐时,其情感评价更为一致,而在实验和教育环境中,熟悉度的提高有助于提升识别准确率12,13,14,15,16,17。这些研究结果表明,熟悉度在情感识别和偏好预测中均是一个关键因素。
基于人工神经网络的深度学习能够自动提取高维特征,在模式识别方面表现出比浅层模型更强的能力18,19,20。深度学习技术也已广泛应用于与音乐相关的任务,包括音乐流派分类、信号识别以及个性化推荐系统21,22,23,24,25,26。脑电图(EEG)被广泛用于测量大脑在不同频段(表1)的电活动,以进行认知与情绪分析27,28。将EEG与深度学习相结合,为捕捉音乐偏好相关的神经反应提供了一个有效的框架。
传统的脑电图(EEG)系统通常需要使用凝胶电极和高成本设备,限制了其在真实场景中的应用。采用干电极的可穿戴式脑电图设备提供了一种实用的替代方案,具有成本低、易用性高和灵活性强的优势。Muse S 设备以 256 Hz 的采样率从关键脑区(TP9、TP10、AF7、AF8)记录信号,能够为受控实验和真实环境应用提供可靠且可扩展的数据采集能力。
本研究通过结合脑电图(EEG)信号与用户对音乐的熟悉度特征,利用深度学习模型预测音乐偏好,从而克服现有研究的局限性。采用CNN+RNN和EEGNet架构提取EEG信号的时间-频率特征以及时序依赖关系,相较于传统方法能更有效地表征EEG信号。本研究检验了两个假设:(1)用户对音乐的熟悉度可提高基于EEG的偏好预测准确性;(2)针对特定音乐类型(摇滚、抒情和民谣)构建的模型优于在混合类别上训练的模型。
纳入了30名性别分布均衡的健康成年人队列。尽管样本量有限且使用四通道脑电图(EEG)限制了结果的普适性和信号分辨率,但将熟悉度特征与深度学习模型相结合,仍可实现稳健的预测性能。研究目标是分类音乐流派并对每个类别进行个体化预测,同时将用户对音乐的熟悉度作为特征纳入模型,以提高预测准确性。
访问受限。请登录或开始试用以查看此内容。
本研究遵循衢州大学伦理委员会的指导方针进行。研究方案已获得衢州大学机构审查委员会(IRB)批准,批准编号为 QZU-IRB-2026-037。所有参与者在纳入研究前均签署了知情同意书。
实验准备与受试者招募
本实验包含四个阶段(图1):准备阶段、实验设计、模型构建和结果分析。在准备阶段,通过综述音乐治疗、脑电图(EEG)数据采集以及深度学习模型的相关文献,明确研究目标。在实验设计阶段,招募了30名健康受试者执行音乐聆听任务,记录其脑电信号和音乐熟悉度评分。脑电数据经过标准化处理,并分割为每段2048个样本、重叠1024个样本的时间窗。将熟悉度特征与脑电数据结合,作为模型输入。构建了两种模型:CNN+RNN 和 EEGNet。卷积神经网络(CNN)层用于提取时频特征,双向长短期记忆网络(LSTM)用于捕捉时间依赖性。分类任务采用带softmax激活函数的全连接层实现。模型训练设置批量大小为50,共训练30个周期,使用Adam优化器。训练过程中应用了Dropout和早停法。模型性能主要以准确率(Accuracy)作为报告指标,同时计算精确率(Precision)、召回率(Recall)和F1分数(F1-score)进行补充评估。
实验环境与设备设置
实验在安静、封闭且无外界干扰的房间内进行,室温保持在 27 oC。所用设备包括:脑电图设备(Muse S,InteraXon Inc.)、一个四通道脑电系统(TP9、AF7、AF8、TP10),采样率为 256 Hz;Final E3000 入耳式耳机;以及一台运行 Muse SDK 和 Lab Streaming Layer(LSL)的数据采集计算机。
每次实验开始前,使用酒精清洁耳机的耳部接触表面,以确保卫生并降低交叉污染的风险。为每位参与者佩戴 Muse S 头戴设备,确保所有四个干电极(TP9、AF7、AF8、TP10)与皮肤保持稳定接触。若信号质量不佳,将调整头带位置,直至获得稳定的信号。参与者坐在带有背部支撑的舒适椅子上,并被要求闭上眼睛,避免说话,并在实验过程中尽量减少大幅度的身体活动。
音乐刺激材料的准备
准备了三种音乐类型:摇滚、抒情(民谣)和民间音乐。每种类型包含三首中文歌曲,共九首歌曲。为了控制音乐熟悉度的差异,每类音乐中的歌曲根据以下标准进行选择:一首老歌;一首当前流行歌曲(来自 Spotify 热门歌曲排行榜);以及一首新歌(来自 Spotify 新发行歌曲排行榜)。
每首歌曲被剪辑成标准化的音频片段,从引子开始,接着是主歌部分,到第一个副歌结束,总时长为90–130秒。每首歌曲均分配一个唯一标识符(例如R1–R3、B1–B3、F1–F3),用于后续的数据标注和文件管理。
实验步骤与问卷记录
正式实验开始前,通过播放一段测试音频进行音量测试。参与者将音量调节至清晰、舒适且不过响的水平,并在整个实验过程中保持该音量不变。九首歌曲的播放顺序采用随机化方式(例如使用随机数字表或软件随机化)以减少顺序效应。所有参与者独立完成音乐聆听任务。每段音乐从引子开始播放至第一段副歌结束,持续时间为 90–130 秒。歌曲之间设有 30 秒的休息间隔。在此期间,参与者通过在线平台(问卷星)完成熟悉度问卷。参与者需根据五点李克特量表对每首歌曲的熟悉程度进行评分(1 = 完全不熟悉;5 = 非常熟悉)。根据预设的二分类方案,记录参与者对每首歌曲的偏好标签(0 = 不喜欢;1 = 喜欢)。完整的实验流程如图2所示。
脑电图采集与数据记录
使用官方Muse SDK采集脑电图数据,并通过实验室流媒体层(Lab Streaming Layer, LSL)进行数据流传输。每首歌曲对应的脑电图数据保存为逗号分隔值(CSV)文件,文件至少包含以下字段:时间戳(毫秒);来自四个通道的原始脑电信号(TP9、AF7、AF8、TP10);手动记录的熟悉度评分(1–5);以及偏好标签(0/1)。采用统一的文件命名规则(例如,S01_R1.csv,表示参与者01和摇滚歌曲1),以方便自动化处理和数据追溯。
数据预处理、归一化与分窗
使用 Muse S 四通道脑电设备以 256 Hz 的采样率记录脑电(EEG)信号,并利用官方开发工具包开发了自定义程序。原始脑电数据通过 Lab Streaming Layer (LSL) 获取并保存为 CSV 格式。CSV 文件包含以下列:时间戳(毫秒)、四通道脑电信号值(TP9、AF7、AF8、TP10)、用户对音乐的熟悉度评分(1–5)以及用户对音乐的偏好评分。
数据条目的总数对应于每位参与者和每首音乐作品生成的多个窗口,因此数据集的规模取决于所采用的窗口划分方案。在原始实验中,音乐偏好被表示为二元标签(0 = 不喜欢,1 = 喜欢),这可能导致准确率被人为高估,且模型的泛化能力受限。
为了提高预测任务的实际意义,将偏好标签转换为多级评分量表:0 = 非常不同意;1 = 不同意;2 = 中立;3 = 同意;4 = 非常同意。
在机器学习之前,数据被标准化并分割为每个包含2048个样本的窗口,相邻窗口之间有1024个样本重叠,以保持时间连续性。此外,还应用了数据增强以增加训练样本的数量,并降低过拟合的风险。
模型架构
该研究模型包含三个卷积层、三个池化层和一个全连接层。采用最大池化(Max pooling)进行特征选择,应用 Dropout 以减少过拟合,并使用 Softmax 分类层生成最终输出。每个输入窗口包含四通道脑电图信号(每窗口 2048 个采样点)以及一个熟悉度特征。输出表示一个五分类的偏好评分。该架构如图 3所示,模型参数列于表 2中。
模型训练与交叉验证
数据集被随机划分为80%用于训练,20%用于测试。采用十折交叉验证方法,每次迭代中使用一个子集进行验证,其余九个子集用于训练。该过程重复十次,结果进行汇总。训练超参数设置如下:训练轮数 = 30;批量大小 = 50;优化器 = Adam;损失函数 = 分类交叉熵;评估指标 = 准确率。模型性能在仅使用脑电图(EEG)信号以及EEG结合熟悉度信息两种条件下分别记录,且针对所有音乐类型合并分析以及各单一音乐类型分别进行分析。
统计分析方法
数据分析使用 Python 3.10 结合 TensorFlow 2.12、Keras 2.12 和 MNE-Python 1.3 进行。数据处理与分析通过 Pandas 2.1 和 NumPy 1.26 完成。10 折交叉验证的性能指标被汇总,并计算均值与标准差。不同条件之间的统计比较采用配对 t 检验或 Wilcoxon 符号秩检验,显著性水平设定为 P < 0.05。
访问受限。请登录或开始试用以查看此内容。
模型性能在两种条件下进行评估:(1)仅使用脑电图(EEG)特征,以及(2)结合音乐熟悉度的脑电图特征。分类分析针对合并的音乐类别以及各个独立的音乐类别(摇滚、声乐和民谣)分别进行。
表3展示了仅使用脑电图(EEG)特征所获得的结果,而表4展示了结合EEG特征与熟悉度信息所获得的结果。在这些条件下,对CNN+RNN和EEGNet模型均进行了评估,由于EEGNet整体性能更优,因此被选为最终模型。
仅使用脑电图(EEG)特征时(表3,图4),模型在所有音乐类别上的总体准确率达到82.28% ± 3.42%。当分别进行评估时,模型对摇滚音乐的准确率为91.13% ± 3.60%,对抒情音乐的准确率为91.83% ± 2.07%,对民谣音乐的准确率为87.87% ± 4.76%。
当脑电图(EEG)特征与熟悉度结合时(表4
访问受限。请登录或开始试用以查看此内容。
以往基于脑电图(EEG)的音乐偏好预测研究主要依赖多通道系统,限制了其实际应用21,22,23,24,25,26。本研究结合深度学习模型与熟悉度特征,采用一款四通道可穿戴式脑电设备(Muse S),实现了相当的预测性能,展现出更具实用性与可扩展性的方法。
结果表明,将脑电(EEG)信号与用户熟悉度相结合,能够显著提高对所有音乐类别的预测准确率。该发现提示,音乐偏好不仅受神经反应的影响,还受到先前接触经验的影响,这与现有音乐认知及熟悉度效应的研究结果一致8,9,
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
作者衷心感谢研究机构在本研究过程中提供的支持与设施。特别感谢实验室工作人员在技术操作方面给予的协助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 酒精棉片 | 任何标准供应商 | N/A | 用于在参与者之间清洁耳机 |
| 数据采集计算机 | 任何标准制造商 | N/A | 运行 Muse SDK 和实验室数据流层(Lab Streaming Layer, LSL) |
| 脑电图头戴设备(Muse S) | InteraXon Inc. | https://choosemuse.com/muse-s/ | 四通道可穿戴脑电设备(TP9, AF7, AF8, TP10) |
| Final E3000 入耳式耳机 | Final Audio Design | https://snext-final.com/en/products/detail/E3000 | 用于实验期间的音频播放 |
| 实验室数据流层(Lab Streaming Layer, LSL)软件 | 开源 | https://github.com/sccn/labstreaminglayer | 用于脑电数据流传输 |
| Muse SDK | InteraXon Inc. | https://developer.choosemuse.com/ | 用于脑电数据采集 |
| 问卷星(在线平台) | 长沙冉星信息技术有限公司 | https://www.wjx.cn/ | 用于熟悉度数据收集 |
| Python 3.10 | Python 软件基金会 | https://www.python.org/downloads/ | 用于数据处理与分析 |
| TensorFlow 2.12 | https://www.tensorflow.org/ | 深度学习框架 | |
| Keras 2.12 | https://keras.io/ | 神经网络 API | |
| MNE-Python 1.3 | 开源 | https://mne.tools/stable/index.html | 脑电数据分析 |
| NumPy 1.26 | 开源 | https://numpy.org/ | 数值计算 |
| Pandas 2.1 | 开源 | https://pandas.pydata.org/ | 数据处理 |
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可