研究文章

基于深度学习的音乐流派偏好识别模型构建

DOI:

10.3791/70514

2026年5月26日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究利用脑电图信号和音乐熟悉度构建了一个深度学习模型,用于预测音乐类型偏好。数据通过低成本的Muse S设备采集,并使用CNN+RNN和EEGNet模型进行分析。熟悉度显著提高了预测准确率,最高达到99%,显示出其在偏好预测中的重要价值。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

随着心理健康问题日益普遍,音乐治疗作为一种非药物干预手段受到关注,而深度学习技术在音乐情感识别与偏好预测方面也展现出良好前景。本研究构建了一种深度神经网络模型(CNN+RNN/EEGNet),以高效识别音乐类型偏好,并考察用户熟悉度对预测准确率的影响。脑电(EEG)信号通过四通道可穿戴设备Muse S采集,用户熟悉度评分被用作输入特征。研究遵循四个阶段的工作流程:准备、实验设计、模型构建与结果分析。在实验设计阶段,音乐被分为摇滚、抒情歌曲和民谣三类,并针对每类音乐采集脑电信号及熟悉度评分。数据采用CNN+RNN或EEGNet模型进行训练与测试,模型性能通过受试者层面的10折交叉验证进行评估。结果表明,仅使用脑电数据预测所有音乐类型的准确率为82.28 ± 3.42%。对于单个音乐类型,准确率分别为91.13 ± 3.60%(摇滚)、91.83 ± 2.07%(抒情歌曲)和87.87 ± 4.76%(民谣)。当将用户熟悉度作为特征并采用多级评分输出时,整体预测准确率提升至94.94 ± 1.61%,而各音乐类型的准确率分别达到99.15 ± 1.56%(摇滚)、98.51 ± 2.30%(抒情歌曲)和98.21 ± 2.60%(民谣)。这些结果表明,结合熟悉度特征与多级评分系统可显著提高音乐偏好预测的准确性。通过使用价格适中、可穿戴的Muse S脑电设备并利用用户熟悉度信息,本研究成功开发出一种高效的深度神经网络模型(CNN+RNN/EEGNet),用于识别音乐类型偏好。研究结果表明,整体及各类别音乐偏好的预测均因引入熟悉度信息而得到改善,凸显了该方法在个性化音乐推荐与音乐治疗应用中的潜力。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

音乐在人类生活中扮演着重要角色,而在线平台的广泛使用使听音乐成为一种日常常规活动。除了娱乐功能外,音乐还作为一种治疗工具,能够促进放松、减轻疼痛,并帮助患有发育障碍的个体。音乐偏好直接影响治疗效果和情绪反应。以往研究表明,偏好的音乐可提升身体表现,例如耐力和短跑能力1,并减轻压力与疼痛2。对于老年人而言,音乐偏好也是一种重要的干预手段,个体偏好会影响治疗效果3,4。研究还发现,偏好的音乐能够降低心率和呼吸频率,促进放松状态。此外,音乐偏好可提高情绪预测的准确性5,增强情绪反应强度6,并提升机器学习模型的性能,使预测准确率从53.18%提高至71.09%。无论初始倾向如何,重复聆听会进一步增强音乐偏好7

尽管有这些发现,目前关于音乐偏好预测的研究仍受限于样本量小、年龄范围狭窄以及对用户熟悉度考虑不足。这些局限性降低了模型的泛化能力和实际应用价值。将熟悉度等用户特异性因素纳入考量,仍是提升预测性能的一个有待深入探索的方向。

音乐情感识别(EMR)已成为一个活跃的研究领域,其准确性受到音乐偏好和熟悉度的影响8,9,10,11。当参与者接触其熟悉且偏好的音乐时,其情感评价更为一致,而在实验和教育环境中,熟悉度的提高有助于提升识别准确率12,13,14,15,16,17。这些研究结果表明,熟悉度在情感识别和偏好预测中均是一个关键因素。

基于人工神经网络的深度学习能够自动提取高维特征,在模式识别方面表现出比浅层模型更强的能力18,19,20。深度学习技术也已广泛应用于与音乐相关的任务,包括音乐流派分类、信号识别以及个性化推荐系统21,22,23,24,25,26。脑电图(EEG)被广泛用于测量大脑在不同频段(表1)的电活动,以进行认知与情绪分析27,28。将EEG与深度学习相结合,为捕捉音乐偏好相关的神经反应提供了一个有效的框架。

传统的脑电图(EEG)系统通常需要使用凝胶电极和高成本设备,限制了其在真实场景中的应用。采用干电极的可穿戴式脑电图设备提供了一种实用的替代方案,具有成本低、易用性高和灵活性强的优势。Muse S 设备以 256 Hz 的采样率从关键脑区(TP9、TP10、AF7、AF8)记录信号,能够为受控实验和真实环境应用提供可靠且可扩展的数据采集能力。

本研究通过结合脑电图(EEG)信号与用户对音乐的熟悉度特征,利用深度学习模型预测音乐偏好,从而克服现有研究的局限性。采用CNN+RNN和EEGNet架构提取EEG信号的时间-频率特征以及时序依赖关系,相较于传统方法能更有效地表征EEG信号。本研究检验了两个假设:(1)用户对音乐的熟悉度可提高基于EEG的偏好预测准确性;(2)针对特定音乐类型(摇滚、抒情和民谣)构建的模型优于在混合类别上训练的模型。

纳入了30名性别分布均衡的健康成年人队列。尽管样本量有限且使用四通道脑电图(EEG)限制了结果的普适性和信号分辨率,但将熟悉度特征与深度学习模型相结合,仍可实现稳健的预测性能。研究目标是分类音乐流派并对每个类别进行个体化预测,同时将用户对音乐的熟悉度作为特征纳入模型,以提高预测准确性。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究遵循衢州大学伦理委员会的指导方针进行。研究方案已获得衢州大学机构审查委员会(IRB)批准,批准编号为 QZU-IRB-2026-037。所有参与者在纳入研究前均签署了知情同意书。

实验准备与受试者招募
本实验包含四个阶段图1):准备阶段、实验设计、模型构建和结果分析。在准备阶段,通过综述音乐治疗、脑电图(EEG)数据采集以及深度学习模型的相关文献,明确研究目标。在实验设计阶段,招募了30名健康受试者执行音乐聆听任务,记录其脑电信号和音乐熟悉度评分。脑电数据经过标准化处理,并分割为每段2048个样本、重叠1024个样本的时间窗。将熟悉度特征与脑电数据结合,作为模型输入。构建了两种模型:CNN+RNN 和 EEGNet。卷积神经网络(CNN)层用于提取时频特征,双向长短期记忆网络(LSTM)用于捕捉时间依赖性。分类任务采用带softmax激活函数的全连接层实现。模型训练设置批量大小为50,共训练30个周期,使用Adam优化器。训练过程中应用了Dropout和早停法。模型性能主要以准确率(Accuracy)作为报告指标,同时计算精确率(Precision)、召回率(Recall)和F1分数(F1-score)进行补充评估。

实验环境与设备设置
实验在安静、封闭且无外界干扰的房间内进行,室温保持在 27 oC。所用设备包括:脑电图设备(Muse S,InteraXon Inc.)、一个四通道脑电系统(TP9、AF7、AF8、TP10),采样率为 256 Hz;Final E3000 入耳式耳机;以及一台运行 Muse SDK 和 Lab Streaming Layer(LSL)的数据采集计算机。

每次实验开始前,使用酒精清洁耳机的耳部接触表面,以确保卫生并降低交叉污染的风险。为每位参与者佩戴 Muse S 头戴设备,确保所有四个干电极(TP9、AF7、AF8、TP10)与皮肤保持稳定接触。若信号质量不佳,将调整头带位置,直至获得稳定的信号。参与者坐在带有背部支撑的舒适椅子上,并被要求闭上眼睛,避免说话,并在实验过程中尽量减少大幅度的身体活动。

音乐刺激材料的准备
准备了三种音乐类型:摇滚、抒情(民谣)和民间音乐。每种类型包含三首中文歌曲,共九首歌曲。为了控制音乐熟悉度的差异,每类音乐中的歌曲根据以下标准进行选择:一首老歌;一首当前流行歌曲(来自 Spotify 热门歌曲排行榜);以及一首新歌(来自 Spotify 新发行歌曲排行榜)。

每首歌曲被剪辑成标准化的音频片段,从引子开始,接着是主歌部分,到第一个副歌结束,总时长为90–130秒。每首歌曲均分配一个唯一标识符(例如R1–R3、B1–B3、F1–F3),用于后续的数据标注和文件管理。

实验步骤与问卷记录
正式实验开始前,通过播放一段测试音频进行音量测试。参与者将音量调节至清晰、舒适且不过响的水平,并在整个实验过程中保持该音量不变。九首歌曲的播放顺序采用随机化方式(例如使用随机数字表或软件随机化)以减少顺序效应。所有参与者独立完成音乐聆听任务。每段音乐从引子开始播放至第一段副歌结束,持续时间为 90–130 秒。歌曲之间设有 30 秒的休息间隔。在此期间,参与者通过在线平台(问卷星)完成熟悉度问卷。参与者需根据五点李克特量表对每首歌曲的熟悉程度进行评分(1 = 完全不熟悉;5 = 非常熟悉)。根据预设的二分类方案,记录参与者对每首歌曲的偏好标签(0 = 不喜欢;1 = 喜欢)。完整的实验流程如图2所示。

脑电图采集与数据记录
使用官方Muse SDK采集脑电图数据,并通过实验室流媒体层(Lab Streaming Layer, LSL)进行数据流传输。每首歌曲对应的脑电图数据保存为逗号分隔值(CSV)文件,文件至少包含以下字段:时间戳(毫秒);来自四个通道的原始脑电信号(TP9、AF7、AF8、TP10);手动记录的熟悉度评分(1–5);以及偏好标签(0/1)。采用统一的文件命名规则(例如,S01_R1.csv,表示参与者01和摇滚歌曲1),以方便自动化处理和数据追溯。

数据预处理、归一化与分窗
使用 Muse S 四通道脑电设备以 256 Hz 的采样率记录脑电(EEG)信号,并利用官方开发工具包开发了自定义程序。原始脑电数据通过 Lab Streaming Layer (LSL) 获取并保存为 CSV 格式。CSV 文件包含以下列:时间戳(毫秒)、四通道脑电信号值(TP9、AF7、AF8、TP10)、用户对音乐的熟悉度评分(1–5)以及用户对音乐的偏好评分。

数据条目的总数对应于每位参与者和每首音乐作品生成的多个窗口,因此数据集的规模取决于所采用的窗口划分方案。在原始实验中,音乐偏好被表示为二元标签(0 = 不喜欢,1 = 喜欢),这可能导致准确率被人为高估,且模型的泛化能力受限。

为了提高预测任务的实际意义,将偏好标签转换为多级评分量表:0 = 非常不同意;1 = 不同意;2 = 中立;3 = 同意;4 = 非常同意。

在机器学习之前,数据被标准化并分割为每个包含2048个样本的窗口,相邻窗口之间有1024个样本重叠,以保持时间连续性。此外,还应用了数据增强以增加训练样本的数量,并降低过拟合的风险。

模型架构
该研究模型包含三个卷积层、三个池化层和一个全连接层。采用最大池化(Max pooling)进行特征选择,应用 Dropout 以减少过拟合,并使用 Softmax 分类层生成最终输出。每个输入窗口包含四通道脑电图信号(每窗口 2048 个采样点)以及一个熟悉度特征。输出表示一个五分类的偏好评分。该架构如图 3所示,模型参数列于表 2中。

模型训练与交叉验证
数据集被随机划分为80%用于训练,20%用于测试。采用十折交叉验证方法,每次迭代中使用一个子集进行验证,其余九个子集用于训练。该过程重复十次,结果进行汇总。训练超参数设置如下:训练轮数 = 30;批量大小 = 50;优化器 = Adam;损失函数 = 分类交叉熵;评估指标 = 准确率。模型性能在仅使用脑电图(EEG)信号以及EEG结合熟悉度信息两种条件下分别记录,且针对所有音乐类型合并分析以及各单一音乐类型分别进行分析。

统计分析方法
数据分析使用 Python 3.10 结合 TensorFlow 2.12、Keras 2.12 和 MNE-Python 1.3 进行。数据处理与分析通过 Pandas 2.1 和 NumPy 1.26 完成。10 折交叉验证的性能指标被汇总,并计算均值与标准差。不同条件之间的统计比较采用配对 t 检验或 Wilcoxon 符号秩检验,显著性水平设定为 P < 0.05。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

模型性能在两种条件下进行评估:(1)仅使用脑电图(EEG)特征,以及(2)结合音乐熟悉度的脑电图特征。分类分析针对合并的音乐类别以及各个独立的音乐类别(摇滚、声乐和民谣)分别进行。

表3展示了仅使用脑电图(EEG)特征所获得的结果,而表4展示了结合EEG特征与熟悉度信息所获得的结果。在这些条件下,对CNN+RNN和EEGNet模型均进行了评估,由于EEGNet整体性能更优,因此被选为最终模型。

仅使用脑电图(EEG)特征时(表3图4),模型在所有音乐类别上的总体准确率达到82.28% ± 3.42%。当分别进行评估时,模型对摇滚音乐的准确率为91.13% ± 3.60%,对抒情音乐的准确率为91.83% ± 2.07%,对民谣音乐的准确率为87.87% ± 4.76%。

当脑电图(EEG)特征与熟悉度结合时(表4

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

以往基于脑电图(EEG)的音乐偏好预测研究主要依赖多通道系统,限制了其实际应用21,22,23,24,25,26。本研究结合深度学习模型与熟悉度特征,采用一款四通道可穿戴式脑电设备(Muse S),实现了相当的预测性能,展现出更具实用性与可扩展性的方法。

结果表明,将脑电(EEG)信号与用户熟悉度相结合,能够显著提高对所有音乐类别的预测准确率。该发现提示,音乐偏好不仅受神经反应的影响,还受到先前接触经验的影响,这与现有音乐认知及熟悉度效应的研究结果一致8,9,

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者无任何利益冲突需要披露。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者衷心感谢研究机构在本研究过程中提供的支持与设施。特别感谢实验室工作人员在技术操作方面给予的协助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
酒精棉片任何标准供应商N/A用于在参与者之间清洁耳机
数据采集计算机任何标准制造商N/A运行 Muse SDK 和实验室数据流层(Lab Streaming Layer, LSL)
脑电图头戴设备(Muse S)InteraXon Inc.https://choosemuse.com/muse-s/四通道可穿戴脑电设备(TP9, AF7, AF8, TP10)
Final E3000 入耳式耳机Final Audio Designhttps://snext-final.com/en/products/detail/E3000用于实验期间的音频播放
实验室数据流层(Lab Streaming Layer, LSL)软件开源https://github.com/sccn/labstreaminglayer用于脑电数据流传输
Muse SDKInteraXon Inc.https://developer.choosemuse.com/用于脑电数据采集
问卷星(在线平台)长沙冉星信息技术有限公司https://www.wjx.cn/用于熟悉度数据收集
Python 3.10Python 软件基金会https://www.python.org/downloads/用于数据处理与分析
TensorFlow 2.12Googlehttps://www.tensorflow.org/深度学习框架
Keras 2.12Googlehttps://keras.io/神经网络 API
MNE-Python 1.3开源https://mne.tools/stable/index.html脑电数据分析
NumPy 1.26开源https://numpy.org/数值计算
Pandas 2.1开源https://pandas.pydata.org/数据处理

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Ballmann, C. G., McCullum, M. J., Rogers, R. R., Marshall, M. R., Williams, T. D. Effects of preferred vs. nonpreferred music on resistance exercise performance. J. Strength Cond. Res. 35 (6), 1650-1655 (2021).
  2. Banks, D. Neurotechnology: microelectronics. Handbook of Neuroprosthetic Methods. Finn, W. E., LoPresti, P. G. , CRC Press. Boca Raton, FL. 361-400 (2002).
  3. Aldridge, D. An overview of music therapy research. Complement. Ther. Med. 2, 204-216 (1994).
  4. Hillecke, T., Nickel, A., Bolay, H. V. Scientific perspectives on music therapy. Ann. N. Y. Acad. Sci. 1060, 271-282 (2005).
  5. Lai, H. L. Music preference and relaxation in Taiwanese elderly people. Geriatr. Nurs. 25 (5), 286-291 (2004).
  6. Kreutz, G., Lotze, M. Neuroscience of music and emotion. Neurosciences in Music Pedagogy. Rauscher, F., Gruhn, W. , Nova Science Publishers. New York. 143-167 (2007).
  7. Madison, G., Schiölde, G. Repeated listening increases the liking for music regardless of its complexity: implications for the appreciation and aesthetics of music. Front. Neurosci. 11, 147(2017).
  8. Pereira, C. S., et al. Music and emotions in the brain: familiarity matters. PLoS One. 6 (11), e27241(2011).
  9. Hamlen, K. R., Shuell, T. J. The effects of familiarity and audiovisual stimuli on preference for classical music. Bull. Counc. Res. Music Educ. 168, 21-34 (2006).
  10. Liu, W. J. Unit learning in junior high school music class based on deep understanding. Prim. Second. Sch. Music Educ. 3, 5(2022).
  11. A vocal range balancing method, device, and system based on deep learning. China Patent. , CN109147807B (2024).
  12. Yin, D. H. Constructing a music classroom teaching paradigm from the perspective of deep learning (Part 2). Prim. Second. Sch. Music Educ. 6, 4(2022).
  13. Zhang, C., Shi, T., Ai, J., Tian, W. Construction of GUI elements recognition model for AI testing based on deep learning. Proceedings of the 2021 8th International Conference on Dependable Systems and Their Applications (DSA), , 508-515 (2021).
  14. Shi, Y., Ko, Y. C. Construction of English pronunciation judgment and detection model based on deep learning neural networks data stream fusion. Int. J. Pattern Recognit. Artif. Intell. 36 (6), 2252011(2022).
  15. Li, X. H., et al. Survey of remote sensing image registration based on deep learning. Natl. Remote Sens. Bull. 27 (2), 267-284 (2023).
  16. Bishop, C. M., Nasrabadi, N. M. Pattern recognition and machine learning. , Springer. New York. (2006).
  17. Goodfellow, I., Bengio, Y., Courville, A. Deep learning. , MIT Press. Cambridge, MA. (2016).
  18. LeCun, Y., Bengio, Y., Hinton, G. Deep learning. Nature. 521, 436-444 (2015).
  19. Janiesch, C., Zschech, P., Heinrich, K. Machine learning and deep learning. Electron. Mark. 31 (3), 685-695 (2021).
  20. A deep learning-based system and method for Gongche notation character recognition. China Patent. , CN202210650096.0 (2024).
  21. Sun, L. Y. Research on music genre classification and generation technology based on deep learning. , Nanjing Audit University. Nanjing, China. Master's thesis (2022).
  22. Gan, Q. Deep learning-based electronic music signal recognition method. Inf. Comput. 35, 54-56 (2023).
  23. Zhang, H. Building a music teaching and research community using deep learning. Music World. 1, 16-19 (2022).
  24. Liu, L., Kong, M., Cao, C., Shu, Z., Liu, K., et al. Personalized music recommendation algorithm based on machine learning. Multimed. Syst. 31, 166(2025).
  25. Naser, D. S., Saha, G. Influence of music liking on EEG-based emotion recognition. Biomed. Signal Process. Control. 64, 102251(2021).
  26. Cannard, C., Brandmeyer, T., Wahbeh, H., Delorme, A. Self-health monitoring and wearable neurotechnologies. Handbook of Clinical Neurology. Ramsey, N. F., Millán, J. delR. 168, 207-232 (2020).
  27. Kumari, P., Vaish, A. Brainwave-based user identification system: a pilot study in robotics environment. Robot. Auton. Syst. 65, 15-23 (2015).
  28. Asif, A., Majid, M., Anwar, S. M. Human stress classification using EEG signals in response to music tracks. Comput. Biol. Med. 107, 182-196 (2019).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

CNN RNN EEGNet Muse S

相关文章