研究文章

智能音乐教育平台中个性化体感与节奏评估交互式人工智能工具的开发

DOI:

10.3791/69058

2025年12月19日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种可重复的体感音乐学习方案,该方案结合残差LSTM识别与TRPO实现自适应难度调节。内容涵盖预处理、FFT特征提取、训练、个性化及评估。在公开数据集上,该混合模型在三个受试者无关的折叠验证中达到了准确率95.0 / 精确率93.5 / 召回率94.6 / F1分数94.2。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

传统的音乐教育通常缺乏互动性和实时适应性,尤其是在远程教学环境中。本研究提出了一种用于音乐教育平台的个性化体感框架 TRPO-ResLSTM。该系统可捕捉动作、节奏和反应时间,采用维纳滤波和 Z 分数归一化对数据进行预处理,并提取特征 通过 FFT。手势识别由DeepRes-LSTM完成,而自适应难度调节则通过TRPO强化学习实现。增量学习确保了跨会话的个性化。在公开可用的匿名手势-节奏数据集上进行的实验(n = 2,730个样本;训练/验证/测试划分比例为70/15/15)表明,该方法优于多模态基线模型,准确率达到95%,精确率为93.5%,召回率为94.6%,F1分数为94.2%。消融研究验证了TRPO和Res-LSTM各自的贡献。本方案的创新之处在于将强化学习与残差时间建模相结合,用于自适应手势识别,从而实现稳定且个性化的学习。本研究证明,具备自适应性和手势响应能力的工具可提升智能音乐教育中的参与度、个性化水平以及渐进式技能发展。局限性包括对单一数据集的依赖以及缺乏真实学习者的验证,这些指明了未来工作的方向。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

人工智能(AI)与体感技术的最新进展正在重塑音乐教育,使学习者能够通过身体动作与音乐互动,将手势转化为音符、节奏或对虚拟乐器的控制1,2。与传统课堂教学相比,这些交互功能增强了学习者的参与度、记忆保持能力和创造力;体感工具使学生能够通过身体打击乐、指挥动作以及合奏模拟来练习节奏、协调性和表现力3。结合由人工智能驱动的自适应学习路径,学习者可获得个性化的学习内容、实时反馈以及循序渐进的技能发展,从而提升学习动机与成效4,5

尽管取得了这些进展,现有平台往往依赖有限的模态,缺乏个性化的连续性,或无法适应多样化的文化背景和身体学习方式6,7。传统方法在提供反映学习者不断变化能力的实时、数据驱动调整方面也存在不足。例如,动作捕捉和可穿戴设备能够生成丰富的数据集,但在自适应教学中往往未被充分利用8,9。此外,尽管音乐库和学习管理系统已提高了可及性,但它们很少能在不同学习阶段提供跨会话的动态个性化支持,而这一点在多元文化和异质学习环境中至关重要10

为解决这些不足,本研究提出了一种面向音乐教育平台的新型信任区域策略优化深度残差长短期记忆网络(Trust Region Policy Optimized Deep Residual Long Short-Term Memory, TRPO-ResLSTM)框架11。该系统结合了维纳滤波和Z分数归一化等先进预处理方法,并采用快速傅里叶变换进行频域特征提取。Res-LSTM能够稳健地识别手势和时序序列,而TRPO强化学习则根据学习者的表现动态调整任务难度。增量学习通过跨会话更新模型,进一步增强了个性化能力。

实验在Kaggle音乐手势与节奏数据集上进行,该数据集包含2,730个样本,划分为训练、验证和测试子集。结果表明,所提出的方法持续优于基线多模态架构,在准确率、精确率、召回率和F1值方面均达到93%–95%。消融分析验证了TRPO和Res-LSTM两个组件的有效性。通过提升节奏准确性、用户参与度以及策略稳定性,该框架为在资源受限和远程学习环境中提高音乐教育效率提供了切实可行的解决方案。关于人工智能驱动音乐教育的相关研究已凸显出体感交互、自适应学习个性化,以及在音乐治疗和自动作曲中应用的潜力12,13。本研究在此基础上,提出了一种可复现的实验方案,将强化学习与深度时序建模相结合,推动智能音乐教育领域的发展。

访问受限。请登录或开始试用以查看此内容。

方案

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究分析了匿名的公开可用数据,未涉及人类受试者或动物。因此,无需额外的伦理审批。

1. 概述

本方案描述了一种基于深度残差LSTM识别与信任域策略优化(TRPO)实现自适应难度控制的可重复的体感音乐教育框架。内容包括数据集准备、预处理、频域特征提取、模型架构、训练、个性化设置及评估。图1展示了端到端的工作流程14

2. 数据集

本研究使用了一个公开可用的匿名音乐动作与节奏数据集,该数据集记录了人体对节拍速度和节拍强度等听觉线索的反应。该数据集提供了适用于研究节奏执行和学习行为的多模态时间序列数据。每条记录包含运动模式、时间信息、节奏准确性指标、反馈响应以及任务完成时间。由于该数据集已完全匿名化且公开可获取,因此无需额外的机构审查委员会批准15。在实验中,数据按受试者划分为训练集、验证集和测试集,以避免身份信息泄露;详细的统计信息和划分比例见表1。实验采用三个受试者互不重叠的折叠划分方式,所有运行过程中使用固定的随机种子,并对所有模型变体采用相同的预处理方法,以确保结果的可比性16

该数据集呈现出节奏性手势的均衡分布,训练集、验证集和测试集在时序和运动特征上的方差相近。各数据子集在节拍偏差和运动幅度方面的描述性统计量(中位数 ± 四分位距)相似,表明协变量偏移极小。

3. 数据预处理

  1. Z分数标准化
    使用Z分数标准化对原始数据进行标准化处理。对于通道c和时间点t:
    标准分数公式,\( Z_{c,t} = \frac{x_{c,t} - \mu_c}{\sigma_c} \),统计学方程。    (1)
    我们仅在训练集上计算μcσc,并将其应用于验证集和测试集,以避免信息泄露17
    标准化后,所有通道的均值接近于零,方差为1,确保了不同受试者之间的数据可比性。按批次进行的诊断分析确认各折之间无分布漂移。
  2. 维纳滤波
    为抑制噪声,我们在频域中应用了维纳滤波器:
    信号处理中的数学方程,显示 H(k)=S_xx(k)/(S_xx(k)+S_nn(k))。     (2)
    其中Y(k)为观测到的频谱,\hat{X}(k)为去噪估计值,Sxx(k)、Snn(k)分别表示信号和噪声的功率谱密度。我们采用的窗长和重叠比例与后续FFT保持一致,以维持相位一致性18
    维纳滤波使高频噪声降低了约30%,同时保留了主要的节律成分。信噪比得到提升,且未削弱与节拍锁定的峰值。
  3. 特征提取(FFT)
    在重叠窗口上使用短时傅里叶变换(FFT)提取特征:
    信号处理中的离散卷积方程,数字信号分析的数学公式。    (3)
    提取的特征包括主导频率、谱通量和频带能量比。此外还计算了与节拍锁定的峰值显著性及峰间变异性,以捕捉微定时稳定性19
    FFT结果显示清晰的频谱峰值与音乐节拍(2–3 Hz)对齐,证实了数据集中存在节律结构。在正确执行的试验中,峰值与噪声比平均超过6–8 dB。

4. 模型:TRPO-ResLSTM

  1. 残差长短期记忆网络(ResLSTM)
    使用带有残差连接的堆叠LSTM对时间模式进行建模:
    LSTM equations; mathematical formulas on neural networks; diagram for computational model understanding. (4)
    其中P为单位矩阵或用于匹配维度的投影矩阵。残差连接可缓解梯度消失问题,使模型能够构建更深的时间序列堆叠结构,同时保持训练稳定性20.
    残差连接相比普通LSTM改善了梯度流动和分类准确率。消融实验表明,在参数量相当的情况下,残差结构堆叠比非残差结构堆叠准确率提高0.7至1.1个百分点。
  2. 信任域策略优化(TRPO)
    TRPO 动态控制任务难度。个性化奖励为:
    Economic equation for dynamic analysis, r_t = αs_t - βΔtempo_t, formula representation.   (5)
    成功率 st,节拍偏差 Δtempot,手势差异性 dt (例如,DTW 距离或分类损失),以及一个开关指示器 ut (惩罚频繁的难度变化)。我们使用 KL 约束优化了一个信任域目标函数:
    <div lang="en">Optimization equation; max θ, L(θ); includes policy π, constraint DKL; mathematical expression.</div>    (6)
    1. 强化学习设置与符号表示
      自适应难度被构建成一个有限视界马尔可夫决策过程(MDP),其中状态 st 聚合窗口化的体感特征(加速度计通道、手部关节位置、归一化、维纳滤波和快速傅里叶变换后的节奏描述符)及动作 at 是一个控制节奏容差和动作严格程度的离散难度级别。奖励 rt 在任务成功率、时间偏差和参与度之间取得平衡,同时对频繁切换难度施加较小惩罚,以避免振荡。策略更新采用带有KL散度约束的TRPO方法,以实现保守的更新步长。在公式(5-6)中,g(y,x) 表示任务特定的损失梯度。 W(ζ)是一种 L2 参数ζ的正则化项 πθ 是具有参数的随机策略 θ, DKL 定义了信任域, γ 是折扣因子,δ 是信任域半径。超参数 α,β,γ,δ 被选中 通过 在验证集上进行网格搜索(范围在 表 2以平衡稳定性和响应性;当平均KL达到0.9时触发早停机制21.
    2. 理论依据与替代方案
      TRPO 的 KL 约束策略更新更适用于小规模的会话级批次及非平稳的学习者行为;PPO/SAC 仍具潜力,将在后续工作中进行基准测试22.
      TRPO 相较于基线控制器实现了更稳定的训练和更平滑的难度调整,且收敛性一致。学习曲线表明,与单组分基线相比,TRPO-ResLSTM 的性能呈现单调提升,且 KL 散度更早趋于稳定。
  3. 个性化与会话更新
    每次用户会话后,通过较小的学习率和回放缓冲区对 ResLSTM 和 TRPO 模型进行增量式更新。我们为每位学习者使用了包含最近若干次试验的小型回放缓冲区,以防止模型漂移,并将每次会话的更新量限制在固定的预算范围内,以保持稳定性。个性化效果通过学习者在固定时间范围内首次与最后一次会话之间 F1 分数的相对提升来衡量23.
    会话间的个性化使用户特定准确率提升了2%–3%,且未出现灾难性遗忘。准确率提升最显著的是基线准确率处于中等水平的学习者,表明自适应支架式教学仍有较大提升空间。
  4. 算法与实现
    完整的伪代码(“算法 1:TRPO-ResLSTM”)和参考的 Python 3.10.1 实现已提供。所有图表均包含测量定义、误差条和样本量。我们报告了三个受试者互斥折次上的均值 ± 标准差,并根据情况采用重复测量方差分析或弗里德曼检验评估模型间差异,辅以多重性校正的事后比较(α = 0.05)。为确保可重复性,我们在文中列出了软件包版本以及 GPU/CPU 规格。 材料表 并包含一个包含环境和种子配置的 README 文件24.
    该方案在多种模态基线方法上持续复现了性能提升,验证了其可重复性。在不同随机种子下的独立重复实验产生了 <集成模型的准确率存在 0.5 pp 的差异。

访问受限。请登录或开始试用以查看此内容。

结果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

实验设置
TRPO-ResLSTM 框架使用 Python 3.10.1 实现,并采用 GPU 加速。计算环境、运动感知硬件和 Python 库详见材料表。数据按受试者独立的方式划分为训练集/验证集/测试集,如表1所示(70/15/15)。关键超参数汇总于表2。共评估了三种模型:基线 TRPO、基线 ResLSTM 以及集成的 TRPO-ResLSTM。该设置实现了对音乐学习场景中手势识别、自适应难度控制及个性化功能的一致性评估。

混淆矩阵
首先使用保留的测试集上的混淆矩阵来评估分类性能(图2)。行表示真实标签,列表示预测结果;数值经过行归一化处理。明显的对角线主导性表明在不同手势类别间具有较强的识别能力,仅在相近的节奏模式之间存在少量混淆。

特征重要性分析
为了理解模型的行为...

访问受限。请登录或开始试用以查看此内容。

讨论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本研究提出了一种混合协议 TRPO-ResLSTM,该协议将强化学习与残差时间建模相结合,用于基于手势的音乐教育。通过结合信任域策略优化(Trust Region Policy Optimization, TRPO)的稳定性与残差长短期记忆网络(residual LSTM)的序列学习能力,该框架实现了实时手势识别与自适应难度控制,从而支持个性化反馈和渐进式技能习得25。为确保可重复性,研究采用受试者互斥的折叠验证、固定随机种子以及各模型间一致的预处理流程,并在三个折叠上报告均值±标准差,显著性检验与结果部分保持一致。

本研究的贡献在于推动了个性化和交互式学习环境的发展。与依赖静态教学或单模态识别的系统不同,TRPO-ResLSTM 能够动态适应学习者的节奏和动作模式,从而在实践导向的学习环节中提升参与度和知识留存率26。我们报告的面向教育的指标(节奏同步性、自适应响应、个性化有效性、知识留存)将学习者为中心的学习成果操作化,而不仅限于机器学习指标,这些指标也响应了近年来在真实学习场景中开...

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明无利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者感谢同事对研究设计和论文撰写的建设性反馈。本工作未从公共、商业或非营利机构的任何资助机构获得特定资助。

访问受限。请登录或开始试用以查看此内容。

材料

本文使用的材料清单
姓名公司目录编号评论
加速度计传感器数据Kaggle (公共领域)数据集中包含的多模态输入信号(运动模式、时序特征)
GPU 工作站NVIDIA Corporation, USA训练硬件:NVIDIA RTX 3080 (10 GB),32 GB RAM,Ubuntu 20.04
手部关节位置数据Kaggle (公共领域)用于手势识别的本体感觉输入
Matplotlib (v3.7)https://matplotlib.org用于绘制图形和性能指标的可视化库
NumPy (v1.23)https://numpy.org用于数组运算的数值计算库
公开的音乐手势与节奏数据集Kaggle (公共领域)包含 2,730 个样本的匿名数据集,记录对节拍与速度的身体反应;用于模型训练/验证/测试(70/15/15)
Python 3.10.1Python Software Foundation, https://www.python.org用于模型实现与分析的编程环境
PyTorch (v1.13)https://pytorch.org用于实现 ResLSTM 和 TRPO 模块的深度学习框架
scikit-learn (v1.2)https://scikit-learn.org用于数据预处理和评估的机器学习工具库
SciPy (v1.10)https://scipy.org科学计算库(用于维纳滤波)

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Wei, J., Karuppiah, M., Prathik, A. College music education and teaching based on AI techniques. Comput Electr Eng. 100, 107851(2022).
  2. Yu, X., et al. Developments and applications of artificial intelligence in music education. Technol. 11 (2), 42(2023).
  3. Fang, J. Artificial intelligence robots based on machine learning and visual algorithms for interactive experience assistance in music classrooms. Entertain Comput. 52, 100779(2025).
  4. Zhang, S., Lu, X., Liu, X. Study on the influence of AI composition software on students' creative ability in music education. J Educ Technol Innov. 6 (2), (2024).
  5. Feng, Y. Design and research of music teaching system based on virtual reality system in the context of education informatization. PLoS One. 18 (10), e0285331(2023).
  6. Zhou, X. Entertainment performance robots application in music network classrooms based on speech sensor recognition and artificial intelligence. Entertain Comput. 52, 100782(2025).
  7. Yu, H., Zou, Z. The music education and teaching innovation using blockchain technology supported by artificial intelligence. Int J Grid Util Comput. 14 (2-3), 278-296 (2023).
  8. Hong Yun, Z., et al. A decision-support system for assessing the function of machine learning and artificial intelligence in music education for network games. Soft Comput. 26 (20), 11063-11075 (2022).
  9. Dey, M. T., Patra, S., Mitra, S. Enhancing music education with innovative tools and techniques: The role of artificial intelligence in musical works. Enhancing Music Education With Innovative Tools and Techniques. , IGI Global. 19-50 (2025).
  10. Lin, X., et al. The application of music therapy in the rehabilitation education of children with cerebral palsy. J Investig Med. 73 (1 Suppl. 1), (2025).
  11. Wang, X. Design of vocal music teaching system platform for music majors based on artificial intelligence. Wirel Commun Mob Comput. 2022 (1), 5503834(2022).
  12. Chen, Y., Sun, Y. The usage of artificial intelligence technology in music education system under deep learning. IEEE Access. , 130546-130556 (2024).
  13. Yang, Y., et al. Multi-source and heterogeneous online music education mechanism: An artificial intelligence-driven approach. Fractals. 31 (6), 2340154(2023).
  14. Sang, J. The intersection of technology and art: A study on AI-driven CTCL music teaching paradigm. , (2024).
  15. Yin, Y. Research on technological innovation and application of music education transformation under the background of technology. J Educ Theory Pract. 2 (2), (2025).
  16. Yuan, Y. Influencing factors and modeling methods of vocal music teaching quality supported by artificial intelligence technology. Int J Web Based Learn Teach Technol. 19 (1), 1-16 (2024).
  17. Sanganeria, M., Gala, R. Tuning music education: AI-powered personalization in learning music. arXiv Prepr. , (2024).
  18. Qiusi, M. Research on the improvement method of music education level under the background of AI technology. Mob Inf Syst. 2022 (1), 7616619(2022).
  19. Xu, Z. Construction of an intelligent recognition and learning education platform of national music genre under deep learning. Front Psychol. 13, 843427(2022).
  20. Wang, X., et al. College music teaching and ideological and political education integration mode based on deep learning. J Intell Syst. 31 (1), 466-476 (2022).
  21. Tang, H., Zhang, Y., Zhang, Q. The use of deep learning-based intelligent music signal identification and generation technology in national music teaching. Front Psychol. 13, 762402(2022).
  22. Artificial intelligence in music education: Exploring applications, benefits, and challenges. Yue, Y., Jing, Y. Proc Int Conf Educ Inf Technol, , 141-146 (2025).
  23. Bai, A., Yeh, C. K., Hsieh, C. J., Taly, A. An efficient rehearsal scheme for catastrophic forgetting mitigation during multi-stage fine-tuning. arXiv Prepr. , (2024).
  24. Ravi, N., Goel, A., Davis, J. C., Thiruvathukal, G. K. Improving the reproducibility of deep learning software: An initial investigation through a case study analysis. arXiv Prepr. , (2025).
  25. Chen, J., Jin, F., Jiao, Y., Zhan, Y., Qin, X. Improving dynamic gesture recognition with attention-enhanced LSTM and grounding SAM. Electronics. 14 (9), 1793(2025).
  26. Ouyang, F., Dai, X., Chen, S. Applying multimodal learning analytics to examine the immediate and delayed effects of instructor scaffoldings on small groups' collaborative programming. Int J STEM Educ. 9 (1), 45(2022).
  27. Aoyama Lawrence,, Weinberger, L., A, Being in-sync: A multimodal framework on the emotional and cognitive synchronization of collaborative learners. Front Educ. , (2022).
  28. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., Klimov, O. Proximal policy optimization algorithms. arXiv Prepr. , (2017).
  29. Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor. PMLR. Haarnoja, T., Zhou, A., Abbeel, P., Levine, S. Proc Int Conf Mach Learn, , (2018).
  30. Huang, S., Dossa, R. F. J., Raffin, A., Kanervisto, A., Wang, W. The 37 implementation details of proximal policy optimization. ICLR Blog Track. , https://iclr-blog-track.github.io/2022/03/25/ppo-implementation-details/ (2023).
  31. Sclater, N., Bailey, P. Code of practice for learning analytics. , https://www.jisc.ac.uk/guides/code-of-practice-for-learning-analytics (2022).
  32. Rabiner, L. R. A tutorial on hidden Markov models and selected applications in speech recognition. Proc IEEE. 77 (2), 257-286 (2002).
  33. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).
  34. Proverbio, A. M., Camporeale, E., Brusa, A. Multimodal recognition of emotions in music and facial expressions. Front Hum Neurosci. 14, 32(2025).
  35. Kang, S. Adaptations, code-switching, and novelty with cultural integrity: Musicians performing and learning musical instruments in different musical traditions. J Res Music Educ. , (2025).
  36. Han, Y., Han, L., Zeng, C., Zhao, W. The innovation path of VR technology integration into music classroom teaching in colleges and universities. Sci Rep. 15 (1), 12200(2025).
  37. Huang, A. Y., Lu, O. H., Yang, S. J. Effects of artificial intelligence-enabled personalized recommendations on learners' learning engagement, motivation, and outcomes in a flipped classroom. Comput Educ. 194, 104684(2023).
  38. Tao, S., et al. MusicalPT: Augmenting physical therapy by integrating adaptive musical guidance to enhance exercise quality and patient experience. Proc ACM Interact Mob Wearable Ubiquitous Technol. 9 (3), 1-32 (2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

TRPO ResLSTM

相关文章