Page 8 - 《软件学报》2026年第5期
P. 8

软件学报 ISSN 1000-9825, CODEN RUXUEW                                        E-mail: jos@iscas.ac.cn
                 2026,37(5):1887−1902 [doi: 10.13328/j.cnki.jos.007542] [CSTR: 32375.14.jos.007542]  http://www.jos.org.cn
                 ©中国科学院软件研究所版权所有.                                                          Tel: +86-10-62562563



                                                                            *
                 融合音乐知识结构化表征的高精度符号音乐理解

                 黄恒焱  1 ,    邹    逸  2 ,    时乐轩  3 ,    程皓楠  2 ,    叶    龙  1,4


                 1
                  (中国传媒大学 数据科学与智能媒体学院, 北京 100024)
                  (媒体融合与传播国家重点实验室        (中国传媒大学), 北京 100024)
                 2
                 3
                  (中国传媒大学 音乐与录音艺术学院, 北京 100024)
                 4
                  (媒介音视频教育部重点实验室       (中国传媒大学), 北京 100024)
                 通信作者: 程皓楠, E-mail: haonancheng@cuc.edu.cn
                 摘 要: 符号音乐理解       (symbolic music understanding, SMU) 是多媒体内容理解的重要任务之一, 旨在从符号化音
                 乐表示中提取旋律、力度、作曲家风格、情感与流派等多维音乐属性. 现有方法在音乐序列依赖建模方面取得了
                 显著进展, 但是仍然存在两方面关键问题: (1) 表示单一化: 将复杂的音乐结构简化为线性符号序列, 忽略了音乐固
                 有的多维层级信息; (2) 乐理知识缺乏: 基于序列数据驱动的模型难以融入系统化乐理知识, 限制了对音乐深层语
                 义的理解. 针对上述问题, 提出了一种融合音乐知识结构化表征的高精度符号音乐理解模型                               CNN-Midiformer.
                 该模型首先基于音乐理论构建音乐知识和音乐序列的结构化表征; 其次, 设计互补音乐特征提取模块, 利用卷积神
                 经网络   (convolutional neural network, CNN) 提取音乐知识结构化表征的深层局部特征, 并通过        Transformer 编码器
                 的自注意力机制捕获音乐序列的深层语义特征; 最后, 设计音乐知识自适应增强的特征融合模块, 利用高效的交叉
                 注意力机制将     CNN  提取的深层音乐知识特征与         Transformer 编码器的深层语义特征进行动态融合, 实现对序列语
                 境的感知与特征增强. 在       6  个公开符号音乐理解数据集         Pop1K7、ASAP、POP909、Pianist8、EMOPIA  和  ADL  上
                 的对比实验表明, 所提出的模型          CNN-Midiformer 在旋律识别、力度预测、作曲家分类、情感分类和流派分类这
                 5  个符号音乐理解的基准下游任务上均优于最新方法, 相较于基线模型准确率提升                         0.21–7.14  个百分点.
                 关键词: 符号音乐理解; 音乐知识结构化表征; 卷积神经网络; Transformer; 特征融合
                 中图法分类号: TP37

                 中文引用格式: 黄恒焱,  邹逸,  时乐轩,  程皓楠,  叶龙.  融合音乐知识结构化表征的高精度符号音乐理解.  软件学报,  2026,  37(5):
                 1887–1902. http://www.jos.org.cn/1000-9825/7542.htm
                 英文引用格式: Huang HY, Zou Y, Shi LX, Cheng HN, Ye L. High-precision Symbolic Music Understanding Incorporating Structured
                 Representation of Music Knowledge. Ruan Jian Xue Bao/Journal of Software, 2026, 37(5): 1887–1902 (in Chinese). http://www.jos.org.
                 cn/1000-9825/7542.htm
                 High-precision Symbolic Music Understanding Incorporating Structured Representation of
                 Music Knowledge
                                       2
                               1
                                                  3
                                                                2
                 HUANG Heng-Yan , ZOU Yi , SHI Le-Xuan , CHENG Hao-Nan , YE Long 1,4
                 1
                 (School of Data Science and Intelligent Media, Communication University of China, Beijing 100024, China)
                 2
                 (State Key Laboratory of Media Convergence and Communication (Communication University of China), Beijing 100024, China)
                 3
                 (School of Music and Recording Arts, Communication University of China, Beijing 100024, China)
                 4
                 (Key Laboratory of Media Audio & Video (Communication University of China), Ministry of Education, Beijing 100024, China)


                 *    基金项目: 国家自然科学基金 (62201524)
                  本文由“多媒体智能理解与生成”专题特约编辑孙立峰教授、闵巍庆副研究员、马占宇教授、蒋树强研究员、彭宇新教授、田丰研究
                  员、黄庆明教授推荐.
                  收稿时间: 2025-05-26; 修改时间: 2025-07-11, 2025-08-30; 采用时间: 2025-09-05; jos 在线出版时间: 2025-09-23
                  CNKI 网络首发时间: 2025-12-26
   3   4   5   6   7   8   9   10   11   12   13