Page 8 - 《软件学报》2026年第5期
P. 8
软件学报 ISSN 1000-9825, CODEN RUXUEW E-mail: jos@iscas.ac.cn
2026,37(5):1887−1902 [doi: 10.13328/j.cnki.jos.007542] [CSTR: 32375.14.jos.007542] http://www.jos.org.cn
©中国科学院软件研究所版权所有. Tel: +86-10-62562563
*
融合音乐知识结构化表征的高精度符号音乐理解
黄恒焱 1 , 邹 逸 2 , 时乐轩 3 , 程皓楠 2 , 叶 龙 1,4
1
(中国传媒大学 数据科学与智能媒体学院, 北京 100024)
(媒体融合与传播国家重点实验室 (中国传媒大学), 北京 100024)
2
3
(中国传媒大学 音乐与录音艺术学院, 北京 100024)
4
(媒介音视频教育部重点实验室 (中国传媒大学), 北京 100024)
通信作者: 程皓楠, E-mail: haonancheng@cuc.edu.cn
摘 要: 符号音乐理解 (symbolic music understanding, SMU) 是多媒体内容理解的重要任务之一, 旨在从符号化音
乐表示中提取旋律、力度、作曲家风格、情感与流派等多维音乐属性. 现有方法在音乐序列依赖建模方面取得了
显著进展, 但是仍然存在两方面关键问题: (1) 表示单一化: 将复杂的音乐结构简化为线性符号序列, 忽略了音乐固
有的多维层级信息; (2) 乐理知识缺乏: 基于序列数据驱动的模型难以融入系统化乐理知识, 限制了对音乐深层语
义的理解. 针对上述问题, 提出了一种融合音乐知识结构化表征的高精度符号音乐理解模型 CNN-Midiformer.
该模型首先基于音乐理论构建音乐知识和音乐序列的结构化表征; 其次, 设计互补音乐特征提取模块, 利用卷积神
经网络 (convolutional neural network, CNN) 提取音乐知识结构化表征的深层局部特征, 并通过 Transformer 编码器
的自注意力机制捕获音乐序列的深层语义特征; 最后, 设计音乐知识自适应增强的特征融合模块, 利用高效的交叉
注意力机制将 CNN 提取的深层音乐知识特征与 Transformer 编码器的深层语义特征进行动态融合, 实现对序列语
境的感知与特征增强. 在 6 个公开符号音乐理解数据集 Pop1K7、ASAP、POP909、Pianist8、EMOPIA 和 ADL 上
的对比实验表明, 所提出的模型 CNN-Midiformer 在旋律识别、力度预测、作曲家分类、情感分类和流派分类这
5 个符号音乐理解的基准下游任务上均优于最新方法, 相较于基线模型准确率提升 0.21–7.14 个百分点.
关键词: 符号音乐理解; 音乐知识结构化表征; 卷积神经网络; Transformer; 特征融合
中图法分类号: TP37
中文引用格式: 黄恒焱, 邹逸, 时乐轩, 程皓楠, 叶龙. 融合音乐知识结构化表征的高精度符号音乐理解. 软件学报, 2026, 37(5):
1887–1902. http://www.jos.org.cn/1000-9825/7542.htm
英文引用格式: Huang HY, Zou Y, Shi LX, Cheng HN, Ye L. High-precision Symbolic Music Understanding Incorporating Structured
Representation of Music Knowledge. Ruan Jian Xue Bao/Journal of Software, 2026, 37(5): 1887–1902 (in Chinese). http://www.jos.org.
cn/1000-9825/7542.htm
High-precision Symbolic Music Understanding Incorporating Structured Representation of
Music Knowledge
2
1
3
2
HUANG Heng-Yan , ZOU Yi , SHI Le-Xuan , CHENG Hao-Nan , YE Long 1,4
1
(School of Data Science and Intelligent Media, Communication University of China, Beijing 100024, China)
2
(State Key Laboratory of Media Convergence and Communication (Communication University of China), Beijing 100024, China)
3
(School of Music and Recording Arts, Communication University of China, Beijing 100024, China)
4
(Key Laboratory of Media Audio & Video (Communication University of China), Ministry of Education, Beijing 100024, China)
* 基金项目: 国家自然科学基金 (62201524)
本文由“多媒体智能理解与生成”专题特约编辑孙立峰教授、闵巍庆副研究员、马占宇教授、蒋树强研究员、彭宇新教授、田丰研究
员、黄庆明教授推荐.
收稿时间: 2025-05-26; 修改时间: 2025-07-11, 2025-08-30; 采用时间: 2025-09-05; jos 在线出版时间: 2025-09-23
CNKI 网络首发时间: 2025-12-26

