Page 10 - 《软件学报》2026年第5期
P. 10
黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解 1889
矩阵 (pitch class transition matrix, PCTM) 能够统计性地刻画旋律在不同音高间的转移偏好, 音符长度转移矩阵
(note length transition matrix, NLTM) 能捕捉节奏的转换规律, 结合两种转移矩阵可以反映不同流派的风格 [16] . 这
些结构化特征兼具音乐学意义与统计特性, 蕴含了关于反映旋律和节奏的重要局部结构信息, 在序列建模的协同
下能够为模型提供乐理指导, 有助于提升模型在下游任务上的精度.
基于该思路, 本文提出了一种融合音乐知识和音乐序列的深层符号音乐理解模型 CNN-Midiformer, 实现了高
精度的符号音乐理解. 不同于完全基于 Transformer 架构的符号音乐理解模型, 本文首先提出了互补音乐特征提取
模块, 利用卷积神经网络 (convolutional neural network, CNN) 从音乐知识结构化表征中提取深层音乐知识特征, 并
基于 Transformer 架构捕捉符号音乐序列的长距离序列依赖关系; 其次, 设计了音乐知识自适应增强的特征融合模
块, 利用高效的交叉注意力机制将 CNN 提取的深层音乐知识特征与 Transformer 编码器的深层语义特征进行自适
应融合, 实现了对序列语境的感知与特征增强. 本文的主要贡献可概括如下.
● 提出了一种深层符号音乐理解模型 CNN-Midiformer, 通过 CNN 与 Transformer 编码器协同学习音乐知识
和音乐序列, 实现了高精度的符号音乐理解.
● 设计了互补音乐特征提取模块, 利用 CNN 提取音乐知识特征中蕴含的音乐局部结构信息, 将音乐知识与
Transformer 编码器的深层语义特征融合, 增强了模型对音乐序列的建模能力.
● 设计了音乐知识自适应增强的特征融合模块, 通过高效的交叉注意力机制将 CNN 提取的深层音乐知识特
征根据序列语境动态地增强 Transformer 编码器的表示, 实现了多源音乐特征的自适应融合.
● 在 6 个公开符号音乐理解数据集 Pop1K7、ASAP、POP909、Pianist8、EMOPIA 和 ADL 上的对比实验表
明, 该模型在旋律识别、力度预测、作曲家分类、情感分类和流派分类这 5 个符号音乐理解的基准下游任务上均
优于最新方法, 相较于基线模型准确率提升 0.21–7.14 个百分点.
本文第 1 节回顾符号音乐理解及相关深度学习模型的研究现状. 第 2 节详细阐述 CNN-Midiformer 模型的架
构设计, 包括模型总框架、互补音乐特征提取模块和音乐知识自适应增强的特征融合模块. 第 3 节介绍实验设置,
并展现详细的实验结果与分析. 最后对全文进行总结.
1 符号音乐理解的相关工作
符号音乐理解 (SMU) 融合了音乐学、计算机科学及自然语言处理 (natural language processing, NLP) 等多学
科的理论与技术 [17] . 然而, 音乐不仅具有音高、时值、力度等多维同步特征, 还呈现从音符到乐句、乐段、乐章
的层级结构, 与自然语言序列存在本质差异 [14] . 直接基于现有 NLP 方法无法充分捕捉音乐数据的独特特征, 这要
求研究者面向音乐属性构建专门的模型与算法.
早期研究基于 Word2Vec [18,19] 等词嵌入方法, 将音符视为“词汇”并学习其分布式表示, 进而捕捉音符间的语义
关系, 在旋律识别等任务中取得初步成果. 隐马尔可夫模型 (hidden Markov model, HMM) 和循环神经网络
(recurrent neural network, RNN), 在捕获短期时序依赖方面表现良好, 但在处理跨越长时序的结构性依赖时易出现
信息遗忘等问题. 音乐中普遍存在跨越长时间段的复杂结构和依赖关系, 导致传统 RNN 类模型难以完整把握音乐
全局特征, 限制了模型在长时序依赖要求较高的任务中的表现.
近年来, 基于 Transformer 架构的深度学习模型通过自注意力机制在捕获长序列依赖方面表现突出, 迅速成
为 SMU 研究的主流. 该架构能够直接关注序列中任意位置的相关信息, 通过在海量未标注音乐上预训练, 再在下
游任务中微调, 显著提升了模型精度 [12,13] . MusicBERT [12] 作为 SMU 方向的早期探索者之一, 成功将 BERT 架构 [10]
应用于大规模符号音乐数据集的预训练, 在旋律完成和伴奏建议等任务上展示了强大的潜力; MidiBERT [13] 进一步
针对符号音乐的特性进行了设计优化, 采用了掩码语言建模 (masked language modeling, MLM) 等预训练任务, 有力
地证明了相较于传统 RNN 类模型, 大规模预训练模型在 SMU 任务上的显著优势. 这些工作充分验证了 Transformer
架构及其预训练方法在建模音乐序列方面的有效性.
为适应音乐的结构和层级特性, 研究者也对 Transformer 进行了针对性改进. 考虑到音乐中音符常以特定模式
共存 (如和弦中的多个音符同时出现), 以及音乐结构具有层级性和相对时空关系 [14] , Li 等人 [20] 受旋转位置编码

