Page 11 - 《软件学报》2026年第5期
P. 11
1890 软件学报 2026 年第 37 卷第 5 期
(RoPE) [21] 启发提出了旋转绝对-相对位置编码 (rotational absolute-relative, RoAR). RoAR 通过旋转嵌入机制灵活地
表示音符间的相对空间关系, 以捕捉音乐序列中的层级结构和多维度特征, 尤其适用于理解结构复杂和动机不断
演变的乐曲. 基于 RoAR 在层级依赖建模方面的卓越性能, CNN-Midiformer 将其集成为序列处理基线, 以进一步
提升对音乐时序结构的建模精度.
然而, 基于 Transformer 架构的模型存在更深层的挑战: 模型仅通过序列数据学习进行建模, 难以有效学习音
乐知识, 导致模型对音乐构成原理的理解相对有限, 限制了对音乐内在构造和深层语义的理解.
为了实现全面的理解能力, 研究者尝试引入非序列化的信息以弥补单一序列表征的不足. 部分研究尝试将乐
谱图像作为新模态进行融合 (score images as a modality, SIM) [22] , 旨在融合乐谱音符形状、谱表布局等视觉特征提
供的非序列化信息和符号序列提供的精确时序信息, 但这种方法没有将结构化的音乐知识建模并融入模型表示
中, 导致模型无法充分利用音乐知识来进一步提升性能.
当前 SMU 研究仍主要面临两项关键问题: 首先, 复杂音乐结构往往被简化为线性符号序列, 多维层级信息缺失;
其次, 乐理知识未有效融入模型表示, 导致对音乐内在构造原则的理解有限. 针对上述问题, 本文提出 CNN-Midiformer
模型, 通过将音乐知识转换为结构化表征, 利用卷积神经网络 (CNN) 提取关键局部特征, 与 Transformer 编码器捕
获的全局语义特征通过高效交叉注意力融合, 显著提升了 SMU 基准下游任务的精度, 为 SMU 领域提供了一种新
的研究思路.
2 融合音乐知识结构化表征的符号音乐理解模型
2.1 总框架
本文提出的 CNN-Midiformer 模型在符号音乐理解任务中引入音乐知识的结构化表征, 与符号序列信息协同
建模, 在语义层面深化和扩展序列表示能力, 有效解决了传统 Transformer 模型在音乐表示单一化和乐理知识缺乏
方面的局限性.
模型整体框架如图 2 所示, 由互补音乐特征提取模块、基于 RoAR [20] 的序列信息捕获基线以及音乐知识自适
应增强的特征融合模块这 3 大模块协同构成. 首先, 模型对 MIDI 文件进行结构化处理, 分别构建音乐知识 (音高
转移矩阵和音长转移矩阵) 与音乐序列 (复合词) 两种结构化表征. 为有效捕获音高与音长之间的关联信息, 将两
种矩阵堆叠形成堆叠特征矩阵. 随后, 互补音乐特征提取模块利用卷积神经网络 (CNN) 从堆叠特征矩阵提取局部
结构特征, 获得深层音乐知识特征. 同时, 复合词序列通过 RoAR 基线处理, 捕获序列的深层语义信息.
互补音乐特征提取模块 音乐知识自适应增强的
特征融合模块
最 最 层 全 全
音高转移矩阵 卷 大 卷 大 卷 正 连 丢 连 旋律识别
积 池 积 池 积 则 接 ReLU 弃 接
块 化 块 化 块 层
堆叠特征矩阵 层 层 化 层 层 交叉注意力 力度预测
深层音乐知识特征
音长转移矩阵
RoAR RoAR序列基线 作曲家分类
多头注意力 特征交互
复合词 位置编码 门控 深层融合特征
时长
情感分类
音高
子节拍
符号音乐序列输入 特征投影 Transformer编码器
小节拍
词嵌入 深层语义特征 流派分类
图 2 CNN-Midiformer: 融合音乐知识与序列信息的整体框架
最后, 音乐知识自适应增强的特征融合模块通过高效的交叉注意力机制, 根据 Transformer 编码器中每个符号
的序列上下文信息, 自适应地将 CNN 提取的深层音乐知识特征融入序列表示之中, 确保音乐知识能在最相关的序
列位置发挥作用.
2.2 互补音乐特征提取模块
音乐创作遵循旋律、和声与节奏等构造原则, 这些原则塑造了乐曲的独特层级结构与风格 [14] . 音高转移矩阵
(PCTM) 与音长转移矩阵 (NLTM) 能够有效捕捉这些原则 [16] . PCTM 通过统计各音高类别间的转移概率以刻画调

