Page 11 - 《软件学报》2026年第5期
P. 11

1890                                                       软件学报  2026  年第  37  卷第  5  期


                 (RoPE) [21] 启发提出了旋转绝对-相对位置编码       (rotational absolute-relative, RoAR). RoAR  通过旋转嵌入机制灵活地
                 表示音符间的相对空间关系, 以捕捉音乐序列中的层级结构和多维度特征, 尤其适用于理解结构复杂和动机不断
                 演变的乐曲. 基于     RoAR  在层级依赖建模方面的卓越性能, CNN-Midiformer 将其集成为序列处理基线, 以进一步
                 提升对音乐时序结构的建模精度.
                    然而, 基于   Transformer 架构的模型存在更深层的挑战: 模型仅通过序列数据学习进行建模, 难以有效学习音
                 乐知识, 导致模型对音乐构成原理的理解相对有限, 限制了对音乐内在构造和深层语义的理解.
                    为了实现全面的理解能力, 研究者尝试引入非序列化的信息以弥补单一序列表征的不足. 部分研究尝试将乐
                 谱图像作为新模态进行融合          (score images as a modality, SIM) [22] , 旨在融合乐谱音符形状、谱表布局等视觉特征提
                 供的非序列化信息和符号序列提供的精确时序信息, 但这种方法没有将结构化的音乐知识建模并融入模型表示
                 中, 导致模型无法充分利用音乐知识来进一步提升性能.
                    当前  SMU  研究仍主要面临两项关键问题: 首先, 复杂音乐结构往往被简化为线性符号序列, 多维层级信息缺失;
                 其次, 乐理知识未有效融入模型表示, 导致对音乐内在构造原则的理解有限. 针对上述问题, 本文提出 CNN-Midiformer
                 模型, 通过将音乐知识转换为结构化表征, 利用卷积神经网络                  (CNN) 提取关键局部特征, 与      Transformer 编码器捕
                 获的全局语义特征通过高效交叉注意力融合, 显著提升了                   SMU  基准下游任务的精度, 为      SMU  领域提供了一种新
                 的研究思路.
                  2   融合音乐知识结构化表征的符号音乐理解模型


                  2.1   总框架
                    本文提出的     CNN-Midiformer 模型在符号音乐理解任务中引入音乐知识的结构化表征, 与符号序列信息协同
                 建模, 在语义层面深化和扩展序列表示能力, 有效解决了传统                  Transformer 模型在音乐表示单一化和乐理知识缺乏
                 方面的局限性.
                    模型整体框架如图       2  所示, 由互补音乐特征提取模块、基于           RoAR [20] 的序列信息捕获基线以及音乐知识自适
                 应增强的特征融合模块这         3  大模块协同构成. 首先, 模型对       MIDI 文件进行结构化处理, 分别构建音乐知识             (音高
                 转移矩阵和音长转移矩阵) 与音乐序列             (复合词) 两种结构化表征. 为有效捕获音高与音长之间的关联信息, 将两
                 种矩阵堆叠形成堆叠特征矩阵. 随后, 互补音乐特征提取模块利用卷积神经网络                         (CNN) 从堆叠特征矩阵提取局部
                 结构特征, 获得深层音乐知识特征. 同时, 复合词序列通过               RoAR  基线处理, 捕获序列的深层语义信息.

                                                                    互补音乐特征提取模块  音乐知识自适应增强的
                                                                                 特征融合模块
                                               最    最    层  全      全
                            音高转移矩阵          卷  大  卷  大  卷  正  连  丢  连                                旋律识别
                                            积  池  积  池  积  则  接  ReLU  弃  接
                                            块  化  块  化  块        层
                                    堆叠特征矩阵     层    层    化  层      层            交叉注意力                力度预测
                                                                      深层音乐知识特征
                             音长转移矩阵
                                                              RoAR      RoAR序列基线                    作曲家分类
                                          多头注意力  特征交互
                             复合词                              位置编码                    门控   深层融合特征
                              时长
                                                                                                     情感分类
                              音高
                              子节拍
                 符号音乐序列输入                           特征投影    Transformer编码器
                              小节拍
                                         词嵌入                            深层语义特征                       流派分类
                                     图 2 CNN-Midiformer: 融合音乐知识与序列信息的整体框架

                    最后, 音乐知识自适应增强的特征融合模块通过高效的交叉注意力机制, 根据                        Transformer 编码器中每个符号
                 的序列上下文信息, 自适应地将          CNN  提取的深层音乐知识特征融入序列表示之中, 确保音乐知识能在最相关的序
                 列位置发挥作用.
                  2.2   互补音乐特征提取模块
                    音乐创作遵循旋律、和声与节奏等构造原则, 这些原则塑造了乐曲的独特层级结构与风格                               [14] . 音高转移矩阵
                 (PCTM) 与音长转移矩阵     (NLTM) 能够有效捕捉这些原则         [16] . PCTM  通过统计各音高类别间的转移概率以刻画调
   6   7   8   9   10   11   12   13   14   15   16