Page 18 - 《软件学报》2026年第5期
P. 18
黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解 1897
表 2 模型超参数设置
超参数 值
最大序列长度 512
网络层数 12
隐藏层大小 768
注意力头数 12
权重衰减系数 0.01
优化器 AdamW
学习率 2E–5
批次大小 12
总参数量 113M
3.3 模型性能对比
本节在旋律识别、力度预测、作曲家分类、情感分类和流派分类这 5 项符号音乐理解基准任务上对比了
CNN-Midiformer 与当前多种先进模型的性能, 并分析了各模型在不同任务中表现提升的根本原因. 表 3 列出了包
括非预训练的传统 RNN 模型、基于大规模预训练的 MidiBERT 与其改进版本以及引入改进位置编码的 RoAR
等模型在内的多种对照模型在上述任务上的准确率, 以 RoAR† (本文复现的基线模型) 为对比基线, 确保实验环境
的一致性与结果的可比性. 表 3 中, 加粗表示该任务的最佳结果, 括号内的数值表示相对于基线 RoAR†的提升, ↑
表示数值越高越好.
表 3 模型在下游任务上的性能对比 (%)
词元分类 序列分类
模型
旋律识别↑ 力度预测↑ 作曲家分类↑ 情感分类↑ 流派分类↑
MidiGPT [29] - - - 61.88 -
RNN [13] 88.66 43.77 60.32 54.13 -
MidiBERT [13] 96.37 51.63 78.57 67.89 61.49
MT-MidiGPT [32] - - - 66.95 -
MT-MidiBERT [32] - - - 69.97 -
OM-MIDI-BERT [33] 97.87 53.42 75.40 68.81 -
RoAR [20] 97.59 53.73 80.95 76.15 -
RoAR† 97.05 53.21 79.37 75.23 64.49
CNN-Midiformer 97.43 (0.38) 53.42 (0.21) 86.51 (7.14) 79.82 (4.59) 68.46 (3.97)
在旋律识别与力度预测两项任务中, CNN-Midiformer 相较于 RoAR† 分别实现了 0.38 和 0.21 个百分点的提
升. 尽管提升幅度有限, 但在高基线水平下依然具备显著意义. 旋律识别任务中, RoAR† 已达到 97.05% 的高准确
率, 几乎贴近饱和状态; CNN-Midiformer 通过音乐知识特征与序列特征的融合, 虽未大幅突破该瓶颈, 却在细微旋
律走向与跨拍依赖处理中展现了稳定的泛化能力. 在力度预测任务中, 模型对音符强弱动态的建模能力得到进一
步提升. NLTM 对节奏律动的量化表示以及 CNN 对时值结构化特征的有效表征, 为模型提供了超出自注意力机
制的额外力度感知, 从而更有效地捕捉力度随时间的细微变化.
在作曲家分类、情感分类和流派分类这 3 项任务中, 模型均取得了显著性能提升, 提升幅度分别达到了 7.14、
4.59 和 3.97 个百分点. 这一现象表明, 结构化音乐知识在区分作曲家风格、情感表达和音乐流派方面具有重要作
用. 在作曲家分类任务中, PCTM 有效刻画了不同创作者在旋律进行过程中的音高偏好, 这些偏好体现了作曲家的
个性化写作习惯; 将 CNN 提取的 PCTM 特征与 Transformer 的全局语义信息融合后, 模型能够敏锐地捕获那些仅
靠线性序列难以辨识的个性化风格标志 [34] . 在情感分类任务中, NLTM 所体现的节奏密度与“激发度”等情感维度
密切相关 [35] , 使模型能够获得更强的情感判别能力. 在流派分类任务中, CNN-Midiformer 在涵盖 18 个不同音乐流

