Page 18 - 《软件学报》2026年第5期
P. 18

黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解                                                    1897



                                                    表 2 模型超参数设置

                                              超参数                         值
                                           最大序列长度                        512
                                             网络层数                         12
                                            隐藏层大小                        768
                                            注意力头数                         12
                                           权重衰减系数                        0.01
                                              优化器                       AdamW
                                              学习率                        2E–5
                                             批次大小                         12
                                             总参数量                        113M

                  3.3   模型性能对比
                    本节在旋律识别、力度预测、作曲家分类、情感分类和流派分类这                          5  项符号音乐理解基准任务上对比了
                 CNN-Midiformer 与当前多种先进模型的性能, 并分析了各模型在不同任务中表现提升的根本原因. 表                         3  列出了包
                 括非预训练的传统       RNN  模型、基于大规模预训练的          MidiBERT  与其改进版本以及引入改进位置编码的              RoAR
                 等模型在内的多种对照模型在上述任务上的准确率, 以                  RoAR† (本文复现的基线模型) 为对比基线, 确保实验环境
                 的一致性与结果的可比性. 表         3  中, 加粗表示该任务的最佳结果, 括号内的数值表示相对于基线                  RoAR†的提升, ↑
                 表示数值越高越好.

                                             表 3 模型在下游任务上的性能对比            (%)

                                              词元分类                              序列分类
                        模型
                                       旋律识别↑        力度预测↑         作曲家分类↑        情感分类↑         流派分类↑
                      MidiGPT [29]       -             -             -            61.88          -
                        RNN [13]        88.66         43.77         60.32         54.13          -
                      MidiBERT [13]     96.37         51.63         78.57         67.89         61.49
                     MT-MidiGPT [32]     -             -             -            66.95          -
                    MT-MidiBERT [32]     -             -             -            69.97          -
                    OM-MIDI-BERT [33]   97.87         53.42         75.40         68.81          -
                       RoAR [20]        97.59         53.73         80.95         76.15          -
                        RoAR†           97.05         53.21         79.37         75.23         64.49
                    CNN-Midiformer    97.43 (0.38)  53.42 (0.21)  86.51 (7.14)  79.82 (4.59)  68.46 (3.97)

                    在旋律识别与力度预测两项任务中, CNN-Midiformer 相较于             RoAR† 分别实现了     0.38  和  0.21  个百分点的提
                 升. 尽管提升幅度有限, 但在高基线水平下依然具备显著意义. 旋律识别任务中, RoAR† 已达到                         97.05%  的高准确
                 率, 几乎贴近饱和状态; CNN-Midiformer 通过音乐知识特征与序列特征的融合, 虽未大幅突破该瓶颈, 却在细微旋
                 律走向与跨拍依赖处理中展现了稳定的泛化能力. 在力度预测任务中, 模型对音符强弱动态的建模能力得到进一
                 步提升. NLTM   对节奏律动的量化表示以及          CNN  对时值结构化特征的有效表征, 为模型提供了超出自注意力机
                 制的额外力度感知, 从而更有效地捕捉力度随时间的细微变化.
                    在作曲家分类、情感分类和流派分类这              3  项任务中, 模型均取得了显著性能提升, 提升幅度分别达到了                 7.14、

                 4.59  和  3.97  个百分点. 这一现象表明, 结构化音乐知识在区分作曲家风格、情感表达和音乐流派方面具有重要作
                 用. 在作曲家分类任务中, PCTM       有效刻画了不同创作者在旋律进行过程中的音高偏好, 这些偏好体现了作曲家的
                 个性化写作习惯; 将      CNN  提取的  PCTM  特征与  Transformer 的全局语义信息融合后, 模型能够敏锐地捕获那些仅
                 靠线性序列难以辨识的个性化风格标志              [34] . 在情感分类任务中, NLTM   所体现的节奏密度与“激发度”等情感维度
                 密切相关   [35] , 使模型能够获得更强的情感判别能力. 在流派分类任务中, CNN-Midiformer 在涵盖              18  个不同音乐流
   13   14   15   16   17   18   19   20   21   22   23