Page 19 - 《软件学报》2026年第5期
P. 19
1898 软件学报 2026 年第 37 卷第 5 期
派、类别分布更为复杂的 ADL 数据集上仍取得了 3.97 个百分点的性能提升, 展示出其在跨风格任务中的优异泛
化能力. 总体而言, 通过互补音乐特征提取模块对节奏与律动的深层结构特征进行提炼, 与序列编码器融合后, 模
型构建了对情感标签和流派标签的精准映射, 推动了分类精度的显著提升.
除上述任务外, CNN-Midiformer 在对比非预训练 RNN 模型时亦体现出压倒性优势. RNN 模型在旋律识别与
力度预测上的准确率分别为 88.66% 和 43.77%, 远低于本文模型的 97.43% 和 53.42%, 凸显了大规模预训练与知
识融合的重要性. MidiBERT 及其变体在多个基准任务中的表现也落后于 CNN-Midiformer, 说明在符号音乐理解
领域, 仅依赖序列预训练而缺乏结构化乐理知识融合的模型在高难度任务中仍存在性能瓶颈.
综上所述, CNN-Midiformer 将通过数学建模的音乐知识特征与强大的自注意力序列编码器有机融合, 在 5 项
任务中均取得了对比模型无法比拟的性能优势, 使模型能够同时兼顾局部结构与全局依赖. 在作曲家分类、音乐
情感分类和流派分类这 3 项高度依赖结构信息的任务上, 知识特征的有效应用显著扩展了模型的判别能力, 验证
了模型在不同音乐风格和任务场景中的通用性.
3.4 消融实验
为量化各模块与训练策略对 CNN‑Midiformer 性能贡献, 本文进行系列消融实验. 结果如表 4 所示, 互补音乐
特征提取模块、RoAR 位置编码、预训练与端到端微调策略在不同层面共同决定了模型的卓越性能, 并结合
CNN 核尺寸对性能的影响分析 (表 5) 进行了系统验证. 表 4 和表 5 中, 加粗表示该任务的最佳结果, ↑表示数值越
高越好.
表 4 模型消融实验结果汇总 (%)
词元分类 序列分类
模型
旋律识别↑ 力度预测↑ 作曲家分类↑ 情感分类↑ 流派分类↑
RoAR† 97.05 53.21 79.37 75.23 64.49
Full model 97.43 53.42 86.51 79.82 68.46
fine-tune w/o CNN 97.17 53.10 84.13 77.06 66.28
w/o CNN 97.05 53.21 79.37 75.23 64.49
w/o RoAR 97.21 53.73 80.95 76.15 66.82
w/o fine-tune 91.30 44.77 69.05 65.14 -
w/o pre-train 94.32 45.79 58.73 56.67 -
表 5 互补特征提取模块核尺寸对性能的影响 (%)
词元分类 序列分类
模型
旋律识别↑ 力度预测↑ 作曲家分类↑ 情感分类↑ 流派分类↑
RoAR† 97.05 53.21 79.37 75.23 64.49
Kernel 3×3 (Full model) 97.43 53.42 86.51 79.82 68.46
fine-tune w/o CNN 97.17 53.10 84.13 77.06 66.28
Kernel 5×5 97.46 53.21 81.75 71.56 68.15
Kernel 7×7 97.09 53.12 83.33 66.97 64.41
当完全移除互补音乐特征提取模块 (w/o CNN) 时, 模型在所有 5 项任务上的表现均回落至 RoAR 基线水平,
旋律识别与力度预测准确率分别降至 97.05% 与 53.21%, 作曲家分类、情感分类和流派分类降至 79.37%、75.23%
和 64.49%. 这一现象表明, CNN 对 PCTM 与 NLTM 所体现的局部结构信息的提炼在提升整体性能中发挥了关键
作用; 缺失音乐知识的融合后, 模型退化为仅依赖 Transformer 序列表示, 导致性能全面下降, 进一步验证了互补音
乐特征提取模块对整体性能提升的必要性.
仅在预训练阶段保留互补特征提取模块而在下游任务微调时移除 (fine-tune w/o CNN), 模型性能虽较完全移
除时有所提升, 但仍低于完整模型. 在旋律识别与力度预测任务中, 准确率分别降至 97.17% 与 53.10%, 而作曲家
分类、情感分类和流派分类则降至 84.13%、77.06% 和 66.28%. 这一结果表明, 预训练阶段学习的音乐知识特征
对后续任务具有持续影响, 但如果不在微调阶段继续利用这些结构化特征, 其效用将受到削弱, 体现了端到端联合

