Page 20 - 《软件学报》2026年第5期
P. 20

黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解                                                    1899


                 优化的重要性.
                    移除  RoAR  位置编码   (w/o RoAR) 后, 模型在旋律识别与力度预测任务中准确率分别为                97.21%  与  53.73%, 作
                 曲家分类、情感分类和流派分类则为              80.95%、76.15%  和  66.82%, 整体性能较完整模型有所下降, 却依然超越
                 RoAR† 基线. 这说明   RoAR  在捕捉长距离时序依赖方面确有助益, 但结构化音乐知识特征的有效融合同样能够在
                 没有该位置编码的情况下取得显著增益, 展现了二者在补充和强化序列信息方面的互补特性.
                    在完全不进行预训练         (w/o pre-train) 的设置下, 各项任务的准确率出现显著滑坡: 旋律识别准确率下降至
                 91.30%, 力度预测性能下滑至 44.77%, 作曲家分类与情感分类任务的准确率也分别大幅跌至                        69.05%  和  65.14%.
                 这一结果凸显了预训练环节在学习通用音乐表示中的基础作用, 缺乏大规模数据的预训练, 模型难以形成对音乐
                 序列及其结构化特征的充分表征能力, 因而在多项下游任务中表现明显受限.
                    若仅微调分类头而冻结其余网络参数              (w/o fine-tune), 则性能也出现明显下滑, 旋律识别与力度预测分别降至
                 94.32%  与  45.79%, 作曲家分类与情感分类降至      58.73%  与  56.67%. 这一现象表明, 全模型微调对于适应具体下游
                 任务至关重要, 仅调整头部分类层无法充分利用预训练得到的序列与知识特征.
                    通过对上述消融实验的综合分析可以得到, 互补音乐特征提取模块、RoAR                        位置编码、预训练以及端到端微
                 调策略在不同层面共同支撑了           CNN-Midiformer 的卓越性能: 互补音乐特征提取模块与           RoAR  分别负责建模局部
                 结构和捕获全局依赖, 是模型性能提升的重要组成部分; 预训练阶段所学得的通用表示为下游任务奠定了稳健基
                 础; 而端到端的联合微调确保了结构化知识与序列表征在具体任务中的有效融合, 最终实现了模型性能的全面提升.
                    为进一步验证      CNN  参数配置对模型性能的影响, 本文对不同卷积核尺寸进行了对比实验. 结果显示, 3×3                       卷
                 积核在整体表现上更为稳定: 在力度预测任务中达到                   53.42%  的准确率, 相较于    5×5  核的  53.21%  和  7×7  核的
                 53.12%  均有提升. 值得注意的是, 尽管      5×5  卷积核在旋律识别任务上略占优势, 但在作曲家分类和情感分类等更
                 具挑战性的任务中, 3×3      卷积核表现更佳, 准确率分别达到 86.51%          和  79.82%. 这一结果表明, 合适的卷积核尺寸
                 对平衡多类型特征的表征具有重要意义: 小卷积核能够更有效地捕获局部音乐结构, 缓解大卷积核可能引入的过
                 度平滑问题, 从而保留更丰富的细粒度信息. 在流派分类任务中, 3×3                  卷积核同样取得了最高准确率            (68.46%), 进
                 一步验证了该参数配置在不同任务上的有效性与普适性.
                    表  6  展示的门控值统计进一步阐释了特征融合过程中不同层级对音乐知识融合的敏感度. 第                            2  层与第  11  层
                 的平均门控值分别达到         0.809 3  与  0.942 2, 显著高于中间层  (第  5  层  0.694 0, 第  8  层  0.699 6). 这一分层表现与
                 Transformer 编码器分层研究   [23] 的结论高度一致: 底层更侧重句法结构, 高层则贴近具体任务需求, 这表明, 在句法
                 主导阶段与决策输出阶段, 编码器分别处于句法结构构建与全局任务信息充分聚合的状态, 仅需适量引入音乐知
                 识即可与原有表示形成有效协同; 中间层则处于由句法向语义过渡、持续抽象任务要素的过程, 更依赖音乐知识
                 的深度融合, 以补充结构化的乐理知识, 增强中间表示的完备性.

                                                    表 6 各层门控值统计

                                              隐藏层编号                  门控均值
                                                 2                   0.809 3
                                                 5                   0.694 0
                                                 8                   0.699 6
                                                 11                  0.942 2

                    综上所述, 消融实验定量地分析验证了             CNN-Midiformer 中各组件与训练策略的设计必要性, 为进一步优化符
                 号音乐理解模型提供了清晰的理论支撑. 尽管模型在多项任务中取得了显著进展, 但仍存在音符密度偏差与标签
                 噪声场景下的性能瓶颈, 详细的失败案例分析与可视化结果参见附录                      A.

                  4   总 结

                    本文提出的     CNN-Midiformer 模型通过融合结构化音乐知识与符号序列信息, 实现了对结构化乐理知识与符
                 号序列表示的深度协同建模: 前者利用卷积神经网络提取旋律与节奏的局部构造规律, 后者基于交叉注意力机制
   15   16   17   18   19   20   21   22   23   24   25