Page 23 - 《软件学报》2026年第5期
P. 23

1902                                                       软件学报  2026  年第  37  卷第  5  期



                       错误样例 #4|真实标签: 高兴低激, 预测标签: 低兴低激                 错误样例 #0|真实标签: 强, 预测标签: 很强
                    音高                                          音高
                   G#1                                         A1
                    小节0 小节1 小节2 小节3 小节4 小节5 小节6 小节7 小节8 小节9 小节10 小节11  小节0     小节1             小节2
                                 时间 (16分音符/小节)                               时间 (16分音符/小节)
                            真实标签正确样例 #3|标签: 高兴低激                          真实标签正确样例 #1|标签: 强
                    音高                                          音高

                   G#1                                         G#1
                    小节0 小节1 小节2 小节3 小节4 小节5 小节6 小节7 小节8 小节9 小节10小节11 小节12 小节13  小节0  小节1       小节2
                                 时间 (16分音符/小节)                               时间 (16分音符/小节)
                            预测标签正确样例 #0|标签: 低兴低激                         预测标签正确样例 #1|标签: 很强

                    音高                                          音高
                   G#1                                         G#1
                    小节0  小节1  小节2  小节3  小节4  小节5  小节6  小节7  小节8  小节0           小节1             小节2
                                 时间 (16分音符/小节)                               时间 (16分音符/小节)
                                  (a) 任务: 情感分类                                (b) 任务: 力度预测
                                              图 A1 情感分类和力度预测失败案例

                  A.2   标签噪声
                    在力度预测任务的失败案例中           (图  A1(b)), 模型的错误预测并非源于特征抽取能力的不足, 而是训练数据中存
                 在的标签不一致问题. 具体表现为两条完全相同的音符序列在数据集中先后被人工标注为                              f (强) 和  ff (很强), 形成
                 了自相矛盾的监督信号. 这种标签冲突在模型训练过程中产生了复杂的负面影响: 模型在预训练阶段通过大规模
                 数据建立了相对稳定的音高-力度映射关系, 但在下游任务微调时同时接收到相互矛盾的标签信息, 导致端到端优
                 化过程无法收敛到唯一的决策边界.
                    在推理阶段, 模型面对这类边界模糊的样本时便倾向于在相邻类别间产生不确定性摇摆. 尽管互补特征提取
                 模块的   PCTM  经  CNN  提炼后能够正确捕获音高子结构信息, RoAR          位置编码也有效传递了全局时序依赖关系, 但
                 当监督信号本身存在不一致时, 即使互补音乐特征提取模块与序列编码器协同工作, 模型仍难以给出稳定一致的
                 预测结果. 值得注意的是, 类似的标签不一致现象不仅出现在力度预测任务中, 在旋律识别任务中也同样存在: 当
                 训练数据中的标注信号本身含有噪声时, 即便完整模型具备充分的学习能力, 也无法在相互矛盾的标签约束之间
                 找到唯一最优解.
                    综上所述, 音符密度偏差和标签噪声揭示了模型在处理异常数据分布和不一致标注时的明确局限性, 凸显了
                 高精度数据集对于提升模型性能的必要性. 未来的研究应侧重于开发能够降低这些局限性的方法, 例如改进特征
                 提取模块以减少对异常数据的敏感性, 以及采用数据清洗和标签校正技术以提高数据集的标注质量.

                 作者简介
                 黄恒焱, 本科生, CCF  学生会员, 主要研究领域为音频信号处理, 音乐人工智能, 自然语言处理.
                 邹逸, 博士生, 主要研究领域为音乐人工智能, 自然语言处理.
                 时乐轩, 本科生, 主要研究领域为数字音乐生态研究, 新技术与音乐传播的融合, 中华民族音乐的当代传播与国际化路径.
                 程皓楠, 博士, 研究员, 主要研究领域为音频信号处理, 有声文化计算.
                 叶龙, 博士, 教授, 博士生导师, CCF  专业会员, 主要研究领域为多模态学习, 音视频生成与鉴伪.
   18   19   20   21   22   23   24   25   26   27   28