Page 16 - 《软件学报》2026年第5期
P. 16

黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解                                                    1895


                    为动态地调控原始序列表示与这个知识增强表示的结合比例, 模块引入了门控机制. 对序列中的每个位置                                   i,
                 门控值的计算方法如下:

                                                              l
                                                    G i = σ(W ·[h : F ]+b )                           (9)
                                                              i
                                                                    g
                                                                 i
                                                           g
                       l
                 其中,  [h : F ] 表示原始隐藏状态和融合特征的拼接,         W  和  b  是可学习的参数,   σ 是  Sigmoid  激活函数.
                       i  i                               g   g
                    最终, 通过加权求和的方式将两者融合, 形成该              Transformer 编码器层的新隐藏状态:

                                                    ˆ l
                                                           l
                                                   h = G ⊙h +(1−G )⊙ F  i                            (10)
                                                           i
                                                                 i
                                                    i
                                                        i
                 其中,  ⊙ 表示元素级乘法.
                    这种逐层、动态、基于注意力和门控的融合策略, 使得音乐知识特征能够以序列上下文感知的方式自适应地
                 在  Transformer 编码器处理序列信息的不同阶段施加影响, 从而引导模型在理解序列依赖的同时, 也能充分利用音
                 乐的内在结构规律, 最终获得对符号音乐全面的理解.
                  2.4   训练对象
                    为确保本文提出的       CNN-Midiformer 模型有效结合音乐知识与符号序列信息, 并实现全面的音乐表示, 设计了
                 一种适当的训练策略. 该训练策略能够驱动模型的所有组件协同优化, 尤其确保                        CNN  提取的结构特征对符号音乐
                 理解任务具有明确的贡献.
                    本文设计的训练策略结合了掩码语言建模                (MLM) 和因果语言建模      (causal language modeling, CLM) 两种目
                 标, 通过端到端训练过程隐式优化卷积特征提取模块. 这种联合策略能够同时捕捉符号音乐序列中的双向上下文
                 依赖和单向时序依赖, 对模型理解音乐进行具有关键作用. 同时, 通过整体训练过程, 确保                         CNN  提取的音乐知识特
                 征有效地服务于序列理解任务.
                    目标  1: 掩码语言建模     (MLM). 受到  BERT  训练方法的启发, MLM     目标通过让模型重建序列中被掩盖的符号
                 来学习上下文相关的表示. 给定一个符号音乐序列                 S = {s , s ,..., s  }, 随机选择  15%  的符号进行掩码操作. 遵循
                                                             1  2   N+1
                 标准的掩码协议, 其中       80%  被替换为特殊的     [MASK] 标记, 10%  被替换为词汇表中随机选择的其他符号, 剩余
                 10%  保持不变  (以减少预训练和微调阶段之间的差异). 模型需要利用被掩盖位置之前和之后的上下文信息来预测
                 原始符号. MLM    的目标函数定义为:

                                                          ∑
                                                 L   (θ) = −  logP(S |S  ;θ)                         (11)
                                                  MLM             i  \M
                                                          S i ∈M
                 其中, M  代表被掩码符号索引的集合,         S  \M  是带有掩码位置的输入序列,      θ 代表模型的参数. 这种训练方式促使模型
                 学习序列内丰富的语义表示, 捕捉音高、时长以及小节拍、子节拍等元素之间复杂的关系.
                    目标  2: 因果语言建模     (CLM). 为了补充   MLM  的双向理解能力, 本文同时采用了类似于             GPT  的单向生成目
                 标. 在  CLM  任务中, 模型学习基于其之前的所有符号来预测当前位置的符号, 有效建模音乐从左到右的自然顺序.
                 对于序列   S  中的每个位置    i, 模型估计符号             S = {s , s ,..., s } 的条件概率. CLM  损失函数定义为序列
                                                  S i 基于前缀
                                                            <i  1  2   i−1
                 中所有符号的负对数似然之和:

                                                           N ∑
                                                  L  (θ) = −  logP(S |S ;θ)                          (12)
                                                   CLM            i  <i
                                                           i=1
                    该目标对于捕捉音乐的进行至关重要, 因为起奏时间、持续时间、力度变化等音符事件的时序关系是音乐连
                 贯性和表现力细微差别的基础.
                    联合训练与知识特征优化: 模型并非孤立地训练这两个目标, 而是在训练过程中交替执行                              MLM  和  CLM  任
                 务. 在计算  MLM  和  CLM  损失并进行反向传播时, 梯度不仅会更新            Transformer 编码器的参数, 还会通过音乐知识
                 自适应增强的特征融合模块回传到互补音乐特征提取模块. 虽然没有为互补音乐特征提取模块定义一个独立的损
                 失函数, 但其参数会根据其提取的音乐知识特征对提升                  MLM  和  CLM  任务性能的贡献程度而被优化. 这种端到端
                 的训练机制确保了       CNN  学习到的结构化知识表示是与序列理解任务高度相关的, 并且能够有效增强                        Transformer
                 编码器的表达能力. 总的训练损失定义为             MLM  和  CLM  损失之和:
   11   12   13   14   15   16   17   18   19   20   21