Page 15 - 《软件学报》2026年第5期
P. 15

1894                                                       软件学报  2026  年第  37  卷第  5  期


                 隐藏层维度, 本模型为      768) 的向量:

                                                                    L
                                            z = W ·Dropout(σ(W · flatten(P )+b ))+b 2                 (5)
                                                2
                                                                        1
                                                            1
                       L
                 其中,  P  是最后池化层输出的特征图,         flatten 操作将其展平为一维向量,       W 、 W 、 、  b  是全连接层的参数,      σ
                                                                                  b
                                                                           1   2   1  2
                 是  ReLU  激活函数,  Dropout  操作用于随机丢弃训练参数, 避免模型过拟合.
                    最终, z 向量封装了音高和节奏的深层抽象表示, 用于与序列特征进一步融合.
                  2.3   音乐知识自适应增强的特征融合模块
                    音乐知识自适应增强的特征融合模块旨在将由                 CNN  提取的结构化音乐知识与         Transformer 编码器所捕获的
                 符号序列信息进行动态交互, 以实现语境相关的知识融合而非简单叠加. 该模块通过交叉注意力机制, 将音乐知识
                 特征作为查询, Transformer 编码器隐藏层的序列表示作为键和值, 计算注意力权重并据此生成知识增强表示, 使
                 模型能够根据每个符号在序列中的上下文动态提取最相关的音乐知识; 这一过程既避免了特征冗余, 又确保了知
                 识对序列语义的精确指导.
                    根据  Transformer 编码器分层研究结果, 低层编码器关注句法信息, 高层侧重语义信息, 中间层则具有较强的
                 任务灵活性    [23] . 结合这一研究结论, 该模块选择      Transformer 编码器的第  2、5、8、11  层进行特征融合, 涵盖句法
                 主导层   (低层)、语义过渡层      (中层)、任务专属层      (高层) 不同阶段, 在减少计算量的同时, 使音乐知识特征贯穿于
                 模型的“句法-语义-决策”全流程.
                    图  5  展示了音乐知识自适应增强的特征融合模块架构. 设第                  l 层的  Transformer 编码器隐藏状态为      H =
                                                                                                      l
                    l
                                                                       l
                                              l
                  l
                 {h ,h ,...,h l  }, 其中  N  是序列长度,  h  是特殊的  [CLS] 标记的表示,  h ,...,h l   是音乐序列,  z   为  CNN  提取的
                  1  2   N+1                  1                        2    N+1          CNN
                 知识特征向量. 在选定的       Transformer 编码器层中, 首先对隐藏状态与知识向量分别进行线性变换:

                                                      
                                                       Q = W ·z
                                                            Q  CNN
                                                      
                                                      
                                                      
                                                               l
                                                       K = W · H                                     (6)
                                                             K
                                                      
                                                      
                                                      
                                                               l
                                                        V = W · H
                                                             V
                 其中,  W 、 W 、 W  是线性变换矩阵. 注意力权重和融合输出计算如下:
                       Q   K    V
                                                                  
                                                                  T
                                                               Q· K 
                                                                  
                                                     A = Softmax   √                              (7)
                                                                  
                                                                 d
                                                                  K
                                                         F = A·V                                      (8)
                 其中, d K 是注意力机制的缩放因子        (隐藏层大小为     768, d K =768),  F  是特征融合结果.


                                                      音乐知识自适应增强的
                                                         特征融合模块
                                                             交叉注意力
                                       深层音乐知识特征
                                                               门控
                                                                         深层融合特征
                                       深层语义特征
                                            图 5 音乐知识自适应增强的特征融合模块

                    通过这种方式, 音乐知识特征能够关注序列表示中与其最相关的部分, 并根据这种相关性动态地从序列语境
                 中提取信息, 生成融合了序列信息的知识增强表示.
   10   11   12   13   14   15   16   17   18   19   20