Page 16 - 《软件学报》2026年第5期
P. 16
黄恒焱 等: 融合音乐知识结构化表征的高精度符号音乐理解 1895
为动态地调控原始序列表示与这个知识增强表示的结合比例, 模块引入了门控机制. 对序列中的每个位置 i,
门控值的计算方法如下:
l
G i = σ(W ·[h : F ]+b ) (9)
i
g
i
g
l
其中, [h : F ] 表示原始隐藏状态和融合特征的拼接, W 和 b 是可学习的参数, σ 是 Sigmoid 激活函数.
i i g g
最终, 通过加权求和的方式将两者融合, 形成该 Transformer 编码器层的新隐藏状态:
ˆ l
l
h = G ⊙h +(1−G )⊙ F i (10)
i
i
i
i
其中, ⊙ 表示元素级乘法.
这种逐层、动态、基于注意力和门控的融合策略, 使得音乐知识特征能够以序列上下文感知的方式自适应地
在 Transformer 编码器处理序列信息的不同阶段施加影响, 从而引导模型在理解序列依赖的同时, 也能充分利用音
乐的内在结构规律, 最终获得对符号音乐全面的理解.
2.4 训练对象
为确保本文提出的 CNN-Midiformer 模型有效结合音乐知识与符号序列信息, 并实现全面的音乐表示, 设计了
一种适当的训练策略. 该训练策略能够驱动模型的所有组件协同优化, 尤其确保 CNN 提取的结构特征对符号音乐
理解任务具有明确的贡献.
本文设计的训练策略结合了掩码语言建模 (MLM) 和因果语言建模 (causal language modeling, CLM) 两种目
标, 通过端到端训练过程隐式优化卷积特征提取模块. 这种联合策略能够同时捕捉符号音乐序列中的双向上下文
依赖和单向时序依赖, 对模型理解音乐进行具有关键作用. 同时, 通过整体训练过程, 确保 CNN 提取的音乐知识特
征有效地服务于序列理解任务.
目标 1: 掩码语言建模 (MLM). 受到 BERT 训练方法的启发, MLM 目标通过让模型重建序列中被掩盖的符号
来学习上下文相关的表示. 给定一个符号音乐序列 S = {s , s ,..., s }, 随机选择 15% 的符号进行掩码操作. 遵循
1 2 N+1
标准的掩码协议, 其中 80% 被替换为特殊的 [MASK] 标记, 10% 被替换为词汇表中随机选择的其他符号, 剩余
10% 保持不变 (以减少预训练和微调阶段之间的差异). 模型需要利用被掩盖位置之前和之后的上下文信息来预测
原始符号. MLM 的目标函数定义为:
∑
L (θ) = − logP(S |S ;θ) (11)
MLM i \M
S i ∈M
其中, M 代表被掩码符号索引的集合, S \M 是带有掩码位置的输入序列, θ 代表模型的参数. 这种训练方式促使模型
学习序列内丰富的语义表示, 捕捉音高、时长以及小节拍、子节拍等元素之间复杂的关系.
目标 2: 因果语言建模 (CLM). 为了补充 MLM 的双向理解能力, 本文同时采用了类似于 GPT 的单向生成目
标. 在 CLM 任务中, 模型学习基于其之前的所有符号来预测当前位置的符号, 有效建模音乐从左到右的自然顺序.
对于序列 S 中的每个位置 i, 模型估计符号 S = {s , s ,..., s } 的条件概率. CLM 损失函数定义为序列
S i 基于前缀
<i 1 2 i−1
中所有符号的负对数似然之和:
N ∑
L (θ) = − logP(S |S ;θ) (12)
CLM i <i
i=1
该目标对于捕捉音乐的进行至关重要, 因为起奏时间、持续时间、力度变化等音符事件的时序关系是音乐连
贯性和表现力细微差别的基础.
联合训练与知识特征优化: 模型并非孤立地训练这两个目标, 而是在训练过程中交替执行 MLM 和 CLM 任
务. 在计算 MLM 和 CLM 损失并进行反向传播时, 梯度不仅会更新 Transformer 编码器的参数, 还会通过音乐知识
自适应增强的特征融合模块回传到互补音乐特征提取模块. 虽然没有为互补音乐特征提取模块定义一个独立的损
失函数, 但其参数会根据其提取的音乐知识特征对提升 MLM 和 CLM 任务性能的贡献程度而被优化. 这种端到端
的训练机制确保了 CNN 学习到的结构化知识表示是与序列理解任务高度相关的, 并且能够有效增强 Transformer
编码器的表达能力. 总的训练损失定义为 MLM 和 CLM 损失之和:

