Page 29 - 《软件学报》2026年第5期
P. 29
1908 软件学报 2026 年第 37 卷第 5 期
签的转写”这一复杂指令, 并按照指定格式输出文本. 具体而言, 用于训练的问答对数据采用多种自然语言提示的
形式, 例如“音频中有多位说话人在交谈, 请将每个人的发言区分开, 并为他们各自生成文字记录”, 并附上对应的
使用标准作答格式的输出, 例如“speaker1: … speaker2: …”.
然而, 常规的交叉熵损失函数在计算损失时对所有 token 一视同仁, 缺乏对稀有的说话人标签 token 的额外关
注. 说话人标签 token (数字“1”“2”…) 在整个文本序列中仅占极小比例, 例如, 对于一个正确的说话人序列“speaker1→
2→1→3”, 若模型误识别为“speaker1→2→3→1”, 则序列中仅有两个 token 的归属发生错误, 而整个文本序列可能
有上百个 token. 因此, 模型在输出错误的说话人顺序时, 受到的梯度惩罚可能不足以纠正说话人标签的归属. 标准
交叉熵损失主要聚焦于词文本身的识别错误, 而对说话人标签置换的惩罚较弱, 更适合在不需要输出说话人标签
的单说话人自动语音识别模型中充当损失函数, 不适用于多说话人场景.
为此, 本研究在标准交叉熵损失的基础上, 在真实标签序列中提取出所有代表说话人标签的 token 的位置. 根
据模型生成的 logits 计算损失时, 对这些位置的 logits 额外计算它们与真实标签之间的交叉熵损失, 得到新的训练
目标:
(1)
L total = L CE +k×L spk
其中, L CE 代表标准的交叉熵损失, L spk 代表仅针对说话人标签 token 位置计算的“说话人损失”, 而 k 是一个用于调
节两者权重的超参数.
这种加权策略与多任务学习中对不平衡类别进行加权的做法具有一致性. 例如, 在多语种或低资源 ASR 领
域, 为提升少数语种的识别性能, Piñeiro-Martin 等人 [20] 通过语言权重交叉熵显著降低了低资源语言的错误率, 证
明对稀有类别添加的额外惩罚能有效缓解类别不平衡问题. 同样, 在端到端说话人切换检测任务中, Khare 等人 [21]
针对“说话人发生改变”与“说话人未发生改变”类别的严重不平衡, 也采用了加权交叉熵的方法提高说话人切换检
测准确率, 同样验证了加权策略对稀有标签学习的有效性. 此外, 多任务联合训练的经验也表明, 当各子任务的损
失通过系数进行灵活调节时, 模型能够在保持主任务性能的同时兼顾辅助任务指标. 例如, Kumar 等人 [22] 将自动
语音识别与说话人切换检测的损失线性组合后, 能在不额外增加模型复杂度的情况下实现任务间互补, 优化收敛
速度与最终性能.
在训练过程中, 超参数 k 的取值既不宜过小, 以免说话人损失 L spk 提供的监督信号过于弱; 也不宜过大, 以免
任务过度偏向说话人标签预测而损害语音识别的精度. 本文在第 4.3 节“消融实验”中展示了超参数 k 对实验结果
k
的影响, 并介绍了如何设定合适的 k 值. 合理调节超参数 后, 模型被期望获得更强的说话人归属判断的能力, 为
后续强化学习阶段的进一步精细优化奠定了基础.
2.2 第 2 阶段: 基于 GRPO 算法的强化学习
在完成监督学习阶段的基础能力预热后, 本研究进一步引入基于强化学习的训练方法, 以突破模型在语音识
别任务和判断说话人归属任务上的性能瓶颈. 近期研究 [23] 表明, 音频-语言模型如果仅靠监督微调, 在数据足够丰
富时常会陷入性能平台期, 而基于策略梯度的 RL 方法则能够通过直接对离散指标进行优化, 进一步提升模型性
能. 也有研究表明 [24] , 在语音识别领域, 通过基于人类反馈的强化学习 (reinforcement learning from human feedback,
RLHF) 或直接的策略优化, 模型在适应病态语音或新领域时获得了显著增益, 表明 RL 对语音识别模型适配任务
具有良好效果.
本研究选择了 GRPO 算法来替代直接偏好优化 (direct preference optimization, DPO) 、近端策略优化 (proximal
[25]
policy optimization, PPO) [26] 等强化学习算法. 多说话人日志任务的核心在于同时优化语音识别与说话人归属两大
能力, 相较于传统的强化学习算法, GRPO 天然支持多响应生成与多指标联合奖励: 只需在奖励函数中完成对优化
目标的定义, 训练时对生成的每条候选回复计算综合奖励, 就可以直接在策略梯度中隐式平衡各指标. 比起需要专
门收集偏好数据的 DPO 流程, GRPO 无需额外组织正负样本对; 而与 PPO 相比, GRPO 以用户自定义的奖励函数
替代了价值网络, 从而提供了一条更为简洁的训练路径.
GRPO 算法内部使用群体相对的方式计算优势, 如公式 (2) 所示, 定义响应的优势函数为:

