Page 35 - 《软件学报》2026年第5期
P. 35
1914 软件学报 2026 年第 37 卷第 5 期
解决问题, 可以使用引入视觉模态信息 (如唇动、人脸位置) 的图文音全模态大模型 (omnimodal large language
model, OLLM); 亦或在当前框架下更精细地设计训练集, 并结合课程学习 (curriculum learning) 等策略, 让模型从
易到难逐步学习. 这在本文第 5.3 节和第 5.5 节中进行了更详细的讨论.
4.3 消融实验
本节通过 3 组消融实验, 在双人说话人场景下探讨了第 1 阶段监督学习中说话人权重 k 的作用, 以及第 2 阶
段强化学习对监督学习模型性能瓶颈的突破, 最终在分布外数据上验证了训练方法的合理性. 通过对比不同设置
下的 Δcp、ΔSA 与 CER, 消融实验验证了两阶段训练方法对模型能力的塑造效果, 并揭示了背后的机理与权衡.
k 产生的影响
(1) 说话人权重
在表 10 中, 当说话人损失权重 k 从 0 (不加权) 逐步增加至 4 时, 衡量说话人归属能力的 Δcp 与 ΔSA 呈现持续
下降趋势, 而反映语音识别能力的 CER 则出现轻微上升; 当 k 超过 4 时, Δcp 与 ΔSA 的下降趋势开始逆转, 不再进
一步降低.
表 10 消融实验: 说话人权重 k 的影响 (%)
模型 ∆cp↓ ∆SA↓ Average↓ CER↓
SFT, k=0 2.83 5.81 4.32 10.98
SFT, k=1 3.40 7.28 5.34 12.66
SFT, k=2 3.07 7.00 5.04 11.93
SFT, k=3 2.97 6.21 4.59 11.47
SFT, k=4 2.57 5.63 4.10 12.29
SFT, k=5 2.83 6.23 4.53 11.47
实验数据显示, 结果与方法设计的初始预期相符: 在序列到序列任务中, 少数类别 (说话人标签 token) 因出现
频率低, 往往被标准交叉熵淡化, 难以获得足够的梯度信号. 引入加权交叉熵, 通过对指定类别赋予更高的损失权
重, 可以有效缓解类别不平衡问题, 提升模型对重要但稀疏信息的敏感度. 具体而言, 本研究从 k = 1 开始, 尝试将
说话人标签 token 的梯度放大, 与多标签分类中为少数类加权的常用做法一致, 可获得对稀有但关键标签更强的
优化信号. 随着权重 k 增加到 4, 模型的 Δcp 从 2.83% 降至 2.57%, ΔSA 从 5.81% 降至 5.63%, 表明说话人归属能力
的提升; 同时, CER 从 10.98% 上升至 12.29%, 反映了将部分学习能力偏向说话人分类带来了语音识别能力的轻微
k 进一步增至 5, 归属指标未能继续下降, 说明过度加权会导致模型对文本流畅性关注不足. 综上所述, 本
退让. 当
实验揭示了加权策略在语音识别能力与说话人归属能力之间的性能权衡.
(2) GRPO 突破监督学习性能瓶颈
如表 11 所示, 在监督学习模型 ( k = 4) 的基础上, 继续使用 MagicData-RAMC 数据集进行监督微调 (抽取 5 000
条样本作为训练集) 难以使模型的性能获得进一步提升, 甚至在语音识别能力上略有下降; 相比之下, 使用相同的
训练集进行 GRPO 强化学习后, Δcp、ΔSA 与 CER 均获得显著的下降, 分别达 1.94%、3.55% 与 10.61%.
表 11 消融实验: GRPO 训练策略的有效性 (%)
模型 ∆cp↓ ∆SA↓ Average↓ CER↓
双人SFT 2.57 5.63 4.10 12.29
双人SFT+继续SFT训练 2.32 5.48 3.90 14.80
双人SFT+GRPO 1.94 3.55 2.75 10.61
由于监督学习目标为最大化似然, 对非可微指标 (如 cpCER、SA-CER) 难以直接优化, 常在数据丰富后陷入性能
瓶颈. 策略梯度方法则通过直接优化下游评价标准, 能够突破监督学习的性能极限. 在消融实验中, 继续进行监督学习
未能带来联合指标的有效提升, 这反映了监督目标与评测指标之间存在一定的目标错配; 而 GRPO 在奖励函数的直
接指导下, 实现了对语音识别与说话人归属两项能力的协同优化, 证明了第 2 阶段强化学习设计的必要性与有效性.
(3) 两阶段训练方法在分布外数据的泛化能力
为验证两阶段训练策略在分布外数据上的泛化能力, 本研究在 SeniorTalk 数据集上进行了消融实验. SeniorTalk

