Page 33 - 《软件学报》2026年第5期
P. 33
1912 软件学报 2026 年第 37 卷第 5 期
4.1 双人场景测试
● 发现 1: 如表 6 所示, 在 MagicData-RAMC 测试集 (真实场景) 中通过监督学习与后续的 GRPO 强化学习, 采用
一位、两位说话人数据训练的“双人模型”在语音识别 (CER) 和判断说话人归属 (∆cp、∆SA) 两项能力上均优于所有
基线模型. 说话人权重的引入能提升归属准确度, 以可接受的 CER 回升为代价; GRPO 强化学习阶段同步提升两项性能.
表 6 MagicData-RAMC 测试集 (双人真实场景) (%)
模型 ∆cp↓ ∆SA↓ Average↓ CER↓ 方法类型
3D-Speaker 8.66 27.58 18.12 14.88 流水线-开源
Sortformer 7.68 25.80 16.74 25.27 时域端到端-开源
AssemblyAI 17.61 28.51 23.06 20.22 API-闭源
Microsoft 8.68 22.46 15.57 14.36 API-闭源
双人SFT 2.83 5.81 4.32 10.98 ALM-SFT
双人加权SFT 2.57 5.63 4.10 12.29 ALM-加权SFT
+双人GRPO 1.94 3.55 2.75 10.61 ALM-加权SFT+RL
4人SFT 2.82 4.91 3.87 13.64 ALM-SFT
4人加权SFT 2.55 4.51 3.53 13.91 ALM-加权SFT
+4人GRPO 2.26 4.26 3.26 13.36 ALM-加权SFT+RL
分析: 即便在监督微调中不加入“说话人损失”, 模型的语音识别能力与判断说话人归属的能力已经较为优秀,
高于基线模型; 引入说话人损失后, 尽管代表语音识别错误的 CER 相比常规 SFT 模型略增, 但加权策略为稀疏的
说话人标签提供了强化信号, 使∆cp 与∆SA 进一步下降, 实现了优化目标之间的权衡; 最终经过 GRPO 强化学习阶
段, 模型不仅在∆cp 与∆SA 达到了最低水平, 其 CER 也恢复至与未加权 SFT 模型相当的水平, 甚至略有提升, 这表
明策略梯度优化在突破监督学习瓶颈方面具有明显优势.
● 发现 2: 如表 7 所示, 在 THCHS-30 测试集 (人工场景) 中, 不引入说话人权重的监督学习模型在说话人归属
相关的指标∆cp 与∆SA 上均达到 0.00, CER 也几乎为 0. 这表明模型在该数据集上已达到性能上限. 而后续的加权
SFT 和 GRPO 阶段反而导致了性能的轻微下降.
表 7 THCHS-30 测试集 (双人人工场景) (%)
模型 ∆cp↓ ∆SA↓ Average↓ CER↓ 方法类型
3D-Speaker 2.74 4.03 3.39 9.47 流水线-开源
Sortformer 1.83 4.24 3.04 18.64 时域端到端-开源
AssemblyAI 6.50 7.32 6.91 15.03 API-闭源
Microsoft 9.94 13.54 11.74 8.42 API-闭源
双人SFT 0.00 0.00 0.00 0.03 ALM-SFT
双人加权SFT 0.26 0.26 0.26 0.33 ALM-加权SFT
+双人GRPO 0.54 0.54 0.54 0.68 ALM-加权SFT+RL
4人SFT 11.27 66.43 38.85 0.00 ALM-SFT
4人加权SFT 1.68 4.95 3.32 0.12 ALM-加权SFT
+4人GRPO 1.68 4.04 2.86 0.12 ALM-加权SFT+RL
分析: 这一“零错误”现象并非由评估方式导致, 而是在该特定数据集上模型能力与任务难度共同作用的结果.
THCHS-30 人工数据由纯净的单人朗读语音拼接而成, 完全不含真实场景中的背景噪声和语音重叠, 这极大地降
低了声学分离和语音识别的难度. Qwen2-Audio 面对如此理想化的任务游刃有余, 因此标准 SFT 足以使其达到“性
能天花板”. 在这种近乎饱和的状态下, 任何对辅助任务 (如强化说话人标签学习) 的额外干预, 都可能引入不必要
的梯度噪声, 从而轻微损害已经接近完美的整体表现, 这与多任务学习中的经验相符. 这一结果也反衬出在
MagicData-RAMC 等真实场景数据集上进行测试的必要性.

