Page 33 - 《软件学报》2026年第5期
P. 33

1912                                                       软件学报  2026  年第  37  卷第  5  期


                  4.1   双人场景测试
                    ● 发现  1: 如表  6 所示, 在  MagicData-RAMC  测试集  (真实场景) 中通过监督学习与后续的       GRPO  强化学习, 采用
                 一位、两位说话人数据训练的“双人模型”在语音识别                 (CER) 和判断说话人归属     (∆cp、∆SA) 两项能力上均优于所有
                 基线模型. 说话人权重的引入能提升归属准确度, 以可接受的                CER  回升为代价; GRPO  强化学习阶段同步提升两项性能.

                                        表 6 MagicData-RAMC  测试集   (双人真实场景) (%)

                               模型         ∆cp↓      ∆SA↓     Average↓   CER↓        方法类型
                            3D-Speaker    8.66      27.58     18.12      14.88     流水线-开源
                             Sortformer   7.68      25.80     16.74      25.27   时域端到端-开源
                            AssemblyAI    17.61     28.51     23.06      20.22      API-闭源
                             Microsoft    8.68      22.46     15.57      14.36      API-闭源
                             双人SFT        2.83      5.81      4.32       10.98      ALM-SFT
                            双人加权SFT       2.57      5.63      4.10       12.29    ALM-加权SFT
                            +双人GRPO       1.94      3.55      2.75       10.61   ALM-加权SFT+RL
                              4人SFT       2.82      4.91      3.87       13.64      ALM-SFT
                            4人加权SFT       2.55      4.51      3.53       13.91    ALM-加权SFT
                             +4人GRPO      2.26      4.26      3.26       13.36   ALM-加权SFT+RL

                    分析: 即便在监督微调中不加入“说话人损失”, 模型的语音识别能力与判断说话人归属的能力已经较为优秀,
                 高于基线模型; 引入说话人损失后, 尽管代表语音识别错误的                   CER  相比常规  SFT  模型略增, 但加权策略为稀疏的
                 说话人标签提供了强化信号, 使∆cp         与∆SA  进一步下降, 实现了优化目标之间的权衡; 最终经过               GRPO  强化学习阶
                 段, 模型不仅在∆cp    与∆SA  达到了最低水平, 其     CER  也恢复至与未加权      SFT  模型相当的水平, 甚至略有提升, 这表
                 明策略梯度优化在突破监督学习瓶颈方面具有明显优势.
                    ● 发现  2: 如表  7  所示, 在  THCHS-30  测试集  (人工场景) 中, 不引入说话人权重的监督学习模型在说话人归属
                 相关的指标∆cp    与∆SA  上均达到   0.00, CER  也几乎为  0. 这表明模型在该数据集上已达到性能上限. 而后续的加权
                 SFT  和  GRPO  阶段反而导致了性能的轻微下降.

                                           表 7 THCHS-30  测试集   (双人人工场景) (%)

                               模型         ∆cp↓      ∆SA↓     Average↓   CER↓        方法类型
                            3D-Speaker    2.74      4.03      3.39       9.47      流水线-开源
                             Sortformer   1.83      4.24      3.04       18.64   时域端到端-开源
                            AssemblyAI    6.50      7.32      6.91       15.03      API-闭源
                             Microsoft    9.94      13.54     11.74      8.42       API-闭源
                             双人SFT        0.00      0.00      0.00       0.03       ALM-SFT
                            双人加权SFT       0.26      0.26      0.26       0.33     ALM-加权SFT
                            +双人GRPO       0.54      0.54      0.54       0.68    ALM-加权SFT+RL
                              4人SFT       11.27     66.43     38.85      0.00       ALM-SFT
                            4人加权SFT       1.68      4.95      3.32       0.12     ALM-加权SFT
                             +4人GRPO      1.68      4.04      2.86       0.12    ALM-加权SFT+RL

                    分析: 这一“零错误”现象并非由评估方式导致, 而是在该特定数据集上模型能力与任务难度共同作用的结果.
                 THCHS-30  人工数据由纯净的单人朗读语音拼接而成, 完全不含真实场景中的背景噪声和语音重叠, 这极大地降
                 低了声学分离和语音识别的难度. Qwen2-Audio          面对如此理想化的任务游刃有余, 因此标准             SFT  足以使其达到“性
                 能天花板”. 在这种近乎饱和的状态下, 任何对辅助任务                (如强化说话人标签学习) 的额外干预, 都可能引入不必要
                 的梯度噪声, 从而轻微损害已经接近完美的整体表现, 这与多任务学习中的经验相符. 这一结果也反衬出在
                 MagicData-RAMC  等真实场景数据集上进行测试的必要性.
   28   29   30   31   32   33   34   35   36   37   38