Page 34 - 《软件学报》2026年第5期
P. 34

韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统                                                     1913


                    ● 发现  3: 如表  6、表  7  所示, 在双人场景中, 采用   1–4  位说话人数据训练的“4      人模型”在测试结果上同样符合
                 训练方法设计的预期. 从最终结果来看, 模型的表现相比“双人模型”略差, 但仍相当接近.
                    分析: 经过加权     SFT  的  4  人模型在判别说话人的能力上优于不加权            SFT  的模型, 语音识别能力相比不加权
                 SFT  的模型稍差; 经过    GRPO  强化学习阶段后, 两项能力均获得进一步提升, 这些现象和双人模型的测试结果展
                 示了相同的趋势, 符合训练方法的设计思路. 相比双人模型, 4                 人模型在双人测试集上的表现略差, 这归因于训练-
                 测试分布的不匹配. 在强化学习阶段, 本研究对模型进行了以                   4  人对话为主的联合奖励优化, 而在双人对话测试
                 中, 其优化策略可能对多说话人交互模式产生了过拟合, 从而降低了模型在双人场景下对对话轮次与说话人切换
                 的敏感度, 导致性能的略微下降. 这与强化学习中常见的“分布外泛化                     (out-of-distribution, OOD)” [30,31] 问题相契合:
                 当  RL  策略在测试时遭遇与训练环境显著不同的输入分布, 会因价值估计或策略执行的偏移而导致性能退化.
                    ● 发现  4: 如表  7  所示, 在  THCHS-30  测试集  (人工场景) 中, 未使用加权交叉熵的监督学习模型尽管实现了近
                 乎完美的语音识别       (CER=0), 却因对第  3、第  4  说话人的大量误检导致 ∆cp       和∆SA  暴增; 引入说话人加权损失后,
                 ∆cp  与∆SA  大幅下降至  1.68%  和  4.95%, 且经  GRPO  后∆SA  进一步优化至  4.04%, 同样符合预期.
                    分析: 人工合成数据的对话结构简单且无环境噪声和重叠语音, 常规模型微调足以优化文本生成, 但对说话人
                 归属缺乏区分信号, 错误地将训练数据中分布较大的第                   3、第  4  说话人标签直接应用于只有两位说话人的场景,
                 导致模型识别出多余的说话人. 说话人加权损失通过专门放大稀有的说话人标签                           token  的误差, 提供了额外的判
                 别监督, 有效缓解了此问题. GRPO        阶段的指标提升也进一步印证了强化学习方法的适用性.
                    综上所述, 双说话人场景下的实验结果验证了两阶段训练策略的合理性: 监督学习阶段通过加权损失为说话
                 人归属提供强化信号, GRPO       强化学习阶段则借助联合奖励函数突破监督学习瓶颈, 实现对语音识别与说话人归
                 属能力的全面优化. 相比       3  个基线模型, 训练后的      Qwen2-Audio  模型不仅在指标上大幅领先, 其转录的语句也具
                 有更好的可读性, 这归功于音频-语言模型出色的下游任务泛化能力和                      Qwen2  系列大语言模型基座优秀的自然语
                 言交互能力.
                  4.2   4  人场景测试
                    ● 发现  5: 如表  8、表  9  所示, 在四说话人真实会议场景中, 不加权的监督学习模型在判别说话人的能力上反
                 而优于加权模型与进一步经过强化学习的模型. 在此场景下, 我们提出的加权交叉熵策略不仅未能带来预期的能
                 力进步, 反而在指标上出现负提升.

                     表 8 AliMeeting  测试集  (4  人真实场景) (%)          表 9 AISHELL-4  测试集  (4  人真实场景) (%)

                     模型       ∆cp↓   ∆SA↓   Average↓  CER↓        模型       ∆cp↓   ∆SA↓   Average↓  CER↓
                   3D-Speaker  7.84  26.24   17.04   41.87      3D-Speaker  3.34  19.71   11.53    59.56
                   Sortformer  14.15  18.54  16.35   71.92      Sortformer  15.28  21.10  18.19    57.23
                   AssemblyAI  11.03  22.53  16.78   45.58      AssemblyAI  13.73  27.26  20.50    50.66
                   Microsoft  9.17   29.47   19.32   42.74       Microsoft  5.61  15.73   10.67    51.24
                    4人SFT     1.99   12.34    7.17   38.56       4人SFT      0.97  13.41    7.19    7.17
                  4人加权SFT     3.88   15.60    9.74   36.41      4人加权SFT     4.24  14.60    9.42    7.63
                   +4人GRPO    2.61   14.69    8.65   34.74      +4人GRPO     2.73  14.09    8.41    6.75

                    分析: 此现象揭示了当前方法在处理高复杂度声学场景时的局限性. 从双人到                         4  人, 任务难度并非线性增加,
                 多人会议录音中急剧增多的语音重叠、更相似的说话人音色以及更复杂的轮转模式, 都对模型的声学建模能力提
                 出极大的挑战. 尽管常规        SFT  模型相比基线仍有较大优势, 但部分输出已出现较为明显的说话人归属混乱现象.
                 在这种高压环境下, 我们为双人场景设计的加权策略反而成为梯度噪声源, 干扰了模型对核心声学信息的学习, 造
                 成了严重的多任务负迁移.
                    对更多说话人场景的适应性推断: 基于             4  人场景的实验结果, 我们可以合理推断, 直接将本方法应用于更多说
                 话人  (如  5  人以上) 的场景是困难的. 任务复杂度的进一步提升可能彻底压垮当前仍较为粗糙的训练框架. 未来的
                 研究既需要探索全新的范式, 也要聚焦于对现有框架的细致优化. 例如, 只精细地依靠音频模态信息可能已不足以
   29   30   31   32   33   34   35   36   37   38   39