Page 30 - 《软件学报》2026年第5期
P. 30

韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统                                                     1909


                                                          r i −mean(r)
                                                      A i,t =                                         (2)
                                                            std(r)
                    在每个训练批次中, GRPO       对同一输入生成多条响应. 在公式            (2) 中,  r i  代表对第   条候选输出得到的奖励分
                                                                                   i
                                                        G
                 数, 而  r  是当前批次内所有候选输出的奖励集合           {r i } . 该函数通过将单个奖励与组内平均奖励进行比较并用标准
                                                        i=1
                 差归一化, 来计算其相对优势.
                    奖励函数的设计是使用         GRPO  算法进行强化学习训练的核心, 也是方法创新之一, 可以定义多个奖励函数来
                 灵活地衡量不同的评价维度. 本研究将转录文本的质量、说话人归属判断的准确性、格式规范性等多种指标融入
                 奖励中. 在本任务中, 如公式       (3) 所示, 每条候选输出的奖励      r i  由联合评价指标构成:

                                                   r i = 2−cpCER−SA-CER                               (3)
                 其中, cpCER  为拼接最小置换字错误率, SA-CER        为说话人归属字错误率, 二者均为越低越好. 该奖励函数旨在同
                 时优化这两个负向指标. cpCER、SA-CER        是语音识别与说话人归属错误的综合性指标, 能同时反映模型的语音识
                 别能力与说话人归属能力, 与说话人日志任务的优化目标高度契合. 本文第                       3.2  节“评价指标”会同实验的测试指标
                 一起, 简要介绍这两个指标.
                    在策略优化阶段, GRPO      的目标是最大化批次级别的期望优势, 通过最小化以下目标:

                                             [                            ]
                                    J GRPO (θ) = E min(ρ t (θ)A t ,clip(ρ t (θ),1−ϵ,1+ϵ)A t ) −βKL[π θ ∥π ref ]  (4)
                 其中,  ρ t (θ) 为策略比值, 用于衡量当前需要优化的模型策略           π θ  与固定的参考模型策略     π ref  (在本研究中  π ref  固定为
                 SFT  阶段结束后的模型) 之间的差异;        A t  是   时刻的优势函数;   是用于裁剪策略比值的超参数, 以限制更新步长;
                                                                 ϵ
                                                  t
                 β 是  KL  散度项的权重系数, 以防止策略崩溃. GRPO        简化了价值估计并提高了多样化响应的利用效率.
                    在训练实施时, 本研究以经过加权           SFT  训练后的模型为基础继续进行强化学习训练, 结合                GRPO  目标与  KL
                 正则项, 保持与监督学习阶段优化目标的一致性; 同时, 通过                  GRPO  算法的小批量多响应机制收集组内奖励, 将
                 cpCER  与  SA-CER  的组内差异转化为增强学习信号, 在降低语音识别错误的同时进一步压低说话人归属的错误.
                 整个训练流程借鉴了       RL  强化  LLM  的成功经验   [27] , 并融合了端到端多模态对话系统的优化策略, 以期模型在中文
                 多说话人日志场景中获得最佳综合性能.
                  3   实验设置

                  3.1   基座模型与对比基线
                    本研究选用     Qwen2-Audio-7B-Instruct 作为端到端说话人日志系统的基座模型. 音频-语言模型             Qwen2-Audio-
                 7B  基于  Qwen2-7B  大语言模型, 它在预训练阶段加入音频编码器, 将            16 kHz 的语音特征映射到与语言模型共享
                 的表示空间. 这样, 整个模型既保留了大语言模型的自然语言理解能力, 又具备音频编码器带来的声学建模能力,
                 因此音频-语言模型无需再外挂额外的语音识别模块或声道分离模块, 就可以在自回归解码器中直接生成带有说
                 话人标签的文本响应.
                    为了评估本方法的提升幅度, 本研究选择开源社区                 ModelScope 的“说话人日志”板块中下载量最高的模型, 即
                 “3D-Speaker”系列中的说话人日志模型       (后文简称为    3D-Speaker 模型) 作为对比的基线. 截至      2025  年  4  月, 此模型
                 的下载量达    390k  次, 被各团队广泛使用. 3D-Speaker 模型由语音端点检测模型、说话人确认模型、说话人转换点
                 定位模型、语音识别模型这          4  个组件串联而成, 提供了完整的说话人日志流水线, 在多个公开基准上展现了稳健
                 的  DER  表现.
                    同时, 我们引入了      NVIDIA NeMo  工具集中的    Diar Sortformer (4spk, V1)  [28] 模型作为另一重要的开源基线.
                 Sortformer 是一种时域端到端的说话人日志模型, 输出带说话人标签的起止时间戳. 这种方法虽然在日志任务本身
                 上是端到端的, 但仍需一个独立的            ASR  模块来完成最终的文本转录. 因此, 在本研究的基线实现中, 我们将
                 Sortformer 的输出结果与   Paraformer-large [29] 中文离线  ASR  模型相结合, 构成一个完整的“时域端到端+ASR”流水
                 线. 这一基线代表了另一条先进的、与本研究不同的技术路线.
   25   26   27   28   29   30   31   32   33   34   35