Page 28 - 《软件学报》2026年第5期
P. 28

韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统                                                     1907


                 与初始的转录文本质量高度相关, 泛化能力也有待进一步验证.
                  1.5   本研究相比现有方案的优势
                    基于音频-语言模型的端到端说话人日志系统, 在错误累积抑制、表示与泛化能力、内置语言建模和多任务
                 交互扩展等方面, 相比现有方案具备如下几方面优势.
                    (1) 相比“语音分离+ASR”或“分段+聚类+ASR”的非端到端模块化系统, 音频-语言模型端到端地将音频输入映
                 射至带有说话人标签的文本输出, 消除了中间模块误差累积的问题. 文献                       [19] 表明, 在级联系统中, 早期阶段产生
                 的错误会持续传递至后续模块, 并在最终结果中被放大, 使系统难以获得全局最优解; 而端到端方法因其统一的优
                 化目标, 可有效降低这种误差传播带来的性能下降. 同时, 音频-语言模型的端到端特性也减少了各模块之间参数
                 调优的开销, 简化了工程实施难度.
                    (2) 与现有端到端 SA-ASR 系统相比, 音频-语言模型提供了更通用的表示空间与更强大的任务迁移能力. 通
                 过融合大规模预训练的文本与音频知识, 它能够在同一架构下同时处理不同人数、不同任务                               (如转录、翻译、摘
                 要等), 在跨任务泛化上具备优势. 这种统一的多模态表征不仅提高了判断说话人归属的准确性, 也增强了模型对
                 复杂语义和上下文的理解能力.
                    (3) 音频-语言模型天然地内置语言模型的功能, 将语言建模与声学建模融为一体, 避免了现有系统在完成文
                 本转录后再使用大语言模型进行后处理的繁琐流程. 音频-语言模型在生成阶段即可考虑全局语义一致性和说话
                 人风格, 从而输出更加连贯、符合语言习惯的多说话人转录结果.
                    (4) 此外, 音频-语言模型具备广泛的交互和多任务扩展能力, 不仅能完成说话人日志的单一任务, 还能按照自
                 然语言指令执行一系列下游操作            (如关键词提取、情感分析等). 现有的“专一型”模型仅限于输出“说话人标签+文
                 本转录结果”, 而音频-语言模型则可在同一模型中通过不同的                  prompt 实现定制化的人机交互, 真正做到了从“听懂”
                 到“理解再处理”的转变. 这一优势为未来构建智慧会议助手或多模态语音助理奠定了基础.

                  2   训练方法

                    说话人日志任务可以拆解为两方面的能力需求: 其一是模型语音识别的能力, 其二是模型判断说话人归属的
                 能力  (即为转录文本打上准确的说话人标签, 例如“speaker1”“speaker2”的能力). 本研究设计的两阶段训练框架围
                 绕这两项能力如何提升、如何权衡展开.
                    模型的训练流程如图        2  所示. 在训练的第    1  阶段, 本研究使用监督学习对        Qwen2-Audio  进行指令微调, 让模
                 型学会指定的作答格式, 并初步具备判别说话人的能力; 为了适应说话人日志任务, 损失函数采用加权交叉熵损
                 失, 以强化模型对说话人标签         token  的学习, 从而平衡语音识别与说话人判别的能力.

                    SFT 阶段训练                                   RL 阶段训练
                                             total = CE +k× spk
                                                                                       r i =2−cpCER−SA-CER
                                  计算加权交叉熵损失       更新模型                  使用 GRPO 算法   为每条候选输出计算奖励
                                                                           更新模型
                  Q-A 对
                                                                                          speaker1: xxx
                  Question: 说话人音频+prompt                                                  speaker2: xxx
                  Answer: 带说话人标签的转录文本
                                            Qwen2-Audio           SFT 输出模型                为同一输入
                                                                                        生成 N 个候选输出
                                                 图 2 两阶段训练流程示意图

                    在随后的第     2  阶段训练中, 本研究在      SFT  模型的基础上引入基于        GRPO  算法的强化学习策略, 使用联合
                 cpCER  与  SA-CER  这两个综合指标的奖励函数, 实现模型语音识别能力与判别说话人归属能力的端到端协同提升.
                  2.1   第  1  阶段: 采用加权交叉熵损失的监督学习
                    如前文所述, Qwen2-Audio   模型在直接遵循复杂的日志任务指令时表现不佳. 因此, 在训练的第                      1  阶段, 本研
                 究基于指令式微调的思路构建训练数据, 旨在引导模型遵循“对输入音频进行多说话人区分, 并输出带有说话人标
   23   24   25   26   27   28   29   30   31   32   33