Page 28 - 《软件学报》2026年第5期
P. 28
韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统 1907
与初始的转录文本质量高度相关, 泛化能力也有待进一步验证.
1.5 本研究相比现有方案的优势
基于音频-语言模型的端到端说话人日志系统, 在错误累积抑制、表示与泛化能力、内置语言建模和多任务
交互扩展等方面, 相比现有方案具备如下几方面优势.
(1) 相比“语音分离+ASR”或“分段+聚类+ASR”的非端到端模块化系统, 音频-语言模型端到端地将音频输入映
射至带有说话人标签的文本输出, 消除了中间模块误差累积的问题. 文献 [19] 表明, 在级联系统中, 早期阶段产生
的错误会持续传递至后续模块, 并在最终结果中被放大, 使系统难以获得全局最优解; 而端到端方法因其统一的优
化目标, 可有效降低这种误差传播带来的性能下降. 同时, 音频-语言模型的端到端特性也减少了各模块之间参数
调优的开销, 简化了工程实施难度.
(2) 与现有端到端 SA-ASR 系统相比, 音频-语言模型提供了更通用的表示空间与更强大的任务迁移能力. 通
过融合大规模预训练的文本与音频知识, 它能够在同一架构下同时处理不同人数、不同任务 (如转录、翻译、摘
要等), 在跨任务泛化上具备优势. 这种统一的多模态表征不仅提高了判断说话人归属的准确性, 也增强了模型对
复杂语义和上下文的理解能力.
(3) 音频-语言模型天然地内置语言模型的功能, 将语言建模与声学建模融为一体, 避免了现有系统在完成文
本转录后再使用大语言模型进行后处理的繁琐流程. 音频-语言模型在生成阶段即可考虑全局语义一致性和说话
人风格, 从而输出更加连贯、符合语言习惯的多说话人转录结果.
(4) 此外, 音频-语言模型具备广泛的交互和多任务扩展能力, 不仅能完成说话人日志的单一任务, 还能按照自
然语言指令执行一系列下游操作 (如关键词提取、情感分析等). 现有的“专一型”模型仅限于输出“说话人标签+文
本转录结果”, 而音频-语言模型则可在同一模型中通过不同的 prompt 实现定制化的人机交互, 真正做到了从“听懂”
到“理解再处理”的转变. 这一优势为未来构建智慧会议助手或多模态语音助理奠定了基础.
2 训练方法
说话人日志任务可以拆解为两方面的能力需求: 其一是模型语音识别的能力, 其二是模型判断说话人归属的
能力 (即为转录文本打上准确的说话人标签, 例如“speaker1”“speaker2”的能力). 本研究设计的两阶段训练框架围
绕这两项能力如何提升、如何权衡展开.
模型的训练流程如图 2 所示. 在训练的第 1 阶段, 本研究使用监督学习对 Qwen2-Audio 进行指令微调, 让模
型学会指定的作答格式, 并初步具备判别说话人的能力; 为了适应说话人日志任务, 损失函数采用加权交叉熵损
失, 以强化模型对说话人标签 token 的学习, 从而平衡语音识别与说话人判别的能力.
SFT 阶段训练 RL 阶段训练
total = CE +k× spk
r i =2−cpCER−SA-CER
计算加权交叉熵损失 更新模型 使用 GRPO 算法 为每条候选输出计算奖励
更新模型
Q-A 对
speaker1: xxx
Question: 说话人音频+prompt speaker2: xxx
Answer: 带说话人标签的转录文本
Qwen2-Audio SFT 输出模型 为同一输入
生成 N 个候选输出
图 2 两阶段训练流程示意图
在随后的第 2 阶段训练中, 本研究在 SFT 模型的基础上引入基于 GRPO 算法的强化学习策略, 使用联合
cpCER 与 SA-CER 这两个综合指标的奖励函数, 实现模型语音识别能力与判别说话人归属能力的端到端协同提升.
2.1 第 1 阶段: 采用加权交叉熵损失的监督学习
如前文所述, Qwen2-Audio 模型在直接遵循复杂的日志任务指令时表现不佳. 因此, 在训练的第 1 阶段, 本研
究基于指令式微调的思路构建训练数据, 旨在引导模型遵循“对输入音频进行多说话人区分, 并输出带有说话人标

