Page 30 - 《软件学报》2026年第5期
P. 30
韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统 1909
r i −mean(r)
A i,t = (2)
std(r)
在每个训练批次中, GRPO 对同一输入生成多条响应. 在公式 (2) 中, r i 代表对第 条候选输出得到的奖励分
i
G
数, 而 r 是当前批次内所有候选输出的奖励集合 {r i } . 该函数通过将单个奖励与组内平均奖励进行比较并用标准
i=1
差归一化, 来计算其相对优势.
奖励函数的设计是使用 GRPO 算法进行强化学习训练的核心, 也是方法创新之一, 可以定义多个奖励函数来
灵活地衡量不同的评价维度. 本研究将转录文本的质量、说话人归属判断的准确性、格式规范性等多种指标融入
奖励中. 在本任务中, 如公式 (3) 所示, 每条候选输出的奖励 r i 由联合评价指标构成:
r i = 2−cpCER−SA-CER (3)
其中, cpCER 为拼接最小置换字错误率, SA-CER 为说话人归属字错误率, 二者均为越低越好. 该奖励函数旨在同
时优化这两个负向指标. cpCER、SA-CER 是语音识别与说话人归属错误的综合性指标, 能同时反映模型的语音识
别能力与说话人归属能力, 与说话人日志任务的优化目标高度契合. 本文第 3.2 节“评价指标”会同实验的测试指标
一起, 简要介绍这两个指标.
在策略优化阶段, GRPO 的目标是最大化批次级别的期望优势, 通过最小化以下目标:
[ ]
J GRPO (θ) = E min(ρ t (θ)A t ,clip(ρ t (θ),1−ϵ,1+ϵ)A t ) −βKL[π θ ∥π ref ] (4)
其中, ρ t (θ) 为策略比值, 用于衡量当前需要优化的模型策略 π θ 与固定的参考模型策略 π ref (在本研究中 π ref 固定为
SFT 阶段结束后的模型) 之间的差异; A t 是 时刻的优势函数; 是用于裁剪策略比值的超参数, 以限制更新步长;
ϵ
t
β 是 KL 散度项的权重系数, 以防止策略崩溃. GRPO 简化了价值估计并提高了多样化响应的利用效率.
在训练实施时, 本研究以经过加权 SFT 训练后的模型为基础继续进行强化学习训练, 结合 GRPO 目标与 KL
正则项, 保持与监督学习阶段优化目标的一致性; 同时, 通过 GRPO 算法的小批量多响应机制收集组内奖励, 将
cpCER 与 SA-CER 的组内差异转化为增强学习信号, 在降低语音识别错误的同时进一步压低说话人归属的错误.
整个训练流程借鉴了 RL 强化 LLM 的成功经验 [27] , 并融合了端到端多模态对话系统的优化策略, 以期模型在中文
多说话人日志场景中获得最佳综合性能.
3 实验设置
3.1 基座模型与对比基线
本研究选用 Qwen2-Audio-7B-Instruct 作为端到端说话人日志系统的基座模型. 音频-语言模型 Qwen2-Audio-
7B 基于 Qwen2-7B 大语言模型, 它在预训练阶段加入音频编码器, 将 16 kHz 的语音特征映射到与语言模型共享
的表示空间. 这样, 整个模型既保留了大语言模型的自然语言理解能力, 又具备音频编码器带来的声学建模能力,
因此音频-语言模型无需再外挂额外的语音识别模块或声道分离模块, 就可以在自回归解码器中直接生成带有说
话人标签的文本响应.
为了评估本方法的提升幅度, 本研究选择开源社区 ModelScope 的“说话人日志”板块中下载量最高的模型, 即
“3D-Speaker”系列中的说话人日志模型 (后文简称为 3D-Speaker 模型) 作为对比的基线. 截至 2025 年 4 月, 此模型
的下载量达 390k 次, 被各团队广泛使用. 3D-Speaker 模型由语音端点检测模型、说话人确认模型、说话人转换点
定位模型、语音识别模型这 4 个组件串联而成, 提供了完整的说话人日志流水线, 在多个公开基准上展现了稳健
的 DER 表现.
同时, 我们引入了 NVIDIA NeMo 工具集中的 Diar Sortformer (4spk, V1) [28] 模型作为另一重要的开源基线.
Sortformer 是一种时域端到端的说话人日志模型, 输出带说话人标签的起止时间戳. 这种方法虽然在日志任务本身
上是端到端的, 但仍需一个独立的 ASR 模块来完成最终的文本转录. 因此, 在本研究的基线实现中, 我们将
Sortformer 的输出结果与 Paraformer-large [29] 中文离线 ASR 模型相结合, 构成一个完整的“时域端到端+ASR”流水
线. 这一基线代表了另一条先进的、与本研究不同的技术路线.

