Page 31 - 《软件学报》2026年第5期
P. 31
1910 软件学报 2026 年第 37 卷第 5 期
此外, 为了更全面地评估本研究方法的性能, 本研究还引入了两个业界领先的商业解决方案作为对比基线:
AssemblyAI 和 Microsoft Azure 的多说话人转录服务, 它们代表了当前工业界成熟的说话人日志技术水平. 由于其
实现细节并未公开, 本研究将其作为“黑盒”模型, 仅对其最终输出结果进行评估.
值得注意的是, 由于本研究所用基座模型 Qwen2-Audio 存在 30 s 的音频输入时长限制, 故本研究中的所有训
练和测试样本均被裁剪或控制在 30 s 以内. 这一约束对不同类型的模型影响是不同的. 对于本研究提出的端到端
模型, 短音频是其固有的处理单元. 然而, 对于 3D-Speaker 等基于分段和聚类的流水线模型, 其性能往往受益于更
长的音频输入. 在长音频中, 模型可以观察到更丰富的说话人信息和更稳定的声学特征, 从而做出更鲁棒的聚类判
断. 因此, 在“中文语境”和“30 s 输入时长”的双重限制下, 基线模型的性能可能受到了限制, 未能完全发挥其在长
时程任务上的优势. 这使得我们的端到端方法在当前实验设置下, 相比基线模型, 可能表现出比在长音频场景下更
大的相对优势.
3.2 评价指标
本研究涉及以下评价指标.
(1) CER (character error rate): 语音识别任务的常见指标, 衡量模型在文本转录层面的准确性, 定义为替换、删
除、插入错误之和与参考文本总字符数之比.
(2) cpCER: 将各说话人对应的转录结果按说话顺序拼接, 遍历所有可能的说话人标签置换组合, 取最低 CER,
联合反映语音识别错误与说话人归属错误.
(3) ∆cp = cpCER – CER: 度量说话人归属错误带来的额外字符错误率增量.
(4) SA-CER: 确定说话人标签映射的情况下, 分别计算每位说话人的 CER 并汇总, 评估词级与说话人级匹配
的整体表现.
(5) ∆SA = SA-CER – CER: 与∆cp 的意义相似, 反映说话人映射的不准确对语音识别造成的附加错误.
其中, ∆cp 与∆SA 主要用于衡量说话人归属的准确性, CER 则专注于语音识别质量; cpCER 与 SA-CER 提供了
两者的联合视角. 这些指标数值越小, 代表模型能力越优秀. 本研究使用∆cp、∆SA、CER 这 3 个指标作为衡量模
型性能的度量, 而综合性指标 cpCER 与 SA-CER 则被应用于强化学习训练阶段的奖励函数.
3.3 数据集的构建
本研究围绕双说话人和四说话人两种场景, 构建了包含真实对话与人工合成对话的训练集, 并从相同数据源
中另外构建了相应的测试集. 真实场景下, 带有文本转录标注的中文多人对话数据集规模有限, 而中文的单人语音
识别数据集更易于寻找. 只要单人的语音识别数据集带有说话人标签, 就可以通过句子间组合拼接的方式构建多
人对话数据集, 且说话人的数量、对话的长度、语速等属性均可控. 通过这种人工合成数据的方法, 可以快速构建
大规模 (但可能缺少上下文语义关联) 的多人对话数据集. 本研究使用了这种数据生成策略, 将人工合成的音频
(超长的音频通过快进的方式保证符合 30 s 的输入时长限制) 结合真实场景下截取的音频一并纳入训练集和测试
集中. 实验选用的训练数据集详见表 2、表 3.
表 2 双说话人场景 SFT 阶段训练集
数据集 种类 数量 备注
MagicData-RAMC 1–2人, 真实场景 10 000 GRPO时随机抽取5 000条
THCHS-30 1–2人, 人工场景 8 000 选取1–2位说话人的数据
表 3 四说话人场景 SFT 阶段训练集
数据集 种类 数量 备注
MagicData-RAMC 1–2人, 真实场景 24 000
AliMeeting 1–4人, 真实场景 24 800 GRPO时, 在所有数据集中
AISHELL-4 1–4人, 真实场景 15 000 随机抽取8 000条
THCHS-30 1–4人, 人工场景 15 000

