Page 31 - 《软件学报》2026年第5期
P. 31

1910                                                       软件学报  2026  年第  37  卷第  5  期


                    此外, 为了更全面地评估本研究方法的性能, 本研究还引入了两个业界领先的商业解决方案作为对比基线:
                 AssemblyAI 和  Microsoft Azure 的多说话人转录服务, 它们代表了当前工业界成熟的说话人日志技术水平. 由于其
                 实现细节并未公开, 本研究将其作为“黑盒”模型, 仅对其最终输出结果进行评估.
                    值得注意的是, 由于本研究所用基座模型             Qwen2-Audio  存在  30 s 的音频输入时长限制, 故本研究中的所有训
                 练和测试样本均被裁剪或控制在            30 s 以内. 这一约束对不同类型的模型影响是不同的. 对于本研究提出的端到端
                 模型, 短音频是其固有的处理单元. 然而, 对于            3D-Speaker 等基于分段和聚类的流水线模型, 其性能往往受益于更
                 长的音频输入. 在长音频中, 模型可以观察到更丰富的说话人信息和更稳定的声学特征, 从而做出更鲁棒的聚类判
                 断. 因此, 在“中文语境”和“30 s 输入时长”的双重限制下, 基线模型的性能可能受到了限制, 未能完全发挥其在长
                 时程任务上的优势. 这使得我们的端到端方法在当前实验设置下, 相比基线模型, 可能表现出比在长音频场景下更
                 大的相对优势.
                  3.2   评价指标

                    本研究涉及以下评价指标.
                    (1) CER (character error rate): 语音识别任务的常见指标, 衡量模型在文本转录层面的准确性, 定义为替换、删
                 除、插入错误之和与参考文本总字符数之比.
                    (2) cpCER: 将各说话人对应的转录结果按说话顺序拼接, 遍历所有可能的说话人标签置换组合, 取最低                           CER,
                 联合反映语音识别错误与说话人归属错误.
                    (3) ∆cp = cpCER – CER: 度量说话人归属错误带来的额外字符错误率增量.
                    (4) SA-CER: 确定说话人标签映射的情况下, 分别计算每位说话人的                 CER  并汇总, 评估词级与说话人级匹配
                 的整体表现.
                    (5) ∆SA = SA-CER – CER: 与∆cp  的意义相似, 反映说话人映射的不准确对语音识别造成的附加错误.
                    其中, ∆cp  与∆SA  主要用于衡量说话人归属的准确性, CER          则专注于语音识别质量; cpCER        与  SA-CER  提供了
                 两者的联合视角. 这些指标数值越小, 代表模型能力越优秀. 本研究使用∆cp、∆SA、CER                       这  3  个指标作为衡量模
                 型性能的度量, 而综合性指标         cpCER  与  SA-CER  则被应用于强化学习训练阶段的奖励函数.
                  3.3   数据集的构建
                    本研究围绕双说话人和四说话人两种场景, 构建了包含真实对话与人工合成对话的训练集, 并从相同数据源
                 中另外构建了相应的测试集. 真实场景下, 带有文本转录标注的中文多人对话数据集规模有限, 而中文的单人语音
                 识别数据集更易于寻找. 只要单人的语音识别数据集带有说话人标签, 就可以通过句子间组合拼接的方式构建多
                 人对话数据集, 且说话人的数量、对话的长度、语速等属性均可控. 通过这种人工合成数据的方法, 可以快速构建
                 大规模   (但可能缺少上下文语义关联) 的多人对话数据集. 本研究使用了这种数据生成策略, 将人工合成的音频
                 (超长的音频通过快进的方式保证符合             30 s 的输入时长限制) 结合真实场景下截取的音频一并纳入训练集和测试
                 集中. 实验选用的训练数据集详见表           2、表  3.

                                              表 2 双说话人场景      SFT  阶段训练集

                                数据集                种类             数量               备注
                            MagicData-RAMC     1–2人, 真实场景        10 000     GRPO时随机抽取5 000条
                               THCHS-30        1–2人, 人工场景         8 000     选取1–2位说话人的数据

                                              表 3 四说话人场景      SFT  阶段训练集

                                数据集                种类             数量               备注
                            MagicData-RAMC     1–2人, 真实场景        24 000
                               AliMeeting      1–4人, 真实场景        24 800    GRPO时, 在所有数据集中
                               AISHELL-4       1–4人, 真实场景        15 000        随机抽取8 000条
                               THCHS-30        1–4人, 人工场景        15 000
   26   27   28   29   30   31   32   33   34   35   36