Page 27 - 《软件学报》2026年第5期
P. 27
1906 软件学报 2026 年第 37 卷第 5 期
1.1 基于语音分离的方法
基于语音分离的方法先将混合的多说话人信号拆分为若干个无重叠的单说话人音轨, 然后分别对每一音轨应用
常规的语音识别模型进行转录. 常用的分离模型包括 Conv-TasNet、dual-path RNN (DPRNN) 以及 TF-GridNet 等.
在 von Neumann 等人 [7] 提出的连续语音分离框架中, 混合语音被映射到预设数目的输出通道, 实现无重叠的
单说话人流. Morrone 等人 [8] 提出的低延迟 SSGD 模型在电话通话上使用 DPRNN 进行实时分离, 然后对每个通道
分别进行语音活动检测, 在 CALLHOME 数据集上达到了 11.1% 的 DER (diarization error rate). Gruttadauria 等人 [9]
提出了面向会议的在线分离-识别方案: 他们先用 Conv-TasNet 或 DPRNN 对会议录音产生 2–3 路分离信号, 再对
每路信号进行语音活动检测, 并通过说话人嵌入进行递增聚类, 最终在 AMI 数据集上取得了新的最优效果. 另一
个代表性工作 PixIT [10] 联合训练了基于 PIT 的说话人分离和基于 MixIT 的无监督分离模型, 借助现有说话人聚类
信息减少过分离, 提高了分离后的语音识别准确率.
总的来说, 基于语音分离的方法能有效处理重叠语音, 但高度依赖分离网络的质量, 一般需要预设输出通道
数, 对快速轮转或长静默的说话人场景仍有挑战.
1.2 模块化流水线系统
模块化流水线始终是说话人日志系统的常用方法, 这类系统包括语音活动检测、声学分割、说话人特征提取、
相似度评估或聚类、语音识别等多个阶段. 例如 Landini 等人 [11] 提出的 VBx 方法在 x-vector 序列上使用贝叶斯隐
马尔可夫模型进行聚类, 在 CALLHOME、AMI、DIHARD 等基准测试中取得当时的最优结果; 近期, 朱必松等
人 [12] 基于相邻语音片段的背景噪声往往相同这一现象, 提出一种新的基于时间分段和重组聚类的说话人日志方
法; 毛青青等人 [13] 提出了一种基于图神经网络的方法, 优化了模块化流水线中“说话人嵌入提取”这一关键步骤, 通
过结合局部和全局说话人信息并采用动态自适应的多原型学习模块, 在 AMI_SDM 和 CALLHOME 数据集上取
得了显著优于基线系统的成绩.
流水线方法的优点是结构清晰、可针对各模块独立优化, 易于集成和升级; 但流水线系统的最终性能高度依
赖于每个子模块与任务场景的匹配程度, 且模块间错误的累积同样会影响整个系统的性能. 不仅如此, 流水线系统
对重叠语音的鲁棒性较弱, 而且一般需要提前知道或估计说话人数量, 否则可能需要额外后处理来合并聚类结果.
1.3 端到端说话人归属 ASR 系统
此方法使用区分说话人的语音识别 (speaker-attributed ASR, SA-ASR) 模型, 这类模型通过联合学习声学、语
言与说话人建模, 端到端地输出带有说话人标签的转录文本, 即用一个统一模型同时输出转写文本和说话人标签.
Kanda 等人 [14] 提出的“Transcribe-to-Diarize”是典型的例子: 这个模型可以在模型内部状态中估计词语的起止
时间, 从而实现对不限数量说话人的日志标注. Li 等人 [15] 提出的 SA-Paraformer 采用并行解码的 Paraformer 结构
加速多说话人语音识别, 并引入“speaker-filling”策略和 inter-CTC 损失来减少说话人识别错误. 类似地, Kanda 等
人 [16] 还提出了一种基于 Transformer 的端到端 SA-ASR, 在 LibriCSS 测试上实现了 11.9% 的 cpWER, 优于传统分
离+聚类方案.
端到端 SA-ASR 的优点是可以联合训练语音识别和说话人归属任务, 但缺点是模型结构复杂、训练数据需求
大, 对声学和语言标注的统一性要求高.
1.4 结合大语言模型的后处理
尽管上述方法在声学层面已经取得长足进展, 它们并没有在文本层面上进一步优化说话人归属和转写结果的
准确性. 近期的部分研究聚焦于利用大语言模型对已有说话人日志结果进行文本级的后处理与纠错.
比如, Wang 等人 [17] 提出 DiarizationLM 框架, 将模型输出的音频转录文本和说话人标签作为文本提示输入微
调后的 PaLM-2 模型, 生成优化后的带有说话人标签的转录文本. 实验结果表明微调后的大语言模型可以显著降
低词级说话人错误率. Efstathiadis 等人 [18] 也研究了基于 LLM 的后处理, 他们针对不同语音识别系统的输出分别
微调多个模型, 并通过集成策略提升了跨系统的稳健性.
这类方法的优点是无需改动原始模型即可提升结果, 能兼容任意系统; 其主要局限在于模型呈现的最终效果

