Page 36 - 《软件学报》2026年第5期
P. 36
韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统 1915
数据集与训练双人模型所使用的 THCHS-30 合成数据和 MagicData-RAMC 真实场景数据在说话人年龄、音色特
征和方言分布等方面存在显著差异, 因而可作为评估模型在分布外场景下表现的理想测试集.
如表 12 所示, 从衡量模型区分说话人能力的 Average 指标来看, 经过监督学习训练的音频-语言模型在识别
说话人的能力上已优于基线, 且引入说话人权重和 GRPO 训练均进一步提升了性能, 表明模型习得的区分说话人
能力在分布外数据上依旧有效. 在 CER 指标上, Microsoft 基线表现最佳, 说明数据分布的变化影响了音频-语言模
型文本转录的能力. 尽管如此, 引入说话人权重的 SFT 模型在说话人分离能力提升的同时, CER 略有妥协, 而随后
的 GRPO 训练在提升说话人分离能力的同时, 同步改善了 CER, 这些规律都符合训练策略设计时的初始设想, 进
一步证明了两阶段训练方法的合理性.
表 12 消融实验: 分布外测试集上的性能比较 (%)
模型 ∆cp↓ ∆SA↓ Average↓ CER↓
3D-Speaker 7.89 22.94 15.42 30.82
Sortformer 9.97 21.49 15.73 42.37
AssemblyAI 15.25 24.13 19.69 35.25
Microsoft 8.72 25.01 16.87 29.56
双人SFT 7.07 15.66 11.37 37.74
双人加权SFT 7.06 14.80 10.93 40.44
+双人GRPO 6.56 14.95 10.76 39.68
5 讨 论
本研究提出了基于 Qwen2-Audio 的端到端说话人日志系统, 并通过两阶段训练策略实现了语音识别与说话
人归属的联合优化. 尽管实验结果表明该方法相比 3D-Speaker 基线具有显著优势, 但在实际应用与模型设计层面
仍存在诸多值得讨论的问题. 本文设计的实验只覆盖了不超过 4 位说话人的场景, 但真实应用中还存在更多人的
混合对话、跨设备收音及多人快速切换等极端场景, 还需要更大规模、多样化的标注数据进行深入验证. 本节针
对模型与训练方法的缺陷以及未来的优化方向进行了更进一步的讨论.
5.1 训练效率与资源权衡
现有端到端多模态音频–语言模型的参数量往往以亿为单位, 如 Qwen2-Audio 拥有约 70 亿参数, 在推理与微
调阶段的计算资源开销不可小觑. 相比之下, 3D-Speaker 基线由多个相对轻量的模块 (语音端点检测、说话人确认、
说话人转换点定位、语音识别) 组成, 训练和使用时对资源的需求更低. 然而, 3D-Speaker 的最终效果高度依赖于
每个模块各自的性能, 需要针对不同场景的需求单独地优化每个子模块, 所以各模块总的工程复杂度与调试成本
可能较高. 对于这一点, Qwen2-Audio 通过统一的单模型架构直接端到端地实现了整个任务的闭环, 简化了任务管
道并避免了多模块接口的误差累积, 尽管需要更强大的硬件资源作为支撑. 所以, 在保证端到端简洁性的前提下,
通过模型压缩、蒸馏或高效的微调技术 (如 LoRA、 QLoRA)、推理框架来降低音频-语言模型的资源需求, 仍亟
待进一步探索.
5.2 输入时长限制与长序列处理问题
Qwen2-Audio 使用了基于 Whisper-large-v3 模型的音频编码器, 它对音频输入有 30 s 的时长限制, 以避免过
长的输入序列导致 O(n ) 复杂度的庞大注意力机制开销与内存溢出风险. 音频长度的限制可以通过音频截断拼接
2
或对音频加速的方式绕过, 但音频截断拼接的方法难以通过算法的设计来保证转录文本的跨段语义衔接与说话人
连续性的正确恢复, 音频加速的方法则会不同程度地削弱模型的能力, 所以这两种方法都不能从根本上解决问题.
相比之下, 基于分段+聚类的流水线 (如 3D-Speaker) 对整体时长的限制更弱, 且聚类算法在更长时长的样本上可
能表现更稳健, 所以在通用性上, 基于分段-聚类的流水线说话人日志系统仍存在一定的优势.
对于上述限制, 一种思路是更换更强的音频编码器, 让音频-语言模型能接收分钟级甚至小时级的音频输入.
比如, 可以引入流式 Transformer (streaming Transformer) 结构的音频编码器 [32] , 它被专门设计用于处理长序列, 通

