Page 24 - 《软件学报》2026年第5期
P. 24

软件学报 ISSN 1000-9825, CODEN RUXUEW                                        E-mail: jos@iscas.ac.cn
                 2026,37(5):1903−1918 [doi: 10.13328/j.cnki.jos.007541] [CSTR: 32375.14.jos.007541]  http://www.jos.org.cn
                 ©中国科学院软件研究所版权所有.                                                          Tel: +86-10-62562563



                                                                       *
                 基于音频-语言模型的端到端说话人日志系统

                 韦舒羽  1 ,    丘德来  2 ,    刘升平  2 ,    桑基韬  1


                 1
                  (北京交通大学 计算机科学与技术学院, 北京 100044)
                 2
                  (云知声智能科技股份有限公司, 北京 100096)
                 通信作者: 桑基韬, E-mail: jtsang@bjtu.edu.cn

                 摘 要: 会议纪要、客服质检等应用对多说话人语音转写与归属判断的需求正日益增长. 随着近年来多模态大语
                 言模型的迅速发展, 音频-语言模型因其能够同时理解音频信号与自然语言提示, 并在自回归解码框架中统一处理
                 两种模态的能力, 天然契合这种“说话人日志”任务的需求, 为端到端多说话人音频转写提供了全新的思路. 提出一
                 种基于音频-语言模型的端到端说话人日志系统, 通过两阶段训练策略实现语音识别能力与判断说话人归属能力的
                 协同优化, 将音频-语言模型的能力泛化到具体的下游任务上. 训练的第                     1  阶段采用监督微调      (SFT), 在标准交叉熵
                 损失中引入“说话人损失”, 以加权的方式强化对稀疏说话人标签                    token  的学习信号; 第  2  阶段使用了基于组相对策
                 略优化   (GRPO) 算法的强化学习策略, 以联合指标          cpCER  与  SA-CER  设计奖励函数, 突破了监督学习的性能瓶颈.
                 在双说话人的场景下开展实验, 对比了热门开源工具                   3D-Speaker、Diar Sortformer 和闭源的   AssemblyAI、
                 Microsoft Azure 说话人日志  API, 并通过消融实验证明了训练方法的合理性, 随后将实验拓宽至四说话人场景. 结
                 果表明, 两阶段的训练方法在双说话人环境中显著提升了模型的语音识别能力与判断说话人归属的能力, 而在四
                 说话人场景中, 常规的监督微调已取得较大收益. 进一步讨论了大模型资源消耗、输入时长限制、跨域适应等问
                 题, 提出了引入流式音频编码器、课程学习、拒绝采样策略等未来优化方向. 研究结果表明音频-语言模型在多说
                 话人日志任务中具备显著潜力, 但亦需在复杂声学场景下完成更多技术突破.
                 关键词: 说话人日志; 音频-语言模型; 监督微调; 强化学习; GRPO             算法
                 中图法分类号: TP37

                 中文引用格式: 韦舒羽, 丘德来, 刘升平, 桑基韬. 基于音频-语言模型的端到端说话人日志系统. 软件学报, 2026, 37(5): 1903–1918.
                 http://www.jos.org.cn/1000-9825/7541.htm
                 英文引用格式: Wei SY, Qiu DL, Liu SP, Sang JT. End-to-end Speaker Diarization System Based on Audio-language Model. Ruan Jian
                 Xue Bao/Journal of Software, 2026, 37(5): 1903–1918 (in Chinese). http://www.jos.org.cn/1000-9825/7541.htm

                 End-to-end Speaker Diarization System Based on Audio-language Model
                                                  2
                          1
                                    2
                 WEI Shu-Yu , QIU De-Lai , LIU Sheng-Ping , SANG Ji-Tao 1
                 1
                 (School of Computer Science and Technology, Beijing Jiaotong University, Beijing 100044, China)
                 2
                 (Unisound AI Technology Co. Ltd., Beijing 100096, China)
                 Abstract:  The demand for multi-speaker speech transcription and speaker attribution in applications such as meeting minutes and customer
                 service  quality  inspection  is  increasing.  Recent  advances  in  multimodal  large  language  models  have  given  rise  to  audio-language  models
                 (ALMs)  that  can  simultaneously  interpret  audio  signals  and  natural-language  prompts  within  a  unified  autoregressive  decoding  framework,
                 making  them  a  natural  fit  for  the  speaker  diarization  task  and  offering  a  fresh  approach  to  end-to-end  multi-speaker  audio  transcription.
                 This  study  proposes  an  end-to-end  speaker  diarization  system  based  on  an  ALM  and  achieves  synergistic  optimization  of  speech-


                 *    基金项目: 国家重点研发计划  (2023YFF1204100)
                  本文由“多媒体智能理解与生成”专题特约编辑孙立峰教授、闵巍庆副研究员、马占宇教授、蒋树强研究员、彭宇新教授、田丰研究
                  员、黄庆明教授推荐.
                  收稿时间: 2025-05-25; 修改时间: 2025-07-11, 2025-08-30; 采用时间: 2025-09-05; jos 在线出版时间: 2025-09-23
                  CNKI 网络首发时间: 2025-12-11
   19   20   21   22   23   24   25   26   27   28   29