Page 26 - 《软件学报》2026年第5期
P. 26

韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统                                                     1905


                 的差异与优势.
                    在音频-语言模型中, 阿里开源的          Qwen2-Audio-7B-Instruct 模型  [5] 因其强大的多模态理解能力和在多种音频
                 任务上的优异表现, 成为本研究的理想基座. 然而, 我们发现, 尽管这类预训练模型具备强大的基础能力, 但其在特
                 定、结构化任务上的指令遵循能力仍有不足. 例如, 当直接使用提示                    (prompt) 引导其执行说话人日志任务时, 模型
                 难以稳定地输出预设格式. 这表明了设计专门的微调策略的必要性, 从而将模型的通用能力“适配”到说话人日志
                 这一具体的下游任务上.
                    因此, 本研究使用     Qwen2-Audio-7B-Instruct 模型作为基座模型, 通过设计阶段式的训练策略, 使模型适应说话
                 人日志任务. 模型的训练使用音频-文本问答对数据, 将音频输入与说话人                      prompt、文本输出统一建模为自回归模
                 型的训练目标, 直接在对话级别进行联合训练, 这样就天然地兼顾了语音识别与说话人归属判别这两项能力需求.
                 本研究设计了两阶段的训练策略: 第           1  阶段使用监督学习      (supervised fine tuning, SFT), 在常规交叉熵损失的基础
                 上额外引入了针对说话人标签的加权损失项, 在模型学习作答格式的同时强化模型的说话人分辨能力; 第                                  2  阶段
                 则基于使用组相对策略优化          (group relative policy optimization, GRPO) 算法  [6] 的强化学习  (reinforcement learning,
                 RL), 通过构造结合    cpCER (concatenated minimum permutation character error rate) 与  SA-CER (speaker attributed
                 character error rate) 两个综合指标的奖励函数, 实现了对语音识别能力和说话人分辨能力的端到端协同优化, 突破
                 SFT  阶段的性能瓶颈. 本研究聚焦于中文多说话人场景, 首先在双说话人场景下验证了方法的有效性, 随后将场景
                 扩展至四说话人.
                    综上所述, 本研究的主要贡献如下.
                    (1) 提出基于音频-语言模型的说话人日志系统. 本研究将音频-语言模型直接应用于说话人日志任务, 通过自
                 回归解码器统一处理音频特征与文本输出, 实现了从原始音频到带有说话人标签的文字转录的端到端流程.
                    (2) 设计监督学习阶段的“说话人损失”加权策略. 针对说话人标签                  token  在序列中占比稀少的问题, 本研究提
                 出在监督学习阶段对该部分          logits 进行加权交叉熵优化, 有效地提升了模型对说话人归属的敏感度.
                    (3) 构建基于   GRPO  算法的强化学习优化方法. 在监督学习之后, 引入基于                GRPO  算法的强化学习阶段, 以
                 cpCER  和  SA-CER  为联合奖励, 直接对下游评测指标进行策略梯度优化, 突破了仅靠                SFT  难以逾越的性能瓶颈.
                    (4) 讨论模型的应用局限与改进方向. 本文分析了音频-语言模型在训练资源、输入时长限制与跨域泛化等方
                 面的挑战, 并提出了可行的未来改进方向, 为后续在实际部署与更复杂场景下的进一步优化提供了参考.
                  1   相关工作

                    说话人日志任务的传统方法通常采用多步流水线: 先使用语音活动检测                         (voice activity detection, VAD) 工具
                 获得语音段落, 再提取说话人特征, 用聚类等方法将语音片段分组, 最后利用语音识别工具将语音转录为文本. 近
                 年来, 深度学习极大地提升了嵌入提取和聚类的效果, 同时也催生了新的方法与思路. 本节将按照方法类型简单介
                 绍说话人日志任务的代表性方法, 如表            1  所示.

                                             表 1 说话人日志任务的现有方法梳理

                  方法类型               代表论文                       方法特征                    主要局限性
                                                        先使用语音分离模型将混合语音
                                       [7]
                                                  [8]
                  基于语音    von Neumann等人 、Morrone等人 、    分解到固定通道, 再分别处理各路         高度依赖分离质量; 通常需预设通
                                      [9]
                    分离    Gruttadauria等人 、Kalda等人 [10]                           道数; 对长时静默或重叠变化敏感
                                                        信号
                   模块化    Landini等人 [11] 、朱必松等人 [12] 、毛青青  逐步执行VAD、分割、说话人嵌 对重叠语音处理能力有限; 常需先
                   流水线    等人  [13]                      入提取、聚类、语音识别等模块           验说话人数量; 各模块误差易累积
                                                        单模型并行输出文本与说话人标
                   端到端                                                           模型结构复杂、训练数据需求大;
                          Kanda等人 [14] 、Li等人 [15] 、Kanda等人 [16]  签, 无需后续聚类即可得出说话人
                  SA-ASR                                                         对声学、语言标注一致性要求高
                                                        划分
                                                        将初步的转录文本和说话人标签 依赖模型初步输出的准确度; LLM
                 LLM后处理 Wang等人   [17] 、Efstathiadis等人 [18]  输入LLM, 利用 LLM知识进行文 推理开销大; 对不同系统的泛化性
                                                        本级纠错和优化                  仍需验证
   21   22   23   24   25   26   27   28   29   30   31