Page 26 - 《软件学报》2026年第5期
P. 26
韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统 1905
的差异与优势.
在音频-语言模型中, 阿里开源的 Qwen2-Audio-7B-Instruct 模型 [5] 因其强大的多模态理解能力和在多种音频
任务上的优异表现, 成为本研究的理想基座. 然而, 我们发现, 尽管这类预训练模型具备强大的基础能力, 但其在特
定、结构化任务上的指令遵循能力仍有不足. 例如, 当直接使用提示 (prompt) 引导其执行说话人日志任务时, 模型
难以稳定地输出预设格式. 这表明了设计专门的微调策略的必要性, 从而将模型的通用能力“适配”到说话人日志
这一具体的下游任务上.
因此, 本研究使用 Qwen2-Audio-7B-Instruct 模型作为基座模型, 通过设计阶段式的训练策略, 使模型适应说话
人日志任务. 模型的训练使用音频-文本问答对数据, 将音频输入与说话人 prompt、文本输出统一建模为自回归模
型的训练目标, 直接在对话级别进行联合训练, 这样就天然地兼顾了语音识别与说话人归属判别这两项能力需求.
本研究设计了两阶段的训练策略: 第 1 阶段使用监督学习 (supervised fine tuning, SFT), 在常规交叉熵损失的基础
上额外引入了针对说话人标签的加权损失项, 在模型学习作答格式的同时强化模型的说话人分辨能力; 第 2 阶段
则基于使用组相对策略优化 (group relative policy optimization, GRPO) 算法 [6] 的强化学习 (reinforcement learning,
RL), 通过构造结合 cpCER (concatenated minimum permutation character error rate) 与 SA-CER (speaker attributed
character error rate) 两个综合指标的奖励函数, 实现了对语音识别能力和说话人分辨能力的端到端协同优化, 突破
SFT 阶段的性能瓶颈. 本研究聚焦于中文多说话人场景, 首先在双说话人场景下验证了方法的有效性, 随后将场景
扩展至四说话人.
综上所述, 本研究的主要贡献如下.
(1) 提出基于音频-语言模型的说话人日志系统. 本研究将音频-语言模型直接应用于说话人日志任务, 通过自
回归解码器统一处理音频特征与文本输出, 实现了从原始音频到带有说话人标签的文字转录的端到端流程.
(2) 设计监督学习阶段的“说话人损失”加权策略. 针对说话人标签 token 在序列中占比稀少的问题, 本研究提
出在监督学习阶段对该部分 logits 进行加权交叉熵优化, 有效地提升了模型对说话人归属的敏感度.
(3) 构建基于 GRPO 算法的强化学习优化方法. 在监督学习之后, 引入基于 GRPO 算法的强化学习阶段, 以
cpCER 和 SA-CER 为联合奖励, 直接对下游评测指标进行策略梯度优化, 突破了仅靠 SFT 难以逾越的性能瓶颈.
(4) 讨论模型的应用局限与改进方向. 本文分析了音频-语言模型在训练资源、输入时长限制与跨域泛化等方
面的挑战, 并提出了可行的未来改进方向, 为后续在实际部署与更复杂场景下的进一步优化提供了参考.
1 相关工作
说话人日志任务的传统方法通常采用多步流水线: 先使用语音活动检测 (voice activity detection, VAD) 工具
获得语音段落, 再提取说话人特征, 用聚类等方法将语音片段分组, 最后利用语音识别工具将语音转录为文本. 近
年来, 深度学习极大地提升了嵌入提取和聚类的效果, 同时也催生了新的方法与思路. 本节将按照方法类型简单介
绍说话人日志任务的代表性方法, 如表 1 所示.
表 1 说话人日志任务的现有方法梳理
方法类型 代表论文 方法特征 主要局限性
先使用语音分离模型将混合语音
[7]
[8]
基于语音 von Neumann等人 、Morrone等人 、 分解到固定通道, 再分别处理各路 高度依赖分离质量; 通常需预设通
[9]
分离 Gruttadauria等人 、Kalda等人 [10] 道数; 对长时静默或重叠变化敏感
信号
模块化 Landini等人 [11] 、朱必松等人 [12] 、毛青青 逐步执行VAD、分割、说话人嵌 对重叠语音处理能力有限; 常需先
流水线 等人 [13] 入提取、聚类、语音识别等模块 验说话人数量; 各模块误差易累积
单模型并行输出文本与说话人标
端到端 模型结构复杂、训练数据需求大;
Kanda等人 [14] 、Li等人 [15] 、Kanda等人 [16] 签, 无需后续聚类即可得出说话人
SA-ASR 对声学、语言标注一致性要求高
划分
将初步的转录文本和说话人标签 依赖模型初步输出的准确度; LLM
LLM后处理 Wang等人 [17] 、Efstathiadis等人 [18] 输入LLM, 利用 LLM知识进行文 推理开销大; 对不同系统的泛化性
本级纠错和优化 仍需验证

