Page 37 - 《软件学报》2026年第5期
P. 37
1916 软件学报 2026 年第 37 卷第 5 期
过分块处理和在线解码, 在输入音频的同时同步生成结果, 非常适合长音频输入, 在语音识别领域已被广泛应用.
5.3 基于训练数据的简单优化策略
本研究通过加权 SFT 和 GRPO 强化学习两阶段的训练, 在双人说话人场景下获得了稳健的性能提升. 然而,
实验结果也显示加权 SFT 的训练策略在四说话人的复杂场景下出现性能退化. 在面对高语速、语句重叠、环境
噪声大和说话人数多样化的真实会议场景时, 训练的收敛不够稳定, 甚至出现了“负提升”.
一种基于训练数据的简单优化方法是课程学习策略, 提前为每条数据打上难度标签, 让模型先使用简单数据
(双人、清晰录音) 完成训练, 再逐渐过渡到难度较大的数据 (多人、重叠、噪声), 或许能缓解这一问题. 同时, 还
可以引入“拒绝采样 (rejection sampling)”的训练数据筛选流程: 先对原始训练集中的各样本按模型当前表现或样
本难度打分, 剔除数据集中难度太小或难度太大的样本, 仅保留中等难度的数据作为新训练集. 通过拒绝采样的数
据筛选流程, 模型在训练时可以专注于具有挑战性但可学习的样本.
5.4 任务专一化带来的能力退化及应对策略
本研究通过定向针对说话人日志任务的监督微调和强化学习训练, 显著提升了模型在多说话人转写与归属判
别中的性能, 但这种针对某一个任务的专项训练会不可避免地侵蚀模型原本的多模态能力, 带来“灾难性遗忘”: 单
任务微调通常会导致模型在新任务上表现优异的同时, 其固有的部分通用能力出现退化, 也会削弱模型在未见任
务或新领域上的泛化能力. 具体到音频-语言模型, 经由说话人日志任务专项训练后, 它在常规模式下对自然语言
指令 (如音频翻译或摘要生成) 的理解和执行是否仍能保持原有水平, 尚未获得系统验证; 若模型在这些任务上出
现显著的性能下滑, 便会严重限制其作为通用音频-语言助理的应用场景.
针对这一问题, 未来工作需在尽量不损害模型基础能力的前提下, 让模型学习说话人日志任务. 首先, 可尝试
多任务微调, 即在 SFT 阶段同时引入其他音频-语言子任务 (如语音翻译、音频问答), 以保持模型对各类指令的响
应能力. 另一种简单的方法是采用 LoRA (low-rank adaptation) 等轻量化微调的方法, 只对特定模块插入小规模的
可训练参数, 而冻结大部分预训练权重, 已有研究 [33] 使用此类轻量化的方式, 发现轻量化微调的思路可显著降低
遗忘风险, 同时降低训练成本.
5.5 扩展到全模态大语言模型
2024 年以来, 以 GPT-4o、Qwen2.5-Omni 为代表的全模态大语言模型迅速崛起, 这类模型一般使用不同的编
码器分别编码视觉、听觉模态的输入信息, 并通过共享自回归解码器 (多为大语言模型) 生成高质量的文本或语
音输出. 相比音频-语言模型, OLLM 不仅能够处理文本和音频, 还支持图像与视频输入, 实现了视觉、听觉、文本
这 3 个模态的统一感知. 它的应用场景十分广阔, 从智能家居助手到自动驾驶汽车, 再到虚拟现实环境中的交互体
验, 它们都可以提供更加自然和直观的服务, 正如一个理想的多模态模型应当能够理解用户的语音指令, 同时分析
背景图像, 据此作出恰当的回应.
OLLM 的多模态处理能力对于说话人日志任务尤为重要: 在视频会议或监控场景下, 模型可以利用人脸位置、
口型运动及场景背景为说话人归属提供额外线索, 从而弥补纯音频信息在高重叠语音和嘈杂环境中的不足. 这意
味着未来的端到端说话人日志系统不仅可以接收音频提示, 还能接收屏幕截帧或摄像头画面, 让模型根据视觉中
人物位置与动作进一步提高区分说话人的准确率. 比如在一次多人会议中, 当多位与会者相继发言时, 模型可以通
过视觉信号判断谁在说话, 从而减少音频重叠、环境噪音导致的说话人归属错误. 与音频-语言模型相似, 以大语
言模型为基础的 OLLM 同样具备优秀的自然语言理解能力, 可以响应用户的个性化需求, 兼容多个任务. 所以随
着硬件算力与模型架构的持续进步, OLLM 可能会成为下一个推动说话人日志系统发展的重要技术方向.
6 结 论
本研究设计了一种以音频-语言模型为基座训练得到的端到端说话人日志系统, 摒弃传统模块化流水线, 通过
监督微调与加权交叉熵损失强化说话人分类信号, 再借助 GRPO 强化学习直接优化联合指标, 实现了语音识别与
说话人归属能力的提升. 在各测试场景中, 经过训练的音频-语言模型相较基线模型具有显著优势. 消融实验进一

