Page 32 - 《软件学报》2026年第5期
P. 32
韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统 1911
下面简单介绍各数据集. 真实场景的数据集来源如下.
(1) MagicData-RAMC: 由 663 名说话人通过手机采集的 180 h 高质量对话语音, 覆盖 15 个领域并提供人工校
对的精确标注, 包括发言时间戳与说话人标识.
(2) AliMeeting: 源自 ICASSP 2022 会议转写挑战的 118.75 h 真实会议录音, 包含 2–4 人的自然交谈场景, 既
有远端八通道麦克风阵列, 也有主体头戴麦克风记录, 覆盖多种室内对话的声学场景. 本研究使用 AliMeeting 的近
场子集 (单通道音频).
(3) AISHELL-4: 录制自 211 场真实录制的中文会议, 每场 4–8 人, 合计 120 h, 采用圆形八通道麦克风阵列, 提
供准确的语音起止时间戳与说话人信息标注, 真实反映了环境噪声、语音重叠与说话人快速切换等复杂现象.
(4) SeniorTalk: 专为 75 岁及以上超高龄老年人设计的中文对话数据集, 包含 55.53 h 的自然对话录音, 涵盖
202 名参与者, 具有丰富的方言和老年人特有的音色特征.
人工场景的数据集来源如下.
THCHS-30: 由清华大学发布的免费中文语音数据库, 包含 30 h 朗读式语音和说话人信息的标注. 本研究将数
据集中单句语音互相拼接以构造多轮对话, 通过快进的方式控制音频的总长度不超过 Qwen2-Audio 的 30 s 输入
长度限制, 作为人工合成的补充数据集.
本研究构造的数据集包含至多 6 轮对话 (5 次说话人切换), 并涵盖了 1–4 位说话人在至多 6 轮对话中可能产
生的所有说话人排列顺序, 尽可能地提升场景丰富度.
在双说话人与四说话人两种情境下, 监督学习的训练集均由上述真实数据与合成数据两部分组成. 对于双人
场景下的强化学习步骤, 因监督学习后模型在双人人工场景已无性能的优化空间, 实验只在真实场景数据中采样
5 000 条数据作为训练集; 对 4 人场景下的强化学习, 在整个监督学习训练集中随机采样 8 000 条作为训练集. 测试
集则分别从各数据集中另外随机采样 50 条 (4 人场景) 或 100 条 (双人场景) 样本.
3.4 超参数设置与硬件需求
两个训练阶段均使用 ModelScope 的 swift 训练框架训练 Qwen2-Audio 模型, 训练使用 4 张 NVIDIA A800 80 GB
显卡. 训练的两个阶段均冻结音频编码器, 仅对 Qwen2-Audio 的语言模型部分进行全参数微调, 以降低显存占用
并专注提升解码质量. 为确保训练效率与收敛稳定性, 训练过程中的关键超参数设置如表 4、表 5 所示. 在双说话
L spk 的权重 设置为 k = 1. 双说话人场景训练耗时约 10 h, 四说
k
人场景下, 说话人损失 4, 四说话人场景下设置为
话人场景训练耗时约 30 h.
表 4 SFT 阶段主要超参数设置 表 5 GRPO 阶段主要超参数设置
超参数 数值 超参数 数值
train_epoch 1 train_epoch 1
per_device_train_batch_size 1 per_device_train_batch_size 4
learning_rate 1E–4 learning_rate 1E–5
warmup_ratio 0.05 warmup_ratio 0.05
gradient_accumulation_steps 16 num_generations 4
temperature 0.9
gradient_accumulation_steps 1
4 实验结果与分析
本节首先对双说话人场景对所提两阶段训练方法进行了系统验证, 通过与 3D-Speaker 基线的对比实验, 展示
了监督微调及加权损失对 ASR 与说话人归属性能的影响, 并进一步引入 GRPO 强化学习以突破模型能力瓶颈;
随后, 本研究尝试将训练方法推广至四说话人的场景, 再次评估其在各种对话环境中的表现差异, 并通过消融实验
探讨各环节对整体性能的贡献. 本节表中 Average 指代∆cp 与∆SA 的均值.

