Page 32 - 《软件学报》2026年第5期
P. 32

韦舒羽 等: 基于音频-语言模型的端到端说话人日志系统                                                     1911


                    下面简单介绍各数据集. 真实场景的数据集来源如下.
                    (1) MagicData-RAMC: 由  663  名说话人通过手机采集的     180 h  高质量对话语音, 覆盖    15  个领域并提供人工校
                 对的精确标注, 包括发言时间戳与说话人标识.
                    (2) AliMeeting: 源自  ICASSP 2022  会议转写挑战的  118.75 h  真实会议录音, 包含  2–4  人的自然交谈场景, 既
                 有远端八通道麦克风阵列, 也有主体头戴麦克风记录, 覆盖多种室内对话的声学场景. 本研究使用                             AliMeeting  的近
                 场子集   (单通道音频).
                    (3) AISHELL-4: 录制自  211  场真实录制的中文会议, 每场      4–8  人, 合计 120 h, 采用圆形八通道麦克风阵列, 提
                 供准确的语音起止时间戳与说话人信息标注, 真实反映了环境噪声、语音重叠与说话人快速切换等复杂现象.
                    (4) SeniorTalk: 专为  75  岁及以上超高龄老年人设计的中文对话数据集, 包含             55.53 h  的自然对话录音, 涵盖
                 202  名参与者, 具有丰富的方言和老年人特有的音色特征.
                    人工场景的数据集来源如下.
                    THCHS-30: 由清华大学发布的免费中文语音数据库, 包含              30 h  朗读式语音和说话人信息的标注. 本研究将数
                 据集中单句语音互相拼接以构造多轮对话, 通过快进的方式控制音频的总长度不超过                             Qwen2-Audio  的  30 s 输入
                 长度限制, 作为人工合成的补充数据集.
                    本研究构造的数据集包含至多           6  轮对话  (5  次说话人切换), 并涵盖了     1–4  位说话人在至多    6  轮对话中可能产
                 生的所有说话人排列顺序, 尽可能地提升场景丰富度.
                    在双说话人与四说话人两种情境下, 监督学习的训练集均由上述真实数据与合成数据两部分组成. 对于双人
                 场景下的强化学习步骤, 因监督学习后模型在双人人工场景已无性能的优化空间, 实验只在真实场景数据中采样
                 5 000  条数据作为训练集; 对    4  人场景下的强化学习, 在整个监督学习训练集中随机采样                 8 000  条作为训练集. 测试
                 集则分别从各数据集中另外随机采样             50  条  (4  人场景) 或  100  条  (双人场景) 样本.

                  3.4   超参数设置与硬件需求
                    两个训练阶段均使用        ModelScope 的  swift 训练框架训练  Qwen2-Audio 模型, 训练使用  4 张  NVIDIA A800 80 GB
                 显卡. 训练的两个阶段均冻结音频编码器, 仅对              Qwen2-Audio  的语言模型部分进行全参数微调, 以降低显存占用
                 并专注提升解码质量. 为确保训练效率与收敛稳定性, 训练过程中的关键超参数设置如表                            4、表  5  所示. 在双说话
                                   L spk  的权重   设置为                    k = 1. 双说话人场景训练耗时约       10 h, 四说
                                            k
                 人场景下, 说话人损失                       4, 四说话人场景下设置为
                 话人场景训练耗时约       30 h.

                         表 4 SFT  阶段主要超参数设置                           表 5 GRPO  阶段主要超参数设置

                             超参数                  数值                      超参数                   数值
                           train_epoch              1                    train_epoch             1
                      per_device_train_batch_size   1              per_device_train_batch_size   4
                           learning_rate          1E–4                  learning_rate           1E–5
                           warmup_ratio            0.05                 warmup_ratio            0.05
                      gradient_accumulation_steps  16                  num_generations           4
                                                                        temperature             0.9
                                                                   gradient_accumulation_steps   1
                  4   实验结果与分析

                    本节首先对双说话人场景对所提两阶段训练方法进行了系统验证, 通过与                         3D-Speaker 基线的对比实验, 展示
                 了监督微调及加权损失对         ASR  与说话人归属性能的影响, 并进一步引入             GRPO  强化学习以突破模型能力瓶颈;
                 随后, 本研究尝试将训练方法推广至四说话人的场景, 再次评估其在各种对话环境中的表现差异, 并通过消融实验
                 探讨各环节对整体性能的贡献. 本节表中             Average 指代∆cp  与∆SA  的均值.
   27   28   29   30   31   32   33   34   35   36   37