Page 255 - 《软件学报》2026年第6期
P. 255

2574                                                       软件学报  2026  年第  37  卷第  6  期


                    Lunar Lander 环境模拟了一艘月球着陆器在二维空间中通过控制其主引擎和侧推器实现平稳着陆的任务. 该
                 环境具有高维度的观测空间和离散的动作空间, 其奖励函数设计如下: 当着陆器成功着陆时可获得+100                                的奖励,
                 着陆器保持静止状态可获得+10          的奖励, 每个着陆腿与地面接触可获得+10            的奖励. 此外, 奖励值会随着着陆器与
                 着陆台之间的距离动态变化, 距离越近奖励越高; 同时着陆器的运动速度也会影响奖励值, 速度越慢奖励越高. 若
                 发生坠毁则获得−100      的惩罚, 且燃料消耗会产生相应的负向奖励. 本文选用的                 Lunar Lander 环境具有内置的风力

                 干扰机制. 通过配置      wind_power = 1.0 及  turbulence_power = 1.5 参数引入显著的环境动态随机性, 构建基准实验
                 环境用于评估各算法的性能表现.












                          (a) Lunar Lander 环境          (b) Thrower 环境               (c) Pusher 环境
                                                 图 4 OpenAI Gym  实验环境

                    Thrower 环境是一个基于 MuJoCo 物理引擎的三维任务, 模拟了一台机械臂将物体抛向指定目标区域. 该任务
                 需要控制机械臂的多个关节, 以生成合适的运动轨迹, 使得物体能够精确地到达目标区域. 环境的奖励函数主要由
                 物体与目标的欧氏距离的负值构成, 即距离目标越近奖励越高. 本文在 Thrower 环境的目标位置中增加均值为                               0,
                 标准差为   0.01  的高斯分布的随机变量, 以引入动态环境的随机性, 使实验环境具备较为明显的动态随机特性.
                    Pusher 环境同样基于 MuJoCo 物理引擎, 模拟了一台机械臂将物体推向目标位置的任务. Pusher 环境具有与
                 Thrower 环境相同的状态空间和动作空间结构, 但其奖励函数由机械臂末端与物体的距离、物体与目标的距离两
                 部分的负值构成. 本文也向        Pusher 环境的目标状态增加分布为         N(0,0.01) 的动态环境随机信息, 使实验环境存在
                 较为明显的动态环境随机信息.
                    通过比较在这些环境下使用          PPO [19] 、HVF [17] 和  PGVO 的表现, 可以更全面地评估  PGVO  的适用性和鲁棒性.
                  5.2   参数设置
                    本文在不同实验环境下, 使用         5 个随机种子   (12, 34, 56, 78, 90) 对各算法进行对比测试. 在离散环境    Lunar Lander
                 测试  5 000  回合, 连续环境  Thrower 和  Pusher 测试  20 000  回合, 每  100  个回合取奖励的平均值作为评估结果.
                    PGVO  的因果编码器     (causal encoder) 和因果解码器  (causal decoder) 均采用多层感知机  (multilayer perceptron,
                 MLP) 实现. 其中, 因果编码器以动作维度与两倍状态维度之和作为输入, 通过双输出结构分别输出均值和对数方
                 差, 输出维度均为隐变量维度. 基于该结构, 编码器利用重参数化技巧实现随机采样. 因果解码器以状态维度、动
                 作维度及隐变量维度之和作为输入, 输出维度与状态维度相同. 动作网络以可观测状态作为输入, 通过                               MLP  输出
                 动作空间维度的动作值. 价值网络采用双流架构, 包含状态处理和隐变量序列处理两个分支. 其中, 状态处理分支
                 通过  MLP  提取可观测状态特征, 隐变量序列处理分支利用               LSTM  网络提取隐变量序列特征. 最终将两个分支的
                 特征拼接, 通过    MLP  网络输出标量价值估计.
                    为保证实验的公平性和可比性, 本文统一配置了各算法的网络结构和超参数. PPO                         的动作网络结构与       PGVO
                 保持一致, 其价值网络直接以可观测状态作为输入. HVF                的后见向量    (hindsight vector) 维度与  PGVO  的隐变量维
                 度相同, 其动作网络和价值网络也和           PGVO  使用相同的网络架构. 具体超参数配置如后文表               1  所示.
                  5.3   实验结果
                    经过第   3.2  节探讨, 动态环境中的未观测随机信息会导致策略梯度估计存在较大方差. 这一问题主要表现为:
                 其一, 训练过程不稳定, 参数更新方向存在较大波动, 影响策略的收敛速度; 其二, 过大的方差可能使策略更新偏离
                 最优方向, 导致算法无法收敛至理想性能. 针对环境随机性引起的策略梯度高方差问题, 本文重点关注以下两个性
   250   251   252   253   254   255   256   257   258   259   260