Page 260 - 《软件学报》2026年第6期
P. 260

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2579



                                                                10 3
                            −40                                 10 2
                           Cumulative reward  −50  (714, −39.99)  (11 276, −39.99)  Value net loss  10 1

                                  (781, −40.00)

                            −60

                            −70
                                0    5 000  10 000  15 000  20 000  10 0  0  5 000  10 000  15 000  20 000
                                          Episodes                            Episodes
                                     (e) 累计奖励: h~(0,0.1)               (f) 价值网络损失: h~(0,0.1)
                                                                10 3
                            −40
                           Cumulative reward  −50  (860, −40.00)  Value net loss  10 2 1

                                   (1 935, −39.99)

                                                                10
                            −60

                            −70                                 10 0
                                0    5 000  10 000  15 000  20 000  0    5 000  10 000  15 000  20 000
                                          Episodes                            Episodes
                                      (g) 累计奖励: h~(0,1)                (h) 价值网络损失: h~(0,1)
                                         图 7 Thrower 环境随机信息消融的性能曲线           (续)
                  5.5   参数敏感实验
                    为了测试算法受模型参数的影响状况, 本节测试了不同参数权重对性能带来的影响. 在动态环境随机信息由
                        N (0,0.01) 产生的  Thrower 环境中, 图                                    β、 因果模型单轮
                 高斯分布                                 8(a)、(b) 测试参数为因果模型的缓存池容量
                 优化网络批次采样数         J, 简写成“  CVF_buf_{β}_{J}  ”; 图  8(c)、(d) 测试参数为隐变量的信息维度       d h , 简写成
                 “  hdim_{d h } ”; 图  8(e)、(f) 测试参数为因果模型的重构损失项权重    w recon  和因果模型的  KL  散度项权重  w KL , 简写为
                  CVF_loss_{w reccon }_{w KL } ”; 图                              CVF_ppoclip_{δ} ”; 图  8(i)、(j)
                 “                       8(g)、(h) 测试参数为近端策略裁剪系数         δ, 简写为“
                 测试参数为强化折扣因子         γ, 简写为“  CVF_gamma_{γ} ”.

                                                               10 4
                          −30                                                 PGVO_buf_10000_128
                                                               10 3           PGVO_buf_20000_256
                                                                              PGVO_buf_40000_512
                          Cumulative reward  −50  (529, −39.99)  PGVO_buf_10000_128  Value net loss  10 2 1
                                 (524, −39.96)
                          −40
                                                                              PGVO_buf_80000_1024
                                 (500, −39.99)
                                 (513, −39.98)
                                                               10
                                          PGVO_buf_20000_256
                          −60
                                          PGVO_buf_40000_512   10 0
                                          PGVO_buf_80000_1024
                          −70                                  10 −1
                               0    5 000  10 000  15 000  20 000  0    5 000  10 000  15 000  20 000
                                         Episodes                            Episodes
                            (a) 累计奖励: 因果模型 buffer 采样容量组合对比     (b) 价值网络损失: 因果模型 buffer 采样容量组合对比
                                             图 8 Thrower 环境噪声消融的性能曲线
   255   256   257   258   259   260   261   262   263   264   265