Page 260 - 《软件学报》2026年第6期
P. 260
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2579
10 3
−40 10 2
Cumulative reward −50 (714, −39.99) (11 276, −39.99) Value net loss 10 1
(781, −40.00)
−60
−70
0 5 000 10 000 15 000 20 000 10 0 0 5 000 10 000 15 000 20 000
Episodes Episodes
(e) 累计奖励: h~(0,0.1) (f) 价值网络损失: h~(0,0.1)
10 3
−40
Cumulative reward −50 (860, −40.00) Value net loss 10 2 1
(1 935, −39.99)
10
−60
−70 10 0
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes
(g) 累计奖励: h~(0,1) (h) 价值网络损失: h~(0,1)
图 7 Thrower 环境随机信息消融的性能曲线 (续)
5.5 参数敏感实验
为了测试算法受模型参数的影响状况, 本节测试了不同参数权重对性能带来的影响. 在动态环境随机信息由
N (0,0.01) 产生的 Thrower 环境中, 图 β、 因果模型单轮
高斯分布 8(a)、(b) 测试参数为因果模型的缓存池容量
优化网络批次采样数 J, 简写成“ CVF_buf_{β}_{J} ”; 图 8(c)、(d) 测试参数为隐变量的信息维度 d h , 简写成
“ hdim_{d h } ”; 图 8(e)、(f) 测试参数为因果模型的重构损失项权重 w recon 和因果模型的 KL 散度项权重 w KL , 简写为
CVF_loss_{w reccon }_{w KL } ”; 图 CVF_ppoclip_{δ} ”; 图 8(i)、(j)
“ 8(g)、(h) 测试参数为近端策略裁剪系数 δ, 简写为“
测试参数为强化折扣因子 γ, 简写为“ CVF_gamma_{γ} ”.
10 4
−30 PGVO_buf_10000_128
10 3 PGVO_buf_20000_256
PGVO_buf_40000_512
Cumulative reward −50 (529, −39.99) PGVO_buf_10000_128 Value net loss 10 2 1
(524, −39.96)
−40
PGVO_buf_80000_1024
(500, −39.99)
(513, −39.98)
10
PGVO_buf_20000_256
−60
PGVO_buf_40000_512 10 0
PGVO_buf_80000_1024
−70 10 −1
0 5 000 10 000 15 000 20 000 0 5 000 10 000 15 000 20 000
Episodes Episodes
(a) 累计奖励: 因果模型 buffer 采样容量组合对比 (b) 价值网络损失: 因果模型 buffer 采样容量组合对比
图 8 Thrower 环境噪声消融的性能曲线

