Page 254 - 《软件学报》2026年第6期
P. 254
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2573
算法 2. 基于隐变量因果模型的策略梯度算法的网络训练方法.
{ }
{ }
(l)
(l)
(l)
(l)
(l)
(l)
(l)
(l)
(l)
(1)
(L) (l)
(0)
输入: L 条完整轨迹 τ ,τ ,...,τ τ = s ,a ,r , s ,a ,r ,..., s ,a ,r , s (l) , 强化样本采样比例 ρ, 迭代次数
0 0 0 1 1 1 T T T T+1
F φ , 已完成训练的因
I, 折扣因子 γ, 因果价值网络 F θ CVF , 动作网络 F θ a , 熵的损失加权 ω e , 裁剪系数 δ, 因果编码网络
φ;
果编码网络参数
输出: 因果价值网络参数 θ CVF , 动作网络参数 .
θ a
1. 初始化 F θ CVF , F θ a
2. for l = 1 : L do
3. for t = 0 : T do
( )
(l)
(l)
(l)
(l)
4. 推断隐变量均值和标准差: µ t , σ t = F φ s t ,a t , s (l)
t+1
( )
[ (l) ] 2
(l)
(l)
5. 重参数化: h t ∼ N µ t , σ t I
( )
6. 计算更新前动作对数概率和熵: (l) (l) (l)
log pa_old t ,e_old t = F θ a s t
( (l) + )
(l)
(l)
7. 计算更新前价值评估: V_old t = F θ a s t ,h t
∑ T
(l)
8. 计算轨迹回报: G t = γ t ′ −t (l)
t
r ′
t ′ =t
(l)
(l)
9. 计算动作优势估计值: A t = G t −V_old t (l)
10. end for
11. end for
12. for i = 1 : I do
13. for l = 1 : L do
14. for t = 0 : T do
( )
(l) (l) (l) (l) (l)
15. 更新动作对数概率 log pa t 和熵 e t : log pa t ,e t = F θ a s t
( )
16. 更新价值评估: (l) (l) (l) +
V t = F θ a s t ,h t
17. end for
18. end for
{ } { } { } {
(ρ)
(ρ)
(ρ)
19. 从 L 条完整轨迹的数据中采样: A ,...,A (ρ) , log pa_old ,...,log pa_old (ρ) , log pa ,...,log pa (ρ) , e ,...,
(ρ)
1 K 1 K 1 K 1
} { } { }
(ρ) (ρ) (ρ) (ρ) (ρ)
e K , G ,...,G K , V ,...,V K
1
1
(ρ)
(ρ)
20. 计算新旧策略比率为: α k = exp(log pa_old −log pa )
k k
1 K ∑{ [ ] }
(ρ)
21. 计算动作网络损失项: L a = − min α k ,clip(α k ,1−δ,1+δ) A +ω e e (ρ)
K k k
k=1
1 K ∑
(ρ)
2
(ρ)
22. 计算因果价值网络损失项: L v =
G −V
k
k
K
k=1
23. 根据动作网络损失项, 更新 θ a
24. 根据因果网络损失项, 更新 θ CVF
25. end for
5 实验结果与分析
5.1 实验环境
本文选择使用 OpenAI Gym 平台中的 3 个经典环境: Lunar Lander、 Thrower 和 Pusher 作为实验环境, 如图 4
所示. OpenAI Gym 是一个流行的深度强化学习环境平台, 提供了丰富多样的环境供研究者开展实验, 涵盖了从基
础控制任务到复杂模拟环境的多种场景.

