Page 250 - 《软件学报》2026年第6期
P. 250
蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化 2569
h 对轨迹回
+
速度和收敛时累计奖励的性能. 因此, 本文采用因果价值函数作为基线 V t , 以此充分考虑隐变量序列
t
报 G t 的影响, 提高动作优势预估的准确性并降低策略梯度的方差.
+
A t = G t −V causal (s t ,h ) (6)
t
定理 1. 假设数据的生成机制满足公式 (2), 那么基于因果价值函数的策略梯度估计是无偏的.
证明: 引入因果价值函数作为基线函数后, 策略梯度可以表示为:
[( causal ) ( ) ]
G(τ)−V
∇ θ a J(θ a ) = E τ∼π θa ∇ θ a log p τ|π θ a
T
∑( )
( )
causal +
= E s 0:T+1 ,a 0:T ,r 0:T G t −V s t ,h ∇ θ a logπ θ a (a t |s t )
t
t=0
T T
∑ ∑
( )
causal +
= E s 0:T+1 ,a 0:T ,r 0:T G t ∇ θ a logπ θ a (a t |s t ) −E s 0:T+1 ,a 0:T V s t ,h ∇ θ a logπ θ a (a t |s t ) (7)
t
t=0 t=0
T ∑ ( )
+
根据环境的因果模型展开, V causal ( s t ,h + t ) 中 s t 和h 都不是关于 a t 的函数, 且 V causal s t ,h ∇ θ a logπ θ a (a t |s t ) 涉及
+
t
t
t=0
s 0:T 、 s T+1 , 可得:
的 h 0:T 和 a 0:T 都不依赖于
T T
∑ ∑
causal ( + ) causal ( + )
t
E s 0:T+1 ,a 0:T V s t ,h ∇ θ a logπ θ a (a t |s t ) = E s 0:T ,a 0:T V s t ,h ∇ θ a logπ θ a (a t |s t )
t
t=0 t=0
T ∑
[ ( ) ]
+
= E s t ,a t V causal s t ,h ∇ θ a logπ θ a (a t |s t )
t
t=0
{ ( ) [ ] }
T ∑
+
= E s t V causal s t ,h ×E a t ∇ θ a logπ θ a (a t |s t )
t
t=0
T ∑
[ ( ) ]
+
= V causal s t ,h ×0
t
E s t
t=0
= 0 (8)
T
∑
综合公式 (7) 和 (8), 易证 J(θ a ) = E s 0:T+1 ,a 0:T ,r 0:T (a t |s t ) , 故定理 1 成立.
∇ θ a
G t ∇ θ a logπ θ a
t=0
定理 2. 相对于以状态价值函数作为基线函数, 基于因果价值函数的策略梯度算法在动作优势估计值上的方
差更小.
证明: 引入因果价值函数作为基线函数后, 策略梯度估值中动作优势估计值的方差为:
]
[ ( ) ] ⟨ {[ ( ) }⟩ ⟨ {[ ( ) }⟩
]
V G t −V causal s t ,h + t = E V G t −V causal s t ,h + s t ,h + t +V E G t −V causal s t ,h + s t ,h + t
t
t
[ ( )] { [ ( ) ]} { ( ) [ ( ) ]}
= E V G t s t ,h + −E V V causal s t ,h s t ,h + +V E G t s t ,h + −E V causal s t ,h s t ,h +
+
+
t t t t t t
[ ( )] { ( ) [ ( ) ]}
+
= E V G t s t ,h + +V E G t s t ,h + −E E G t |s t ,h s t ,h +
t t t t
[ ( )] { ( ) ( ) }
= E V G t s t ,h + t +V E G t s t ,h + t −E G t |s t ,h + t
[ ( )]
= E V G t s t ,h + (9)
t
{ } { [ ]}
[ ] { [ ]} 2 [ ] 2 causal ( ) +
+
其中, 由 V f (x)|x = E⟨ f(x)−E f(x)|x ⟩ = E f(x)− f(x) = 0, 可知 E V V s t ,h s t ,h = 0. 结合公式 (5) 给
t t
出的因果价值函数定义, 可推导出公式 (9) 第 3 个等式.
使用状态价值函数作为基线函数时, 策略梯度估值中动作优势估计值的方差为:
{ [ ( )] [ ( )]}
s
V[G t −V (s t )] = E[V(G t |s t )] = E E V G t s t ,h + +V E G t s t ,h +
t t
[ ( )] { [ ( )]}
= E V G t s t ,h + t +E V E G t s t ,h + t
[ ( )] [ ( ) ]
⩾ E V G t s t ,h + = V G t −V causal s t ,h + (10)
t t
其中, 利用公式 (9) 的证明逻辑可以证明公式 (10) 第 1 个等式, 利用 V(y) = E V(y|x) +V E(y|x) 可以证明公式 (10)
]
[
]
[

