Page 249 - 《软件学报》2026年第6期
P. 249
2568 软件学报 2026 年第 37 卷第 6 期
.
变量组成的子集被表示为 PA i F 是一组函数的集合 { f 1 , f 2 ,..., f n }, 每个函数 f i 是其他变量集合 PA i ∪{U i } 到内生变
,
,
量子集 {Y i } 的映射. 函数和各个对应的变量集构成结构方程 Y i := f i (PA i ,U i ), 其中 U i ∈ U PA i ⊆ X\X i i = 1,2,...,n.
结构方程明确了因果方向, 刻画了系统内部的因果关系. SCM 的一个关键优势在于其模块化和可解释性. 通过将
复杂系统分解为相互关联的子模块. 这种模块化使得模型更容易构建、理解和维护, 同时也有助于识别关键的因
果关系和潜在的干预目标. 通过明确表示变量之间的因果关系, SCM 使研究者能够提出和回答关于系统行为的问
题, 识别关键的因果机制, 并估计因果效应.
3 隐变量因果模型和因果价值函数
3.1 隐变量因果模型
通过上述分析可知, 策略梯度算法的高方差问题主要源于环境中的外部扰动. 这些扰动通常表现为未观测的
随机信息, 且可能影响下一时刻可观测的状态. 这使得 t 时刻的状态除了依赖 t–1 时刻可观测的状态和动作外, 还
受到 t–1 时刻的未观测的随机扰动的影响, 从而使策略梯度估计的方差增大. 以 Gym 的 Lunar Lander 环境为例,
风就是一个典型的未观测随机信息. 其可能在智能体做出决策动作后, 扰动下一时刻返回的可观测状态信息. 在实
际环境中, 类似的未观测随机信息普遍存在, 例如机器人运行过程由于接触材料变化而引起的摩擦力变化或运输
车因为货物装卸而产生的不同负重等. 因此, 本文在传统深度强化学习中的马尔可夫决策过程五元组基础上, 引入
t
隐变量 h t 刻画 时刻的动态环境的未观测随机信息, 并假设存在隐变量 h t 指向下一时刻可观测状态信息 s t+1 的因
果边. 其因果关系如图 1(c) 所示. 因此, 在时刻 t 时, 含有隐变量的结构因果模型可以形式化为:
a t := f a (s t )
s t := f s (s t−1 ,a t−1 ,h t−1 ) (2)
r t := f r (s t ,a t , s t+1 )
3.2 因果价值函数
基于上述因果模型, 状态转移不仅取决于可观察状态信息和采取的动作, 还受到未观测随机信息的影响. 而奖
励函数会结合当前时刻的状态、动作和下一时刻的状态返回环境的反馈, 这也意味着未观测随机信息还可能影响
奖励信息. 在给定时刻 t 下的状态为 s t 时, 内生变量 r t 的结构方程可以展开为:
r t = f r (s t ,a t , s t+1 ) = f r (s t ,a t , f s (s t ,a t ,h t )) = f r (s t , f a (s t ), f s (s t , f a (s t ),h t )) (3)
可以得知与内生变量 r t 存在直接或间接因果关系的外生变量集合为 (s t ,h t ). 相同地, 在给定时刻 t+1 下的状态为
s t+1 , 通过结构因果模型的分析, 可以寻找与内生变量 r t+1 存在直接或间接因果关系的外生变量集合为 (s t ,h t ,h t+1 ).
∑ T
在给定时刻 t 下的状态为 s t 时, 从时刻 t 开始累计, 到轨迹最终结束的时刻 T 的轨迹回报为 G t = γ t ′ −t r t ′ ,
t ′ =t
所以与 G t 存在直接或间接因果关系的外生变量集合为 (s t ,h t ,h t+1 ,...,h T ). 为了方便表示, 引入从时刻 t 开始到轨迹
结束的所有隐变量序列的定义:
+
h ≜ (h t ,h t+1 ,...,h T ) (4)
t
+
因为价值函数 V 往往就是对轨迹回报 G t 的期望值的拟合, 所以 V 可以使用 (s t ,h ) 作为网络输入进行拟合. 故
t
提出因果价值函数 (CVF) 的定义如下所示:
+
V causal (s t ,h ) ≜ E τ∼π θ a [ G t |s t ,h + t ] (5)
t
根据公式 (3) 可知, 奖励函数会受到隐变量的干扰. 当采用状态价值函数 V (s t ) ≜ E τ∼π θ a [G t |s t ] 作为基线 V t 时,
s
+
动作优势函数 A t = G t −V t 的估计值会受到隐变量序列的影响. 这是因为轨迹回报 G t 受隐变量序列 h 的影响, 而状
t
+
态价值函数并未考虑隐变量序列 h 的影响, 导致动作优势估计存在较大方差. 在样本充足且隐变量均值为 0 的情
t
况下, 对动作优势估计值多次求平均可实现类似无偏的效果, 但会降低数据样本效率. 而且即使通过平均实现了动
+
作优势的无偏估计, 策略梯度在优化过程中仍会受到隐变量序列 h 的影响, 导致梯度估计的方差过大并影响收敛
t

