Page 264 - 《软件学报》2026年第6期
P. 264

蔡瑞初 等: 隐变量因果模型视角下的策略梯度方差优化                                                      2583


                 [6]   刘建伟, 高峰, 罗雄麟. 基于值函数和策略梯度的深度强化学习综述. 计算机学报, 2019, 42(6): 1406–1438. [doi: 10.11897/SP.
                    J.1016.2019.01406]
                 [9]   张峻伟, 吕帅, 张正昊, 于佳玉, 龚晓宇. 基于样本效率优化的深度强化学习方法综述. 软件学报, 2022, 33(11): 4217–4238. http://www.
                    jos.org.cn/1000-9825/6391.htm [doi: 10.13328/j.cnki.jos.006391]

                 作者简介
                 蔡瑞初, 博士, 教授, 博士生导师, CCF  高级会员, 主要研究领域为因果发现, 图神经网络, 领域自适应学习, 自然语言处理.
                 林富艺, 硕士生, 主要研究领域为强化学习, 因果发现.
                 陈薇, 博士, 讲师, 主要研究领域为机器学习, 因果推断, 因果强化学习.
                 朱海鹏, 硕士生, 主要研究领域为强化学习, 因果发现.
                 郝志峰, 博士, 教授, 博士生导师, CCF  专业会员, 主要研究领域为因果发现, 图神经网络, 领域自适应学习, 自然语言处理.
   259   260   261   262   263   264   265   266   267   268   269