Back
值函数方法不擅于行动,策略梯度方法方差过高,由此产生将两者结合的 Actor-Critic:Actor 负责选择动作,Critic 负责评估好坏.
强化学习
actor-critic
TD 算法存在一步更新的局限,是否有 TD 算法在线、低方差优点的同时,也拥有类似蒙特卡洛方法那样高效分配奖励的能力的算法——资格迹
资格迹
从贝尔曼方程到策略迭代、值迭代与截断策略迭代,自然生长出DP在强化学习中的完整方法体系
动态规划
强化学习概述 - 基本概念、原理与分类