Page 1 - Showing 6 of 6 postsView all posts by years →
- 9 Actor-Critic及其变种
值函数方法不擅于行动,策略梯度方法方差过高,由此产生将两者结合的 Actor-Critic:Actor 负责选择动作,Critic 负责评估好坏.
19 min - 6 资格迹
TD 算法存在一步更新的局限,是否有 TD 算法在线、低方差优点的同时,也拥有类似蒙特卡洛方法那样高效分配奖励的能力的算法——资格迹
35 min - 3 基于动态规划的强化学习方法
从贝尔曼方程到策略迭代、值迭代与截断策略迭代,自然生长出DP在强化学习中的完整方法体系
18 min - Git 操作命令
Git 常用操作命令速查表与参考指南
13 min - Git 清空历史
如何彻底清空 Git 提交历史并重新开始?四种方法详解
5 min - 1 强化学习概述
强化学习概述 - 基本概念、原理与分类
6 min