StarX

Back

资格迹#

前面我们学习了 TD 算法,它只根据眼前的即时奖励 Rt+1R_{t+1} 和下一状态的价值 V(St+1)V(S_{t+1}) 来调整自己的估计.

而我们的问题是,能不能再保留 TD 算法在线、低方差优点的同时,也拥有类似蒙特卡洛方法那样高效分配奖励的能力——资格迹


1. 回顾与动机:一步更新的局限#

我们将之前所学习的 TD 算法记为 TD(0)\text{TD}(0),后面大家会明白这一符号的含义.在状态序列中,我们执行更新:

V(St)V(St)+α[Rt+1+γV(St+1)V(St)],V(S_t) \leftarrow V(S_t) + \alpha \big[ R_{t+1} + \gamma V(S_{t+1}) - V(S_t) \big],

它只利用紧接着的一步奖励来更新前一个状态的价值.这带来两个问题:

  • 信息传播速度慢.当一个 episode 末尾才出现明显的奖励信号(比如走到终点获得 +1),TD(0)\text{TD}(0) 需要沿着经历的顺序,一个状态一个状态地把奖励信息往回“倒灌”,这个过程可能极其漫长.

  • 信用分配的偏差.如果某一步的状态变动触发了后来一系列好的结果,但 TD(0)\text{TD}(0) 只把功劳或责任归给前一个状态,更早的状态需要多次重复经历才能获得公平的分配.

Monte Carlo 方法,需要等到 episode 结束后,用全部剩余奖励的折扣和 GtG_t 来更新沿途的每一个状态:

V(St)V(St)+α[GtV(St)],V(S_t) \leftarrow V(S_t) + \alpha \big[ G_t - V(S_t) \big],

其信息传播是“瞬间”的,整个轨迹上的所有状态同时获得更新.但它的代价是高方差——因为必须走完一个完整的 episode,奖励序列中的随机噪声全部累积了起来,且必须等 episode 结束才能学习,无法在线更新.

信息传播速度慢

假设一个简单状态序列 s0s_0s1s_1s2s_2s3=Goals_3=\text{Goal}r1=r2=0r_1=r_2=0r3=1r_3=1. 终点状态 V(s3)=0V(s_3)=0,折扣因子 γ\gamma,学习率 α\alpha.

1)TD(0)\text{TD}(0)

目的:对 π\pi 评估.初始化 V(s)=0,sV(s)=0,\forall s. 根据 TD 更新公式

episode 1:

V(s0)=V(s1)=0,V(s2)=0+α[1+00]=α.\begin{aligned}& V(s_0)=V(s_1)=0,\\& V(s_2)=0+\alpha[1+0\cdot 0]=\alpha.\end{aligned}

episode 2:

V(s0)=0, V(s1)=0+α[0+γV(s2)0]=α2γ,V(s2)=α+α[1α]=2αα2.\begin{aligned}& V(s_0)=0,\ V(s_1)=0+\alpha[0+\gamma V(s_2)-0]=\alpha^2\gamma,\\ & V(s_2)=\alpha+\alpha [1-\alpha]=2\alpha-\alpha^2.\end{aligned}

episode 3:

V(s0)=0+α[0+γV(s1)0]=α3γ2,V(s1)=α2γ+α[γ(2αα2)α2γ]=3α2γ2α3γ,V(s2)=.\begin{aligned}& V(s_0)=0+\alpha[0+\gamma V(s_1)-0]=\alpha^3\gamma^2, \\& V(s_1)=\alpha^2\gamma+\alpha[\gamma(2\alpha-\alpha^2)-\alpha^2\gamma]=3\alpha^2\gamma-2\alpha^3 \gamma, \\& V(s_2)=\ldots. \\\end{aligned}

可以看到,每一个 episode 只传播一点.在 episode 1 中,想要更新 s0,s1s_0,s_1 的价值,只能等下一个 episode. 由于 TD(0)\text{TD}(0)一次更新只看一步,它并不知道后面还有多远,因此 TD(0)\text{TD}(0)的信息传播速度慢.

2)Monte Carlo

Monte Carlo 在一次 episode 结束后,知道整条轨迹的最终回报,其看到了每一步的奖励.针对上述序列问题,已知 r1,r2,r3r_1,r_2,r_3,那么可直接计算得到 G0,G1,G2G_0,G_1,G_2,从而得到各状态的价值,即 Monte Carlo 能更快地传播奖励信息

【注】信息传播速度快 \neq 收敛速度快:TD(0)\text{TD}(0)只利用一步信息,若环境随机,则更新时只受一步随机性的影响;而 Monte Carlo 依赖整条轨迹,任何一步随机变化都会影响,每次更新存在较大方差,使得更新可能一直剧烈震荡.TD 由于单步地逐步学习,后续状态价值会越来越稳定,更新波动会小很多,因而一般情况下收敛更稳定,收敛速度更快.但若为确定性环境,如上述的确定状态序列,明显 Monte Carlo 的收敛速度更快.

信用分配的偏差

偏差: 指代作用权重、资格分配不完整.

假设一个简单状态序列 s0s_0s1s_1s2s_2s3=Goals_3=\text{Goal}r1=r2=0r_1=r_2=0r3=1r_3=1. 终点状态 V(s3)=0V(s_3)=0,折扣因子 γ\gamma,学习率 α\alpha.

  • TD(0)\text{TD}(0)

episode 1: V(s0)=V(s1)=0,V(s2)=αV(s_0)=V(s_1)=0,V(s_2)=\alpha,即 s0,s1s_0,s_1 没有奖励,没有贡献,s2s_2 得到奖励,有贡献. 但这样的表述明显不对:正是由 s1s2s_1\to s_2s2s_2 才能到达 s3s_3,同样地有 s0s1s_0\to s_1.由此出现了短暂的、不完整的分配.

原因: TD(0)\text{TD}(0) 只看到了下一步,如对于 s0s_0 来说不知道再走两步便到达 Goal.

TD(0)\text{TD}(0):第一次只奖励 s2s_2,第二次奖励 s1s_1,第三次奖励 s0s_0,因此更早的状态需要多次重复经历才能获得更完整公平的信用分配.

  • Monte Carlo

整个 episode 结束后,知道最终到达 Goal(s3s_3),且知道每一步奖励,可以直接计算每个状态真正经历得到的回报.

对于 Monte Carlo 来说,其所谓的高效分配,即是对轨迹中的状态,按照之后真正获得的累计回报来分配 直观上,s2s_2 距 Goal(s3s_3)最近,价值最大,s1s_1 可以到达距离 Goal 更近的 s2s_2,也有价值,而 s0s_0 虽然距 Goal 远,但最终还是可以到到 Goal,因此也分配一定的价值.

TD(0)\text{TD}(0)Monte Carlo
在线,更新及时,低方差高效分配奖励,信息传播快
分配奖励低效,信息传播慢需等待 Episode 结束,高方差,样本利用率低

于是,一个自然的想法出现了:能不能在每一步都进行更新,但更新的幅度不仅仅影响当前状态的前一个状态,而是根据某种“责任资格大小”,把当前观察到的 TD 误差扩散到之前访问过的多个状态上?

这就是资格迹要解决的核心问题.


2. 前向视角:λ回报——多步回报的加权融合#

在引入资格迹的机制之前,我们先从前向视角(或称理论视角)来看理想的目标是什么.

我们已经知道 TD(0)\text{TD}(0) 的目标是 1 步回报:

Gt(1)=Rt+1+γV(St+1).G_t^{(1)} = R_{t+1} + \gamma V(S_{t+1}).

蒙特卡洛的目标是无穷步回报 GtG_t,即在终止前累积的真实奖励.那么,介于两者之间的便是 nn 步回报

Gt(n)=Rt+1+γRt+2++γn1Rt+n+γnV(St+n).G_t^{(n)} = R_{t+1} + \gamma R_{t+2} + \dots + \gamma^{n-1} R_{t+n} + \gamma^n V(S_{t+n}).

nn 步回报既含有 nn 步的真实奖励,又以 nn 步后状态的当前价值作为剩余回报的估计.

  • n=1n=1 时,方差小,有偏;
  • n=2n=2 时,多了一步真实奖励;
  • n=3n=3 时,真是奖励更多,估计值更少. 因此,随着 nn 增加,一般情况下偏差减小,方差增大.

我们可以选择任何一个 nn 作为更新的目标,但不一定只选一个固定的 nn,因此我们可以采用不同 nn 值的线性组合对参数进行更新,并使它们的权重值和为 11. 根据这样的思路,便产生一种特定权重的分配方式,即 TD(λ)\text{TD}(\lambda)前向算法(λ-回报算法).

λ-回报 的做法是,对所有的 nn 步回报做一个指数衰减的加权平均

Gtλ=(1λ)n=1λn1Gt(n),G_t^\lambda = (1-\lambda) \sum_{n=1}^{\infty} \lambda^{n-1} G_t^{(n)},

此时中间的 λ\lambda 值让我们在偏差方差之间连续调节:λ\lambda 越小,更多依赖有偏但低方差的 TD 估计;λ\lambda 越大,更多依赖无偏但高方差的实际奖励.

当轨迹为有限 TT 步时,此时

Gtλ=(1λ)n=1Tt1λn1Gt(n)+λTt1Gt.G_t^{\lambda}=(1-\lambda)\sum_{n=1}^{T-t-1} \lambda^{n-1}G_t^{(n)}+\lambda^{T-t-1}G_t.

这里,λ[0,1]\lambda \in [0,1].当 λ=0\lambda=0 时,Gtλ=Gt(1)G_t^\lambda = G_t^{(1)},退化为 TD(0)\text{TD}(0);当 λ=1\lambda=1 时,为 Monte Carlo 回报 GtG_t(在 episodic 情况下,并假设对终止状态 V=0V=0).最终我们得到 TD 目标,可以进行值函数更新:

V(St)V(St)+α(GtλV(St)).V(S_{t})\leftarrow V(S_t)+\alpha (G_t^{\lambda}-V(S_t)).

前向视角对于每个访问到得状态 ss,从它开始向前看所有得未来状态,并决定如何结合未来状态得回报来更新当前状态 ss 的值函数 V(St)V(S_t) .每更新完当前状态 ss,就转移至下一状态 ss',且不再回头关心已更新的状态 ss.也就是说,前向视角是通过观看未来状态的回报估计当前状态的值函数.

例 1:状态随机游走

想象一排 21个状态,从左端 -10 走到右端 +10,每步等概率向左或向右,到达两端 episode 终止,奖励只有到达 +10 时 +1,其他 0.

  • 如果采用 TD(0)\text{TD}(0)(λ=0),价值信息必须从终点逐步向相邻状态传播.在 100 个 episode 训练后,远离终点的状态价值依然接近 0.
  • 如果采用 MC(λ=1),每个 episode 结束后,整条路径上的状态都根据最终奖励更新,信息瞬间传遍,但因每个 episode 路径长度差异大,方差很高,学习曲线震荡剧烈.
  • 取一个中间值,如 λ=0.5 或 0.7,能用明显更少的 episode 达到更低的均方根误差.这就是 λ-回报的优势:结合两者优势,加速学习.

然而,从实现角度看,λ回报要求我们在 episode 结束时才能计算,因为 GtλG_t^\lambda 依赖于未来的奖励和状态价值,这显然不是一种在线、逐步更新的算法.那么,有没有一种方式能在每一步立即进行更新,却等价于前向的 λ-回报?答案就是资格迹.


3. 资格迹的引入:TD(λ) 后向视角#

由于前向视角在估计值函数时,每一个时间步都需要用到很多步之后的信息,在工程上十分不高效.我们需要一种无需等到实验结束就可以更新当前状态的值函数更新方法.

资格迹提供了一种后向视角:我们不再等着未来回报再去平均,而是每经历一步,立即计算 TD 误差 δt\delta_t,然后把这个误差分配给过去访问过的所有状态,分配的比例由一个称为资格迹的变量 Et(s)E_t(s) 决定.

直觉上,一个状态如果最近经常被访问,它就更“有资格”接受当前的 TD 误差的更新.资格迹更新方式如下 E0(s)=0E_0(s)=0

Et(s)={γλEt1(s)+1,s=St,γλEt1(s),sSt.E_t(s) = \begin{cases} \gamma \lambda E_{t-1}(s) + 1, & s = S_t, \\ \gamma \lambda E_{t-1}(s), & s \neq S_t. \\ \end{cases}

其被称为 累积型资格迹,表示 tt 时刻状态 ss 对应的资格迹, 其含义是:

  • 每当一个状态被访问,它的迹增加 1(“被访问则给它加上一份资格”).
  • 之后,所有状态的迹都按原来 γλ\gamma \lambda 的速率衰减(“随着时间的流逝,过去状态的资格逐渐消退”).
  • γ\gamma 是折扣因子;λ\lambda 控制衰减的速度,称迹退化参数.λ\lambda 越小,迹消失得越快,更新就越集中在最近的状态;λ\lambda 越大,迹越持久,更新越接近均匀地分配给所有过去状态.

TD(λ)\text{TD}(\lambda) 的更新为:

δt=Rt+1+γVt(St+1)Vt(St),\delta_t = R_{t+1} + \gamma V_t(S_{t+1}) - V_t(S_t), Vt+1(s)=Vt(s)+αδtEt(s),s.V_{t+1}(s) = V_t(s) + \alpha \delta_t E_t(s), \quad \forall s.

也就是说,每一步的 TD 误差,都按照当前每个状态的资格迹权重来,更新其价值.那些最近被访问、且 λ\lambda 较大的状态,会获得较大的更新幅度;很久以前的状态迹已经衰减殆尽,几乎不会被更新.

特别地,λ=0\lambda=0 时,即 TD(0)\text{TD}(0),此时资格迹为

Et(s)={1,s=St,0sSt.E_t(s) = \begin{cases} 1, & s = S_t, \\ 0 & s \neq S_t. \\ \end{cases}

更新变为

{Vt+1(s)=Vt(s)+αδt,s=St,Vt+1(s)=Vt(s),sSt,\begin{cases} V_{t+1}(s) = V_t(s) + \alpha \delta_t, & s=S_t, \\ V_{t+1}(s)=V_t(s), & s\neq S_t, \\ \end{cases}

即一个 TD 误差 δt\delta_t 只更新当前状态 StS_t.

例 2:简单状态序列的迹演化

假设一个简单状态序列 s0s_0s1s_1s2s_2s3=Goals_3=\text{Goal} .折扣因子 γ\gamma,迹退化参数 λ\lambda,初始化所有 V=0V=0,迹为 00.

  • s0s_0s1s_1,迹 E(s0)E(s_0) =1,其它为 00.计算 δ0\delta_0 ,此时仅更新 V(s0)V(s_0).

  • s1s_1s2s_2E(s0)E(s_0) 衰减为 γλ\gamma\lambdaE(s1)=1E(s_1)=1,计算 δ1\delta_1 ,此时更新 VV 会同时影响 s0s_0s1s_1,但 s0s_0 的影响权重小于 s1s_1.

  • s2s_2s3s_3E(s0)=(γλ)2E(s_0)=(\gamma\lambda)^2E(s1)=γλE(s_1)=\gamma\lambdaE(s2)=1E(s_2)=1.此时到达终点 s3s_3 获得 +1+1 奖励,误差 δ2\delta_2 较大.该误差会依据迹的权重同时更新 s0,s1,s2s_0,s_1,s_2s0s_0 因衰减系数得到较小的更新,s2s_2 得到较大的更新.

    另一方面,在 TD(0)\text{TD}(0) 中,每一步只更新当前状态,到达终点时,得到 +1+1 奖励与误差 δ2\delta_2,但只有 s3s_3 的前一个状态 s2s_2 被更新,而要更新 s0s_0 需要很多次重复经历.资格迹正好弥补了这一缺陷.

TD(λ)\text{TD}(\lambda)资格迹分配:越近期的状态,对当前 TD 误差贡献越直接,因此获得更多更新;越早的状态,虽然贡献较小,但仍然能立即获得部分奖励,而不需要等待多个 episode.


4. 资格迹的变种:替换迹与其他#

累积型资格迹中

Et(s)={γλEt1(s)+1,s=St,γλEt1(s),sSt.E_t(s) = \begin{cases} \gamma \lambda E_{t-1}(s) + 1, & s = S_t, \\ \gamma \lambda E_{t-1}(s), & s \neq S_t. \\ \end{cases}

γλEt1(s)\gamma \lambda E_{t-1}(s) 代表频率启发式,指将资格分配给较频繁的状态;示性函数 IsStI_{sS_t} 代表最近启发式 ,指将资格分配个给最近的状态.在状态被反复快速访问时,可能会使得迹过大,导致更新过度.一种常用的改进是替代型资格迹,其更新规则变为:

Et(s)={γλEt1(s),sSt,1,s=St,E_t(s) = \begin{cases} \gamma \lambda E_{t-1}(s), & s \neq S_t, \\ 1, & s = S_t, \end{cases}

即每次进入一个状态时,直接将其迹重置为 1,而不是累加.这避免了某些被循环访问的状态迹值无限制增长,通常在部分可观测或频繁重复访问的状态空间中效果更优.

5. 前向算法与后向算法的统一#

前向视角与后向视角在更新值函数时采用的方式不同:前向视角需要等到一次 episode 结束后更新当前状态的值函数,更新完当前状态的值函数后,此状态的值函数就不再改变;后向视角不需要等到轨迹结束,在每个时间步计算完当前状态的 TD 误差后,其它状态的值函数需要利用当前状态的 TD 误差进行更新.它在每个时间步都在进行值函数更新,是增量式更新方法.

资格迹后向更新的 TD(λ)\text{TD}(\lambda) 为什么能做到与离线的前向 λ 回报等价?

设想我们把一个 episode 所有步的更新累加起来.后向视角的在线更新在每步使用该时刻的 VV值,而前向视角在所有数据已知后统一计算.当 α 足够小(或采取离线更新,即在 episode 结束后一次性应用所有 δ 但保持过程中 V 不变),两种视角在总量上完全等价.

等价的关键在于,每个奖励 Rt+kR_{t+k} 对某个状态价值估计的贡献,通过迹机制恰好以权重 (γλ)k1(\gamma\lambda)^{k-1} 分配到 k 步之前的状态,这与 λ 回报中 n 步回报的加权系数完美匹配.因此:

tαδtEt(s)等价于α(GsλV(s)).\sum_{t} \alpha \delta_t E_t(s) \quad \text{等价于} \quad \alpha \big( G_s^\lambda - V(s) \big).

这说明 TD(λ)\text{TD}(\lambda) 本质上就是在一步步实现对 λ 回报的逼近,但以一种真正的在线、增量式、内存高效的方式完成.这也是资格迹被称为强化学习“时间桥梁”的原因.

前向视角中 λ\lambda 权重的分配与前后向视角的统一

TD(λ)\text{TD}(\lambda)的前向视角中,定义了 λ\lambda -回报为所有 nn 步回报的加权平均

Gtλ=(1λ)n=1λn1Gt(n),G_t^\lambda = (1-\lambda) \sum_{n=1}^{\infty} \lambda^{n-1} G_t^{(n)},

其中第 nn 步回报的权重为

wn=(1λ)λn1.w_n=(1-\lambda)\lambda^{n-1}.

可能会问为什么要这样进行权重分配,实际上该权重呈几何级数(衰减).

  • 权重需要构成一个概率分布,即权重之和为 11 :

n=1(1λ)λn1=(1λ)11λ=1.\sum_{n=1}^{\infty}(1-\lambda)\lambda^{n-1}=(1-\lambda)\cdot \frac{1}{1-\lambda}=1.

  • 几何分布的“无记忆性”: 几何分布是唯一具有无记忆性的离散分布.

几何分布

XG(p)pk=P(X=k)=p(1p)k1,k=1,2,.0<p<1.X\sim G(p)\Leftrightarrow p_k=P(X=k)=p(1-p)^{k-1},k=1,2,\ldots.\quad 0<p<1.

Thm.XG(p)X\sim G(p),则对任意正整数 m,nm,n,有

P(X>m+nX>m)=P(X>n).P(X>m+n\mid X>m)=P(X>n).

从直观上理解 λ\lambda - 回报的构造过程:站在时刻 tt,有两种选择:

  1. 以概率 (1λ)(1-\lambda) 停下,使用 1 步回报 Gt(1)G_t^{(1)}
  2. 以概率 λ\lambda 继续走,在时刻 t+1t+1,面临相同的选择 这就产生了一个递归结构

Gtλ=(1λ)Gt(1)+λ[(1λ)Gt(2)+λ[(1λ)Gt(3)+]].G_t^{\lambda}=(1-\lambda)G_t^{(1)}+\lambda[(1-\lambda)G_t^{(2)}+\lambda[(1-\lambda)G_t^{(3)}+\cdots]].

最终展开后即得

Gtλ=(1λ)n=1λn1Gt(n).G_t^{\lambda}=(1-\lambda)\sum_{n=1}^{\infty}\lambda^{n-1}G_t^{(n)}.

  • 从前向视角 λ\lambda-回报到后向视角资格迹

在终止型任务中

Gtλ=(1λ)n=1Tt1λn1Gt(n)+λTt1Gt,G_t^{\lambda}=(1-\lambda)\sum_{n=1}^{T-t-1} \lambda^{n-1}G_t^{(n)}+\lambda^{T-t-1}G_t,

其中

Gt(n)=Rt+1+γRt+2++γn1Rt+n+γnV(St+n).G_t^{(n)} = R_{t+1} + \gamma R_{t+2} + \dots + \gamma^{n-1} R_{t+n} + \gamma^n V(S_{t+n}).

TD误差

δk=Rk+1+γV(Sk+1)V(Sk).\delta_k=R_{k+1}+\gamma V(S_{k+1})-V(S_k).

考虑离线 TD(λ)\text{TD}(\lambda),即整个 episode 期间不改变状态价值,只记录所有 TD 误差和资格迹,等 episode 结束后一次性完成更新,此时在整个 episode 中,有

V0(s)=V1(s)==VT(s).V_0(s)=V_1(s)=\cdots=V_T(s).

最后统一更新

V(s)V(s)+Δ(s),V(s)\leftarrow V(s)+\Delta(s),

则有式(1)

k=tT1(λγ)ktδk=δt+λγδt+1+(λγ)2δt+2++(λγ)Tt1δT1=Rt+1+γV(St+1)V(St)+λγ(Rt+2+γV(St+2)V(St+1))+(λγ)2(Rt+3+γV(St+3)V(St+2))++(λγ)Tt1(RT+γV(ST)V(ST1))=Rt+1+λγRt+2+(λγ)2Rt+3+V(St)+(1λ)γV(St+1)+(1λ)λγ2V(St+2)+(1λ)λ2γ3V(St+3)++(1λ)λTt2γTt1V(ST1)+λTt1γTtV(ST).\begin{aligned}\sum_{k=t}^{T-1}(\lambda\gamma)^{k-t}\delta_k = & \delta_t+\lambda\gamma\delta_{t+1}+(\lambda\gamma)^2\delta_{t+2}+\cdots+(\lambda\gamma)^{T-t-1}\delta_{T-1} \\ = & R_{t+1} +\gamma V(S_{t+1})-V(S_t) + \\ & \lambda\gamma( R_{t+2} + \gamma V(S_{t+2})- V(S_{t+1})) + \\ & (\lambda\gamma)^2 (R_{t+3}+\gamma V(S_{t+3})-V(S_{t+2})) + \\ & \cdots + \\ & (\lambda\gamma)^{T-t-1}(R_T+\gamma V(S_T)-V(S_{T-1})) \\ = & R_{t+1}+\lambda\gamma R_{t+2}+(\lambda\gamma)^2 R_{t+3}+\cdots \\ & -V(S_t) + \\ & (1-\lambda)\gamma V(S_{t+1}) + \\ & (1-\lambda)\lambda\gamma^2 V(S_{t+2}) + \\ & (1-\lambda)\lambda^2\gamma^3 V(S_{t+3}) + \\ & \cdots + \\ & (1-\lambda)\lambda^{T-t-2}\gamma^{T-t-1}V(S_{T-1}) + \\ & \lambda^{T-t-1}\gamma^{T-t}V(S_T). \end{aligned}

终止状态 V(ST)=0V(S_T)=0.

另一方面,

Gt(1)=Rt+1+γV(St+1)Gt(2)=Rt+1+γRt+2+γ2V(St+2)Gt(3)=Rt+1+γRt+2+γ2Rt+3+γ3V(St+3)Gt(Tt1)=Rt+1+γRt+2++γTt2RT1+γTt1V(ST1)Gt=Rt+1+γRt+2++γTt2RT1+γTt1RT.\begin{aligned} G_t^{(1)} & =R_{t+1}+\gamma V(S_{t+1}) \\G_t^{(2)} & =R_{t+1}+\gamma R_{t+2}+\gamma^2 V(S_{t+2}) \\G_t^{(3)} & =R_{t+1}+\gamma R_{t+2}+\gamma^2 R_{t+3}+\gamma^3 V(S_{t+3}) \\& \cdots \\G_t^{(T-t-1)} & =R_{t+1}+\gamma R_{t+2}+\cdots+\gamma^{T-t-2}R_{T-1}+\gamma^{T-t-1}V(S_{T-1})\\G_t & =R_{t+1}+\gamma R_{t+2}+\cdots+ \gamma^{T-t-2}R_{T-1}+\gamma^{T-t-1}R_{T}.\end{aligned}

有式(2)

Gtλ=(1λ)n=1Tt1λn1Gt(n)+λTt1Gt=(1λ)(1+λ++λTt2)Rt+1+λTt1Rt+1+(1λ)(λ+λ2++λTt2)γRt+2+λTt1Rt+2++(1λ)γV(St+1)+(1λ)λγ2V(St+2)++(1λ)λTt2γTt1V(ST1)=Rt+1+λγRt+2+(λγ)2Rt+3+(1λ)γV(St+1)+(1λ)λγ2V(St+2)++(1λ)λTt2γTt1V(ST1).\begin{aligned} G_t^{\lambda}= & (1-\lambda)\sum_{n=1}^{T-t-1} \lambda^{n-1}G_t^{(n)}+\lambda^{T-t-1}G_t \\ = & (1-\lambda)(1+\lambda+\cdots+\lambda^{T-t-2})R_{t+1}+\lambda^{T-t-1}R_{t+1} + \\ & (1-\lambda)(\lambda+\lambda^2+\cdots+ \lambda^{T-t-2})\gamma R_{t+2} +\lambda^{T-t-1}R_{t+2} + \\ & \cdots + \\ & (1-\lambda)\gamma V(S_{t+1})+ \\ & (1-\lambda)\lambda\gamma^2 V(S_{t+2}) + \\ & \cdots + \\ & (1-\lambda)\lambda^{T-t-2}\gamma^{T-t-1} V(S_{T-1}) \\ = & R_{t+1}+\lambda\gamma R_{t+2}+(\lambda\gamma)^2 R_{t+3}+\cdots \\ & (1-\lambda)\gamma V(S_{t+1})+ \\ & (1-\lambda)\lambda\gamma^2 V(S_{t+2}) + \\ & \cdots + \\ & (1-\lambda)\lambda^{T-t-2}\gamma^{T-t-1} V(S_{T-1}). \end{aligned}

比较 (1)(1)(2)(2) 得到

GtλV(St)=k=tT1(λγ)ktδk.G_t^{\lambda}-V(S_t)=\sum_{k=t}^{T-1}(\lambda\gamma)^{k-t}\delta_k.

这意味着对 V(St)V(S_t) 的更新可以表示为所有TD误差的加权和:

ΔV(St)=αk=tT1(λγ)ktδk.\Delta V(S_t)=\alpha\sum_{k=t}^{T-1}(\lambda\gamma)^{k-t}\delta_k.

在后向视角中,每产生一个 δk\delta_k,立即乘系数 (λγ)kt(\lambda\gamma)^{k-t} 传播给以前访问的状态,所有 TD 误差传播完成后,状态 StS_t 得到的累计更新就是α(GtλV(St))\alpha(G_t^{\lambda}-V(S_t)).因此前向视角与后向视角两者在本质是统一的.


6. 资格迹与控制:Sarsa(λ)#

价值估计的资格迹很自然地能推广到动作价值函数的控制问题.将资格迹从状态扩展为状态-动作对,我们就得到了 Sarsa(λ)\text{Sarsa}(\lambda).

6.1 前向 Sarsa(λ)方法#

在 Sarsa(λ\lambda)前向视角中,通过对每个回报赋予权重 (1λ)λn1(1-\lambda)\lambda^{n-1} 来平均多个不同的 QQ-回报进行更新,其中 nn 步 Sarsa 的 QQ-回报为

Qt(n)=Rt+1+γRt+1++γn1Rt+n+γnQ(St+n,At+n),Q_t^{(n)}=R_{t+1}+\gamma R^{t+1}+\cdots +\gamma^{n-1}R_{t+n}+\gamma^n Q(S_{t+n},A_{t+n}),

则得到 λ\lambda-回报 QtλQ_t^{\lambda}

Qtλ=(1λ)n=1λn1Qt(n).Q_t^{\lambda}=(1-\lambda)\sum_{n=1}^{\infty}\lambda^{n-1}Q_t^{(n)}.

结合 Sarsa 的更新公式,得到前向视角 Sarsa(λ\lambda)的更新公式为

Q(St,At)Q(St,At)+α(QtλQ(St,At)).Q(S_t,A_t)\leftarrow Q(S_t,A_t)+\alpha (Q_t^{\lambda}-Q(S_t,A_t)).

6.2 后向 Sarsa(λ)方法#

在 Sarsa(λ\lambda)后向视角中,通过引入资格迹,将当前行为值函数误差按权重进行分配更新,每执行一个动作,我们更新资格迹 Et(s,a)E_t(s,a)

Et(s,a)={γλEt1(s,a)+1如果 (s,a)=(St,At),(累积迹情况)γλEt1(s,a)其他,E_t(s,a) = \begin{cases} \gamma \lambda E_{t-1}(s,a) + 1 & \text{如果 } (s,a) = (S_t, A_t), \text{(累积迹情况)} \\ \gamma \lambda E_{t-1}(s,a) & \text{其他}, \end{cases}

其中 E0(s,a)=0E_0(s,a)=0.TD 误差为:

δt=Rt+1+γQt(St+1,At+1)Qt(St,At).\delta_t = R_{t+1} + \gamma Q_t(S_{t+1}, A_{t+1}) - Q_t(S_t, A_t).

然后更新所有状态-动作对:

Qt+1(s,a)=Qt(s,a)+αδtEt(s,a), s,a.Q_{t+1}(s,a) = Q_t(s,a) + \alpha \delta_t E_t(s,a),\ \forall s, a.

Sarsa(λ)\text{Sarsa}(\lambda) 算法伪代码:


7. 资格迹与控制:Q(λ)#

常规的 Q-Learning 的更新目标为 1 步回报,即

Q(St,At)Q(St,At)+α(QtQ(St,At)),Q(S_t,A_t)\leftarrow Q(S_t,A_t)+\alpha (Q_t-Q(S_t,A_t)),

其中

Qt=Rt+1+γmaxaQt(St+1,a).Q_t=R_{t+1}+\gamma \max_{a'}Q_t(S_{t+1},a').

Q-Learning 估计的 π\pi^* 是 greedy 策略,在计算 TD 目标 QtQ_t 时,对应的是 greedy 策略 π\pi 生成的轨迹.由于 O-Learning 是 off-policy,行为策略 μ\mu (ϵ\epsilon-greedy) 与目标策略 π\pi (greedy)不同,即采样生成的真实轨迹与 π\pi 生成的可能不一致,因此在计算 nn 步回报时,根据采样真实轨迹不一定可以得到 nn 步对应的 TD 目标,由此在实际操作中,资格迹不能像 Sarsa(λ\lambda)那样传播到整个 episode,而需要在某些时候截断.

为描述行为策略与目标策略对应轨迹的不同,并确定当前时间步选择的行为的性质,我们给出贪婪行为探索行为的定义.

Def. 在当前状态 ss 下,若选择的行为 aa 满足

Q(s,a)=maxaQ(s,a)Q(s,a)=\max_{a'} Q(s,a')

则称该行为是贪婪行为,反之则为探索行为.

例 3:多步回报的限制

考虑轨迹

s0a0R1,s1a1R2,s2a2R3,s3.s_0 \xrightarrow{a_0} R_1,s_1 \xrightarrow{a_1}R_2, s_2 \xrightarrow{a_2}R_3, s_3.

在常规 Q-Learning 的 1 步回报中,更新状态行为对 (s0,a0)(s_0,a_0)QQ 值,所使用的是 maxaQ(s1,a)\max_{a'}Q(s_1,a'),而不是实际执行的 a1a_1.并且由于只看到下一步,即使真实轨迹没有采取 greedy,我们仍然会认为从 s1s_1 开始以后是 greedy 策略生成的轨迹,即无论 a1a_1 是贪婪行为还是探索行为,不影响 Q(s0,a0)Q(s_0,a_0) 的更新;

若考虑多步回报,如 3 步回报,且 a1a_1 为贪婪行为,a2a_2 为探索行为,则 TD 目标 Q(3)Q^{(3)}

Q(3)=R1+γR2+γ2R3+γ3maxaQ(s3,a).Q^{(3)}=R_{1}+\gamma R_{2}+\gamma^2 R_{3}+\gamma^3 \max_a Q(s_{3},a).

a2a_2 开始,后面的轨迹不是 greedy 策略产生的,对应经验奖励 R3R_3\ldots 不能再代表 QQ^*,因此不能使用 3 步回报作为 TD 目标,进而更新 Q(s0,a0)Q(s_0,a_0) ^eg3

7.1 前向 Watkins’s Q(λ) 方法#

将 Q-Learning 的更新目标变为多步.假设正在求解贪心策略在状态行为对 (st,at)(s_t,a_t) 的行为值函数,前两个时间步选择的行为是贪婪行为,但第三个时间步选择的行为是探索行为.

stgreedyatst+1greedyat+1st+2exploreat+2st+3s_t \xrightarrow[\text{greedy}]{a_t} s_{t+1} \xrightarrow[\text{greedy}]{a_{t+1}} s_{t+2} \xrightarrow[\text{explore}]{a_{t+2}} s_{t+3}

对于 (st,at)(s_t,a_t),可以利用哪些回报?从例 3 中,我们可以得到,1 步回报和 2 步回报可以利用.3 步回报中,在 st+2at+2Rt+3,st+3s_{t+2}\xrightarrow{a_{t+2}} R_{t+3},s_{t+3} 中,at+2a_{t+2} 为探索行为,由于后续轨迹不是 greedy 策略产生,而是 ϵ\epsilon-greedy,因此 3 步回报不能使用.

  • 1 步回报
Rt+1+γmaxaQ(st+1,a).R_{t+1}+\gamma \max_a Q(s_{t+1},a).
  • 2 步回报
Rt+1+γRt+2+γ2maxaQ(st+2,a).R_{t+1}+\gamma R_{t+2}+\gamma^2\max_a Q(s_{t+2},a).
  • 3 步回报
Rt+1+γRt+2+γ2Rt+3+γ3maxaQ(st+3,a).R_{t+1}+\gamma R_{t+2}+\gamma^2 R_{t+3}+\gamma^3 \max_a Q(s_{t+3},a).

结合上述对回报的利用, Watkins’s Q(λ)\text{Q}(\lambda) 使用的有效轨迹长度,最长就到第二个时间步,从第三个时间步往后的序列不再理会,即 Watkins’s Q(λ)\text{Q}(\lambda) 使用的有效轨迹长度最远到达第一个探索行为对应的时间步长.因此,Watkins’s Q(λ)\text{Q}(\lambda) 的有效轨迹长的不是整个轨迹从开始到结束,它只考虑最近的探索行为,一旦探索行为发生,则轨迹结束.

对状态行为对 (st,at)(s_t,a_t),第一个探索行为是 at+na_{t+n},轨迹以 st+ns_{t+n} 为最后一个状态,则最长的 nn 步 Q-回报为

Qt(n)=Rt+1+γRt+2++γn1Rt+n+γnmaxaQ(st+n,a).Q_t^{(n)}=R_{t+1}+\gamma R_{t+2}+\cdots +\gamma^{n-1}R_{t+n}+\gamma^n \max_{a}Q(s_{t+n},a).

对 Q-回报加权求和得到 Q 的 λ-回报 QtλQ_t^\lambda

Qtλ=(1λ)n=1λn1Qt(n).Q_t^{\lambda}=(1-\lambda)\sum_{n=1}^\infty \lambda^{n-1}Q_t^{(n)}.

Watkins’s Q(λ)\text{Q}(\lambda) 更新公式为

Q(st,at)Q(st,at)+α(QtλQ(st,at)).Q(s_t,a_t)\leftarrow Q(s_t,a_t)+\alpha(Q_t^\lambda - Q(s_t,a_t)).

7.2 后向 Watkins’s Q(λ) 方法#

对每个状态行为对 (s,a)(s,a),我们更新资格迹 Et(s,a)E_t(s,a)

Et(s,a)=IsStIaAt+{γλEt1(s,a)如果 Qt1(St,At)=maxaQt1(St,a),0其他,E_t(s,a) = I_{sS_t}\cdot I_{aA_t}+ \begin{cases} \gamma \lambda E_{t-1}(s,a) & \text{如果 } Q_{t-1}(S_t,A_t) = \max_{a'} Q_{t-1}(S_t, a'), \\ 0 & \text{其他}, \end{cases}

其中

IsSt={1, s=St0, sSt,IaAt={1, a=At0, aAtI_{sS_t}=\begin{cases}1,\ s=S_t \\ 0,\ s\neq S_t\end{cases},\quad I_{aA_t}=\begin{cases}1,\ a=A_t \\ 0,\ a\neq A_t\end{cases}

即若当前选择行为 ata_t 是贪婪行为,则资格迹乘系数 γλ\gamma\lambda,否则资格迹截断为 0;其次,对于当前正在访问的 (st,at)(s_t,a_t),其资格迹单独加 1.

Q(s,a)Q(s,a) 的更新公式为

Qt+1(s,a)=Qt(s,a)+αδtEt(s,a), s,a,Q_{t+1}(s,a)= Q_t(s,a)+\alpha\delta_t E_t(s,a),\ \forall s,a,

其中

δt=Rt+1+γmaxaQt(st+1,a)Qt(st,at).\delta_t = R_{t+1}+\gamma \max_{a'} Q_t(s_{t+1},a')-Q_t(s_t,a_t).

后向 Watkins’s Q(λ)\text{Q}(\lambda) 算法伪代码:

事实上,当存在多个贪婪行为时,即

#{aQ(s,a)=maxbQ(s,b)}#A(s)>1,\#\{a'\mid Q(s',a')=\max_{b}Q(s',b) \}\triangleq \# A^*(s')>1,

若上述算法中 aaA(s)a'\neq a^*\in A^*(s'),则会出现本来仍然符合贪婪策略的轨迹被错误截断.因此上述的贪心动作可更改为贪心动作集合 A(s)A^*(s'),以及资格迹更新条件变为 aA(s)a'\in A^*(s').

例 4 资格迹更新

状态序列

stgreedyatst+1greedyat+1st+2exploreat+2st+3.s_t \xrightarrow[\text{greedy}]{a_t} s_{t+1} \xrightarrow[\text{greedy}]{a_{t+1}} s_{t+2} \xrightarrow[\text{explore}]{a_{t+2}} s_{t+3}.

(st,at)(s_t,a_t) 处,E(st,at)=1E(s_t,a_t)=1ata_t 是贪婪行为,则资格迹继续衰减并累计

E(st,at)=γλ,E(st+1,at+1)=1.\begin{aligned} & E(s_t,a_t)=\gamma\lambda, \\ &E(s_{t+1},a_{t+1})=1. \end{aligned}

再执行下一步 (st+2,at+2)(s_{t+2},a_{t+2}) ,此时得到

E(st,at)=(γλ)2,E(st+1,at+1)=γλ,E(st+2,at+2)=1.\begin{aligned} & E(s_t,a_t)=(\gamma\lambda)^2, \\ & E(s_{t+1},a_{t+1})=\gamma\lambda, \\ & E(s_{t+2},a_{t+2})=1. \end{aligned}

在探索动作发生之前,各状态行为对的资格迹均保留,且当前 TD 误差能够传播给之前访问过的状态动作对.

而在 at+2a_{t+2} 不是贪婪动作,表明此后轨迹偏离目标策略,后续经验不能用于估计greedy策略的价值,因此,在计算完当前一步更新后,资格迹立即清理:

E(s,a)=0, s,aE(s,a)=0,\ \forall s,a

原来的资格迹 E(st,at),E(st+1,at+1),E(st+2,at+2)E(s_t,a_t),E(s_{t+1},a_{t+1}),E(s_{t+2},a_{t+2}) 均变为 00.

若不清零,则随后计算得到的 TD 误差 δt+3\delta_{t+3} 仍会更新 (st,at)(s_t,a_t), (st+1,at+1)(s_{t+1},a_{t+1})(st+2,at+2)(s_{t+2},a_{t+2}) 对应值,即探索行为后的经验影响了原本目标贪婪策略,因此此时需将资格迹截断清零.

例 5:悬崖行走任务

经典的悬崖行走网格中,智能体从起点到终点,途中某些格是悬崖,掉下去会获得 -100 奖励并回到起点.用 Sarsa(0) 学习,智能体学到的安全路径会远离悬崖(因为探索时有概率掉下悬崖,一步更新过于谨慎).若使用 Sarsa(λ)\text{Sarsa}(\lambda) 并取较大的 λ,掉下悬崖的大负奖励会被迹传播到更早的状态-动作对,那些导致接近悬崖路径的动作会受到更强的惩罚,智能体可能更快地学会避开危险区域.同时,正奖励的传播也更快,使得成功路径的 Q 值提升更迅速.实验通常显示,在 λ≈0.7~0.9 时学习速度明显快于 λ=0.


8. 总结#

本节脉络:

  • 动机:一步更新的信息传播瓶颈与蒙特卡洛的高方差,促使我们寻找多步信息的在线融合方式.
  • 前向 λ 回报:对 n 步回报的指数加权平均,给予我们偏差-方差可调的理想更新目标.
  • 后向资格迹:通过“迹”来记录每个状态的访问新近度与频率,将每一步的 TD 误差按迹分配给历史状态,从而在在线更新中等价于前向 λ 回报.
  • Sarsa(λ)\text{Sarsa}(\lambda)Q(λ)\text{Q}(\lambda):将迹扩展到动作值函数,实现多步同策略控制,显著加速学习.

教材参考

  • 邹伟 - 强化学习 - 清华大学出版社.
  • Richard S. Sutton - Reinforcement Learning: An Introduction.
6 资格迹
https://explorx.pages.dev/blog/rl/8fjfe8
AuthorXin
Published at2026年7月9日