
568
|
第
18
章
18.13 一些流行的 RL 算法概述
在结束本章之前,让我们快速浏览一些流行的 RL 算法:
Actor-Critic
算法
一系列 RL 算法,结合了策略梯度和深度 Q 网络。 一个 Actor-Critic 智能体包含两
个神经网络:策略网络和 DQN。通过从智能体的经验中学习,可以对 DQN 进行常
规的训练。 与常规的策略梯度相比,策略网络的学习方式有所不同(学习速度更
快):不是通过经历多个回合来估算每个动作的值,然后对每个动作的未来折扣奖
励进行相加,最后对它们进行归一化,智能体(actor)依赖于根据 DQN(critic)估
算得到的动作值。有点像运动员(智能体)在教练(DQN)的帮助下学习。
Asynchronous Advantage Actor-Critic
注 23
(
A3C
)
1
DeepMind 的研究人员于 2016 年推出的一种重要的 Actor-Critic 变体,多个智能体
并行学习,探索环境的不同副本。每个智能体以固定的时间间隔但不同步(因此得
名)将一些权重更新推送到主网络,然后从该主网络获取最新的权重。因此,每个
智能体都有助于改善主网络并受益于其他智能体学到的知识。此外,DQN 不会估算
Q 值,而是估算每个动作的优势(名称中的第二个 A),这样可以稳定训练。
Advantage Actor-Critic
(
A2C
)
A3C 算法的一种变体,它去除了异步性。所有模型更新都是同步的,因此梯度更新
是在较大的批次上执行的,这使模型可以更好地利用 GPU ...