
强化学习
|
569
不稳定)。PPO 是对先前的
Trust Region Policy Optimization
注 26
(TRPO)算法的简化,
该算法由 John Schulman 和其他 OpenAI 研究人员提出。OpenAI 于 2019 年 4 月发
布了他们的 AI,该 AI 基于 PPO 算法,名为 OpenAI Five,在多人游戏 Dota 2 中击
败了世界冠军。PPO 在 TF-Agents 中也可用。
1
Curiosity-based exploration
注 272
RL 中反复出现的问题是奖励的稀疏性,这使得学习非常缓慢且效率低下。Deepak
Pathak 和加州大学伯克利分校(UC Berkeley)的其他研究人员提出了一种令人振奋
的方法来解决该问题:为什么不忽略这些奖励,而只是让智能体极端好奇地探索环
境?因此,奖励成为智能体所内在固有的,而不是来自环境。同样,激发孩子的好
奇心比单纯奖励孩子取得了好成绩更可能产生良好的效果。这是如何运作的呢?智
能体不断尝试预测其动作的结果,并寻找结果与预测不符的情况。换句话说,它需
要感到惊奇。如果结果是可预见的(无聊的),那么它将转移到其他地方。但是,如
果结果是不可预测的,但是智能体发现自己无法控制它,则一段时间后也会感到无
聊。只是出于好奇,作者成功地在许多视频游戏中训练了一个智能体:即使智能体没
有因失败而受到惩罚,游戏还是重新开始,这很无聊,因此它学习避免这种情况。
本章涵盖了许多主题:策略梯度、马尔可夫链、马尔可夫决策过程、 ...