
vi
|
目录
18.7 马尔可夫决策过程 ................................................................................. 536
18.8 时序差分学习 ........................................................................................ 540
18.9 Q 学习 .................................................................................................. 540
18.10 实现深度 Q 学习 ................................................................................. 544
18.11 深度 Q 学习的变体 .............................................................................. 547
18.12 TF-Agents 库 ....................................................................................... 550
18.13 一些流行的 RL