August 2019
Intermediate to advanced
608 pages
7h 46m
Japanese
Ruben Fiszel
この付録では、まず強化学習(reinforcement learning)の概要を紹介します。続いてピクセル入力に対するDeep Qネットワーク(DQN)について詳しく説明し、最後にRL4Jの例を示します。強化学習の主要な概念について説明するところから始めましょう。
強化学習は機械学習の興味深い分野の1つです。基本的には、与えられた環境における効率的な戦略による学習です。くだけた議論では、これはパブロフ型条件付け(Pavlovian conditioning)にとてもよく似ています。与えられた行動に対して報酬を割り当てると、時間経過とともに、エージェントはより多くの報酬を受け取るために行動を再現することを学習します。
形式的には、環境はマルコフ決定過程(Markov Decision Process:MDP)によって定義されます。この恐ろしげな名前の背後にあるのは、以下の5つの要素の組み合わせ以外の何物でもありません。
Read now
Unlock full access