B.1 序文 B.1.1 マルコフ決定過程 B.1.2 用語 B.2 異なる設定 B.2.1 モデルフリー B.2.2 観測の設定 B.2.3 シングルプレイヤーと対戦ゲーム B.3 Q学習 B.3.1 方策とそれに続くニューラルネットワーク B.3.2 方策反復 B.3.3 探索と活用 B.3.4 ベルマン方程式 B.3.5 初期状態のサンプリング B.3.6 Q学習の実装 B.3.7 Q(s, a)のモデリング B.3.8 経験再生(Experience Replay) B.3.9 畳み込み層と画像前処理 B.3.10 履歴の処理 B.3.11 ダブルQラーニング(Double Q-Learning) B.3.12 クリッピング B.3.13 報酬のスケーリング B.3.14 優先再生(Prioritized Replay) B.4 グラフ、可視化、平均Q B.5 RL4J B.6 結論