
380
Chapitre 10. Apprentissage par renforcement
les observations sont dépourvues de bruit et contiennent l’intégralité de l’état de
l’environnement.
Voici le code qui permet de construire cette politique par réseau de neurones avec
tf.keras
:
import tensorflow as tf
from tensorflow import keras
n_inputs = 4 # == env.observation_space.shape[0]
model = keras.models.Sequential([
keras.layers.Dense(5, activation="elu", input_shape=[n_inputs]),
keras.layers.Dense(1, activation="sigmoid"),
])
Après les importations, nous employons un simple modèle Sequential pour
dénir le réseau de politique. Le nombre d’entrées correspond à la taille de l’es-
pace des observations ...