
402
Chapitre 10. Apprentissage par renforcement
Pour comprendre son fonctionnement, nous devons tout d’abord remarquer que
la valeur Q d’un couple état-action (s, a) peut être exprimée sous la forme Q(s, a)
=V(s)+ A(s, a), où V(s) est la valeur de l’état s et A(s, a) correspond à l’avantage
de prendre l’action a dans l’état s, en comparaison de toutes les autres actions pos
-
sibles dans cet état. Par ailleurs, la valeur d’un état est égale à la valeur Q de la
meilleure action a
*
pour cet état (puisque nous supposons que la politique optimale
sélectionnera la meilleure action). Par conséquent, V(s) = Q(s, a
*
), ce qui implique
que A(s,a
*
) = 0. ...