
112
Chapitre 3. Entraînement de réseaux de neurones profonds
etb’=γ ⊗(b − µ)/σ + β, l’équation se simplie en XW’ + b’. Par conséquent, si nous
remplaçons les poids et les termes constants de la couche précédente (W et b) par les
poids et les termes constants actualisés (W’ et b’), nous pouvons nous débarrasser de
la couche BN (l’optimiseur de TFLite le fait automatiquement
; voir le chapitre11).
Il est possible que l’entraînement soit relativement lent car, lorsque la
normalisation par lots est mise en œuvre, chaque époque prend plus de
temps. Ce comportement est généralement contrebalancé par le fait que
la convergence est beaucoup plus ...