
116
Chapitre 3. Entraînement de réseaux de neurones profonds
les deux axes. Dans la pratique, cette approche fonctionne bien. Si nous voulons
être certains que l’écrêtage de gradient ne modie pas la direction du vecteur de gra-
dient, il doit se faire par norme en indiquant clipnorm à la place de clipvalue.
Dans ce cas, l’écrêtage du gradient se fera si sa norme ℓ
2
est supérieure au seuil xé.
Parexemple, si nous indiquons clipnorm=1.0, le vecteur [0,9
; 100,0] sera alors
écrêté à [0,00899964
; 0,9999595], conservant son orientation mais éliminant quasi
-
ment le premier élément.
Si nous observons une explosion des gradients au cours de l’entraînement ...