Descente de Gradient & Optimiseurs

Machine Learning
Data & IA
Explorer les algorithmes d’optimisation (SGD, Adam) pour trouver le minimum de la fonction de coût.

La descente de gradient est le mécanisme central de l’apprentissage : à chaque étape, on ajuste les paramètres dans le sens qui réduit l’erreur. Imaginez la fonction de perte comme un paysage montagneux — le but est d’atteindre le point le plus bas. On lâche une “boule” sur la pente, et elle roule vers le bas guidée par le gradient.

Deux réglages clés :

Les optimiseurs modernes automatisent ces réglages :

La mise à jour des poids à chaque étape :

\[w \leftarrow w - \eta \cdot \nabla_w \mathcal{L}\]

  • \(\eta\) : le taux d’apprentissage (learning rate)
  • \(\nabla_w\) : le gradient de la perte par rapport aux poids

Adam adapte le pas pour chaque paramètre en maintenant deux moyennes mobiles — le gradient moyen (\(m_t\)) et le gradient carré moyen (\(v_t\)) :

\[\hat{w} = w - \eta \cdot \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \epsilon}\]

  • \(\hat{m}_t, \hat{v}_t\) : moyennes mobiles corrigées du biais d’initialisation
  • \(\epsilon\) : constante de stabilité numérique (\(\approx 10^{-8}\))

Simulation de la Trajectoire d’Optimisation

Trajectoire d’Optimisation

L’inertie (Momentum) accumule les gradients passés pour accélérer dans les directions constantes et franchir les plateaux.

RMSprop adapte le taux d’apprentissage de chaque paramètre selon la moyenne mobile de la magnitude des gradients récents.

AdaGrad adapte le pas selon l’historique accumulé des gradients depuis le début — efficace pour les caractéristiques éparses.

Adam combine Momentum et RMSprop en maintenant à la fois une moyenne des gradients (1er moment) et de leurs carrés (2e moment).