Compromis Biais-Variance

Machine Learning
Data & IA
Diagnostiquer le sous-apprentissage (underfitting) et le sur-apprentissage (overfitting) pour équilibrer un modèle.

Trouver le bon modèle est une affaire de compromis : soit il est trop rigide et rate les grandes tendances (biais élevé), soit il est trop fluide et mémorise les moindres détails inutiles (variance élevée). Entre les deux se trouve la zone de généralisation optimale.

Le Biais et le Sous-apprentissage

Le biais est l’erreur systématique d’un modèle trop simpliste. Il “manque” les vraies tendances des données — comme un moule trop rigide incapable d’épouser la forme de la figurine. Le modèle reste grossièrement plat, incapable de capter la structure réelle : c’est le sous-apprentissage (underfitting).

\[\text{Biais}(\hat{Y}) = E[\hat{Y}] - Y\]

  • \(\hat{Y}\) : la prédiction estimée par le modèle
  • \(Y\) : la valeur réelle de référence
  • \(E[\cdot]\) : l’espérance mathématique (moyenne des prédictions sur différents jeux d’entraînement)

L’écart moyen et systématique entre ce que le modèle prédit et la réalité.

La Variance et le Sur-apprentissage

La variance représente l’erreur liée à une sensibilité excessive aux fluctuations du jeu d’entraînement. Le modèle mémorise le bruit au lieu d’apprendre. Dans notre analogie, la matière est trop liquide : elle capture parfaitement la forme générale, mais s’infiltre aussi dans chaque micro-rayure et grain de poussière. Ce moule ultra-spécifique produira une erreur importante sur une nouvelle figurine légèrement différente — c’est le sur-apprentissage (overfitting).

\[\text{Variance}(\hat{Y}) = E\left[(\hat{Y} - E[\hat{Y}])^2\right]\]

  • \(\hat{Y}\) : la prédiction du modèle
  • \(E[\hat{Y}]\) : la valeur moyenne prédite sur tous les entraînements possibles

La mesure de la dispersion des prédictions autour de leur moyenne pour différents jeux d’entraînement.

Biais et Variance

Complexité du modèle50

Le Phénomène de Double Descente

La courbe classique en U montre que la variance augmente avec la complexité. Cependant, le Deep Learning montre parfois une Double Descente : la perte diminue à nouveau pour de très grands modèles. Parfois, un très grand modèle que l’on pensait condamné au sur-apprentissage recommence mystérieusement à s’améliorer — c’est une zone où le modèle découvre des règles encore plus simples et robustes.

Selon l’hypothèse de l’unfolding, ce phénomène est souvent un artefact lié à un scaling composite (variation simultanée de la taille du modèle et des données). Si l’on fait varier la complexité et les données indépendamment, le modèle réadopte des motifs classiques en U ou en L.

L’Impact Stratégique

  • Diagnostic : Une erreur d’entraînement très faible couplée à une erreur de test élevée indique une variance excessive.
  • Ajustement : Il faut adapter l’architecture ou régulariser le modèle plutôt que de sur-interpréter les performances sur les données d’entraînement.