Définition
Le Principe des Moindres Carrés détermine les paramètres d’un modèle en minimisant la somme des carrés des résidus entre valeurs observées et prédictions du modèle : arg min_θ Σ_i (y_i - f(x_i; θ))^2. Il définit une fonction de perte donnant des estimateurs analytiques dans les modèles linéaires et coïncide avec l’estimateur du maximum de vraisemblance sous bruit additif gaussien i.i.d.
Principe
Principe
Minimiser l’erreur quadratique produit des estimateurs de paramètres optimaux au sens de la perte par carrés ; dans les modèles linéaires avec erreurs centrées et homoscédastiques, l’estimateur est le meilleur estimateur linéaire sans biais (Gauss–Markov) et, sous bruit gaussien, il est aussi l’estimateur du maximum de vraisemblance.
Démonstration
Démonstration
Scénario illustratif : En régression linéaire simple y = α + β x + ε avec ε bruit de moyenne nulle, calculer α̂ et β̂ en minimisant Σ(y_i - α - β x_i)^2. Reconnaissance : poser la somme des carrés ; Action : résoudre les équations normales (X'X)θ = X'y ; Conséquence : obtenir des estimateurs en forme fermée qui projettent le vecteur observé y sur l’espace colonne de X (interprétation géométrique : projection orthogonale).
Mauvaise application
Mauvaise application
Employer les moindres carrés sans vérifier les hypothèses du modèle (hétéroscédasticité, erreurs corrélées, bruit à queues épaisses, observations dépendantes). L’erreur consiste à considérer les estimateurs par moindres carrés comme efficaces ou non biaisés dans des contextes où les conditions de Gauss–Markov ou gaussiennes échouent, ce qui conduit à des inférences trompeuses.
Conséquence
Conséquence
Sous ses hypothèses, les moindres carrés donnent des estimateurs linéaires sans biais et de variance minimale et des formules d’inférence commodes ; lorsque les hypothèses sont violées, la méthode reste une fonction de perte pratique mais peut être inefficace ou sensible aux valeurs aberrantes, motivant des alternatives robustes (p. ex. L1, Huber, moindres carrés pondérés).
Inversion
Inversion
Si les distributions d’erreur ont des queues épaisses, sont hétéroscédastiques ou corrélées, ou si l’objectif privilégie la robustesse ou une autre perte (p. ex. déviations absolues), les moindres carrés ne sont pas optimaux ; il faut recourir au pondéré, à des transformations ou à d’autres estimateurs. En petits échantillons ou en cas de mauvaise spécification, les estimateurs peuvent être biaisés ou fournir des estimations de variance trompeuses.
Limite
Limite
Clairement dans : régression linéaire avec erreurs indépendantes, homoscédastiques, de moyenne nulle et modèle linéaire correctement spécifié. Cas frontière : régressions avec hétéroscédasticité légère traitable par pondération. Clairement hors : modèles avec fonctions de lien non linéaires nécessitant d’autres fonctions de perte (p. ex. modèles linéaires généralisés) ou données avec outliers extrêmes où la perte L2 est inappropriée.
Tension sémantique
Tension sémantique
Moindres Carrés ↔ Estimation Robuste. Les moindres carrés optimisent l’efficience sous erreurs de type gaussien mais sacrifient la robustesse aux valeurs aberrantes et à la mauvaise spécification ; le choix oppose efficience statistique et résistance à la contamination.
Synthèse
Synthèse
Les moindres carrés associent une interprétation géométrique (projection) à une optimalité probabiliste sous hypothèses gaussiennes et homoscédastiques ; c’est à la fois une fonction de perte et, sous modèles de bruit particuliers, un estimateur basé sur la vraisemblance — son adéquation dépend donc de la validité de ces hypothèses.