Des coefficients ponctuels aux distributions
Dans le module Régression Linéaire, le modèle $y = a \cdot x + b$ produit UNE pente $a$ et UN intercept $b$: les valeurs qui minimisent l'erreur quadratique (moindres carrés, OLS).
Question gênante: avec seulement quelques dizaines de ventes immobilières, à quel point peut-on faire confiance à ces deux nombres ? Une pente de 3500 EUR/m2 estimée sur 20 ventes n'a pas la même solidité qu'estimée sur 20000 ventes. L'OLS ne répond pas: il rend les mêmes nombres, sans indication de fiabilité.
La réponse bayésienne: traiter les coefficients comme des variables aléatoires.
- Prior sur les coefficients: $w \sim \mathcal{N}(0, \tau^2)$ ("les coefficients sont probablement modestes")
- Vraisemblance gaussienne: $y \mid x, w \sim \mathcal{N}(w^\top x, \sigma^2)$ (le bruit d'observation)
- Posterior: une distribution complète sur les coefficients, calculable EXACTEMENT (conjugaison gaussienne, comme la Beta-Binomiale du module précédent)
Le scoop de ce module: vous faisiez déjà du bayésien sans le savoir.
La régression Ridge (pénalité L2) du monde sklearn s'écrit:
$$\hat{w}_{ridge} = \arg\min_w \; \|y - Xw\|^2 + \alpha \|w\|^2$$
On démontrera que c'est EXACTEMENT le maximum du posterior (MAP) avec un prior gaussien, avec la correspondance $\alpha = \sigma^2 / \tau^2$:
- prior large ($\tau$ grand) $\Leftrightarrow$ $\alpha$ petit $\Leftrightarrow$ peu de régularisation
- prior serre ($\tau$ petit) $\Leftrightarrow$ $\alpha$ grand $\Leftrightarrow$ forte régularisation
La régularisation n'est pas une astuce d'ingénieur: c'est un prior qui dit son nom.