Aller au contenu principal

Cours · Bac+4 (ingénieur)

Statistiques avancées

Fiches de cours et sous-notions liées à ce chapitre.

Connecte-toi pour t'entraîner

Pas assez de questions pour un entraînement ciblé sur cette notion.

Régression

Non commencé

Définitions

Régression linéaire : modèle y=Xβ+εy = X\beta + \varepsilon, estimateur MC β^=(XTX)1XTy\hat{\beta} = (X^TX)^{-1}X^Ty. Ridge : β^λ=(XTX+λI)1XTy\hat{\beta}_\lambda = (X^TX + \lambda I)^{-1}X^Ty (pénalité L2L^2). LASSO : pénalité L1L^1 favorise sparsité.

Régression logistique : P(y=1x)=σ(βTx)P(y=1|x) = \sigma(\beta^Tx), σ\sigma sigmoïde ; perte log-vraisemblance. R2R^2 mesure variance expliquée. Diagnostic : résidus, multicolinéarité (VIF), validation croisée.

Régression linéaire β^=(XTX)1XTy\hat\beta=(X^TX)^{-1}X^Ty. Ridge (L2L^2), LASSO (L1L^1). Logistique : sigmoïde.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • β^=(XTX)1XTy;y^=Xβ^\hat{\beta} = (X^TX)^{-1}X^Ty \quad ; \quad \hat{y} = X\hat{\beta}
  • Ridge : minyXβ2+λβ2\text{Ridge : } \min \|y - X\beta\|^2 + \lambda\|\beta\|^2
  • LASSO : minyXβ2+λβ1\text{LASSO : } \min \|y - X\beta\|^2 + \lambda\|\beta\|_1
  • P(y=1x)=11+eβTxP(y=1|x) = \frac{1}{1 + e^{-\beta^Tx}}

Exemples

Exemple 1

Estimateur des moindres carrés.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) β^=(XTX)1XTy\hat\beta=(X^TX)^{-1}X^Ty si XX plein rang. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

β^\hat\beta MC ordinaires.

Exemple 2

Rôle de Ridge.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) (XTX+λI)1XTy(X^TX+\lambda I)^{-1}X^Ty stabilise si multicolinéarité / κ\kappa grand. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

Ridge régularise L2L^2.

À retenir

Séries temporelles

Non commencé

Définitions

Une série temporelle (Xt)(X_t) est stationnaire si loi invariante par translation et Cov(Xt,Xt+h)\mathrm{Cov}(X_t, X_{t+h}) ne dépend que de hh. AR(1) : Xt=ϕXt1+εtX_t = \phi X_{t-1} + \varepsilon_t, stationnaire si ϕ<1|\phi| < 1. MA(qq), ARMA(p,qp,q), ARIMA pour non stationnaire (differencing).

ACF/PACF pour identification. Bruit blanc : εt\varepsilon_t i.i.d., E[εt]=0E[\varepsilon_t]=0. Décomposition : tendance + saisonnalité + résidu. Prévision : X^T+hT=E[XT+hX1,,XT]\hat{X}_{T+h|T} = E[X_{T+h}|X_1,\ldots,X_T].

Série temporelle stationnaire : ACF ne dépend que du lag. AR(1) : ϕ<1|\phi|<1. ARMA/ARIMA. Décomposition tendance/saison/résidu.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • Xt=ϕXt1+εt, ϕ<1 stationnaireX_t = \phi X_{t-1} + \varepsilon_t,\ |\phi| < 1 \Rightarrow \text{ stationnaire}
  • E[Xt]=0, γ(h)=ϕhσ21ϕ2E[X_t] = 0,\ \gamma(h) = \phi^{|h|} \frac{\sigma^2}{1-\phi^2}
  • ACF(h)=Corr(Xt,Xth)\text{ACF}(h) = \mathrm{Corr}(X_t, X_{t-h})
  • Xt=Tt+St+Rt(deˊcomposition)X_t = T_t + S_t + R_t \quad \text{(décomposition)}

Exemples

Exemple 1

AR(1) stationnaire.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Xt=ϕXt1+εtX_t=\phi X_{t-1}+\varepsilon_t stationnaire ssi ϕ<1|\phi|<1 ; γ(h)ϕh\gamma(h)\propto\phi^{|h|}. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

Stationnaire si ϕ<1|\phi|<1.

Exemple 2

Rôle du différencing ARIMA.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Différences pour stationnariser une tendance stochastique. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

ARIMA = différencier puis ARMA.

À retenir

Apprentissage statistique

Non commencé

Définitions

Apprentissage statistique : minimiser risque empirique 1nL(yi,f(xi))+Ω(f)\frac{1}{n}\sum L(y_i, f(x_i)) + \Omega(f) (régularisation). Surapprentissage : faible erreur train, haute erreur test. Validation croisée kk-fold estime erreur généralisation.

Biais-variance : MSE=Biais2+Var+σ2\mathrm{MSE} = \mathrm{Biais}^2 + \mathrm{Var} + \sigma^2. Modèles : arbres, SVM, forêts aléatoires. Courbe apprentissage diagnostique under/overfitting. PAC learning (complexité VC) borne erreur généralisation.

Apprentissage statistique : biais-variance, surapprentissage, validation. Classifieurs, risque empirique, régularisation.

Trade-off complexité du modèle vs erreur de généralisation.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • Remp(f)=1ni=1nL(yi,f(xi))R_{\mathrm{emp}}(f) = \frac{1}{n}\sum_{i=1}^n L(y_i, f(x_i))
  • MSE=Biais2+Var+σε2\mathrm{MSE} = \mathrm{Biais}^2 + \mathrm{Var} + \sigma^2_\varepsilon
  • CV : 1kj=1kErrtest(j)\text{CV : } \frac{1}{k}\sum_{j=1}^k \mathrm{Err}_{\mathrm{test}}^{(j)}
  • VC : P(errtesterrtrain>η)δ\text{VC : } P(\mathrm{err}_{\mathrm{test}} - \mathrm{err}_{\mathrm{train}} > \eta) \leq \delta

Exemples

Exemple 1

Décomposition biais-variance (régression).

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) MSE =biais2+var+bruit=\mathrm{biais}^2+\mathrm{var}+\mathrm{bruit}. Modèle trop simple : biais ; trop complexe : var. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

MSE = biais² + variance + bruit.

Exemple 2

Rôle de la validation croisée.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Estimer l'erreur de généralisation pour choisir hyperparamètres. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

CV \approx erreur hors échantillon.

À retenir