Aller au contenu principal

Cours · Bac+4 (ingénieur)

Machine learning (maths)

Fiches de cours et sous-notions liées à ce chapitre.

Connecte-toi pour t'entraîner

Pas assez de questions pour un entraînement ciblé sur cette notion.

Régularisation

Non commencé

Définitions

Régularisation contrôle complexité modèle : ridge (L2L^2), LASSO (L1L^1), elastic net. Interprétation bayésienne : prior gaussien (ridge), Laplace (LASSO). Dropout (réseaux) : désactive neurones aléatoirement à l'entraînement.

Early stopping : arrêt quand validation stagne. Data augmentation artificielle élargit train. Trade-off biais-variance : λ\lambda grand \Rightarrow biais↑ variance↓.

Régularisation : pénaliser la complexité (L2L^2, L1L^1, elastic net, early stopping). Contrôle biais-variance.

Équivalent bayésien : prior sur les paramètres.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • minL(yi,f(xi))+λw22(ridge)\min \sum L(y_i, f(x_i)) + \lambda \|w\|_2^2 \quad \text{(ridge)}
  • minL(yi,f(xi))+λw1(LASSO)\min \sum L(y_i, f(x_i)) + \lambda \|w\|_1 \quad \text{(LASSO)}
  • Prior : wN(0,σ2I) ridge\text{Prior : } w \sim \mathcal{N}(0, \sigma^2 I) \Leftrightarrow \text{ ridge}
  • P(dropout)=p reˊgularisation ensembleP(\mathrm{dropout}) = p \Rightarrow \text{ régularisation ensemble}

Exemples

Exemple 1

Effet L1L^1 vs L2L^2.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) L1L^1 favorise sparsité ; L2L^2 rétrécit sans annuler en général. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

LASSO sparse ; Ridge dense rétréci.

Exemple 2

Choisir λ\lambda.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Par validation croisée / courbe validation. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

λ\lambda^* via CV.

À retenir

Gradient boosting

Non commencé

Définitions

Gradient boosting : modèle additif Fm(x)=Fm1(x)+γmhm(x)F_m(x) = F_{m-1}(x) + \gamma_m h_m(x)hmh_m approxime le gradient négatif de la perte. XGBoost, LightGBM : régularisation, parallélisation, gestion données creuses. Random forest : moyenne arbres entraînés sur bootstrap + sous-ensemble features.

Bagging réduit variance ; boosting réduit biais. Learning rate ν\nu shrink chaque arbre : Fm=Fm1+νhmF_m = F_{m-1} + \nu h_m.

Gradient boosting : somme additive de faibles estimateurs (arbres) ajustant les résidus. XGBoost/LightGBM.

Learning rate ν\nu petit + beaucoup d'arbres. Régularisation sur feuilles.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • Fm(x)=Fm1(x)+νargminhL(yi,Fm1(xi)+h(xi))F_m(x) = F_{m-1}(x) + \nu \cdot \arg\min_h \sum L(y_i, F_{m-1}(x_i) + h(x_i))
  • hm(x)L(y,Fm1(x))Fh_m(x) \approx -\frac{\partial L(y, F_{m-1}(x))}{\partial F}
  • RF : f^=1Bb=1BTb(x)\text{RF : } \hat{f} = \frac{1}{B}\sum_{b=1}^B T_b(x)
  • Var RF ρ+(1ρ)/B\text{Var RF } \propto \rho + (1-\rho)/B

Exemples

Exemple 1

Idée d'une itération boosting.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Ajuster hth_t aux résidus/gradients négatifs de la perte ; FF+νhtF\leftarrow F+\nu h_t. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

Ajout stagewise de faibles modèles.

Exemple 2

Surapprentissage boosting.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Trop d'arbres / ν\nu trop grand : overfit ; early stopping sur validation. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

Contrôler TT et ν\nu.

À retenir

Réseaux de neurones

Non commencé

Définitions

Réseau de neurones : composition f=fLf1f = f_L \circ \cdots \circ f_1, couche fl(x)=σ(Wlx+bl)f_l(x) = \sigma(W_l x + b_l). ReLU max(0,x)\max(0,x) : sparse, évite vanishing gradient partiellement. Rétropropagation : règle chaîne pour L/Wl\partial L/\partial W_l.

Fonctions perte : MSE régression, cross-entropy classification. Architectures : MLP, CNN (convolution), RNN/LSTM (séquences), Transformer (attention). Vanishing gradient avec sigmoïde ; BatchNorm stabilise.

Réseau de neurones : couches, activation (ReLU, sigmoïde), backprop, SGD/Adam. Universal approximation.

Non convexité : minima locaux / selles. Régularisation dropout, weight decay.

Pourquoi c’est central : cette notion structure les preuves et calculs du programme ; maîtriser définitions et hypothèses évite les applications hors cadre.

Formules

  • σ(x)=max(0,x)(ReLU);σ(x)=11+ex(sigmoı¨de)\sigma(x) = \max(0, x) \quad \text{(ReLU)} \quad ; \quad \sigma(x) = \frac{1}{1+e^{-x}} \quad \text{(sigmoïde)}
  • δl=(Wl+1Tδl+1)σ(zl)(backprop)\delta_l = (W_{l+1}^T \delta_{l+1}) \odot \sigma'(z_l) \quad \text{(backprop)}
  • LWl=δlal1T\frac{\partial L}{\partial W_l} = \delta_l a_{l-1}^T
  • Attention : softmax(QKT/d)V\text{Attention : } \mathrm{softmax}(QK^T/\sqrt{d})V

Exemples

Exemple 1

Passe avant / arrière.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) Forward : z=Wx+bz=Wx+b, a=σ(z)a=\sigma(z). Backward : dériver la perte via chaîne. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

Backprop = règle de chaîne.

Exemple 2

Rôle de ReLU.

Méthode

(1) Lire l'énoncé et repérer les hypothèses / la forme utile. (2) max(0,x)\max(0,x) : gradient simple, atténue vanishing vs sigmoïde profonde. (3) Vérifier le résultat (ordre de grandeur, cas particulier, ou dérivation/substitution).

Résultat

ReLU standard en deep learning.

À retenir