Apprentissage statistique
L’économétrie cherche à expliquer : elle veut un coefficient interprétable, assorti d’un écart-type. L’apprentissage statistique cherche à prévoir : il veut une erreur faible sur des données jamais vues, quitte à renoncer à toute lecture des coefficients.
Ce cours prend cette distinction au sérieux, parce qu’elle commande tout le reste. Le compromis biais-variance, la validation croisée, la régularisation ne sont pas des recettes : ce sont les conséquences directes du fait qu’on juge un modèle sur des données qui n’ont pas servi à l’estimer.
Le point de départ est un terrain connu — la régression linéaire du cours d’économétrie — et on l’étend pas à pas : la pénaliser (ridge, lasso), remplacer la droite par des découpages (arbres), agréger des modèles faibles (forêts aléatoires, boosting), puis séparer par des marges (SVM). Chaque méthode est jugée sur le même protocole, et le cours insiste autant sur ce que chacune ne peut pas faire que sur ce qu’elle fait.
Premier cours de la branche science des données, niveau Master.
Syllabus
| Niveau | Master |
| Volume horaire indicatif | 12 chapitres, soit environ 24 h de cours |
| Prérequis | Le niveau Licence dans son ensemble, en particulier l’introduction à l’économétrie et l’algèbre linéaire. La pratique de R ou de Python est supposée acquise. |
Chaque chapitre est un diaporama en PDF. Le tableau ci-dessous rassemble, chapitre par chapitre, les diapositives et le reste du matériel — polycopié, exercices, vidéo — au fur et à mesure de leur mise en ligne.
Chapitres et documents
| # | Chapitre | Diapositives | Polycopié | Exercices | Vidéo |
|---|---|---|---|---|---|
| 1 | Expliquer ou prévoir : deux objectifs distincts | — | — | — | |
| 2 | Le compromis biais-variance | — | — | — | |
| 3 | Rééchantillonnage et validation croisée | — | — | — | |
| 4 | La régression pénalisée : ridge et lasso | — | — | — | |
| 5 | Sélection de variables et grande dimension | — | — | — | |
| 6 | La classification : logistique et analyse discriminante | — | — | — | |
| 7 | Évaluer un classifieur : matrice de confusion, ROC, AUC | — | — | — | |
| 8 | Les arbres de décision | — | — | — | |
| 9 | Forêts aléatoires et bagging | — | — | — | |
| 10 | Le boosting de gradient | — | — | — | |
| 11 | Les machines à vecteurs de support | — | — | — | |
| 12 | Interpréter un modèle de prévision | — | — | — |