Apprentissage statistique

L’économétrie cherche à expliquer : elle veut un coefficient interprétable, assorti d’un écart-type. L’apprentissage statistique cherche à prévoir : il veut une erreur faible sur des données jamais vues, quitte à renoncer à toute lecture des coefficients.

Ce cours prend cette distinction au sérieux, parce qu’elle commande tout le reste. Le compromis biais-variance, la validation croisée, la régularisation ne sont pas des recettes : ce sont les conséquences directes du fait qu’on juge un modèle sur des données qui n’ont pas servi à l’estimer.

Le point de départ est un terrain connu — la régression linéaire du cours d’économétrie — et on l’étend pas à pas : la pénaliser (ridge, lasso), remplacer la droite par des découpages (arbres), agréger des modèles faibles (forêts aléatoires, boosting), puis séparer par des marges (SVM). Chaque méthode est jugée sur le même protocole, et le cours insiste autant sur ce que chacune ne peut pas faire que sur ce qu’elle fait.

Premier cours de la branche science des données, niveau Master.

Syllabus

Niveau Master
Volume horaire indicatif 12 chapitres, soit environ 24 h de cours
Prérequis Le niveau Licence dans son ensemble, en particulier l’introduction à l’économétrie et l’algèbre linéaire. La pratique de R ou de Python est supposée acquise.

Chaque chapitre est un diaporama en PDF. Le tableau ci-dessous rassemble, chapitre par chapitre, les diapositives et le reste du matériel — polycopié, exercices, vidéo — au fur et à mesure de leur mise en ligne.

Chapitres et documents

# Chapitre Diapositives Polycopié Exercices Vidéo
1 Expliquer ou prévoir : deux objectifs distincts PDF
2 Le compromis biais-variance PDF
3 Rééchantillonnage et validation croisée PDF
4 La régression pénalisée : ridge et lasso PDF
5 Sélection de variables et grande dimension PDF
6 La classification : logistique et analyse discriminante PDF
7 Évaluer un classifieur : matrice de confusion, ROC, AUC PDF
8 Les arbres de décision PDF
9 Forêts aléatoires et bagging PDF
10 Le boosting de gradient PDF
11 Les machines à vecteurs de support PDF
12 Interpréter un modèle de prévision PDF