Introduction à l’analyse des données

Un chameau photographié de face, en noir et blanc, est une colonne étroite surmontée d’une tache : rien ne permet de reconnaître l’animal. De profil, il n’y a plus le moindre doute. Même bête, même appareil — seul l’angle a changé.

C’est que le chameau a trois dimensions et la photographie deux. Passer de l’un à l’autre détruit forcément de l’information, et le métier du photographe consiste à trouver l’angle qui en détruit le moins.

Une entreprise a exactement ce problème. Trois cents clients décrits par une douzaine de variables forment un objet à douze dimensions, et aucun tableau de chiffres ne se regarde. Il faudrait le photographier — c’est-à-dire trouver le plan qui conserve la plus grande part de l’information.

C’est la définition de l’analyse des données, et c’est tout ce que fait ce cours.

Il prolonge directement la statistique descriptive : il n’introduit aucune notion statistique nouvelle. Moyenne, variance, covariance, corrélation y sont déjà — ce qui change est le nombre de variables traitées ensemble. D’où trois chapitres de rappels, qui ne sont pas une formalité : la variable centrée réduite, la covariance comme généralisation de la variance et la corrélation comme covariance de variables réduites portent tout le reste.

Viennent ensuite les deux méthodes fondatrices : l’analyse en composantes principales pour les variables quantitatives, l’analyse des correspondances pour les variables qualitatives.

Cinquième cours du bloc statistique et probabilités, niveau Licence.

Syllabus

Niveau Licence
Volume horaire indicatif 14 chapitres, soit environ 21 h de cours
Prérequis Statistique descriptive, en particulier la covariance et la corrélation. Les notions d’algèbre linéaire employées — vecteurs propres, valeurs propres — sont rappelées au moment où elles servent.

Un fil rouge minuscule traverse les chapitres 3 à 12 : cinq clients notés sur deux critères, l’accueil et la fidélité. Tout s’y calcule à la main — moyennes de 12, variances de 8 et 32, covariance de 14,4, et une corrélation qui vaut exactement 0,9 parce que le produit des écarts-types tombe juste sur 16. Les valeurs propres qui en découlent, 1,9 et 0,1, montrent qu’un seul axe conserve 95 % de l’information.

Analyse des données avancée, au niveau Master, reprend l’ensemble depuis le début et l’approfondit : le formalisme matriciel qui unifie les méthodes, puis les correspondances multiples, la classification, l’analyse discriminante, le positionnement multidimensionnel et la mise en œuvre sur R et Python.

Chaque chapitre est un diaporama en PDF. Le tableau ci-dessous rassemble, chapitre par chapitre, les diapositives et le reste du matériel — polycopié, exercices, vidéo — au fur et à mesure de leur mise en ligne.

Chapitres et documents

# Chapitre Diapositives Polycopié Exercices Vidéo
1 Voir en deux dimensions ce qui en a beaucoup PDF
2 De la statistique descriptive à l’analyse des données PDF
3 Rappels sur une variable : centrer et réduire PDF
4 La covariance, généralisation de la variance PDF
5 La corrélation linéaire PDF
6 Le tableau de données et le nuage PDF
7 L’inertie, ou l’information d’un nuage PDF
8 L’idée de l’analyse en composantes principales PDF
9 Axes, valeurs propres et inertie expliquée PDF
10 Combien d’axes retenir PDF
11 Le cercle des corrélations PDF
12 Le plan des individus PDF
13 Du khi-deux à l’analyse des correspondances PDF
14 Lire un plan de correspondances, et la suite PDF