Introduction à l’analyse des données
Un chameau photographié de face, en noir et blanc, est une colonne étroite surmontée d’une tache : rien ne permet de reconnaître l’animal. De profil, il n’y a plus le moindre doute. Même bête, même appareil — seul l’angle a changé.
C’est que le chameau a trois dimensions et la photographie deux. Passer de l’un à l’autre détruit forcément de l’information, et le métier du photographe consiste à trouver l’angle qui en détruit le moins.
Une entreprise a exactement ce problème. Trois cents clients décrits par une douzaine de variables forment un objet à douze dimensions, et aucun tableau de chiffres ne se regarde. Il faudrait le photographier — c’est-à-dire trouver le plan qui conserve la plus grande part de l’information.
C’est la définition de l’analyse des données, et c’est tout ce que fait ce cours.
Il prolonge directement la statistique descriptive : il n’introduit aucune notion statistique nouvelle. Moyenne, variance, covariance, corrélation y sont déjà — ce qui change est le nombre de variables traitées ensemble. D’où trois chapitres de rappels, qui ne sont pas une formalité : la variable centrée réduite, la covariance comme généralisation de la variance et la corrélation comme covariance de variables réduites portent tout le reste.
Viennent ensuite les deux méthodes fondatrices : l’analyse en composantes principales pour les variables quantitatives, l’analyse des correspondances pour les variables qualitatives.
Cinquième cours du bloc statistique et probabilités, niveau Licence.
Syllabus
| Niveau | Licence |
| Volume horaire indicatif | 14 chapitres, soit environ 21 h de cours |
| Prérequis | Statistique descriptive, en particulier la covariance et la corrélation. Les notions d’algèbre linéaire employées — vecteurs propres, valeurs propres — sont rappelées au moment où elles servent. |
Un fil rouge minuscule traverse les chapitres 3 à 12 : cinq clients notés sur deux critères, l’accueil et la fidélité. Tout s’y calcule à la main — moyennes de 12, variances de 8 et 32, covariance de 14,4, et une corrélation qui vaut exactement 0,9 parce que le produit des écarts-types tombe juste sur 16. Les valeurs propres qui en découlent, 1,9 et 0,1, montrent qu’un seul axe conserve 95 % de l’information.
Analyse des données avancée, au niveau Master, reprend l’ensemble depuis le début et l’approfondit : le formalisme matriciel qui unifie les méthodes, puis les correspondances multiples, la classification, l’analyse discriminante, le positionnement multidimensionnel et la mise en œuvre sur R et Python.
Chaque chapitre est un diaporama en PDF. Le tableau ci-dessous rassemble, chapitre par chapitre, les diapositives et le reste du matériel — polycopié, exercices, vidéo — au fur et à mesure de leur mise en ligne.
Chapitres et documents
| # | Chapitre | Diapositives | Polycopié | Exercices | Vidéo |
|---|---|---|---|---|---|
| 1 | Voir en deux dimensions ce qui en a beaucoup | — | — | — | |
| 2 | De la statistique descriptive à l’analyse des données | — | — | — | |
| 3 | Rappels sur une variable : centrer et réduire | — | — | — | |
| 4 | La covariance, généralisation de la variance | — | — | — | |
| 5 | La corrélation linéaire | — | — | — | |
| 6 | Le tableau de données et le nuage | — | — | — | |
| 7 | L’inertie, ou l’information d’un nuage | — | — | — | |
| 8 | L’idée de l’analyse en composantes principales | — | — | — | |
| 9 | Axes, valeurs propres et inertie expliquée | — | — | — | |
| 10 | Combien d’axes retenir | — | — | — | |
| 11 | Le cercle des corrélations | — | — | — | |
| 12 | Le plan des individus | — | — | — | |
| 13 | Du khi-deux à l’analyse des correspondances | — | — | — | |
| 14 | Lire un plan de correspondances, et la suite | — | — | — |