Analyse des données avancée
Le cours de Licence montrait ce que font les méthodes factorielles : réduire la dimension en perdant le moins d’information possible, comme le photographe cherche l’angle qui rend le chameau reconnaissable.
Celui-ci montre pourquoi elles le font — et démontre au passage le résultat qui les unifie. L’analyse en composantes principales, l’analyse des correspondances et l’analyse des correspondances multiples ne sont pas trois méthodes à apprendre séparément : c’est un seul calcul, appliqué à trois choix de métrique et de poids.
D’où l’ordre du cours. Quatre chapitres posent le triplet (\mathbf{X}, \mathbf{M}, \mathbf{D}), l’inertie comme trace et la décomposition en valeurs singulières ; tout le reste en découle. Le lagrangien de l’ACP tient alors en trois lignes, la dualité entre le nuage des individus et celui des variables en trois autres.
Le cours va ensuite là où la Licence s’arrêtait : les correspondances multiples, la classification — ascendante hiérarchique puis k-means —, l’analyse discriminante, l’affectation d’un nouveau client, le positionnement multidimensionnel, et une mise en œuvre complète sur R et Python.
Premier cours de la branche science des données, niveau Master.
Syllabus
| Niveau | Master |
| Volume horaire indicatif | 20 chapitres, soit environ 30 h de cours |
| Prérequis | Introduction à l’analyse des données et Algèbre linéaire — diagonalisation, formes quadratiques, projection orthogonale. La décomposition en valeurs singulières est établie dans le cours. |
Deux jeux de données traversent le cours. Un fichier réel de 300 clients notés sur 8 critères de satisfaction porte tous les résultats : inertie totale de 8, valeurs propres de 4,535 et 1,645 — soit 77,3 % sur un simple plan —, un premier axe de satisfaction générale sur lequel la fréquence de visite vient s’ordonner toute seule, alors qu’elle n’a participé à aucun calcul. Les chapitres 9 et 10 croisent deux variables du même fichier, la catégorie socioprofessionnelle et le motif de visite : un khi-deux de 110,41 pour 12 degrés de liberté, et deux axes à 61,6 et 28,0 %.
À côté, un tableau minuscule de quatre individus et deux variables sert à écrire les calculs en entier. Sa matrice \mathbf{X}'\mathbf{X} a pour valeurs propres 16 et 4, donc des valeurs singulières de 4 et 2 : la diagonalisation, la décomposition en valeurs singulières et l’ACP normée s’y font au tableau, sans une décimale.
Chaque chapitre est un diaporama en PDF. Le tableau ci-dessous rassemble, chapitre par chapitre, les diapositives et le reste du matériel — polycopié, exercices, vidéo — au fur et à mesure de leur mise en ligne.
Chapitres et documents
| # | Chapitre | Diapositives | Polycopié | Exercices | Vidéo |
|---|---|---|---|---|---|
| 1 | Reprendre l’analyse des données par l’algèbre | — | — | — | |
| 2 | Le tableau, les poids et la métrique | — | — | — | |
| 3 | L’inertie, formalisée | — | — | — | |
| 4 | Diagonalisation et décomposition en valeurs singulières | — | — | — | |
| 5 | L’ACP en écriture matricielle | — | — | — | |
| 6 | Dualité et relations de transition | — | — | — | |
| 7 | Combien d’axes retenir | — | — | — | |
| 8 | Contributions, cosinus carrés et éléments supplémentaires | — | — | — | |
| 9 | L’AFC et la métrique du khi-deux | — | — | — | |
| 10 | Profils, barycentres et lecture conjointe | — | — | — | |
| 11 | L’analyse des correspondances multiples | — | — | — | |
| 12 | Distances et dissimilarités | — | — | — | |
| 13 | La classification ascendante hiérarchique | — | — | — | |
| 14 | Les k-means et la consolidation | — | — | — | |
| 15 | Décrire et nommer les segments | — | — | — | |
| 16 | L’analyse factorielle discriminante | — | — | — | |
| 17 | Classer un nouveau client | — | — | — | |
| 18 | Le positionnement multidimensionnel | — | — | — | |
| 19 | Étude de cas | — | — | — | |
| 20 | Mise en œuvre sur R et Python | — | — | — |