50
4.1.2. Analyse en composante principale : Principe et objectifs
Lorsqu'on veut étudier simultanément un nombre important de variables quantitatives (ne
serait-ce que 4), la question qui se pose automatiquement est : comment en faire un graphique
global ? La difficulté vient de ce que les individus étudiés (voir le tableau des données cidessous Fig. 4.2) ne sont plus représentés dans un plan, espace de dimension 2, mais dans un
espace de dimension plus importante (par exemple 4). L'objectif de l'Analyse en Composantes
Principales est de revenir à un espace de dimension réduite (par exemple 2) en déformant le
moins possible la réalité. Il s'agit donc d'obtenir le résumé le plus pertinent possible des
données initiales.
C'est la matrice des variances-covariances (ou celle des corrélations) qui va permettre de
réaliser ce résumé pertinent, parce qu'on analyse essentiellement la dispersion des données
considérées. De cette matrice, on va extraire, par un procédé mathématique approprié, les
facteurs que l'on recherche, en petit nombre. Ils vont permettre de réaliser les graphiques
désirés dans cet espace de petite dimension (le nombre de facteurs retenus), en déformant le
moins possible la configuration globale des individus telle qu'elle est définie par l'ensemble
des variables initiales (ainsi remplacées par les facteurs). C'est l'interprétation de ces
graphiques qui permettra de comprendre la structure des données analysées.
L'analyse en composantes principales - que nous notons par la suite ACP - est une des
premières analyses factorielles, et certainement aujourd'hui l'une des plus employées. Dans
[LMP95], nous trouvons l'historique de cette méthode qui fut conçue par Karl Pearson en
1901. Elle est sans doute à la base de la compréhension actuelle des analyses factorielles.
Pour faire une ACP, il faut disposer d’un tableau de données sous forme (individus *
variables), que nous allons noter X
On a un ensemble de n individus décrits par p variables
quantitatives sous forme de matrice de dim
p
n,
représentant les valeurs du tableau de données.
Où :
ij
x : Est la valeur de la variable X j observée sur l`individu i
nj
ij
j
j
j
x
x
x
x
X
,...,
,...,
, 2
1
est le vecteur de variable
4.1.2. Analyse en composante principale : Principe et objectifs
Lorsqu'on veut étudier simultanément un nombre important de variables quantitatives (ne
serait-ce que 4), la question qui se pose automatiquement est : comment en faire un graphique
global ? La difficulté vient de ce que les individus étudiés (voir le tableau des données cidessous Fig. 4.2) ne sont plus représentés dans un plan, espace de dimension 2, mais dans un
espace de dimension plus importante (par exemple 4). L'objectif de l'Analyse en Composantes
Principales est de revenir à un espace de dimension réduite (par exemple 2) en déformant le
moins possible la réalité. Il s'agit donc d'obtenir le résumé le plus pertinent possible des
données initiales.
C'est la matrice des variances-covariances (ou celle des corrélations) qui va permettre de
réaliser ce résumé pertinent, parce qu'on analyse essentiellement la dispersion des données
considérées. De cette matrice, on va extraire, par un procédé mathématique approprié, les
facteurs que l'on recherche, en petit nombre. Ils vont permettre de réaliser les graphiques
désirés dans cet espace de petite dimension (le nombre de facteurs retenus), en déformant le
moins possible la configuration globale des individus telle qu'elle est définie par l'ensemble
des variables initiales (ainsi remplacées par les facteurs). C'est l'interprétation de ces
graphiques qui permettra de comprendre la structure des données analysées.
L'analyse en composantes principales - que nous notons par la suite ACP - est une des
premières analyses factorielles, et certainement aujourd'hui l'une des plus employées. Dans
[LMP95], nous trouvons l'historique de cette méthode qui fut conçue par Karl Pearson en
1901. Elle est sans doute à la base de la compréhension actuelle des analyses factorielles.
Pour faire une ACP, il faut disposer d’un tableau de données sous forme (individus *
variables), que nous allons noter X
On a un ensemble de n individus décrits par p variables
quantitatives sous forme de matrice de dim
p
n,
représentant les valeurs du tableau de données.
Où :
ij
x : Est la valeur de la variable X j observée sur l`individu i
nj
ij
j
j
j
x
x
x
x
X
,...,
,...,
, 2
1
est le vecteur de variable
