® Chaque ligne correspond à un individu : les vecteurs-ligne sont de la forme
t X 1 ,
t X 2 ,. . .,
t X n , où X 1 ,X 2 ,. . .,X n sont des vecteurs de l’espace R
p . Ces vecteurs
X 1 , . . . , X n sont les vecteurs-individu.
C 1 C 2 · · · C p
X 1
X 2
. . .
X n
⎡
⎢
⎢
⎣
x 11 x 12 · · · x 1p
x 21 x 22 · · · x 2p
. . .
. . .
. . .
x n1 x n2 · · · x np
⎤
⎥
⎥
⎦
= [ C 1 C 2 · · · C p ] =
⎡
⎢
⎢
⎣
t X 1
t X 2
. . .
t X n
⎤
⎥
⎥
⎦
Représentons chaque vecteur-individu par un point dans R
p : on obtient un nuage
d’individus formé de n points. L’analyse de données se propose d’étudier la forme
de ce nuage pour en déduire des corrélations entre caractères et découvrir des
groupes d’individus dont les caractères s’opposent ou se ressemblent.
Préparation des données. Afin de réaliser une étude globale, on introduit la
valeur moyenne de chaque caractère et l’on s’intéresse aux écarts à ce caractère
moyen. De plus, pour pouvoir comparer des données dont la dispersion dépend des
unités employées, on opère également une normalisation sur les écarts à la moyenne.
Ainsi, on commence par faire subir aux données deux opérations de régularisation.
Centrage
Pour chaque vecteur-caractère C k ∈R
n , notons m k la moyenne de ses coordonnées :
m k = 1
n
(x 1k +x 2k + · · · +x nk ), et définissons le caractère centré C k en posant :
C k =
⎡
⎢
⎣
x 1k −m k
x 2k −m k
. . .
x nk −m k
⎤
⎥
⎦
Puisque
n
i=1 (x ik −m k ) = (
n
i=1 x ik ) − n m k = 0, la somme des coordonnées de
C k est nulle.
Normalisation
On définit la variance var(C k ) et l’écart-type σ k (voir page 70) :
var(C k ) = 1
n
C k
2 = 1
n
n
i=1
(x ik −m k )
2 et σ k =
var(C k ) , pour k = 1, 2, . . . , p.
Le caractère centré et normalisé est D k = 1
√
n σ k
C k = 1
C k
C k .
En posant y ik =
x ik −m k
√
n σ k
pour 1in et 1kp, la nouvelle matrice des données est
M =
D 1 D 2 · · · D p
⎡
⎢
⎢
⎣
y 11 y 12 · · · y 1p
y 21 y 22 · · · y 2p
. . .
. . .
. . .
y n1 y n2 · · · y np
⎤
⎥
⎥
⎦
t Y 1
t Y 2
. . .
t Y n
230 – APPLICATION `
A L’ANALYSE DE DONN ´
EES
t X 1 ,
t X 2 ,. . .,
t X n , où X 1 ,X 2 ,. . .,X n sont des vecteurs de l’espace R
p . Ces vecteurs
X 1 , . . . , X n sont les vecteurs-individu.
C 1 C 2 · · · C p
X 1
X 2
. . .
X n
⎡
⎢
⎢
⎣
x 11 x 12 · · · x 1p
x 21 x 22 · · · x 2p
. . .
. . .
. . .
x n1 x n2 · · · x np
⎤
⎥
⎥
⎦
= [ C 1 C 2 · · · C p ] =
⎡
⎢
⎢
⎣
t X 1
t X 2
. . .
t X n
⎤
⎥
⎥
⎦
Représentons chaque vecteur-individu par un point dans R
p : on obtient un nuage
d’individus formé de n points. L’analyse de données se propose d’étudier la forme
de ce nuage pour en déduire des corrélations entre caractères et découvrir des
groupes d’individus dont les caractères s’opposent ou se ressemblent.
Préparation des données. Afin de réaliser une étude globale, on introduit la
valeur moyenne de chaque caractère et l’on s’intéresse aux écarts à ce caractère
moyen. De plus, pour pouvoir comparer des données dont la dispersion dépend des
unités employées, on opère également une normalisation sur les écarts à la moyenne.
Ainsi, on commence par faire subir aux données deux opérations de régularisation.
Centrage
Pour chaque vecteur-caractère C k ∈R
n , notons m k la moyenne de ses coordonnées :
m k = 1
n
(x 1k +x 2k + · · · +x nk ), et définissons le caractère centré C k en posant :
C k =
⎡
⎢
⎣
x 1k −m k
x 2k −m k
. . .
x nk −m k
⎤
⎥
⎦
Puisque
n
i=1 (x ik −m k ) = (
n
i=1 x ik ) − n m k = 0, la somme des coordonnées de
C k est nulle.
Normalisation
On définit la variance var(C k ) et l’écart-type σ k (voir page 70) :
var(C k ) = 1
n
C k
2 = 1
n
n
i=1
(x ik −m k )
2 et σ k =
var(C k ) , pour k = 1, 2, . . . , p.
Le caractère centré et normalisé est D k = 1
√
n σ k
C k = 1
C k
C k .
En posant y ik =
x ik −m k
√
n σ k
pour 1in et 1kp, la nouvelle matrice des données est
M =
D 1 D 2 · · · D p
⎡
⎢
⎢
⎣
y 11 y 12 · · · y 1p
y 21 y 22 · · · y 2p
. . .
. . .
. . .
y n1 y n2 · · · y np
⎤
⎥
⎥
⎦
t Y 1
t Y 2
. . .
t Y n
230 – APPLICATION `
A L’ANALYSE DE DONN ´
EES
