Chapitre I : Généralités et Méthodes d’étude
- 27 -
Classification ascendante hiérarchique CAH
La classification hiérarchique a été utilisée dans des disciplines extrêmement variées. Elle a été
décrite par plusieurs auteurs entre autres DAGET (1979), PHILIPPEAU (1986), DAGNELIE
(1986), LEGENDRE et LEGENDRE (1984 et 1998), HERRERA et Le GAC (2002), GEORGIN
(2002) et BOUROCHE et SAPORTA (2005), ainsi que par d’autres auteurs cités par HEMIDA
(2005) : DAGNELIE (1973, 1975), GILBERT (1978), DANIEL (1978), LAFORGE (1981),
LAGARDE (1983) et SCHWARTZ (1983). Cette méthode a pour but de regrouper les individus
observés en un nombre restreint de groupes.
Cette méthode consiste à partitionner les objets (ou les descripteurs) de l’étude en groupes et en
sous-groupes, en passant par la condensation de l’information fournie par la matrice de données en
une matrice de similitude ou de distance. En effet, toutes les procédures d’agglomération
commencent par la transformation de la matrice initiale I (variables/objets) en une matrice de
ressemblance D (objets/objets). Cette dernière est obtenue à partir du calcul d’un indice de
similarité/dissimilarité ou de la mesure de distance entre objets. En écologie, il existe plusieurs
distances et indices de similarité/dissimilarité qui peuvent être utilisés afin d’effectuer une CAH. La
méthode la plus directe consiste à calculer les distances Euclidiennes entre objets (HEMIDA, 2005)
(le type de distance le plus couramment utilisé ; il s'agit simplement d'une distance géométrique
dans un espace multidimensionnel).
A partir de la matrice de distance D, des différents algorithmes de classification peuvent être
utilisés : Ward, Lien simple (saut minimum - single linkage), Lien complet (saut maximum -
complete linkage), Lien moyen (average linkage ou UPGMA), Lien moyen avec pondération
(WPGMA), Critère centroïde (barycentre). Dans ce présent travail, nous avons utilisé les quatre
premiers critères de classification. Ces différents algorithmes classifient les objets de l’étude d’une
manière différente, cela produit des dendrogrammes différents entre les différentes méthodes de
classification. Donc la sélection d’un algorithme de classification approprié est cruciale. De ce fait,
une fois les dendrogrammes sont établis, il sera demandé d’identifier le dendrogramme qui
représente le plus fidèlement possible la matrice de ressemblance D. Cela peut être effectué par la
comparaison de la matrice de ressemblance D à chacune des matrices ultramétriques U fournies par
les différents dendrogrammes, et d’identifier la matrice U la plus proche de la matrice D
(MERIGOT et al., 2010). Parmi les méthodes utilisées, on trouve l’approche de la corrélation
cophénétique basée sur le coefficient de corrélation de Pearson entre la matrice ultramétrique et la
matrice de ressemblance (LEGENDRE et LEGENDRE, 1998 ; MERIGOT et al., 2010). Cependant,
cette approche ne semble pas des plus adaptées pour étudier le degré d’ajustement de U sur D, car
elle ne quantifie pas explicitement le degré d’éloignement entre U et D mais l’intensité de la
relation linéaire entre les éléments de U et D (MERIGOT, 2008). MERIGOT et al. (2010) ont
- 27 -
Classification ascendante hiérarchique CAH
La classification hiérarchique a été utilisée dans des disciplines extrêmement variées. Elle a été
décrite par plusieurs auteurs entre autres DAGET (1979), PHILIPPEAU (1986), DAGNELIE
(1986), LEGENDRE et LEGENDRE (1984 et 1998), HERRERA et Le GAC (2002), GEORGIN
(2002) et BOUROCHE et SAPORTA (2005), ainsi que par d’autres auteurs cités par HEMIDA
(2005) : DAGNELIE (1973, 1975), GILBERT (1978), DANIEL (1978), LAFORGE (1981),
LAGARDE (1983) et SCHWARTZ (1983). Cette méthode a pour but de regrouper les individus
observés en un nombre restreint de groupes.
Cette méthode consiste à partitionner les objets (ou les descripteurs) de l’étude en groupes et en
sous-groupes, en passant par la condensation de l’information fournie par la matrice de données en
une matrice de similitude ou de distance. En effet, toutes les procédures d’agglomération
commencent par la transformation de la matrice initiale I (variables/objets) en une matrice de
ressemblance D (objets/objets). Cette dernière est obtenue à partir du calcul d’un indice de
similarité/dissimilarité ou de la mesure de distance entre objets. En écologie, il existe plusieurs
distances et indices de similarité/dissimilarité qui peuvent être utilisés afin d’effectuer une CAH. La
méthode la plus directe consiste à calculer les distances Euclidiennes entre objets (HEMIDA, 2005)
(le type de distance le plus couramment utilisé ; il s'agit simplement d'une distance géométrique
dans un espace multidimensionnel).
A partir de la matrice de distance D, des différents algorithmes de classification peuvent être
utilisés : Ward, Lien simple (saut minimum - single linkage), Lien complet (saut maximum -
complete linkage), Lien moyen (average linkage ou UPGMA), Lien moyen avec pondération
(WPGMA), Critère centroïde (barycentre). Dans ce présent travail, nous avons utilisé les quatre
premiers critères de classification. Ces différents algorithmes classifient les objets de l’étude d’une
manière différente, cela produit des dendrogrammes différents entre les différentes méthodes de
classification. Donc la sélection d’un algorithme de classification approprié est cruciale. De ce fait,
une fois les dendrogrammes sont établis, il sera demandé d’identifier le dendrogramme qui
représente le plus fidèlement possible la matrice de ressemblance D. Cela peut être effectué par la
comparaison de la matrice de ressemblance D à chacune des matrices ultramétriques U fournies par
les différents dendrogrammes, et d’identifier la matrice U la plus proche de la matrice D
(MERIGOT et al., 2010). Parmi les méthodes utilisées, on trouve l’approche de la corrélation
cophénétique basée sur le coefficient de corrélation de Pearson entre la matrice ultramétrique et la
matrice de ressemblance (LEGENDRE et LEGENDRE, 1998 ; MERIGOT et al., 2010). Cependant,
cette approche ne semble pas des plus adaptées pour étudier le degré d’ajustement de U sur D, car
elle ne quantifie pas explicitement le degré d’éloignement entre U et D mais l’intensité de la
relation linéaire entre les éléments de U et D (MERIGOT, 2008). MERIGOT et al. (2010) ont
