Chapitre IV
Traitement et recueil de données
49
Chaibai M. S & Hanani A. Z
ENSSMAL
5 Méthode de k clustering k-means
En basant sur cette distribution, on peut ressortir les conditions de projet les plus fréquentes
par un affinement directionnel et connaitre la norme de la distribution et ses anomalies.
K-means est un algorithme non supervisé de clustering non hiérarchique. Il permet de regrouper
en K clusters distincts les observations du data set. Ainsi les données similaires se retrouveront
dans un même cluster. Par ailleurs, une observation ne peut se retrouver que dans un cluster à
la fois (exclusivité d’appartenance). Une même observation, ne pourra donc, appartenir à deux
clusters différents. ( https://mrmint.fr/algorithme-k-means )
Les avantages de cette méthode ce sont la Scalabilité ou la Capacité à traiter les très grandes
bases, et la complexité linéaire par rapport au nombre d’observations (pas de calcul des
distances deux à deux des individus, cf. CAH).
5.1 Degré de similarité
Pour pouvoir regrouper les ensembles de données en K clusters distincts, l'algorithme KMeans a besoin d'un moyen de comparer la similarité des différentes observations. Par
conséquent, deux données similaires auront une distance de dissimilarité réduite et deux objets
différents auront une distance de séparation plus grande.
5.2 Choix de K cluster
Choisir plusieurs clusters K n'est pas forcément intuitif. Surtout lorsque l'ensemble de
données est volumineux et que nous n'avons pas d'antécédents ni d'hypothèses sur les données.
Un K plus grand peut entraîner des partitions de données trop fragmentées. Cela empêchera la
découverte des patterns intéressants dans les données. D'un autre côté, avoir trop peu de clusters
peut rendre les clusters contenant de grandes quantités de données trop généraux. Dans ce cas,
il n'y aura pas de patterns "fins" à découvrir.
Toutes fois on peut déduire le nombre de cluster idéal pour notre distribution à l’aide de graphe
de coude, On définit cette dernière comme ceci : la somme des distances euclidiennes
entre chaque point et son centroïde associé. Evidemment plus on fixe un nombre initial
de clusters élevés et plus on réduit l’inertie : les points ont plus de chance d’être à côté
d’un centroïde. ( https://datascientest.com/)
Pour notre cas d’étude la méthode de la distribution kmeans été faites par la création d’un script
sur le langage python en basant sur les bibliothèques pandas, numpy avec les visualiser jupyter
sur anaconda.
5.3 Interprétation de la distribution des données
Les groupes finaux des données Hs,Dp et Tp sous 2 clusters (figure 64) sont homogènes,
logiques et ne représentent pas d’anomalies.
La figure 62 représente la distribution des amplitudes de la houle en fonction de la période de
la houle, sur toute la série chronologique extraite du point IOWAGA mentionnée. On remarque
que les houles aillant une amplitude de 5m a 7m ont une période moyenne de 10sec.
Précédent

Modélisation hydrodynamique et étude d’agitation: Cas de la Marina Bay D’Alger - 60/121

Suivant