52
Tableau 4.1 : Donnée des paramètres physico-chimiques de l`année 2007.
Date
pH
CE
O2d
NO3
(mg/l)
NO2
(mg/l)
NH4
(mg/l)
PO4
(mg/)
DBO5
(mg/l)
MO
(mg/)
DCO
(mg/l)
Janvier
7,77
822
100
9
0,076
0,02
0,5
2,5
12,9
55
Février
7,37
898
52,83
1
0,297
0,15
0,6
6,6
11,8
26
Mars
7,73
892
75
11
0,092
0,02
0,4
2,9
15,5
37
Avril
8,12
736
100
8
0,09
0,02
0,6
7,8
12,5
70
Mai
7,74
804
84
0
0,32
0,08
0,7
11,1
10,2
36
Juin
7,99
768
100
8
0,25
0
0,4
4,4
7,3
18
Juillet
7,99
768
100
8
0,25
0
0,4
4,4
7,3
18
Août
7,87
822
56,96
3
0,028
0,05
0,3
8,3
9,4
32
Septembre
7,75
810
93,82
2
0,2
0,02
0,2
11,3
32
Octobre
7,97
844
76,54
4
0,145
0,02
0,3
2,8
7,1
33
Novembre
7,56
762
65,21
10
0,005
0
0,3
5,2
7
34
Décembre
7,71
760
44,68
4
0,277
0,45
0,5
2,4
11
25
Le traitement des données est très important avant n’importe quelle analyse statistique, car
une mauvaise manipulation des données peut entrainer de faux résultats et une analyse non
concluante. D’après notre tableau nous sommes en présence de données manquantes et de
données non homogènes, nous allons voir ci-dessous comment remédier à ce problème.
 Traitement des données manquantes :
Comme vous pouvez le voir dans le tableau de données, nous avons parfois ce qu’on appelle
donnée manquante (voir tableau. 4.1, la case coloriée).
Le traitement des données avec observations manquantes est un problème concret et toujours
embarrassant lorsqu’il s’agit de données réelles. En effet dans les applications, on est très
souvent en présence d’observations pour lesquelles on ne dispose pas de l’ensemble des
valeurs des variables descriptives, et ceci se produit pour de nombreuses raisons : erreurs de
saisie, rubriques non renseignées dans des enquêtes, valeurs aberrantes qu’on préfère
supprimer, données recueillies difficilement, statistiques officielles non disponibles, etc.
Certain logiciel nous donnent la possibilité d’ignorer les données manquantes et cela en
éliminant toute la ligne, mais il existe des logiciel qui traite ce problème autrement, en les
estimant car on ne peut pas toujours ignorer des données manquantes.
Dans notre cas nous avons choisis méthodes de Monte-Carlo par chaînes de Markov
(MCMC). Cette technique d’estimation s’appuyant sur la simulation d`un grand nombre de
variable aléatoire.
 Transformation des données:
Si on revient au tableau 4.1, on voit clairement que nous avons des données hétérogènes : les
paramètres n’ont pas la même unité de mesure ni les mêmes grandeurs.
Précédent

Etude des paramètres physico-chimiques des eaux du barrage de beni Haroun (Wilaya de Mila) et proposition de gestion des plans d\'eau.: - 52/105

Suivant