Chapitre VI
Machine Learning
90
VI.2.3. Overfitting
Le Sur apprentissage (Overfitting) se produit lorsque le modèle prédictif s'adapte trop bien aux
données d'apprentissage en capturant toutes les fluctuations et en s'entraînant même sur le bruit de
ces données. Par conséquent, la fonction prédictive ne généralise pas bien, elle prédira mal sur
des données qu’elle n’a pas encore vue lors de sa phase d’apprentissage.
VI.2.4. Underfitting
Le sous-apprentissage (Underfitting) se produit lorsque le modèle prédictif est trop simple et
n’arrive même pas à capturer les corrélations des données d'apprentissage. Par conséquent, le coût
d’erreur en phase d’apprentissage reste grand et le modèle prédictif ne se généralisera pas bien non
plus sur les données qu’il n’a pas encore vues. (Benzaki Y. 2017).
Figure VI-1 Exemples de Sous-apprentissage, un bon apprentissage et un sur apprentissage (Burkov A.)
VI.2.5. Modèles de Machine Learning
Dans la suite, on va présenter les modèles utilisés dans notre travail.
VI.2.5.1. Régression Linéaire
La régression linéaire est une méthode statistique qui consiste à trouver la relation linéaire entre
une variable cible et une ou plusieurs variables d'entrée. Ce modèle utilise une équation linéaire
afin de représenter la relation entre les variables. L’Équation VI-1 présente le cas linéaire d’une
seule variable indépendante. Le but est de trouver alors les coefficients í µí»½ 1 et β 0 minimisant l’erreur
quadratique MSE (Mean Squared Error) qui représente en fait la distance entre les valeurs
mesurées et prédites. Pour l’évaluer, on utilise la formule illustrée dans l’Équation VI-2. Une fois
le modèle construit, il peut être utilisé pour prédire les valeurs de la variable cible pour de nouvelles
données d'entrée.
í µí± = í µí»½ 1 í µí±¥ 1 + í µí»½ 0
Équation VI-1
í µí±í µí±í µí°¸ =
1
í µí±
∑(í µí± í µí±ééí µí±í µí±í µí± − í µí± í µí±í µí±éí µí±í µí±í µí±¡í µí± )
2
Équation VI-2
Machine Learning
90
VI.2.3. Overfitting
Le Sur apprentissage (Overfitting) se produit lorsque le modèle prédictif s'adapte trop bien aux
données d'apprentissage en capturant toutes les fluctuations et en s'entraînant même sur le bruit de
ces données. Par conséquent, la fonction prédictive ne généralise pas bien, elle prédira mal sur
des données qu’elle n’a pas encore vue lors de sa phase d’apprentissage.
VI.2.4. Underfitting
Le sous-apprentissage (Underfitting) se produit lorsque le modèle prédictif est trop simple et
n’arrive même pas à capturer les corrélations des données d'apprentissage. Par conséquent, le coût
d’erreur en phase d’apprentissage reste grand et le modèle prédictif ne se généralisera pas bien non
plus sur les données qu’il n’a pas encore vues. (Benzaki Y. 2017).
Figure VI-1 Exemples de Sous-apprentissage, un bon apprentissage et un sur apprentissage (Burkov A.)
VI.2.5. Modèles de Machine Learning
Dans la suite, on va présenter les modèles utilisés dans notre travail.
VI.2.5.1. Régression Linéaire
La régression linéaire est une méthode statistique qui consiste à trouver la relation linéaire entre
une variable cible et une ou plusieurs variables d'entrée. Ce modèle utilise une équation linéaire
afin de représenter la relation entre les variables. L’Équation VI-1 présente le cas linéaire d’une
seule variable indépendante. Le but est de trouver alors les coefficients í µí»½ 1 et β 0 minimisant l’erreur
quadratique MSE (Mean Squared Error) qui représente en fait la distance entre les valeurs
mesurées et prédites. Pour l’évaluer, on utilise la formule illustrée dans l’Équation VI-2. Une fois
le modèle construit, il peut être utilisé pour prédire les valeurs de la variable cible pour de nouvelles
données d'entrée.
í µí± = í µí»½ 1 í µí±¥ 1 + í µí»½ 0
Équation VI-1
í µí±í µí±í µí°¸ =
1
í µí±
∑(í µí± í µí±ééí µí±í µí±í µí± − í µí± í µí±í µí±éí µí±í µí±í µí±¡í µí± )
2
Équation VI-2
