"Pourquoi vous devriez prétraiter vos données. Tout sur la normalisation, la suppression des valeurs aberrantes, l'imputation des données manquantes et les transformations de variables.
___________________________________________
___________________________________________
Partie 1 : Régression en apprentissage automatique et le modèle de régression linéaire
Partie 2 : Les différentes fonctions de coût pour la régression - Comprendre MAE, MSE, WMAE
Partie 3 : Comment fonctionne l'entraînement du modèle avec la minimisation basée sur le gradient
Partie 4 : Prétraitement des données - Normalisation, Valeurs aberrantes, Données manquantes, Transformation des variables
Partie 5 : Validation croisée - Comment sélectionner le meilleur modèle d'apprentissage automatique ?
Partie 6 : Régularisation - Arrêt précoce, Régression Ridge (L2) et Régression Lasso (L1)
___________________________________________
- La normalisation est particulièrement importante pour une minimisation basée sur le gradient. Les données peuvent être normalisées via la normalisation min-max ou la standardisation.
- La détection des valeurs aberrantes peut être utilisée pour supprimer les valeurs aberrantes. Les valeurs aberrantes peuvent être identifiées via des boxplots. Un boxplot affiche la médiane et l'intervalle interquartile avec des moustaches.
- Les données manquantes peuvent être soit supprimées, soit imputées par exemple via la moyenne ou la médiane.
- La transformation des variables peut être appliquée aux variables numériques. Par exemple, une modification fonctionnelle, une combinaison de variables ou des modèles complexes peuvent être utilisés. Une transformation de variable pour les variables catégorielles peut transformer des caractéristiques catégorielles en variables binaires. Cela s'appelle l'encodage one-hot.