🧠 Ne manquez pas ça ! Obtenez un accès GRATUIT à ma communauté Skool — remplie de ressources, d'outils et de soutien pour vous aider avec les données, l'apprentissage automatique et les automatisations IA ! 📈
https://www.skool.com/data-and-ai-automations-4579Aujourd'hui, nous examinons comment appliquer la mise à l'échelle des caractéristiques aux ensembles de données dans scikit-learn en python. Cela est utile lors de l'application de la normalisation ou de la standardisation aux données, ce qui permet aux modèles d'apprentissage automatique de mieux performer.
L'ensemble de données est disponible sur mon Github
📧 Email : ryannolandata@gmail.com
🍿 REGARDEZ ENSUITE
Dans cette vidéo, je vous guide à travers la mise à l'échelle des caractéristiques en Python en utilisant scikit-learn pour améliorer vos modèles d'apprentissage automatique. La mise à l'échelle des caractéristiques transforme les valeurs numériques à la même échelle, rendant vos données plus cohérentes et vos modèles plus précis. Je couvre deux méthodes essentielles : la normalisation et la standardisation.
La normalisation met les données à l'échelle entre 0 et 1 en utilisant le MinMaxScaler, qui fonctionne en prenant votre valeur moins le minimum et en divisant par l'intervalle. La standardisation, en revanche, crée une moyenne de zéro et un écart type de un en utilisant le StandardScaler, similaire à une distribution normale. Contrairement à la normalisation, la standardisation peut gérer des valeurs négatives et des nombres supérieurs à un, ce qui la rend mieux adaptée aux ensembles de données avec des valeurs aberrantes.
Je démontre les deux techniques en utilisant de vraies statistiques de baseball avec 465 joueurs et 13 caractéristiques différentes. Vous verrez exactement comment importer les scalers de sklearn.preprocessing, ajuster et transformer vos données, et convertir les résultats en dataframes pandas propres. Je compare également les résultats côte à côte afin que vous puissiez voir comment chaque méthode modifie vos données différemment, y compris l'examen de la moyenne, de l'écart type, des valeurs minimales et maximales avant et après la mise à l'échelle.
HORAIRES
00:00 Introduction à la mise à l'échelle des caractéristiques
01:35 Configuration des données avec Pandas
03:00 Vue d'ensemble et préparation des données
04:40 Création des variables X1 et X2
05:17 Mise en œuvre du Standard Scaler
06:45 Revue des données standardisées
08:15 Mise en œuvre du Min Max Scaler
09:27 Comparaison de la standardisation vs normalisation
10:45 Résultats finaux et conclusion
AUTRES RÉSEAUX SOCIAUX :
Qui est Ryan
Ryan est Data Scientist dans une entreprise fintech, où il se concentre sur la prévention de la fraude dans l'évaluation des risques. Avant cela, il a travaillé comme Data Analyst dans une entreprise de logiciels fiscaux. Il est titulaire d'un diplôme en ingénierie électrique de l'UCF.
Qui est Matt
Matt est le fondateur de Width.ai, une agence d'IA et d'apprentissage automatique. Avant de créer sa propre entreprise, il était ingénieur en apprentissage automatique chez Capital One.
*Il s'agit d'un programme d'affiliation. Nous recevons une petite partie de la vente finale sans coût supplémentaire pour vous.