Dans ce tutoriel de 365 Data Science, nous allons nous concentrer sur l'une des pratiques les plus importantes en apprentissage automatique : la validation croisée, également connue sous le nom de validation croisée N-fold ou K-fold. La validation croisée est une technique utilisée dans de nombreux domaines de l'apprentissage automatique. Nous l'utiliserons spécifiquement pour choisir le meilleur ensemble de paramètres pour notre classificateur à vecteurs de support. Il est important de connaître la signification générale de la validation croisée et ses différentes applications.
Disons d'abord que vous avez un ensemble de données déjà étiqueté et que vous souhaitez l'utiliser pour entraîner des modèles d'apprentissage automatique et choisir celui qui performe le mieux. Ce qui se passerait probablement si nous n'utilisions qu'un seul ensemble d'entraînement, c'est qu'un des modèles performerait mieux que les autres. Cependant, il arrive souvent qu'en testant sur un nouvel ensemble de données, le modèle ne performe pas aussi bien qu'en phase d'entraînement. Dans la plupart des cas, la raison est que le modèle a incorporé certains biais des données d'entraînement, et par conséquent, il est incapable de généraliser avec la même précision sur un nouvel ensemble de données lors des tests. Dans d'autres situations, vous souhaitez entraîner le modèle d'apprentissage automatique sur vos données mais vous n'avez pas une taille d'échantillon suffisamment grande.
Vous pourriez penser que dans cette ère axée sur les données, l'abondance de données pose des problèmes plutôt que de ne pas en avoir assez, ce qui est vrai dans la plupart des cas. Cependant, dans certains domaines comme les sciences de la vie, obtenir un échantillon suffisamment grand est souvent plus facile à dire qu'à faire. Pour obtenir des données, nous devons concevoir des expériences qui sont souvent longues et coûteuses.
C'est ici que la validation croisée entre en jeu, car elle nous permet d'augmenter artificiellement la quantité de données d'entraînement sans réellement échantillonner de nouveaux points. L'idée de la validation croisée repose sur le fait de diviser nos données en N ou K parties égales, puis de créer de nouvelles variations. Regardez jusqu'à la fin de la vidéo pour voir comment cela fonctionne exactement, comment calculer la performance moyenne de nos algorithmes sur tous les ensembles de données et découvrir d'autres cas où la validation croisée pourrait être bénéfique.
365 Data Science est un site éducatif en ligne qui offre l'incroyable opportunité de trouver votre voie dans le monde de la science des données, peu importe vos connaissances et expériences antérieures. C'est pourquoi nous avons dédié cette chaîne à ceux qui sont complètement nouveaux et curieux d'explorer le merveilleux monde de la science des données. Une fois que vous avez acquis des connaissances théoriques de base, vous pouvez vous inscrire à notre programme complet où nous avons préparé de nombreux cours adaptés aux besoins des futurs analystes BI, analystes de données et scientifiques des données.
#validationcroisée #apprentissageautomatique #tutoriels365datascience