In diesem 365 Data Science Tutorial konzentrieren wir uns auf eine der wichtigsten Praktiken im maschinellen Lernen – die Kreuzvalidierung, auch bekannt als N-fache Kreuzvalidierung oder K-fache Kreuzvalidierung. Kreuzvalidierung ist eine Technik, die in vielen Bereichen des maschinellen Lernens verwendet wird. Wir werden sie speziell verwenden, um die besten Parameter für unseren Support Vector Classifier auszuwählen. Es ist wichtig, die allgemeine Bedeutung der Kreuzvalidierung und ihre verschiedenen Anwendungen zu kennen.
Zunächst nehmen wir an, du hast einen bereits beschrifteten Datensatz und möchtest ihn verwenden, um maschinelle Lernmodelle zu trainieren und das leistungsstärkste auszuwählen. Was wahrscheinlich passieren würde, wenn wir nur einen Trainingssatz verwenden, ist, dass eines der Modelle besser abschneidet. Es ist jedoch oft der Fall, dass das Modell bei Tests mit einem neuen Datensatz nicht so gut abschneidet wie in der Trainingsphase. In den meisten Fällen liegt der Grund darin, dass das Modell einige der Verzerrungen aus den Trainingsdaten übernommen hat und daher nicht in der Lage ist, mit der gleichen Genauigkeit auf einem neuen Datensatz während des Tests zu verallgemeinern. In anderen Situationen möchtest du das maschinelle Lernmodell mit deinen Daten trainieren, hast aber nicht genügend große Stichprobengröße.
Du könntest denken, dass in diesem datengestützten Zeitalter die Fülle an Daten Probleme verursacht, anstatt nicht genug davon zu haben – was in den meisten Fällen zutrifft. In einigen Bereichen wie den Lebenswissenschaften ist es jedoch oft leichter gesagt als getan, eine ausreichend große Stichprobe zu erhalten. Um Daten zu erhalten, müssen wir Experimente entwerfen, die oft zeitaufwendig und teuer sind.
Hier kommt die Kreuzvalidierung ins Spiel, da sie es uns ermöglicht, die Menge an Trainingsdaten künstlich zu erhöhen, ohne tatsächlich neue Punkte zu sampeln. Die Idee der Kreuzvalidierung basiert darauf, unsere Daten in N oder K gleich große Teile zu teilen und dann neue Variationen davon zu erstellen. Schau bis zum Ende des Videos, um zu sehen, wie das genau funktioniert, wie man die durchschnittliche Leistung unserer Algorithmen über alle Datensätze berechnet und herausfindet, in welchen anderen Fällen die Kreuzvalidierung von Vorteil sein könnte.
365 Data Science ist eine Online-Bildungsplattform, die die unglaubliche Möglichkeit bietet, deinen Weg in die Welt der Data Science zu finden, unabhängig von deinem vorherigen Wissen und deiner Erfahrung. Deshalb haben wir diesen Kanal denjenigen gewidmet, die völlig neu sind und neugierig darauf sind, die wunderbare Welt der Data Science zu erkunden. Sobald du ein grundlegendes theoretisches Wissen aufgebaut hast, kannst du dich für unser umfassendes Curriculum anmelden, in dem wir zahlreiche Kurse vorbereitet haben, die den Bedürfnissen angehender BI-Analysten, Datenanalysten und Data Scientists entsprechen.
#kreuzvalidierung #maschinelleslernen #365datasciencetutorials