"Warum Sie Ihre Daten vorverarbeiten sollten. Alles über Normalisierung, das Entfernen von Ausreißern, das Imputieren fehlender Daten und Variablenumwandlungen.
___________________________________________
___________________________________________
Teil 1: Regression im maschinellen Lernen und das lineare Regressionsmodell
Teil 2: Die verschiedenen Kostenfunktionen für Regression - Verstehen von MAE, MSE, WMAE
Teil 3: Wie das Modelltraining mit gradientenbasierter Minimierung funktioniert
Teil 4: Datenvorverarbeitung - Normalisierung, Ausreißer, Fehlende Daten, Variablenumwandlung
Teil 5: Kreuzvalidierung - Wie wählt man das beste Modell für maschinelles Lernen aus?
Teil 6: Regularisierung - Frühes Stoppen, Ridge-Regression (L2) und Lasso-Regression (L1)
___________________________________________
- Normalisierung ist besonders wichtig für eine gradientenbasierte Minimierung. Daten können durch Min-Max-Normalisierung oder Standardisierung normalisiert werden.
- Die Ausreißererkennung kann verwendet werden, um Ausreißer zu entfernen. Ausreißer können über Boxplots identifiziert werden. Ein Boxplot zeigt den Median und den Interquartilsabstand mit „Schnurrhaaren“.
- Fehlende Daten können entweder verworfen oder zum Beispiel durch den Mittelwert oder Median imputiert werden.
- Variablenumwandlungen können auf numerische Variablen angewendet werden. Zum Beispiel kann eine funktionale Modifikation, eine Kombination von Variablen oder komplexe Modelle verwendet werden. Eine Variablenumwandlung für kategoriale Variablen kann kategoriale Merkmale in binäre Variablen umwandeln. Dies wird als One-Hot-Encoding bezeichnet.