Lernen Sie, wie Sie Rohdaten für maschinelles Lernen vorbereiten, indem Sie wichtige Techniken zur Datenumwandlung beherrschen. Diese Lektion behandelt wesentliche Schritte wie den Umgang mit fehlenden Werten, Merkmalsnormalisierung, Standardisierung und die Kodierung kategorialer Variablen. Sie werden praktische Beispiele mit dem Titanic-Datensatz sehen, um sicherzustellen, dass Ihre Daten für eine genaue und effiziente Modellierung bereit sind.
Verfolgen Sie, wie wir praktische Methoden zur Skalierung und Kodierung von Merkmalen, zum Aufbau von Vorverarbeitungs-Pipelines und zur Aufteilung von Daten für Training und Test demonstrieren. Am Ende werden Sie die Bedeutung von sauberen, gut umgewandelten Daten verstehen und in der Lage sein, diese Fähigkeiten auf Ihre eigenen Projekte anzuwenden.
00:00 Einführung in die Datenumwandlung
00:18 Einrichten einer sauberen Umgebung
00:46 Was ist Datenumwandlung
01:51 Laden und Erkunden des Titanic-Datensatzes
02:55 Warum Merkmale transformieren
03:21 Identifizierung und Umgang mit fehlenden Werten
04:47 Normalisierung vs. Standardisierung erklärt
05:18 Auswahl von Spalten zur Skalierung
06:06 Anwendung der Normalisierung auf Merkmale
07:12 Standardisierung numerischer Daten
08:13 Kodierung von Textspalten
08:29 Beispiel für Label-Kodierung
09:40 Beispiel für One-Hot-Kodierung
10:36 Automatisierung der Vorverarbeitung mit Pipelines
13:08 Bedeutung der Merkmals-Skalierung
13:35 Mini-Projekt: Vollständiger Vorverarbeitungs-Workflow
15:22 Praktische Übung zur manuellen Normalisierung
16:24 Demo zur Normalisierung von Benutzereingaben
17:32 Tipps zur Merkmals-Skalierung
18:00 Identifizierung von Spalten zur Kodierung
18:45 Zusammenfassung und wichtige Erkenntnisse
19:13 Nächste Schritte und Handlungsaufforderung
#DataScience #MachineLearning #PythonTutorial