In diesem Video werden wir Dagster erneut betrachten. Wir werden über Änderungen an diesem Workflow-Orchestrierungssystem aufgrund der jüngsten Updates (Update von Version 0.15 auf 1.3.1) sprechen.
Dagster ist ein Orchestrator, der für die Entwicklung und Wartung von Datenassets wie Tabellen, Datensätzen, Machine Learning-Modellen und Berichten konzipiert ist.
Wir werden Software-definierte Assets behandeln, da Dagster auf Software-definierte Assets drängt. Standardmäßig werden unsere Pipeline-Ausgaben als Pickle-Datei im Dagster-Home-Ordner gespeichert. Was ist, wenn wir die Ausgaben in einer Datenbanktabelle oder in einer lesbaren Datei wie einer CSV- oder Parquet-Datei speichern möchten? Dagster bietet uns Input- und Output-Manager (IO-Manager), die das Lesen und Schreiben von Daten in Speichersysteme ermöglichen. Mit Store IO-Managern können wir die Ausgaben im Dateisystem speichern oder unsere Daten als Tabellen in einer Datenbank ablegen. Wir werden File CSV/Parquet und Database IO-Manager definieren.
Starten Sie mit Dagster in nur drei schnellen Schritten:
Installieren Sie Dagster, definieren Sie Assets und materialisieren Sie Assets.
Erstellen Sie eine virtuelle Umgebung: python -m venv env
Aktivieren Sie die virtuelle Umgebung: env\Scripts\activate
Um Dagster in einer bestehenden Python-Umgebung zu installieren, führen Sie aus:
pip install dagster dagit
Befehl zum Erstellen eines neuen Projekts
dagster project scaffold --name my-dagster-project
Zusätzliche benötigte Bibliotheken: Pandas, psycopg2
Um Dagster auszuführen, geben Sie folgenden Befehl ein:
dagit
dagster-daemon run
💥Abonnieren Sie unseren Kanal:
📌 Links
-----------------------------------------
#️⃣ Folgen Sie mir in den sozialen Medien! #️⃣
-----------------------------------------
#Python #ETL #Dagster
Themen, die in diesem Video behandelt werden:
==================================
0:00 - Einführung in Dagster
2:11 - Dagster neues Projekt erstellen
3:03 - Dagster Projektstruktur
4:18 - Software-definierte Assets
5:35 - Benötigte Bibliotheken installieren
5:58 - Quell-DB-Verbindung
6:27 - Quell-Asset
10:05 - File IO-Manager
14:16 - Zweites Asset
16:19 - Parquet IO-Manager
16:26 - Database IO-Manager
19:05 - Assets materialisieren