Dans cette vidéo, nous allons revisiter Dagster. Nous parlerons des changements apportés à ce système d'orchestration de flux de travail en raison des mises à jour récentes (mise à jour de la version 0.15 à 1.3.1)
Dagster est un orchestrateur conçu pour développer et maintenir des actifs de données, tels que des tables, des ensembles de données, des modèles d'apprentissage automatique et des rapports.
Nous aborderons les Actifs Définis par Logiciel, car Dagster s'oriente vers les Actifs Définis par Logiciel. Par défaut, nos sorties de pipeline sont stockées sous forme de fichier pickle dans le dossier d'accueil de Dagster. Que se passe-t-il si nous voulons stocker les sorties dans une table de base de données, ou dans un fichier lisible tel qu'un fichier csv ou parquet ? Dagster nous fournit des gestionnaires d'entrée et de sortie (gestionnaires IO) qui permettent de lire et d'écrire des données dans des systèmes de stockage. En utilisant les gestionnaires IO de stockage, nous pouvons enregistrer les sorties dans un système de fichiers ou stocker nos données sous forme de tables dans une base de données. Nous définirons les gestionnaires IO pour les fichiers csv/parquet et les bases de données.
Commencez avec Dagster en trois étapes rapides :
Installez Dagster, définissez des actifs et matérialisez des actifs.
Créez un environnement virtuel : python -m venv env
Activez l'environnement virtuel : env\Scripts\activate
Pour installer Dagster dans un environnement Python existant, exécutez :
pip install dagster dagit
Commande pour créer un nouveau projet
dagster project scaffold --name my-dagster-project
Bibliothèques supplémentaires requises : Pandas, psycopg2
Pour exécuter Dagster, exécutez la commande suivante :
dagit
dagster-daemon run
💥Abonnez-vous à notre chaîne :
📌 Liens
-----------------------------------------
#️⃣ Suivez-moi sur les réseaux sociaux ! #️⃣
-----------------------------------------
#Python #ETL #Dagster
Sujets abordés dans cette vidéo :
==================================
0:00 - Introduction à Dagster
2:11 - Création d'un nouveau projet Dagster
3:03 - Structure du projet Dagster
4:18 - Actifs définis par logiciel
5:35 - Installer les bibliothèques requises
5:58 - Connexion à la base de données source
6:27 - Actif source
10:05 - Gestionnaire IO de fichiers
14:16 - Deuxième actif
16:19 - Gestionnaire IO Parquet
16:26 - Gestionnaire IO de base de données
19:05 - Matérialiser des actifs