En este video volveremos a visitar Dagster. Hablaremos sobre los cambios en este sistema de orquestación de flujos de trabajo debido a las actualizaciones recientes (actualización de la versión 0.15 a 1.3.1)
Dagster es un orquestador diseñado para desarrollar y mantener activos de datos, como tablas, conjuntos de datos, modelos de aprendizaje automático e informes.
Cubriremos Activos Definidos por Software ya que Dagster está avanzando hacia los Activos Definidos por Software. Por defecto, nuestras salidas de pipeline se almacenan como un archivo pickle en la carpeta de inicio de Dagster. ¿Qué pasa si queremos almacenar las salidas en una tabla de base de datos, o en un archivo legible como un archivo csv o parquet? Dagster nos proporciona gestores de entrada y salida (gestores de IO) que permiten leer y escribir datos en sistemas de almacenamiento. Usando gestores de IO de almacenamiento, podemos guardar las salidas en un sistema de archivos o almacenar nuestros datos como tablas en una base de datos. Definiremos gestores de IO para archivos csv/parquet y bases de datos.
Comienza con Dagster en solo tres pasos rápidos:
Instala Dagster, Define activos y Materializa activos.
Crea un entorno virtual: python -m venv env
Activa el entorno virtual: env\Scripts\activate
Para instalar Dagster en un entorno de Python existente, ejecuta:
pip install dagster dagit
Comando para crear un nuevo proyecto
dagster project scaffold --name my-dagster-project
Bibliotecas adicionales requeridas: Pandas, psycopg2
Para ejecutar Dagster, emite el siguiente comando:
dagit
dagster-daemon run
💥Suscríbete a nuestro canal:
📌 Enlaces
-----------------------------------------
#️⃣ ¡Sígueme en las redes sociales! #️⃣
-----------------------------------------
#Python #ETL #Dagster
Temas cubiertos en este video:
==================================
0:00 - Introducción a Dagster
2:11 - Dagster crear nuevo proyecto
3:03 - Estructura del Proyecto Dagster
4:18 - Activos Definidos por Software
5:35 - Instalar Bibliotecas Requeridas
5:58 - Conexión a la DB de Origen
6:27 - Activo de Origen
10:05 - Gestor de IO de Archivos
14:16 - Segundo Activo
16:19 - Gestor de IO de Parquet
16:26 - Gestor de IO de Base de Datos
19:05 - Materializar Activos