En este video, estamos construyendo un pipeline de raspado web totalmente automatizado y transitorio desde cero. Si estás cansado de pagar por computación en la nube inactiva, esta arquitectura es para ti. Estamos configurando una VM de Azure "autodestructiva" que se inicia, raspa una página web objetivo usando Playwright dentro de un contenedor Docker, archiva el HTML en Blob Storage y luego se desasigna inmediatamente para mantener los costos cerca de $0.
Te guiaré a través de todo el flujo de trabajo de ingeniería de datos, desde la contenedorización del raspador hasta la configuración del pipeline de CI/CD y la construcción de un frontend rápido en Flask para ver nuestros datos archivados.
🔗 Recursos y Código:
⚙️ Lo que Construimos en Este Video:
El Raspador: Script de Python contenedorizado que utiliza Playwright y single-file-cli para renderizado completo de HTML estático.
La Orquestación: Runbooks programados de Azure Automation para activar la VM.
El Ahorra Costos: Una función personalizada shutdown_self que utiliza Identidades Administradas para desasignar programáticamente la VM después de la ejecución.
El Almacenamiento y UI: Enviando artefactos a Azure Blob Storage y sirviéndolos dinámicamente a través de una App Flask en Azure App Service.
El CI/CD: Pipeline de GitHub Actions para construir y enviar automáticamente imágenes de Docker al Azure Container Registry (ACR).
🛠️ Stack Tecnológico:
Python | Docker | Microsoft Azure (VMs, Blob, App Service, ACR) | Playwright | GitHub Actions | Flask