Neste vídeo, estamos construindo um pipeline de web scraping totalmente automatizado e transitório do zero. Se você está cansado de pagar por computação em nuvem ociosa, esta arquitetura é para você. Estamos configurando uma VM do Azure "auto-destrutiva" que inicia, raspa uma página da web alvo usando Playwright dentro de um contêiner Docker, arquiva o HTML no Blob Storage e, em seguida, se desaloja imediatamente para manter os custos próximos de $0.
Vou te guiar por todo o fluxo de trabalho de engenharia de dados, desde a containerização do scraper até a configuração do pipeline de CI/CD e a construção de um frontend rápido em Flask para visualizar nossos dados arquivados.
🔗 Recursos & Código:
⚙️ O que Construímos Neste Vídeo:
O Scraper: Script Python containerizado utilizando Playwright e single-file-cli para renderização completa de HTML estático.
A Orquestração: Runbooks agendados do Azure Automation para acionar a VM.
O Economizador de Custos: Uma função personalizada shutdown_self utilizando Managed Identities para desalocar programaticamente a VM após a execução.
O Armazenamento & UI: Enviando artefatos para o Azure Blob Storage e servindo-os dinamicamente através de um App Flask no Azure App Service.
O CI/CD: Pipeline de GitHub Actions para construir e enviar automaticamente imagens Docker para o Azure Container Registry (ACR).
🛠️ Stack Tecnológico:
Python | Docker | Microsoft Azure (VMs, Blob, App Service, ACR) | Playwright | GitHub Actions | Flask