Dans cette vidéo, nous construisons un pipeline de scraping web entièrement automatisé et éphémère à partir de zéro. Si vous en avez assez de payer pour des ressources cloud inactives, cette architecture est faite pour vous. Nous mettons en place une VM Azure "auto-destructible" qui démarre, scrape une page web cible en utilisant Playwright à l'intérieur d'un conteneur Docker, archive le HTML dans le Blob Storage, puis se désalloue immédiatement pour maintenir les coûts près de 0 $.
Je vous guiderai à travers l'ensemble du flux de travail d'ingénierie des données, de la conteneurisation du scraper à la mise en place du pipeline CI/CD et à la création d'un frontend Flask rapide pour visualiser nos données archivées.
🔗 Ressources & Code :
⚙️ Ce que nous construisons dans cette vidéo :
Le Scraper : Script Python conteneurisé utilisant Playwright et single-file-cli pour un rendu HTML statique complet.
L'Orchestration : Runbooks automatisés Azure planifiés pour déclencher la VM.
L'Économiseur de Coûts : Une fonction shutdown_self personnalisée utilisant les Identités Gérées pour désallouer programmétiquement la VM après exécution.
Le Stockage & UI : Envoi des artefacts vers Azure Blob Storage et service dynamique via une application Flask sur Azure App Service.
Le CI/CD : Pipeline d'Actions GitHub pour construire et pousser automatiquement des images Docker vers Azure Container Registry (ACR).
🛠️ Stack Technologique :
Python | Docker | Microsoft Azure (VMs, Blob, App Service, ACR) | Playwright | Actions GitHub | Flask