In diesem Video bauen wir eine vollständig automatisierte, temporäre Web-Scraping-Pipeline von Grund auf. Wenn Sie es leid sind, für untätige Cloud-Computing-Ressourcen zu zahlen, ist diese Architektur genau das Richtige für Sie. Wir richten eine "selbstzerstörende" Azure-VM ein, die hochfährt, eine Zielwebseite mit Playwright in einem Docker-Container scrapt, das HTML in Blob Storage archiviert und sich dann sofort selbst deallociert, um die Kosten nahe $0 zu halten.
Ich führe Sie durch den gesamten Data Engineering-Workflow, vom Containerisieren des Scrapers über die Einrichtung der CI/CD-Pipeline bis hin zum Aufbau eines schnellen Flask-Frontends, um unsere archivierten Daten anzuzeigen.
🔗 Ressourcen & Code:
⚙️ Was wir in diesem Video bauen:
Der Scraper: Containerisiertes Python-Skript, das Playwright und single-file-cli für die vollständige statische HTML-Darstellung nutzt.
Die Orchestrierung: Geplante Runbooks in Azure Automation zur Auslösung der VM.
Der Kosten-Sparer: Eine benutzerdefinierte shutdown_self-Funktion, die Managed Identities nutzt, um die VM nach der Ausführung programmgesteuert zu deallocieren.
Der Speicher & UI: Artefakte in Azure Blob Storage pushen und sie dynamisch über eine Flask-App auf Azure App Service bereitstellen.
Die CI/CD: GitHub Actions-Pipeline zum automatischen Erstellen und Pushen von Docker-Images in das Azure Container Registry (ACR).
🛠️ Tech-Stack:
Python | Docker | Microsoft Azure (VMs, Blob, App Service, ACR) | Playwright | GitHub Actions | Flask