Aufbau einer skalierbaren und kosteneffizienten Web-Scraping-Pipeline
In dieser Live-Session tauchen wir tief ein in das Design einer skalierbaren, kosteneffizienten Web-Scraping- und Datenextraktionspipeline unter Verwendung der Zyte API, AWS Lambda, Step Functions und LLMs.
🌱 Sie werden lernen, wie man:
- Die Zyte API und Lambda-Funktionen für großflächiges Scraping (über 10.000 Seiten/Tag) nutzt
- Kosten und Rechenleistung durch Batching und Parallelverarbeitung optimiert
- Reinigungsskripte anwendet, um die Token-Größe für LLMs zu reduzieren
- Extraktionslogik effizient mit Open-Source- oder kostenpflichtigen Modellen ausführt
- Halluzinationen, Wiederholungen und QA-Prüfungen für zuverlässige Ausgaben behandelt
- Einen produktionsbereiten Workflow mit AWS-Orchestrierung aufbaut
⚠️ Hinweis: Überprüfen Sie immer die Nutzungsbedingungen einer Website und die robots.txt, bevor Sie scrapen. Dieser Inhalt ist zu Bildungszwecken, nutzen Sie ihn ethisch!
Eine florierende Gemeinschaft von über 20.000 Web-Scraping-Enthusiasten, die sich dem Austausch von Erkenntnissen, dem Lernen und der Erkundung neuer Technologien sowie dem Fortschritt im Web-Scraping widmet.
#awslambda #llm #dataengineering #ai #python #StepFunctions #zyteapi #cloudcomputing #machinelearning #datapipeline #bigdata