In dieser Live-Session gehen wir einen praktischen, realistischen Ansatz zur Planung und Erstellung von Web-Scraping-Projekten mit RTILA V8 durch. Ausgehend von der finalen Detailseite identifizieren wir das richtige Datenmodell, nutzen den KI-Assistenten, um scrapbare Felder zu erkennen, und lassen ihn ein erstes funktionierendes Projekt generieren. Unterwegs besprechen wir, wie man Ergebnisse validiert, Felder wie Lagerbestand und Bewertungen bereinigt und entscheidet, was während des Scrapings und was in späteren ETL/AI-Schritten transformiert werden soll – damit Ihre Automatisierungen robust, wartbar und skalierbar bleiben.
🎁 Nutzen Sie unsere frühen Black Friday und Cyber Monday Rabattcodes:
75 % auf Enterprise-Lizenzen. Code: BlackCyber75P
55 % auf Agenturlizenzen. Code: BlackCyber55P
35 % auf Business-Lizenzen. Code: BlackCyber35P
#VibeWebScraping #WebScrapingGrundlagen #WebScraping #RtilaV8 #Datenextraktion #Automatisierungstools #KI-unterstützteAutomatisierung #NoCodeAutomatisierung #ScrapingBestPractices
#Datenqualität #Directus #n8n
🔑 Hauptlernziele :
🎯 Beginnen Sie am Ende des Trichters
Beginnen Sie immer ein Web-Scraping-Projekt von der finalen Detailseite (wo die vollständigen Daten liegen) und wählen Sie idealerweise das vollständigste / reichhaltigste Listing, um Ihr Datenmodell und die Felder zu entwerfen, bevor Sie Zeit in die Paginierung und Skalierung investieren.
🤖 Nutzen Sie den KI-Assistenten von RTILA V8 als „Pre-Flight-Check“
Verwenden Sie den KI-Assistenten (mit Gemini Flash 2.5), um:
1) Eine URL direkt zu analysieren und alle potenziellen Felder zu erkennen
2) Oder, wenn blockiert, HTML + Screenshot bereitzustellen, damit er die Seite weiterhin über Code + Computer Vision verstehen kann.
Dies validiert, was realistisch scrapbar ist, bevor das vollständige Projekt aufgebaut wird.
🧩 Lassen Sie die KI das Projekt erstellen, aber Sie bleiben die QA
Die KI kann:
1) Die Projektstruktur und Befehle generieren
2) Robuste CSS-Selektoren oder XPath auswählen (z. B. XPath für die UPC-Zeile)
3) Das Projekt ausführen, Protokolle überprüfen und Ergebnisse zusammenfassen
Aber Sie müssen den Datensatz manuell in Projektläufen, gescrapten Daten und CSV-Export überprüfen.
🧪 Iterative Verfeinerung: Daten Schritt für Schritt transformieren
Die Sitzung zeigte, wie man Felder iterativ bereinigt, wie:
1) Sternebewertung (Entfernen von „Sternenbewertung“ und Behalten nur der Punktzahl)
2) Verfügbarkeit/Lagerbestand (von „Auf Lager (22 verfügbar)“ zu nur 22)
Wichtige Lektion: Führen Sie einfache, robuste Transformationen während des Scrapings durch und lassen Sie komplexe oder anfällige Transformationen für spätere ETL/AI-Verarbeitung.
🧮 Verständnis von Transformationen: Regex, Cast & JavaScript-Grenzen
Sie erkundeten:
1) Regex-basierte Transformationen mit Ersetzen + Cast Integer
2) JavaScript über Skript ausführen und wie es mit dem Variablenobjekt interagiert
3) Eine aktuelle Einschränkung: fehlende Typ: Variable-Option in der Datensatz-UI, die die ideale „JS → Variable → Datensatz-Eigenschaft“-Brücke blockiert.
Dies unterstrich die Bedeutung von Backups, Versionierung und Vorsicht bei langen KI-Bearbeitungsketten.
🔌 Vision für die nächsten Schritte: Push & Integration
Zukünftige Sitzungen werden sich auf Folgendes konzentrieren:
1) Verwendung von RTILA V8, um Daten zu Directus zu pushen/pullen
2) Orchestrierung von Flows zwischen RTILA und n8n (und anderen Tools) unter Verwendung der neuen API-Schicht für einen vollständig selbstgehosteten Automatisierungs-Stack.
Kapitel & Zeitstempel
0:00 – 👋 Einführung & Sitzungsziel
1:00 – 🎯 „Beginnen Sie am Ende“-Ansatz für Web-Scraping
2:30 – 📚 Auswahl einer vollständigen Buchdetailseite als Referenz
3:30 – 🤖 Erste Nutzung des RTILA V8 KI-Assistenten auf der Buch-URL
5:00 – ⚙️ Kontext-Einstellungen: Projektverlauf, HTML & Computer Vision
7:00 – 🧠 Wie die KI HTML + Screenshots wie ein Mensch liest
8:30 – 🛠️ KI erstellt das erste Scraping-Projekt (CSS vs XPath)
14:30 – ✅ Überprüfung von Protokollen, Projektläufen, gescrapten Daten & CSV-Export
18:30 – 🧹 Bereinigung des „Sternebewertung“-Texts mit Regex & Transformationen
23:30 – 🔍 Designentscheidungen: Regex vs JavaScript vs Nachbearbeitung
33:00 – 🧪 Debugging von JS + Variablen und Verständnis der Engine-Grenzen
47:30 – 🚧 Entdeckung des fehlenden Typs: Variable & Rückrollbedarf
55:00 – 🔁 Neustart mit einem sauberen Kontext & Fokussierung auf das Machbare
1:08:30 – 🔢 Verwendung von Regex zur Bereinigung von „Auf Lager (22 verfügbar)“
1:14:30 – 📚 Überprüfung der finalen Transformationen, um daraus zu lernen
1:16:30 – 🚀 Zusammenfassung, Feature-Ideen & nächste Themen (Directus, n8n, API-Schicht)