Dans cette session en direct, nous parcourons une approche pratique et concrète pour planifier et construire des projets de web scraping avec RTILA V8. En partant de la page de détail finale, nous identifions le bon modèle de données, utilisons l'Assistant IA pour détecter les champs exploitables, et laissons générer un premier projet fonctionnel. En cours de route, nous discutons de la manière de valider les résultats, de nettoyer des champs comme le stock et les évaluations, et de décider quoi transformer pendant le scraping par rapport aux étapes ETL/IA ultérieures—afin que vos automatisations restent robustes, maintenables et prêtes à évoluer.
🎁 Profitez de nos codes de réduction anticipés pour le Black Friday et le Cyber Monday :
75 % sur les Licences Entreprise. Code : BlackCyber75P
55 % sur les Licences Agence. Code : BlackCyber55P
35 % sur les Licences Business. Code : BlackCyber35P
#VibeWebScraping #WebScrapingBasics #WebScraping #RtilaV8 #DataExtraction #AutomationTools #AIAssistedAutomation #NoCodeAutomation #ScrapingBestPractices
#DataQuality #Directus #n8n
🔑 Points d'apprentissage principaux :
🎯 Commencez par la fin de l'entonnoir
Commencez toujours un projet de web scraping par la page de détail finale (où se trouvent toutes les données), et idéalement choisissez l'annonce la plus complète / riche pour concevoir votre modèle de données et vos champs avant d'investir du temps dans la pagination et l'évolutivité.
🤖 Exploitez l'Assistant IA de RTILA V8 comme un "vérificateur pré-vol"
Utilisez l'Assistant IA (avec Gemini Flash 2.5) pour :
1) Analyser une URL directement et détecter tous les champs potentiels
2) Ou, lorsqu'il est bloqué, lui fournir HTML + capture d'écran afin qu'il puisse toujours comprendre la page via le code + la vision par ordinateur.
Cela valide ce qui est réalistement exploitable avant de construire le projet complet.
🧩 Laissez l'IA construire le projet, mais vous restez le QA
L'IA peut :
1) Générer la structure du projet et les commandes
2) Choisir des sélecteurs CSS robustes ou XPath (par exemple, XPath pour la ligne UPC)
3) Exécuter le projet, inspecter les journaux et résumer les résultats
Mais vous devez toujours vérifier manuellement le jeu de données dans les Exécutions de Projet, les Données Scrappées et l'export CSV.
🧪 Affinage itératif : transformer les données étape par étape
La session a montré comment nettoyer itérativement des champs comme :
1) Évaluation par étoiles (en supprimant "star-rating" et en gardant uniquement le score)
2) Disponibilité/stock (passant de En stock (22 disponibles) à juste 22)
Leçon clé : effectuer des transformations simples et robustes pendant le scraping et laisser les transformations complexes ou fragiles pour un traitement ETL/IA ultérieur.
🧮 Comprendre les transformations : regex, cast & limites JavaScript
Vous avez exploré :
1) Transformations basées sur regex avec replace + cast integer
2) JavaScript via run script et comment il interagit avec l'objet variables
3) Une limitation actuelle : option de type manquante : variable dans l'interface utilisateur du jeu de données, qui bloque le pont idéal "JS → variable → propriété du jeu de données".
Cela a souligné l'importance des sauvegardes, du versionnage et de la prudence avec de longues chaînes d'édition IA.
🔌 Vision pour les prochaines étapes : pousser & intégrer
Les futures sessions se concentreront sur :
1) Utiliser RTILA V8 pour pousser/extraire des données vers/depuis Directus
2) Orchestrer des flux entre RTILA et n8n (et d'autres outils) en utilisant la nouvelle couche API pour une pile d'automatisation entièrement auto-hébergée.
chapitres & horodatages
0:00 – 👋 Intro & objectif de la session
1:00 – 🎯 Approche "Commencer par la fin" pour le web scraping
2:30 – 📚 Choisir une page de détail de livre complète comme référence
3:30 – 🤖 Première utilisation de l'Assistant IA RTILA V8 sur l'URL du livre
5:00 – ⚙️ Paramètres contextuels : historique du projet, HTML & vision par ordinateur
7:00 – 🧠 Comment l'IA lit HTML + captures d'écran comme un humain
8:30 – 🛠️ L'IA construit le premier projet de scraping (CSS vs XPath)
14:30 – ✅ Vérification des journaux, Exécutions de Projet, Données Scrappées & export CSV
18:30 – 🧹 Nettoyage du texte "évaluation par étoiles" avec regex & transformations
23:30 – 🔍 Choix de conception : regex vs JavaScript vs post-traitement
33:00 – 🧪 Débogage JS + variables et compréhension des limites du moteur
47:30 – 🚧 Découverte du type manquant : variable & besoins de rollback
55:00 – 🔁 Redémarrer avec un contexte propre & se concentrer sur ce qui est faisable
1:08:30 – 🔢 Utiliser regex pour nettoyer "En stock (22 disponibles)"
1:14:30 – 📚 Inspecter les transformations finales pour en tirer des leçons
1:16:30 – 🚀 Conclusion, idées de fonctionnalités & prochains sujets (Directus, n8n, couche API)