En esta sesión en vivo, recorremos un enfoque práctico y del mundo real para planificar y construir proyectos de web scraping con RTILA V8. Comenzando desde la página de detalle final, identificamos el modelo de datos adecuado, utilizamos el Asistente de IA para detectar campos que se pueden raspar y dejamos que genere un primer proyecto funcional. A lo largo del camino, discutimos cómo validar resultados, limpiar campos como stock y calificaciones, y decidir qué transformar durante el scraping frente a en pasos posteriores de ETL/IA, para que tus automatizaciones se mantengan robustas, mantenibles y listas para escalar.
🎁 Aprovecha y utiliza nuestros códigos de descuento anticipados para Black Friday y Cyber Monday:
75% en Licencias Empresariales. Código: BlackCyber75P
55% en Licencias de Agencia. Código: BlackCyber55P
35% en Licencias de Negocios. Código: BlackCyber35P
#VibeWebScraping #FundamentosWebScraping #WebScraping #RtilaV8 #ExtracciónDeDatos #HerramientasDeAutomatización #AutomatizaciónAsistidaPorIA #AutomatizaciónSinCódigo #MejoresPrácticasDeScraping
#CalidadDeDatos #Directus #n8n
🔑 Puntos principales de aprendizaje:
🎯 Comienza desde el final del embudo
Siempre comienza un proyecto de web scraping desde la página de detalle final (donde vive toda la información), y idealmente elige la lista más completa/rica para diseñar tu modelo de datos y campos antes de invertir tiempo en paginación y escalado.
🤖 Aprovecha el Asistente de IA de RTILA V8 como un “chequeo previo”
Utiliza el Asistente de IA (con Gemini Flash 2.5) para:
1) Analizar una URL directamente y detectar todos los campos potenciales
2) O, cuando esté bloqueado, alimentarlo con HTML + captura de pantalla para que aún pueda entender la página a través del código + visión por computadora.
Esto valida lo que es realmente raspable antes de construir el proyecto completo.
🧩 Deja que la IA construya el proyecto, pero tú mantente como QA
La IA puede:
1) Generar la estructura del proyecto y comandos
2) Elegir selectores CSS robustos o XPath (por ejemplo, XPath para la fila UPC)
3) Ejecutar el proyecto, inspeccionar registros y resumir resultados
Pero aún debes verificar manualmente el conjunto de datos en Ejecuciones de Proyecto, Datos Raspados y exportación a CSV.
🧪 Refinamiento iterativo: transforma datos paso a paso
La sesión mostró cómo limpiar iterativamente campos como:
1) Calificación por estrellas (eliminando “calificación-por-estrellas” y manteniendo solo la puntuación)
2) Disponibilidad/stock (pasando de En stock (22 disponibles) a solo 22)
Lección clave: realiza transformaciones simples y robustas durante el scraping y deja las transformaciones complejas o frágiles para el procesamiento posterior de ETL/IA.
🧮 Entendiendo transformaciones: regex, conversión y límites de JavaScript
Exploraste:
1) Transformaciones basadas en regex con reemplazo + conversión a entero
2) JavaScript a través de ejecutar script y cómo interactúa con el objeto de variables
3) Una limitación actual: falta de tipo: opción de variable en la interfaz de usuario del conjunto de datos, que bloquea el puente ideal “JS → variable → propiedad del conjunto de datos”.
Esto subrayó la importancia de copias de seguridad, versionado y tener cuidado con largas cadenas de edición de IA.
🔌 Visión para los próximos pasos: empujar e integrar
Las futuras sesiones se centrarán en:
1) Usar RTILA V8 para empujar/jalar datos hacia/desde Directus
2) Orquestar flujos entre RTILA y n8n (y otras herramientas) utilizando la nueva capa de API para una pila de automatización completamente autoalojada.
capítulos y marcas de tiempo
0:00 – 👋 Introducción y objetivo de la sesión
1:00 – 🎯 Enfoque “Comienza desde el final” para el web scraping
2:30 – 📚 Elegir una página de detalle de libro completa como tu referencia
3:30 – 🤖 Primer uso del Asistente de IA de RTILA V8 en la URL del libro
5:00 – ⚙️ Configuraciones de contexto: historial del proyecto, HTML y visión por computadora
7:00 – 🧠 Cómo la IA lee HTML + capturas de pantalla como un humano
8:30 – 🛠️ La IA construye el primer proyecto de scraping (CSS vs XPath)
14:30 – ✅ Comprobando registros, Ejecuciones de Proyecto, Datos Raspados y exportación a CSV
18:30 – 🧹 Limpiando el texto de “calificación por estrellas” con regex y transformaciones
23:30 – 🔍 Elecciones de diseño: regex vs JavaScript vs post-procesamiento
33:00 – 🧪 Depurando JS + variables y entendiendo límites del motor
47:30 – 🚧 Descubriendo la falta de tipo: variable y necesidades de retroceso
55:00 – 🔁 Reiniciando con un contexto limpio y enfocándose en lo que es factible
1:08:30 – 🔢 Usando regex para limpiar “En stock (22 disponibles)”
1:14:30 – 📚 Inspeccionando las transformaciones finales para aprender de ellas
1:16:30 – 🚀 Cierre, ideas de funciones y próximos temas (Directus, n8n, capa de API)