Aprende a procesar sitemaps XML para extraer todos los textos presentes en un sitio web. Ve directamente desde la página de inicio de noticias o blog a una colección de documentos completamente procesados.
Este tutorial de nivel introductorio muestra cómo se ejecutan las funciones de #crawling y #scraping en Python y en la terminal.
--
Tabla de Contenidos:
0:00 Introducción: ¿Cómo podemos descubrir contenido dentro de un sitio web?
0:44 La biblioteca de Python
1:00 ¿Qué son los sitemaps y para qué sirven?
1:57 Descubriendo y procesando sitemaps con Python
2:40 Comprensiones de listas para filtrar los enlaces
4:00 Scraping y extracción de contenido
5:30 Uso en la línea de comandos
--
Trafilatura es una herramienta de scraping disponible de forma gratuita que descarga, analiza y extrae datos de páginas web sin problemas, preservando partes del formato del texto y la estructura de la página. Presenta procesamiento en línea y fuera de línea en paralelo, extracción robusta y eficiente, descubrimiento de enlaces en feeds y sitemaps, así como detección de idiomas.
La salida se puede convertir a diferentes formatos: TXT, CSV, JSON, XML y XML-TEI.
▶️ Más información
#webscraping #tutorialPython #pythonPrincipiantes