Apprenez à traiter les sitemaps XML pour extraire tous les textes présents sur un site web. Passez directement d'une page d'accueil d'actualités ou de blog à une collection de documents entièrement traités.
Ce tutoriel de niveau introductif montre comment les fonctions de #crawling et de #scraping sont exécutées en Python et dans le terminal.
--
Table des matières :
0:00 Introduction : Comment pouvons-nous découvrir du contenu sur un site web ?
0:44 La bibliothèque Python
1:00 Qu'est-ce qu'un sitemap et à quoi sert-il ?
1:57 Découverte et traitement des sitemaps avec Python
2:40 Compréhensions de liste pour filtrer les liens
4:00 Scraping et extraction de contenu
5:30 Utilisation en ligne de commande
--
Trafilatura est un outil de scraping disponible gratuitement qui télécharge, analyse et extrait les données des pages web tout en préservant certaines parties de la mise en forme du texte et de la structure de la page. Il propose un traitement en ligne et hors ligne parallèle, une extraction robuste et efficace, la découverte de liens dans les flux et les sitemaps, ainsi qu'une détection de langue.
La sortie peut être convertie en différents formats : TXT, CSV, JSON, XML et XML-TEI.
▶️ Plus d'informations
#webscraping #tutorielPython #débutantsPython