Aprenda como processar sitemaps XML para extrair todos os textos presentes em um site. Vá direto de uma página inicial de notícias ou blog para uma coleção de documentos totalmente processados.
Este tutorial de nível introdutório mostra como as funções de #crawling e #scraping são executadas em Python e no shell.
--
Sumário:
0:00 Introdução: Como podemos descobrir conteúdo dentro de um site?
0:44 A biblioteca Python
1:00 O que são sitemaps e para que servem?
1:57 Descobrindo e processando sitemaps com Python
2:40 Compreensões de lista para filtrar os links
4:00 Scraping e extração de conteúdo
5:30 Uso na linha de comando
--
Trafilatura é uma ferramenta de scraping disponível gratuitamente que baixa, analisa e extrai dados de páginas da web enquanto preserva partes da formatação do texto e da estrutura da página. Ela apresenta processamento paralelo online e offline, extração robusta e eficiente, descoberta de links em feeds e sitemaps, além de detecção de idioma.
A saída pode ser convertida para diferentes formatos: TXT, CSV, JSON, XML e XML-TEI.
▶️ Mais informações
#webscraping #tutorialPython #iniciantesPython