Neste vídeo, vamos aprender como extrair conteúdo que NÃO está presente nas cargas iniciais da página, mas que é carregado dinamicamente pelo JavaScript.
Esse é um problema comum ao fazer scraping na web moderna: a resposta inicial contém HTML mínimo e um aplicativo JavaScript baseado em SPA (React, Vue, Angular, etc). Os dados que queremos extrair na página, portanto, não estão presentes, mas são renderizados posteriormente através de chamadas de API do aplicativo SPA.
Vamos ver como podemos usar requests-html para resolver esse problema em Python ao fazer scraping de tais sites. Também veremos como usar isso com BeautifulSoup para encontrar dados na página.
Este vídeo utiliza o seguinte site de exemplo (uma aplicação React):
📌 𝗖𝗵𝗮𝗽𝘁𝗲𝗿𝘀:
00:00 Introdução
02:15 Enviando requisição GET usando a biblioteca requests do Python
04:00 Encontrando objetos com BeautifulSoup
05:15 Instalando requests-html
06:38 Executando JavaScript na página usando requests-html
☕️ 𝗖𝗼𝗺𝗽𝗿𝗲 𝗺𝗲 𝘂𝗺 𝗰𝗼𝗳𝗳𝗲𝗲:
Para apoiar o canal e incentivar novos vídeos, considere me comprar um café aqui:
𝗦𝗼𝗰𝗶𝗮𝗹 𝗠𝗲𝗱𝗶𝗮:
📚 𝗟𝗲𝗶𝘁𝘂𝗿𝗮 𝗮𝗱𝗶𝗰𝗶𝗼𝗻𝗮𝗹 𝗲 𝗶𝗻𝗳𝗼𝗿𝗺𝗮ç𝗮𝗼:
#python #webscraping #datascience