Estamos muito animados em trazer para você nosso mais recente projeto Scrapy / Tutorial de Web Scraping.
Raspagem de um grande site com "rolagem infinita", também conhecido como "AJAX carregar mais".
(Isso é baseado em um projeto do mundo real do Upwork).
*** PARTE 1 de 7 ***
Isso cobre a análise do site, enquanto identificamos os elementos e fontes relevantes para os seletores que colocaremos em nossa aranha Scrapy.
Se você quiser pular para uma seção:
2:29 Procurando a fonte da receita/ingredientes completa
3:14 Verificando AJAX / XHR na aba Rede nas Ferramentas de Desenvolvedor no Firefox
5:25 Confirmando os incrementos da URL durante a rolagem
7:06 Procurando por "json" na fonte
8:26 Miniaturas da Página Principal - Links para páginas de detalhes - teste no shell do Scrapy
9:27 response.xpath("//script[@type='application/ld+json']/text()").get();
11:04 Localizando a lista COMPLETA de ingredientes
14:21 Localizando a receita COMPLETA
17:51 testando o incremento de "pn=" para usar em nossa aranha para nossa "próxima página"
23:59 Exibindo a lista completa de ingredientes
O json que encontramos é extremamente útil, então durante o vídeo você verá como planejamos usá-lo e selecionar os "links" que trabalharemos mais na parte 2.
Por favor, comente, inscreva-se, curta 👍, pois isso está demandando muito esforço e quanto mais comentários/feedback, melhor poderei adaptar futuros vídeos para você.
Código do GitHub
Saudações,
Dr. Pi.
#scrapy #rolageminfinita #carregarmais