#scrapy #webscraping #python
Código Scrapy + Python para extrair dados disponíveis publicamente de anúncios de imóveis.
Originalmente baseado no vídeo de Imóveis do Bahrein de CMK, decidimos explorar uma maneira diferente de escrever o código para alcançar a mesma saída e aqui está o resultado!
▸ O código começa em 10:20
**desculpas pelos 30 segundos antes disso onde o texto está fora da tela.. minha culpa!
▸ Público-alvo: Usuários de Scrapy do nível Iniciante ao Intermediário
▸ Para demonstrar xpath, escrevemos todos os seletores para usar xpath
▸ ItemLoader foi utilizado com o arquivo items.py para permitir o uso de processadores de entrada e saída
▸ add_value também foi utilizado, junto com add_xpath para preencher os campos do Scrapy
▸ Assista para ver a escrita do código, correção de alguns erros de digitação e sucesso com a saída final desejada em formato csv.
Esse formato de código pode ser modificado para ser usado em outros sites - e a vantagem de usar o ItemLoader é que se você tivesse outra aranha semelhante para escrever, poderia acessar os mesmos campos em items.py se optasse por importar esse mesmo módulo.
Esse código não tem a intenção de ser "melhor" do que o original escrito por Maksim, há vantagens no código dele, ou seja, apenas um arquivo, tudo contido. Nós apenas procuramos ilustrar o uso de seletores xpath, ItemLoader e Processadores de Entrada/Saída como uma alternativa para Scraping de um site de imóveis.
Há também outras dicas no vídeo, como editar o arquivo de configurações, para permitir que você trabalhe com o Scrapy shell quando ele exibe 'proibido'.
Créditos: Agradecimentos a Maskim Korzh pelo código original que me deu a ideia.
Créditos: Ahmed Rafik Djerah pelos seguintes exemplos de código:
-- use xpaths em vez de css, -- ItemLoader -- novo "next_page"
Espero que você aprenda/aprecie.
Por favor, comente.
Até mais!
Dr Pi
Ainda ninguém me comprou um café/chá.