Como executar um projeto de web scraping com Scrapy em um ambiente virtual todos os dias e armazenar os resultados em um banco de dados. (Eu uso postgres, mas o mesmo conceito se aplica a qualquer banco de dados que você use).
⦾ Crie um script bash para ativar o ambiente virtual e executar o spider via CRON.
--
#!/usr/bin/env bash
source /home/pi/Documents/Scrape/bin/activate
cd /home/pi/Documents/Scrape/Scrapy19/jobz/spiders
scrapy crawl jobzspider
--
⦾ Agendar no CRON
# Por exemplo, você pode fazer um backup de todas as suas contas de usuário
# às 5 da manhã toda semana com:
0 15 * * * ~/Documents/Scrape/Scrapy19/jobz/spiders/cj.sh
#
# Para mais informações, consulte as páginas manuais de crontab(5) e cron(8)
#
# m h dom mon dow comando
--
⦾ SAÍDA 3 dias depois...
jobs=# select posted from listings group by 1;
posted
------------
2021-06-04
2021-06-05
2021-06-06
(3 linhas)***
Visite o blog redandgreen para mais Tutoriais
=========================================
Inscreva-se no Canal do YouTube
=================================
Siga no Twitter - para ser notificado sobre novos vídeos
=================================================
👍 Torne-se um patrono 👍
Compre um café (ou chá) para o Dr Pi
Proxies
=================================================
Se você precisa de um bom proxy fácil de usar, me recomendaram este, e tendo usado o ScraperAPI por um tempo, posso garantir por eles. Se você for se inscrever de qualquer forma, talvez você possa ser gentil o suficiente para usar o link e o código de cupom abaixo?
Você também pode fazer um teste completo primeiro, (diferente de algumas outras empresas). O teste não pede detalhes de pagamento, então tudo certo! 👍
◼️ Código do Cupom: DRPI10
(Você também pode começar com 1000 chamadas de API gratuitas. Nenhum cartão de crédito necessário.)
❀ Curtiu? (porque Algos..)
#webscraping #scrapy #python