Cómo ejecutar un proyecto de web scraping con Scrapy en un entorno virtual todos los días y almacenar los resultados en una base de datos. (Uso postgres, pero el mismo concepto se aplica a cualquier base de datos).
⦾ Crea un script bash para activar el entorno virtual y ejecutar el spider a través de CRON.
--
#!/usr/bin/env bash
source /home/pi/Documents/Scrape/bin/activate
cd /home/pi/Documents/Scrape/Scrapy19/jobz/spiders
scrapy crawl jobzspider
--
⦾ Programar en CRON
# Por ejemplo, puedes hacer una copia de seguridad de todas tus cuentas de usuario
# a las 5 a.m. cada semana con:
0 15 * * * ~/Documents/Scrape/Scrapy19/jobz/spiders/cj.sh
#
# Para más información, consulta las páginas del manual de crontab(5) y cron(8)
#
# m h dom mon dow comando
--
⦾ SALIDA 3 días después...
jobs=# select posted from listings group by 1;
posted
------------
2021-06-04
2021-06-05
2021-06-06
(3 filas)***
Visita el blog de redandgreen para más tutoriales
=========================================
Suscríbete al canal de YouTube
=================================
Síguenos en Twitter - para recibir notificaciones de nuevos videos
=================================================
👍 Conviértete en patrocinador 👍
Compra un café (o té) para Dr Pi
Proxies
=================================================
Si necesitas un buen proxy fácil de usar, me recomendaron este, y habiendo usado ScraperAPI durante un tiempo, puedo dar fe de ellos. Si ibas a registrarte de todos modos, ¿podrías ser tan amable de usar el enlace y el código de cupón a continuación?
También puedes hacer una prueba completa primero, (a diferencia de algunas otras empresas). La prueba no solicita detalles de pago, ¡así que todo bien! 👍
◼️ Código de Cupón: DRPI10
(Puedes comenzar con 1000 llamadas API gratuitas. No se requiere tarjeta de crédito.)
❀ ¿Dedos arriba, sí? (por los Algoritmos..)
#webscraping #scrapy #python