Comment exécuter un projet de web scraping Scrapy dans un environnement virtuel chaque jour et extraire les résultats vers une base de données. (J'utilise Postgres, mais le même concept s'applique quelle que soit la base de données que vous utilisez).
⦾ Créez un script bash pour activer l'environnement virtuel et exécuter l'araignée via CRON.
--
#!/usr/bin/env bash
source /home/pi/Documents/Scrape/bin/activate
cd /home/pi/Documents/Scrape/Scrapy19/jobz/spiders
scrapy crawl jobzspider
--
⦾ Planifiez dans CRON
# Par exemple, vous pouvez exécuter une sauvegarde de tous vos comptes utilisateurs
# à 5 heures du matin chaque semaine avec :
0 15 * * * ~/Documents/Scrape/Scrapy19/jobz/spiders/cj.sh
#
# Pour plus d'informations, consultez les pages de manuel de crontab(5) et cron(8)
#
# m h dom mon dow commande
--
⦾ SORTIE 3 jours plus tard...
jobs=# select posted from listings group by 1;
posted
------------
2021-06-04
2021-06-05
2021-06-06
(3 lignes)***
Visitez le blog redandgreen pour plus de tutoriels
=========================================
Abonnez-vous à la chaîne YouTube
=================================
Suivez sur Twitter - pour être informé des nouvelles vidéos
=================================================
👍 Devenez un patron 👍
Offrez un café (ou un thé) à Dr Pi
Proxies
=================================================
Si vous avez besoin d'un bon proxy facile à utiliser, on m'a recommandé celui-ci, et ayant utilisé ScraperAPI pendant un certain temps, je peux en témoigner. Si vous alliez vous inscrire de toute façon, seriez-vous assez aimable pour utiliser le lien et le code promo ci-dessous ?
Vous pouvez également faire un essai complet d'abord, (contrairement à certaines autres entreprises). L'essai ne demande pas de détails de paiement non plus, donc tout va bien ! 👍
◼️ Code Promo : DRPI10
(Vous pouvez également commencer avec 1000 appels API gratuits. Pas de carte de crédit requise.)
❀ Un pouce en l'air, d'accord ? (à cause des algos..)
#webscraping #scrapy #python