So führen Sie ein Scrapy-Web-Scraping-Projekt in einer virtuellen Umgebung täglich aus und speichern die Ergebnisse in einer Datenbank. (Ich verwende Postgres, aber dasselbe Konzept gilt für jede Datenbank, die Sie verwenden).
⦾ Erstellen Sie ein Bash-Skript, um die virtuelle Umgebung zu aktivieren und den Spider über CRON auszuführen.
--
#!/usr/bin/env bash
source /home/pi/Documents/Scrape/bin/activate
cd /home/pi/Documents/Scrape/Scrapy19/jobz/spiders
scrapy crawl jobzspider
--
⦾ Im CRON planen
# Zum Beispiel können Sie ein Backup aller Ihrer Benutzerkonten
# jeden Tag um 5 Uhr morgens mit folgendem Befehl ausführen:
0 15 * * * ~/Documents/Scrape/Scrapy19/jobz/spiders/cj.sh
#
# Für weitere Informationen siehe die Handbuchseiten von crontab(5) und cron(8)
#
# m h dom mon dow Befehl
--
⦾ AUSGABE 3 Tage später...
jobs=# select posted from listings group by 1;
posted
------------
2021-06-04
2021-06-05
2021-06-06
(3 Zeilen)***
Besuchen Sie den redandgreen Blog für weitere Tutorials
=========================================
Abonnieren Sie den YouTube-Kanal
=================================
Folgen Sie auf Twitter - um über neue Videos informiert zu werden
=================================================
👍 Werden Sie ein Unterstützer 👍
Kaufen Sie Dr. Pi einen Kaffee (oder Tee)
Proxys
=================================================
Wenn Sie einen guten, einfach zu verwendenden Proxy benötigen, wurde mir dieser hier empfohlen, und nachdem ich ScraperAPI eine Weile verwendet habe, kann ich für sie bürgen. Wenn Sie sich sowieso anmelden wollten, wären Sie dann so nett, den Link und den Gutscheincode unten zu verwenden?
Sie können auch zuerst eine vollständige Testversion durchführen (im Gegensatz zu einigen anderen Unternehmen). Die Testversion fragt auch keine Zahlungsdetails ab, also alles gut! 👍
◼️ Gutscheincode: DRPI10
(Sie können auch mit 1000 kostenlosen API-Aufrufen beginnen. Keine Kreditkarte erforderlich.)
❀ Daumen hoch, ja? (wegen Algorithmen..)
#webscraping #scrapy #python