#webscraping #scrapy #sql #mariadb
Dieses Demo / Tutorial zeigt, wie man mit Python-Code eine gesamte Website mit Scrapy crawlt und dabei nur die 'interessanten' Links in die mariadb SQL-Datenbank speichert.
⦿ Web Scraping ohne CSS oder XPATH! Schön!
Ich suche nach Buchtiteln, um Titel zu finden, die die 'Schlüsselwörter' enthalten, die ich in einer Python-Liste angebe. (Zeile 43 im Code).
Sie werden sehen, wie ich:
⦿ List Comprehension,
⦿ die "ANY"-Funktion
⦿ "mysql.connector" verwende, um mich zu verbinden und die Ausgabe an eine MySQL-Datenbank zu senden.
⦿ SQL-Befehle wie DESC table, TRUNCATE und INSERT
Das ist einfacher als die Verwendung von Scrapy-Pipelines, und der Code in diesem Video könnte auch auf andere Projekte außerhalb von Scrapy angewendet werden.
timings:-
0:00 Einführung
2:00 booksto.scrape.com
5:00 Parsen des Items
8:00 Verwendung der "ANY"-Funktion
13:06 mariadb (MySQL)
16:23 Scrapy füllt die MySQL-Datenbank
*Geany hat Unterstriche bei bestimmten Zoomstufen nicht angezeigt, aber wenn Sie den GitHub-Code sehen, werden Sie feststellen, dass sie vorhanden sind. Ich vermute, das könnte auch daran liegen, dass ich eine VM verwende, die nicht auf die richtige Hardware/Grafiktreiber zugreifen kann. Eines Tages, wenn ich mehr Geld habe, werde ich mir einen neuen PC kaufen und Linux nativ betreiben!
# Scrapy Crawler Code auf GitHub:
# Installieren Sie den "Connector"
pip install mysql-connector-python
# Installieren Sie die Datenbank:
sudo apt update
sudo apt install mariadb-server
sudo mysql_secure_installation
# Installieren Sie phpmyadmin :
sudo apt-get install phpmyadmin