#webscraping #scrapy #sql #mariadb
Cette démo / tutoriel montre comment utiliser du code Python pour explorer un site entier avec Scrapy, tout en ne sauvegardant que les liens 'intéressants' dans la base de données SQL mariadb.
⦿ Web scraping sans utiliser de CSS ou XPATH ! Génial !
Je recherche des titres de livres pour trouver ceux qui contiennent les 'mots-clés' que je spécifie dans une liste Python. (Ligne 43 dans le code).
Vous verrez comment j'utilise :
⦿ la compréhension de liste,
⦿ la fonction "ANY"
⦿ "mysql.connector" pour me permettre de me connecter et d'envoyer la sortie à une base de données MySQL.
⦿ des commandes SQL telles que DESC table, TRUNCATE et INSERT
C'est plus simple que d'utiliser les pipelines Scrapy, et le code de cette vidéo pourrait être appliqué à d'autres projets en dehors de Scrapy.
timings:-
0:00 Introduction
2:00 booksto.scrape.com
5:00 analyse de l'élément
8:00 utilisation de la fonction "ANY"
13:06 mariadb (MySQL)
16:23 Scrapy remplit la base de données MySQL
*Geany n'affichait pas les underscores à certains niveaux de zoom, mais si vous voyez le code GitHub, vous verrez qu'ils sont présents. Je soupçonne que cela pourrait également être dû à l'utilisation d'une VM, qui ne peut pas accéder au bon matériel/driver graphique. Un jour, quand j'aurai plus d'argent, je prendrai un nouveau PC et ferai tourner Linux nativement !
# Code du Crawler Scrapy sur GitHub :
# Installer le "Connector"
pip install mysql-connector-python
# Installer la base de données :
sudo apt update
sudo apt install mariadb-server
sudo mysql_secure_installation
# Installer phpmyadmin :
sudo apt-get install phpmyadmin