#webscraping #scrapy #sql #mariadb
Esta demostración / tutorial muestra cómo usar código Python para rastrear un sitio completo con Scrapy, guardando solo los enlaces 'interesantes' en la base de datos SQL de mariadb.
⦿ Web scraping sin usar CSS ni XPATH. ¡Genial!
Busco títulos de libros para encontrar aquellos que contengan las 'palabras clave' que especifico en una lista de Python. (Línea 43 en el código).
Verás cómo utilizo:
⦿ comprensión de listas,
⦿ función "ANY"
⦿ "mysql.connector" para permitirme conectar y enviar la salida a una base de datos MySQL.
⦿ comandos SQL como DESC table, TRUNCATE e INSERT
Esto es más simple que usar pipelines de Scrapy, y el código en este video podría aplicarse a otros proyectos fuera de Scrapy.
tiempos:-
0:00 Introducción
2:00 booksto.scrape.com
5:00 analizando el ítem
8:00 usando la función "ANY"
13:06 mariadb (MySQL)
16:23 Scrapy llena la base de datos MySQL
*Geany no mostró guiones bajos en ciertos niveles de zoom, pero si ves el código de GitHub verás que están presentes. Sospecho que esto también podría deberse a que estoy usando una VM, que no puede acceder al hardware/controlador gráfico adecuado. ¡Un día, cuando tenga más dinero, conseguiré una nueva PC y ejecutaré Linux de forma nativa!
# Código del Rastreador Scrapy en GitHub:
# Instalar el "Conector"
pip install mysql-connector-python
# Instalar la Base de Datos:
sudo apt update
sudo apt install mariadb-server
sudo mysql_secure_installation
# Instalar phpmyadmin :
sudo apt-get install phpmyadmin