#webscraping #scrapy #sql #mariadb
Esta demonstração / tutorial mostra como usar código Python para rastrear um site inteiro com Scrapy, salvando apenas os links 'interessantes' no banco de dados SQL mariadb.
⦿ Web scraping sem usar CSS ou XPATH! Legal!
Eu busco títulos de livros para encontrar aqueles que contêm as 'palavras-chave' que especifico em uma lista Python. (Linha 43 no código).
Você verá como eu uso:
⦿ compreensão de listas,
⦿ função "ANY"
⦿ "mysql.connector" para me permitir conectar e enviar a saída para um banco de dados MySQL.
⦿ comandos SQL como DESC table, TRUNCATE e INSERT
Isso é mais simples do que usar pipelines do Scrapy, e o código neste vídeo pode ser aplicado a outros projetos fora do Scrapy.
timings:-
0:00 Introdução
2:00 booksto.scrape.com
5:00 analisando o item
8:00 usando a função "ANY"
13:06 mariadb (MySQL)
16:23 Scrapy popula o banco de dados MySQL
*O Geany não exibiu sublinhados em certos níveis de zoom, mas se você ver o código no GitHub, verá que eles estão presentes. Suspeito que isso também possa ser devido ao fato de eu estar usando uma VM, que não consegue acessar o hardware/drivers gráficos adequados. Um dia, quando eu tiver mais dinheiro, vou comprar um novo PC e rodar Linux nativamente!
# Código do Crawler Scrapy no GitHub:
# Instale o "Connector"
pip install mysql-connector-python
# Instale o Banco de Dados:
sudo apt update
sudo apt install mariadb-server
sudo mysql_secure_installation
# Instale o phpmyadmin :
sudo apt-get install phpmyadmin