L'extraction ou le crawling d'un grand site peut générer une grande quantité de données à stocker. Pour éviter la duplication des données, il peut être préférable d'utiliser plusieurs tables dans une base de données.
Ici, je montre une méthode très simple d'utiliser une logique conditionnelle avec du code Python dans une araignée Scrapy pour envoyer des données vers différentes tables en fonction des valeurs extraites. Ceci est destiné à donner un aperçu à quiconque a déjà exploré l'extraction de données vers une base de données sqlite3 ou similaire.
🟢 Les dangers de l'utilisation de CSV (par exemple Excel) sont également abordés !
L'objectif de cette vidéo est de vous inspirer à explorer les possibilités d'utiliser une base de données, plusieurs tables, et l'extraction de données de manière plus structurée, et de considérer quel sera l'objectif final de vos données, et comment elles pourraient être utilisées/interrogées.
Si cela vous a intéressé, l'étape suivante sera d'apprendre le SQL et de créer des tables.
Merci de regarder.
Dr Pi.
'Illegitimi non carborundum'
def parse_item(self, response):
wsearch = ['train','murder']
lstitle = []
x = response.url
booktitle = str(x)
booktitle = booktitle.split("/")[4]
booktitle = booktitle.split("_")[0]
[lstitle.append(i) for i in booktitle.split("-")]
check = any(item in wsearch for item in lstitle)
if check is True:
myquery = """INSERT INTO links (url,book)
values(%s,%s)
"""
val=(x,booktitle)
cursor.execute(myquery,val)
mydb.commit()
else:
myquery = """INSERT INTO links2 (url,book)
values(%s,%s)
"""
val=(x,booktitle)
cursor.execute(myquery,val)
mydb.commit()
#extractiondedonnées #sqlite #base de données