Dans ce tutoriel, nous allons apprendre ce que sont les cookies et les sessions, leur importance dans le scraping et comment les utiliser avec la bibliothèque requests de Python.
Un cookie HTTP est un type spécial d'en-tête de requête qui représente un petit morceau de données envoyé par un site web et stocké sur l'ordinateur de l'utilisateur. Il est différent des autres en-têtes, car ce n'est pas nous qui le choisissons – c'est le site web qui nous indique comment définir ce champ. Ensuite, le cookie peut être envoyé avec les requêtes ultérieures du client.
Les cookies ont été conçus pour être un mécanisme fiable permettant aux sites web de se souvenir d'informations d'état, telles que les articles ajoutés dans le panier d'achat d'une boutique en ligne, ou pour enregistrer l'activité de navigation de l'utilisateur.
Ils peuvent également être utilisés pour se souvenir de morceaux d'informations arbitraires que l'utilisateur a précédemment saisis dans des champs de formulaire, tels que des noms, des adresses, des mots de passe et des numéros de carte de crédit.
Chaque fois que le navigateur web des utilisateurs interagit avec un serveur web, il transmettra les informations du cookie au serveur web. Seuls les cookies stockés par le navigateur qui se rapportent au domaine de l'URL demandée seront envoyés au serveur.