--
Bonjour à tous, je m'appelle Thomas Laetsch. Je suis actuellement data scientist au Centre de Data Science de l'Université de New York.
Dans ce cours, Web Scraping avec Python, vous apprendrez certaines des techniques fondamentales du web scraping computationnel. C'est-à-dire que vous apprendrez à créer des logiciels pour automatiser l'extraction de données à partir de sources en ligne.
Avant de passer aux spécificités et aux détails techniques, laissez-moi vous convaincre que ces techniques peuvent être un ajout précieux à vos connaissances en science des données, et que ce cours sera l'endroit idéal pour commencer ou renforcer les bases de cet ensemble de compétences.
Vous vous demandez peut-être pourquoi les entreprises pourraient employer des personnes ayant de l'expérience en web scraping ? Que peuvent-elles tirer du web scraping ? Eh bien, elles peuvent extraire des sites concurrents pour rassembler des prix de produits ou services similaires afin de comparer et d'ajuster leurs propres points de prix. Elles peuvent extraire des avis en ligne sur leurs produits ou services, et recueillir l'opinion publique sur l'entreprise en général. Elles peuvent extraire des informations des réseaux sociaux ou d'autres forums publics pour obtenir des contacts ou d'autres informations sur des clients ou des clients potentiels, afin de diriger de manière significative des ressources vers ce groupe de clients possibles. Et ce n'était qu'une courte liste !
Nous énumérons ici quelques choses amusantes que vous pouvez faire en scrappant le web. Vous pourriez rechercher vos mèmes préférés sur vos sites préférés. Vous pouvez parcourir les petites annonces à la recherche de vos objets préférés. Vous pouvez chercher des sujets tendance sur les réseaux sociaux. Vous pouvez chercher des recettes qui pourraient vous intéresser sur des blogs de cuisine. En fait, il y a beaucoup de choses que vous pouvez faire !
Pour mieux visualiser l'objectif de ce que vous apprendrez dans ces cours et exercices, décomposons grossièrement le pipeline de web scraping en trois parties.
La première partie est la configuration, c'est-à-dire définir l'objectif ou la tâche et identifier les sources en ligne qui, selon vous, vous aideront à atteindre le résultat final souhaité.
La deuxième est l'acquisition de ces données en ligne. Cela inclut l'accès aux données, l'analyse de ces informations et l'extraction de ces données dans des structures de données significatives et utiles.
La troisième est la phase de traitement, où vous passez ces données téléchargées à travers les analyses ou processus nécessaires pour atteindre l'objectif souhaité.
Ce cours se concentre sur la phase d'acquisition. Pour ce faire, nous utiliserons Python et le framework de web crawling Scrapy. Nous avons choisi Scrapy car nous pouvons nous lancer rapidement et facilement évoluer vers de grands projets de scraping. Cependant, même si vous n'êtes pas convaincu d'utiliser Scrapy ou Python, vous développerez tout de même des techniques et une intuition qui seront précieuses dans tout environnement de web scraping computationnel que vous appréciez !
Donc, j'espère que vous êtes aussi enthousiaste que moi à l'idée de participer à ce cours et d'acquérir les compétences nécessaires pour commencer à scrapper le web pour toutes les raisons qui vous passionnent !
#TutorielPython #WebScraping #Python #DataCamp