Pour satisfaire le besoin de données dans l'IA générative et traditionnelle, dans un environnement en évolution rapide, la capacité d'extraire efficacement des données du web est devenue indispensable pour les entreprises et les développeurs. Cette présentation explore la méthodologie et les outils de web crawling et de web scraping, avec un aperçu des aspects éthiques et légaux du processus, y compris les meilleures pratiques sur la manière de crawler poliment et efficacement et d'utiliser les données sans violer les lois sur la vie privée ou la propriété intellectuelle.
www.pydata.org
PyData est un programme éducatif de NumFOCUS, une organisation à but non lucratif 501(c)3 aux États-Unis. PyData fournit un forum pour la communauté internationale des utilisateurs et des développeurs d'outils d'analyse de données afin de partager des idées et d'apprendre les uns des autres. Le réseau mondial PyData promeut la discussion des meilleures pratiques, des nouvelles approches et des technologies émergentes pour la gestion, le traitement, l'analyse et la visualisation des données. Les communautés PyData abordent la science des données en utilisant de nombreux langages, y compris (mais sans s'y limiter) Python, Julia et R.
Les conférences PyData visent à être accessibles et axées sur la communauté, avec des présentations allant du niveau novice au niveau avancé. Les tutoriels et les conférences PyData apportent aux participants les dernières fonctionnalités des projets ainsi que des cas d'utilisation à la pointe de la technologie.
00:00 Bienvenue !
00:10 Aidez-nous à ajouter des horodatages ou des sous-titres à cette vidéo ! Voir la description pour plus de détails.