Web Scraping em Python usando o módulo Beautiful Soup. Neste vídeo, vou explicar como realizar web scraping em Python utilizando o Beautiful Soup e o módulo Requests. Vou escrever um programa em Python para extrair dados do site IMDB e, em seguida, carregar os dados desejados em um arquivo Excel. Vou escrever este programa do zero para que você possa acompanhar.
Se você gostaria de praticar consultas SQL ou explorar meus cursos gravados de SQL, confira minha plataforma de aprendizado SQL tudo-em-um, SQLNest 👇
Web Scraping é o processo de extrair programaticamente alguns dados de um site. Em Python, podemos facilmente escrever um programa para extrair dados de um site usando o Beautiful Soup e o módulo Requests. O módulo Requests pode ser usado para acessar o site desejado e o módulo Beautiful Soup pode ser usado para analisar o código-fonte HTML do site. O Beautiful Soup facilita muito a análise do conteúdo HTML e, em seguida, fornece vários métodos que podem ser usados para extrair dados de qualquer tag HTML. Todos os sites são escritos na linguagem HTML, portanto, para realizar web scraping, nosso programa precisa ler o conteúdo HTML. É aqui que o Beautiful Soup entra em cena para facilitar o acesso ao conteúdo HTML usando métodos muito simples.
Você não precisa ser um especialista em HTML para aprender web scraping em Python. Você só precisa conhecer o HTML mais básico, que é saber o que é uma tag e como identificar os atributos associados a uma tag.
Neste vídeo, para explicar o conceito de web scraping usando BeautifulSoup em Python, estaremos escrevendo um programa em Python que acessará o site IMDB e, em seguida, buscará os filmes mais bem avaliados presentes no site IMDB e carregará esses dados em um arquivo Excel.
O site IMDB contém classificações de filmes, mas neste programa estamos apenas interessados em extrair os filmes mais bem avaliados de todos os tempos.
Para carregar dados em um arquivo Excel, estarei usando o módulo openpyxl. Usando openpyxl, é muito fácil criar um novo arquivo Excel e, em seguida, renomear o nome da planilha e carregar dados no arquivo Excel. Não vou explicar o openpyxl em detalhes, mas apenas cobrir o suficiente para saber como criar um arquivo Excel e carregar dados nele.
Estaremos instalando os módulos Requests e Beautiful Soup usando o instalador pip. Estou usando um Mac, então o comando no Mac a ser executado no terminal é “pip3 install module_name”. Se você estiver usando Windows, precisará executar o comando de instalação do pip no prompt de comando usando o comando “pip install module_name”.
🔴 ASSISTA MAIS VÍDEOS AQUI 👇
✅ Tutorial de SQL - Conceitos básicos:
✅ Tutorial de SQL - Conceitos intermediários:
✅ Tutorial de SQL - Conceitos avançados:
✅ Pratique resolvendo consultas SQL básicas:
✅ Pratique resolvendo consultas SQL intermediárias:
✅ Pratique resolvendo consultas SQL complexas:
✅ Orientação de carreira em Análise de Dados:
✅ Curso de SQL, Recomendações de Plataforma de Treinamento em SQL:
✅ Tutorial de Python:
✅ Tutorial de Git e GitHub:
✅ Projetos de Análise de Dados:
OBRIGADO,
Thoufiq