Confira meu Patreon!
Bem-vindo de volta à próxima parte da nossa série Python para Fantasy Sports Diários!
Neste vídeo, vamos aprender uma ferramenta mais avançada para web scraping
chamada Selenium. Selenium é um pacote Python que permite a interação com
páginas da web além de simplesmente atualizar a URL.
Usaremos o Selenium em adição ao Beautiful Soup para nossas necessidades de web scraping
daqui em diante, então, se você não está familiarizado com o Beautiful Soup, vou postar um link para
meus vídeos anteriores sobre Beautiful Soup aqui em cima.
Agora, vamos começar a codificar.
Requisitos::
Tudo do Tutorial BS4
+
Instalar Selenium com Pip
Gecko Driver
Explicação do Gecko
- O Gecko é basicamente uma interface que permite que o Firefox seja controlado por um terceiro
partido, ou seja, seu código Python. Você deve estar atualizado com o Firefox e o Gecko; se você
escrever algum código que funcione e depois parar de funcionar, esse é um problema provável.
Documentação do Selenium
-- Funções/processos importantes necessários para
Encontrar elementos
Selecionar elementos
Essas táticas nos permitem automatizar interações com as páginas da web, o que
torna o web scraping em larga escala MUITO mais eficiente.
Por exemplo:
Estatísticas do NBA.com, cada página precisará ser interagida para extrair a
base de estatísticas. A URL só pode nos levar à página inicial dos 50 principais resultados.
A URL pode ser repetida para cobrir diferentes páginas de estatísticas, mas precisaremos
interagir com a própria página da web para avançar.
Por que é importante entender como inspecionar os elementos na página,
muito semelhante à maneira como estabelecemos a tabela que queríamos usar no
tutorial do Beautiful Soup. Agora, precisaremos identificar os elementos na
página com os quais queremos interagir e, em seguida, como interagir com eles.