Cómo 'extraer datos de la web' archivos pdf de un sitio utilizando el archivo sitemap.xml para proporcionar los números de identificación para reformar nuestras URLs usando Python, Pandas, Jupyter... y el paquete 'advertools'.
Nota: Usa requests para obtener cada una de las URLs resultantes/reconstruidas producidas por el código de Pandas. Recuerda pasar los encabezados con la url.
No mostré la descarga de los archivos pdf ya que es trivial una vez que puedes formar la url, y el sitio objetivo era solo un ejemplo.
Vi esta publicación en Stackoverflow y quería ayudar. Al usar advertools y Pandas, el código fue muy corto y no hubo necesidad de Selenium, bs4 o Scrapy.
Visita el blog redandgreen para más tutoriales
=========================================
Suscríbete al canal de YouTube
=================================
Síguenos en Twitter - para recibir notificaciones de nuevos videos
=================================================
Compra un café (o té) para Dr Pi
Proxies
=================================================
Si necesitas un buen proxy fácil de usar, me recomendaron este, y habiendo usado ScraperAPI por un tiempo, puedo dar fe de ellos. Si ibas a registrarte de todos modos, ¿podrías ser tan amable de usar el enlace y el código de cupón a continuación?
También puedes hacer una prueba completa primero, (a diferencia de algunas otras empresas). La prueba no pide detalles de pago, ¡así que todo bien! 👍
◼️ Código de cupón: DRPI10
(Puedes comenzar también con 1000 llamadas API gratuitas. No se requiere tarjeta de crédito.)
¿Dedos arriba, sí? (por los algoritmos..)
#webscraping #tutoriales #python