Wie man 'Web Scraping' von PDF-Dateien von einer Website mithilfe der sitemap.xml-Datei durchführt, um die ID-Nummern bereitzustellen, um unsere URLs mit Python, Pandas, Jupyter... und dem 'advertools'-Paket zu reformieren.
Hinweis: Verwenden Sie requests, um jede der resultierenden/wiederhergestellten URLs abzurufen, die durch den Pandas-Code erzeugt wurden. Denken Sie daran, die Header mit der URL zu übergeben.
Ich habe das Herunterladen der PDF-Dateien nicht gezeigt, da dies trivial ist, sobald Sie in der Lage sind, die URL zu bilden, und die Zielseite war nur ein Beispiel.
Ich habe diesen Beitrag auf Stackoverflow gesehen und wollte helfen. Durch die Verwendung von advertools und Pandas war der Code sehr kurz und es war keine Notwendigkeit für Selenium oder bs4 oder Scrapy.
Besuchen Sie den redandgreen Blog für weitere Tutorials
=========================================
Abonnieren Sie den YouTube-Kanal
=================================
Folgen Sie auf Twitter - um über neue Videos informiert zu werden
=================================================
Kaufen Sie Dr. Pi einen Kaffee (oder Tee)
Proxys
=================================================
Wenn Sie einen guten, einfach zu verwendenden Proxy benötigen, wurde mir dieser empfohlen, und nachdem ich ScraperAPI eine Weile verwendet habe, kann ich für sie bürgen. Wenn Sie sich sowieso anmelden wollten, wären Sie dann vielleicht so freundlich, den Link und den Gutscheincode unten zu verwenden?
Sie können auch zuerst eine vollständige Testversion durchführen (im Gegensatz zu einigen anderen Unternehmen). Die Testversion fragt auch keine Zahlungsdetails ab, also alles gut! 👍
◼️ Gutscheincode: DRPI10
(Sie können auch mit 1000 kostenlosen API-Aufrufen beginnen. Keine Kreditkarte erforderlich.)
Daumen hoch, ja? (wegen Algos..)
#webscraping #tutorials #python