Beginne mit der Datenerfassung von X / Twitter 👉🏻
Reddit ist eine der größten Quellen für nutzergenerierte Inhalte im Internet, mit Millionen von Beiträgen und Kommentaren, die über Tausende von aktiven Subreddits organisiert sind.
Wenn du jemals versucht hast, Reddit programmgesteuert zu scrapen, hast du wahrscheinlich auf die offizielle API über PRAW zurückgegriffen. Es funktioniert, erfordert jedoch eine OAuth-Einrichtung, setzt strenge Ratenlimits und begrenzt die Daten, die du pro Anfrage abrufen kannst.
Es gibt einen schnelleren Weg.
Die internen Web-Endpunkte von Reddit (die gleichen, die die Seite verwendet, um Inhalte in deinem Browser zu laden) geben strukturiertes HTML zurück, das du direkt mit BeautifulSoup parsen kannst. Keine API-Schlüssel, keine OAuth-Token, keine Ratenlimit-Header zu verwalten.
Der Haken ist der Anti-Bot-Schutz von Reddit, der automatisierte Anfragen stillschweigend blockiert, ohne einen Fehler zurückzugeben. Damit werden wir mit Scrape.do umgehen und drei vollständige Scraper erstellen: einen für Subreddit-Beiträge, einen für Suchergebnisse und einen für Kommentare.