Erfahren Sie, wie Sie XML-Sitemaps verarbeiten, um alle Texte auf einer Website zu extrahieren. Gehen Sie direkt von einer Nachrichten- oder Blog-Startseite zu einer vollständig verarbeiteten Dokumentensammlung.
Dieses Einführungstutorial zeigt, wie die Funktionen für #Crawling und #Scraping in Python und in der Shell ausgeführt werden.
--
Inhaltsverzeichnis:
0:00 Einführung: Wie können wir Inhalte innerhalb einer Website entdecken?
0:44 Die Python-Bibliothek
1:00 Was sind Sitemaps und wofür sind sie gut?
1:57 Entdecken und Verarbeiten von Sitemaps mit Python
2:40 List Comprehensions zum Filtern der Links
4:00 Scraping und Inhaltsextraktion
5:30 Verwendung in der Kommandozeile
--
Trafilatura ist ein kostenlos verfügbares Scraping-Tool, das nahtlos Webseitendaten herunterlädt, analysiert und scrapt, während Teile der Textformatierung und Seitenstruktur erhalten bleiben. Es bietet parallele Online- und Offline-Verarbeitung, robuste und effiziente Extraktion, Linkentdeckung in Feeds und Sitemaps sowie Spracherkennung.
Die Ausgabe kann in verschiedene Formate konvertiert werden: TXT, CSV, JSON, XML und XML-TEI.
▶️ Weitere Informationen
#webscraping #pythonTutorial #pythonAnfänger