Zum Inhalt springen
FindOpenSource

Scrapy

Schnelles, High-Level-Python-Framework für Web Scraping und Crawling, zum Extrahieren strukturierter Daten von Websites.

Überblick

Scrapy ist ein Web-Scraping-Framework für Python, das strukturierte Daten von Websites extrahiert. Es ist plattformübergreifend, benötigt Python 3.10 oder neuer und wird von Zyte (früher Scrapinghub) zusammen mit einer großen Community von Contributors gepflegt – das macht es zu einem der etablierteren, langjährigen Frameworks im Bereich Web Scraping.

Als Framework statt als Tool für einen einzelnen Zweck übernimmt Scrapy das Grundgerüst rund um einen Scraper – Anfragen stellen, Links folgen, Antworten parsen und extrahierte Daten exportieren –, sodass ein Entwickler die für eine bestimmte Website spezifische Extraktionslogik schreibt, statt die umgebende Crawling-Infrastruktur selbst zu bauen.

Scrapy eignet sich für Python-Entwickler, die Scraper oder Crawler bauen und ein etabliertes, funktionsreiches Framework wollen – besonders für größere oder langfristig laufende Scraping-Projekte, bei denen Framework-Struktur und Wartbarkeit eine Rolle spielen.

Kategorien
Entwicklertools
Schlagwörter
web-scrapingcrawlerdata-extractionpython
Sprachen
Python
Lizenz
BSD-3-Clause

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.