Scrapy
Schnelles, High-Level-Python-Framework für Web Scraping und Crawling, zum Extrahieren strukturierter Daten von Websites.
Überblick
Scrapy ist ein Web-Scraping-Framework für Python, das strukturierte Daten von Websites extrahiert. Es ist plattformübergreifend, benötigt Python 3.10 oder neuer und wird von Zyte (früher Scrapinghub) zusammen mit einer großen Community von Contributors gepflegt – das macht es zu einem der etablierteren, langjährigen Frameworks im Bereich Web Scraping.
Als Framework statt als Tool für einen einzelnen Zweck übernimmt Scrapy das Grundgerüst rund um einen Scraper – Anfragen stellen, Links folgen, Antworten parsen und extrahierte Daten exportieren –, sodass ein Entwickler die für eine bestimmte Website spezifische Extraktionslogik schreibt, statt die umgebende Crawling-Infrastruktur selbst zu bauen.
Scrapy eignet sich für Python-Entwickler, die Scraper oder Crawler bauen und ein etabliertes, funktionsreiches Framework wollen – besonders für größere oder langfristig laufende Scraping-Projekte, bei denen Framework-Struktur und Wartbarkeit eine Rolle spielen.
- Kategorien
- Entwicklertools
- Schlagwörter
- web-scrapingcrawlerdata-extractionpython
- Sprachen
- Python
- Lizenz
- BSD-3-Clause
Ähnliche Projekte
Crawlee
Apache-2.0Node.js- und TypeScript-Bibliothek für Web Scraping und Browserautomatisierung, gebaut für zuverlässige Crawler, die der Bot-Erkennung widerstehen.
- Entwicklertools
Playwright
Apache-2.0Zuverlässiges Framework für End-to-End-Tests und Browserautomatisierung für moderne Webanwendungen.
- Entwicklertools
- Testing
Backstage
Apache-2.0Offenes Framework zum Aufbau eines internen Entwicklerportals, das die Dienste, Infrastruktur und Dokumentation eines Unternehmens in einem durchsuchbaren Software-Katalog vereint.
- Entwicklertools
Buildpacks
Apache-2.0Cloud Native Buildpacks bauen produktionsreife Container-Images direkt aus dem Quellcode der Anwendung, ohne ein Dockerfile zu schreiben.
- Entwicklertools
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.