Zum Inhalt springen
FindOpenSource

Crawlee

Node.js- und TypeScript-Bibliothek für Web Scraping und Browserautomatisierung, gebaut für zuverlässige Crawler, die der Bot-Erkennung widerstehen.

Überblick

Crawlee ist eine Web-Scraping- und Browserautomatisierungs-Bibliothek für Node.js und TypeScript, die darauf abzielt, zuverlässige Crawler mit minimalem zusätzlichem Konfigurationsaufwand zu bauen. Sie ist so konzipiert, dass sich Crawler standardmäßig menschenähnlicher verhalten, was hilft, gängige Bot-Erkennungssysteme nicht auszulösen, während sie gleichzeitig die Werkzeuge bereitstellt, um Links zu crawlen, Daten zu scrapen und Ergebnisse auf der Festplatte oder in der Cloud zu speichern.

Sie lässt sich mit Playwright (bereits an anderer Stelle in diesem Katalog für Browserautomatisierung genutzt) als optionale Abhängigkeit integrieren, wenn ein Crawler einen echten Browser statt reiner HTTP-Anfragen benötigt, und es gibt ein separates Crawlee-for-Python-Paket für Teams, die in Python statt im JavaScript/TypeScript-Ökosystem arbeiten, auf das dieses npm-Paket abzielt.

Crawlee eignet sich für JavaScript/TypeScript-Teams, die Scraper oder Datenextraktions-Pipelines bauen – auch zur Versorgung von LLM- oder RAG-Pipelines – und eine gepflegte Bibliothek mit eingebauten Anti-Erkennungs-Standardeinstellungen wollen, als Ergänzung zu Python-first-Tools wie Scrapy im aktuellen Katalog statt als Duplikat.

Kategorien
Entwicklertools
Schlagwörter
web-scrapingcrawlerbrowser-automationdata-extractionjavascript
Sprachen
TypeScript
Lizenz
Apache-2.0

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.