Saltar al contenido
FindOpenSource

Crawlee

Biblioteca de Node.js y TypeScript para web scraping y automatización de navegador, diseñada para crear crawlers fiables que resistan la detección de bots.

Descripción general

Crawlee es una biblioteca de web scraping y automatización de navegador para Node.js y TypeScript, orientada a construir crawlers fiables con una configuración adicional mínima. Está diseñada para que los crawlers se comporten de forma más parecida a un humano por defecto, ayudando a evitar activar los sistemas de detección de bots habituales, a la vez que te da las herramientas para rastrear enlaces, extraer datos y guardar los resultados en disco o en la nube.

Se integra con Playwright (ya utilizado en otras partes de este catálogo para automatización de navegador) como dependencia opcional cuando un crawler necesita un navegador real en lugar de solicitudes HTTP sin más, y existe un paquete aparte, Crawlee for Python, para equipos que trabajan en Python en lugar del ecosistema JavaScript/TypeScript al que se dirige este paquete de npm.

Crawlee encaja en equipos de JavaScript/TypeScript que construyen scrapers o pipelines de extracción de datos —incluso para alimentar pipelines de LLM o RAG— y quieren una biblioteca mantenida con valores predeterminados anti-detección incorporados, complementando en lugar de duplicar herramientas Python-first del catálogo actual como Scrapy.

Categorías
Herramientas para desarrolladores
Palabras clave
web-scrapingcrawlerbrowser-automationdata-extractionjavascript
Lenguajes
TypeScript
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.