跳至内容
FindOpenSource

Crawlee

用于网页抓取和浏览器自动化的 Node.js/TypeScript 库,旨在构建能够抵御反爬检测的可靠爬虫。

概述

Crawlee 是一个面向 Node.js 和 TypeScript 的网页抓取与浏览器自动化库,目标是以最少的额外配置构建可靠的爬虫。它的设计让爬虫默认表现得更接近真实用户行为,从而有助于避免触发常见的反爬检测系统,同时提供工具帮你抓取链接、爬取数据,并将结果存储到磁盘或云端。

当爬虫需要真实浏览器而不是原始 HTTP 请求时,它可以将 Playwright(本目录中其他项目也使用它来实现浏览器自动化)作为可选依赖进行集成;此外还有独立的 Crawlee for Python 包,供使用 Python 而非这个 npm 包所面向的 JavaScript/TypeScript 生态的团队使用。

Crawlee 适合那些正在构建抓取器或数据提取管道(包括为 LLM 或 RAG 管道提供数据)的 JavaScript/TypeScript 团队,他们希望使用一个内置反检测默认配置、并持续维护的库,与目录中以 Python 为主的工具(如 Scrapy)形成互补,而非重复。

分类
开发者工具
关键词
web-scrapingcrawlerbrowser-automationdata-extractionjavascript
编程语言
TypeScript
许可证
Apache-2.0

发现信息有误?在 GitHub 上提出修改建议