コンテンツへスキップ
FindOpenSource

Crawlee

信頼性の高いクローラーを構築するための Node.js・TypeScript 向けウェブスクレイピング・ブラウザ自動化ライブラリで、ボット検知を回避しやすい設計になっています。

概要

Crawlee は、最小限の追加設定で信頼性の高いクローラーを構築することを目指した、Node.js と TypeScript 向けのウェブスクレイピング・ブラウザ自動化ライブラリです。クローラーがデフォルトでより人間らしい振る舞いをするよう設計されており、一般的なボット検知システムのトリガーを避けやすくなっている一方で、リンクをたどってクロールし、データをスクレイピングし、結果をディスクやクラウドに保存するためのツールも提供します。

クローラーが生の HTTP リクエストではなく実際のブラウザを必要とする場合には、(このカタログの他のプロジェクトでもブラウザ自動化に使われている)Playwright をオプションの依存関係として統合できます。また、この npm パッケージが対象とする JavaScript/TypeScript エコシステムではなく Python で作業するチーム向けに、別途 Crawlee for Python パッケージも用意されています。

Crawlee は、LLM や RAG パイプラインへのデータ供給を含め、スクレイパーやデータ抽出パイプラインを構築する JavaScript/TypeScript チームに向いており、組み込みのアンチ検知デフォルト設定を備えたメンテナンスされているライブラリを求める場合に適しています。カタログ内の Scrapy のような Python 中心のツールと重複するのではなく、それらを補完する存在です。

カテゴリ
開発者向けツール
キーワード
web-scrapingcrawlerbrowser-automationdata-extractionjavascript
言語
TypeScript
ライセンス
Apache-2.0

誤りを見つけましたか? GitHub で修正を提案する