Crawlee
信頼性の高いクローラーを構築するための Node.js・TypeScript 向けウェブスクレイピング・ブラウザ自動化ライブラリで、ボット検知を回避しやすい設計になっています。
概要
Crawlee は、最小限の追加設定で信頼性の高いクローラーを構築することを目指した、Node.js と TypeScript 向けのウェブスクレイピング・ブラウザ自動化ライブラリです。クローラーがデフォルトでより人間らしい振る舞いをするよう設計されており、一般的なボット検知システムのトリガーを避けやすくなっている一方で、リンクをたどってクロールし、データをスクレイピングし、結果をディスクやクラウドに保存するためのツールも提供します。
クローラーが生の HTTP リクエストではなく実際のブラウザを必要とする場合には、(このカタログの他のプロジェクトでもブラウザ自動化に使われている)Playwright をオプションの依存関係として統合できます。また、この npm パッケージが対象とする JavaScript/TypeScript エコシステムではなく Python で作業するチーム向けに、別途 Crawlee for Python パッケージも用意されています。
Crawlee は、LLM や RAG パイプラインへのデータ供給を含め、スクレイパーやデータ抽出パイプラインを構築する JavaScript/TypeScript チームに向いており、組み込みのアンチ検知デフォルト設定を備えたメンテナンスされているライブラリを求める場合に適しています。カタログ内の Scrapy のような Python 中心のツールと重複するのではなく、それらを補完する存在です。
- カテゴリ
- 開発者向けツール
- 言語
- TypeScript
- ライセンス
- Apache-2.0
関連プロジェクト
Scrapy
BSD-3-Clauseウェブサイトから構造化データを抽出するための、高速で高レベルな Python 製のウェブスクレイピング・クローリングフレームワークです。
- 開発者向けツール
Playwright
Apache-2.0モダンな Web アプリ向けの、信頼性の高いエンドツーエンドテスト・ブラウザ自動化フレームワークです。
- 開発者向けツール
- テスト
Backstage
Apache-2.0会社のサービス、インフラ、ドキュメントを1つの検索可能なソフトウェアカタログに統合し、社内向け開発者ポータルを構築するためのオープンなフレームワークです。
- 開発者向けツール
Buildpacks
Apache-2.0Cloud Native Buildpacks は、Dockerfile を書くことなく、アプリケーションのソースコードから直接、本番運用に適したコンテナイメージを構築します。
- 開発者向けツール
誤りを見つけましたか? GitHub で修正を提案する