Scrapy
ウェブサイトから構造化データを抽出するための、高速で高レベルな Python 製のウェブスクレイピング・クローリングフレームワークです。
概要
Scrapy は、ウェブサイトから構造化データを抽出する Python 製のウェブスクレイピングフレームワークです。クロスプラットフォームで、Python 3.10 以降が必要であり、Zyte(旧 Scrapinghub)と多数のコントリビューターからなるコミュニティによってメンテナンスされています。これにより、ウェブスクレイピング分野の中でも比較的確立され、長く運用されているフレームワークの1つとなっています。
単一目的のツールではなくフレームワークであるため、Scrapy はリクエストの送信、リンクの追跡、レスポンスの解析、抽出データのエクスポートといった、スクレイパーを取り巻く土台となる部分を処理します。そのため開発者は、周辺のクローリングインフラではなく、対象サイト固有の抽出ロジックの記述に集中できます。
Scrapy は、確立されたバッテリー同梱型のフレームワークを求める、スクレイパーやクローラーを構築する Python 開発者に向いており、特にフレームワークの構造や保守性が重要となる、大規模あるいは長期運用のスクレイピングプロジェクトに適しています。
- カテゴリ
- 開発者向けツール
- 言語
- Python
- ライセンス
- BSD-3-Clause
関連プロジェクト
Crawlee
Apache-2.0信頼性の高いクローラーを構築するための Node.js・TypeScript 向けウェブスクレイピング・ブラウザ自動化ライブラリで、ボット検知を回避しやすい設計になっています。
- 開発者向けツール
Playwright
Apache-2.0モダンな Web アプリ向けの、信頼性の高いエンドツーエンドテスト・ブラウザ自動化フレームワークです。
- 開発者向けツール
- テスト
Backstage
Apache-2.0会社のサービス、インフラ、ドキュメントを1つの検索可能なソフトウェアカタログに統合し、社内向け開発者ポータルを構築するためのオープンなフレームワークです。
- 開発者向けツール
Buildpacks
Apache-2.0Cloud Native Buildpacks は、Dockerfile を書くことなく、アプリケーションのソースコードから直接、本番運用に適したコンテナイメージを構築します。
- 開発者向けツール
誤りを見つけましたか? GitHub で修正を提案する