コンテンツへスキップ
FindOpenSource

Scrapy

ウェブサイトから構造化データを抽出するための、高速で高レベルな Python 製のウェブスクレイピング・クローリングフレームワークです。

概要

Scrapy は、ウェブサイトから構造化データを抽出する Python 製のウェブスクレイピングフレームワークです。クロスプラットフォームで、Python 3.10 以降が必要であり、Zyte(旧 Scrapinghub)と多数のコントリビューターからなるコミュニティによってメンテナンスされています。これにより、ウェブスクレイピング分野の中でも比較的確立され、長く運用されているフレームワークの1つとなっています。

単一目的のツールではなくフレームワークであるため、Scrapy はリクエストの送信、リンクの追跡、レスポンスの解析、抽出データのエクスポートといった、スクレイパーを取り巻く土台となる部分を処理します。そのため開発者は、周辺のクローリングインフラではなく、対象サイト固有の抽出ロジックの記述に集中できます。

Scrapy は、確立されたバッテリー同梱型のフレームワークを求める、スクレイパーやクローラーを構築する Python 開発者に向いており、特にフレームワークの構造や保守性が重要となる、大規模あるいは長期運用のスクレイピングプロジェクトに適しています。

カテゴリ
開発者向けツール
キーワード
web-scrapingcrawlerdata-extractionpython
言語
Python
ライセンス
BSD-3-Clause

誤りを見つけましたか? GitHub で修正を提案する