跳至内容
FindOpenSource

Scrapy

快速的高层次 Python 网页抓取与爬虫框架,用于从网站中提取结构化数据。

概述

Scrapy 是一个用于 Python 的网页抓取框架,能够从网站中提取结构化数据。它跨平台,需要 Python 3.10 及以上版本,由 Zyte(前身为 Scrapinghub)和庞大的贡献者社区共同维护——这使它成为网页抓取领域中较为成熟、历史悠久的框架之一。

作为一个框架而非单一用途的工具,Scrapy 负责处理围绕爬虫的基础架构工作——发起请求、跟踪链接、解析响应以及导出提取的数据——让开发者可以专注于编写针对特定网站的提取逻辑,而不必自行搭建周围的爬取基础设施。

Scrapy 适合那些希望使用一个成熟、功能齐全(“开箱即用”)框架来构建抓取器或爬虫的 Python 开发者,尤其适合那些框架结构和可维护性至关重要的大型或长期运行的抓取项目。

分类
开发者工具
关键词
web-scrapingcrawlerdata-extractionpython
编程语言
Python
许可证
BSD-3-Clause

发现信息有误?在 GitHub 上提出修改建议