본문으로 건너뛰기
FindOpenSource

Scrapy

웹사이트에서 구조화된 데이터를 추출하기 위한 빠르고 고수준의 Python 웹 스크레이핑·크롤링 프레임워크입니다.

개요

Scrapy는 웹사이트에서 구조화된 데이터를 추출하는 Python 웹 스크레이핑 프레임워크입니다. 크로스 플랫폼이며 Python 3.10 이상이 필요하고, Zyte(구 Scrapinghub)와 대규모 컨트리뷰터 커뮤니티가 함께 유지 관리합니다. 이 덕분에 웹 스크레이핑 분야에서 비교적 확립되고 오래된 프레임워크 중 하나로 자리 잡았습니다.

단일 목적 도구가 아니라 프레임워크이기 때문에, Scrapy는 스크레이퍼 주변의 기반 작업——요청 보내기, 링크 따라가기, 응답 파싱, 추출한 데이터 내보내기——을 처리하므로, 개발자는 주변 크롤링 인프라가 아니라 특정 사이트에 특화된 추출 로직 작성에 집중할 수 있습니다.

Scrapy는 확립되고 필요한 기능이 모두 포함된("배터리 포함") 프레임워크를 원하는, 스크레이퍼나 크롤러를 만드는 Python 개발자에게 적합하며, 특히 프레임워크 구조와 유지 관리성이 중요한 대규모 또는 장기 실행 스크레이핑 프로젝트에 잘 맞습니다.

카테고리
개발자 도구
키워드
web-scrapingcrawlerdata-extractionpython
언어
Python
라이선스
BSD-3-Clause

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기