Scrapy
웹사이트에서 구조화된 데이터를 추출하기 위한 빠르고 고수준의 Python 웹 스크레이핑·크롤링 프레임워크입니다.
개요
Scrapy는 웹사이트에서 구조화된 데이터를 추출하는 Python 웹 스크레이핑 프레임워크입니다. 크로스 플랫폼이며 Python 3.10 이상이 필요하고, Zyte(구 Scrapinghub)와 대규모 컨트리뷰터 커뮤니티가 함께 유지 관리합니다. 이 덕분에 웹 스크레이핑 분야에서 비교적 확립되고 오래된 프레임워크 중 하나로 자리 잡았습니다.
단일 목적 도구가 아니라 프레임워크이기 때문에, Scrapy는 스크레이퍼 주변의 기반 작업——요청 보내기, 링크 따라가기, 응답 파싱, 추출한 데이터 내보내기——을 처리하므로, 개발자는 주변 크롤링 인프라가 아니라 특정 사이트에 특화된 추출 로직 작성에 집중할 수 있습니다.
Scrapy는 확립되고 필요한 기능이 모두 포함된("배터리 포함") 프레임워크를 원하는, 스크레이퍼나 크롤러를 만드는 Python 개발자에게 적합하며, 특히 프레임워크 구조와 유지 관리성이 중요한 대규모 또는 장기 실행 스크레이핑 프로젝트에 잘 맞습니다.
- 카테고리
- 개발자 도구
- 언어
- Python
- 라이선스
- BSD-3-Clause
관련 프로젝트
Crawlee
Apache-2.0신뢰할 수 있는 크롤러를 만들기 위한 Node.js·TypeScript용 웹 스크레이핑·브라우저 자동화 라이브러리로, 봇 탐지를 회피하도록 설계되었습니다.
- 개발자 도구
Playwright
Apache-2.0현대적인 웹 앱을 위한 신뢰할 수 있는 엔드투엔드 테스트·브라우저 자동화 프레임워크입니다.
- 개발자 도구
- 테스팅
Backstage
Apache-2.0회사의 서비스, 인프라, 문서를 검색 가능한 하나의 소프트웨어 카탈로그로 통합해 내부 개발자 포털을 구축하는 오픈 프레임워크입니다.
- 개발자 도구
Buildpacks
Apache-2.0Cloud Native Buildpacks는 Dockerfile을 작성하지 않고도 애플리케이션 소스 코드에서 곧바로 프로덕션 준비가 된 컨테이너 이미지를 빌드합니다.
- 개발자 도구
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기