본문으로 건너뛰기
FindOpenSource

Crawlee

신뢰할 수 있는 크롤러를 만들기 위한 Node.js·TypeScript용 웹 스크레이핑·브라우저 자동화 라이브러리로, 봇 탐지를 회피하도록 설계되었습니다.

개요

Crawlee는 최소한의 추가 설정으로 신뢰할 수 있는 크롤러를 구축하는 것을 목표로 하는, Node.js와 TypeScript용 웹 스크레이핑·브라우저 자동화 라이브러리입니다. 크롤러가 기본적으로 더 사람처럼 동작하도록 설계되어 있어 일반적인 봇 탐지 시스템을 트리거하지 않는 데 도움이 되며, 동시에 링크를 따라 크롤링하고 데이터를 스크레이핑하고 결과를 디스크나 클라우드에 저장할 수 있는 도구를 제공합니다.

크롤러가 원시 HTTP 요청이 아니라 실제 브라우저가 필요한 경우, (이 카탈로그의 다른 프로젝트에서도 브라우저 자동화에 사용되는) Playwright를 선택적 의존성으로 통합할 수 있습니다. 또한 이 npm 패키지가 대상으로 하는 JavaScript/TypeScript 생태계가 아니라 Python으로 작업하는 팀을 위한 별도의 Crawlee for Python 패키지도 있습니다.

Crawlee는 LLM이나 RAG 파이프라인에 데이터를 공급하는 용도를 포함해 스크레이퍼나 데이터 추출 파이프라인을 구축하는 JavaScript/TypeScript 팀에 적합하며, 기본 제공되는 안티 디텍션 설정을 갖춘 유지 관리되는 라이브러리를 원하는 경우에 잘 맞습니다. 카탈로그의 Scrapy 같은 Python 중심 도구를 대체하는 것이 아니라 보완합니다.

카테고리
개발자 도구
키워드
web-scrapingcrawlerbrowser-automationdata-extractionjavascript
언어
TypeScript
라이선스
Apache-2.0

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기