본문으로 건너뛰기
FindOpenSource

Spark

대규모 배치·스트림 데이터 처리를 위한 통합 분석 엔진으로, 가장 널리 채택된 빅데이터 프레임워크 중 하나입니다.

개요

Apache Spark는 분산된 머신 클러스터 전반에서 매우 큰 데이터셋을 처리하며, Python, Scala, Java 등 여러 언어로 배치 처리, 스트리밍, SQL 쿼리, 머신러닝 워크로드를 하나의 통합 엔진과 API로 지원합니다. 10년 넘게 표준 빅데이터 처리 프레임워크로 자리 잡아왔습니다.

Spark는 분산 클러스터 전반에서 대규모 데이터 변환, ETL, 머신러닝 파이프라인을 운영하는 팀에 적합하며, 카탈로그에 있는 더 전문화된 Flink(실시간 스트리밍)나 Trino(연합 SQL)보다 더 폭넓고 범용적인 엔진입니다.

카테고리
분석
키워드
big-databatch-processingstream-processingdistributed-computing
언어
Scala, Python, Java
라이선스
Apache-2.0

잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기