Spark
대규모 배치·스트림 데이터 처리를 위한 통합 분석 엔진으로, 가장 널리 채택된 빅데이터 프레임워크 중 하나입니다.
개요
Apache Spark는 분산된 머신 클러스터 전반에서 매우 큰 데이터셋을 처리하며, Python, Scala, Java 등 여러 언어로 배치 처리, 스트리밍, SQL 쿼리, 머신러닝 워크로드를 하나의 통합 엔진과 API로 지원합니다. 10년 넘게 표준 빅데이터 처리 프레임워크로 자리 잡아왔습니다.
Spark는 분산 클러스터 전반에서 대규모 데이터 변환, ETL, 머신러닝 파이프라인을 운영하는 팀에 적합하며, 카탈로그에 있는 더 전문화된 Flink(실시간 스트리밍)나 Trino(연합 SQL)보다 더 폭넓고 범용적인 엔진입니다.
- 카테고리
- 분석
- 언어
- Scala, Python, Java
- 라이선스
- Apache-2.0
광고
관련 프로젝트
Beam
Apache-2.0여러 실행 엔진에 걸쳐 이식 가능하게 실행할 수 있는 배치·스트림 데이터 처리 파이프라인을 정의하기 위한 통합 프로그래밍 모델입니다.
- 분석
Flink
Apache-2.0지속적이고 무한한 데이터 스트림에 대해 정확히 한 번(exactly-once) 처리를 보장하며 연산하는 분산 스트림 처리 엔진입니다.
- 분석
ClickHouse
Apache-2.0대규모 데이터셋에 대한 실시간 분석 쿼리를 위해 만들어진 컬럼형 데이터베이스로, 집계 리포트를 초 단위나 분 단위가 아니라 밀리초 단위로 생성합니다.
- 분석
Druid
Apache-2.0지속적으로 유입되는 스트리밍 데이터와 과거 이벤트 데이터에 대해 대규모로 1초 미만의 쿼리를 수행하도록 만들어진 실시간 분석 데이터베이스입니다.
- 분석
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기