Beam
여러 실행 엔진에 걸쳐 이식 가능하게 실행할 수 있는 배치·스트림 데이터 처리 파이프라인을 정의하기 위한 통합 프로그래밍 모델입니다.
개요
Apache Beam은 통합된 배치/스트림 API를 사용해 데이터 파이프라인을 한 번만 작성하면, (카탈로그에 있는) Flink와 Spark를 포함한 서로 다른 기반 실행 엔진에서 엔진마다 다시 작성하지 않고도 동일한 파이프라인을 실행할 수 있게 해줍니다. 이를 통해 파이프라인 로직이 특정 처리 엔진에 종속되는 것을 피할 수 있습니다.
Beam은 실행 엔진 간 파이프라인 이식성을 원하는 팀이나, (Beam을 프로그래밍 모델로 사용하는) Google Cloud Dataflow 위에 구축하는 팀에 적합합니다. Flink나 Spark 자체와는 다른 계층으로, 그것들은 Beam 파이프라인이 실제로 실행되는 엔진입니다.
- 카테고리
- 분석
- 언어
- Java, Python, Go
- 라이선스
- Apache-2.0
관련 프로젝트
Spark
Apache-2.0대규모 배치·스트림 데이터 처리를 위한 통합 분석 엔진으로, 가장 널리 채택된 빅데이터 프레임워크 중 하나입니다.
- 분석
Flink
Apache-2.0지속적이고 무한한 데이터 스트림에 대해 정확히 한 번(exactly-once) 처리를 보장하며 연산하는 분산 스트림 처리 엔진입니다.
- 분석
ClickHouse
Apache-2.0대규모 데이터셋에 대한 실시간 분석 쿼리를 위해 만들어진 컬럼형 데이터베이스로, 집계 리포트를 초 단위나 분 단위가 아니라 밀리초 단위로 생성합니다.
- 분석
Druid
Apache-2.0지속적으로 유입되는 스트리밍 데이터와 과거 이벤트 데이터에 대해 대규모로 1초 미만의 쿼리를 수행하도록 만들어진 실시간 분석 데이터베이스입니다.
- 분석
잘못된 정보를 발견하셨나요? GitHub에서 수정 제안하기