コンテンツへスキップ
FindOpenSource

Beam

複数の実行エンジンにまたがってポータブルに実行できる、バッチ・ストリームデータ処理パイプラインを定義するための統一プログラミングモデルです。

概要

Apache Beam は、統一されたバッチ/ストリーム API を使ってデータパイプラインを一度だけ記述し、その同じパイプラインを(カタログにもある) Flink や Spark を含む異なる基盤の実行エンジン上で、エンジンごとに書き直すことなく実行できるようにします。これにより、パイプラインのロジックが特定の処理エンジンに縛られることを避けられます。

Beam は、実行エンジンをまたいだパイプラインの移植性を求めるチームや、(Beam をプログラミングモデルとして使用する) Google Cloud Dataflow 上に構築しているチームに向いています。Flink や Spark 自体とは異なるレイヤーで、それらは Beam のパイプラインが実際に実行されるエンジンです。

カテゴリ
アナリティクス
キーワード
data-pipelinebatch-processingstream-processingportable-pipelines
言語
Java, Python, Go
ライセンス
Apache-2.0

誤りを見つけましたか? GitHub で修正を提案する