Beam
複数の実行エンジンにまたがってポータブルに実行できる、バッチ・ストリームデータ処理パイプラインを定義するための統一プログラミングモデルです。
概要
Apache Beam は、統一されたバッチ/ストリーム API を使ってデータパイプラインを一度だけ記述し、その同じパイプラインを(カタログにもある) Flink や Spark を含む異なる基盤の実行エンジン上で、エンジンごとに書き直すことなく実行できるようにします。これにより、パイプラインのロジックが特定の処理エンジンに縛られることを避けられます。
Beam は、実行エンジンをまたいだパイプラインの移植性を求めるチームや、(Beam をプログラミングモデルとして使用する) Google Cloud Dataflow 上に構築しているチームに向いています。Flink や Spark 自体とは異なるレイヤーで、それらは Beam のパイプラインが実際に実行されるエンジンです。
- カテゴリ
- アナリティクス
- 言語
- Java, Python, Go
- ライセンス
- Apache-2.0
広告
関連プロジェクト
Spark
Apache-2.0大規模なバッチ・ストリームデータ処理のための統合分析エンジンで、最も広く採用されているビッグデータフレームワークの1つです。
- アナリティクス
Flink
Apache-2.0継続的で無限のデータストリームに対して、Exactly-once の正確性保証のもとで計算を行う、分散型ストリーム処理エンジンです。
- アナリティクス
ClickHouse
Apache-2.0大量のデータセットに対するリアルタイムな分析クエリのために構築された列指向データベースで、集計レポートを秒単位や分単位ではなくミリ秒単位で生成します。
- アナリティクス
Druid
Apache-2.0継続的にストリーミングされる、および過去のイベントデータに対して、サブ秒単位のクエリを大規模に実行するために構築された、リアルタイム分析データベースです。
- アナリティクス
誤りを見つけましたか? GitHub で修正を提案する