コンテンツへスキップ
FindOpenSource

Spark

大規模なバッチ・ストリームデータ処理のための統合分析エンジンで、最も広く採用されているビッグデータフレームワークの1つです。

概要

Apache Spark は、分散したマシンのクラスタ全体で非常に大規模なデータセットを処理し、Python、Scala、Java など複数の言語で、バッチ処理、ストリーミング、SQL クエリ、機械学習ワークロードを1つの統合されたエンジンと API を通じてサポートします。10年以上にわたり、標準的なビッグデータ処理フレームワークであり続けています。

Spark は、分散クラスタ全体で大規模なデータ変換、ETL、機械学習パイプラインを実行するチームに向いています。カタログにあるより専門特化した Flink(リアルタイムストリーミング) や Trino(連合 SQL) よりも、より幅広く汎用的なエンジンです。

カテゴリ
アナリティクス
キーワード
big-databatch-processingstream-processingdistributed-computing
言語
Scala, Python, Java
ライセンス
Apache-2.0

誤りを見つけましたか? GitHub で修正を提案する