Zum Inhalt springen
FindOpenSource

Beam

Einheitliches Programmiermodell zum Definieren von Batch- und Stream-Datenverarbeitungspipelines, die portabel über mehrere Ausführungs-Engines hinweg laufen können.

Überblick

Apache Beam lässt ein Team eine Datenpipeline einmal mit seiner einheitlichen Batch/Stream-API schreiben und dieselbe Pipeline dann auf verschiedenen zugrunde liegenden Ausführungs-Engines laufen lassen – einschließlich Flink und Spark (ebenfalls in diesem Katalog) –, ohne sie für jede neu zu schreiben. Das verhindert, dass die Logik einer Pipeline an eine bestimmte Verarbeitungs-Engine gebunden wird.

Beam eignet sich für Teams, die Pipeline-Portabilität über Ausführungs-Engines hinweg wollen, oder die auf Google Cloud Dataflow aufbauen (das Beam als Programmiermodell nutzt) – eine andere Schicht als Flink oder Spark selbst, die die Engines sind, auf denen Beam-Pipelines tatsächlich laufen.

Kategorien
Analytics
Schlagwörter
data-pipelinebatch-processingstream-processingportable-pipelines
Sprachen
Java, Python, Go
Lizenz
Apache-2.0

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.