Zum Inhalt springen
FindOpenSource

Spark

Einheitliche Analytics-Engine für Batch- und Stream-Datenverarbeitung im großen Maßstab, eines der am weitesten verbreiteten Big-Data-Frameworks.

Überblick

Apache Spark verarbeitet sehr große Datensätze über einen verteilten Cluster aus Maschinen und unterstützt Batch-Verarbeitung, Streaming, SQL-Abfragen und Machine-Learning-Workloads durch eine einzige einheitliche Engine und API in mehreren Sprachen, darunter Python, Scala und Java. Es ist seit über einem Jahrzehnt das Standard-Framework für Big-Data-Verarbeitung.

Spark eignet sich für Teams, die großangelegte Datentransformation, ETL oder Machine-Learning-Pipelines über verteilte Cluster betreiben – eine breitere, allgemeinere Engine als die spezialisierteren Flink (Echtzeit-Streaming) oder Trino (föderiertes SQL), ebenfalls in diesem Katalog.

Kategorien
Analytics
Schlagwörter
big-databatch-processingstream-processingdistributed-computing
Sprachen
Scala, Python, Java
Lizenz
Apache-2.0

Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.