Spark
Einheitliche Analytics-Engine für Batch- und Stream-Datenverarbeitung im großen Maßstab, eines der am weitesten verbreiteten Big-Data-Frameworks.
Überblick
Apache Spark verarbeitet sehr große Datensätze über einen verteilten Cluster aus Maschinen und unterstützt Batch-Verarbeitung, Streaming, SQL-Abfragen und Machine-Learning-Workloads durch eine einzige einheitliche Engine und API in mehreren Sprachen, darunter Python, Scala und Java. Es ist seit über einem Jahrzehnt das Standard-Framework für Big-Data-Verarbeitung.
Spark eignet sich für Teams, die großangelegte Datentransformation, ETL oder Machine-Learning-Pipelines über verteilte Cluster betreiben – eine breitere, allgemeinere Engine als die spezialisierteren Flink (Echtzeit-Streaming) oder Trino (föderiertes SQL), ebenfalls in diesem Katalog.
- Kategorien
- Analytics
- Sprachen
- Scala, Python, Java
- Lizenz
- Apache-2.0
Ähnliche Projekte
Beam
Apache-2.0Einheitliches Programmiermodell zum Definieren von Batch- und Stream-Datenverarbeitungspipelines, die portabel über mehrere Ausführungs-Engines hinweg laufen können.
- Analytics
Flink
Apache-2.0Verteilte Stream-Processing-Engine zur Berechnung über kontinuierliche, unbegrenzte Datenströme mit Exactly-once-Korrektheitsgarantien.
- Analytics
ClickHouse
Apache-2.0Spaltenorientierte Datenbank für Echtzeit-Analyseabfragen über riesige Datensätze, die aggregierte Berichte in Millisekunden statt Sekunden oder Minuten erzeugt.
- Analytics
Druid
Apache-2.0Echtzeit-Analytics-Datenbank für Abfragen unter einer Sekunde über kontinuierlich streamende und historische Ereignisdaten im großen Maßstab.
- Analytics
Einen Fehler entdeckt? Änderung auf GitHub vorschlagen.