Spark
Motor de analítica unificado para procesamiento de datos por lotes y en streaming a gran escala, uno de los frameworks de big data más adoptados.
Descripción general
Apache Spark procesa conjuntos de datos muy grandes en un clúster distribuido de máquinas, admitiendo procesamiento por lotes, streaming, consultas SQL y cargas de trabajo de machine learning a través de un único motor y API unificados, en varios lenguajes incluidos Python, Scala y Java. Ha sido el framework estándar de procesamiento de big data durante más de una década.
Spark encaja en equipos que ejecutan transformación de datos a gran escala, ETL o pipelines de machine learning en clústeres distribuidos, un motor más amplio y de propósito más general que los más especializados Flink (streaming en tiempo real) o Trino (SQL federado), también en este catálogo.
- Categorías
- Analítica
- Lenguajes
- Scala, Python, Java
- Licencia
- Apache-2.0
Proyectos relacionados
Beam
Apache-2.0Modelo de programación unificado para definir pipelines de procesamiento de datos por lotes y en streaming que pueden ejecutarse de forma portable en múltiples motores de ejecución.
- Analítica
Flink
Apache-2.0Motor de procesamiento de streams distribuido para calcular sobre flujos de datos continuos e ilimitados con garantías de exactitud exactly-once.
- Analítica
ClickHouse
Apache-2.0Base de datos orientada a columnas construida para consultas analíticas en tiempo real sobre conjuntos de datos masivos, generando informes agregados en milisegundos y no en segundos o minutos.
- Analítica
Druid
Apache-2.0Base de datos de analítica en tiempo real construida para consultas de menos de un segundo sobre datos de eventos históricos y en streaming continuo a gran escala.
- Analítica
¿Encontraste un error? Sugiere una edición en GitHub.