Saltar al contenido
FindOpenSource

Spark

Motor de analítica unificado para procesamiento de datos por lotes y en streaming a gran escala, uno de los frameworks de big data más adoptados.

Descripción general

Apache Spark procesa conjuntos de datos muy grandes en un clúster distribuido de máquinas, admitiendo procesamiento por lotes, streaming, consultas SQL y cargas de trabajo de machine learning a través de un único motor y API unificados, en varios lenguajes incluidos Python, Scala y Java. Ha sido el framework estándar de procesamiento de big data durante más de una década.

Spark encaja en equipos que ejecutan transformación de datos a gran escala, ETL o pipelines de machine learning en clústeres distribuidos, un motor más amplio y de propósito más general que los más especializados Flink (streaming en tiempo real) o Trino (SQL federado), también en este catálogo.

Categorías
Analítica
Palabras clave
big-databatch-processingstream-processingdistributed-computing
Lenguajes
Scala, Python, Java
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.