Beam
Modelo de programación unificado para definir pipelines de procesamiento de datos por lotes y en streaming que pueden ejecutarse de forma portable en múltiples motores de ejecución.
Descripción general
Apache Beam permite a un equipo escribir un pipeline de datos una sola vez usando su API unificada de lotes/streaming, y luego ejecutar ese mismo pipeline en distintos motores de ejecución subyacentes —incluidos Flink y Spark, también en este catálogo— sin reescribirlo para cada uno. Esto evita atar la lógica de un pipeline a un motor de procesamiento específico.
Beam encaja en equipos que quieren portabilidad de pipelines entre motores de ejecución, o que construyen sobre Google Cloud Dataflow (que usa Beam como su modelo de programación), una capa distinta de Flink o Spark en sí, que son los motores sobre los que realmente se ejecutan los pipelines de Beam.
- Categorías
- Analítica
- Lenguajes
- Java, Python, Go
- Licencia
- Apache-2.0
Proyectos relacionados
Spark
Apache-2.0Motor de analítica unificado para procesamiento de datos por lotes y en streaming a gran escala, uno de los frameworks de big data más adoptados.
- Analítica
Flink
Apache-2.0Motor de procesamiento de streams distribuido para calcular sobre flujos de datos continuos e ilimitados con garantías de exactitud exactly-once.
- Analítica
ClickHouse
Apache-2.0Base de datos orientada a columnas construida para consultas analíticas en tiempo real sobre conjuntos de datos masivos, generando informes agregados en milisegundos y no en segundos o minutos.
- Analítica
Druid
Apache-2.0Base de datos de analítica en tiempo real construida para consultas de menos de un segundo sobre datos de eventos históricos y en streaming continuo a gran escala.
- Analítica
¿Encontraste un error? Sugiere una edición en GitHub.