Saltar al contenido
FindOpenSource

Beam

Modelo de programación unificado para definir pipelines de procesamiento de datos por lotes y en streaming que pueden ejecutarse de forma portable en múltiples motores de ejecución.

Descripción general

Apache Beam permite a un equipo escribir un pipeline de datos una sola vez usando su API unificada de lotes/streaming, y luego ejecutar ese mismo pipeline en distintos motores de ejecución subyacentes —incluidos Flink y Spark, también en este catálogo— sin reescribirlo para cada uno. Esto evita atar la lógica de un pipeline a un motor de procesamiento específico.

Beam encaja en equipos que quieren portabilidad de pipelines entre motores de ejecución, o que construyen sobre Google Cloud Dataflow (que usa Beam como su modelo de programación), una capa distinta de Flink o Spark en sí, que son los motores sobre los que realmente se ejecutan los pipelines de Beam.

Categorías
Analítica
Palabras clave
data-pipelinebatch-processingstream-processingportable-pipelines
Lenguajes
Java, Python, Go
Licencia
Apache-2.0

¿Encontraste un error? Sugiere una edición en GitHub.