Buscar proyectos open source
59 proyectos encontrados para "pipeline de datos"
SeaTunnel
Apache-2.0Plataforma de integración de datos distribuida para mover y transformar datos entre bases de datos, data lakes y sistemas de mensajería a gran escala.
- Backend
Kestra
Apache-2.0Plataforma de orquestación declarativa basada en YAML para programar y orquestar pipelines de datos, trabajos ETL y workflows de negocio.
- Automatización
Prefect
Apache-2.0Plataforma de orquestación de workflows nativa de Python para construir, programar y monitorizar pipelines de datos con código Python normal.
- Automatización
Beam
Apache-2.0Modelo de programación unificado para definir pipelines de procesamiento de datos por lotes y en streaming que pueden ejecutarse de forma portable en múltiples motores de ejecución.
- Analítica
Vector
MPL-2.0Pipeline de datos de observabilidad de alto rendimiento para recolectar, transformar y enrutar logs, métricas y trazas.
- Monitorización
Argo Workflows
Apache-2.0Motor de workflows nativo de Kubernetes que ejecuta cada paso de un pipeline como un contenedor, orquestando trabajos en paralelo y DAGs de varios pasos directamente en un clúster.
- Automatización
Jenkins
MITServidor de automatización de código abierto ampliamente utilizado, con un gran ecosistema de plugins para construir pipelines de CI/CD y automatizar la entrega de software.
- DevOps
Kubeflow
Apache-2.0Plataforma de machine learning para Kubernetes que agrupa pipelines, entrenamiento de modelos, ajuste de hiperparámetros y servicio en un solo kit de herramientas.
- IA y Machine Learning
Sensu
MITPipeline de monitorización y observabilidad basado en eventos que da a los equipos control total sobre cómo se procesan y enrutan los eventos de monitorización.
- Monitorización
Spinnaker
Apache-2.0Plataforma de entrega continua multi-cloud, construida originalmente en Netflix para desplegar aplicaciones de forma fiable entre muchos proveedores de nube y regiones.
- DevOps
Tekton
Apache-2.0Componentes nativos de Kubernetes para crear pipelines de CI/CD, ofreciendo a los equipos una forma estándar y portable de definir pipelines como recursos de Kubernetes.
- DevOps
Woodpecker CI
Apache-2.0Motor de CI/CD sencillo y nativo de contenedores, ampliable mediante plugins, diseñado para ejecutar pipelines con una huella ligera de servidor y agente.
- DevOps
Apache Kafka
Apache-2.0Plataforma distribuida de streaming de eventos que almacena los datos como un log duradero y reproducible, pensada para pipelines de alto rendimiento en tiempo real y no para colas punto a punto tradicionales.
- Backend
Docling
MITBiblioteca de análisis de documentos que convierte PDFs, documentos de Word y otros formatos en datos limpios y estructurados listos para pipelines de LLM y RAG.
- IA y Machine Learning
Alluxio
Apache-2.0Capa de orquestación de datos situada entre los motores de cómputo y los sistemas de almacenamiento, que cachea datos para un acceso más rápido y unificado entre ambos.
- Almacenamiento
Appwrite
BSD-3-ClausePlataforma backend de código abierto que ofrece autenticación, bases de datos, almacenamiento, funciones y APIs en tiempo real, autoalojada o como servicio en la nube gestionado.
- Backend
- Base de datos
- Autenticación y seguridad
Cassandra
Apache-2.0Base de datos NoSQL de columnas anchas y distribuida, diseñada para escala masiva y cero puntos únicos de fallo entre múltiples centros de datos.
- Base de datos
ClickHouse
Apache-2.0Base de datos orientada a columnas construida para consultas analíticas en tiempo real sobre conjuntos de datos masivos, generando informes agregados en milisegundos y no en segundos o minutos.
- Analítica
CloudEvents
Apache-2.0Especificación de la CNCF y colección de SDKs para describir datos de eventos en un formato común y neutral respecto al proveedor entre sistemas y plataformas.
- Backend
Crossplane
Apache-2.0Plano de control nativo de Kubernetes que te permite aprovisionar y gestionar infraestructura cloud —bases de datos, redes, almacenamiento— usando APIs de Kubernetes.
- DevOps
CubeFS
Apache-2.0Sistema de archivos distribuido y de almacenamiento de objetos construido para aplicaciones cloud-native de datos intensivos a gran escala.
- Almacenamiento
Directus
BUSL-1.1Plataforma de datos de código abierto que envuelve cualquier base de datos SQL con una API dinámica y una app de administración intuitiva.
- CMS
- Backend
- API
Druid
Apache-2.0Base de datos de analítica en tiempo real construida para consultas de menos de un segundo sobre datos de eventos históricos y en streaming continuo a gran escala.
- Analítica
Elasticsearch
AGPL-3.0Motor distribuido de búsqueda y analítica para todo tipo de datos, incluidos texto, numéricos y geoespaciales.
- Búsqueda
Envoy
Apache-2.0Proxy de alto rendimiento construido para aplicaciones cloud-native, que actúa como plano de datos fundamental para muchos service mesh y API gateways modernos.
- DevOps
Flink
Apache-2.0Motor de procesamiento de streams distribuido para calcular sobre flujos de datos continuos e ilimitados con garantías de exactitud exactly-once.
- Analítica
Fluentd
Apache-2.0Recolector de logs graduado por la CNCF que unifica la recolección de datos de muchas fuentes en una única capa de logging estructurada.
- Monitorización
Hasura
Apache-2.0APIs GraphQL y REST instantáneas sobre PostgreSQL y otras bases de datos, mediante Data Connectors.
- Backend
- API
- Base de datos
InfluxDB
MITBase de datos de series temporales construida específicamente para métricas, eventos y analítica en tiempo real con altos volúmenes de escritura.
- Monitorización
Instructor
MITBiblioteca para obtener salidas de datos estructurados y fiables de LLMs usando APIs de function calling y modelos Pydantic para la validación.
- IA y Machine Learning
JuiceFS
Apache-2.0Sistema de archivos POSIX distribuido que almacena los datos en almacenamiento de objetos como S3, combinando la semántica habitual de un sistema de archivos con almacenamiento a escala cloud.
- Almacenamiento
JupyterLab
BSD-3-ClauseEl entorno de computación interactiva estándar basado en web para notebooks, código y datos, muy usado en ciencia de datos e investigación.
- Herramientas para desarrolladores
Keploy
Apache-2.0Herramienta de pruebas de API centrada en el desarrollador que graba tráfico real de API y bases de datos con eBPF y lo convierte automáticamente en casos de prueba y mocks de datos, sin cambios en el código.
- Testing
LlamaIndex
MITFramework de datos para conectar grandes modelos de lenguaje con tus propios datos —documentos, bases de datos, APIs— para aplicaciones de generación aumentada por recuperación.
- IA y Machine Learning
M3
Apache-2.0Base de datos de series temporales distribuida y horizontalmente escalable, construida en Uber para monitorización a muy gran escala.
- Monitorización
Matomo
GPL-3.0Plataforma de analítica web de código abierto que te da control y propiedad total sobre los datos de tus visitantes.
- Analítica
Milvus
Apache-2.0Base de datos vectorial de código abierto construida para búsqueda de similitud escalable y aplicaciones de IA.
- IA y Machine Learning
- Base de datos
MongoDB
SSPL-1.0Base de datos NoSQL orientada a documentos, diseñada para la escalabilidad y la flexibilidad del desarrollador.
- Base de datos
Neo4j
GPL-3.0Base de datos de grafos nativa que almacena y consulta datos como nodos y relaciones, construida específicamente para problemas de datos conectados.
- Base de datos
Open Policy Agent (OPA)
Apache-2.0Motor de políticas de propósito general, graduado por la CNCF, para aplicar como código reglas de autorización, cumplimiento y configuración en microservicios, APIs, Kubernetes y pipelines de CI.
- DevOps
OpenTelemetry Collector
Apache-2.0Pipeline neutral respecto al proveedor para recopilar, procesar y exportar trazas, métricas y logs de aplicaciones hacia cualquier backend de observabilidad.
- Monitorización
Perses
Apache-2.0Herramienta de dashboards de la CNCF para visualizar datos de observabilidad, construida en torno a definiciones de dashboard portables y versionables.
- Monitorización
PocketBase
MITBackend de código abierto que incluye una base de datos SQLite embebida, autenticación, almacenamiento de archivos y una API en tiempo real, todo en un único ejecutable.
- Backend
- Base de datos
PostgreSQL
PostgreSQL LicensePotente sistema de base de datos objeto-relacional de código abierto, con más de 35 años de desarrollo activo.
- Base de datos
PostgREST
MITServidor web independiente que convierte directamente cualquier base de datos PostgreSQL en una API RESTful.
- API
- Backend
Prometheus
Apache-2.0Kit de herramientas de código abierto para monitorización de sistemas y alertas, con un modelo de datos dimensional y un potente lenguaje de consulta.
- Monitorización
Qdrant
Apache-2.0Base de datos vectorial y motor de búsqueda de similitud para construir aplicaciones de IA con embeddings.
- IA y Machine Learning
- Base de datos
Quickwit
Apache-2.0Motor de búsqueda nativo de la nube diseñado específicamente para datos de observabilidad, que indexa logs y trazas directamente en almacenamiento de objetos para una búsqueda rentable a gran escala.
- Búsqueda
Redis
AGPL-3.0Almacén de estructuras de datos en memoria usado como base de datos, caché, bróker de mensajes y motor de streaming.
- Base de datos
- Almacenamiento
Scrapy
BSD-3-ClauseFramework de Python rápido y de alto nivel para web scraping y crawling, orientado a extraer datos estructurados de sitios web.
- Herramientas para desarrolladores
secureCodeBox
Apache-2.0Plataforma de orquestación de pruebas de seguridad que ejecuta varios escáneres de código abierto contra tus aplicaciones e infraestructura desde un único pipeline.
- Testing
Spark
Apache-2.0Motor de analítica unificado para procesamiento de datos por lotes y en streaming a gran escala, uno de los frameworks de big data más adoptados.
- Analítica
Supabase
Apache-2.0Alternativa open source a Firebase que ofrece una base de datos Postgres, autenticación, APIs instantáneas, funciones edge, suscripciones en tiempo real y almacenamiento.
- Backend
- Base de datos
- Autenticación y seguridad
TiDB
Apache-2.0Base de datos SQL distribuida y compatible con MySQL que escala horizontalmente mientras admite tanto cargas de trabajo transaccionales como analíticas.
- Base de datos
Trino
Apache-2.0Motor de consultas SQL distribuido que te permite ejecutar consultas federadas entre múltiples fuentes de datos —bases de datos, data lakes y más— desde un solo lugar.
- Analítica
Valkey
BSD-3-ClauseAlmacén de datos en memoria y fork liderado por la comunidad de Redis, creado tras el cambio de licencia de Redis en 2024 que lo alejó de una licencia de código abierto.
- Base de datos
Velero
Apache-2.0Herramienta de copia de seguridad, restauración y migración para clústeres de Kubernetes, que protege tanto los recursos del clúster como los datos de volúmenes persistentes ante pérdidas, o te permite mover cargas de trabajo entre clústeres.
- Almacenamiento
XGBoost
Apache-2.0Biblioteca de gradient boosting optimizada y distribuida, muy usada para problemas de datos estructurados/tabulares, un pilar del machine learning aplicado.
- IA y Machine Learning
Zabbix
AGPL-3.0Plataforma de monitorización de infraestructura y red de nivel empresarial con alertas, autodescubrimiento y almacenamiento de datos a largo plazo integrados.
- Monitorización