跳至内容
FindOpenSource

Spark

统一的大数据分析引擎,用于大规模批处理和流处理,是应用最广泛的大数据框架之一。

概述

Apache Spark 通过一个统一的引擎和 API(支持 Python、Scala、Java 等多种语言),跨分布式机器集群处理超大规模数据集,涵盖批处理、流处理、SQL 查询和机器学习工作负载。十多年来它一直是标准的大数据处理框架。

Spark 适合那些在分布式集群上运行大规模数据转换、ETL 或机器学习流水线的团队,相比目录中更专注的 Flink(实时流处理)或 Trino(联合 SQL 查询),它是一个覆盖范围更广、更通用的引擎。

分类
分析
关键词
big-databatch-processingstream-processingdistributed-computing
编程语言
Scala, Python, Java
许可证
Apache-2.0

发现信息有误?在 GitHub 上提出修改建议