Spark
统一的大数据分析引擎,用于大规模批处理和流处理,是应用最广泛的大数据框架之一。
概述
Apache Spark 通过一个统一的引擎和 API(支持 Python、Scala、Java 等多种语言),跨分布式机器集群处理超大规模数据集,涵盖批处理、流处理、SQL 查询和机器学习工作负载。十多年来它一直是标准的大数据处理框架。
Spark 适合那些在分布式集群上运行大规模数据转换、ETL 或机器学习流水线的团队,相比目录中更专注的 Flink(实时流处理)或 Trino(联合 SQL 查询),它是一个覆盖范围更广、更通用的引擎。
- 分类
- 分析
- 编程语言
- Scala, Python, Java
- 许可证
- Apache-2.0
广告
相关项目
发现信息有误?在 GitHub 上提出修改建议。