由于 trendforge.devlive.top 访问受限,请切换到 trendforge.devlive.org 域名
项目介绍
暂无项目描述
使用场景
最适合需要显著提升Spark SQL性能但不想重构现有代码的场景。
加速Spark SQL查询
Spark SQL在处理复杂分析查询时性能遇到瓶颈,特别是涉及大量数据扫描和聚合操作时速度较慢。
使用Gluten将Spark SQL的执行卸载到ClickHouse或Velox原生引擎,利用其向量化执行和列式存储优势,显著提升查询性能。
一个电商数据分析平台,每天需要处理TB级的用户行为日志进行漏斗分析,使用Gluten后查询速度提升3-5倍。
混合技术栈集成
企业已有基于ClickHouse的实时分析系统,但需要与Spark的批处理和数据湖能力集成,避免数据重复和架构复杂。
通过Gluten作为中间层,在Spark中直接调用ClickHouse引擎执行SQL,统一使用Spark API同时获得ClickHouse的高性能。
金融风控系统需要同时处理实时交易流(ClickHouse)和历史数据挖掘(Spark),使用Gluten实现统一查询接口。
降低Spark资源成本
Spark集群CPU和内存资源消耗大,特别是在处理高并发查询时JVM开销显著,硬件成本高昂。
利用原生引擎(如Velox)的高效内存管理和SIMD指令集,在相同硬件配置下处理更多查询,减少集群规模。
一个SaaS平台需要为多个租户提供即席查询服务,使用Gluten后单台服务器支持的并发查询数提升2倍。
无缝性能升级
现有Spark应用代码复杂,重构成本高,但需要获得新一代查询引擎的性能优势。
只需在Spark配置中启用Gluten插件,无需修改现有DataFrame或SQL代码,即可透明地获得原生引擎加速。
一个已上线的数据仓库应用,通过添加spark.gluten.enabled=true配置,查询性能平均提升40%以上。
项目健康度
从未记录更新时间
平台 Star TOP 100% · Forks 0
本周 +7 ⭐ · 本月 +19 ⭐
173 位贡献者 · 0 条平台评论
缺少 2 项内容
2 项改进建议
- 活跃度:暂无最后推送时间记录,建议重新采集仓库元数据
- 人气:项目在平台内知名度较低,持续更新有助于提升曝光
项目信息
赞赏支持
如果本站对你有帮助,欢迎打赏支持
微信
支付宝
Widget 徽章
相关项目推荐
twitter/the-algorithm
X 推荐算法源代码
apache/spark
Apache Spark——面向大规模数据处理的统一分析引擎
lichess-org/lila
♞ lichess.org:永久免费、无广告、开源的国际象棋服务器 ♞
scala/scala
Scala 2编译器与标准库。Scala 2错误报告请提交至https://github.com/scala/bug;Scala 3项目位于https://github.com/scala/scala3
akka/akka-core
一个用于构建和运行具备弹性、敏捷性和韧性应用的平台。提供软件开发工具包、程序库及托管环境。
playframework/playframework
社区维护的Java与Scala高性能Web框架。
加载评论中...