
Apache Gluten架构全景图Substrait如何桥接JVM与原生引擎的底层原理【免费下载链接】glutenGluten is a middle layer responsible for offloading JVM-based SQL engines execution to native engines.项目地址: https://gitcode.com/GitHub_Trending/glu/glutenApache Gluten是一个强大的中间层框架旨在将基于JVM的SQL引擎如Spark的执行流程卸载到原生引擎如ClickHouse、Velox从而显著提升大数据处理性能。其核心创新在于通过Substrait协议作为统一的执行计划表示层实现了JVM与原生引擎之间的高效通信与协作。本文将深入解析Gluten的架构设计重点探讨Substrait如何作为关键桥梁连接JVM生态与原生执行引擎以及这一技术路径带来的性能突破。为什么需要GlutenJVM与原生引擎的性能鸿沟在大数据处理领域JVM生态如Spark、Flink凭借其易用性和丰富的生态系统占据主导地位但在计算密集型场景下JVM的内存管理开销和垃圾回收机制往往成为性能瓶颈。原生引擎C/Rust实现则在计算效率和内存利用上具有天然优势但缺乏JVM生态的灵活性和易用性。Gluten的出现正是为了弥合这一鸿沟保留JVM生态优势继续使用Spark等熟悉的API和生态系统原生执行加速将核心计算逻辑卸载到ClickHouse/Velox等原生引擎零成本迁移用户无需修改现有代码即可享受性能提升图1Gluten执行流程示意图展示了数据从Parquet读取到聚合计算的全过程突出了Transformer和Columnar Shuffle等核心组件的作用Gluten核心架构三层协同设计Gluten采用清晰的分层架构确保各组件解耦且高效协作1. 执行计划转换层核心功能将Spark的逻辑计划转换为Substrait协议表示关键组件SubstraitContextgluten-substrait/src/main/scala/org/apache/gluten/substrait/SubstraitContext.scala负责管理转换过程中的上下文信息技术亮点通过RelBuildergluten-substrait/src/main/java/org/apache/gluten/substrait/rel/RelBuilder.java构建Substrait计划支持多种关系代数操作2. 原生执行引擎层多引擎支持可插拔设计目前支持ClickHouse和Velox后端ClickHouse集成通过CHBackendbackends-clickhouse/src/main/scala/org/apache/gluten/backendsapi/clickhouse/CHBackend.scala实现深度集成Velox集成通过VeloxBackendbackends-velox/src/main/scala/org/apache/gluten/backendsapi/velox/VeloxBackend.scala提供高性能内存计算3. 数据交互层列存优化采用Arrow内存格式实现零拷贝数据传输shuffle优化通过ColumnarShufflebackends-velox/src/main/scala/org/apache/gluten/execution/HashJoinExecTransformer.scala实现高效数据交换内存管理统一的内存池管理避免JVM与原生引擎间的内存浪费图2Gluten操作符层次结构展示了SubstraitTransformerSupport如何作为基础衍生出各种具体的执行节点转换器Substrait协议打破引擎壁垒的通用语言什么是SubstraitSubstrait是一个跨引擎的查询计划表示协议旨在解决不同SQL引擎间执行计划不兼容的问题。它定义了关系代数操作的标准化表示数据类型系统和函数签名序列化格式基于Protobuf在Gluten中Substrait扮演着翻译官的角色将Spark的逻辑计划转换为原生引擎可理解的执行计划。Substrait在Gluten中的实现路径Gluten通过以下关键组件实现Substrait的转换与执行计划转换SubstraitTransformergluten-substrait/src/main/scala/org/apache/gluten/execution/WholeStageTransformer.scala负责将Spark计划转换为Substrait计划ExpressionTransformergluten-substrait/src/main/scala/org/apache/gluten/expression/ExpressionTransformer.scala处理表达式级别的转换原生执行Velox后端通过SubstraitToVeloxPlanConvertercpp/velox/substrait/SubstraitToVeloxPlan.h将Substrait计划转换为Velox可执行计划ClickHouse后端通过CHExpressionTransformerbackends-clickhouse/src/main/scala/org/apache/gluten/expression/CHExpressionTransformer.scala实现表达式转换类型系统映射VeloxSubstraitSignaturecpp/velox/substrait/VeloxSubstraitSignature.h处理数据类型的映射ConverterUtilsgluten-substrait/src/main/scala/org/apache/gluten/expression/ConverterUtils.scala提供类型转换工具函数Substrait上下文管理SubstraitContext是Gluten中管理计划转换的核心类它维护了Spark操作符ID与Substrait关系ID的映射函数注册与解析信息类型转换上下文通过new SubstraitContext()创建上下文实例后即可开始计划转换流程val context new SubstraitContext() val transformContext transformer.doTransform(context)深入核心Substrait计划的生命周期一个Substrait计划在Gluten中的典型生命周期包括1. 计划生成Spark Catalyst优化器生成逻辑计划WholeStageTransformer将逻辑计划转换为Substrait计划关键代码gluten-substrait/src/main/scala/org/apache/gluten/execution/WholeStageTransformer.scala2. 计划序列化Substrait计划序列化为Protobuf格式通过JNI传递给原生引擎关键代码gluten-substrait/src/main/java/org/apache/gluten/substrait/plan/PlanBuilder.java3. 原生执行原生引擎解析Substrait计划生成物理执行计划并执行关键代码Veloxcpp/velox/substrait/SubstraitToVeloxPlan.cc4. 结果返回执行结果通过Arrow格式返回JVMSpark将Arrow格式转换为内部Row格式关键代码gluten-arrow/src/main/java/org/apache/gluten/vectorized/PlanEvaluatorJniWrapper.java图3Gluten ClickHouse后端架构展示了Spark通过Substrait计划与ClickHouse原生引擎的交互流程性能优化Substrait带来的技术红利1. 减少数据序列化开销采用Arrow内存格式实现JVM与原生引擎间的零拷贝数据传输避免传统Spark中Java对象与字节数组间的频繁转换2. 下推计算优化通过Substrait计划将过滤、投影等操作下推到原生引擎减少数据传输量充分利用原生引擎的向量化执行能力3. 统一函数库SubstraitParsercpp/velox/substrait/SubstraitParser.h实现函数签名的统一映射避免因函数实现差异导致的执行计划不兼容4. 执行计划缓存SubstraitContext支持计划缓存避免重复转换开销特别适合迭代式机器学习和交互式查询场景实际应用如何启用Gluten与Substrait启用Gluten非常简单只需在Spark配置中添加以下参数spark.sql.extensionsorg.apache.gluten.GlutenPlugin spark.gluten.sql.columnar.backendvelox # 或clickhouse spark.driver.extraClassPath/path/to/gluten-jars/* spark.executor.extraClassPath/path/to/gluten-jars/*Gluten会自动将支持的SQL算子转换为Substrait计划并交由原生引擎执行。用户无需修改现有SQL代码即可享受性能提升。未来展望Substrait生态的扩展Gluten团队正积极参与Substrait社区推动以下方向的发展扩展函数覆盖范围增加更多SQL函数的Substrait支持增强数据类型系统支持更丰富的复杂数据类型优化计划缓存机制进一步提升重复查询的性能多引擎协同执行支持同一查询中混合使用多种原生引擎随着Substrait协议的不断成熟Gluten有望成为连接JVM生态与原生计算的标准化桥梁为大数据处理带来更多性能突破。总结Apache Gluten通过Substrait协议实现了JVM SQL引擎与原生执行引擎的无缝集成打破了传统大数据处理中的性能瓶颈。其分层架构设计确保了灵活性和可扩展性而Substrait作为通用执行计划语言则为跨引擎协作提供了统一标准。无论是ClickHouse还是Velox后端Gluten都能充分发挥原生执行的性能优势同时保留Spark等JVM引擎的易用性。对于追求极致性能的大数据应用而言Gluten无疑是一个值得尝试的革命性框架。【免费下载链接】glutenGluten is a middle layer responsible for offloading JVM-based SQL engines execution to native engines.项目地址: https://gitcode.com/GitHub_Trending/glu/gluten创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考