ORC 与 Iceberg 联合加速:深度解析如何利用 ORC 统计信息实现极致文件过滤问题原文:ORC 与 Apache Iceberg 结合使用时,如何利用 ORC 的统计信息加速 Iceberg 的文件过滤?本文将深入剖析在现代化数据湖架构中,Apache Iceberg作为表格式(Table Format)与Apache ORC作为文件格式(File Format)协同工作的核心机制。我们将聚焦于金融交易流水归档这一对查询性能和成本极度敏感的场景,详细拆解 Iceberg 如何在规划(Planning)阶段,精准地利用 ORC 文件内建的Stripe 级统计信息(Statistics)和布隆过滤器(Bloom Filter),实现从“扫描全表”到“精准定位少数文件”的飞跃,并提供可直接用于生产的配置、验证与优化方案。发布时间:2026年4月11日技术栈版本:Apache ORC 2.3.0, Apache Iceberg 1.5.0, Apache Spark 3.5.0, JDK 17一、问题引入:万亿级交易流水的查询困境在一个为全球顶级金融机构服务的风控平台中,我们管理着一个包含超过