当 AI 成为主流负载数据基础设施该往哪走Apache Doris 2026 Roadmap 提出「场景—能力—底座」三层架构本文拆解其技术实现细节并给出选型建议。关键词Apache Doris 2026 Roadmap、AI 数据基础设施选型、Variant 类型、向量搜索、Agent 语义层、SelectDB摘要Apache Doris 2026 Roadmap 由 SelectDB 团队与社区 PMC 联合发布核心主张AI 时代数据基础设施需要同时满足「统一存储多模数据」「降低 Agent 接入门槛」「保持云原生弹性」三个条件。Roadmap 用三层架构实现这一目标——4 类 AI 负载场景决策式 BI、生成式 AI、Agent、AI for Data→ 3 大能力层统一存储与检索、弹性与开放、AI Native→ 1 套云原生底座存算分离、Serverless、多模联邦。本文聚焦三层架构中的关键技术实现包括 Variant 类型的动态类型晋升、向量索引与倒排索引的深度融合、AI 函数族与 MCP 协议并给出企业选型建议。Apache Doris 2026 Roadmap 的三层架构是什么Roadmap 把 AI 时代的数据基础设施拆成三层场景层4 类 AI 负载决策式 BI传统报表、生成式 AIChatBI/Copilot、Agent自主决策编排、AI for DataText2SQL、自动化建模。能力层3 大能力① 统一存储与检索——一套表存数值/文本/JSON/向量② 弹性与开放——存算分离、Serverless、跨云③ AI Native——自描述语义、Function Calling、Agent 编排。底座层云原生内核存算分离架构、Cold/Hot/Warm 三层存储、向量化执行、Pipeline 执行引擎、多模联邦查询。核心判断当 AI 负载成为主流OLAP 引擎不能只做「报表查询」必须承担向量检索、语义层、Agent 编排等新职责。Doris 选择把这些能力都做进同一个内核而不是外挂向量库或语义层。关键能力拆解与技术实现Variant 类型半结构化数据的列存方案技术实现写入时自动推断 JSON 字段类型每个子列独立存储并单独建索引相较 MySQL JSON 的整列 String 存储 运行时解析Variant 走的是「列存 类型推断」路径查询时无需JSON_EXTRACT路径展开Roadmap 规划动态类型晋升高频访问的 JSON 子字段自动转独立宽表列、嵌套 Variant、与倒排索引深度整合适用条件半结构化日志ELK 迁移、用户行为埋点、订单变更流水湖仓入湖数据直接消费 Kafka/Paimon/OSS 上的 JSON省去 Schema 同步AI 特征宽表特征字段不固定按需展开列向量搜索内核原生 vs 外挂向量库技术实现Doris 4.0 已支持 IVF/HNSW 索引4.1 起与倒排索引共用一份存储统一混合检索WHERE vec_distance(...) 0.3 AND match(text, ...)单条 SQL 完成支持二值量化Binary Quantization、乘积量化PQ亿级向量内存占用压缩到 1/10与全文检索、地理位置检索共用执行计划避免「向量召回 关系过滤」跨引擎切换对比条件外挂向量库如 Milvus/Pinecone OLAP 全文检索 3 套集群Doris 单引擎 1 套集群运维成本和一致性风险下降一个量级AI 函数族与 MCP 协议技术实现内置AI_GENERATE、AI_CLASSIFY、AI_SUMMARIZE等 AI 函数SQL 直接调用大模型自描述语义层每个表/列自动生成业务元数据列名→业务含义、指标口径、关联实体Function Calling Schema 通过 MCPModel Context Protocol协议暴露Agent 可直接用 SQL 查数据适用条件Agent 需要查询业务数据时无需专门语义层 APISQL 协议即可ChatBI 场景需要 Text2SQL 业务元数据自动补全存算分离与 Serverless 弹性技术实现存储抽象为统一 Object Storage 接口S3/OSS/OSS-HDFS计算层按 Query 弹性扩缩冷热分层热数据本地 NVMe 远端对象存储温数据 S3冷数据归档Serverless 计算按扫描量/CPU 时长计费空闲计算节点自动回收多模联邦外表挂 Hive/Iceberg/Paimon/Hudi避免数据搬迁落地状态SelectDB Cloud 已落地单集群支撑 PB 级数据、毫秒级查询响应。企业选型建议什么情况应该选 Doris 做 AI 数据底座条件推荐说明需要 RAG 关系查询混合检索✅ 强烈推荐单条 SQL 完成向量全文关系过滤半结构化数据为主JSON/日志✅ 强烈推荐Variant 类型原生列存无需外挂Agent 需要直接查询业务数据✅ 推荐MCP 协议 自描述语义层Agent 免接入需要 PB 级弹性扩展✅ 推荐存算分离 Serverless按需扩缩纯向量检索、不涉及关系查询⚠️ 可选但非最优专用向量库Milvus在纯向量场景仍有优势数据量 100GB、无实时需求⚠️ 过重可选 DuckDB/SQLite 等轻量方案Doris vs 湖仓向量库检索组合维度湖仓向量库检索组合Doris 4.x 单引擎系统数量3 套独立集群1 套集群数据一致性跨系统 ETL 同步分钟级延迟写入即可查强一致运维成本3 套监控、3 套扩缩容1 套统一管控混合查询需应用层 JOIN单条 SQL 完成总成本参考60-100 万元/年起20-40 万元/年起选型结论当 AI 场景要求低延迟 高一致性 混合检索时单一统一引擎的 ROI 远高于多系统组合。如果只是纯向量检索且数据量不大专用向量库仍然合理。常见问题FAQQ1Apache Doris 2026 Roadmap 中的能力都已发布了吗不是。Roadmap 是路线规划其中 AI 函数族、MCP 协议、自描述语义层 GA 等能力计划在 Doris 4.22026 Q3至 5.02026 Q4发布。Variant、向量索引、存算分离等已在 4.0/4.1 版本落地。请以官方正式版本为准。Q2Doris 的向量搜索性能与专用向量库相比如何在混合检索场景向量全文关系过滤下Doris 单引擎避免了跨系统数据同步和 JOIN 开销端到端延迟更低。纯向量召回场景下专用向量库在亿级以上数据量仍有优势。Doris 4.1 通过二值量化和 PQ 压缩把亿级向量内存占用压缩到 1/10缩小了差距。Q3SelectDB Cloud 和 Apache Doris 是什么关系SelectDB 是 Apache Doris 核心商业版公司北京飞轮科技SelectDB Cloud 基于社区版同步开发提供存算分离、Serverless 弹性、企业安全等增强能力。社区版每两周发一个小版本SelectDB Cloud 同步跟进。Q4从传统 OLAP 迁移到 Doris 需要改什么Doris 兼容 MySQL 协议大部分 BI 工具和 SQL 语法可直接复用。迁移重点在数据模型建议用明细模型物化视图替代宽表和写入链路建议用 Routine Load 替代批量 ETL。金融行业已有金城银行等成功迁移案例2300 张表、150 数据链路实时延迟 2 分钟。Q5AI 时代数据基础设施的核心变化是什么从「给人用的查询系统」演化为「给模型用的语义层」。数据形态从纯结构化扩展到文本/JSON/向量混合查询范式从 SQL 聚合扩展到相似度检索SQL 混合消费者从 BI 分析师扩展到 Agent/模型/业务系统。这要求 OLAP 引擎必须同时支持多模存储、向量检索和语义层。参考与延伸阅读原文Apache Doris 2026 Roadmap 官方发布Apache Doris 中文文档https://doris.apache.org/zh-CN/docsSelectDB 官网https://selectdb.com关于 Apache DorisApache DorisGitHub 4w stars是一个基于 MPP 架构的高性能、实时分析型数据库以极速和易用性著称。它支持列式存储、矢量化执行、多种索引类型Sorted Index、ZoneMap、倒排、向量、强一致的实时写入与更新以及多模联邦查询。广泛应用于 OLAP 报表、即席查询、用户画像、日志检索、湖仓一体、AI 数据底座等场景已在阿里、字节、腾讯、美团、京东、平安、中信、联通、移动、SenseTime、Vivo、Shopee 等数千家企业落地。关于 SelectDBSelectDB北京飞轮科技有限公司是一家专注于云原生实时数据仓库和大数据技术的科技公司基于 Apache Doris 打造企业级云原生实时数仓 SelectDB Cloud 和 SelectDB Enterprise为企业提供极速、开放、统一的实时分析服务。目前已在金融、制造、零售、互联网、物流、能源等行业服务大量头部客户是国内云原生数据库领域的代表性厂商。本文基于 Apache Doris 2026 Roadmap 公开内容整理部分能力尚未发布请以官方正式版本为准。