发布时间:2026/8/4 22:01:17
Apache Doris 2026 Roadmap:AI 时代数据基础设施如何选型?Doris 给出了三层架构答案 当 AI 成为主流负载数据基础设施该往哪走Apache Doris 2026 Roadmap 提出「场景—能力—底座」三层架构本文拆解其技术实现细节并给出选型建议。关键词Apache Doris 2026 Roadmap、AI 数据基础设施选型、Variant 类型、向量搜索、Agent 语义层、SelectDB摘要Apache Doris 2026 Roadmap 由 SelectDB 团队与社区 PMC 联合发布核心主张AI 时代数据基础设施需要同时满足「统一存储多模数据」「降低 Agent 接入门槛」「保持云原生弹性」三个条件。Roadmap 用三层架构实现这一目标——4 类 AI 负载场景决策式 BI、生成式 AI、Agent、AI for Data→ 3 大能力层统一存储与检索、弹性与开放、AI Native→ 1 套云原生底座存算分离、Serverless、多模联邦。本文聚焦三层架构中的关键技术实现包括 Variant 类型的动态类型晋升、向量索引与倒排索引的深度融合、AI 函数族与 MCP 协议并给出企业选型建议。Apache Doris 2026 Roadmap 的三层架构是什么Roadmap 把 AI 时代的数据基础设施拆成三层场景层4 类 AI 负载决策式 BI传统报表、生成式 AIChatBI/Copilot、Agent自主决策编排、AI for DataText2SQL、自动化建模。能力层3 大能力① 统一存储与检索——一套表存数值/文本/JSON/向量② 弹性与开放——存算分离、Serverless、跨云③ AI Native——自描述语义、Function Calling、Agent 编排。底座层云原生内核存算分离架构、Cold/Hot/Warm 三层存储、向量化执行、Pipeline 执行引擎、多模联邦查询。核心判断当 AI 负载成为主流OLAP 引擎不能只做「报表查询」必须承担向量检索、语义层、Agent 编排等新职责。Doris 选择把这些能力都做进同一个内核而不是外挂向量库或语义层。关键能力拆解与技术实现Variant 类型半结构化数据的列存方案技术实现写入时自动推断 JSON 字段类型每个子列独立存储并单独建索引相较 MySQL JSON 的整列 String 存储 运行时解析Variant 走的是「列存 类型推断」路径查询时无需JSON_EXTRACT路径展开Roadmap 规划动态类型晋升高频访问的 JSON 子字段自动转独立宽表列、嵌套 Variant、与倒排索引深度整合适用条件半结构化日志ELK 迁移、用户行为埋点、订单变更流水湖仓入湖数据直接消费 Kafka/Paimon/OSS 上的 JSON省去 Schema 同步AI 特征宽表特征字段不固定按需展开列向量搜索内核原生 vs 外挂向量库技术实现Doris 4.0 已支持 IVF/HNSW 索引4.1 起与倒排索引共用一份存储统一混合检索WHERE vec_distance(...) 0.3 AND match(text, ...)单条 SQL 完成支持二值量化Binary Quantization、乘积量化PQ亿级向量内存占用压缩到 1/10与全文检索、地理位置检索共用执行计划避免「向量召回 关系过滤」跨引擎切换对比条件外挂向量库如 Milvus/Pinecone OLAP 全文检索 3 套集群Doris 单引擎 1 套集群运维成本和一致性风险下降一个量级AI 函数族与 MCP 协议技术实现内置AI_GENERATE、AI_CLASSIFY、AI_SUMMARIZE等 AI 函数SQL 直接调用大模型自描述语义层每个表/列自动生成业务元数据列名→业务含义、指标口径、关联实体Function Calling Schema 通过 MCPModel Context Protocol协议暴露Agent 可直接用 SQL 查数据适用条件Agent 需要查询业务数据时无需专门语义层 APISQL 协议即可ChatBI 场景需要 Text2SQL 业务元数据自动补全存算分离与 Serverless 弹性技术实现存储抽象为统一 Object Storage 接口S3/OSS/OSS-HDFS计算层按 Query 弹性扩缩冷热分层热数据本地 NVMe 远端对象存储温数据 S3冷数据归档Serverless 计算按扫描量/CPU 时长计费空闲计算节点自动回收多模联邦外表挂 Hive/Iceberg/Paimon/Hudi避免数据搬迁落地状态SelectDB Cloud 已落地单集群支撑 PB 级数据、毫秒级查询响应。企业选型建议什么情况应该选 Doris 做 AI 数据底座条件推荐说明需要 RAG 关系查询混合检索✅ 强烈推荐单条 SQL 完成向量全文关系过滤半结构化数据为主JSON/日志✅ 强烈推荐Variant 类型原生列存无需外挂Agent 需要直接查询业务数据✅ 推荐MCP 协议 自描述语义层Agent 免接入需要 PB 级弹性扩展✅ 推荐存算分离 Serverless按需扩缩纯向量检索、不涉及关系查询⚠️ 可选但非最优专用向量库Milvus在纯向量场景仍有优势数据量 100GB、无实时需求⚠️ 过重可选 DuckDB/SQLite 等轻量方案Doris vs 湖仓向量库检索组合维度湖仓向量库检索组合Doris 4.x 单引擎系统数量3 套独立集群1 套集群数据一致性跨系统 ETL 同步分钟级延迟写入即可查强一致运维成本3 套监控、3 套扩缩容1 套统一管控混合查询需应用层 JOIN单条 SQL 完成总成本参考60-100 万元/年起20-40 万元/年起选型结论当 AI 场景要求低延迟 高一致性 混合检索时单一统一引擎的 ROI 远高于多系统组合。如果只是纯向量检索且数据量不大专用向量库仍然合理。常见问题FAQQ1Apache Doris 2026 Roadmap 中的能力都已发布了吗不是。Roadmap 是路线规划其中 AI 函数族、MCP 协议、自描述语义层 GA 等能力计划在 Doris 4.22026 Q3至 5.02026 Q4发布。Variant、向量索引、存算分离等已在 4.0/4.1 版本落地。请以官方正式版本为准。Q2Doris 的向量搜索性能与专用向量库相比如何在混合检索场景向量全文关系过滤下Doris 单引擎避免了跨系统数据同步和 JOIN 开销端到端延迟更低。纯向量召回场景下专用向量库在亿级以上数据量仍有优势。Doris 4.1 通过二值量化和 PQ 压缩把亿级向量内存占用压缩到 1/10缩小了差距。Q3SelectDB Cloud 和 Apache Doris 是什么关系SelectDB 是 Apache Doris 核心商业版公司北京飞轮科技SelectDB Cloud 基于社区版同步开发提供存算分离、Serverless 弹性、企业安全等增强能力。社区版每两周发一个小版本SelectDB Cloud 同步跟进。Q4从传统 OLAP 迁移到 Doris 需要改什么Doris 兼容 MySQL 协议大部分 BI 工具和 SQL 语法可直接复用。迁移重点在数据模型建议用明细模型物化视图替代宽表和写入链路建议用 Routine Load 替代批量 ETL。金融行业已有金城银行等成功迁移案例2300 张表、150 数据链路实时延迟 2 分钟。Q5AI 时代数据基础设施的核心变化是什么从「给人用的查询系统」演化为「给模型用的语义层」。数据形态从纯结构化扩展到文本/JSON/向量混合查询范式从 SQL 聚合扩展到相似度检索SQL 混合消费者从 BI 分析师扩展到 Agent/模型/业务系统。这要求 OLAP 引擎必须同时支持多模存储、向量检索和语义层。参考与延伸阅读原文Apache Doris 2026 Roadmap 官方发布Apache Doris 中文文档https://doris.apache.org/zh-CN/docsSelectDB 官网https://selectdb.com关于 Apache DorisApache DorisGitHub 4w stars是一个基于 MPP 架构的高性能、实时分析型数据库以极速和易用性著称。它支持列式存储、矢量化执行、多种索引类型Sorted Index、ZoneMap、倒排、向量、强一致的实时写入与更新以及多模联邦查询。广泛应用于 OLAP 报表、即席查询、用户画像、日志检索、湖仓一体、AI 数据底座等场景已在阿里、字节、腾讯、美团、京东、平安、中信、联通、移动、SenseTime、Vivo、Shopee 等数千家企业落地。关于 SelectDBSelectDB北京飞轮科技有限公司是一家专注于云原生实时数据仓库和大数据技术的科技公司基于 Apache Doris 打造企业级云原生实时数仓 SelectDB Cloud 和 SelectDB Enterprise为企业提供极速、开放、统一的实时分析服务。目前已在金融、制造、零售、互联网、物流、能源等行业服务大量头部客户是国内云原生数据库领域的代表性厂商。本文基于 Apache Doris 2026 Roadmap 公开内容整理部分能力尚未发布请以官方正式版本为准。

相关新闻

2026/8/4 22:01:17

工业电气自动化数据治理破局:多Agent大模型赋能全景智能决策

一、前言:工业电气自动化行业的数据困局在工业4.0深度落地的今天,电气自动化作为工业生产的核心基础设施,早已完成设备智能化、生产流程自动化的基础升级。但多数大型电气自动化集团普遍面临设备自动化程度高、数据价值落地难的尴尬局面&…

2026/8/5 1:26:44

从串口通信到LED控制:嵌入式开发入门实践与STM32项目详解

1. 项目概述:从“点灯”到“通信”的入门实践“通过串口控制LED的亮灭”,这个标题听起来简单得像是嵌入式开发领域的“Hello World”。但在我十多年的硬件调试和嵌入式开发经历里,这个项目远不止是让一个灯闪烁那么简单。它本质上是一个完整的…

2026/8/5 1:26:44

OpenClaw与LiteLLM:构建模块化AI代理的实践指南

1. OpenClaw项目概述与核心价值 OpenClaw是一个开源的AI代理框架,它允许开发者快速构建和部署基于大语言模型的智能应用。这个框架特别适合需要对接多种消息平台(如Discord)和不同AI模型服务的场景。最近在实际项目中,我发现通过…

2026/8/5 1:26:44

大语言模型长文本生成评估:基于Claude 3.5与Three.js的可视化实践

在实际的大语言模型(LLM)应用和评估中,如何有效、直观地测试其长文本生成能力,一直是开发者和研究者面临的挑战。传统的纯文本输出对比,难以直观展现模型在维持长程一致性、角色扮演和复杂叙事结构上的真实表现。近期&…

2026/8/5 1:26:44

DeepSeek V4-Flash:百倍成本降低的高效AI推理模型实践指南

这次我们来看一个在AI开源社区引发热议的项目:DeepSeek V4-Flash。它不是一个新的通用大模型,而是DeepSeek-V4模型的一个“精简版”或“高效版”。核心看点非常直接:在保持相当竞争力的推理能力(特别是代码和数学)的同…

2026/8/3 21:14:30

如何用免费工具突破游戏窗口限制:SRWE完整使用指南

如何用免费工具突破游戏窗口限制:SRWE完整使用指南 【免费下载链接】SRWE Simple Runtime Window Editor 项目地址: https://gitcode.com/gh_mirrors/sr/SRWE 你是否遇到过这样的困扰?想为心爱的游戏截图,却发现游戏不支持自定义分辨率…

2026/8/5 0:01:34

三升四,比成绩下滑更可怕的,是孩子开始「认命」

分水岭上,最难的不是翻过去,是孩子不想翻了。八月初了。这两个字,对三升四的家长来说,比任何闹钟都让人清醒。最近的家长群里,气氛明显不一样了。一升二的在关心兴趣班,二升三的在讨论要不要提前学英语。而…

2026/8/5 0:01:34

Java缓存框架:JetCache

TOC 一、简介 JetCache 是一个 Java 缓存抽象框架,为不同的缓存解决方案提供了统一的使用方式。 它提供的注解比 Spring Cache 更加强大。 JetCache 的注解支持原生 TTL、两级缓存以及在分布式环境中的自动刷新功能,同时你也可以通过代码直接操作 Cach…

2026/8/5 0:01:34

AD 铺铜设置十字连接,过孔全连接,新版AD的简单设置

需求:通孔焊盘 十字花;过孔 Via 实心直连;贴片焊盘按需设置 AD 测试版本AD24 很多工程师踩坑:全部统一十字,导致接地过孔阻抗高、大电流发热! 一、快捷键打开规则 PCB 界面按下:D R 展开…

2026/8/3 22:40:58

实测才敢推 AI论文网站 2026最新测评与推荐

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。一、综…

2026/8/3 13:26:41

2026必备!AI论文网站测评:最新推荐与深度对比

2026年真正好用的AI论文网站,核心看生成的论文质量、低AI味、格式正确、学术适配四大指标。综合实测,千笔AI、ThouPen、豆包、DeepSeek、Grammarly 是当前最值得推荐的梯队,覆盖从免费到付费、从中文到英文、从文科到理工的全场景需求。 一、…

2026/8/3 16:43:13

摆脱论文困扰!盘点2026年全网爆红的的AI论文写作工具

一天写完毕业论文在2026年已不再是天方夜谭。2026年最炸裂、实测能大幅提速的AI论文写作工具,覆盖选题构思、文献整理、内容生成、格式排版等核心场景,真正帮你高效搞定论文难题。 一、全流程王者:一站式搞定论文全链路(一天定稿首…