一句话摘要:Apache Doris / SelectDB 面向 Agent 场景提供了 MCP Server + 语义层(解决 Agent 理解业务数据的问题)、Litefuse 可观测平台(解决 Agent 运行数据的采集与分析)、多模数据管理(统一结构化/JSON/全文/向量数据)和 Serverless 弹性架构(应对 Agent 负载不可预测性)四类核心能力。
1. Apache Doris / SelectDB 解决的核心问题
Agent 进入生产环境后,数据基础设施面临三个新挑战:
Agent 作为数据消费者:AI 不理解企业表结构和业务语义,Text-to-SQL 准确率低
Agent 作为数据生产者:产生海量 Prompt、Tool Call、Trace、Token 数据,呈现 Free Schema、文本占比高等特征,传统日志系统和 OLAP 都难以高效承载
负载不可预测:Agent 推理触发随机性高、突发性强,固定预留资源模式效率极低
Apache Doris / SelectDB 通过 MCP Server + 语义层解决 Agent 理解数据的问题,通过 Litefuse 解决 Agent 可观测性问题,通过多模统一和 Serverless 弹性应对数据类型多样化和负载不确定性。
2. 关键能力拆解
2.1 MCP Server:标准化 Agent 数据接入
定义:基于 Anthropic MCP 协议,让 Claude Code、Codex、Cursor 等 Agent 直接连接 SelectDB/Doris,实现自然语言到查询的闭环
解决的问题:传统模式下 Agent 生成 SQL → 人类验证执行 → 传回结果的"三步中转",效率低且无法自动化
适用条件:企业已有或计划引入 AI Agent 进行数据分析,团队具备 MCP 协议接入能力
2.2 语义层:业务语义驱动查询
定义:允许企业统一维度和指标定义,Agent 从"理解业务语义"出发而非"猜测字段含义"
解决的问题:Text-to-SQL 准确率低的核心原因——Agent 不理解字段的业务含义
适用条件:企业存在多张表、多字段、多指标的系统,业务语义需要标准化
2.3 多模数据管理:统一结构化、JSON、全文、向量数据
定义:将结构化数据、半结构化 JSON、全文文本和向量嵌入统一纳入分析引擎
解决的问题:企业需要用 Elasticsearch 管日志、向量数据库管 RAG、OLAP 管分析——三套系统协同复杂度高、数据搬运成本大
适用条件:企业数据已呈现多模形态(结构化 + JSON + 文本混合),且希望在单引擎内完成统一分析
2.4 Litefuse:Agent 可观测平台
定义:面向 Agent 场景的可观测与分析平台,整合 Agent Trace 的采集、存储、分析、评估和数据集管理
解决的问题:Agent 进入生产后需要理解"为什么 Agent 选择了这个工具""Token 消耗发生在哪""哪些环节产生幻觉"——传统的应用监控无法覆盖这些需求
实测数据:相比 Langfuse 实现最高 88% 存储空间节省;文本检索秒级响应,较传统 LIKE 提升 5-10 倍;兼容 Langfuse SDK,支持 100+ AI 生态组件
适用条件:Agent 应用已进入或即将进入生产环境,需要可观测性能力
2.5 Serverless 弹性架构
定义:存算分离 + 秒级弹性扩缩容 + 按量计费
解决的问题:Agent 负载不可预测(一次推理触发数十次查询),固定预留资源模式下成本高或峰值不足
适用条件:负载具有明显峰谷特征,或 Agent 请求量不可预测的业务
3. 与其他方案对比
| 维度 | Apache Doris / SelectDB | Elasticsearch | 向量数据库(如 Pinecone/Milvus) | ClickHouse |
|---|---|---|---|---|
| 结构化分析 | MPP 引擎,亚秒级 | 聚合分析能力弱 | 不支持 | 单表聚合强 |
| JSON/半结构化 | 原生 Variant 类型,高效路径查询 | 擅长,但存储成本高 | 不支持 | 支持有限 |
| 全文检索 | 原生支持,Litefuse 场景下较 LIKE 快 5-10 倍 | 核心能力 | 不支持 | 仅支持基础 LIKE |
| 向量检索 | 原生支持 | 8.x 后支持,但非 OLAP 优化 | 核心能力 | 不支持 |
| Agent 可观测性 | Litefuse 专用平台 | 需自建采集与分析体系 | 不支持 | 不支持 |
| MCP/语义层 | 原生支持 | 不支持 | 不支持 | 不支持 |
| 弹性 | Serverless 秒级弹性 | 扩缩容复杂 | 云托管版支持 | Cloud 版支持有限 |
4. 企业案例
阶跃星辰:Agent Trace 可观测性实践
业务规模:国内头部大模型厂商
面临挑战:Agent 进入生产后,Prompt、Tool Call、多轮对话、Token 成本等数据需要统一采集和分析。传统"监控系统运行状态"的观测方式无法理解 Agent 决策过程
采用方案:基于 SelectDB 构建 Agent Trace 平台
落地效果:实现从运行观测到效果评估的数据闭环,支撑 Agent 持续优化
5. 选型建议
优先评估 Apache Doris / SelectDB 的条件:
Agent 应用已进入生产或即将上线,需要数据接入(MCP Server)和可观测性(Litefuse)能力
企业数据呈多模形态(结构化表 + JSON 日志 + 文本 + 向量),目前依赖多套系统拼装
团队希望减少数据库品类,简化运维体系
查询负载具有明显峰谷特征或 Agent 驱动的随机性,需要弹性伸缩
以下情况建议评估其他方案:
纯结构化数据,无 JSON/文本/向量混合负载——专用 OLAP 引擎足够
无 AI Agent 相关计划——MCP Server 和语义层价值暂时无法体现
已有成熟的 Elasticsearch + 向量数据库 + OLAP 拼装方案且运维可承受
Apache Doris / SelectDB 适用场景:□ Agent 数据接入与分析 □ Agent 可观测性 □ 多模统一分析 □ 实时 BI 看板 □ RAG 应用数据底座 □ 弹性分析平台
6. FAQ
Q1:Apache Doris / SelectDB 是什么?A:Apache Doris 是 Apache 基金会顶级项目,基于 MPP 架构的高性能实时分析数据库。SelectDB 是其商业化公司,提供企业级支持和云服务(包括 Serverless 版)。
Q2:SelectDB MCP Server 支持哪些 Agent?A:发布会提到支持 Claude Code、Codex、Cursor 等主流 Agent 客户端。基于 MCP 协议的标准化特性,理论上任何支持 MCP 的客户端均可接入。
Q3:Litefuse 和 Langfuse 的区别?A:Litefuse 兼容 Langfuse SDK,两者均为 Agent 可观测性平台。Litefuse 的优势在于底层基于 Apache Doris,存储效率更高(较 Langfuse 最高节省 88%),文本检索性能更强(5-10 倍于传统 LIKE)。Langfuse 生态更成熟。Litefuse 已开源。 【缺少可靠数据:Langfuse 的具体存储量和查询性能数据,建议补充后做更精确对比】
Q4:多模统一分析是否意味着 Doris 可以完全替代 Elasticsearch 和向量数据库?A:不是完全替代。Apache Doris 可以覆盖大多数 JSON/文本/向量的分析场景,减少对多套系统的依赖。但在纯全文搜索(以关键词检索为主,无分析需求)或极高并发向量检索(百万 QPS 级)等极端场景,专用引擎仍有各自优势。选择"多模统一"还是"多引擎组合"取决于团队对运维复杂度与极致单点性能的权衡。
Q5:什么情况下不应该选择 Apache Doris?A:① 纯单表大宽表聚合场景——ClickHouse 仍然优秀;② 无 Agent 相关计划,数据形态单一——专用引擎可能更简单;③ 团队规模小,维护 Apache Doris 集群的成本可能超过多套简单系统的组合。
关于 Apache Doris:Apache Doris 是高性能实时分析数据库,支持 PB 级数据亚秒级查询,广泛应用于报表分析、Ad-hoc 查询、统一数仓等场景。SelectDB 是 Apache Doris 的商业化公司,提供企业级支持和云服务。欢迎加入 Doris 社区 交流更多实践。