- 数据湖
- 大数据
- 数据存储
【免费下载链接】iceberg
Apache Iceberg
Apache Iceberg 之所以成为开放数据湖仓事实标准,除了格式规范本身(spec.md)与核心 Java 实现(core)之外,还仰赖一个庞大的厂商生态:云服务商、查询引擎、数据集成工具、目录与治理平台都在产品中原生支持 Iceberg 表。本文以官方站点 vendors.md 为骨架,逐一梳理这些厂商的 Iceberg 能力定位,并结合当前仓库(Apache Iceberg Java 项目)中的第一方实现模块与 REST Catalog 协议,说明每一项支持背后的技术根基,帮助你在选型、集成与排障时快速定位合适的生态组件。
一、生态繁荣的技术底座:REST Catalog 与兼容性测试
在逐一介绍厂商之前,有必要先理解"为什么这么多厂商能低成本地支持 Iceberg"。答案在于 Iceberg 的开放协议设计——目录逻辑被封装在标准 HTTP API 之后,任意引擎只需实现一个客户端即可对接所有合规服务器。仓库中的 rest-protocol.md 明确写道:随着生态扩张,每个引擎和语言原本都需要为每种目录实现专属客户端,REST 目录协议通过把目录逻辑放到通用 HTTP API 后面解决了这一问题;由于服务端拥有提交逻辑,协议还能提供客户端目录无法实现的能力,如服务端冲突解决、多表提交、通过凭据下发(credential vending)或远程签名实现的表安全共享。
这一点在代码层面有直接印证:
- 客户端实现位于 core/src/main/java/org/apache/iceberg/rest/RESTCatalog.java,配套属性定义见 RESTCatalogProperties.java;
- 协议规范(OpenAPI 定义)沉淀在 open-api/rest-catalog-open-api.yaml;
- 仓库还提供了 REST 兼容性测试套件(RCK, REST Compatibility Kit),见 open-api/src/testFixtures/java/org/apache/iceberg/rest/RESTCatalogServer.java 与 RESTCompatibilityKitCatalogTests.java,任何宣称支持 Iceberg REST 协议的厂商产品都可以用这套测试验证合规性。
因此,下文多数厂商的 Iceberg 支持都可以归为两类:通过 REST Catalog 协议接入(目录侧),以及通过 Iceberg 表格式直接读写(引擎侧)。
二、云服务商与云上托管数据平台
云厂商是 Iceberg 生态的第一梯队,它们把 Iceberg 能力内建到对象存储、查询服务、数据集成与托管目录中。
Amazon Web Services (AWS)
AWS 围绕 Iceberg 提供了一整套现代数据架构服务:
- Amazon S3:为数据湖提供近乎无限、高持久性的对象存储底座;
- Amazon S3 Tables:完全托管的 Iceberg 表服务,内置自动化维护、优化与成本管理;
- Amazon Athena:无服务器交互式查询引擎,原生支持 Iceberg,适合大规模数据集上的快速、低成本查询;
- Amazon EMR:在 Iceberg 之上集成 Apache Spark、Flink、Hive、Presto 与 Trino,覆盖规模化处理与分析;
- AWS Glue:完全托管的数据集成能力,为 Iceberg 表提供 schema 演进、维护、优化与分区管理。
从仓库源码看,AWS 是当前仓库中第一方实现最完整的云厂商模块(aws):包括以 AWS Glue 作为目录实现的 GlueCatalog.java(继承BaseMetastoreCatalog,通过 GlueClient 同步数据库与表元数据)、以 S3 为文件系统的 S3FileIO.java(实现SupportsStorageCredentials、SupportsRecoveryOperations等接口,支持分片上传与批量删除),以及 DynamoDB 锁管理、Lake Formation 客户端工厂(LakeFormationAwsClientFactory.java)和 S3 访问授权(S3 Access Grants)等。详细的接入指南见 aws.md。
Google Cloud
Google Cloud 通过 BigLake 提供对 Apache Iceberg 的一流支持,核心是:
- BigLake metastore:面向全部 Iceberg 表的无服务器元数据服务,可在 Apache Spark、BigQuery 及第三方引擎间创建和管理表,提供一致的视图与统一访问控制;它支持 Apache Iceberg REST Catalog,便于 OSS 与第三方引擎集成;
- BigLake tables for Apache Iceberg:与 BigQuery 配合,提供企业级、完全托管的 Iceberg 使用体验。
仓库中 gcp 模块即承载 Google Cloud 相关实现(含集成与单元测试,见 gcp/src/test/java/org/apache/iceberg),可用于将 GCS 文件系统接入 Iceberg 的表读写链路。
Microsoft OneLake(Microsoft Fabric)
Microsoft OneLake 是 Fabric 内置的统一数据湖,把企业数据资产收敛到开放、安全的基础之上,对外暴露两类 API:
- Tables API:支持 Apache Iceberg REST Catalog(IRC)规范,可直接用现有工具与工作流创建、管理和集成 Iceberg 表;
- Files API:完全兼容 Azure Data Lake Storage(ADLS),支持与既有 ADLS 工具的无缝文件操作。
仓库中 azure 模块提供了 ADLS 文件系统实现(ADLSFileIO.java 及配套的输入/输出流、位置解析类),支持通过 SAS 令牌或托管凭据访问 Azure 存储,是 OneLake Files API 兼容性的直接技术基础。
Oracle
Oracle Autonomous AI Lakehouse 将 Apache Iceberg 的开放性与 Oracle Autonomous Database、Exadata 的性能/自动化/安全结合,可在 OCI、Azure、Google Cloud、AWS 及本地部署,提供多云与混合开放湖仓架构:通过既有目录集成与对 Iceberg REST Catalog 规范的支持实现高性能表访问,并在 Spark、Trino、Flink 等引擎间互操作,尽量减少数据搬移、保持厂商中立,同时内置 AI、向量搜索、图分析与 JSON 关系能力。
Databricks
Databricks 采用开放湖仓架构支撑其 Data Intelligence Platform,通过Unity Catalog统一管理与治理结构化数据、非结构化数据、业务指标和 AI 模型,覆盖 Delta Lake、Apache Iceberg、Hudi、Parquet 等多种开放格式。对 Iceberg 用户而言,关键是 Iceberg 表可以注册进 Unity Catalog,与 Delta 表同享治理能力。仓库中的 delta-lake 模块与 delta-lake-migration.md 提供了 Iceberg 与 Delta Lake 之间互操作/迁移的参考实现。
Cloudera
Cloudera 的开放数据湖仓让客户以 Apache Iceberg 等开放表格式存储和管理数据,支撑大规模多函数分析与 AI。其 Iceberg 支持强调易用、易集成进任意数据生态、可在多引擎(Cloudera 与非 Cloudera)上运行,并提供统一的安全、治理、元数据管理与细粒度访问控制。典型的端到端路径是:用 NiFi、Flink、Kafka 摄入批/流数据,用 Spark 处理同一份数据,再用 Data Visualization、Data Warehouse、Machine Learning 工具做分析或 AI,私有云或任意公有云皆可。仓库中的 kafka-connect 模块正是 Kafka 生态接入 Iceberg 的第一方参考实现(含 Sink 连接器与单消息转换,见 kafka-connect/kafka-connect)。
IBM watsonx.data
IBM watsonx.data 是以 Apache Iceberg 为核心表格式的开放数据湖仓,提供 schema 演进、时间旅行、分区等能力;开发者在不同环境间管理数据、无中断查询历史数据。其生态还整合了 Velox、Presto、Apache Gluten 等高性能计算组件。仓库中 nessie 模块可佐证 Iceberg 目录生态的开放性——Nessie 这类 Git 式目录同样被第一方支持,详见 nessie.md。
Teradata
Teradata 为企业级开放表格式(Open Table Format)支持投入,覆盖 Apache Iceberg 与 Delta Lake,用户可自由选择存储、目录与查询引擎,无专有锁定;OTF 兼容性横跨主流云、本地与混合环境,并通过集中式安全与治理、AMP、基于成本的优化器与智能工作负载管理,提供跨湖格式、跨目录、跨部署的大规模查询性能。
三、查询与分析引擎
这是 Iceberg 生态中厂商数量最多的类别,覆盖从嵌入式分析库到分布式 MPP、从实时 OLAP 到图分析的各种引擎。
ClickHouse
ClickHouse 是列式数据库,与 Iceberg 集成提供两种方式:
- iceberg 表函数(table function):提供对 Amazon S3 中 Iceberg 表的只读表式接口;
- iceberg 表引擎(table engine):对 S3 中已有 Iceberg 表的只读集成。
这是典型的"引擎侧直接读 Iceberg 文件"路径:读取表元数据(manifest 与 Parquet 数据文件)而无需专用目录客户端。
DuckDB
DuckDB 是开源、进程内、面向快速分析查询的 SQL 数据库,轻量(仅一个小二进制)且可扩展。其核心扩展之一duckdb-iceberg允许用户 attach 到 Iceberg 目录、查询数据并向 Iceberg 表写入,全部功能原生实现在 DuckDB 内部、无外部依赖。对 Java 生态开发者而言,DuckDB 通常作为轻量分析/验证 Iceberg 表内容的便捷工具。
Dremio
Dremio 让组织以 Apache Iceberg 等开放格式构建数据湖仓,并用其交互式 SQL 查询引擎或第三方引擎处理数据:
- Dremio Sonar:湖仓查询引擎,在 Iceberg 上提供交互式性能与 DML(如 MERGE、UPDATE、DELETE),也支持其他格式与数据源;
- Dremio Arctic:湖仓目录与优化服务,后台自动优化表以保证任何引擎的高性能访问,并在 Iceberg 表上提供分支(branch)、标签(tag)等 Git 式概念。
分支/标签能力正是 Iceberg 规范提供的语义——仓库文档 branching.md 对 Iceberg 分支与标签机制做了完整说明。
Firebolt
Firebolt 是面向低延迟、高并发数据密集型应用的云数据仓库,针对 Iceberg 表读取做了亚秒级性能优化,并与主流 Iceberg 目录深度集成;同时提供免费、自托管的分布式查询引擎发行版 Firebolt Core。
StarRocks / CelerData
CelerData 提供 StarRocks 的商业化服务——一个面向企业级 Iceberg 分析的分布式 MPP SQL 引擎:凭借全向量化技术、本地缓存与智能物化视图,在批处理与实时分析上都能实现亚秒级查询延迟。CelerData 提供企业部署与云服务两种形态。
Trino / Starburst
Trino 是分布式 MPP SQL 查询引擎,能以交互式速度查询 Iceberg 数据,并能把 Iceberg 表与大量其他系统做 Join。Starburst 是 Trino 的商业化发行方,提供企业部署与全托管服务,并提供 Iceberg connector 的企业支持;Starburst 团队包含许多开源 Trino 的原生贡献者。
Apache Doris / VeloDB
VeloDB 是由 Apache Doris 驱动的商业数据仓库。Apache Doris 是开源实时数仓,为 Iceberg 表提供查询加速与高效数据写回能力(Iceberg catalog 集成)。VeloDB 提供与开源 Doris 完全兼容的企业版与云服务。
StarTree
StarTree 是基于 Apache Pinot 索引能力的实时分析平台,能精确定位抓取 Parquet 文件的页级数据,减少不必要的扫描与传输,从而在 Iceberg 数据上提供稳定、高并发的查询;适用于可观测性、面向客户的分析、异常检测与交互式 BI,无需复制、预聚合或物化数据到独立服务系统,支持托管云服务或企业云内部署。
SingleStore
SingleStore 是高性能、可扩展的分布式 SQL 平台,原生 Iceberg 集成消除了昂贵的 ETL 步骤:直接读取并管理 Iceberg 表数据,支持毫秒级响应应用、低延迟 schema 演进,可自托管或云上部署,弥合传统数据湖与实时分析之间的鸿沟。
Crunchy Data
Crunchy Data Warehouse 是基于 PostgreSQL 的现代数据仓库:扩展未修改的 PostgreSQL 以提供完全事务性的 Iceberg 表与高性能分析;可通过 Crunchy Bridge(AWS 上的全托管 PostgreSQL 服务)获取。它支持直接从 PostgreSQL 数据库或外部 URL 创建 Iceberg 表,并可用 PostgreSQL 语法读、查、更新 Iceberg 表,通过结合 PostgreSQL 与 DuckDB 的混合查询引擎提供高性能分析查询。
PuppyGraph
PuppyGraph 是云原生图分析引擎,可将一个或多个关系数据存储作为统一图模型查询,无需部署和维护孤立的图数据库、无需 ETL。其对 Apache Iceberg 的原生集成把图能力直接加到现有数据湖上。
Bodo
Bodo 是高性能 SQL 与 Python 计算引擎,把 HPC 与超算技术带入数据分析,将 Apache Iceberg 表作为一级表格式与存储,支持用其高性能处理引擎读写 Iceberg 表;提供 AWS/Azure 上的云服务与本地部署方案。
Sail
Sail 是 Rust 构建的开源多模态分布式计算框架,统一批处理、流式与 AI 负载;为平滑采用,Sail 在单机与分布式场景下都提供 Spark SQL 与 DataFrame API 的即插即用替代品,并提供了专门的 Iceberg 接入指南。
四、数据集成与实时数据管道
这类厂商解决的核心问题是"如何把数据搬进 Iceberg 表"——包括 CDC、流式写入、批量同步与表维护。
Confluent(Tableflow)
Confluent 提供 Tableflow 托管服务,把 Apache Kafka topic 的数据流式写入 Iceberg 表:通过 Schema Registry 集成自动完成 schema 演进,并自动处理包括 compaction 在内的表维护任务。仓库中的 kafka-connect 与 kafka-connect-events 模块展示了 Iceberg 官方对 Kafka 生态的支持路径,文档见 kafka-connect.md。
Redpanda
Redpanda 是云原生且可自托管的流式平台,其Iceberg topics能力实时把 Kafka 消息自动转换为 Iceberg 表——无需连接器或额外技术即可把 Kafka 数据纳入既有 Iceberg 部署查询,并持续扩展所支持的 Iceberg 目录与查询引擎。
RisingWave
RisingWave 是面向实时数据摄入、处理与管理的云原生流数据库:既能从 Iceberg 表读取、也能向 Iceberg 表写入,支持跨消息队列、数据库(CDC)、数据湖与文件的源进行高效文件压缩(compaction)。提供开源版、托管云服务(含 BYOC)与企业本地版。
StreamNative(Ursa)
StreamNative 提供由 Ursa 驱动的数据流平台——Ursa 是 Kafka 兼容、无 leader、湖仓原生的流引擎:直接向云对象存储上的 Iceberg 表写入(无需定制连接器),自动压缩与提交数据,使 Spark、Trino、Flink 等引擎立即可查询。
BladePipe
BladePipe 是实时端到端数据集成工具,提供 40+ 开箱即用的连接器、一站式数据搬运方案(schema 演进、数据迁移与同步、校验与修正、监控与告警)。以亚秒级延迟从 MySQL、Oracle、PostgreSQL 等源捕获变更数据并流式写入 Iceberg,无需写代码,支持本地部署与 BYOC。
Dataddo
Dataddo 是全托管数据集成平台,可在云、本地与混合环境间搬运企业数据,对 Iceberg 等开放表格式提供一流支持:
- 架构:单一控制平面编排部署在 AWS、Azure、GCP、主权云或本地 Kubernetes/OpenShift 上的数据平面,敏感数据不出网络;
- 传输模式:支持 ETL/ELT、CDC、流式、反向 ETL 与批量交付,连接器数百个且全部持续维护;
- Iceberg 支持:通过 AWS Glue、REST 等目录写入 Iceberg,并自动检测源 schema 漂移,避免下游表静默损坏。
dltHub(dlt)
dlt 是开源 Python 库,用于构建生产级 extract & load 管道,以极简代码把任意数据源载入 Iceberg:
- Pythonic 管道:用简单、可测试、CI/CD 友好的 Python 函数定义 Iceberg 摄入;
- 自动化 schema 管理:即时推断并演进 Iceberg 表 schema,自动适配源端变化;
- 目录支持:兼容 SQL 系(SQLite、PostgreSQL)、REST 系(Lakekeeper、Polaris)以及 AWS Glue、Databricks Unity Catalog、Snowflake Open Catalog 等云原生目录;
- 灵活部署:本地、Docker、Airflow 或 serverless 均可运行。
Fivetran
Fivetran 是数据搬运领域的头部供应商,其 Managed Data Lake 服务提供全托管的 Iceberg 数据湖:可接入 700+ 连接器,把数据直接写入用户自选存储位置;服务端负责 Iceberg 表的摄入与维护,并托管一个 Iceberg REST 兼容目录端点供下游消费。
Upsolver
Upsolver 是面向 Apache Iceberg 的流式数据摄入与表管理方案:可从文件、流与数据库(CDC)轻松摄入批/流数据到 Iceberg 表;连接既有 REST 与 Hive 目录,并持续优化表——压缩小文件、排序与压缩、重分区、清理悬空文件与过期 manifest。提供云服务或 AWS VPC 内部署。
OLake
OLake 是开源 ELT 工具,用于把数据库复制到 Iceberg 数据湖仓:原生集成 PostgreSQL、MySQL、MongoDB、Oracle 与 Kafka,无需 Debezium、Kafka 或 Spark 等中间层即可实时摄入;模块化架构支持全量加载、持续 CDC 与基于 bookmark/cursor 列的增量同步,具备断点续传与 schema 演进;通过并行分块策略加速初始同步,CDC cursor 持久化保证增量更新不丢事件。
Estuary
Estuary 是低延迟、高保真的数据移动平台:智能 schema 推断与演进根据使用情况确定字段类型并在字段变化时保持管道运行;部署选项包括公有、私有与 BYOC。其预构建连接器目录覆盖数据库、API、事件日志等,Apache Iceberg 是主要目标之一,提供两种可配置物化:merge新更新与简单append。
Tinybird
Tinybird 是实时数据平台,可通过 ClickHouse 的iceberg()表函数原生支持 Apache Iceberg,无缝查询存储在 S3 的 Iceberg 表:支持低延迟、高并发访问,由 Tinybird 处理摄入、转换与 API 发布,开发者用 Iceberg 做开放存储与治理、用 Tinybird 做快速查询与实时交付。
OptimaFlo
OptimaFlo 是 AI 数据团队服务,在客户自有 AWS 或 GCP 账号(BYOC)内端到端运行数据栈(原始摄入到干净、可查询的表)。Apache Iceberg 是其管理的所有表的存储层,提供 ACID 事务、schema 演进与时间旅行,目录采用 Apache Polaris;其控制平面不存储客户数据,仅构建与运行管道;查询根据表大小路由到 DuckDB 或客户云数仓,LLM Agent 生成构建与维护 Iceberg 表的 SQL。
五、目录、治理与存储层服务
最后一类是"让 Iceberg 表更好管、更好找、更安全"的平台:目录、数据目录、治理与对象存储。
Snowflake
Snowflake 是跨云统一平台,其Snowflake Horizon Catalog内建于每个账号,为跨引擎与跨云的 Iceberg 提供治理、元数据与互操作;支持Snowflake 托管的 Iceberg 表(完整 DDL/DML)与Iceberg REST API 端点(Spark、Trino、Flink 等外部引擎直接读写这些表);并提供catalog-linked databases实现与远程 Iceberg REST 目录的自动表发现与同步,以及通过 catalog integration 访问外部托管 Iceberg 表。仓库中的 snowflake 模块(含单元测试 snowflake/src/test/java/org/apache/iceberg)提供了与 Snowflake 集成的第一方代码参考。
Collate
Collate 是构建于 OpenMetadata(开源 Apache 2.0 上下文层)之上的 AI 原生数据目录与治理平台:通过连接已在查询 Iceberg 的引擎(Trino、Snowflake、BigQuery 等),把每张 Iceberg 表汇入单一受治理上下文源,提供列级血缘、数据画像与无代码数据质量测试。仓库中的 open-api 兼容性测试即体现了"任意引擎对接任意目录"这一治理思路的协议基础。
MinIO AIStor
MinIO AIStor 是软件定义对象存储,可在本地或任意云部署,并在存储层内实现 Apache Iceberg REST Catalog 规范:表无需 Nessie、Hive Metastore、Glue 或关系数据库,同一部署在统一身份、策略与加密模型下同时服务 S3 对象与 Iceberg 表。AIStor 支持 V3 表格式(含行血缘与删除向量)、视图、表注册、多表原子事务与可选服务端扫描规划;客户端用 SigV4 或规范的 OAuth2 client-credentials 流程认证,并可请求 vended credentials 获取短时、表级作用域的存储凭据;内置维护处理压缩、快照过期与未引用文件清理,目录元数据可复制到第二站点做故障切换。Spark、Trino、PyIceberg、DuckDB、Starburst、Dremio 等引擎通过标准 REST catalog 协议接入。
SeaweedFS
SeaweedFS 是开源分布式对象存储,提供 S3 兼容网关;其S3 Table Buckets在单一服务内提供 Iceberg 部署的两半:内嵌 Iceberg REST 目录服务表元数据,表 bucket 以 Parquet 文件存表数据,并支持服务端压缩与快照过期。Spark、Trino、ClickHouse、DuckDB、Apache Doris、RisingWave、Dremio、PyIceberg 等引擎通过标准 Iceberg REST catalog 与 S3 API 接入。
Ryft
Ryft 是全自动 Iceberg 管理平台:根据实际使用模式实时维护与优化 Iceberg 表,智能运行压缩以适配流式、批作业、CDC 等不同场景;自动化合规、灾难恢复与数据生命周期管理;直接集成既有目录、存储与查询引擎,部署简单。
Stackable
Stackable 提供模块化开源数据平台(Stackable Data Platform),遵循"你的数据、你的平台"理念,通过 Trino、Apache NiFi 与 Apache Spark 无缝集成 Apache Iceberg,支持数据网格、数据湖仓、事件流与机器学习等架构;完全开源、无厂商锁定,支持私有或公有云上的数据主权,并提供 24/7 支持与严格 SLA。
IOMETE
IOMETE 是全托管、"开箱即用"的数据平台:优化对 Iceberg 表的聚类、压缩与访问控制,客户数据保留在客户账号内以防厂商锁定;平台核心是无服务器湖仓,以 Apache Iceberg 为核心表格式,另含 Serverless Spark、SQL 编辑器、数据目录与细粒度访问控制,支持混合多云部署。
六、从厂商列表回看仓库:第一方实现模块地图
把上述厂商能力与当前仓库对照,可以梳理出 Iceberg 官方 Java 项目中的第一方"云与生态"模块,它们是理解各厂商支持深度的最佳入口:
| 厂商/技术方向 | 仓库模块 | 关键实现 |
|---|---|---|
| AWS(S3/Glue/Lake Formation) | aws | GlueCatalog.java、S3FileIO.java、DynamoDbCatalog.java |
| Azure(ADLS) | azure | ADLSFileIO.java |
| Google Cloud(GCS) | gcp | 含集成与单元测试 gcp/src/test |
| Snowflake | snowflake | 目录/表操作相关实现 |
| BigQuery | bigquery | BigQuery 集成(含测试 bigquery/src/test) |
| Delta Lake 互操作 | delta-lake | 迁移参考见 delta-lake-migration.md |
| Kafka 生态 | kafka-connect | Sink 连接器与转换器,文档见 kafka-connect.md |
| REST Catalog 协议 | core + open-api | RESTCatalog.java + RCK 兼容性测试 |
| 其他目录实现 | hive-metastore、nessie、jdbc | 文档见 hive.md、nessie.md |
值得强调的是,REST Catalog 协议的开放性(rest-protocol.md)让上述众多第三方厂商能以极低成本接入:只要实现规范端点(rest-catalog-open-api.yaml),引擎就能通过统一客户端读写目录,这也是 MinIO AIStor、SeaweedFS、Snowflake Horizon、Oracle、OneLake 等目录/存储厂商能"内嵌"目录服务的技术前提。若需自建目录或验证厂商合规性,可参考 custom-catalog.md 与 open-api 模块中的 RCK 测试套件。
七、选型建议:如何理解这张生态地图
面对 40+ 厂商,选型可依据三个维度:
- 读写方向:若只需要"读",ClickHouse 表函数、StarTree、PuppyGraph、DuckDB 扩展等引擎侧方案足够;若需要"写"(含 DML),应选择 Dremio Sonar、Snowflake 托管表、SingleStore、Crunchy Data 这类提供完整写入/更新能力的引擎;
- 数据入口:从 Kafka 流入选 Confluent Tableflow、Redpanda、StreamNative Ursa;从数据库 CDC 流入选 BladePipe、OLake、RisingWave、Dataddo;从 SaaS/API 批量同步选 Fivetran、dlt、Estuary;
- 目录与治理:需要跨引擎统一治理选 Snowflake Horizon、Databricks Unity Catalog、Collate(OpenMetadata);需要存储+目录一体选 MinIO AIStor、SeaweedFS;需要表生命周期自动化选 Ryft、Upsolver、IOMETE。
无论选择哪个厂商,都可回到当前仓库验证其协议合规性:用 open-api 的兼容性测试框架对目录端点做 RCK 校验,用 aws、azure、gcp 等第一方实现作为文件系统与目录集成的参照,让 Iceberg 的"开放"真正落地为可验证的互操作。
本文厂商能力描述均源自官方站点 vendors.md,仓库源码与文档仅用于佐证实现路径;各厂商具体功能细节与最新支持范围请以厂商官方发布为准。
- 数据湖
- 大数据
- 数据存储
【免费下载链接】iceberg
Apache Iceberg
相关推荐
Apache Iceberg Python 库指南
Apache Iceberg Python 库指南 Apache Iceberg 是一个现代的数据表存储框架,支持大规模数据处理,提供高性能和灵活的数据版本控制
大数据数据库Apache Iceberg文档架构解析与技术生态全景
Apache Iceberg文档架构解析与技术生态全景 Apache Iceberg作为新一代开源表格式标准,其文档体系结构清晰地反映了项目的技术架构和生态系统
数据湖大数据数据存储Apache Iceberg Hive表迁移完全指南
Apache Iceberg Hive表迁移完全指南 概述 在现代数据架构中,将传统Hive表迁移到Apache Iceberg表已成为提升数据管理能力的重要步
数据湖大数据数据存储
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考