什么是数据湖仓一体?

Jeffrey Erickson | 资深撰稿人 | 2025 年 12 月 10 日

为什么分析团队都在逐步弃用原有的数据仓库和数据湖,转而采用数据湖仓一体架构?有三个原因。首先,需要分析的数据在数量和多样性方面持续增长。其次,人们希望在更广的范围内提供由 AI 自动化驱动的实时数据分析。最后,批量云存储和开放表数据架构的出现使得数据湖仓一体更易于组装和管理。

什么是数据湖仓一体?

数据湖仓一体是一种数据分析架构,它将数据湖(擅长存储和分析非结构化数据)的灵活性与传统数据仓库的管理功能和可预测能力相结合。其实现方式是在一套架构中融合存储、治理和计算,该架构支持结构化、半结构化和非结构化数据,以及数据工程、AI/ML 和分析等多种工作负载,同时提供数据持久性保障。

当您的业务需要统一结构化和非结构化数据以实现协作分析,并支持可扩展的 AI 和机器学习用例时,可以考虑采用数据湖仓一体。


数据湖仓一体架构图,说明如下
数据湖仓一体架构被描绘为雪景球中的湖畔房屋,标注为“对象存储”,周围环绕着数据源、数据摄取与移动、数据使用与治理、安全与监控,以及统一 API 与访问控制等相关信息。
数据湖仓一体架构将数据湖的低成本、灵活存储与数据仓库的结构化分析功能相结合。

关键要点

  • 数据湖仓一体将数据湖的灵活性与数据仓库的性能和数据管理功能相结合,支持对大规模、多样化数据集进行数据分析。
  • AI 模型和 agent 通常依赖对数据湖仓一体的实时访问,才能在输出中提供最新的企业信息。
  • 数据湖仓一体支持多种不同格式的结构化、半结构化和非结构化数据,并且大多使用经济高效的云存储来构建。

数据湖仓一体详解

数据湖仓一体是一种数据架构,它使用 Parquet 等开放的栏格式文件格式,以及 Apache Iceberg、Delta Lake 或 Hudi 等开放表格式,使组织能够用开放格式直接在对象存储上存储大量数据。数据湖仓一体还提供团队清理数据、强制实施模式和支持 ACID 事务所需的工具。

由于数据湖仓一体可以通过单一平台服务于多种数据用途,包括商业智能 (BI)、机器学习与 AI 以及实时分析,因此可以最大限度地减少数据的复制和移动。

数据湖仓一体、数据湖与数据仓库的对比

数据湖(湖仓一体中的“湖”)是一种低成本存储库,主要由数据工程师使用,但业务分析师和其他类型的最终用户也会使用。数据湖可存储来自各种来源的各种类型的原始数据,并使其可供以原始格式进行探索。

数据仓库(湖仓一体中的“仓”)与数据湖的不同之处在于,数据仓库存储的是经过处理、为特定目的精心整理、并具有指定格式的结构化和半结构化数据。这些数据通常由业务人员查询,他们在分析工具中使用准备好的数据进行报告和预测。近期,能够编写 SQL 代码的大语言模型 (LLM) 在某些数据仓库中实现了自然语言查询。

数据湖仓一体结合了这两种架构。现在,数据可以在具备低成本、灵活存储的数据湖与数据仓库之间轻松双向迁移。现在,用于实施模式和治理的数据仓库管理工具,以及用于从数据中提取洞察的机器学习和人工智能系统,都可以访问公司数据湖中的所有原始数据。

这实现的成果是一个数据存储库,它整合了数据湖的经济实惠和非结构化特性,以及数据仓库的高度就绪性。

数据湖仓一体如何运作?

传统数据仓库长期以来一直为企业提供报告和分析当前及历史数据所需的可靠性和性能,但在面对来自不同来源的非结构化内容时,企业可能会在规模化和复杂性方面遇到困难。相比之下,数据湖为多种数据类型提供了经济实惠的存储,但可能缺乏企业分析所要求的治理、一致性和性能。

数据湖仓一体模型通过在数据湖(通常位于批量云存储中)之上引入事务性存储层克服了这些局限性。该模型使企业能够高效地处理海量数据集,同时帮助强制实施一致性、确保数据完整性并支持模式演化。AI 模型AI agent进一步增强了数据湖仓一体环境,它们可以自动执行数据目录编制、异常检测和动态资源分配,同时保持数据质量并强制执行合规规则。

数据湖仓一体的能力

数据湖仓一体可以充当企业数据的终极存储库,并支持各种分析。以下是您可以获得的一些能力。

  • 可访问的一致数据能够促进 AI 模型的开发、训练和部署。
  • 集中式数据安全和访问控制可降低数据丢失或泄露的风险,并满足政策和合规性要求。
  • PB 级存储和海量计算资源意味着数据湖仓一体可以支持拥有海量数据和高要求用例的高增长企业。
  • 同时支持结构化和非结构化数据,支持涉及分析、AI 和报告的多样化用例。
  • 支持可靠且一致的事务,使数据湖仓一体适用于要求苛刻的运营和分析工作负载。
  • 统一架构通过消除为不同分析环境配置独立存储的需求,最大限度地减少数据重复。

数据湖仓一体的优势

作为超大数据集的主要存储和分析系统,数据湖仓一体支持高级分析、实时决策和 AI 模型开发,同时可简化数据基础设施和治理。

具体而言,数据湖仓一体能够:

  • 将数据湖的灵活性与数据仓库的性能相结合。 数据湖仓一体架构融合了数据湖对象存储的灵活性与数据仓库的性能。这使得组织能够在单一平台内同时处理原始的未处理数据和结构化数据,并支持多样化的分析工作负载。
  • 支持实时和批量处理。 数据湖仓一体同时支持流式处理和批量数据处理,帮助组织通过实时分析及时获得洞察,同时在单一平台上满足多样化的深度处理需求。
  • 增强分析与机器学习集成。 数据湖仓一体架构使数据科学家和分析师能够处理多种数据类型。这使得开发 AI 驱动的应用程序成为可能,这些应用程序通常能够从积累的数据中获取更深入、更准确的洞察。
  • 提供强大的治理与安全性。 基于云的数据湖仓一体通过加密、访问控制和审计提供可靠的数据治理。此框架有助于保持合规性、保护敏感数据以及维护利益相关方的信任
  • 减少数据复制与移动。 通过为所有数据类型提供单一存储库,湖仓一体消除了对多个独立数据存储库的需求。这减少了数据重复,有助于降低存储成本,并简化了数据管理和维护,使保持数据一致性和准确性变得更加轻松。
  • 借助云存储经济高效地扩展。 由于数据湖仓一体架构专为云存储而设计,而云存储可提供弹性扩展以适应不断变化的数据量,因此组织可以实现可扩展性。云技术提供商还通过分层存储和生命周期管理来帮助平衡存储成本。
  • 支持结构化、半结构化和非结构化数据。 数据湖仓一体的一个显著优势是能够支持几乎所有数据类型:结构化、半结构化和非结构化数据。这使组织能够管理来自不同来源(如 IoT 设备、日志文件、事务系统和用户反馈系统)的数据,并执行涉及多种数据类型的综合分析。

数据湖仓一体面临的挑战

运营良好的数据湖仓一体能够为各种大型现代数据分析运营创造价值。但这需要规划、资金、时间和调优。以下是构建和维护数据湖仓一体时面临的挑战。

  • 复杂性:数据湖仓一体引入了需要规划和持续管理的新架构层。要在集成多种分析工具的同时实现事务一致性和可扩展存储的双重优势,需要精心的设计和定义明确的治理模型。所有这些都增加了复杂性。
  • 数据质量问题:如果数据管道管理不善,可能会引入不一致性,降低分析输出的准确性和可信度。自动验证工具和记录完善的流程是确保在数据摄取和转换步骤中保持高数据质量的关键。
  • 性能优化需求:如果不进行精心优化,跨多样化数据集运行大规模分析可能会引入瓶颈。持续调优和监控对于提供高效处理并最大限度减少延迟十分必要,尤其是在数据量增长和/或数据湖仓一体分布在多个云端位置或涉及多个提供商的情况下。
  • 跨多样化数据类型提供一致的治理:同时支持结构化和非结构化数据会使访问控制、元数据管理和数据血缘追踪变得更加复杂。维护一致的治理方案需要统一的策略框架和审慎的自动化,包括在适当情况下集成 AI agent。
  • 混合结构化与非结构化数据带来的安全风险。 组合多种数据类型提升了综合数据保护策略的重要性。如果没有强有力的访问控制和持续监控,敏感信息可能更难追踪和保护,好在 AI 赋能的解决方案可以在这些方面提供支持。
  • 大量设置与集成工作:实施湖仓一体通常需要在设计、数据迁移以及与当前数据和分析平台集成方面投入大量前期成本。组织还必须设计新的工作流,这项任务往往涉及多个职能团队和广泛的测试。
  • 技能差距:转向湖仓一体架构可能需要团队掌握数据工程、云技术服务和 AI 工具方面的新专业知识。在预算中为培训、技能提升和跨团队协作安排时间和资金,对于顺利采用和持续的运营成功至关重要。

数据湖仓一体架构层

构建能够可靠地给出答案和预测的数据湖仓一体,需要在技术栈的不同层级组合使用多种技术。虽然云技术提供商隐藏了大部分复杂性,但组织仍然需要理解其运作机制。

  1. 摄取层:摄取层是数据湖仓一体的入口点,通过 API 从运营数据库、流处理平台和其他来源实时或批量捕获数据。有效的摄取层应支持多种格式,并能够安全可靠地将原始数据导入湖仓一体。
  2. 存储层:作为湖仓一体的核心,存储层提供可扩展且经济高效的数据存储。它处理结构化表、半结构化日志以及非结构化文档或媒体,为分析和 AI 应用程序创建统一的数据基础。
  3. 元数据与目录层:该层维护所存储数据的基本上下文信息。目录用于注册模式、管理数据血缘以确保透明度,并为数据和文件建立索引,以支持快速发现和高效查询。AI agent 可以自动执行目录更新并监控元数据的完整性。
  4. 处理层:处理层负责编排数据准备工作,包括清洗、规范化和转换。它支持批量和实时工作负载,也是构建或执行 AI 和机器学习管道的位置。
  5. 治理与安全层:治理与安全贯穿架构的所有层级,强制执行数据隐私、合规性、访问控制和可审计性等策略。该层负责管理访问策略、跟踪数据血缘,以及应用自动加密和监控来保护敏感信息。
  6. 服务层:该层专注于使分析就绪的数据可供下游使用。它可优化数据集以提高性能和可靠性,为来自商业智能平台、运营仪表板和 AI 建模框架的请求提供服务。
  7. 使用层:使用层为最终用户提供对精心整理的数据的直观访问。分析师、数据科学家和 AI agent 使用此界面生成报告、构建可视化内容和创建预测模型,推动整个组织获取可执行洞察。

数据湖仓一体用例

对于所有希望从海量多样化数据集中获取实时、AI 驱动型洞察的组织来说,数据湖仓一体都非常实用,正如以下真实案例所示。

  • 在线销售:一家动态在线销售商使用数据湖仓一体来改进其电子商务平台。湖仓一体架构不仅可以为库存和发货物流提供支持,还使品牌能够与买家分享针对性的内容,并利用 AI 来理解和分享其平台上发布的用户生成内容。
  • 专业服务:Bevi 是一家为商业空间提供创新智能饮水机的设计公司,他们需要替换其手动、割裂的现场服务流程,以支持快速增长。

在 OCI 上构建数据湖仓一体

在 Oracle AI Data Platform 上构建企业数据湖仓一体后,您将能够集成和分析来自不同来源的数据,并快速应用最新的 AI 创新。该平台提供了企业可靠性与治理能力以及开源灵活性的强大组合。例如,您可以在同时支持 Delta Lake、Parquet 和 Iceberg 等开放格式的平台上,获得与 Oracle Autonomous Data Warehouse、Oracle Analytics Cloud 和 OCI AI 服务组合的原生集成。借助数据管理系统附带的全套 AI 和 ML 服务,推动您的 AI 自动化计划,这些服务包括可生成洞察和预测同时有助于降低运营开销的预训练模型。

数据湖仓一体使组织能够以可扩展且受治理的方式充分利用其信息的全部价值。凭借对分析和 AI 功能的内置支持(通常由智能 agent 驱动),湖仓一体可为企业计划提供性能、灵活性和合规性。

对于希望利用 AI 的数据驱动型组织,数据湖仓一体正在成为新标准。以下是具有前瞻性的公司为迎接未来而采取的另外七种措施。

数据湖仓一体常见问题解答

数据湖仓一体与数据仓库有何区别?

数据仓库针对结构化数据和一致的报告进行了优化,而数据湖仓一体则将数据仓库的这些特性与数据湖的可扩展性和灵活性相结合,支持更广泛的数据类型和分析。

数据湖仓一体与数据网格有何区别?

数据湖仓一体是一种统一的技术架构,融合了数据湖的灵活性和数据仓库的管理功能,实现存储和分析的集中化。相比之下,数据网格是一种组织方法,它强调去中心化的数据所有权和领域驱动型设计,通常利用分布式架构;湖仓一体平台可以作为更广泛的数据网格策略中的一个组成部分。

数据湖仓一体能否取代数据仓库?

数据湖仓一体除了可以处理半结构化和非结构化数据外,还提供结构化存储、ACID 事务和分析功能,通常能够取代传统数据仓库。但是,在过渡之前,应仔细评估迁移需求和与遗留系统的兼容性。

AI 在数据湖仓一体中发挥什么作用?

AI 通过自动化元数据管理、确保数据质量,以及通过智能监控和建议来优化资源,从而增强数据湖仓一体。此外,数据湖仓一体也是 AI 系统的赋能技术,因为它支持实时访问多种类型的数据文件。

注:为免疑义,本网页所用以下术语专指以下含义:

  1. 除Oracle隐私政策外,本网站中提及的“Oracle”专指Oracle境外公司而非甲骨文中国。
  2. 相关Cloud或云术语均指代Oracle境外公司提供的云技术或其解决方案。