数据湖仓已成为企业数据战略的核心,这得益于数据整合的需求、开放标准的涌现,以及生成式AI的兴起。
企业分析和生成式AI对集中式数据存储的需求,使数据湖仓成为企业数据的默认选择,与此同时,开放表格式标准的出现让这一转型更加顺畅,在降低厂商锁定风险的同时,也促进了湖仓与其他企业系统及服务提供商之间更好的集成。
数据湖仓融合了数据仓库的结构化能力与数据湖的灵活性,使其成为充分利用企业所采集各类数据的多功能工具——无论是用于商业分析、与其他系统集成,还是为大语言模型提供相关上下文。
Gartner 分析师 Adam Ronthal 表示,数据湖仓背后的理念,就是将数据湖和数据仓库各自的优势合二为一。
数据仓库还能让企业存储大量具有明确定义模式的结构化数据,因为它的设计初衷就是支持大量并发查询,并能快速向众多同时在线的用户返回结果。
而数据湖则让企业能够以多种格式采集原始的非结构化数据,供数据分析师从中挖掘,这些庞大的数据池近年来备受关注,正是因为它们为企业提供了灵活存储海量数据流的能力,而无需事先定义存储目的。
据 Gartner 称,数据湖仓是数据架构演进的下一步,它将上述两种能力合并到单一平台中,以克服以往架构的局限性、降低复杂度、简化数据管理,并支持多样化的工作负载。
2025 年末,Gartner 还发布了首份数据湖仓平台市场指南,Ronthal 与合著者在报告中写道:"湖仓如今已牢牢确立为大多数企业力求标准化采用的架构。"
与此同时,数据湖仓本身也在向 Apache Iceberg 数据表格式看齐,这一格式最初由 Netflix 于 2017 年创建,次年捐赠给 Apache 软件基金会。2024 年,随着 Apple、LinkedIn、Adobe 以及各大云厂商的采用,Iceberg 迎来了转折点,就连创建了竞争标准 Delta Lake 的 Databricks,如今也原生支持 Iceberg。
咨询公司 OSF Digital 的首席AI官 Gerry Szatvanyi 表示,湖仓厂商正在更加开放其架构,以便第三方更好地访问数据。"几年前还不是这样。"他说。
他还表示,其他企业服务提供商也在借此获利。例如,Salesforce Data Cloud 可以直接连接 Iceberg 格式的数据。
"Salesforce 拥有零拷贝访问格式,因此它可以将自身的数据平台连接到另一个数据湖,而无需将数据复制到 Salesforce 内部。"Szatvanyi 说。
当然,正如当今企业领域的一切一样,生成式AI正在产生巨大影响。数据湖仓对大语言模型尤为适用,因为它能为检索增强生成嵌入和模型上下文协议访问提供关键的业务上下文——这是向大语言模型输入数据的两种最常见方式。
"湖仓正被越来越多的AI代理访问,"Szatvanyi 说,"这是我观察到的最主要的趋势。"
他还补充道,就连传统的商业分析如今也越来越多地通过AI界面来完成,从而实现了企业数据的用户民主化访问。
在 IDC 近期发布的一份报告中,数据平台领域的领先厂商包括 Databricks、Google、Oracle 和 Snowflake,其他主要参与者还有 Microsoft、IBM 和 Cloudera。IDC 还将 Amazon SageMaker 列为值得关注的湖仓平台,但该平台直到 2025 年初才广泛可用,因此尚未被列入顶级厂商之列。
Gartner 则将 Databricks、Google、Oracle、Snowflake、Microsoft、IBM、Cloudera 和 Amazon SageMaker 等列入其数据湖仓平台代表性厂商名单,此外还有其他公司。
数据湖仓的商业价值
Docusign 选择了 Snowflake 作为用于训练内部销售代理的数据平台,并正在训练其机器学习模型,以便更精准地服务客户。信息从 Salesforce 中提取,同时他们也在探索 Atlassian 和 ServiceNow,以及其他内部定制工具。
这些信息还通过检索增强生成嵌入管道输送给大语言模型,随着技术成熟,模型上下文协议连接也在探索之中。
其他公司采用数据湖仓,则是看重其所支持的数据源的灵活性以及能够处理的数据体量。
以 Sega Europe 为例,该公司早在 2016 年就开始使用 Amazon Redshift 数据仓库来采集旗下游戏《足球经理》的事件数据,起初,这些事件数据仅包括玩家开启和关闭游戏的记录。
"但我们能采集的数据远不止这些,"该公司数据服务负责人 Felix Baker 说,"比如玩家在管理哪些球队,或者花了多少钱。"
由于数据仓库对数据结构有特定要求,数据只能分批进入,分析耗时过长。
"我们希望实时分析数据,"Baker 补充道,但当时 Redshift 并不具备这一功能。"Databricks 提供了一套开箱即用的托管服务方案,完全满足了我们的需求,无需自行开发任何东西。"他说。此外,湖仓架构还让 Sega Europe 能够摄取非结构化数据,比如社交媒体动态。
凯捷咨询的AI转型负责人 Steven Karan 表示,为组织的所有结构化和非结构化数据提供统一来源所带来的成本效益,是数据湖仓的核心价值驱动因素,他已帮助金融服务、电信和零售行业的头部企业落地了数据湖仓。
此外,数据湖仓以一种可随时被广泛技术调用的方式存储数据,从传统的商业智能和报表系统到机器学习与AI均可使用。Karan 说:"其他优势还包括减少数据冗余、简化运维、统一数据模式管理,以及更易于实施数据治理。"
让数据释放价值
数据湖仓一个特别有价值的应用场景,是帮助企业从过去被困在遗留系统或孤岛系统中的数据中获取价值。例如,凯捷咨询的一位企业客户在过去十年间通过并购不断扩张,却无法访问与其产品经销商相关的数据。
"通过将孤岛数据从遗留数据仓库迁移到集中式数据湖仓,该客户得以在企业层面了解哪些经销商伙伴最为高效,以及推荐计划和架构调整等变化如何驱动营收增长。"他说。
充分利用数据湖仓优势的企业之一,是生命科学、分析与服务公司 IQVIA,该公司在数年前就开始采用数据湖仓。
IQVIA 临床数据分析高级产品管理总监 Wendy Morahan 表示,疫情之前,开展药物试验的制药公司通常会派员工前往医院和其他现场,采集不良反应等方面的数据。"这是他们确保患者安全的方式。"
然而疫情爆发、现场封锁之后,制药公司不得不紧急寻找获取所需数据的办法——而且要以符合监管要求的方式获取,同时速度要足够快,以便及时发现潜在问题。
Snowflake 和 Databricks 为该公司提供了在单一平台上以任意格式存储原始数据的能力,包括图像和音频。
湖仓采用率持续增长
据 Research and Markets 2 月份发布的一份报告,数据湖仓市场呈指数级增长。
2025 年市场规模达 103 亿美元,预计到今年年底将增至 126 亿美元,复合增长率为 22%,该研究机构预测,到 2030 年这一数字将达到 273 亿美元。
此外,根据湖仓厂商 Dremio 近期的一项调查,63% 的公司将大部分分析工作放在湖仓上运行,而非传统数据仓库,高于 2024 年的 55%。
遥测厂商 Cribl 的现场首席信息安全官 Ed Bailey 表示,数据湖仓也越来越多地被用于信息技术和安全工作负载。"过去,湖仓提供商主要面向业务数据领域,侧重结构化数据和查询语言。"
湖仓能够以更低的成本处理IT和安全数据,而考虑到该领域的数据体量,这一点至关重要。"即使是中型企业产生的信息技术和安全数据也远多于业务数据,"他说,"湖仓厂商终于开始向这一市场发力了。"
但目前仍处于早期阶段,现有方案尚不成熟,与这类数据的适配也不够理想。"IT和安全数据与业务数据有很大不同,"他补充道。例如,业务数据往往更可预测、结构更规整。此外,业务用户比IT和安全用户更熟悉数据分析工具的使用。"这种错配一直是推广采用的严重障碍。"他说。
数据湖仓还在以另一种方式演进,Gartner 认为,湖仓并非终极方案,而是通往更先进系统(如数据编织)的过渡架构。两者的区别在于:湖仓包含来自不同系统的数据,而数据编织仅包含指向数据原始存放位置的指针。
数据编织的优势在于能够保留并使用原始的安全访问控制和元数据,无需重复存储数据,也无需协调不同标准之间的差异。
"但它也带来了一些性能问题,访问也没那么无缝。"OSF Digital 的 Szatvanyi 说。
他认为,对于规模较小的公司来说,数据编织可能是一个不错的起点,当然也可以两者并用。"你可以把大部分数据放在湖仓里,再用编织来连接两三个次要系统,"他说,"但我要说,数据湖仓才是黄金标准。"