记者 陈睿 报道

在2023年Data+AI峰会上,Databricks正式推出了一项名为LakeBridge的全新连接服务,旨在实现数据湖与数据仓库之间的实时、双向数据同步。这一创新举措被业界视为数据湖仓一体化进程中关键的一步,有望彻底改变企业数据架构中“湖”与“仓”长期割裂的困局。

破解数据孤岛:从批处理到实时流动

长期以来,企业数据架构面临一个核心矛盾:数据湖擅长存储海量原始数据并支持机器学习的探索性分析,而数据仓库则擅长结构化查询和BI报表,两者在技术栈、存储格式和实时性要求上存在天然壁垒。传统做法是通过ETL/ELT工具进行批量数据迁移,但这种方式不仅带来数小时甚至数天的延迟,还增加了存储冗余和运维成本。

LakeBridge的诞生正是为了解决这一痛点。据Databricks官方介绍,LakeBridge基于Delta Sharing协议和变更数据捕获(CDC)技术,能够在数据湖(以Delta Lake为核心)与主流数据仓库(如Snowflake、Amazon Redshift、Google BigQuery)之间架设一条低延迟、高吞吐量的实时管道。与过去单向、批量的数据搬运不同,LakeBridge支持双向同步——用户既可以将数据湖中的非结构化/半结构化数据实时推送到仓库供分析师查询,也可以将仓库的聚合结果或维度表反哺回湖中的ML模型训练流程。

技术亮点:零拷贝、开放格式与安全治理

LakeBridge的核心优势体现在三个层面。首先是“零拷贝”架构——它并不创建数据的物理副本,而是通过共享元数据和逻辑视图实现底层数据的直接访问。这意味着数据只需在湖中存储一次,仓库通过LakeBridge即可像查询本地表一样实时访问最新数据,避免了冗余存储和同步开销。其次是开放格式支持,基于Delta Lake、Apache Parquet等开放标准,LakeBridge确保了数据的可移植性,不会被任何单一供应商锁定。最后,安全治理层面,LakeBridge继承了Databricks Unity Catalog的细粒度权限控制,同一张数据表在不同引擎中保持相同的数据访问策略,免去重复配置的麻烦。

在性能方面,Databricks宣称LakeBridge的端到端延迟可控制在秒级,远低于传统T+1模式的数小时延迟。对于需要分钟级数据新鲜度的实时看板、风控模型或运营决策场景,这一突破尤为关键。

应用场景:从实时分析到混合云协同

LakeBridge的推出迅速引发企业CIO和技术架构师的关注。某跨国零售企业的数据负责人表示,他们此前需要在Databricks湖中对用户行为日志进行特征工程,再将结果批量导入Snowflake供业务分析师制作实时促销看板,整个过程耗时约3小时。借助LakeBridge,这一流程缩短至10秒以内,且无需维护两套数据副本。

此外,LakeBridge还适用于多云和混合云场景。例如,一家公司的核心数据存储在AWS上的Databricks数据湖中,而财务部门使用Azure Synapse Analytics作为报表仓库,LakeBridge能够在不同云平台间建立安全的实时数据通道,无需复杂的手动配置。对于那些希望逐步将分析负载从传统数仓迁移到数据湖的企业,LakeBridge也提供了一条平滑的“双跑”路径——在迁移期间保持两套系统的数据一致,降低切换风险。

市场格局:加速“湖仓一体”生态成熟

分析师指出,LakeBridge的发布并非孤立的补丁,而是Databricks构建“湖仓一体”生态战略的重要一环。过去,Databricks通过Delta Sharing实现了跨组织的数据共享,如今通过LakeBridge将这一能力延伸到跨引擎的实时协同,本质上是在打造一个“湖为中心、仓为终端的互联网络”。

不过,LakeBridge也面临竞争。Snowflake此前推出了自己的跨云数据共享功能(Snowflake Data Sharing),亚马逊Redshift也具备零ETL与S3数据湖的集成能力。不同之处在于,LakeBridge强调“双向”和“实时”,而前者多侧重单向或批量。可以说,LakeBridge正在定义一种更灵活的数据流动范式。

未来展望:数据架构从“迁移”走向“联结”

随着实时数据需求成为常态,企业不再需要在一个数据平台中完成全部工作,而是需要不同平台之间能智能、实时地协作。LakeBridge正是这种“联结”思维的产物。Databricks联合创始人兼CEO Ali Ghodsi在采访时表示:“我们的目标不是取代数据仓库,而是让数据湖与数据仓库像同一个系统一样工作。”

可以预见,LakeBridge的出现将加速企业数据架构的去中心化进程,推动数据湖、数据仓库、机器学习工作负载在统一治理下的实时融合。对于正在数字化转型中挣扎的企业来说,这或许是一个值得关注的转折点。