近日,数据与人工智能平台领导者Databricks宣布对其Marketplace(市场)进行重大功能升级,新增IP Protection(知识产权保护)、Job Compute(任务计算)以及Secret Management(密钥管理)三项核心能力。这一系列更新旨在解决企业在数据协作与AI模型共享过程中长期面临的合规、计算隔离与安全痛点,进一步巩固Databricks在湖仓一体生态中的开放性与可治理性。
背景:从数据共享到安全协作的演进
Databricks Marketplace自2022年推出以来,一直致力于成为数据、模型与应用的“一站式交易市场”。企业用户可以在平台上发布和订阅数据集、机器学习模型、笔记本以及Dashboards,实现跨组织的数据货币化与协作。然而,随着AI应用加速落地,用户对数据共享的合规性、计算资源的独立性以及敏感信息的管理提出了更高要求。此次三大新功能的发布,正是对此类需求的直接响应。
IP Protection:为共享数据加装“法律+技术”双保险
在数据交易中,知识产权(IP)保护是用户最关心的问题之一。传统数据市场往往难以防止订阅方对数据进行非法复制、逆向工程或二次分发。Databricks此次推出的IP Protection功能,通过细粒度的使用条款与自动化审计机制,为数据提供者提供了更强有力的保障。
具体而言,数据提供者可以在发布产品时,通过统一许可管理器定义具体的使用限制,例如“仅用于非商业分析”“禁止训练竞争对手模型”或“禁止再分发”。这些条款不仅以法律文本形式呈现,更通过技术手段在Databricks平台内强制执行——例如,当订阅方尝试将数据导出到非授权环境时,系统将自动阻断操作并记录审计日志。此外,所有数据交换都基于Unity Catalog的访问控制,确保数据不会脱离平台的安全边界。
“IP Protection让数据提供者能够放心地分享高价值资产,而不必担心被滥用。”Databricks产品副总裁在发布会上表示,“这标志着数据市场从‘信任驱动’向‘可验证合规’的转型。”
Job Compute:实现安全的“数据不动,计算流动”
长期以来,对于包含敏感数据(如个人隐私、商业秘密)的共享数据集,订阅方通常需要将数据复制到自己的计算环境中进行分析,这增加了数据泄露的风险。Job Compute功能则打破了这一模式:它允许数据消费者直接在数据提供者的计算环境(即Databricks工作区)中运行托管作业,而无需访问底层数据。
工作流程如下:数据消费者可以在Marketplace中选择支持Job Compute的数据产品,然后提交一个分析任务(如Spark作业或Notebook)。该任务将在提供者的安全集群中执行,仅将结果(聚合统计、模型权重等)返回给消费者。所有敏感数据始终留在原处,且消费者无法直接读取原始记录。这种“数据不动、计算流动”的模式,尤其适用于医疗、金融等强监管行业。
值得注意的是,Job Compute还支持“付费即用”模式——消费者仅为实际消耗的计算资源付费,提供者则能从数据使用中获取收益。这一机制极大地降低了多方联合分析的门槛。
Secret Management:零信任架构下的密钥集中管控
在数据处理与AI流水线中,密钥(如API令牌、数据库密码、云服务凭证)的管理一直是安全薄弱环节。不同团队或合作伙伴在共享环境使用密钥时,往往面临硬编码、权限混乱和泄露风险。Databricks Secret Management新功能将密钥管理直接嵌入到市场生态中。
现在,数据提供者或平台管理员可以在Marketplace中创建“安全变量”,并将其与特定的数据产品或组件绑定。当消费者订阅并运行相关作业时,自动化工作流会在运行时注入密钥,但消费者无法通过任何方式查看或提取这些密钥。此外,密钥支持自动轮换与过期策略,且所有访问行为均被记录到审计日志中。
这一功能对于多团队协作的AI项目尤为重要——例如,一个基于Marketplace的实时欺诈检测模型,可能需要调用多个外部API。借助Secret Management,模型开发者不必再手动分发凭证,而是通过市场统一管理,极大地减少了人为错误和内部威胁。
行业影响与未来展望
此次更新被业界视为Databricks强化其“开放治理”战略的重要一步。通过IP Protection、Job Compute和Secret Management,Databricks实际上构建了一个“高安全性的数据协作网格”——数据提供者可以定义规则,消费者可以安全地计算,密钥则由平台统一托管。这有望打破数据孤岛,加速AI模型的跨组织训练与推理。
分析人士指出,随着企业对于数据主权与隐私合规的要求日益严格,类似Databricks Marketplace这样的“可治理数据市场”将成为主流。目前,该功能已在AWS、Azure和GCP上的Databricks工作区中可用,并支持与Unity Catalog深度集成。
未来,Databricks计划进一步引入基于差分隐私的自动化匿名化工具,以及面向联邦学习的原生支持。可以预见,一个更加安全、开放且高效的AI数据生态正在加速成型。