Snowflake Horizon Catalog扩展至企业非结构化数据
历史编译稿 旧版 AI 基于原文编译
Snowflake Horizon Catalog正在向企业非结构化数据资产扩展。官方博客明确了这一方向,其核心理念是“元数据优先,内容按需获取”。这意味着Snowflake希望将统一目录能力延伸至文件和对象存储领域,弥补企业数据资产中最后一块未被充分覆盖的部分。
Horizon Catalog的愿景是构建一个单一目录,让每个数据和AI资产都可被发现、可治理,并准备好产生可信答案。这包括表、应用、模型、列表,甚至外部目录中的数据。如今,非结构化数据成为这一愿景需要攻克的新边界。
大约80%的企业数据以文件和对象形式存在,其中大部分位于本地部署环境。这些数据涵盖媒体素材、芯片设计文件、医学影像、合同、传感器数据等,广泛分布在NAS、对象存储和归档层中,来自多家存储供应商。长期以来,这些非结构化数据与结构化数据割裂,难以统一治理和利用,也给AI应用获取可信数据带来障碍。
Snowflake的策略是“元数据优先,内容按需”。也就是说,首先通过统一目录捕获和管理文件的元数据,使数据可发现、可治理,而在实际使用时再按需获取内容。这种方式避免了对非结构化数据的大规模复制和迁移,降低了成本和复杂度,同时让企业和AI应用能够通过统一入口访问这些数据。
对于数据从业者而言,这一举措意味着数据平台正逐步将非结构化数据纳入统一治理体系。随着AI应用对多种数据类型的需求增加,企业需要确保数据资产不仅包括表格,还包括文件、图像、视频等。Snowflake Horizon Catalog的扩展有助于打通结构化与非结构化数据之间的壁垒,为可信AI答案提供更完整的数据基础。
此外,该扩展也反映了数据目录在数据平台中的核心地位。无论是数据湖、数据仓库还是外部数据源,统一目录已成为实现数据发现、治理和访问控制的关键。未来,企业有望通过一个目录管理所有数据资产,无论其存储在何处、格式如何。
总体来看,Snowflake此举聚焦于企业非结构化数据这一庞大而未被充分利用的领域。通过元数据优先的策略,它正在为解决企业数据资产难以发现和治理的痛点提供新路径,也为数据驱动的AI应用铺平道路。数据团队应关注这一趋势,并思考如何在自己的架构中采纳类似能力。