用Databricks构建高质量可信数据产品
DataHot 速览
Databricks官方博客介绍如何将产品思维应用于数据,构建企业级高质量、可信的数据产品。文中提及通过数据网格范式实现数据资产所有权与管理民主化,并指出无论是否采用数据网格,数据质量和可用性对数据驱动决策都至关重要。博客还给出基于Databricks平台落地数据产品架构的具体建议。
为什么值得关注:数据从业者可从中了解在湖仓平台上落地数据产品与数据网格原则的实践路径,对数据资产治理与平台建设有直接参考价值。
译文
AI 逐段翻译引言
旨在成为AI和数据驱动型企业的组织,通常需要为其内部团队提供高质量且值得信赖的数据产品。构建此类数据产品可确保组织为其数据和AI目标建立标准及可信的业务真相基础。一种将质量和易用性置于首位的方法是采用数据网格范式,以民主化数据资产的所有权和管理。我们的博客文章(第一部分、第二部分)提供了关于客户如何在其企业中利用Databricks来应对数据网格的基础支柱的指导,其中之一是“数据即产品”。
尽管将数据视为产品的想法可能因数据网格的出现而流行,但我们观察到,即使未选择采用数据网格的客户,应用产品思维也能引起共鸣。无论组织结构或数据架构如何,数据驱动决策仍是普遍指导原则。数据质量和可用性对于确保基于有效信息做出数据驱动决策至关重要。本博客将概述我们关于构建企业就绪数据产品的一些建议,既包括一般性建议,也包括针对Databricks的特定建议。
当用户和应用程序在正确的时间、以正确的质量和正确的格式获得正确数据时,数据产品最终会实现价值。虽然传统上这种价值通过降低成本、加快流程和降低风险而实现为更高效运营,但现代数据产品还可为组织所在行业或合作伙伴生态系统内的新增值产品和数据共享机会铺平道路。
数据产品
虽然数据产品可有多种定义,但它们通常与DJ Patil在《数据柔术:将数据转化为产品的艺术》中的定义一致:“首先,...一个好的数据产品定义是一种通过使用数据促进最终目标的产品”。因此,数据产品不限于表格数据,也可以是机器学习模型、仪表板等。要将此类产品思维应用于数据,强烈建议每个数据产品应有一个数据产品负责人。

图1:数据产品的关键方面数据产品负责人管理其数据产品的开发,并监控其使用和性能。为此,他们必须了解底层业务,并能将数据消费者的需求转化为高质量、易用数据产品的设计。他们与组织中的其他人一起,弥合业务与数据工程师等技术同事之间的鸿沟。数据产品负责人负责确保其产品组合中的产品符合组织在可信性特征方面的标准。
数据产品必须满足五个关键特征:
- 质量和可观测性:数据质量包括准确性、一致性、可靠性、及时性以及文档清晰度。可以监控和公开有关数据产品的已定义质量指标,以确保预期数据质量随时间保持。总体目标是使数据产品成为数据消费者信任的来源。
- 语义一致性:湖仓架构的目标是简化数据处理。因此,旨在一起使用的数据产品应在语义上保持一致。换句话说,它们应遵循约定的治理规则,并共享术语定义,以便消费者能够以有意义且正确的方式组合这些数据产品。
- 隐私:隐私涉及信息的机密性和安全性,涉及如何收集、共享和使用数据。数据隐私通常由法规法律(如GDPR、CCPA)管辖。遵守数据隐私规则可包括匿名化、加密、数据驻留、数据标记(如PII)、将存储限制在特定环境以及最小化少数员工的访问权限等主题。
- 安全性:除了拥有经信息安全批准的数据平台外,数据产品负责人仍需定义例如访问权限(谁可以访问数据、数据可与哪些合作伙伴共享等)及其数据产品的可接受使用政策。
- 可发现性:数据产品需要以组织内每个人都能找到的方式进行发布。这可能包括中央数据目录或内部数据市场等地方。数据产品负责人应在发布的产品中包含资产,使其易于理解数据以及如何与其他数据产品组合(例如示例笔记本、仪表板等)。
数据产品生命周期
典型数据产品生命周期包括以下阶段:
- 启动 – 在此阶段定义所需数据产品的业务价值,并指定负责人。还应定义性能和质量的指标以供监控。
- 设计 – 在此阶段创建设计规范和数据结构体等具体细节,确保与其他数据产品的一致性。
- 创建 – 创建实际数据产品可包括架构、表、视图、模型、任意文件(卷)、仪表板等,以及生成它们的管道。此阶段还包括根据已定义数据结构体测试最终数据产品。
- 发布 – 数据产品的创建和发布通常被视为同一回事,但它们非常不同。此阶段包括诸如部署模型、将架构发布到共享目录、根据数据结构体管理访问权限等活动。发布应涉及发布管理以版本化已发布数据产品的更改。
- 运营和治理 - 运营涉及持续性的活动,如监控质量、权限和使用指标。治理部分包括处理合规相关请求和审计数据产品访问等。
- 消费与价值创造 - 数据产品在业务中用于解决各种问题。消费者可根据使用体验向数据产品所有者提供反馈,并建议改进措施,以促进未来的进一步价值创造。
- 退役 - 数据产品退役可能有多种原因,如使用不足、数据产品不再合规等。无论如何,数据产品应以优雅的方式退役。这意味着弃用产品、通知消费者、归档资产并清理资源。在此,对下游使用的可见性通常很重要,如果自动捕获血缘关系,将大大简化此过程。

图2:数据产品的典型生命周期 在上图中,数据产品所有者对所有阶段负责,从数据产品的构思到退役。然而,个别任务的责任可与数据管理员、数据工程师等其他利益相关者分担。
数据产品实现的最佳实践
使用Databricks实现高质量的数据产品需要超越纯技术执行的周到方法。首先确定明确的所有权,设置了解业务需求和技术要求的专门数据产品所有者。预先定义全面的数据契约,包括质量指标、模式定义、使用策略和安全参数,以确保生产者和消费者之间的对齐。
构建管道时,利用Delta Live Tables (DLT),直接在代码中实现质量控制,利用内置期望和约束在每个阶段验证数据。实施分阶段开发方法,区分开发、测试和生产环境,确保在发布前保证质量。使用Lakehouse监控自动化监控,设置质量指标阈值告警,以便及早发现问题。
在Unity Catalog中广泛记录,使用技术规范和业务上下文,帮助用户理解和正确使用您的数据产品。为实现治理效率,跨数据产品标准化命名约定和元数据,提高可发现性和互操作性。最后,与消费者实施正式反馈循环,根据实际使用模式和用户需求持续改进数据产品。
Databricks数据+AI平台可用于数据产品生命周期中涉及的多项活动:
- ETL管道 - Delta Live Tables (DLT) 可用于构建稳健且 质量控制 的数据管道。 Auto Loader 和 流式表 可用于将数据增量加载到数据湖表 (Bronze) 层,供DLT管道或Databricks SQL查询使用。
- 治理 - Databricks Unity Catalog 功能丰富,专为企业实现简单统一的治理而构建。 Catalog Explorer 可用于数据发现,访问控制机制有助于向预期消费者发布数据产品。 血缘关系 和 系统表 自动跟踪,对运营治理至关重要。
- 监控 - Lakehouse监控 为监控数据和AI资产的质量提供单一、统一的解决方案。这种主动方法对于满足数据契约条款是必要的。
对于某些数据产品生命周期活动,如设计数据产品和数据契约,Databricks目前没有功能支持。这些过程应在Databricks数据+AI平台之外完成,数据产品发布后,将结果记录在Unity Catalog中。
数据契约
数据契约是对齐领域和实施联邦治理的正式方式。数据生产者应提供,但应以消费者为中心设计。契约应以所有类型用户可消费的方式制定。
典型的数据契约具有以下属性
- 数据描述 (名称、描述、源系统、属性选择等)
- 数据模式 (表、列、匿名化和加密信息、过滤器、掩码等)以及 数据格式 (半结构化和非结构化数据)
- 使用策略 (标签、个人身份信息、指南、数据驻留等)
- 数据质量 (应用的质量检查和约束、质量指标等)
- 安全 (谁被允许使用数据产品)
- 数据服务等级协议 (最后更新、过期日期、保留时间等)
- 责任 (所有者、维护者、升级联系人、变更流程等)
此外,可以提供支持资产,如笔记本、仪表板等,以帮助消费者理解和分析数据产品,从而促进更易采用。
数据治理团队
企业中的数据治理团队通常由来自不同群体的代表组成,如业务所有者、合规和安全专家以及数据专业人员。该团队应作为合规和数据安全主题的卓越中心,并支持对数据产品负责的数据产品所有者。他们在制定数据契约方面发挥关键作用,通过扩展使用策略以及影响谁被允许使用数据产品的决策。对于大型组织,这样的团队可以帮助指导数据契约制定过程,并与全球职能(如数据管理办公室)保持一致和标准化。
发布与认证
尽管已建立数据契约,数据产品的治理仍是一个广泛的主题,涵盖访问控制、个人身份信息(PII)分类和各类使用政策等方面,这些在不同组织间可能有所差异。然而,我们观察到一个一致的趋势,即数据产品的发布。随着消费者接触到越来越多的数据集,他们通常需要确保数据经过管理、标准化并得到官方批准使用。例如,在大型组织中,报告或主数据管理用例可能要求企业内不同数据资产之间存在高度的语义一致性和互操作性。
这就是数据产品“认证”概念对某些数据产品变得有价值的地方。在此过程中,数据生产者首先可以提出数据契约规范,通常需要由数据治理管理员或团队审查。批准后,可运行持续集成/持续部署(CI/CD)流程,以部署生产管道,这些管道将数据物理写入客户的云存储账户。然后,这些数据可以通过Unity Catalog表、视图甚至非表格数据的卷发布,并易于发现。在此上下文中,Unity Catalog支持使用标签以及Markdown来指示数据产品的认证状态和详细信息。

图3:数据产品“认证”流程 一些客户甚至可能通过发布相应的私有列表在Databricks市场中推广其经过认证的数据产品,并附上全面的指南和使用示例。此外,Databricks的REST API以及与Alation、Atlan、Coalesce和Collibra等企业目录解决方案的集成,也促进了经过认证的数据产品通过多种渠道(甚至Databricks之外)的轻松可发现性。
用例与成功案例
汽车行业:Rivian的车辆智能平台 电动汽车制造商Rivian,利用Databricks处理来自道路上超过25,000辆车辆的IoT传感器数据,每辆车每天产生TB级数据。其高级驾驶辅助系统(ADAS)团队使用该平台分析遥测数据,包括俯仰、侧倾、速度、悬架和安全气囊活动的信息,这有助于Rivian了解车辆性能和驾驶模式。通过利用Databricks Lakehouse平台,他们实现了30%-50%的运行时性能提升,从而获得更快的洞察并提高模型准确性。这种数据驱动的方法使Rivian能够实施预测性维护、优化部件可靠性并持续改进客户驾驶体验。
医疗保健:Walgreens的处方个性化 Walgreens是美国最大的药房连锁店之一,使用Databricks转型了患者体验,大规模处理处方数据。凭借每年在近9,000个地点处理超过8.25亿张处方,Walgreens在Databricks上构建了其信息、数据和洞察(IDI)平台,以每秒处理40,000个数据事件。这优化了其供应链,通过合理调整库存水平节省了数百万美元,并将药剂师生产力提高了20%。该平台使药剂师能够通过强大的患者档案提供更好的护理,包括药物相互作用警报、药物档案变化和其他关键信息,以实现更安全的处方管理。
制造业:Mahindra的AI驱动分析 Mahindra & Mahindra Limited是一家全球制造集团,已实施企业级AI解决方案使用Databricks以增强其业务运营。其面向财务分析师的GenAI机器人使日常任务花费时间减少了70%,使团队能够专注于更高价值的战略计划。该公司正在利用Databricks Data + AI平台处理多个用例,包括使用Databricks DBRX开源LLM构建的客户之声聊天机器人,该机器人通过Delta Lake集成内部数据以及来自网站和社交媒体外部数据。这种全面方法正在帮助Mahindra推动增长、增强客户体验并优化运营效率。
电信行业:T-Mobile的数据网格架构 T-Mobile已成功实施数据网格架构使用Databricks,在保持安全性和治理的同时实现数据访问民主化。这家电信巨头使用Unity Catalog和Delta Sharing将其湖屋集成到数据网格中,使企业各部门能够访问和使用数据,同时维护合理且易于理解的安全模型。这种方法使领域团队能够创建和管理自己的数据产品,同时确保一致的治理,加速整个组织的分析计划并改进基于数据的决策。
数据产品的未来趋势 数据产品的未来正受到多个新兴趋势的影响,这些趋势将影响组织如何利用Databricks等平台。实时数据产品日益突出,因为企业需要越来越及时的洞察,流架构成为关键运营数据产品的标准。我们还看到自助式数据产品创建的兴起,业务领域专家使用低代码/无代码界面定义和构建数据产品,同时保持治理护栏。
融合了机器学习特性和洞察的AI增强型数据产品越来越普遍,模糊了传统数据与AI资产之间的界限。数据网格架构日益成熟,组织正在实施兼顾中央标准与领域自治的联邦计算治理。跨组织的数据产品正在兴起,能够安全地跨越企业边界,数据清洁室和隐私保护计算促成了新的协作洞察。
数据合约正在演变,包含更复杂的数据质量保证、隐私控制和用途权利,成为可执行的规范,而非静态文档。嵌入运营应用程序中的分析日益增长,数据产品专门用于支持应用内洞察,而非独立的分析环境。最后,可持续性指标正被纳入数据产品,在传统业务KPI之外追踪环境影响,以支持ESG报告和绿色倡议。
结论
在大型企业环境中,制定数据产品和数据合约可能成为复杂的任务。鉴于与数据交互的新技术涌现,加之现代业务和监管要求,数据产品和合约的规范正在持续演进。如今,Databricks Marketplace和Unity Catalog成为数据消费者发现和入门数据体验的核心组件。对于数据生产者,Unity Catalog提供了关键的治理功能,包括血缘、审计和访问控制。
随着数据产品超越简单的表或仪表板,涵盖AI模型、流等,客户可以在Databricks上,为所有主要用户角色获得统一一致的治理体验。
本博客中强调的企业数据产品的关键方面,可以作为您处理该主题的指导原则。要了解更多关于使用Databricks数据+AI平台构建高质量数据产品的信息,请联系您的Databricks代表。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏