返回
RSS Databricks Blog 精选 发布 2026-08-14 05:00 62

苏格兰水务用Databricks Genie实现资本投资数据对话式访问

苏格兰水务的资本投资项目团队过去需依赖大量报表或数据专家才能获取项目状态、财务、交付里程碑和风险信息。他们基于Databricks Genie构建了内部工具SPARK,通过Microsoft Teams以自然语言提问,由Copilot编排并经MCP连接Genie Space,在Unity Catalog治理下返回可信答案。该方案减少了重复报表制作,让项目团队能快速自助获取数据。
推荐理由:该案例展示了Databricks Genie结合Teams与语义层在企业内部落地ChatBI的架构,对数据从业者设计对话式数据访问方案有直接参考价值。

译文 AI 逐段翻译

在苏格兰水务的资本投资(CI)项目中,团队需要快速获得关于项目状态、财务绩效、交付里程碑和风险的答案。这些信息已经存在,但找到它们往往需要浏览大量的报告,或依赖数据专家从底层表中提取正确的信息。Databricks Genie改变了这一点。如今,项目团队可以直接在Microsoft Teams中用日常英语提问,并在几秒钟内得到可信的答案。

挑战:数据可得,但不易获取

苏格兰水务的CI职能并不缺乏数据。它存在的是访问问题。

实际上,这体现在几个方面:

  • 大量报告已经存在,但有限的认知和可见性常常导致重复工作,为了回答已有报告已解答的问题而创建新报告。
  • 有价值的数据对非技术用户来说仍然难以获取,减慢了整个职能部门的决策速度。

结果是可以预见的:分析师花费时间重复已有工作,交付团队等待提取数据,重要的项目数据并不总能到达负责日常决策的人员手中。

解决方案:面向受治理项目数据的对话式界面

SPARK是苏格兰水务为其项目组合数据自然语言界面设定的内部品牌,基于Genie构建。

用户无需搜索正确的报告,而是可以提问并获得基于受治理数据的答案。SPARK将这种体验直接带入Microsoft Teams,团队已经在此工作,无需切换到新界面。

用户通过Copilot在Teams中提交问题,然后由Copilot监督代理编排,通过模型上下文协议(MCP)连接到Databricks Genie Space。Genie将问题转换为查询,针对Unity Catalog中的受治理数据运行,并将结果返回给用户。

Genie架构

从搜索报告到直接提问

借助SPARK,团队可以提出实际的业务问题,例如:

  • 列出所有在八月到期未解决的项目风险,包括项目名称、风险描述、风险负责人和风险到期日期。
  • 项目X当前的实际风险评分是多少?
  • 对于项目X,当前风险敞口最大的风险是什么?请提供风险名称、描述和当前敞口值。
  • 项目X的未来承包商是谁?

每个问题都会从受治理的指标视图中立即返回答案。这意味着减少了查找报告的时间,增加了根据洞察采取行动的时间。

影响:更快的访问、更少的摩擦、更广泛的数据使用

通过使数据访问变得对话化,苏格兰水务正在帮助项目团队更快、更轻松地获得答案。

  • 对于项目数据,以前通常需要约8次点击加上仪表板加载时间的典型查询,现在可以只需在Teams中提出一个问题。
  • 对于基于报告的问题,用户不再需要为了找到正确的资产而浏览SharePoint、报告中心、报告类别和单独的报告链接。在许多情况下,这将4到5步的搜索旅程转变为直接的问答体验。
  • 如果100名用户每周每人提出3个问题,那么每周大约有300个信息请求。按每次请求节省2到5分钟的保守估计,这相当于每周节省约10到25小时,或每年约520到1300小时。
  • 好处不仅仅是速度。团队得到的是针对他们提出的问题量身定制的答案,而不是必须解读为广泛受众设计的静态报告。
  • 它还减少了对专家支持的依赖,并使非技术用户更容易获得受治理的洞察。

实际上,这意味着减少在工具中搜索的时间,减少等待他人提取数据的时间,增加在工作流程中基于可信答案采取行动的时间。

SPARK将彻底改变我们的项目组合和项目团队与数据互动的方式。它使我们从静态报告转向与信息的实时、智能对话,赋予我们的员工更快、更明智的决策能力,并释放我们以前无法触及的价值。这确实令人兴奋!——Allan Mason,项目与交付经理,业务分析

为信任和规模而构建

对话式分析只有在用户信任答案时才有效。苏格兰水务的实施从一开始就考虑到了这一点。

默认治理

治理从一开始就内置,Genie体验基于受治理的Unity Catalog数据和共享的语义定义,以确保答案一致、可解释,并与现有业务逻辑保持一致。

  • 该解决方案基于受治理的Unity Catalog数据,使访问控制、血缘关系和单一事实来源成为基础的一部分。
  • 苏格兰水务没有直接将Genie暴露给大量原始表,而是首先将本用例所需的数据精选到金层。
  • 在此基础上,使用指标视图构建了语义层,标准化了度量、维度和业务术语,以便一致地重用相同的定义。这有助于减少歧义并提高答案的一致性。

针对准确性进行调优

为了使Genie空间在实践中可靠,苏格兰水务围绕其自身的业务规则、术语和真实的用户问题进行了配置,而不是依赖通用配置。

  • 添加了精选的业务规则指令,以便Genie能够正确解释苏格兰水务的惯例,例如财政期间的定义、里程碑门的排序以及项目ID和日期的处理方式。
  • 使用带解答的示例问题和匹配的 SQL 来教导助手,让助手了解苏格兰水务用户如何表述问题,以及这些问题应如何映射到正确的查询模式。
  • 使用了一套基准测试套件,以便在空间定义或底层数据发生变化时,能够以可重复的方式测试准确性。
  • 与苏格兰水务团队进行的用户测试有助于验证真实世界的表述,并随着时间推移将额外的改进反馈回空间中。

持续监控

为了在生产环境中支持该解决方案,苏格兰水务围绕其构建了监控,以便团队能够随时间跟踪采用情况、回答质量和性能。

  • 在开发阶段,通过用户反馈监控回答质量,这有助于识别需要进一步改进的响应。
  • 在生产中,通过对话时长和每位用户的对话次数等指标来监控采用情况。
  • 团队审查重复出现的问题,以了解用户最常询问的内容,以及是否可以围绕反复提出的问题构建可视化。
  • 通过执行时间、总查询量和最慢运行的查询来跟踪查询性能。
  • 团队还构建了一个可视化,用于跟踪每位用户的 Genie 成本。

可重复、可靠的交付

苏格兰水务还设计了该解决方案,使其能够在不同环境之间安全且一致地推广,而不是将其视为一次性构建。

  • 该解决方案使用 Databricks Asset Bundles 打包为环境参数化配置,因此同一份定义可以部署到不同环境中。
  • 使用独立的开发、测试和生产环境,每个环境都有自己的工作区和 SQL 仓库。
  • 部署通过 Azure DevOps 进行,变更时自动部署,并在进入生产环境前设置手动审批门。
  • 身份验证通过 Microsoft Entra ID 服务主体处理,凭据在部署时从 Azure Key Vault 获取,而非存储在代码中。
  • 部署是幂等的,因此 Genie 空间可以被创建或就地更新,并自动向适当的组授予访问权限。

结论:一种更简单、高效的方式,让团队使用数据工作

结果简单但强大:苏格兰水务的团队可以通过自然语言访问项目数据,并信任他们收到的答案。对于领导者来说,这意味着更快的可见性和更少的报告摩擦。对于交付团队和数据用户来说,这意味着在工作流程中直接访问受管控的洞察。

SPARK 表明,当设计良好、治理良好的数据与 Genie 结合时,组织可以构建一个改变游戏规则的工具,真正向其用户普及可信的业务数据。

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存