返回
RSS Databricks Blog AI 逐段翻译 发布 2026-08-29 01:30

Indra在Databricks上统一EV充电数据

DataHot 速览

英国EV充电公司Indra在数据快速增长后,将原先分散在Cosmos DB、Synapse、Power BI等多项服务中的数据整合到Databricks单一平台。通过并行原型迁移、月度Delta表和Unity Catalog实现统一治理,并借助AI/BI仪表盘与Genie Agent让业务团队自助获取数据答案。该实践减少了工具数量和运维成本,提升了数据标准化与可治理性。

为什么值得关注:数据从业者可借鉴多工具数据栈向统一湖仓平台迁移的路径,以及如何通过治理和AI/BI自助分析释放数据价值。

本文目录 7 节
  1. 出发点:工具过多,开销过大
  2. 为什么单一平台很重要
  3. 对工程、业务用户和客户的变化
  4. 用中卫架构取代脆弱的管道
  5. 将报告转变为自助服务
  6. 转型背后的数字及其带来的价值
  7. 从平台整合到数据驱动的运营

译文

AI 逐段翻译

当数据增长速度超过其周围系统时,复杂性成为默认状态。这就是Indra可再生能源技术公司面临的挑战,该公司是英国增长最快的电动汽车充电公司之一,设计和制造面向商业和家庭场所的智能充电器。随着其数据资产扩展,相关工具、管道和成本也随之增加。

结果众所周知:系统碎片化、逻辑重复,大量时间花在维护基础设施上,而不是利用数据推动业务发展。

Indra的应对措施不是增加另一个单点解决方案,而是整合到Databricks上,创建一个统一的治理平台,用于跨业务的分析、报告和自助访问。

观看Indra首席技术官Matthew Noonan和数据工程师Meghana Ganatra分享他们在Databricks上的历程。

Indra的Databricks之旅始于从Synapse进行的并行原型迁移。在结果达到预期后,团队扩展到月度Delta表,整合了车队管道,并将更多运营负载从Cosmos DB转移到Databricks。下一阶段侧重于让治理数据在工程之外发挥作用,通过自动化的AI/BI仪表板和Genie Agents使业务团队能够直接访问答案。

出发点:工具过多,开销过大

Indra的数据分布在Cosmos DB、Synapse、Azure数据湖存储、Azure Functions、Power BI和其他Azure服务中。每个用例都有自己的发展路径。

这产生了一些问题:

  • 成本在多个工具中自然增长
  • 管道单独构建,缺乏标准化
  • 数据碎片化
  • 治理有限,没有统一的目录或血缘视图
  • 业务团队仍依赖数据团队获取常规数字

该架构有效,但成本高昂且难以清晰扩展。

为什么单一平台很重要

Databricks为Indra提供了一种将这些部分整合在一起的方式。

团队不再维护多个独立服务,而是迁移到一个拥有治理数据集、标准化工作流和通过Unity Catalog提供集中可见性的单一平台。这一转变既改变了技术栈,也改变了运营模式。

团队不再需要将每个用例视为单独的构建。他们可以在治理数据之上构建一次,并在团队和工作负载之间复用该平台。

实际上,这意味着一个集中的数据平台服务于多个用例,而不是一组彼此孤立的工具。

对工程、业务用户和客户的变化

好处不仅限于数据团队:

  • 对于工程团队,Databricks成为在治理数据集而非分散来源上构建的基础
  • 对于业务用户,减少了对数据团队请求数字的需求
  • 对于外部客户,创建了从一个平台交付的单一事实来源
  • 对于数据团队,使系统更易于支持、更具可扩展性且更易于扩展

从碎片化到标准化的转变是任何平台整合中最大的收益之一:价值不仅在于降低成本,还在于减少交接和运营摩擦。

用中卫架构取代脆弱的管道

Indra最明显的例子之一是车队数据管道。

此前,该系统依赖多个Azure函数和独立阶段来移动数据。该管道接收遥测和交易数据,通过服务链处理,然后将输出推送到报告工具或客户交付层。

新架构简化了该路径。使用中卫设计,Indra将车队数据带入青铜层作为原始单一事实来源,在白银层使用PySpark进行转换,并发布为报告和客户交付准备就绪的黄金表。

该整合消除了对三个旧Azure函数的需求,并允许一个管道按每日计划服务三个客户。

影响是直接的:

  • 一个代码库取代重复逻辑
  • 维护的部件更少
  • 相比旧函数性能提升60%至70%

将报告转变为自助服务

Indra还解决了常见的痛点:手动报告。月度KPI曾在Excel中跟踪,一些报告在Power BI中存在许可限制。这拖慢了决策,并使业务用户依赖数据团队。

新的生产模式运行在基于中卫架构的治理黄金表上,通过Unity Catalog,编目,并通过无服务器SQL仓库提供服务。AI/BI仪表板按计划自动刷新,并已取代营销、运营和其他团队之前维护的手动Excel跟踪器。借助Genie One直接嵌入仪表板画布,用户无需离开页面即可从固定可视化过渡到与底层数据进行自然语言对话。

仪表板支持实际运营决策。设备电压报告监控现场充电器群的合规性,而充电器正常运行时间分析仪表板帮助团队了解车队健康状况,例如,显示14,975台设备在所选期间平均正常运行时间为90.25%。伍斯特的电网电压仪表板增加了地理背景,帮助团队识别过压和欠压热点,了解当地条件可能如何影响充电器设计。

Genie Agents将相同的治理数据扩展到对话式分析。Indra拥有用于遥测、设备固件以及用户、设备和车辆的Agents。营销或运营用户可询问某月有多少设备为电动汽车供电;工程团队可检查按型号或固件版本划分的设备数量;产品团队可探索平台上代表的车辆品牌。Genie生成SQL,返回结果,并支持后续问题,而无需向数据团队提出新请求。

这些功能共同实现了报告自动化,使仪表板无需手动刷新即可保持更新,让用户能用日常语言提问,并让团队无需等待临时支持即可获得答案——将日常问题从数天缩短到数分钟,同时创建对数据的共享、受控视图。

image2.png

转型背后的数字及其带来的价值

Indra 的架构简化带来了可衡量的成果:

  • 从 Synapse 迁移到 Databricks,业务成本节省 80-90%,存储成本节省 90%
  • 每活跃用户成本从 1 月的 1.30 英镑降至 5 月的 45 便士
  • 查询延迟从 24.4 秒改善到 3.5 秒

这些收益源于 Indra 处理数据方式的更广泛变革:更少的系统、更多的复用,以及支持当前报告、运营监控和未来 AI 工作的受控数据平台。当更多人能够使用数据时,数据的价值就会增加。受控平台不仅仅是一个控制层;它是实现自助服务的关键。

image4.png

从平台整合到数据驱动的运营

电动汽车充电是一个数据密集型环境。充电器持续生成遥测数据,本地电网条件各不相同,运营绩效可能迅速变化。这使得拥有一个既可靠又灵活的系统变得重要。

Indra 的仪表板和 Genie 空间帮助团队监控该环境,而无需让每个问题都经过数据团队。其架构还为下一步留出了空间:流式处理、Delta 表、Lakeflow 管道以及未来 AI 驱动的用例。

团队的建议很实际:保持好奇心、阅读文档、尽早提问、与 Databricks 专家合作,并不断探索新功能。这种心态很重要,因为平台价值会随着时间的推移而累积。第一个胜利可能是降低成本;更大的胜利是当同一个平台开始解锁跨业务的新工作方式时。

Indra 的历程展示了当分散的数据资产被一个为复用而构建的受控平台取代时会发生什么。该公司降低了成本,简化了运营,提高了性能,并为业务用户提供了更快访问所需数字的途径。同样重要的是,它为流式处理和 AI 奠定了基础,而没有进一步增加蔓延。

对于那些面临同样工具碎片化、成本上升和手动报告问题的团队,经验很简单:首先标准化平台,然后在此基础上扩展用例。

想了解更多?观看我们“能源虚拟行业论坛”中的完整演示和专家深入探讨:以统一数据、实时洞察和规模化 AI 推动能源转型

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存