返回
RSS Fivetran Blog AI 逐段翻译 发布 2026-09-02 02:53

Fivetran:开放数据基础设施加速工作流的六种方式

DataHot 速览

Fivetran博客提出开放数据基础设施(ODI)是开放、基于标准的架构,可提升控制力、互操作性和AI就绪性。文章指出Salesforce、SAP等软件厂商的封闭数据策略加剧了数据迁移摩擦,而ODI将开放数据访问作为架构要求。开放表格式能帮助企业在扩展基础设施的同时控制成本,并支持AI代理等新工作负载。全文从数据访问、成本控制、可靠性等六个方面给出实践思路。

为什么值得关注:开放数据基础设施是数据平台演进的重要方向,Fivetran从数据集成厂商视角总结的实践方法,对构建AI-ready数据架构有参考价值。

本文目录 6 节
  1. 1. 按照您的条件访问数据
  2. 2. 在控制成本的同时扩展基础设施
  3. 3. 更轻松地引入或更换工具
  4. 4. 减少重复管道和对账
  5. 5. 通过共享血统和定义减少调查
  6. 6. 标准化安全以加速审计和批准

译文

AI 逐段翻译

我们已经进入了数据工程和分析的新阶段,在这个阶段,数据将被智能体以及人类使用。与通过训练、经验、观察和自主学习来学习的人类不同,智能体需要明确、全面的上下文才能正确推理。为了驱动智能体,数据工程团队需要访问比以往更多的数据集。但现有的数据基础设施造成了工作流程摩擦,使得在控制成本和确保数据可靠性与安全性的同时进行扩展变得困难。

开放数据基础设施(ODI)是一种基于开放标准、用于控制、互操作性和AI就绪数据的架构。通过使用开放格式和共享标准,组织可以引入新工作负载(包括AI),而无需重复复制数据或重建基础。以下是ODI让您生活更轻松的6种方式。

1. 按照您的条件访问数据

很多“数据摩擦”实际上不是技术性的,而是合同性的。软件供应商越来越倾向于通过高级API层级、按次计费、激进的速率限制,或限制导出和AI使用的服务条款来限制您对数据的访问。您技术上拥有数据,但供应商决定实际使用数据的可负担性和实用性。Salesforce、SAP、Slack、Workday等公司最近的政策变化都使得将数据移出其平台变得更加困难或昂贵——将您的数据锁定在围墙花园中。

要使AI有价值,它需要访问更多系统,并且更频繁地访问。围墙花园使数据移动更加困难,AI项目更加昂贵和困难。ODI通过使开放数据访问成为架构的要求,并越来越成为您可以构建到供应商合同中的要求来解决这个问题。而不是每次出现新用例时都请求许可,您可以按照自己的条件继续构建。

[CTA_MODULE]

2. 在控制成本的同时扩展基础设施

传统架构迫使人们做出一个不舒服的选择:仓库可靠但扩展成本高,因为计算和存储捆绑在一起;而数据湖便宜但难以进行严肃的分析工作治理。

开放表格式缩小了这一差距。它们为基于湖的存储带来了模式强制和事务可靠性,因此您在廉价的商品化基础设施上获得了仓库级的可靠性。存储保持廉价——您将数据存储在对象存储中(如S3、Azure Data Lake Storage或Google Cloud Storage),以开放表格式(如Apache Iceberg*或Delta Lake)编写。然后,您为给定的工作负载选择最佳的计算引擎,例如一个用于BI,一个用于数据科学,一个用于运营应用,而无需为每个引擎复制底层数据。

3. 更轻松地引入或更换工具

在紧密耦合的堆栈中,更改计算引擎、BI工具或编排层通常意味着需要调整周围的一切,需要大量的时间和资源。

当存储、计算和元数据解耦并标准化时,您可以在不重建基础的情况下更换更好的引擎、在价格上谈判更有利的条件或采用新的AI框架。您可以引入新工具和技术进行实验、迭代和采用新功能,并为每项工作选择最具成本效益的方案。您的基础设施不再强制每个工作流程适应特定平台,而是满足您当前的需求,同时为未来保留选择。

一位在Shutterstock的高级软件开发经理分享了这一价值主张对他们的业务有多么强大:“开放数据基础设施使我们能够灵活地使用合适的工具来完成工作。无论是Snowflake、AWS服务还是未来的新东西,我们的数据已经就位,无需移动或重建。”

4. 减少重复管道和对账

仪表板、运营工作流程和AI智能体都从相同的基础数据中获取数据,但在典型的堆栈中,每个都有自己的副本和自己的定义。当这些定义发生偏差时,您会看到不一致的决策和不可靠的AI输出。当每个工具维护自己的数据副本时,追踪一个错误的数字或AI幻觉的输出意味着在找到问题根源之前,需要在几个不同系统之间花费宝贵的时间和资源进行对账。

ODI将数据层视为共享基础,创建可互操作的基础设施。其核心是数据湖,您可以在其中移动一次数据并根据需要查询。当数据以开放格式存储在数据湖中并通过共享标准治理时,跨业务部门共享数据、支持集成和更改下游工具就变得更加容易,而无需强制数据团队复制数据或管道。每个系统都从相同的业务一致视图工作。这消除了维护并行管道和追查数据差异的持续低强度工作,节省了数据团队的时间和资源。

5. 通过共享血统和定义减少调查

名为“收入”的列不会告诉智能体它是否包括退款或税费。人类分析师通过隐性知识填补这一空白,而智能体只会猜测。自信的错误答案通常比没有答案更糟糕。

在ODI中,您将这些定义构建到数据湖的元数据层中,从而实现在分析、运营和AI系统中保持一致性的策略执行、血统和业务定义。对数据的信心很高,数据团队不会在重建上下文上手忙脚乱,而不是交付分析和数据产品。

我们的智能体模式通过指定一个共享的、受治理的模式,将指标定义、血缘和业务文档存放在普通的SQL表中,任何代理在执行操作前都可以查询,从而简化了这一过程。当代理被问到诸如“我们这个月的MRR是多少”时,它首先查找经过批准的定义和血缘,而不是自行发明逻辑。当定义发生变化时,它会在源头处一次性更改,下游的每个代理和分析师都会看到更新。

6. 标准化安全以加速审计和批准

“开放”往往让安全团队感到紧张,因为其隐含意义是“暴露”。但在ODI中,开放指的是承诺采用广泛接受的标准,而不是放松控制——它是在适当的控制下,使数据可供正确的系统使用。访问策略、分类和血缘随数据本身一起移动,因此新的管道、应用程序或代理会继承现有的安全模型,而不是需要从头构建新的。

随着AI代理开始自主行动以及代理驱动的交互增加,这一点变得更加重要。通过将数据和语义基于开放标准,并存储在统一存储层中,ODI确保代理通过受控路径访问一致、可信的数据,而不是通过脆弱的集成。策略在整个基础设施中应用,而不是为每个工作负载重新创建,从而赋予安全团队对数据实际流动方式的完全可见性,这使得审计更快,批准更容易。

要了解您的技术栈与开放数据基础设施的接近程度,并获得为大规模AI构建基础的定制化后续步骤,请参加我们的ODI评估

*Apache Iceberg是Apache软件基金会的商标。

[CTA_MODULE]

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存