返回
RSS Fivetran Blog 发布 2026-08-07 23:06 25

开放数据基础设施需用上下文工程统一数据用例

Fivetran产品布道师Charles Wang撰文指出,单一事实来源不仅来自数据集中化,还必须从数据中构建上下文。他结合Fivetran与dbt Labs的托管数据湖服务(MDLS),说明开放表格式、持续同步与元数据发布如何支撑统一架构。文章强调AI系统缺乏隐性知识,必须通过上下文工程让信息显式、结构化、可信且可检索。他将上下文工程分为四类需求,并首先提及语义与血缘。
推荐理由:数据从业者需关注如何将统一数据架构与AI系统对齐,上下文工程正成为语义层与Data Agent落地的关键实践。
语义层湖仓Fivetrandbt Labs

译文 AI 逐段翻译

数据洞察

开放数据基础设施需要上下文工程来统一数据用例

2026年8月7日

开放数据基础设施需要上下文工程来统一数据用例

Charles Wang

首席产品布道师

Fivetran

锚点链接

主题

开放数据基础设施

分享

单一事实来源不仅仅来自数据的集中化。你还需要从中构建上下文。

开放数据基础设施承诺通过互操作性和单一事实来源支持每个数据用例。在Fivetran + dbt Labs,我们针对在统一数据架构中一次性移动和存储数据问题的首选解决方案是托管数据湖服务(MDLS),它将数据以开放表格式交付,保持数据湖从源系统持续同步,自动管理模式演变,并将元数据发布到目录中,以便每个引擎都能访问一致、受治理的数据视图。统一数据架构可以与任何计算或查询引擎结合,并支持所有用例。

虽然MDLS支持各种工具可读的技术格式,但您还需要将原始数据转化为一种上下文,向人类和AI用户传达单一事实来源。代理和人类不能基于相互冲突的事实版本进行操作,尤其是在智能自动化具有连续性和高规模特性的情况下。

上下文工程是一种实践,使AI系统所需的信息变得明确、结构化、可信赖,并在使用时可检索。与人类不同,AI系统缺乏通过经验、在职培训、自主学习和常识获得的隐性知识和群体知识。它们必须被明确指示所有相关上下文,这使得上下文工程成为实现开放数据基础设施潜力的关键。

上下文工程可分为四大需求:

  1. 语义和来源:数据代表什么,如何计算,来自哪里?
  2. 质量和状态:根据质量、新鲜度和其他执行状态特征,当前数据是否可信?
  3. 治理和生命周期管理:如何确保数据资产被适当的用例和受众交付和拥有?
  4. 发现和交付:如何为每个代理或AI系统定制上下文?

[CTA_MODULE]

1. 语义和来源

语义和来源涉及每个数据资产的含义和起源。它可归结为以下需求:

  • 语义、结构和粒度:每个数据模型和字段到现实世界业务概念的映射,直至每一行代表的内容。
  • 业务逻辑:产生每个现实世界业务概念的规则和转换
  • 血缘和来源:揭示并理解产生每个字段和模型的完整过程,包括所有中间步骤

语义在dbt语义层中定义,其中指标、维度、实体和有效连接在构建数据的同一工作流中进行编写、测试和治理。开放语义交换,现在称为Apache Ossie(孵化中),是dbt Labs帮助创立的一个供应商中立规范,使这些定义在查询引擎和工具之间可移植,而不是锁定在创建它们的引擎中。诸如Agents Schema这样的开放标准为代理提供了一个查找上下文的地方:模型、列、血缘和业务含义。业务逻辑通过转换直接编码,模型明确显示源记录如何成为下游业务实体,如客户、订单或收入。dbt Catalog通过揭示产生数据资产和每个业务实体的每个中间模型和字段,建立了来源和血缘。

2. 质量和状态

质量和状态向AI系统和其他用户确认模型可用且可信,基于新鲜度、质量和其他执行状态特征(例如,最近或正在进行同步的状态)。

通过明确的质量和状态评估,AI可以限定答案、寻找替代来源或拒绝回答,而不是假设所有数据同等可靠。数据的可信度基于证据的递进:

  • 测试:数据是否满足预期规则?
  • 契约:模型是否仍然符合预期的模式和约束?
  • 新鲜度:数据对于此用途是否足够最新?
  • 运行状态:最新的转换是否成功完成?

dbt Catalog由dbtDiscovery API驱动,生成并存储有关项目运行的所有相关信息,包括模型、源、节点和执行结果。

3. 治理和生命周期管理

除了了解所涉及的数据资产之外,治理还包括控制访问和权限。更具体地说,它涉及层级、分类、依赖和边界,以确保数据资产仅发送到预期的流程和受众。生命周期管理包括确保上下文随时更新,以反映变化的定义、废弃的数据资产、演变的模式和所有权变更。

dbt Mesh及其治理功能专为解决这些需求而设计,确保控制力的同时,随时间负责地变更。

4. 发现和交付

发现和交付确保每个AI系统都有其确切需要的上下文,以及最少的噪音。

代理式AI的可预见未来看起来不像单体式“全能”代理,而更像特定、离散指令和用例的专业代理网络。通常,为这类AI系统补充其需要的少量精确定义的模型、指标和依赖关系,比提供整个仓库的模式更好。

这意味着识别相关上下文,选择数据的最小可行子集,并使其机器可读。

如前所述,dbt Catalog 通过搜索、资源页面、血缘关系和 ERD 视图展示模型、指标、所有者、关系和状态。这些元数据也可以通过 Discovery API 以编程方式获取。要将 AI 系统连接到相关数据,dbt MCP 服务器提供了一种标准化协议,用于检索模型、指标、血缘关系和其他上下文,以及执行其他允许的操作。

上下文工程也帮助数据的人类消费者

使数据对 AI 可读和可用所需的所有上下文工程,也使数据对可能将其嵌入产品或依赖其支持决策的每个人可用。没有哪个实体能够仅凭表和列名称可靠地推断业务含义。

通过上下文工程将机构知识外部化,也使工作可重复,实现有意义的自助服务,促进协作,并使入职和组织变革更容易、更安全。

上下文工程将数据从组织仅仅拥有的东西,转变为人和机器都能可靠理解、使用、验证和维护的东西。

[CTA_MODULE]

看看你的技术栈距离开放数据基础设施有多近。

了解更多

准备好使用 Fivetran 构建开放数据基础设施了吗?

开始免费试用

主题

开放数据基础设施

分享

相关博客文章

标题

免费开始

加入使用 Fivetran 集中和转换数据的数千家公司。

谢谢!您的提交已收到!

哎呀!提交表单时出了点问题。

获取演示

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存