返回
RSS Fivetran Blog AI 逐段翻译 发布 2026-08-18 08:00 收录于 08-19

Fivetran谈数据目的地:决定数据架构成败的5个要点

DataHot 速览

Fivetran 认为数据目的地决定了数据在分析、AI和业务运营中被治理、查询、激活和复用的难易程度,是数据架构中最关键的决策之一。其目的地设计强调跨仓库一致的 schema 语义、表级同步模式选择、对开放湖格式的原生支持与自动目录注册,以及反向 ETL 层以避免数据死胡同。文中还指出,借助一致的 schema,dbt 模型和 Quickstart 包可跨 Snowflake、Databricks、BigQuery、Redshift 等平台移植。

为什么值得关注:数据集成常只关注源端,本文深入阐述目的地侧的 schema 一致性、开放格式与反向 ETL 设计,对数据湖仓架构选型和多平台迁移有实际参考价值。

本文目录 6 节
  1. 1. 处处一致的架构
  2. 2. 两种同步模式:软删除和历史模式(SCD类型2)
  3. 3. 开放湖格式和多引擎查询
  4. 4. 目标端是激活的开始
  5. 5. 支持多个目标
  6. 目标是一级决策

译文

AI 逐段翻译

大多数关于数据集成的讨论都集中在源端——存在哪些连接器、它们如何处理模式变更、同步的可靠性如何。目标端得到的关注较少,但设计决策的后果恰恰在那里最为直接地体现。目标端是你的分析师查询的地方,是你的dbt模型运行的地方,是你的AI模型训练的地方,也是你的业务决策做出的地方。做好这一点至关重要。

Fivetran对目标端的方法反映了一种更广泛的理念:目标端应该是一等公民,而不是事后才考虑的事情。在每个数据仓库中保持一致的模式语义,在表级别选择同步模式,原生支持开放湖格式并自动注册目录,以及一个反向ETL层,防止数据仓库成为数据死胡同。以下是定义Fivetran如何看待目标端的5件事。

[CTA_MODULE]

1. 处处一致的架构

Fivetran目标端层最有价值但宣传最少的特性之一是架构一致性。当Fivetran将数据加载到目标端时,它使用标准化的类型系统——将源数据类型映射到一组规范的Fivetran类型(字符串、整数、浮点数、布尔值、日期、时间戳、JSON、二进制),然后将这些映射到目标端中最接近的等价类型。这意味着一个将数据加载到Snowflake的管道和一个将相同数据加载到Databricks的管道将生成具有相同表名、相同列名和语义等价类型的表。

实际上,这意味着dbt模型、Quickstart包和SQL转换逻辑可以在不同目标端之间移植。一个在Snowflake中生成干净收入分析层的Salesforce Quickstart包,在BigQuery或Databricks中无需修改即可生成相同的层。一个针对Redshift目标端开发的dbt项目,只需很少改动就可以指向Snowflake。这种可移植性消除了迁移摩擦的一个最常见来源——当底层数据仓库发生变化时,需要重新验证或重建分析资产。Fivetran还为每个目标端表添加了2个元数据列——_fivetran_synced(该行上次成功同步的时间戳)和_fivetran_deleted(标记源中软删除行的布尔值)——这些在所有目标端中都是一致的。

2. 两种同步模式:软删除和历史模式(SCD类型2)

Fivetran同步到目标端的每个表都以两种模式之一运行,可按表配置,无需任何代码。软删除模式(默认)维护每个表的当前状态视图。当源中的记录被删除时,Fivetran不会将其从目标端移除。相反,它将该行标记为_fivetran_deleted = TRUE,保留数据,同时通过简单的WHERE子句轻松地将已删除记录排除在查询之外。当记录被更新时,目标端行会就地更新。结果是目标端表准确反映源的当前状态,并在需要时完全恢复已删除的记录。

历史模式原生实现了类型2缓慢变化维度(SCD2)——无需自定义dbt模型,无需单独的历史表,无需手动管理时间戳。当为表启用历史模式时,源中的每次更改都会插入新行,而不是更新现有行。三个系统列管理历史记录:_fivetran_start(该记录版本何时生效)、_fivetran_end(何时被替代,如果仍然是最新则使用最大可能时间戳)和_fivetran_active(用于筛选当前版本的便捷布尔标志)。这使得只需在架构配置中启用一个开关,就可以对源数据进行时间点分析和趋势报告。历史模式可以按表打开和关闭,当更改模式时,Fivetran会自动运行迁移查询——现有数据会重构为新格式,不会丢失任何数据。

3. 开放湖格式和多引擎查询

Fivetran的托管数据湖服务将目标端概念扩展到数据仓库之外。它不是加载到专有的仓库格式,而是以开放表格式(Apache IcebergTM 或 Delta Lake)直接写入云对象存储——Amazon S3、Azure Data Lake Storage或Google Cloud Storage。结果是数据不受任何单一供应商控制。Fivetran创建的相同Iceberg表可以由Snowflake使用外部Iceberg表、Databricks通过Unity Catalog、Amazon Athena通过AWS Glue、BigQuery通过BigLake Metastore、Apache Spark通过Fivetran Catalog同时查询——所有这些都读取相同的物理文件,没有数据重复,也没有引擎之间的复制管道。

目录注册步骤——历史上多引擎湖架构中的痛点——由Fivetran自动化。托管数据湖服务附带预配置的Fivetran Catalog(基于Apache PolarisTM)作为默认。它还支持自动注册到AWS Glue(提供对整个AWS生态系统的访问,包括EMR和Athena)、Databricks Unity Catalog(跨Delta表的治理、血缘和细粒度访问控制)以及Google BigLake Metastore。每次同步完成后,Fivetran都会更新相关目录,使下游查询引擎立即看到最新数据——无需手动DDL、REFRESH命令或计划爬虫。

4. 目标端是激活的开始

仓库是数据变得可信的地方——经过治理、建模、丰富和一致结构化。但仓库仪表板中的可信数据并不是大多数企业需要的最终状态。销售代表在Salesforce中工作,而不是在Snowflake中。营销团队在HubSpot中构建活动,而不是在BigQuery中。客户成功团队在CRM或CS平台中监控流失信号,而不是在SQL查询中。仓库中构建的分析智能需要一条路径返回业务团队实际工作的运营系统。

Fivetran Activations 是弥补这一循环的逆向ETL层。它从你的仓库读取数据——客户细分、健康评分、流失倾向模型、产品使用摘要、丰富的联系人记录——并按设定的时间表同步回运营工具。支持的激活目标包括Salesforce和Salesforce Marketing Cloud、HubSpot、Braze、ActiveCampaign、Iterable、Zendesk、Google Ads、Meta Ads、Slack、Microsoft Fabric、Webflow等——覆盖CRM、营销自动化、客户成功、广告和通信平台。驱动BI仪表板的同一数据模型也驱动销售代表的CRM、营销人员的电子邮件细分和客户成功经理的健康评分视图——来自单一受治理来源。

5. 支持多个目标

现代数据环境很少是同质的。企业数据团队可能运行Snowflake进行SQL分析、Databricks进行机器学习、S3与Iceberg进行经济高效的历史归档、PostgreSQL作为内部数据产品的后端,以及ClickHuse用于高并发的面向客户的分析功能。这些并非竞争性选择——它们是适合不同工作负载的合适工具。Fivetran的目标库在单一平台上支持所有目标,而无需为每个架构层使用不同的摄取工具。

Fivetran目前支持超过30种目标类型,涵盖数据基础设施的每个主要类别。完整的目标范围涵盖云数据仓库、多种格式的开放数据湖、专用分析数据库、关系数据库、流媒体平台以及用于AI工作负载的向量数据库。所有目标共享相同的连接器覆盖——相同的750多个源连接器适用于每个目标。所有目标都受益于相同的模式一致性、元数据列、同步模式选项(软删除和历史记录)以及治理能力。对于有严格数据驻留要求的目标,可使用混合部署,将数据处理保留在你的网络边界内。

类别目标最适合
云数据仓库Snowflake、BigQuery、Databricks、Amazon Redshift(预置版和无服务器版)、Azure Synapse核心现代数据栈目标——列式、可扩展、完整的dbt/Quickstart支持
开放数据湖Amazon S3(Iceberg/Delta)、Azure Data Lake Storage(Iceberg/Delta)、Google Cloud Storage(Iceberg)、Microsoft OneLake(Delta)开放表格式、多引擎查询、自动目录注册(AWS Glue、Unity Catalog、BigLake)
分析数据库ClickHouse Cloud、SingleStore、Teradata Vantage、MotherDuck、Materialize、Starburst适合实时分析、高并发BI或进程内OLAP工作负载的专用引擎
关系数据库PostgreSQL(包括RDS、Aurora、Google Cloud)、MySQL(包括RDS、Aurora)、SQL Server(包括RDS、Azure SQL)、Oracle适用于将数据存入运营数据库或为下游应用提供数据的团队
流媒体和向量Confluent Cloud(Kafka)、Milvus、Propel、SurrealDB用于AI/ML嵌入工作负载的实时流目标和支持的向量数据库

目标是一级决策

一致的模式使分析资产可移植。两种同步模式在表级别处理当前状态和完整历史跟踪,无需任何自定义代码。开放的湖格式让多个引擎同时查询相同数据,并自动注册目录。激活功能确保仓库中构建的智能到达执行它的运营工具。目标库覆盖从传统仓库到开放湖、分析数据库、流媒体平台和向量存储的每种架构。

无论你的数据需要落在何处——以及接下来需要去哪里——Fivetran都能提供目标覆盖。

Apache Iceberg和Apache Polaris是Apache软件基金会的商标。

[CTA_MODULE]

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存