Iceberg/Delta、存算分离与半结构化——架构之争的下一站
近 7 天收录 15 个事件 · 每 6 小时更新
Fivetran宣布Managed Data Lake Service Write Credentials全面可用,用户现在可以对该数据湖执行DDL和DML操作,包括删除记录以响应GDPR请求,以及删除不再需要的表。该服务基于开源Iceberg表格式,支持AWS S3、Azure Data Lake和Google Cloud Storage等对象存储,并已被Snowflake、BigQuery、Databricks等引擎查询。Fivetran的750多个连接器可将数据直接接入托管数据湖,兼顾ACID事务与低迁移成本。
Apache Iceberg v3引入Variant类型,用于在单列中存储任意形状的半结构化数据,并以紧凑二进制形式保持原生类型。相比JSON字符串和固定扁平schema,Variant兼具灵活性与查询性能,且无需预定义schema和迁移。本文是该系列首篇,后续将介绍shredding技术。
Amtrak 正在推进50多年来最大规模的物理转型,引入新列车并重建基础设施。为匹配这一规模,其基于 Databricks 构建名为 Rail Intelligence 的统一数据平台,通过 Lakeflow Connect 和实时流处理整合车队物联网、道旁检测器等信号。该平台旨在打破原有数据孤岛,为分析、运营和预测性维护奠定统一治理基础。
加拿大最大铁路网络之一运营约2万英里线路,年承运货物价值超2500亿加元。其数据团队借助Databricks Genie Code、Unity Catalog、自定义Agent Skills及Databricks Apps上的Streamlit应用,将管道开发变成可复制的工厂:一段YAML提示即可生成生产级摄取代码,涵盖表定义、历史加载、流式摄入、增量合并和自动化测试。结果新表摄入自动化率超过90%,管道交付从数天压缩至数分钟。
Spotify推出随机访问Parquet(RAP)存储架构,通过外部索引层将查找键直接映射到Parquet文件中的行位置,从而在数据湖上实现低延迟点查询,无需将数据复制到运营数据库。该方案支持在线服务和AI应用从同一数据集读取单个记录,同时继续用于分析、机器学习和在线服务。Spotify表示,其数据湖中存储着EB级数据,而Bigtable中存储PB级在线数据,大规模复制成本高昂。
TiDB工程师在SCaiLE Europe 2026上论述,单独的向量数据库并非AI应用的必要代价,而是数据同步约束下的变通方案。每个新增AI组件都会复制一份数据,带来独立的接入路径、运维和同步任务,导致栈越堆越复杂。TiDB通过同一Raft流同步行存储、列存储、向量索引和全文索引,由SQL优化器决定查询走哪个存储。文章认为分布式SQL原生支持向量搜索与分析能力,可减少数据漂移和多系统运维成本。
DuckDB计划从v2.0开始支持Parquet和CSV异步读取,解决EC2/S3等计算存储分离环境中工作线程等待网络I/O的问题。随着DuckDB从本地SSD查询扩展到远程数据湖和服务化场景,异步请求有望更充分利用带宽。
华为在2026数据存储用户精英论坛上提出AI数据中心数据基础设施五层架构,涵盖AI数据湖、AI数据平台、算力、模型和Agent。为应对大规模推理与Agent落地,华为推出业界首个面向大规模推理的上下文记忆存储CMS(G3.5存储),置于HBM/DRAM与共享存储之间,支持构建PB级共享KV Cache池。华为表示战略方向未变,而是将单点能力整合为全栈方案,存储正进入模型推理路径。
Databricks宣布推出FILE类型(beta),这是一种原生列类型,可将非结构化数据以受治理的列形式存储在表中,实现与结构化数据统一管理。FILE类型支持统一治理、自动合规(删除行时同步删除对象存储中的二进制文件)、SQL和Python UDF访问,并可与Parquet和Delta Lake生态集成。
Snowflake于2026年8月2日至6日发布10.27版本更新,其中CREATE OR ALTER DYNAMIC TABLE命令正式全面可用(GA)。该命令结合了CREATE DYNAMIC TABLE与ALTER DYNAMIC TABLE的功能,若动态表不存在则创建,存在则按新定义修改,匹配时无操作。此更新简化了数据管道中的表管理流程。
Snowflake 发布 10.25 版本更新,覆盖 SQL 与数据湖能力。会话变量大小限制从 256 字节提升至 16KB,对象定义大小限制从 95KB 提升至 1MB。VARIANT 与结构化类型新增 UUID 和 DECFLOAT 值支持,并推出 FORMAT_STRING_TEMPLATE 函数。Apache Iceberg 表新增 UNKNOWN 数据类型预览支持。
Snowflake于2026年6月20日至25日发布10.22版本更新,宣布Dynamic Tables和Insert-only Streams在Delta Direct表上正式可用(GA)。该版本更新说明已发布在官方文档中,并提供了变更日志。这标志着Snowflake进一步扩展对Delta Lake格式的原生支持,增强数据平台互操作性。
Fivetran产品布道师Charles Wang撰文指出,单一事实来源不仅来自数据集中化,还必须从数据中构建上下文。他结合Fivetran与dbt Labs的托管数据湖服务(MDLS),说明开放表格式、持续同步与元数据发布如何支撑统一架构。文章强调AI系统缺乏隐性知识,必须通过上下文工程让信息显式、结构化、可信且可检索。他将上下文工程分为四类需求,并首先提及语义与血缘。
Snowflake Horizon Catalog目标是为所有数据和AI资产提供统一目录,实现可发现、可治理并产生可信答案。现在它将扩展到非结构化数据领域。约80%企业数据以文件和对象形式存在,且大多位于本地,包括媒体素材、芯片设计、医学影像、合同和传感器数据等。Snowflake采用元数据优先、内容按需获取的策略,覆盖NAS、对象存储和归档层。
AWS官方博客介绍如何结合IAM Identity Center、Lake Formation基于标签的访问控制(TBAC)以及SageMaker Unified Studio的信任身份传播,为大规模企业湖仓构建自动化的最小权限访问治理架构。方案使用CDK部署,通过LF-Tags对数据分类,将IAM Identity Center组映射到标签策略,并在查询时跨分析引擎强制执行权限,解决表级权限手动管理带来的权限漂移与审计困难问题。