← 主题地图

湖仓

Iceberg/Delta、存算分离与半结构化——架构之争的下一站

近 7 天收录 15 个事件 · 每 6 小时更新

AWSApache IcebergDatabricksDuckDBFivetranPingCAPSnowflakeTiDBdbt Labs华为

本主题必读

Apache Iceberg Variant类型:半结构化数据新解法2026-08-12Amtrak 构建铁路智能平台,用 Databricks 统一数据骨干2026-08-13加拿大大型铁路用Databricks Genie Code将管道创建自动化率提至90%2026-08-13Agentic AI 架构为何需要数据库,不只是向量存储2026-07-31Spotify为数据湖构建外部索引实现低延迟点查询2026-08-12开放数据基础设施需用上下文工程统一数据用例2026-08-07SageMaker Unified Studio与Lake Formation实现湖仓细粒度访问控制2026-08-07
8月13日5 个事件
RSSFivetran Blog08-07 30

Fivetran推出托管数据湖写入凭证功能

Fivetran宣布Managed Data Lake Service Write Credentials全面可用,用户现在可以对该数据湖执行DDL和DML操作,包括删除记录以响应GDPR请求,以及删除不再需要的表。该服务基于开源Iceberg表格式,支持AWS S3、Azure Data Lake和Google Cloud Storage等对象存储,并已被Snowflake、BigQuery、Databricks等引擎查询。Fivetran的750多个连接器可将数据直接接入托管数据湖,兼顾ACID事务与低迁移成本。

推荐理由:数据从业者需关注托管数据湖写入能力的扩展,它补充了Fivetran在开放数据基础设施中的管理操作能力,对数据治理和生命周期管理有直接价值。
湖仓Fivetran
RSSApache Iceberg Blog周三 08:00 精选 51

Apache Iceberg Variant类型:半结构化数据新解法

Apache Iceberg v3引入Variant类型,用于在单列中存储任意形状的半结构化数据,并以紧凑二进制形式保持原生类型。相比JSON字符串和固定扁平schema,Variant兼具灵活性与查询性能,且无需预定义schema和迁移。本文是该系列首篇,后续将介绍shredding技术。

推荐理由:湖仓从业者需关注Variant如何改善半结构化数据的存储与查询效率,影响表格式设计与引擎兼容策略。
湖仓Apache Iceberg
RSSDatabricks Blog周四 03:45 精选 53

Amtrak 构建铁路智能平台,用 Databricks 统一数据骨干

Amtrak 正在推进50多年来最大规模的物理转型,引入新列车并重建基础设施。为匹配这一规模,其基于 Databricks 构建名为 Rail Intelligence 的统一数据平台,通过 Lakeflow Connect 和实时流处理整合车队物联网、道旁检测器等信号。该平台旨在打破原有数据孤岛,为分析、运营和预测性维护奠定统一治理基础。

推荐理由:大型传统企业以统一数据平台支撑大规模资产转型的实践,对数据平台架构和湖仓建设有参考价值。
湖仓数据人Databricks
RSSDatabricks Blog周四 00:35 精选 51

加拿大大型铁路用Databricks Genie Code将管道创建自动化率提至90%

加拿大最大铁路网络之一运营约2万英里线路,年承运货物价值超2500亿加元。其数据团队借助Databricks Genie Code、Unity Catalog、自定义Agent Skills及Databricks Apps上的Streamlit应用,将管道开发变成可复制的工厂:一段YAML提示即可生成生产级摄取代码,涵盖表定义、历史加载、流式摄入、增量合并和自动化测试。结果新表摄入自动化率超过90%,管道交付从数天压缩至数分钟。

推荐理由:数据从业者可借鉴如何用AI Agent与元数据驱动大规模数据管道现代化,降低手工重复开发。
RSSInfoQ (AI/数据工程)周三 22:26 49

Spotify为数据湖构建外部索引实现低延迟点查询

Spotify推出随机访问Parquet(RAP)存储架构,通过外部索引层将查找键直接映射到Parquet文件中的行位置,从而在数据湖上实现低延迟点查询,无需将数据复制到运营数据库。该方案支持在线服务和AI应用从同一数据集读取单个记录,同时继续用于分析、机器学习和在线服务。Spotify表示,其数据湖中存储着EB级数据,而Bigtable中存储PB级在线数据,大规模复制成本高昂。

推荐理由:该架构展示了如何在保持数据湖统一存储的同时满足在线点查询性能,对湖仓架构设计有参考价值。
8月12日2 个事件
RSSTiDB Blog07-31 精选 38

Agentic AI 架构为何需要数据库,不只是向量存储

TiDB工程师在SCaiLE Europe 2026上论述,单独的向量数据库并非AI应用的必要代价,而是数据同步约束下的变通方案。每个新增AI组件都会复制一份数据,带来独立的接入路径、运维和同步任务,导致栈越堆越复杂。TiDB通过同一Raft流同步行存储、列存储、向量索引和全文索引,由SQL优化器决定查询走哪个存储。文章认为分布式SQL原生支持向量搜索与分析能力,可减少数据漂移和多系统运维成本。

另有 1 家信源报道:TiDB Blog
推荐理由:数据从业者关注的多系统同步与数据一致性痛点,本文给出分布式数据库一体化方案,对构建Agentic AI数据栈有参考价值。
收录DataHot 精选08-01 42

DuckDB引入异步I/O,适应云端远程数据读取

DuckDB计划从v2.0开始支持Parquet和CSV异步读取,解决EC2/S3等计算存储分离环境中工作线程等待网络I/O的问题。随着DuckDB从本地SSD查询扩展到远程数据湖和服务化场景,异步请求有望更充分利用带宽。

另有 1 家信源报道:X 线索·@duckdb
推荐理由:异步I/O是DuckDB从嵌入式本地分析走向远程数据湖负载的重要架构变化,值得湖仓与查询引擎团队关注。
8月10日5 个事件
RSSInfoQ 中文周一 23:24 精选 42

华为重定义存储:推AI数据中心五层架构

华为在2026数据存储用户精英论坛上提出AI数据中心数据基础设施五层架构,涵盖AI数据湖、AI数据平台、算力、模型和Agent。为应对大规模推理与Agent落地,华为推出业界首个面向大规模推理的上下文记忆存储CMS(G3.5存储),置于HBM/DRAM与共享存储之间,支持构建PB级共享KV Cache池。华为表示战略方向未变,而是将单点能力整合为全栈方案,存储正进入模型推理路径。

推荐理由:AI推理和Agent规模化落地正在改变数据基础设施架构,存储层创新直接关系到AI数据平台与Agent应用的性能与成本,数据从业者应关注。
RSSDatabricks Blog周一 23:00 精选 47

Databricks推出FILE类型:原生多模态数据列

Databricks宣布推出FILE类型(beta),这是一种原生列类型,可将非结构化数据以受治理的列形式存储在表中,实现与结构化数据统一管理。FILE类型支持统一治理、自动合规(删除行时同步删除对象存储中的二进制文件)、SQL和Python UDF访问,并可与Parquet和Delta Lake生态集成。

推荐理由:数据从业者需关注非结构化数据治理与查询的新方案,FILE类型可能改变多模态数据入湖和分析的实践方式。
湖仓Databricks
官网Snowflake Release Notes周一 01:32 33

Snowflake发布10.27版本更新:动态表支持CREATE OR ALTER

Snowflake于2026年8月2日至6日发布10.27版本更新,其中CREATE OR ALTER DYNAMIC TABLE命令正式全面可用(GA)。该命令结合了CREATE DYNAMIC TABLE与ALTER DYNAMIC TABLE的功能,若动态表不存在则创建,存在则按新定义修改,匹配时无操作。此更新简化了数据管道中的表管理流程。

推荐理由:Snowflake动态表是数据湖仓和实时分析的关键能力,CREATE OR ALTER语法将简化管道运维,数据从业者需关注其GA后的行为变化。
湖仓Snowflake
官网Snowflake Release Notes周一 01:32 26

Snowflake 10.25 版发布:多项 SQL 与数据湖能力更新

Snowflake 发布 10.25 版本更新,覆盖 SQL 与数据湖能力。会话变量大小限制从 256 字节提升至 16KB,对象定义大小限制从 95KB 提升至 1MB。VARIANT 与结构化类型新增 UUID 和 DECFLOAT 值支持,并推出 FORMAT_STRING_TEMPLATE 函数。Apache Iceberg 表新增 UNKNOWN 数据类型预览支持。

推荐理由:Snowflake 官方版本更新直接影响数仓与湖仓实践,本次容量上限提升和 Iceberg 类型支持增强值得数据从业者关注。
湖仓Snowflake
官网Snowflake Release Notes周一 01:32 38

Snowflake发布2026年6月更新:动态表与流支持Delta Direct表

Snowflake于2026年6月20日至25日发布10.22版本更新,宣布Dynamic Tables和Insert-only Streams在Delta Direct表上正式可用(GA)。该版本更新说明已发布在官方文档中,并提供了变更日志。这标志着Snowflake进一步扩展对Delta Lake格式的原生支持,增强数据平台互操作性。

推荐理由:Snowflake核心平台功能更新,直接关系数据湖仓与实时数据管道实践,数据从业者需关注其GA能力及对现有架构的影响。
8月7日3 个事件
RSSFivetran Blog08-07 25

开放数据基础设施需用上下文工程统一数据用例

Fivetran产品布道师Charles Wang撰文指出,单一事实来源不仅来自数据集中化,还必须从数据中构建上下文。他结合Fivetran与dbt Labs的托管数据湖服务(MDLS),说明开放表格式、持续同步与元数据发布如何支撑统一架构。文章强调AI系统缺乏隐性知识,必须通过上下文工程让信息显式、结构化、可信且可检索。他将上下文工程分为四类需求,并首先提及语义与血缘。

推荐理由:数据从业者需关注如何将统一数据架构与AI系统对齐,上下文工程正成为语义层与Data Agent落地的关键实践。
语义层湖仓Fivetrandbt Labs
RSSSnowflake Engineering (Medium)08-07 25

Snowflake Horizon Catalog扩展至企业非结构化数据

Snowflake Horizon Catalog目标是为所有数据和AI资产提供统一目录,实现可发现、可治理并产生可信答案。现在它将扩展到非结构化数据领域。约80%企业数据以文件和对象形式存在,且大多位于本地,包括媒体素材、芯片设计、医学影像、合同和传感器数据等。Snowflake采用元数据优先、内容按需获取的策略,覆盖NAS、对象存储和归档层。

推荐理由:非结构化数据治理是数据平台的关键边界,Snowflake的目录扩展将影响企业数据架构与AI就绪数据策略。
湖仓Snowflake
RSSAWS Big Data Blog08-07 25

SageMaker Unified Studio与Lake Formation实现湖仓细粒度访问控制

AWS官方博客介绍如何结合IAM Identity Center、Lake Formation基于标签的访问控制(TBAC)以及SageMaker Unified Studio的信任身份传播,为大规模企业湖仓构建自动化的最小权限访问治理架构。方案使用CDK部署,通过LF-Tags对数据分类,将IAM Identity Center组映射到标签策略,并在查询时跨分析引擎强制执行权限,解决表级权限手动管理带来的权限漂移与审计困难问题。

推荐理由:数据平台治理团队可参考该架构,利用标签与身份中心自动化的细粒度权限控制,降低湖仓规模扩大后的合规风险与运维成本。