← 主题地图

湖仓

Iceberg/Delta、存算分离与半结构化——架构之争的下一站

近 7 天新增 12累计 56 · 每 6 小时更新

近期进展

最近 7 天内最新的 3 条

2026-09-30 · AWS Big Data Blog

AWS 在 Amazon EMR on EKS 上支持 Spark Connect

AWS 宣布在 Amazon EMR on EKS 上支持 Spark Connect,起始版本为 EMR 7.14(Apache Spark 3.5.8)与 emr-spark-8.1(Apache Spark 4.1.1)。开发者可在 VS Code、PyCharm、Jupyter、SageMaker Unified Studio 等本地工具中构建、测试和调试 PySpark 应用,实际计算则路由到 EKS 上的 Spark 集群执行。该能力基于客户端-服务端架构,通过 gRPC/TLS 连接,旨在解决本地环境与远程集群之间的依赖冲突和规模性能差异。每个 Spark Connect 会话可使用独立的 IAM 执行角色与自定义标签,便于权限隔离和成本追踪,AWS 还提供了端到端示例 notebook。

2026-09-30 · AWS Big Data Blog

Aurora PostgreSQL 与 SageMaker zero-ETL 集成

AWS 推出 Amazon Aurora PostgreSQL 与 Amazon SageMaker 的 zero-ETL 集成,将 Aurora PostgreSQL 数据近实时复制到 AWS Glue Data Catalog,并以 Apache Iceberg 表形式提供分析访问。该集成基于 CDC,通过增强逻辑复制捕获事务日志中的插入、更新和删除,减少传统 ETL 管道的延迟、运维开销与数据孤岛。用户可在 SageMaker 中结合 S3 数据湖和 Redshift 数仓的数据,用 SQL、Spark、BI 及 AI/ML 工具分析同一份数据。文章还介绍了 Lake Formation 的统一访问控制、湖仓架构和配置查询流程。

2026-09-29 · ClickHouse Blog

ClickHouse Fabric 工作负载公测:OneLake 亚秒级分析

ClickHouse Workload for Microsoft Fabric 现已公开预览,可从 Fabric 工作负载中心获取,把 ClickHouse 作为 OneLake 的加速层。用户可将 OneLake 表同步到专属 ClickHouse Cloud 服务,在 Fabric 内以亚秒级响应查询数十亿行,且 OneLake 保持唯一事实源。该工作负载使用 Microsoft Entra 账户在 Azure 上开通专属 ClickHouse Cloud 计算,含试用,可服务 AI agent、仪表盘和应用而不消耗 Fabric 容量。它还提供内嵌 SQL 控制台、Power BI 认证连接器、Fabric notebook 及面向 Copilot Studio/GitHub Copilot 的只读治理访问。

入门阅读

精选长期内容,最多 3 篇

全部动态

按发布时间倒序

AWS 在 Amazon EMR on EKS 上支持 Spark Connect AWS Big Data Blog Aurora PostgreSQL 与 SageMaker zero-ETL 集成 AWS Big Data Blog ClickHouse Fabric 工作负载公测:OneLake 亚秒级分析 ClickHouse Blog Redshift Iceberg 写入支持 Part 3:模式与分区演进 AWS Big Data Blog Plaid 从 Aurora 迁移到分布式 SQL 的零停机实践 TiDB Blog Apache Iceberg C++ 0.4.0 发布 Apache Iceberg Blog Fivetran 与 Airbyte 对比:功能、定价与关键差异 Fivetran Blog 从Kafka依赖到直连接入:Snowpipe Streaming Elastic Channels生产实践 Snowflake Engineering (Medium) DuckDB 与 Hugging Face:直接查询数据集 DuckDB Engineering Blog Snowflake托管Iceberg表的事件驱动Glue Catalog注册方案 Snowflake Engineering (Medium) Lakebase与TiDB X:AI需求下的数据库架构 TiDB Blog Concurrence 用 Unity Gateway 治理万亿级临床 AI Databricks Blog 用Databricks系统表查询理解成本的Top 5 Databricks Blog 从Cassandra到Snowflake:NoSQL数据集成蓝图 Snowflake Engineering (Medium) Snowflake PERIOD 数据类型:用原生时间范围查询生效记录 Snowflake Engineering (Medium) 蚂蚁Altum大模型训练数据处理系统设计与实践 InfoQ 中文 Google Cloud为托管Spark引入灵活虚拟机以应对容量短缺 Google Cloud Data Analytics Blog DuckDB-Wasm 结合 OPFS 实现浏览器持久化数据库 DuckDB Engineering Blog 为 AI Agent 选择数据库的 5 项评估标准 Databricks Blog Snowflake实时分析:可复现的亚秒级延迟基准测试 Snowflake Engineering (Medium) 美联航用Redshift联邦查询Databricks数据 AWS Big Data Blog 用 Iceberg 物化视图加速 Spark 查询 AWS Big Data Blog 开放湖仓中跨引擎与目录的统一治理 Databricks Blog AWS助力Sony LIV构建实时视频流分析 AWS Big Data Blog 40年数据库规则被Agent打破:LTAP统一OLTP与OLAP负载 Databricks Blog S3到GPU一次拷贝:Vortex重新定义ML训练数据加载 InfoQ (AI/数据工程) Moovit通过架构现代化实现33%成本优化 AWS Big Data Blog 使用Iceberg REST端点从Amazon EMR Trino查询S3 Tables AWS Big Data Blog 在Amazon SageMaker用Iceberg物化视图构建Medallion架构 AWS Big Data Blog 用Apache Iceberg和Flink构建动态流式数据湖 AWS Big Data Blog Fivetran:开放数据基础设施加速工作流的六种方式 Fivetran Blog Snowflake Postgres:从OLTP到分析的无ETL实战指南 Snowflake Engineering (Medium) Indra在Databricks上统一EV充电数据 Databricks Blog Razor Group在AWS上构建现代数据湖仓实践 AWS Big Data Blog AWS Glue 6.0支持Iceberg v3地理空间与变体类型 AWS Big Data Blog 对象存储+WAL:面向智能体时代的Lakebase Postgres Databricks Blog 用Snowflake CREATE OR ALTER告别频繁Schema变更部署疲劳 Snowflake Engineering (Medium) 超越偏移滞后:PB级Apache Hudi数据湖管道的队列时间计算 InfoQ (AI/数据工程) 跨云分析:使用IAM将BigQuery连接到Amazon S3 Tables AWS Big Data Blog 数据网格vs数据结构:湖仓如何化解架构之争 Databricks Blog 开放表格式解析:Iceberg vs. Delta vs. Hudi Databricks Blog 关系型与非关系型数据库选型指南 Databricks Blog dbt on Snowflake实践:把编排搬进数仓后真正的问题 Snowflake Engineering (Medium) 破解SQL迁移迷思:新SQL特性让存储过程平迁湖仓更轻松 Databricks Blog Iceberg Catalog层选型指南:Horizon、Polaris、Glue与Nessie对比 Snowflake Engineering (Medium) Google Cloud Lakehouse catalog 助力 Hive Metastore 现代化 Google Cloud Data Analytics Blog talabat构建跨AWS与Google Cloud的近实时分析架构 AWS Big Data Blog Fivetran谈数据目的地:决定数据架构成败的5个要点 Fivetran Blog Amtrak 构建铁路智能平台,用 Databricks 统一数据骨干 Databricks Blog 加拿大大型铁路用Databricks Genie Code将管道创建自动化率提至90% Databricks Blog Spotify为数据湖构建外部索引实现低延迟点查询 InfoQ (AI/数据工程) Apache Iceberg Variant类型:半结构化数据新解法 Apache Iceberg Blog Agentic AI 架构为何需要数据库,不只是向量存储 TiDB Blog 开放数据基础设施需用上下文工程统一数据用例 Fivetran Blog SageMaker Unified Studio与Lake Formation实现湖仓细粒度访问控制 AWS Big Data Blog DuckDB引入异步I/O,适应云端远程数据读取 DuckDB Blog
涉及 39 个厂商 展开查看
AWSAWS GlueAWS Lake FormationAirbyteAmazon AuroraAmazon EKSAmazon EMRAmazon RedshiftAmazon S3 TablesAmazon SageMakerApache AirflowApache IcebergApache PaimonApache SparkBigQueryClickHouseDataStaxDatabricksDremioDuckDBFivetranGoogleGoogle BigQueryGoogle CloudHugging FaceMicrosoftMicrosoft FabricNeonPingCAPPlaidPower BIRedshiftSnowflakeSpiralDBTableauTiDBdbtdbt Labs蚂蚁集团