返回
RSS DuckDB Engineering Blog AI 逐段翻译 精选 发布 2026-08-26 08:00

DuckLabs加入AWS,DuckDB等项目保持开源

DataHot 速览

亚马逊AWS宣布签署最终协议收购DuckDB母公司DuckLabs。DuckDB将继续保持开源,创始人Hannes Mühleisen和Mark Raasveldt将继续领导团队及开源项目的技术方向。DuckDB的架构聚焦于让90%以上的日常SQL查询(通常在1TB以内)实现极速运行,广泛应用于数据分析和仪表盘场景。

为什么值得关注:DuckDB是开源分析数据库领域的重要力量,AWS收购将深度影响数据湖仓、分析工具链和SQL生态,值得数据从业者关注。

译文

AI 逐段翻译

今天我们宣布,亚马逊已签署最终协议,收购 DuckLabs,这家总部位于阿姆斯特丹的公司是开源分析数据库 DuckDB 背后的团队。我们预计交易将很快完成,但需满足惯例成交条件。DuckDB 的创建者、DuckLabs 联合创始人 Hannes Mühleisen 和 Mark Raasveldt 将继续领导团队,并在 AWS 内负责该开源项目的技术方向。DuckDB 开源项目也将继续由 DuckLabs 团队推动,并继续保持开源,由独立的基金会(负责监督 DuckDB 的非营利组织)管理,并像今天一样以 MIT 许可证提供(见DuckLabs 博客)。

数据一直是公司的核心资产和差异化因素。如今更是如此,因为组织利用其数据来定制推理和构建 AI 代理。20 年来,AWS 一直引领数据前沿,从推出 Amazon S3 为每个企业创建数据湖开始,然后是第一个云分析服务 Amazon EMR、第一个云数据仓库 Amazon Redshift,以及我们通过 Athena、Glue ETL 等引入的众多功能。我们继续在数据前沿为 AWS 客户创新,包括在 S3 Tables 中直接提供 Apache Iceberg 功能、数据湖中的向量存储,以及我们新的基于 Graviton 的优化 Redshift 集群。

DuckDB 也一直处于改变世界数据处理方式的前沿。Hannes 和 Mark 在荷兰国家研究机构 Centrum Wiskunde & Informatica (CWI) 开始了 DuckDB 项目,该机构还发明了 Python。DuckDB 的创始人意识到,像 Spark 这样的旧数据库和分析引擎专注于处理超大规模数据的性能,但没有有效的方法来“缩小”到较小规模的数据查询,而这些查询构成了大多数客户使用 SQL 分析的主要部分。

DuckDB 致力于解决当今世界上 90% 以上的数据查询的极速性能问题,这些查询通常在分析和仪表板中处理 1 TB 或更少的数据。DuckDB 的架构基于“让日常 SQL 查询超快”的核心前提,因此 DuckDB 在应用程序内进程运行,这简化并加速了与应用程序的数据交换。DuckDB 通过其向量化执行获得了巨大的性能提升,因为它不需要重型编译器来执行像 SELECT * FROM table 这样的简单语句。而且,适用于日常查询的方法(毫不奇怪)也非常适用于代理,因为代理与数据交互时很像人类。它们试探、实验,在弄清楚真正想做什么之前,先在小数据集上进行探索性分析。DuckDB 最终自然地为 AI 代理的使用进行了优化。这个最初作为学术项目的工具,如今因其易用性和原始性能而被广泛应用于数据工程、数据科学、分析以及现在的 AI 代理领域。我们计划将 DuckDB 在 TB 级以下日常查询方面的超能力,与我们经过验证的 S3 的 EB 级以上企业规模以及我们的 AWS 分析服务 Redshift、Athena、EMR、Glue-ETL 和 SageMaker 平台相结合,这些服务为数百 TB 到 PB 级数据提供分析支持。AWS 杰出工程师 Andy Warfield 在 Werner Vogel 的 All Things Distributed 博客中讨论了 DuckDB 与分析物理学的变革

我们的客户今天将 DuckDB 与 AWS 服务结合使用,并告诉我们他们非常喜欢它的速度和简单性。例如,DuckDB 可以直接对本地或 S3 等云存储中的外部文件(如 Parquet、CSV 和 JSON)执行 SQL,提供无与伦比的性能并显著降低成本。

艾伦研究所科学计算执行总监 David Feng 表示:“艾伦研究所通过大规模解决生物学中最重大的问题来加速科学进步,造福更健康的世界,这涉及对大型多模态数据的广泛分析。我们于 2025 年开始使用 DuckDB 分析 TB 级科学数据,非常喜欢它。我们将数据存储在 S3 中,用于神经生理学和行为数据的实时质量控制和分析,这对推动下一次数据采集至关重要。过去需要几分钟的查询现在不到一秒钟就能返回,实现了与数据交互的全新方式。”DuckDB 还可以在 AWS Lambda 函数内进程运行。

我们很高兴能让 DuckDB 应用在 AWS 上运行得最好,并将继续投资于 DuckDB 与我们基础服务之间的深度集成。

我们还在自己的 AWS 基础设施中使用 DuckDB。当 Amazon Quick 想要增强其自定义仪表板引擎的性能时,他们选择了 DuckDB 来查询 S3 Tables 中的数据。Quick 团队发现 DuckDB 引擎可轻松随 CPU 数量扩展,并且其单一库可以轻松插入 Quick 内部控制平面子系统。自 2025 年 10 月推出 Quick 以来,我们已经使用带有 DuckDB 集成和优化的自定义 Quick 查询引擎处理了超过 25 亿次查询。这些 DuckDB 集成和优化帮助 Amazon Quick 将平均查询延迟降低了 30%。我们将研究如何将 DuckDB 的性能和简单性集成到我们的其他数据和分析 AWS 服务中。

请继续关注更多关于 DuckLabs 和 AWS 如何共同重塑数据前沿,为应用程序、数据工程师和 AI 服务,满足客户当前需求,并在 AWS 内提供 DuckDB 创新带来的益处。

补充来源

1 个信源 · 1 篇报道

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存