返回
收录 DataHot 精选 精选 收录 2026-08-10 09:12 41

OpenAI自研数据智能体:内部600PB数据查询从几天缩至几分钟

OpenAI公开了其内部自建数据智能体的实践细节。该智能体为3500多名员工提供数据服务,覆盖7万个数据集、超过600PB数据。它将获取洞察的时间从几天缩短到几分钟,显著降低各职能部门的数据分析门槛。智能体结合Codex驱动的表格级知识与持续学习记忆,可执行端到端分析。
推荐理由:这是一线大模型公司内部数据智能体落地的一手案例,展示了Agent在超大规模数据平台上的真实路径,对数据团队和BI产品设计有参考价值。

历史编译稿 旧版 AI 基于原文编译

OpenAI日前揭开了其内部自建数据智能体(in-house data agent)的面纱。该智能体服务于工程、产品和研究部门的3500多名内部用户,覆盖7万个数据集中超过600PB的数据。在如此规模下,快速找到正确的表格,成为分析流程中最耗时的环节之一。

OpenAI数据平台在实践中总结出多种常见故障模式,包括多对多连接、筛选条件下推错误,以及未处理的空值。这些问题会显著拖慢分析进度,让数据工程师和分析师在数据准备阶段耗费大量精力。为避免这些陷阱,OpenAI构建了一个能理解数据语义和组织上下文的智能体。

该数据智能体的核心价值在于效率提升:员工可以在几分钟而非几天内,从原始问题中提取出可行动的洞察。它降低了所有职能部门提取数据和进行细致分析的门槛,工程、数据科学、市场进入、财务和研究团队都已依赖它解答高价值数据问题。

技术层面,该智能体结合了Codex驱动的表格级知识(codex-powered table-level knowledge),以及产品和组织的背景信息。它拥有持续学习记忆系统,意味着随着使用频次增加,其对数据资产的理解和回答质量会不断优化。这种机制让智能体能够逐步适配内部数据环境的演变。

在实际使用中,智能体负责执行端到端分析:从理解用户问题开始,到探索数据、运行查询,最终汇总结果。用户无需掌握复杂的查询语言或预先了解底层表结构,即可完成严谨的数据分析。OpenAI的此次分享,为数据智能体在高复杂度数据平台上的应用提供了一个值得参考的样本。

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存