返回
RSS Pinterest Engineering 历史编译稿 编辑精选 发布 2026-03-06 08:00 精选于 2026-09-05 00:32

Pinterest 用意图向量解决十万张表的 Text-to-SQL 检索

DataHot 速览

Pinterest 面对十万级分析表和数千名用户,没有把 Text-to-SQL 的希望只压在大模型上,而是从历史查询中抽取连接、过滤、聚合等结构化意图,构建意图向量,再结合文档、热度、新鲜度和治理等级进行资产排序。核心变化是先找到可信的数据资产,再生成 SQL。

为什么值得关注:它抓住了企业 Text-to-SQL 最容易被低估的一环,也就是表检索。对数据目录、语义检索和 Data Agent 的工程落地都有很强的参考价值。

历史编译稿

旧版 AI 基于原文编译
先解决表检索

当分析环境里有十万级表时,用户问题可能对应大量名称相近、字段相似但口径不同的数据资产。即使模型能写出语法正确的 SQL,只要选错表,答案仍然不可信。Pinterest 因此把资产发现放到 Text-to-SQL 流程前面。

意图向量怎么工作

团队从历史 SQL 中提取连接关系、过滤条件、聚合方式等结构信号,把真实分析行为编码成意图向量。相较只对表名和文档做文本嵌入,这种方法能更好地捕捉一张表在实际业务问题中是怎样被使用的。

检索还要理解治理

候选资产不会只按语义相似度排序。系统还综合表的治理等级、使用热度、数据新鲜度和文档完整度,避免把实验表、过期表或缺乏说明的资产推到前面。Pinterest 使用 DataHub 的内部实现 PinCat 管理元数据,并以 OpenSearch 承载向量检索。

可借鉴处

这套方法把 Data Agent 的起点从直接生成查询,改成先完成受治理的数据资产选择。对企业产品而言,表选择依据、候选排序信号和最终引用的数据资产都应可见、可调试、可评测。

补充来源

1 个信源 · 1 篇报道

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存