Pinterest 用意图向量解决十万张表的 Text-to-SQL 检索
DataHot 速览
Pinterest 面对十万级分析表和数千名用户,没有把 Text-to-SQL 的希望只压在大模型上,而是从历史查询中抽取连接、过滤、聚合等结构化意图,构建意图向量,再结合文档、热度、新鲜度和治理等级进行资产排序。核心变化是先找到可信的数据资产,再生成 SQL。
为什么值得关注:它抓住了企业 Text-to-SQL 最容易被低估的一环,也就是表检索。对数据目录、语义检索和 Data Agent 的工程落地都有很强的参考价值。
历史编译稿
旧版 AI 基于原文编译先解决表检索
当分析环境里有十万级表时,用户问题可能对应大量名称相近、字段相似但口径不同的数据资产。即使模型能写出语法正确的 SQL,只要选错表,答案仍然不可信。Pinterest 因此把资产发现放到 Text-to-SQL 流程前面。
意图向量怎么工作
团队从历史 SQL 中提取连接关系、过滤条件、聚合方式等结构信号,把真实分析行为编码成意图向量。相较只对表名和文档做文本嵌入,这种方法能更好地捕捉一张表在实际业务问题中是怎样被使用的。
检索还要理解治理
候选资产不会只按语义相似度排序。系统还综合表的治理等级、使用热度、数据新鲜度和文档完整度,避免把实验表、过期表或缺乏说明的资产推到前面。Pinterest 使用 DataHub 的内部实现 PinCat 管理元数据,并以 OpenSearch 承载向量检索。
可借鉴处
这套方法把 Data Agent 的起点从直接生成查询,改成先完成受治理的数据资产选择。对企业产品而言,表选择依据、候选排序信号和最终引用的数据资产都应可见、可调试、可评测。
补充来源
1 个信源 · 1 篇报道X 线索·@PinterestEng
Pinterest Engineering 分享可扩展 Text-to-SQL 的意图向量方案 2026-03-13 00:21这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏
可选原因
可选原因