为Token建模而非表:dbt仓储上下文节省20倍成本
DataHot 速览
Gong通话记录是AI重要上下文,但直接调用API每次账户查询消耗约24万token且触及速率上限。团队用Fivetran将Gong数据同步至Snowflake,通过dbt建模并经dbt MCP server提供结构化上下文。最终token成本降低20倍,还能与账户其他数据关联形成更丰富的上下文层。
为什么值得关注:展示如何用现有数仓与dbt为AI Agent构建可治理、低成本的上下文层,避免直接调用事务性API,是数据平台服务AI的典型实践。
译文
AI 逐段翻译Gong是我们拥有的价值最高的AI上下文来源之一。当Claude的内部使用量开始增长时,团队想要连接Gong以提取我们大量的通话历史。这些请求的最短路径是通过Gong MCP的包装器流向Gong REST API。不幸的是,这也意味着团队获得的是原始、未建模的上下文,我们无法治理和改进。
一个客户历史查询通过使用MCP包装Gong的API扩散开来,使用list_calls来收集ID,每次通话记录消耗8,300个token,或者说大约30次通话的账户历史需要约240,000个token的上下文。将这一情况乘以整个销售部门研究多个账户,正是使Gong API的每秒和每日速率上限达到红线的方式,很快我们就触及了上限。
Gong的API限制并不是真正的问题。我们的核心问题是使用事务性API作为AI的高吞吐量上下文层。Gong和其他来源从未为这些高容量、操作型用例设计过。数据库才是为此设计的。
阅读: 从分析工程师到上下文工程师
压缩、上下文工程和成本节约
我们确定根本原因是数据团队面临的相同历史问题。用户没有通过我们传统的数据建模和数据仓库层,而是直接命中源数据,每次都用相同的"给我所有记录,然后总结它们"请求去访问Gong。分析MCP连接器使用情况显示,Claude直接访问我们数据仓库中已有的源。
Fivetran已经将Gong持续地导入Snowflake,我们可以在那里建模数据,这样人们就永远不需要原始源。通过dbt MCP服务器从数据仓库提供Gong数据,消除了API上限,并让我们能将丰富但通常冗长的上下文建模成代理所需的确切形状。我们甚至可以从更广泛的数据仓库中受益,将Gong数据与我们了解的关于账户的所有其他信息连接起来,为我们的团队使用Claude等代理工作时创建丰富的上下文层。

更高质量的上下文,更低的成本
通过利用我们的数据仓库和dbt,我们解决了API限制问题,并且开启了显著的潜在token节省。将原始Gong数据摄取到我们的数据仓库中,使我们能够使用数据建模来总结每次通话,消除噪音并仅提取相关信号。鉴于Gong数据在指导业务方面的重要性及其使用频率,在其上建立管道以供所有通话记录用例使用是合理的。
积极压缩记录使数据量缩减了20倍或更多,将60分钟的通话从10,000多token削减到仅几百个。相同的记录,经过总结,消耗的token减少了74倍,现在为AI代理提供服务的成本降低了99%,同时保持或提高了上下文质量。我们可以在相同成本下每天运行数百或数千个额外的Claude会话,使投资回报率飙升。
压缩本身在数据进入仓库时作为增量dbt作业运行,推理通过Snowflake积分、Vertex批处理定价或Databricks AI函数定价,这些都比交互式API调用便宜得多,并且每次调用只支付一次,而不是每轮支付。结果是数量级的节省:批量压缩1,000次通话的成本在几十美元的低位数。由于压缩是每次通话的一次性成本,而节省在每次读取时重复,批处理作业在第一次有意义的代理会话中就能收回成本。
企业规模下的token效率
| 直接连接(原始记录) | dbt + 仓库AI压缩20倍 | |
|---|---|---|
| 每轮输入token (约12次通话上下文) | 100,000 | 5,000 |
| 每轮输入成本 | $0.30 | $0.015 (1/20) |
| 每轮输出token/成本 | 5,000 / $0.075 | 5,000 / $0.075 |
| 每轮总成本 | $0.375 | $0.090 |
| 每名销售每年 (50轮 × 250个工作日) | $4,700 | $1,125 |
| 人在环路成本 100人销售团队/年 | $470,000 | $110,000(节省:$360,000/年) |
| 代理成本 始终在线工作流/年(5K轮 × 365天) | $685,000 | $165,000(节省:$520,000/年) |
基于2026年8月的Claude Sonnet 5定价,可能会有变动:每百万输入token $3,每百万输出token $15。
模式
这种模式正是dbt构建要做的:在数据仓库中建模记录,使用仓库原生AI函数压缩它们,并通过dbt MCP服务器向代理提供压缩形式。我们只需要在内部进行dogfooding,以展示dbt为AI转换数据的效果与为BI转换一样好:
- Fivetran在通话结束时使用现有连接器将Gong记录交付到数据仓库,无需新基础设施。
- 一个dbt模型调用仓库原生AI函数 (Snowflake Cortex COMPLETE、Vertex AI批处理预测或Databricks AI函数)来生成结构化总结,捕获交易相关要点、命名实体、情感、行动项和异议类型。10,000个token的记录通常压缩为500到1,000个token的结构化总结,而不会丢失代理进行交易上下文所需的信号。
- dbt MCP服务器向查询的AI客户端提供压缩形式。这是AI客户端用于任何其他dbt建模数据的相同连接,总结看起来就像另一个建模良好的表。
Gong是我们的初始测试案例,但该模式适用于任何token密集、持久的数据源。相同的架构适用于来自电子邮件档案、Slack频道日志、支持工单、合同或营销材料的工程上下文。
提供Gong的三种方式
直接比较,使用官方Gong MCP、包装Gong API的MCP(Gong MCP)和dbt MCP服务器,它们在将非结构化Gong数据作为AI上下文提供方面的表现如何:
| 官方Gong MCP | Gong MCP包装器 | dbt MCP服务器 | |
|---|---|---|---|
| 关键工具 | ask_account, generate_brief | list_calls,get_transcripts,list_calls_extensive;精简变体(例如get_transcripts_slim) 用于减少上下文 | text_to_sql, execute_sql, query_metrics |
| 返回内容 | 服务器综合的简报,无原始文本 | 原始转录文本,按说话人分段并去除时间戳;精简变体削减字段但不削减文字 | 问题所需的任何层级:元数据、简报、片段或完整转录,以及受治理的指标 |
| Gong API 压力 | 轻 | 重;每个问题会展开 list_calls → get_transcripts 对每个通话。 list_calls_extensive 减少往返,但仍返回完整文本并消耗速率限制预算。精简变体不改变调用次数。 | 无, 读取命中 Snowflake |
| 拉取前的内容过滤 | 无 | 无 | 有 (WHERE topic = 'pricing') |
| 关联 CRM、产品、计费 | 无 | 无 | 有 |
| 逐字 | 无 | 有 | 有 |
| 确定性 | 无;每次调用重新综合 | 有,原始文本是稳定的 | 有, 根据受治理的定义计算 |
| 设置成本 | 无 | 无 | 前期需要真正的建模工作 |
成本比较:Gong vs MCP 包装 vs dbt
没有适用于所有查询的单一最佳工具,但每种问题类型都有 一个 最佳工具。当您只需要一个快速的、服务器综合的、单账户摘要时,Gong 的官方 MCP 很高效;MCP 包装/网关平台适合拉取原始转录文本。其他一切——任何过滤、聚合、关联或趋势分析,即人们实际提出的大多数分析性问题——都应该通过 dbt 的建模和仓库层来处理。
注意:成本按 Opus 定价每百万 token 5 美元计算,锚定每次调用 8,314 个原始 token 和 112 个简报 token。
| 问题类型 | 官方 Gong | Gong MCP 包装 | dbt MCP 服务器 | 最佳选择 |
|---|---|---|---|---|
| 摘要;"Acme 公司情况如何" | 30 次通话的简报,约 1,200 token,$0.006 | 没有专门的摘要工具;list_calls_extensive 使用主题获取结构化元数据;叙述需要 get_transcripts_slim 跨 30 次通话,接近 ~$1.25 | 简报列 × 30,约 $0.017 | 官方 Gong, 最便宜,且在没有包装摘要工具的情况下更便宜 |
| 一次性原始文本:"拉取 5 月 14 日 Acme 通话的逐字记录" | 无法返回原始文本 | get_transcripts 使用通话 ID,约 8,314 token,$0.042, 这是它的优势所在 | SELECT transcript WHERE call_id = ..., ~$0.042 | MCP 包装 ≈ dbt |
| 过滤后的逐字记录:"Acme 对定价说了什么" | 仅转述,不可审计,$0.004 | list_calls 获取 ID 然后 get_transcripts 获取全部 30 次通话,无内容过滤,$1.25 | WHERE topic = 'pricing', 逐字并且带说话人和时间戳,$0.06 | dbt, 便宜 20 倍,可审计 |
| 大规模通话汇总: "今年所有通话中的前 10 大异议" | 无聚合工具 | 即使简报层级也约 $21,不可靠 | 一次 query_metrics 调用,约 500 token,$0.0025 | dbt, 便宜约 8,600 倍,是唯一可靠的路径 |
| 关联: "提出定价 3 次以上的账户转化更差,按 细分" | 不可能 | 不可能 | Salesforce 关联已存在,成本极低 | dbt, 唯一路径 |
| 趋势: "这个竞争对手每季度被提及次数是否增加" | 无时间序列原语 | 不实际 | query_metrics 按季度分桶,$0.0025 | dbt, 唯一实际的路径 |
开始使用
如果您想将 Gong 上下文接入 AI 工作流,前进的道路是停止直接连接 Gong 的 API,与数据团队合作,将 Fivetran + dbt + 仓库-AI 管道建模。任何 AI 客户端(Claude、代理或您使用的任何界面)连接到 dbt MCP 服务器 作为单一受治理的入口点,并通过与仓库中其他内容相同的界面访问 dbt 建模的数据。
分析工程师一直在转换结构化数据,为人类和 BI 工具构建表。现在我们可以将相同的一般原则应用于非结构化数据,为 AI 代理构建模型和上下文。为 AI 建模 Gong(及类似来源)是当前数据团队最具影响力的工作之一,token 效率是首要设计约束。
是时候超越我们能提供什么指标,开始将通话转录和其他定性数据视为一流的、受治理的仓库资产。现在,对于您接入 AI 的任何来源,要问的第一个问题是 原始形式每个问题的成本是多少,以及能回答该问题的最小建模形式是什么?
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏