为什么AI试点会卡在上下文鸿沟——dbt的解法
DataHot 速览
仅16%的企业已规模化部署agentic AI;近80%的公司称AI项目受数据访问限制,70%的受访者表示无法充分信任和治理agent。dbt认为,AI试点停滞的主因并非模型,而是缺乏可信、受治理的上下文,导致agent可能臆造指标或随意选择口径。dbt平台通过提供受治理的语义上下文,帮助企业构建可规模化、可信任的AI agent。
为什么值得关注:数据从业者应关注agentic AI落地中的上下文治理缺口;本文给出了未经治理agent的典型失败模式及dbt平台的解决思路,对自建ChatBI/分析Agent有直接参考价值。
译文
AI 逐段翻译每个人都对智能体AI项目能带来的价值寄予厚望。梦想是让它们投入生产,协助用户并做出推动业务发展的自主决策。
但许多项目停滞在试点阶段。
数字不容乐观:
- 仅有16%的公司已在企业规模部署了智能体AI。
- 一项调查中近80%的公司表示其AI项目受制于数据访问问题。
- 德勤受访者中70%表示他们认为自己无法充分信任和治理智能体。
这导致了常见的情况:AI智能体要么猜测数据,要么完全编造。当智能体在数据源中发现多个相互冲突的“收入”定义时,可能会随意选择一个。
问题在于AI智能体被剥夺了做出明智决策所需的受治理上下文。让我们审视这个上下文问题、无治理智能体为何失败,以及dbt平台如何使您能够构建公司全员可信的可扩展AI智能体。
无治理智能体失败的四种方式
缺乏可信、受治理的数据时,在测试条件下有效的智能体AI解决方案在面临真实用户问题时往往会失败。常见原因有四个:
它编写不可靠的SQL。这通常不是直接的语法错误;一般SQL能解析并运行。问题在于它选择了错误的值。
它发明或误读指标定义。缺乏足够上下文时,智能体可能使用过时、缺失或捏造的指标。缺乏审查加剧了这一问题。
它没有护栏和审计轨迹。没有辅助流程检查智能体的工作,也没有记录可供核查以验证其如何得出结论。
它因低效工作导致计算成本上升。听之任之,AI智能体可能使用超出必要的计算资源,导致数据处理成本飙升。它们完成了工作,但处理过程吞噬了您的利润。
这些都不是“智能体偶尔犯错”的问题。这些问题可预测,且幸运的是可修复。您只需采用正确的数据处理方法。例如:
- SQL生成可以通过严格测试进行验证。您还可以训练模型和智能体学习数据的工作方式。
- 收入可以集中定义,并使用语义层在团队间共享,而不是分散在数十个数据存储中。
机器可读的治理
过去,我们依赖人工审查数据并确保其准确性。在AI时代,我们产生的数据量太大,这种方法已不可扩展。
要使智能体AI真正可扩展,您需要治理。但不是那种把所有内容写进一个没人阅读的大文档的治理。您需要计算和机器可读的治理。
在计算模型中,治理通过多种能力实现:
- 契约。契约是对数据形状、功能、版本间差异以及访问端点的机器可读描述。不满足契约的数据无法发布,从而将一类错误排除在生产之外。契约还使智能体能够发现和使用数据,尤其是当数据形状随时间演变时。
- 测试。数据需要像软件一样进行测试。确保数据正确的测试可以在发布数据转换更改时运行,并在生产中定期运行以确保数据持续健康。
- 语义层。语义层为所有指标定义提供单一中心位置。这消除了智能体猜测“收入”含义的必要。每个指标都提供对AI智能体宝贵的额外元数据:其来源、推导方式以及业务目的。
没有这种机器可读的治理方法,您无法保证AI智能体在大规模下返回准确的答案。
向智能体消费数据的转变
历史上,数据的主要消费者是人。现在很快变为AI智能体,我们人类依赖它们来帮助提炼我们不断生成的海量信息。
Fivetran和dbt Labs认识到,我们可以携手推动AI时代可信的开放数据基础设施的新纪元。
您的AI智能体不必停留在原型阶段。借助dbt平台,您拥有创建高质量、受治理、可信数据所需的工具,使您的智能体能够做出准确决策。
要了解如何操作,观看dbt平台实际运行的完整演示。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏