Agentic AI项目失败的原因与修复之道
DataHot 速览
Wayfair用AI Agent每月自动化4.1万张供应商支持工单;C.H. Robinson的Agent每天自动创建超5500个货运订单,节省600人时。而Klarna的客服Agent却导致质量问题和客户满意度下滑。Gartner预测超40%的Agentic AI项目将在2027年底前被取消,Fivetran报告显示仅15%组织准备就绪。文章指出成败关键不在模型,而在数据质量与治理。
为什么值得关注:用真实案例和行业数据揭示AI Agent成败的数据关键,帮助数据团队理解数据质量与治理在Agent项目中的决定性作用。
译文
AI 逐段翻译人工智能实现之间存在令人惊讶的差异。
Wayfair 构建了智能体来支持其供应商,现在每月自动化处理41,000个支持工单。C.H. Robinson 构建了智能体,能够读取运输请求电子邮件、连接消息和附件中的信息、获取额外上下文,并自动创建每天超过5,500个运输订单,每天节省600个人工时。
但也有 Klarna,一位分析师称之为“糟糕AI部署的典型代表”。一个旨在完成超过850名员工工作的客户服务智能体导致了质量问题和客户满意度下降。
相同的技术,结果却截然不同。而决定因素很少是模型。正如我们下面将讨论的,区分成功与警示案例的是底层数据,以及用户是否能信任它。
为什么智能体AI项目因缺乏可信数据而失败
智能体AI正经历一代人以来最激进的技术采用曲线。
根据 2026年Gartner CIO和技术高管调查,超过60%的组织计划在未来两年内部署AI智能体,而目前只有17%已经部署。McKinsey估计 生成式AI每年可在企业用例中增加2.6万亿至4.4万亿美元的价值。
然而 Gartner还预测 到2027年底,超过40%的智能体AI项目将被取消。2026年Fivetran报告 发现,尽管绝大多数组织已经投入了数百万美元,但只有15%的组织完全准备就绪。
雄心与准备之间的差距有原因,而且是具体的。成功的智能体AI实施的关键限制因素通常不是模型质量,而是数据质量差和治理不善。
前沿AI实验室已经发布了强大的基础模型。但如果输入它们的数据不准确、不完整或不一致,结果就会很差。
智能体AI 将生成式AI的推理能力扩展到通过软件执行的决策和行动,不仅产生信息,还在世界中行动。正是这种转变提高了风险。
没有充分的数据和上下文,智能体AI可能误判情况、选择错误的响应、大规模执行错误操作,并导致级联工作流错误。如果安全、治理和问责制不足,包括数据资产层面的不足,可能难以或无法追溯错误决策的根源并加以补救。
公开示例具有启发性。Air Canada 部署的聊天机器人为客户提供了关于丧亲定价的不准确信息,未能参考并正确引用公司的内部政策。Replit的软件开发副驾驶 在代码冻结期间删除了生产数据库,并在此过程中创建了虚假数据,这类事件是严格的生产控制应该防止的,无论行为者是人类还是AI。
我们认为将智能体AI带来的风险分为三类很有用:
- 操作正确性风险: 智能体基于过时、缺失或误解的数据行动。
- 控制平面风险: 智能体拥有错误的权限、可审计性弱或安全边界差。
- 人机系统风险: 人类过度信任、审查不足或无法有效监督智能体。
这三者贯穿始终的是上下文。对于智能体,过时的数据不仅仅是分析问题;它可能变成基于错误现实版本采取的操作行动。基于上周数字构建的仪表板是糟糕的报告。基于上周数字行动的智能体是糟糕的决策,以机器速度自动执行。
智能体对数据的要求比仪表板更高
智能体AI对组织数据基础设施的要求远高于以人为中心的分析工作流,尤其是报告和其他形式的决策支持。
人类分析师间歇性地消费数据;智能体则持续消费数据。人类可以通过经验吸收隐性的、部落的知识,并能凭直觉、记忆或调查数据资产的来源。智能体需要明确的上下文访问、明确的治理和数据沿袭访问。
关键挑战是在整个企业数据资产中缺乏受治理的、一致的上下文。AI智能体不仅需要原始数据。它们需要可靠的数据移动、共享业务逻辑、语义上下文、沿袭以及跨每个来源和消费者的访问控制。
满足这一要求依赖于两大支柱:自动化和集中化。集中数据并确保一次性盘点、定义,对于扩展可信数据访问、控制基础设施成本和管理合规风险至关重要。数据集中后,团队必须系统性地转换,即建模,将其转化为AI可用的上下文层。这就是为什么沿袭、语义层和治理至关重要:
- 沿袭 向用户(包括智能体)展示数据来自何处以及是否可信。
- 语义层 为表应用共享业务含义,让人类和智能体都能对数据如何映射到现实世界业务概念达成一致、一致的理解。
- 治理 控制用户和智能体可以访问、决定和更改的内容。
还有一个容易低估的要求:互操作性。随着AI工具的不断发展,一个工作流的最佳模型、计算引擎、编排层或激活渠道可能不适用于另一个工作流。
互操作性让团队能够自由连接系统,而无需复制数据、重建管道,或将代理工作流锁定在单一供应商中。如果每个AI用例都需要将数据复制到专有孤岛中,组织将失去治理、可移植性和控制力。
代理式AI真正表现最佳之处
决定将代理指向何处与底层基础设施同样重要。由于AI的设计,其能力分布极不均匀,在某些任务上表现出色,而在其他任务上则有所欠缺。
它在文本和代码的模式识别与补全方面很强,包括起草、编辑、总结、翻译和编码。它在构思和头脑风暴方面很强,尤其是在需要广度且糟糕建议成本较低时。它擅长在前提和约束明确的情况下进行推理。
另一方面,当事实晦涩或高度具体时,它难以区分真相与合理性,也不知道何时不该回答。它在需要有限证据进行因果推理和长期规划的无界问题上,以及对抗性交互方面,表现不佳。
这一能力分布为良好的代理用例指明了一套清晰的特征:
- 高容量
- 可重复的结构
- 文本/代码密集型输入
- 明确成功标准
- 低成本人工审核
- 可逆或低风险操作
- 有可用的权威数据
糟糕的用例则相反:责任模糊、法律或安全风险高、数据稀疏、用户具有对抗性、需要长期规划且操作不可逆。
记住这些系统往往增强工作而非取代工作是有帮助的。2016年,杰弗里·辛顿,他后来因人工神经网络方面的研究获得2024年诺贝尔物理学奖,曾预测到2021年放射科医生将作为一个职业灭绝,原因是AI图像识别。到2025年,放射科医生的薪酬、就业和工作量从未如此之高。AI更可能增强复杂工作流而非消除岗位。
我们自己也应用了这些原则。Fivetran的首席产品官使用代理式AI对Jira数据进行对话式分析。直接查询Jira的MCP服务器在规模上不可行,因此团队通过Fivetran将Jira数据移至BigQuery,使用Claude技能进行查询,并在数小时内而非多个分析师冲刺中产生产品运营洞察。
另外,我们的支持团队在Zendesk中嵌入了一个自定义AI应用,用于回答问题、起草回复、总结交接和查找类似工单。该应用使用Fivetran和dbt构建,集中了来自Zendesk、Slab、Jira、GitHub、Google Drive、Gong、Salesforce和文档的知识。
共同点是:每个代理都是狭窄的、高容量的,并基于它能接触到的权威数据。
构建您可以信赖的代理
一旦您选择了工作流,构建本身比大多数团队想象的要容易。从零构建代理式AI模型是一项复杂的工作,可能花费数百万美元和数月开发时间。
更实用且风险较低的选择是使用RAG架构,用您组织的独特专有数据增强基础模型。您可以通过dbt MCP服务器和类似受控接口与您的运营交互,从而创建执行特定任务的专门代理。
最安全的推出方式是分阶段,逐渐增加自主性:
- 从仅检索和汇总信息的只读代理开始。
- 然后,构建起草代理,准备输出供人工审查和最终实施。
- 接下来,构建有界回写代理,在严格、狭窄的范围内行动。具有潜在风险的操作应需要批准,而敏感、不可逆、受监管或安全关键的操作应禁止自主执行。
正确实施每个阶段取决于若干细节,例如您的参考架构、上下文工程的纪律,以及一份具体的就绪检查清单。
我们已在《数据领导者代理式AI入门》中阐述了这个蓝图。它逐步介绍了参考架构、选择用例的优势与劣势映射,以及我们用来将代理从想法推进到生产的检查清单,以便您的项目避免沦为40%取消统计数据的一部分。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏