Amplitude发布Agent Analytics:AI Agent团队为何需要它
DataHot 速览
Amplitude 在构建自己的 AI Agent 时发现,传统产品分析无法判断 Agent 是否真的给出了有用回答。用户可能两分钟对话后愤怒离开,传统指标却显示为高活跃。为此他们推出 Agent Analytics,用于追踪回答质量、定位失败原因(prompt、缺失上下文、工具调用错误),并分析不良体验对留存和升级的影响。这为 AI Agent 的可观测性提供了新的思路。
为什么值得关注:Agent 质量评估是数据 Agent 落地中的关键难题;Amplitude 的实践展示了传统分析工具的盲区,值得所有构建和运营 Agent 的团队参考。
本文目录 9 节
译文
AI 逐段翻译这篇博客文章由Amplitude首席AI产品经理Jacob Newman和产品营销负责人Nikhil Gangaraju共同撰写。
Amplitude是一家产品分析公司。我们花了十多年时间帮助产品团队了解他们的用户正在做什么以及为什么这样做。漏斗、留存曲线和行为分群。我们深谙此道。然而,去年当我们开始构建自己的AI代理时,我们发现自己陷入了一个奇怪的境地:
我们完全不知道我们的代理是否真的优秀。
不是我们通常衡量产品的那种“优秀”。我们有参与度指标、激活率、NPS分数和离线评估。但没有一个能告诉我们我们需要知道的事情:当用户向我们的代理提问时,它是否给出了有用的答案?当它失败时,为什么失败?是提示词不好?缺少上下文?工具调用出错?如果用户体验不佳,他们是否会流失?如果他们体验很好,他们是否会更好地留存或升级?
我们的职业生涯建立在这样的理念上:好产品来自对用户行为的理解。但当我们的“产品”变成了非确定性的AI代理时,我们整个可观测性栈就变得无关紧要了。因此我们构建了Agent Analytics来解决这个问题。
借助Agent Analytics,我们最终能够回答最初无法回答的问题。本文将介绍我们是如何做到的。
为什么传统产品分析对我们失效了
我们现有的分析在其设计用途上仍然有效。我们可以看到有多少人打开了代理。我们可以跟踪会话时长、功能采用率和留存率。仪表板都是绿色的。图表都是向上向右的。
但用户可能打开代理,进行两分钟的对话,然后愤怒地离开。在传统分析中,这显示为一次积极参与的会话。两分钟!多个事件触发了!漏斗显示“已激活”。而实际上,用户问了一个问题,代理产生了幻觉,用户认为我们的产品有问题。
传统产品分析是为用户点击按钮和浏览页面的世界而构建的,产品行为是确定性的,你可以从行为中推断意图。代理颠覆了这一点。
对于代理,用户明确表达意图(他们明确输入他们想要什么),但产品行为不可预测。代理可能以正确的顺序调用正确的工具并完美回答问题。或者它可能误解请求、调用错误的工具、凭空捏造数据,并自信地将垃圾作为洞察呈现。两条路径都会生成事件。在传统分析仪表板中它们看起来完全一样。
我们开始意识到我们的盲区无处不在。
- 我们无法衡量质量。代理的输出准确吗?它是否回答了用户的问题?传统分析跟踪的是发生了什么,而不是体验是否良好。对于生成自由格式响应的非确定性产品,这种区别是一个重大转变。
- 我们也无法调试失败。当出现问题(对于代理,问题会以创造性的方式出现),没有系统的方法来理解导致问题的推理链。是系统提示太模糊?检索返回了不相关的上下文?还是模型尽管有正确信息却产生了幻觉?每种失败模式需要完全不同的修复。
- 实验也是一团糟。在传统产品开发中,你对功能发布或流程更改进行A/B测试并衡量结果。对于代理,变量是提示词措辞、上下文窗口组成、工具选择逻辑、模型温度。结果是定性的:响应是否有意义?是否有帮助?用户是否信任它?我们的实验框架不是为此构建的。
- 我们也无法衡量投资回报率。团队在问正确的问题:“优秀的代理交互是否会促使免费用户升级?”“当我们的代理产生幻觉时,我们付出了什么代价?”但由于除了浅层的参与数据外没有质量信号,没有人能回答这些问题。
这个讽刺难以忽视。十年间我们告诉客户,没有好的分析就无法构建好的产品,而我们现在却在构建一个没有任何信号表明其是否有效的代理。
我们与其他构建代理的团队交流过。模式是普遍的。每个人都在拼凑日志框架、LLM可观测性工具和一些感觉。可观测性工具给了我们追踪,所以你可以看到模型逐步做了什么,但这些追踪在基础设施层面运作。它们告诉你模型如何运行,而不是产品是否成功。另一方面,传统分析工具告诉我们代理周围的用户行为,但无法看到对话内部。
没有人拥有完整的图景。所以我们构建了Agent Analytics。
什么是Agent Analytics?
Agent Analytics介于产品分析和LLM可观测性之间。它不是日志工具。也不是LLM追踪之上的仪表板层。它是一个系统,从用户角度理解你的AI代理作为产品的表现,并具有足够的深度来实际诊断和改进它。
在构建Agent Analytics时,我们并没有打算取代工程师用来监控基础设施的深层技术追踪。相反,它充当桥梁,将技术信号转化为产品的语言,如用户留存、转化和意图。
追踪是用户与代理之间对话的完整记录:多轮交互,包含意图、推理、工具使用和可评估的结果。与在追踪处停止的可观测性工具不同,Agent Analytics将这些对话分解为事件,可以直接在你已经用于其他所有事的相同漏斗、分群和留存分析中查询。
当你将追踪作为分析的主要对象时,一些事情开始展开:
你可以看到你的用户实际试图做什么。 Agent 分析按意图对用户查询进行聚类,展示最常见的请求,并告诉你 Agent 在哪些方面持续表现出色,哪些方面表现不佳。这是传统分析无法提供的产品市场契合信号。你不再需要从行为模式中猜测。相反,Agent 内的用户在向你传达信息。
你可以追溯失败的根本原因。 当 Agent 失败时,你可以深入完整的追踪记录:用户问了什么,Agent 如何理解,调用了哪些工具,检索了哪些上下文,哪里出了问题。是提示词问题?工具问题?还是上下文问题?这正是 Agent 分析系统可操作性的体现。
你可以大规模衡量质量。 每条追踪记录都会通过可配置的评估自动进行,以判断 Agent 是成功、部分成功还是失败。你可以跟踪随时间、用户群体和查询类型的质量变化。当你部署新的提示词或添加新工具时,你能持续看到生产环境中质量是上升还是下降。
Agent 分析用产品信号为你的评估提供信息
当我们以 76% 的通过率上线全球 Agent 在离线评估集上时,我们认为最困难的部分已经过去了。离线评估对于让 Agent 达到可信的基线至关重要,但它无法捕捉 Agent 上线后用户实际使用的多样性。我们精心挑选的“真实”问题集结果证明与真实用户输入的问题大相径庭。
我们大力投资于构建离线评估作为 AI 开发生命周期的一部分。然而,离线评估永远无法代表生产环境中的完整问题空间。最接近真相的是在线信号:对真实对话、真实用户,以生产环境实际产生的规模和多样性进行的评估。然而,真正的突破来自将在线评估与产品数据结合之后。
虽然现在有很多工具可以给生产环境中的追踪记录打分,但没有产品数据,它们就无法将该追踪记录与用户后续行为联系起来:他们是否在接下来一周升级,或者在接下来一个月流失,或者你最活跃的用户如何以不同于其他人的方式使用 Agent。通过在同一身份下捕获追踪记录以及同一用户在此之前和之后的所有行为,我们可以评估体验,而不仅仅是记录。产品数据告诉我们体验是否良好。在线评估在此基础上更好。
了解 Agent 对话背后的完整图景
另一个考虑因素是了解人们使用 Agent 完成任务的真实图景。知道“支付调度”失败率为 31%,而“一般问题”失败率仅为 3%,如果你能将它们与真实的产品结果联系起来,就可以采取行动。Agent 分析使用它已经生成的嵌入自动将对话聚类为主题,然后叠加每个主题的质量:任务完成度、摩擦、负面反馈。你接入后就能看到 Agent 被问及什么以及在哪里遇到困难,按主题分类,无需先构建仪表板。这也是从生产环境回到更好的离线数据集的最直接途径:失败最多的主题正是你的参考数据集应该覆盖但可能没有覆盖的部分。
这里也需要清醒认识。实时主题聚类正在成为标配;我们不是唯一能对对话进行分组的。区别在于聚类连接到了什么。当一个主题聚类与你的其他产品数据共享用户身份时,“支付调度失败率为 31%”不再是一个质量统计数据,而成为一个业务问题:其中哪些失败让我们失去了续费,以及哪个主题的错误代价最高?
实验驱动 Agent 行为的因素
一旦 Agent 质量可衡量,实验的形式就改变了。不再是对表面 UI 更改进行 A/B 测试,而是对真正驱动 Agent 行为的输入进行实验:提示词变体、工具配置、上下文策略、模型参数。
我们已经看到自主实验循环,Agent 在夜间运行数百个提示词变体并保留表现最好的。Shopify 的 Sidekick 团队构建了一个 LLM 驱动的模拟器 在夜间运行候选系统并选择获胜者。但这类系统优化的是模型质量指标,如验证损失。它们无法知道获胜变体是否提高了真实用户的留存率或转化率。
借助 Agent 分析,你可以衡量变体对交互质量以及为 Agent 付费的下游结果的影响。
Agent 分析如何与业务结果相关联
每个构建 Agent 的团队最终都会问的问题:哪些交互驱动了我们的关键指标?Agent 是否提高了长期留存率?收入呢?哪些行为导致流失?
回答这个问题实际上可以将 AI 从成本中心转变为收入项目。模型提供商(他们没有下游用户数据)和可观测性工具(他们没有产品分析)都无法单独实现这一点。在某些方面,这看起来像是 Agent 的归因建模。
现有的可观测性工具专注于追踪本身。但用户打开你的 Agent 前五分钟在做什么?两分钟后呢?两天后呢?成功的交互是否导致了功能采用、升级或推荐?失败是否与 30 天后的流失相关?
在 Agent 分析中,AI 会话数据和产品事件数据共享相同的用户身份。这些问题不再是数据工程项目。例如,我们在内部发现,拥有高质量 Agent 会话的 Amplitude 用户的留存率是遇到任务失败用户的 2.3 倍。
让我们来看一个假设的例子:一个智能体同时处理产品推荐和退货。推荐会话以35%的比例转化为购买。然而,退货会话的转化率只有2%,并且运行成本高出3.5倍,因为智能体不断询问相同的信息,触发重试,并将对话拖长直到用户放弃。在这种情况下,你在最失败的事情上花费最多。
Agent Analytics在一个地方同时显示这两个差距(质量和成本)。因此,与其问“我们的AI每月花费X”,不如问“为什么我们在效果最差的话题上每会话花费高出3.5倍?”
可选内容的分析
早期我们从对隐私敏感的客户那里听到的头号担忧是:“我们不能向您发送提示内容。”
您不需要内容就能获得价值,但您需要内容才能获得全部价值。
我们构建了隐私层级,作为采用的入门途径。即使在仅元数据的层级,您也能获得成本分析、留存细分以及如再生率和放弃率等行为信号。
没有内容,您失去的是增强层:自动浮现的“您的退货智能体在企业用户的退款请求上失败”,无需任何人构建仪表板。
结语
我们构建Agent Analytics是因为我们必须这样做。我们当时正在构建一个智能体,却无法看到它是否在正常工作。现有工具只给了我们片面的信息,基础设施指标在这边,参与度数字在那边,但没有人将用户视角的完整故事串联起来。
我们发现最有价值的是从失败到采取行动的过程。当我们看到特定用户群体遇到“幻觉循环”时,我们不仅记录它,还利用这些数据立即测试修复方案,或引导这些特定用户获得更好的结果。
如果您现在正在构建智能体,您可能也有同样的感受。您发布新版本、更新系统提示、添加新工具,却并不真正知道它是否更好。您的团队可能因为缺乏自动化的质量衡量方式而手动审查轨迹。当出现问题时,您要翻遍分散的日志来重建发生的事情。您想尝试提示或工具,但没有严谨的方法来衡量影响。

开始使用
所有客户,包括我们的入门(免费)计划账户,都可以使用Agent Analytics。如果您正在开发智能体,或者任何这些内容听起来让您感兴趣,今天就立即开始。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏