AI Agent评估信号:首次正面体验带来3倍留存
DataHot 速览
Calibre与Amplitude对2万+资深用户分析Amplitude Global Agent使用数据,发现老用户的eval得分与留存基本无关,坏会话不会赶走他们,好会话也不会留住他们。对新用户则相反:首次会话是否正向并保存Agent输出,是预测后续留存的最强信号。首周体验严格正面的用户,长期留存是触发过任一失败标志用户的3倍。
为什么值得关注:揭示了AI Agent评估指标与用户留存之间的非线性关系,提醒数据从业者不要只盯会话内eval,而要关注首次体验对长期业务价值的影响。
本文目录 7 节
译文
AI 逐段翻译这篇博客由Sandhya Hegde共同撰写,她是应用AI研究公司Calibre的联合创始人。
如果你在过去一年中向你的产品发布了一个智能体功能,你可能已经问过类似的问题:智能体是让我的产品更具粘性,还是只是在蚕食原本已经有效的部分?具有高评估分数的用户是否真的能更好地留存?我如何理解智能体改进在用户和业务层面的影响,而不仅仅是在会话内部?
我们也有这些问题,因此我们对Amplitude的Global Agent进行了分析,涉及2万多名在Global Agent发布前就是Amplitude资深用户(实际上是高级用户)的用户。我们想了解积极的智能体会话(基于评估分数)如何影响他们与Amplitude的关系,并找到更好长期留存的预测因素。
核心洞察:评分与留存
对于既有AI产品的用户,评估分数和留存基本上是无关的。糟糕的会话不会让他们离开。好的会话也不会让他们留下。
对于新AI产品的用户,这种关系是相反的:评估分数对采用和未来留存具有很强的预测性。最明显的价值信号是用户是否在首次会话中获得了积极体验并保存了智能体的输出。以下是我们的数据中突出的三个模式:
1. 我们留存最多的用户也拥有最负面的智能体体验。
纯粹的关联,而非因果关系。我们的高级用户比任何人都更努力地使用智能体,不断遇到死胡同,但第二天仍然带着新查询回来。他们不是因为智能体失败而留存。尽管有失败,他们仍然留存,因为智能体是他们工作方式的一部分,而摩擦是在崎岖前沿生活的代价。
2. 积极的第一周体验相当于3倍的留存乘数。
这是最明显的信号。在Global Agent第一周/第一次会话严格积极的用户,其长期留存率是那些第一周就触发失败标志的用户的三倍,即使两组用户在Amplitude的其他所有方面活跃程度相同。同样的产品,同样的用户质量,不同的第一印象,完全不同的后续行为。
3. 早期的积极智能体体验也拉高了Amplitude的整体使用率。
智能体不是一个沙盒(尽管它在技术上运行在一个沙盒中)。Global Agent的出色首次会话提高了对Amplitude平台其余部分的每周留存,而不仅仅是智能体本身。另一方面,糟糕的首次会话并没有把用户从Amplitude推开。他们只是特别远离了智能体。
含义:如果你的评估队列显示出强大的留存,并且你因为低评估分数没有损害留存而自鸣得意,不要。它们很可能在损害。你只是没有看到全貌。
第一个线索:纠缠的评估队列留存曲线
当我们开始将评估分数和留存相关联时,我们从简单开始。我们根据会话模式绘制了所有用户按评估队列的每周留存(参见我们的智能体分析模式文章了解“干净成功”、“优雅恢复”、“静默失败”和“死胡同”的定义)。令我们惊讶的是,什么也没得到。所有四个评估队列都在彼此的5%以内。
图表1:任何评估队列中的既有用户留存率大致相同。
所有四个评估队列都在彼此的±5%以内
按评估队列划分的每周Global Agent留存,显示为与跨队列平均值的偏差。
如果会话质量预测用户留存,这些曲线会分开。它们聚集在一起。
乍一看,我们可以通过两种方式解释这一点:
- 糟糕的会话是一个很好的需求信号。用户不断尝试,因为他们真的需要答案(而不是因为他们是受虐狂...或者也许他们是)。
- 评估分类和评分不重要。它要么不正确,要么不相关。
采纳其中任何一种似乎都很危险。它们会很容易成为不关心我们智能体在每次会话中输出质量的绝佳借口。
所以我们回到了用户心理学的绘图板。是什么让用户喜欢/讨厌AI产品?改变他们的旧工作流程并成为新界面的粘性用户?给它一个工作的机会?是智能体处理复杂任务的强大能力,还是它自动化简单任务的速度?
我们想找到最能产生差异的强信号。
当我们把问题分成两个队列(既有用户和AI产品的新用户)并分别问每个问题时,数据立刻揭示了一个故事。纠缠的图表变得清晰,答案几乎相反。
信号:首次用户体验评估分数预测长期留存
此时,我们开始只关注首次使用Global Agent的用户。注意:这些用户都已经是Amplitude的高级用户。
我们选取了2026年第一季度首次使用Global Agent的用户,并按首次会话结果进行拆分:
- 积极(干净成功标志)与
- 消极(触发任何失败标志,包括拇指朝下的反馈)
留存曲线立即分开,并且每周保持分开。
图表2:对于首次用户,首次会话评估结果预测留存
积极的首次会话能留住用户。消极的则不能。
按首次会话结果划分的Global Agent每周留存,显示为与两队列平均值的偏差。
首次会话结果对于新用户的智能体留存就是全部信号。
然后我们加入了数据中最严格的“用户获得真正价值”的信号:他们是否保存了智能体的输出(如图表、队列、仪表板等)并将其提交到工作区。
图表3:在首次(积极)会话中保存AI工件的用户,其留存率是首次会话遇到任何失败标志的用户的3倍。
在首次会话中保存AI工件相当于3倍的留存
按首次会话队列划分的每周Global Agent留存。以严格积极W0 = 1.0为基准。
首次会话保存是数据中智能体采用最明显的预测指标。
这是第1周3.57倍的梯度,到第4周保持3倍。单调、持久,且仅针对全局代理。
实现这一点的关键:关联评估与使用指标。如果你在开发代理产品,首先要测量首次会话的评估分数和价值提取。将其与用户参与度和留存率关联起来,以便向整个业务展示新AI功能的价值。
要做到这一点,你的评估数据和产品分析数据需要共享一个模式。
大多数团队无法进行这种分析。他们的评估数据在一个仓库,产品分析在另一个仓库,任何跨领域的问题都需要进行JOIN、模式协调和多次会议。
Amplitude的代理分析将两者写入同一事件流:
- 评估分数。 为每次全局聊天会话自动记录的结构化会话评估事件,包含诸如“有任务失败”、“有负面反馈”、“有技术故障”等布尔标志。
- 产品分析。 跨产品事件分类。当用户保存图表、构建群组或修改仪表板时,这些产品动作会与代理的会话事件一起进入同一事件流,并具有一致的属性命名。
这意味着像“有干净代理会话、保存了工件并在第2周回来发送消息的用户”这样的群组定义,是对单个用户历史的直接布尔条件。无需JOIN,无需模式协调,只需一次查询。
这对你的代理意味着什么
第一次会话决定了整个采纳决策。 新用户遇到你的代理时,会做出二元判断:它是否足够有用,值得回来?像保存这样的价值时刻发生在首次会话的一小时内,而那一小时内发生的事情决定了接下来的四周。
评估和分析需要共享模式。 如果没有将会话级评估标志与产品动作一起触发到同一事件流并采用一致的属性命名,所有这些分析都不可能实现。像“干净会话、保存和在第2周返回消息的用户”这样的跨领域查询,只有当所有三个事件都位于同一位置并作用于同一用户时才有效。
如果你在开发代理,我们很乐意听取你对代理分析的反馈。在此注册加入我们的合作伙伴设计计划,获取早期访问权限。
方法论:定义事件、评估标志和群组以下是我们在会话级评估分数与长期产品使用指标之间进行相关性分析的完整方法论。
定义事件、评估标志和群组。
三个事件类别,全部在同一个事件流中:
1. 带有结构化结果标志的会话级评估事件。 每个会话触发一次[代理]会话评估,并带有诸如“有任务失败”、“有负面反馈”、“有技术故障”、“代理ID”、“轮次数”、“会话成本(美元)”和“请求复杂度”等标志属性。标志必须是布尔值(或可过滤的字符串枚举),而不是自由文本描述。如果你的评估流程产生叙述性摘要,请从中推导出布尔标志并一同触发。
2. 每条消息的代理遥测。 [代理]用户消息用于用户消息,[代理]评分(来源=“用户”)用于赞/踩反馈。这些是你的留存测量目标和细粒度反馈信号。每个事件应携带代理ID属性,以便一次将分析范围限定在一个代理。
3. 带有代理归因的产品动作事件。 当代理代表用户“保存”或提交工作时,产生的产品事件应记录属性以将动作归因于操作代理。这些是你的价值信号。
群组定义:严格正向:干净胜利+提取的价值。
- 在W周期内≥1次会话,所有失败标志为false
- 在W周期内0次会话有“有负面反馈”为true
- 在W周期内0次会话有“有任务失败”为true
- ≥1次产品保存事件(或等效价值动作),来源=<你的代理归因>
群组定义:广泛负面:每次会话都有问题。
- 在W周期内≥1次会话
- 在W周期内0次会话所有失败标志为false
群组定义:中间:干净体验,未提取价值。
- 在W周期内≥1次会话所有失败标志为false
- 0次产品保存事件,来源=<你的代理归因>
有了这个同一事件流中的分类,上述分析就是对单个用户历史的直接布尔查询。无需JOIN,无需数据模型之间的模式协调。
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏