返回
官网 Amplitude Blog AI 逐段翻译 精选 发布 2026-08-29 03:56

如何平衡AI Agent推理成本与用户体验

DataHot 速览

Amplitude 官方博客记录了其 Global Agent 从 Claude Sonnet 4.6 切换到 Gemini 3 Flash 的受控实验:会话成本从 $4.88 降至 $2.33(-52.3%),端到端延迟从 63.8s 升至 119.7s(+87.7%),平均消息数下降 10%,有效行动转化率基本持平(30.4% vs 29.98%)。团队利用 Agent Analytics 和 Feature Experimentation 在三天内完成了成本与体验的权衡决策。文章还讨论了为何厂商基准无法替代生产流量下的实验。对数据从业者而言,这是一套可复用的 Agent 生产评估方法。

为什么值得关注:数据从业者应关注:这篇提供了 AI Agent 在生产环境中成本与体验权衡的可复用实验框架,并给出了具体指标和决策流程,比单纯模型选型建议更有可操作性。

本文目录 6 节
  1. 我们想精确测量切换到更便宜的模型时用户体验会如何变化,以及我们是否应该这样做。这是我们如何在三天内做出这个决定的故事。
  2. 切换到Gemini的确切影响
  3. 通常,团队无法根据证据做出这个决定。他们采用更便宜的模型,稍后了解后果,或者他们因为无法证明移动是安全的而放弃节省。借助代理分析,我们可以确切地看到任何一种选择会带来什么。
  4. 是什么让这种分析成为可能
  5. 从追踪到收入,一站式解决
  6. 现已对所有客户开放

译文

AI 逐段翻译

如果你在生产环境中运行AI功能,你可能大概每个月都会问同样的问题:有没有更便宜或更好的模型我们应该采用?

供应商基准测试选择了他们想要赢的工作负载。没有一个会告诉你,当你为一半用户进行切换时,转化率、留存率或成本会发生什么变化。我们自己的代理就碰到了这堵墙。

我们想精确测量切换到更便宜的模型时用户体验会如何变化,以及我们是否应该这样做。这是我们如何在三天内做出这个决定的故事。

我们花了十多年帮助团队理解用户行为,所以当我们推出自己的AI代理时,我们期望能够测量它。但我们做不到。LLM可观测性工具和产品分析无法告诉我们代理是否给用户提供了好的答案,为什么失败,或者糟糕的会话是否在三十天后失去了客户。所以我们建造了能够做到这一点的东西:代理分析。

切换到Gemini的确切影响

今年春天,全球代理(我们产品内的代理框架)团队想要回答一个问题:我们能否用Google的Gemini 3 Flash替换生产中的Claude Sonnet 4.6,保持相同的质量,并支付一小部分价格?目标是在不使体验变差的情况下削减成本。

从纸面上看,这似乎很明显。Gemini 3 Flash的定价大约是Sonnet输入成本的六分之一和输出成本的五分之一,每令牌降低5-6倍。我们的离线评估结果令人鼓舞。如果它在生产中成立,我们将以五分之一的价格获得Sonnet级别的答案。

所以我们在真实流量上进行了测试。我们运行了一个受控实验,测量会话成本、端到端响应延迟、每用户消息数量和下游转化率。Amplitude功能实验帮助我们定位特定队列,排除内部用户,并将结果保持在统计显著性护栏内。

指标Sonnet 4.6(对照组)Gemini 3 Flash(实验组)变化
每活跃用户的会话成本4.88美元2.33美元-52.3%
平均响应延迟63.8秒119.7秒+87.7%
每用户平均消息数5.955.36-10%
代理转化为合格的有价值行为29.98%30.42%持平

好消息是,每活跃聊天用户的会话成本从4.88美元下降到2.33美元,这已经考虑了令牌效率、重试和工具调用开销,转化率基本持平。

让我们花点时间介绍我们自定义的转化定义。在这种情况下,它指的是向全球代理发送消息然后在同一天完成“合格的有价值行为”的用户百分比。这些行为分为两类:

  • 隐式(用户使用了输出):查看、保存或复制了代理的响应
  • 显式(用户对其采取行动):点击了聊天中呈现的链接或CTA

Amplitude的行为图使我们能够轻松定义一个自定义事件,作为代理聊天交互是否导致有意义的下游产品使用的代理。该指标被设置为护栏(不是主要成功指标),因此团队监控它以确保Gemini Flash不会损害下游价值创造,即使它不期望改进它。

在大多数团队会检查的两个数字(价格和转化率)上,更便宜的模型通过了。坏消息是人们实际使用它的方式。响应时间从63.8秒增加到119.7秒,使用更便宜模型的用户发送的消息减少了10%。答案一样好,但Gemini在工具调用编排上效率不高,额外的等待足以让人们参与度降低。

有趣的是,转化率没有下降,因为在本实验中,一个用户可以通过几种方式转化,并且仍然觉得代理有价值。每次代理交互对不同用户可能意味着不同的事情。通过结合这些高价值行为,我们可以展示代理如何满足所有用户,无论他们在哪里,并帮助他们成功。这样,我们不是通过单一行为(比如图表创建)的小视角来看待转化率。

✓ 0:30

Sonnet

仍在思考… 2:00+

2:00+

Gemini

如果转化率已经上升,我们就会发布更便宜的模型并承担延迟损失。实验确切地告诉我们切换会有什么影响。转化率没有变化,但使用更便宜模型的用户发送的消息减少了10%,所以我们决定暂时不进行模型切换,并通过其他方式弥补成本节省。

通常,团队无法根据证据做出这个决定。他们采用更便宜的模型,稍后了解后果,或者他们因为无法证明移动是安全的而放弃节省。借助代理分析,我们可以确切地看到任何一种选择会带来什么。

是什么让这种分析成为可能

如果我们只关注离线评估,我们会错过很多影响我们最终决定的因素。我们需要生产查询混合的成本与延迟权衡。我们还得了解真实用户对较慢响应的反应,会话数量是持平还是下降,负面反馈率是否变化,以及令牌效率差距是否一对一转化为延迟差距。

代理分析用实际影响模型决策的指标来标记每个AI会话:以美元计的每次会话成本、以毫秒计的端到端延迟、令牌使用量、工具调用次数、错误率和负面反馈标记。这些指标随检测一起提供,并作为可查询指标与其余产品数据并存。

实验在同一数据上运行受控推出:目标、拆分、顺序测试、多重比较校正和方差缩减。来自代理分析的相同成本和延迟指标作为实验中的主要指标和护栏指标出现。

借助 Agent Analytics,AI 会话数据和产品行为共享同一个用户身份和事件流。模型提供商和可观测性工具都无法单独做到这一点。模型提供商没有下游用户数据,可观测性工具也没有产品分析。

从追踪到收入,一站式解决

AI 质量

代理做了什么

产品结果

用户接下来做了什么

01观察

03决策

02评估

04部署

模型切换只是 Agent Analytics 功能的一个例子。我们在四个阶段思考其能力:

  • 观察:捕获端到端的追踪,包括每个提示、轮次、工具调用和上下文检索,以及每次会话的延迟和成本。当出现异常时,从追踪直接跳转到会话回放,定位到代理开始失败的确切时刻。
  • 评估:使用基于代码的检查对每个生产交互进行评分,以验证精确规则,并利用 LLM 作为裁判来评估主观质量。在回归问题变得系统性之前捕获它们,并根据实际观察构建失败分类,而不是凭感觉。
  • 量化:将情绪、错误、主题、成本和延迟与用户旅程的其他部分关联起来。在这里,您可以回答任何评估工具都无法回答的问题:新模型是否提高了注册转化率?哪种失败模式对留存率伤害最大?在代理响应不佳后,用户会做什么?
  • 部署:利用实验套件推广改进,将行为指南定向到需要的用户,并在同一位置衡量影响。

大多数团队从追踪和遥测开始,只是了解发生了什么。接下来是断言和评估:是否正确地完成了任务?再往上,是语义智能(代理在多次运行中实际做了什么)和行为分析(代理使用如何影响用户旅程)。曲线的顶端是收入归因,即 AI 实际价值多少美元。上面的模型切换是一个收入归因问题,通过底层每一层在一个平台中解答。

那么,实现这一切的组成部分是什么?

  • 性能监控 是模型实验运行的表面。通过成本、延迟、错误率和可靠性比较模型,并查看更便宜的模型是否在产品结果上站得住脚。
  • 追踪 为您提供一次运行的完整记录,并可一键导航到会话回放。
  • 评估 附带模板,并支持自定义基于代码或 LLM 作为裁判的评分。
  • 语义过滤 根据任务成功、技术失败、工具调用问题或语义匹配来隔离会话,并允许您钻取任何用户群,例如核心用户。
  • 数据集和运行 使分析可重复。定义代理活动的一个切片(一个模型、一个产品表面或一个用户细分),并按计划对其执行检查。
  • 人工审查 让整个团队可以注释会话、分类主题和错误,并从发现中关闭工单。

如果您已经在运行 LangSmith、Braintrust、Langfuse 或其他评估和追踪堆栈,请保留它。这些工具非常适合离线评估和工程测试。但生产追踪应该位于产品分析工具中,以便您可以轻松地将评估与用户行为结合起来。

这就是 Agent Analytics 目前解决的问题。它添加了其他评估工具无法达到的层(身份、用户群、旅程、回放、实验和激活),因此您可以将代理质量与产品和业务结果联系起来。

现已对所有客户开放

Agent Analytics 现已对所有客户开放,包括我们的入门(免费)计划。它始于让我们的代理变得更好的不起眼的工作,然后经历了合作伙伴设计计划,其中设计合作伙伴如经济学人针对他们自己的生产代理进行了推动,并塑造了它的现状。

我们一直在撰写沿途的发现:预测3 倍更好留存率的评估信号,针对首次会话干净并保存了制品的新用户,人们实际如何使用代理,以及当我们以 76% 的离线通过率发布全局代理后,离线评估达到上限时发生了什么。本文中的模型决策是同一研究方向的最新成果。

如果您正在发布代理,但还无法回答其价值,您可以提前排队。我们现在正在收集候补名单,并将在普遍可用之前开放访问时与您联系。

停止凭感觉发布。开始衡量您的 AI 的价值。立即开始。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存