← 数据产品设计库

OpenSearch Search Relevance Workbench · 产品截图

效果变好了,如何让用户看见证据而不只看到分数?

换一个配置后,整体指标可能变化,但团队仍需要知道评估样本从哪里来、哪些查询变好或变差。

需要评估搜索配置的数据与搜索产品团队
从实际查询建立评估样本 — 看数据来源和样本配置,它们决定评估覆盖哪些问题。点击放大 ↗
产品截图 · AWS · Measuring and improving search quality ↗

操作 01 / 04

从实际查询建立评估样本

用户操作
创建查询集,从 UBI 查询记录中选择样本。
系统反馈 · 公开材料
评估拥有可识别的查询集,而不是一个来源不明的总分。
看图重点
看数据来源和样本配置,它们决定评估覆盖哪些问题。
DataHot 解读

Agent 评估也应保留样本来源与范围,便于判断代表性。

说明判断依据 — 点击是隐式信号,并不等同于人工标注的正确答案。点击放大 ↗
产品截图 · AWS · Measuring and improving search quality ↗

操作 02 / 04

说明判断依据

用户操作
创建判断列表,选择隐式点击与 COEC 模型。
系统反馈 · 公开材料
界面明确展示用于判断相关性的信号类型。
看图重点
点击是隐式信号,并不等同于人工标注的正确答案。
DataHot 解读

评估页面应区分人工判断和行为代理指标,避免误读。

比较两个配置的结果差异 — 重叠衡量结果差异,不直接说明哪组结果更好。点击放大 ↗
产品截图 · AWS · Measuring and improving search quality ↗

操作 03 / 04

比较两个配置的结果差异

用户操作
对同一查询集比较两个搜索配置。
系统反馈 · 公开材料
页面展示 Jaccard、排名偏差等重叠指标。
看图重点
重叠衡量结果差异,不直接说明哪组结果更好。
DataHot 解读

先确认变化发生在哪里,再结合质量判断决定是否采用。

从整体指标进入逐条检查 — 看汇总与明细的衔接,平均分不能掩盖个别失败。点击放大 ↗
① 逐条查询的评估状态产品截图 · AWS · Measuring and improving search quality ↗

操作 04 / 04

从整体指标进入逐条检查

用户操作
查看搜索评估结果和单条查询表现。
系统反馈 · 公开材料
整体指标与逐查询明细同页展示。
看图重点
看汇总与明细的衔接,平均分不能掩盖个别失败。
DataHot 解读

你的 Agent 评估工作台可以保留逐题证据和失败样例入口。

依据 AWS 官方搜索质量教程;可借鉴评估工作台结构,不能把搜索相关性指标直接当作 Data Agent 准确率。 · 核对于 2026-09-05

迁移到你的产品 · DataHot 判断

指标必须带着样本和依据

用户才能判断一次评估是否适用于自己的场景。

适合
需要比较多个模型、提示词或配置。
代价
维护样本和判断集比只展示总分更费功夫。

对应证据:操作 01 · 操作 02

汇总分数旁保留失败明细

方便找到改进对象,避免只追求平均分。

适合
质量问题可以追溯到具体查询或任务。
代价
需要保持不同版本的样本可比;搜索指标不能直接套到所有 Agent。

对应证据:操作 03 · 操作 04

未验证与边界搜索评估与生成式答案评估的目标不同。借鉴的是交互结构,不是直接移植指标或声称评估结果可靠。

资料出处

阅读站内原文 →

对你的产品设计有帮助吗?

反馈与收藏分开保存在当前设备。

查看界面