指标必须带着样本和依据
用户才能判断一次评估是否适用于自己的场景。
- 适合
- 需要比较多个模型、提示词或配置。
- 代价
- 维护样本和判断集比只展示总分更费功夫。
OpenSearch Search Relevance Workbench · 产品截图
换一个配置后,整体指标可能变化,但团队仍需要知道评估样本从哪里来、哪些查询变好或变差。
点击放大 ↗
操作 01 / 04
Agent 评估也应保留样本来源与范围,便于判断代表性。
点击放大 ↗
操作 02 / 04
评估页面应区分人工判断和行为代理指标,避免误读。
点击放大 ↗
操作 03 / 04
先确认变化发生在哪里,再结合质量判断决定是否采用。
点击放大 ↗
操作 04 / 04
你的 Agent 评估工作台可以保留逐题证据和失败样例入口。
依据 AWS 官方搜索质量教程;可借鉴评估工作台结构,不能把搜索相关性指标直接当作 Data Agent 准确率。 · 核对于 2026-09-05
未验证与边界搜索评估与生成式答案评估的目标不同。借鉴的是交互结构,不是直接移植指标或声称评估结果可靠。
反馈与收藏分开保存在当前设备。