← 数据产品设计库

Data Agent · 产品截图

OpenSearch Agent Health

传统测试只能判断代码是否运行,无法说明 Agent 的多步行为是否符合预期,团队缺少从 Trace 到评估结论的统一审查界面。

做治理 · 治理与评估
Agent Health 评估报告,显示多个标签页中的测试结果查看完整原图 ↗
产品截图 · AWS Big Data Blog ↗ · Agent Health 评估报告,显示多个标签页中的测试结果

配图 01 / 04

Agent Health 评估报告,显示多个标签页中的测试结果

要解决的问题
传统测试只能判断代码是否运行,无法说明 Agent 的多步行为是否符合预期,团队缺少从 Trace 到评估结论的统一审查界面。
可以借鉴 · DataHot 解读

Agent 评估界面应让结论、理由、执行证据和修改建议能在一次下钻中连贯起来。

架构图显示了代理、Amazon OpenSearch Ingestion、Amazon OpenSearch Service以及OpenSearch Agent Health可观测性和评估流程查看完整原图 ↗
产品截图 · AWS Big Data Blog ↗ · 架构图显示了代理、Amazon OpenSearch Ingestion、Amazon OpenSearch Service以及OpenSearch Agent Health可观测性和评估流程

配图 02 / 04

原文配图 2

配图说明
架构图显示了代理、Amazon OpenSearch Ingestion、Amazon OpenSearch Service以及OpenSearch Agent Health可观测性和评估流程
示例零售代理聊天界面,显示电子商务助手准备接受查询查看完整原图 ↗
产品截图 · AWS Big Data Blog ↗ · 示例零售代理聊天界面,显示电子商务助手准备接受查询

配图 03 / 04

示例零售代理聊天界面,显示电子商务助手准备接受查询

配图说明
示例零售代理聊天界面,显示电子商务助手准备接受查询
Agent Health Traces 视图,列出从之前交互中捕获的代理追踪记录查看完整原图 ↗
产品截图 · AWS Big Data Blog ↗ · Agent Health Traces 视图,列出从之前交互中捕获的代理追踪记录

配图 04 / 04

原文配图 4

配图说明
Agent Health Traces 视图,列出从之前交互中捕获的代理追踪记录

代表图优先,其余配图保留原文顺序;配图不代表一次连续操作。材料核对于 2026-09-02 · 阅读完整原文 →

设计拆解

公开材料说明

  • Agent Health 使用 OpenTelemetry Trace 分析 Agent 行为,并针对运行执行测试用例和基准评估。
  • 演示方案将 Agent 模型与评估模型分开,并将评估历史与配置保存到 OpenSearch。
  • Agent Health 可连接开源 OpenSearch;AWS 演练使用 OpenSearch Ingestion 与 OpenSearch Service 收集、存储运行数据。

DataHot 解读

  • 将“裁判理由”和“原始 Trace”放在同一运行下,可避免用户只看通过率而无法追问证据。
  • 在评估结果底部给出具体改进建议,把可观测性从故障看板变成了策划 Agent 的工作台。

功能模块

  • 测试用例定义
  • Trace 与工具调用明细
  • Judge Evaluation
  • Annotations
  • 指标与改进建议

交互方式 · 案例整理

  • 定义用户目标与期望行为后发起运行
  • 在测试输出、Trace、裁判结果与批注标签之间切换
  • 展开单个匹配项查看裁判理由和分项指标
  • 根据失败原因审查建议,再将用例纳入基准比较

可以借鉴

  • Agent 评估界面应让结论、理由、执行证据和修改建议能在一次下钻中连贯起来。
  • 通过、失败和改进项都要带可回放的用例身份,才能成为发布门禁。

收益与代价

  • LLM-as-judge 能覆盖难以用布尔断言表达的质量,但需要额外成本、标准校准与人工抽检。
  • 完整 Trace 有助于诊断,也可能包含提示词、业务数据和工具参数,需要脱敏与访问控制。

适用边界AWS 演练中的电商 Agent 工具调用在运行时内模拟,不是真实业务系统 API。 本案例展示的是单次运行的审查体验,不代表长期趋势、团队协作和大规模用例管理能力。

资料出处

阅读站内原文 →

对你的产品设计有帮助吗?

反馈与收藏分开保存在当前设备。

查看界面