← 数据产品设计库
查看完整原图 ↗产品截图 · AWS Big Data Blog ↗ · Agent Health 评估报告,显示多个标签页中的测试结果
配图 01 / 04
Agent Health 评估报告,显示多个标签页中的测试结果
- 要解决的问题
- 传统测试只能判断代码是否运行,无法说明 Agent 的多步行为是否符合预期,团队缺少从 Trace 到评估结论的统一审查界面。
可以借鉴 · DataHot 解读Agent 评估界面应让结论、理由、执行证据和修改建议能在一次下钻中连贯起来。
查看完整原图 ↗产品截图 · AWS Big Data Blog ↗ · 架构图显示了代理、Amazon OpenSearch Ingestion、Amazon OpenSearch Service以及OpenSearch Agent Health可观测性和评估流程
配图 02 / 04
原文配图 2
- 配图说明
- 架构图显示了代理、Amazon OpenSearch Ingestion、Amazon OpenSearch Service以及OpenSearch Agent Health可观测性和评估流程
查看完整原图 ↗产品截图 · AWS Big Data Blog ↗ · Agent Health Traces 视图,列出从之前交互中捕获的代理追踪记录
配图 04 / 04
原文配图 4
- 配图说明
- Agent Health Traces 视图,列出从之前交互中捕获的代理追踪记录
代表图优先,其余配图保留原文顺序;配图不代表一次连续操作。材料核对于 2026-09-02 · 阅读完整原文 →
设计拆解
公开材料说明
- Agent Health 使用 OpenTelemetry Trace 分析 Agent 行为,并针对运行执行测试用例和基准评估。
- 演示方案将 Agent 模型与评估模型分开,并将评估历史与配置保存到 OpenSearch。
- Agent Health 可连接开源 OpenSearch;AWS 演练使用 OpenSearch Ingestion 与 OpenSearch Service 收集、存储运行数据。
DataHot 解读
- 将“裁判理由”和“原始 Trace”放在同一运行下,可避免用户只看通过率而无法追问证据。
- 在评估结果底部给出具体改进建议,把可观测性从故障看板变成了策划 Agent 的工作台。
功能模块
- 测试用例定义
- Trace 与工具调用明细
- Judge Evaluation
- Annotations
- 指标与改进建议
交互方式 · 案例整理
- 定义用户目标与期望行为后发起运行
- 在测试输出、Trace、裁判结果与批注标签之间切换
- 展开单个匹配项查看裁判理由和分项指标
- 根据失败原因审查建议,再将用例纳入基准比较
可以借鉴
- Agent 评估界面应让结论、理由、执行证据和修改建议能在一次下钻中连贯起来。
- 通过、失败和改进项都要带可回放的用例身份,才能成为发布门禁。
收益与代价
- LLM-as-judge 能覆盖难以用布尔断言表达的质量,但需要额外成本、标准校准与人工抽检。
- 完整 Trace 有助于诊断,也可能包含提示词、业务数据和工具参数,需要脱敏与访问控制。
适用边界AWS 演练中的电商 Agent 工具调用在运行时内模拟,不是真实业务系统 API。 本案例展示的是单次运行的审查体验,不代表长期趋势、团队协作和大规模用例管理能力。
对你的产品设计有帮助吗?
反馈与收藏分开保存在当前设备。