返回
官网 Hex Blog 发布 2026-08-04 08:00 收录于 08-12 32

Hex 推出 Evals:评估与分析 Agent 性能

Hex 发布 Evals,用于衡量 Hex Agent 的性能,并允许在变更上线前安全测试上下文影响,完全通过 CLI 操作。Evals 受 Hex 内部测试工作流启发,支持从简单数值结果到复杂任务(如工具使用、多方案提出、数据矛盾识别、适当拒绝回答)的评估。其采用 LLM-as-judge 读取完整对话,不仅考核答案正确性,还评估推理过程与行为。该工具旨在帮助数据团队在维护分析 Agent 时保持准确性与一致性。
推荐理由:数据团队在管理分析 Agent 时面临准确性与一致性挑战,Hex Evals 提供了一套基于 CLI 的测试框架,可用于生产评估与运营,值得关注。

译文 AI 逐段翻译

博客

介绍 Evals

在发布前,从命令行安全地衡量 Hex Agent 的性能和测试上下文更改。

Andrew Lee

数据团队

产品

2026年8月4日

分享:

每隔几年,数据团队的工作似乎就会被颠覆(至少我们习惯了)。我们角色的最新转变:维护和管理分析代理。随着人们要求对话式分析,数据团队的新工作是保持代理的准确性和一致性。这从上下文开始。

代理是非确定性的 并且你无法像控制仪表板那样控制用户与它们的交互。这使得很难知道代理实际上将如何使用上下文,以及答案是否随着上下文的变化而变得更好。

今天, 我们在 Hex 中推出 Evals。Hex 的 Evals 灵感来自我们内部使用的相同测试工作流程来发布我们自己的代理功能,现在你可以在此基础上构建。

我们一直在使用 Evals 来比较模型性能。8月13日加入我们 ,参加一场关于我们构建新方法测试 AI 是否可信进行数据分析所学到的实时对话。

评估工作,而不仅仅是答案

数据分析是代理工作的一个特别困难的领域:简单的问题可能看起来很难,困难的问题可能看起来很容易,正确的数字仍然可能误导你。

使用 Evals,你可以为各种情况构建测试。

在最简单的版本中,你可以将数值结果指定为特定数字或引用 SQL 查询,以及你的容差级别。

但 Hex 的 Evals 更加强大:它们使用 LLM-as-judge 阅读整个对话,并查看代理使用的特定工具和资源。这让你评估代理的工作

  • 代理是否使用了正确的工具,比如特定的语义模型或指南?
  • 对于开放式问题,代理是否向用户提出了多种方法或要求澄清?
  • 代理是否发现并指出你知道数据中存在的差异?
  • 代理是否恰当地拒绝回答上下文不足的问题?

这让你不仅衡量是否得到“正确”答案,还衡量你如何得到答案的推理和行为。

为现有工作流程构建

你的评估测试用例定义在文件中,你可以进行版本控制,并从 Hex CLI 运行它们。评估套件可以与你的其余上下文一起存放,因此你可以使用已经用于指南和语义模型的相同代码审查工作流程。

你还可以分叉你的上下文并针对分叉运行评估,称为 上下文预览。这些是你代理的沙盒版本,包含你的工作区上下文的替代版本。

因为每次运行都限定在特定的分叉和配置中,你可以并排比较结果。代理不是确定性的,因此你可以在提交默认值之前运行每个测试用例最多三次,看看答案变动多少。

你能用 Evals 做什么

Evals 将代理质量和成本转化为你可以衡量和改进的东西,这样你就不仅仅依靠感觉。

具体来说,它们帮助您:

  • 在发布前测试上下文更改: 从 CLI 开始暂存指南或语义模型更改。你可以针对此更改的预览运行评估套件,只有通过才发布。
  • 在用户之前抓住漂移: 数据随时间变化,上下文也是如此。外部上下文、数据和表可以在代理上游更改。你可以按计划运行评估套件,并捕获代理性能的意外回归。
  • 运行配置扫描: 针对不同的语言模型和努力水平运行评估套件:你可以评估更便宜的开源模型如 Kimi 与前沿模型。比较代理中响应的成本和质量。这让你选择适合组织需求的默认 LLM。

Chime 如何使用 Evals

让我们来看看 Chime® 如何将 Evals 集成到他们的工作流程中。Chime® 是一家服务超过 1000 万会员的金融科技公司,已经构建了自己的评估框架来跟上 50 多个数据领域的步伐。他们逐一运行问题,并使用 LLM-as-judge 进行评估。但这需要手动调整和维护。当我们在 Hex 中引入原生 Evals 时,团队迅速采用。

“构建自己的评估工具很繁琐,但 Hex 的 CLI 让我不再维护第二个系统,专注于评判我们上下文层的实际问题。”

Dori Wilson — Chime 高级数据科学家

查看 文档 了解如何定义和运行评估的更多详情。

完整的上下文生命周期

评估代理性能不是一次性的工作,构建、维护和改进上下文是持续的工作。以下是你如何管理完整的上下文生命周期,让组织对从代理获得的答案有信心:

统一上下文

引入上下文,并基于你在 dbt、git 仓库、文档或外部应用中已有的内容构建。我们永远不会用专有规范让你锁定,所有在 Hex 中定义的上下文都是可移植的,可以带出 Hex。

观察代理

获取每个问题和答案的一个视图,无论发生在哪里:Hex、Slack、MCP 或 CLI。Review Agent 在上下文缺失时标记警告,并分类每个答案实际使用了什么。

通过使用改进

Review Agent 将上下文差距聚类为 建议,以便你可以快速审查和应用。一旦你做出上下文更改,使用 Evals 验证更改是否有效。想应用建议吗?添加带有评估的建议,确保你的更改将来不会回归。

Chime® 在这个规模上运行这个循环。数据科学总监 Jordan 将公司数据划分为多个领域(营销、贷款等),每个领域都有自己的指南、语义模型和评估集,在公司范围内认可之前进行门控。

"我们不断推出新产品和功能,因此我们的上下文环境永远不会停滞。即使我们首次启动一个新的数据域,第二天它就已经过时了。Hex 的 Context Studio 和 Evals 为我们提供了大规模管理上下文所需的可见性。"

Jordan Farrer — Chime 数据科学总监

开始使用

以下是一些关于开始使用 Evals的提示:

  • curl 安装程序:curl -fsSL https://hex.tech/install.sh | bash
  • Homebrew 安装程序:brew install hex-inc/hex-cli/hex

查看建议,“审查代理”已经提供了一些你可能需要做的更改。从简单的问题开始,即你的团队已经在问的问题,那些你希望代理每次都答对的问题。下周再运行一次,即使每周临时运行,也会开始浮现出有趣的机会。作为入职流程的一部分,我们为 Claude Code、Cursor 或你选择的编码代理提供了引导提示。它会扫描你最近的 Threads,将它们聚类到你的团队最常见的问题主题中,并根据实际使用情况起草一套入门测试套件,而不是从一个空白文件开始。

试试 Evals,我们很想听听你的发现!

Evals 适用于 Team 和 Enterprise 计划中的编辑、经理和管理员。

分享:

这是我们在 Hex 经常思考的事情,我们正在创建一个平台,让构建和共享交互式数据产品变得容易,这可以帮助团队更具影响力。如果你对此感兴趣,请点击下方开始使用,或查看加入我们团队的机会。

✨ 免费开始使用

👩‍💻 开放职位

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存