返回
官网 Hex Blog 发布 2026-08-13 08:00 收录于 08-14 51

Hex发布DataBench:面向复杂数据分析的Agent基准

Hex推出了新的前沿基准DataBench,用于评估代理在复杂数据工作与分析推理上的表现。文章指出数据分析对代理而言是一个独特困难的领域:简单问题看似困难,困难问题看似简单,许多问题无法回答,错误通常隐蔽且微妙。DataBench旨在衡量代理在真实分析任务上的能力,为agentic analytics提供评测参照。
推荐理由:数据从业者尤其是关注分析Agent选型与评估的人,可借此了解当前代理在真实数据任务上的能力边界与评测思路。

译文 AI 逐段翻译

博客

介绍 DataBench

面向复杂数据工作与分析推理的前沿基准

Izzy Miller

研究

2026年8月13日

分享:

介绍 DataBench

这里有两个你可能给智能体的提示:

  1. 构造一个Dinitz Garg Goemans猜想一般(非平面)情况的反例。你应该取得突破并找到结构性的反例。
  2. 中西部收购v2活动是否值得花费?广告平台数据显示它带来了837次转化……

哪个更可能失败?

嗯,一位数学家最近使用第一个提示配合GPT-5.6,在一个困扰专家30年的著名数学问题上取得了正确且重大的突破。

我们在仓库环境中运行了第二个看似简单的提示,得到了一个自信但错误的答案,声称该活动不值得,而实际上做出这种判断所需的数据并不存在。

那么这是怎么回事?为什么数据如此困难!?我真的需要Fable 5 Max来做我的营销表现汇总吗?Sonnet不行吗?在这个机器智能参差不齐的奇异时代,智能体在我们Hex最关心的代理式分析任务上表现如何?

为了找出答案,我们创建了一个新的前沿基准测试,用于代理式分析:DataBench

如果你想直接看完整结果,可以点击这里——或者阅读下一部分,了解我们为什么创建“又一个基准”。

被诅咒的领域

我一直认为数据分析是智能体难以操作的独特领域。我之前已经详细撰写过关于代理式分析为何如此具有挑战性:

简单的问题看起来很难。困难的问题看起来很容易。许多问题无法回答;即使尝试也注定失败。Bug通常是无声且微妙的。无伤大雅的假设(LLM的最爱!)决定分析的成败。没有linter、测试套件或形式化语言。几乎没有现实的公共数据可供训练或构建环境,而且预训练中充斥着大量的教程垃圾。每个人的数据仓库都是分布外的。对于每个正确的答案,都有十个看似合理但微妙错误的答案,并且无法验证或确认结果。

但这一说法与领先行业基准测试所显示的情况之间存在矛盾。Sonnet 4.5在Spider 2.0上舒适地达到了90%。Claude Haiku 4.5在DABstep上可以获得89%。最近对较新的Data Agent Bench的尝试都在85%以上。

那么分析是否已完全解决?!我们甚至不需要前沿模型?唉,还没有。

问题是这些基准测试并没有真正测试我们在Hex中看到的客户运行的代理式分析任务类型。相反,它们由我喜欢称之为“过度指定的酒吧琐事”组成:

这些在演示时可能令人印象深刻,而且模型在这些方面越来越好是好事,但不幸的是,这不是普通人提示智能体的方式!这些更像“力量展示”而不是现实使用。

以下是从实际Hex使用中轻度匿名化的更现实的提示示例:

这些是非常不同的任务!它们模糊且方向性。用户通常不确定他们想要什么。他们很少要求单一数字,而是想要建议、直觉检查或下一步看哪里的立足点。通常正确的答案是“我不确定我们能如实回答”(剧透:这是模型表现最差的地方,它们不喜欢放弃)。

即使在语义丰富的良好建模环境中,这类任务也需要遍历仓库的广泛部分,并就定义、上下文语义、数据质量、用户意图和最佳分析实践做出数百个决策。

我们需要了解模型在我们Hex真正关心的事情上的表现!因此,我们构建了一个更具代表性、更现实的基准测试,看起来像人们实际做的工作:DataBench。

DataBench上的表现

DataBench v1涵盖100个现实的分析任务。这些任务分为问答和开放式提示。所有任务都在一个名为Shorelane Commerce的合成业务的Hex工作区中运行,并使用原生Evals功能进行执行和评判。

它仍然是v1,还有很多改进空间,但我们认为这是第一个真正针对人们希望智能体在该领域能够完成的实际工作的代理式分析基准测试。

以下是阵容:

最可行的见解:

  • Opus 5能够做出伟大的事,但在更高的努力水平上行为非常奇怪。
  • Claude Fable 5是唯一一个高努力不会适得其反的模型。
  • GPT 5.6 Sol通常以一半的成本“足够好”。
  • GPT-5.6 Luna是荒谬的性价比。
  • 尽管高努力行为奇怪,Opus 5相比Opus 4.8是显著升级——忘掉X上喷子们说的。
  • Sonnet 5是一个有点令人困惑的模型,可能很少是正确选择。

模型表现出色的地方

下限比我们想象的要高

这张图表最引人注目的是性能下限。没有任何模型/努力组合得分低于50%,尽管DataBench任务没有一个是故意“简单”的。任务难度各不相同,但即使最简单的任务也有棘手的细微差别。

例如,31/32次运行通过了一个我们认为可能难倒许多较小模型的任务:当移动订单因我们在仓库中埋藏的渠道重命名而神秘崩溃,没有回填、没有文档时,所有模型都能自己发现、证明并自主为用户修复趋势。

这是Kimi K2.7在82秒内以十五美分的成本完成了出色工作的示例:

模型能够接受大量令牌并同时考虑它们。这让它们能够注意到复杂查询中的分析细节,这似乎超乎人类!查看25万令牌的查询结果,对智能体显而易见的东西与人类分析师显而易见的东西相去甚远,而这正是模型最佳表现所在之处。

因为这种能力在某种程度上是天生的,并且在我们测试的模型中已经普及,所以分析性能的下限比我们预期的要高得多。

早期的帕累托前沿很陡峭

“帕累托效率前沿”只是一种花哨的说法,意思是“在给定的预算下,我的钱能买到的最好分数是多少?”它遵循我们所有图表左上边缘的虚线。

我们惊讶地看到GPT-5.6 Luna的相对表现非常强劲,它构成了帕累托效率前沿的整个前肘部分!在xHigh努力下,它实现了接近Sol的性能,而成本仅为约1/14。

这里的陡峭特别意味着Luna能够在不显著增加成本的情况下,随着努力程度的提高而提高准确性,这与棋盘上的其他模型形成鲜明对比。

当意图明确时,杂乱的数据很容易处理

DataBench中大约一半的难度来自于必须在复杂而混乱的数据环境中完成相对清晰的任务——同一指标有多种定义,定义分散在难以连接的表中,以及过时和半删除的数据集。我们以为这会是失败的主要原因。

实际上,这大体上没问题?事实证明,这种环境对前沿模型来说并不是很有挑战性当任务的意图和护栏相对清晰时。

在一个任务中,我们要求为一份历史报告提供“截至1月15日”的当前美元管道——而仓库的当前状态自那以后已经混乱地漂移了。用户没有将其定义为复杂问题,也没有要求重建,但模型仍然认为这个问题需要回滚,仔细地将阶段转换历史重放到截止点,并且落在我们真值SQL的舍入误差范围内。32个模型配置中有29个做到了这一点!

在极端情况下,这开始感觉超出了人类专家的能力。在构建这个基准测试时,我们不得不修改五个任务,这些任务原本是特意设计为不可能完成的因为Fable 5通过仔细的法务会计分析,不断找到优雅、有创意且正确的方法来完成它们。

Fable在这里具有独特的能力,但这种精细的分析性探索在模型领域中的分布比我们最初认为的更为广泛。

模型挣扎的地方

那么问题出在哪里?我们按任务类型细分了分数,发现了一个明显的模式:模型在收集证据方面表现最好(问答任务为75%),在开放式委派决策方面较差(66%),而在我们故意加入DataBench的特定“陷阱”失败模式中表现最差(54%),这些模式中有一个明显且看似合理但错误的简单答案,成功需要更深入。

这归根结底是判断力最小的模型在问答上惊人地接近前沿,但在需要直觉和推理的陷阱上则远远落后。

例如:我们要求在一个两个计费系统对谁拖欠有分歧的日子里,生成一份催收电话清单。显而易见的答案——给所有系统有分歧的人打电话——有合法的催收事件、文档化的来源所有权约定支持,而且没有任何明显的矛盾信号。但它是错误的:拖欠标志是过时的同步产物,而单独的现金分类账显示这些账户中的大多数已经付款。

只有Opus 5通过了这个测试。这是Fable 5在最大努力下愉快地叙述陷阱的每个支持证据:

这里的评分标准故意很严格——模型可以在一个线程中做对90/100的事情,但随后得出错误的结论或不诚实地呈现数字而失败。但这就是工作,也是我们想用DataBench做出不同的地方;没有人愿意雇佣一个数字都对但给你糟糕建议的分析师!

做出正确的决定

代理可以在“正确”的非常具体的假设下“正确”地计算所有数字,但仍然得出错误的第二或第三阶结论。与上面的催收案例不同,这通常不是来自信任糟糕的证据——而是来自制造确定性。

当被问到多箱发货的订单是否会产生更多支持工单时,Opus 5在最大努力下产生了十一分钟的仔细正确的算术——然后将其提升为因果法则(“每个额外的包裹都是投诉的独立机会”),宣布“我直接验证了机制”,并为用户写了自信的建议。

但它是错误的。它验证了计数是正确的,但没有验证实际原因。这是我们设置的一个故意陷阱。订单不会随机拆分,仓库在库存分散或短缺时拆分订单;正是这些情况本身会导致延迟和投诉。有问题的订单会得到更多的箱子更多的工单,这产生了相同的平面每箱数学。数据无法区分这两种情况;但Opus只是选择了一个,盖上“已验证”的印章,并在其上做出了自信的建议。

你仍然应该小心将像这样复杂决策外包给代理。

一个很好的缓解方法是保持好奇,并与代理跟进!对事情进行探究,施加压力测试,保持你的大脑开启!请保持你的大脑开启。请放心,一旦你能够关闭大脑,我们会及时通知你。

难以捕捉错误

人类非常擅长一种模型不表现出的应用性怀疑。“哦,那个数字看起来不像我预期的!”不是我们经常看到模型说的话。一个人类分析师在这些问题上会经常这样说。这种蜘蛛感应为人类捕捉错误、重新定位和调整信心水平的方式提供信息。

除非被强烈而反复地提示,模型不太可能进行广泛的“探索和利用”重新定位和饱和分析问题空间,而是倾向于正面进攻,有时过度承诺。它们也不会在呈现工作之前可靠地进行合理性检查。

有趣的是,模型在解决所有这些问题上表现出色,一旦有人类提示。但仅靠它们自己,还达不到这个水平——至少目前如此。

提示技巧在这里能有所帮助。给代理一些探索的立足点,或强调它应探索多个方向(如果你希望它这样做)确实有帮助。或者,像第一点那样,深思熟虑地跟进和重新引导代理,会带来回报。

前沿模型不喜欢认输

当我们比较DataBench的结果曲线和像CursorBench这样的编码基准(见下文)时,我们发现测试时计算和模型规模的改进远非一致。与这些基准不同,我们看到回归在高努力水平下,尤其是Opus 5。这是什么原因?

最初我们认为这可能表明我们的某些评分标准或任务有问题,并手动审计和重新评分了每一个轨迹。结果发现效果是真实的,而在更高努力水平下,模型有时会说服自己超越正确的简单答案,给用户一个更复杂但错误(或只是令人困惑——我们对此严格扣分)的答案。

Opus 5在高努力水平下位居榜首,但在xhigh和max水平下被这个现象 破坏。

当被问及一个大客户支付了$92K年费并在四天后取消时,Opus 5在中等努力水平下直接给出了正确的简单答案——访问权限持续到付费期结束。在最大努力水平下,它做了三倍的工作,明确证明了计费系统在所有916次取消中从不截断付费期——但随后仍然保留态度,提供取消日期作为可能的访问截止日期。

这就是为什么代理分析如此独特地具有挑战性:没有测试套件,也没有正式甚至非正式的可验证性。在复杂的软件工程任务中,很难想象花费更多时间和努力却得到更差的结果。也许你会达到平台期,但不会回归,编码基准清楚地显示了这一点。

分析并非如此。知道何时得到正确答案更多地是判断和直觉的问题,而不是其他。人类分析师在这方面非常擅长,尽管通常是通过缓慢而艰苦地发展极其具体的专业知识。他们知道问题所在,可以这么说。代理在这方面正在改进,但似乎仍受制于在更高努力水平下完成任务的强烈愿望。

Claude Fable 5是个例外。在85/100的分数上,它远非完美,但它是唯一一个在测试时计算和努力水平持续带来更好结果而没有回归的模型。无论是什么让Opus在Max水平下说服自己放弃正确答案,Fable都没有这个问题。

任务细节

DataBench v1中有100个任务,每一个都是精心设计的,不仅仅是“将这些需求转换成SQL”的提示。相反,我们发送模糊的问题,答案开放,并将代理置于一个仓库中,里面既有金色的语义建模数据,也有危险(但有时必要)的原始表。

我们必须构建三样东西来使其工作:

  1. 一套任务,代表人们实际发送给代理分析工具的现实提示。
  2. 评判标准不仅衡量“是否达到了正确的数值答案”,还理解每个分析结果中良好和优秀的细微差别。
  3. 一个现实的环境,让代理在其中操作,反映数据仓库和分析工作区的混乱现实,包括额外的上下文和语义模型。

任务

DataBench v1中有两种类型的任务:问答和开放式。其中十个也是你上面遇到的“标志性陷阱”。

问答任务 是直接但不过度指定的分析查询:

  • “我们的活动按设备和浏览器的转化率是多少?”
  • “财务想知道按渠道的订单量和预订价值趋势。”

这些问答任务看起来简单,但底层的环境使它们变得有趣。

例如,正确回答我们的Shorelane环境中的订单量提示,意味着做出至少四个用户没有提到或知道的决定:

  • 使用哪个“时钟”: 订单同时带有业务创建时间戳和仓库加载时间戳,后者有意滞后,它们在一个迁移窗口内漂移不同,如果不正确考虑,会影响月度趋势。
  • 跟踪哪个群体: 取消的订单根据明确记录的公司约定仍然包含在预订量中。排除它们,每个月都会出错。
  • 哪些标签: 渠道重命名没有回填,导致“mobile”和“mobile_app”值同时存在。
  • 哪个收入列: Shorelane提供了五个可以合理地称为收入的列,每个都有不同的含义。对于这个任务关键的是,语义层的默认模型代表了一个正确但并不完全是财务利益相关者所指的“预订”的收入。

这些复杂性都没有出现在提示中。它们需要从上下文或中间数据探索中发现。重要的是(这是上述测试时扩展不完美的原因),这些错误不会抛出错误或提供任何信号,只是默默地错误。

模型通常善于——甚至非常善于——处理这些混乱的复杂性。但当它们遗漏时,没有什么告诉它们遗漏了:

开放式任务 要求代理更进一步,要么创建工件,要么为用户做决定,而不是直接提供问题的定量答案:

  • “我们的广告代理希望我们根据他们跟踪的ROAS数字增加付费媒体30%。你会批准吗?如果不,我们如何更好地分配?”
  • “我们是否应该在下次续订时继续提供年度计划的两个月免费?”

开放式任务要求智能体不仅要获得准确的数据点,通常还要获取多个数据点,并结合额外的背景信息进行综合,做出判断——往往需要多次迭代调查才能得出正确答案。它们还要求向用户进行更细致的框架说明,以做到诚实、准确且有用。

这里的失败很少表现为错误的数字。它通常表现为“巧妙地”绕开一个正确的简单答案,提供一个错综复杂且可疑的破解答案,以满足用户明确的要求。

当被问及是否批准一批源自2021年古老收购遗留的客户合并时,Fable 5在最大努力下(正确地)指出,这些身份从未被链接到客户注册表中,但仍然建议将其中一百个合并。正如Opus 5解释的那样,正确的答案是,由于不存在身份映射,无法进行任何安全的合并。

评分标准

每项任务都由一个LLM评审员评估,该评审员可以访问线程、线程创建的工件、相关的地面实况“预期”数据集,以及全面的评分标准。

编写评分标准时的一大难题是,大多数任务不能简单地归结为“你得到529.57了吗?”。每条评分标准都写成一份通俗易懂的简报,就像你向人类评分员简要介绍一样:这是正确答案和决定它的证据,这是这个案例有趣且困难的原因,这些是不要陷入的陷阱,以及常见的失败模式。我们做出了一个有点不寻常的选择,提供非常详细的评分标准指导,并使用前沿模型作为评审员——5.6 Sol——指示它根据评分标准行使判断。

这是一种有风险的方法,因为它可能增加噪音,但它使我们能够更好地评估我们看到的先锋模型在攻克困难任务时所展现出的增强创造力。我们觉得这能在这里返回最诚实的指标。为了降低噪音,每个裁决是三次评审员运行中的多数结果(尽管它们有96%的时间相互认同)。

这也是为什么目前该集合上限为100个案例的部分原因。这个规模足够小,我们可以手动检查整个扫描的重要样本,以确保我们的校准!

环境

一切都在Shorelane环境中运行,这是我们用于内部开发和评估的同一工作空间和仓库。Shorelane Commerce是一个虚构的B2B2C办公用品平台,每年约1.29亿美元的收入,包括直接面向消费者的订单、净30天企业订阅和一个市场(抽取15-25%的佣金)。它也是故意搞得一团糟。

  • 它于2021年迁移了平台,并在过程中丢失了客户ID。
  • 同年收购了一家竞争对手,但从未完成数据合并。
  • 它在2022年重命名了一个销售渠道,但没有回填数据,并在2023年重组了订阅计划,同时保留了足够多的旧客户,使得三代客户仍然活跃。
  • 它有Stripe、Salesforce和遗留的Shopify数据集的表,其中大部分是干扰项。
  • 哦,还有三个广告平台,三个不同的转化总数。
  • 每个客户至少有两个ID,有时甚至有四个。
  • 有五列都可以合理地被称为收入,财务、营销和运营各自使用不同的列。

六年的数据,数百万行,几十个表,超过30,000行手工编写的生成器、dbt模型、文档、事件和具有自身历史背景的利益相关者角色。这听起来很疯狂,但对很多公司来说相当现实!

当然,Shorelane工作空间附带了工作区指南和丰富的语义模型。语义模型在其覆盖范围内是“黄金”且无问题的,但有时任务的重要数据位于未建模的状态,智能体必须小心翼翼地走出语义层——就像在现实世界中一样。

未来计划

我们将持续更新DataBench,并定期发布新版本以及添加新模型。近期未来的改进包括增加基于“工件”的任务数量和复杂性,以更好地评估诸如生成式数据应用等内容。

将DataBench保密对我们的内部开发信号很有帮助,这样任务就不会被训练到,但我们确实有计划开源Shorelane分析环境。我们知道,拥有一个逼真的公共环境用于智能体分析将对其他在这个有趣且具有挑战性领域工作的人有所帮助,我们很兴奋能做出贡献。

请关注http://hex.tech/databench以查看我们运行新模型和更新基准时的最新结果!

分享:

这是我们在Hex经常思考的问题,我们正在创建一个平台,使构建和分享交互式数据产品变得容易,这可以帮助团队更具影响力。如果这很有趣,请点击下方开始,或者查看加入我们团队的机会。

✨ 免费开始

👩‍💻 开放职位

更多研究

博客

我们不得不为Fable构建新的评估

伊兹·米勒 · 2026年6月9日

博客

抱歉,但那些是虚荣评估

伊兹·米勒 · 2025年4月14日

使用GPT-4.1作为我们有影响力的LLM评估框架的案例研究

博客

我们如何建立了一个实验室来评估数据代理

伊兹·米勒 · 2026年5月22日

我们构建了一个虚构的1.29亿美元业务来测试我们的数据代理。以下是评估架构、它能发现什么,以及仍然不奏效的地方。

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存