Databricks称专用数据Agent比通用Coding Agent更准更省
DataHot 速览
Databricks用401个真实内部任务对Genie Code与三款通用Coding Agent进行评测。厂商公布的结果显示,Genie Code准确率为76.6%,平均每项任务成本0.55美元,正确答案成本不到最接近对手的一半。该结果属于Databricks自建基准,应结合评测设计审慎解读。
为什么值得关注:这是少见的专用数据Agent与通用Coding Agent成本、准确率同场比较,能帮助团队理解语义搜索和企业上下文的实际价值。
译文
AI 逐段翻译代理型人工智能的传统观点认为,更好的答案需要更多的令牌:让代理探索更久、验证更多、重试更多,准确性总会提高。当我们对 Genie Code 与来自主要 AI 实验室的三个广泛使用的编码代理进行正面比较,在我们的内部使用中涉及 400 多个真实数据任务时,我们发现相反的情况:Genie Code 既是我们测试过的最准确的代理,也是最具成本效益的。

原因是数据代理必须在通用编码代理难以驾驭的新范式中工作。正如我们之前分享的,数据代理面临独特的挑战:它们必须在动态、不断变化的工作空间中(拥有数十万个表、笔记本、仪表板和文档)发现正确的资产,它们必须确定元数据和可能过时或矛盾的文档中的真实来源,并且它们必须在没有编码代理所依赖的可验证测试的情况下完成所有这些。
为了应对这些挑战,我们为 Genie Code 提供了能力,使其能够跳过通用编码代理依赖的随机游走探索:对目录和工作空间资产进行语义搜索,对用户依赖的表和业务逻辑的持久记忆,以及对企业上下文的深度语义理解。
我们直接在该评估的会话中观察到这种差异。在一个示例中,Genie Code 利用语义搜索和元数据高效找到正确的表,编写一个 SQL 查询,并在五次工具调用中得出正确答案,而三个通用代理都没有从探索中恢复。

下面,我们将深入探讨我们如何在广泛的实际用户任务上评估 Genie Code。
我们在 400 多个真实任务上评估了代理,这些任务来自真实使用
我们刻意构建了一个评估集,以涵盖 Genie Code 上真实用户任务的广泛分布。我们从 Databricks 的真实内部使用中提炼了 401 个自包含任务,涵盖日常问题和高级用户解决的更困难问题:必须找到正确资产的发现任务,创建和修改代码和查询,调试代码,理解和解释现有代码,需要从表中提取精确数字的精确数据查找,等等。

结果
我们对所有 401 个任务运行了每个代理,编码代理使用它们自己的框架,来自领先前沿实验室的最新模型,并增强了 Databricks MCP。每个代理在每个任务上都有相同的 20 分钟墙钟时间预算。答案由独立评判员根据响应是否正确和有用进行评分,超时的任务计为失败。此分析中的美元数字是每个代理用户需支付的估计值,它们更具相对意义。
| 代理 | 准确性 | 平均 $/任务 |
| Genie Code | 76.6% | $0.55 |
| 编码代理 1 | 72.1% | $1.09 |
| 编码代理 2 | 55.9% | $0.91 |
| 编码代理 3 | 56.1% | $1.16 |

Genie Code 在此基准上是最准确的代理,也是最便宜的:它每任务成本大约是最近竞争对手的一半,每正确答案成本不到其一半。其他两个编码代理的准确性在 50% 左右,很大程度上是因为长时间运行的扫描在墙钟时间上超时,这通常是由于对非常大的表进行了低效、无上限的查询。
对于这个特定的基准,我们观察到任务中位数成本为 $0.34,p99 为 $2.72,最昂贵的任务为 $3.87,只有 4% 的任务超过 $2。其他代理有 33-40% 的任务成本超过 $1(而 Genie Code 为 16%),并且一个编码代理的深度探索运行最高达到 $9.49 的显着更高成本。由于所有代理都可以访问相同级别的前沿模型,成本差异归结为效率:更少的交互轮次和更少的令牌来获得答案。

差距是由每个代理如何找到所需数据驱动的。集合中最难的任务没有明确命名资产,代理必须定位正确的表、笔记本或仪表板,以及相关的业务逻辑,然后才能回答。在这些任务上,通用代理退回到低效的工作空间探索,这种探索导致准确率降低和成本提高。
Genie Code 对工作空间上下文的理解——对目录的语义搜索和对工作空间数据的持久记忆——让它跳过大部分探索,平均每个任务仅 8.3 次工具调用——少于我们测试的任何代理。这也是上述成本尾部的构成:每个代理的昂贵运行都主要由这些发现任务主导,而 Genie Code 的尾部是最短的。我们预计这一优势将得到进一步的加强Genie Ontology;在本次运行中,我们禁用了 Ontology,因为它在全球范围内尚未对我们的所有客户可用。
结论
当我们开始调查时,我们预期准确性和成本之间有取舍。相反,在广泛分布的真实用户任务中,我们发现 Genie Code 能够利用其对数据的强大语义理解来超越通用编码代理,更准确且更便宜。
Genie Code 是作为前沿数据代理构建的,专为在高度动态和模糊的环境中(如 Databricks 工作空间)操作而优化。通用编码代理在这些环境中挣扎:它们最终花费轮次和令牌去重新发现 Genie Code 已经拥有的上下文。这种专业知识同时转化为准确性、速度和成本优势,而不用牺牲通用能力。
最后,像我们的 Databricks 代码库的编码代理基准一样,更广泛的教训是,通用的排行榜不能衡量用户的日常体验。我们每天都在扩展基于真实任务的评估,并将继续发布我们学到的内容。
补充来源
1 个信源 · 1 篇报道这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏