Databricks称专用数据Agent比通用Coding Agent更准更省
译文 AI 逐段翻译
智能体AI的传统观念认为,更好的答案需要更多令牌:让智能体探索更久、验证更多、重试更多,准确率总会提高。当我们将Genie Code与来自主要AI实验室的三个广泛使用的编码智能体在我们内部使用中的400多个真实数据任务上进行直接比较时,我们发现恰恰相反:Genie Code既是我们测试过的最准确的智能体,也是成本效益最高的。

原因是数据智能体必须在一个通用编码智能体难以适应的新范式下工作。正如我们之前分享的,数据智能体面临独特的挑战:它们必须在一个动态、不断演变的工作区中发现正确的资产,该工作区有数十万个表、笔记本、仪表板和文档;它们必须确定元数据和可能过时或矛盾的文档中的真相来源;而且它们必须在没有编码智能体所依赖的可验证测试的情况下完成这一切。
为了应对这些挑战,我们为Genie Code提供了能力,使其能够跳过通用编码智能体所依赖的随机游走探索:对目录和工作区资产的语义搜索、对用户依赖的表和业务逻辑的持久记忆,以及对企业管理上下文的深度语义理解。
我们直接从这个评估的会话中观察到了这种差异。在一个例子中,Genie Code利用语义搜索和元数据高效地找到了正确的表,编写了一个SQL查询,并在五次工具调用中得到了正确的答案,而三个通用智能体都没有从探索中恢复过来。

下面,我们将更深入地探讨我们如何在广泛的实际用户任务上评估Genie Code。
我们评估了来自实际使用的400多项真实任务上的智能体
我们特意构建了一个评估集,以覆盖Genie Code上真实用户任务的广泛分布。我们从Databricks内部实际使用中提炼出401个自包含任务,涵盖日常问题和高级用户处理的难题:发现任务(智能体必须找到正确的资产)、创建和修改代码与查询、调试代码、理解和解释现有代码、需要从表中提取精确数字的精确数据查找等。

结果
我们在所有401个任务上运行了每个智能体,编码智能体使用自己的框架,采用领先前沿实验室的最新模型,并增强了Databricks MCP。每个智能体每个任务都有相同的20分钟墙钟时间预算。答案由独立评审员根据响应是否正确和有用进行评分,超时的任务算作失败。本分析中的美元数字是对用户为每个智能体支付费用的估计,相对而言更具参考价值。
| 智能体 | 准确率 | 平均美元/任务 |
| Genie Code | 76.6% | $0.55 |
| 编码智能体1 | 72.1% | $1.09 |
| 编码智能体2 | 55.9% | $0.91 |
| 编码智能体3 | 56.1% | $1.16 |

Genie Code是这个基准上最准确的智能体,也是最便宜的:每个任务的成本大约是最近竞争对手的一半,每个正确答案的成本不到其一半。其他两个编码智能体的准确率在55%左右,很大程度上被长时间扫描的墙钟超时拖累,这通常是由于对非常大的低效、无上限的查询造成的。
对于这个特定的基准,我们观察到中位任务成本为0.34美元,p99为2.72美元,最贵的任务为3.87美元,只有4%的任务超过2美元。其他智能体有33-40%的任务超过1美元(Genie Code为16%),其中一个编码智能体的深度探索运行成本显著更高,达到9.49美元。由于所有智能体都可以访问相同级别的前沿模型,成本的差异归结为效率:用更少的轮次和更少的令牌来获得答案。

差距是由每个智能体如何找到所需数据驱动的。集合中最难的任务没有明确命名资产,智能体必须在回答之前定位正确的表、笔记本或仪表板以及相关的业务逻辑。在这些任务上,通用智能体退回到低效的工作区探索,这种探索导致准确率较低和成本较高。
Genie Code对工作区上下文的理解——对目录的语义搜索和对工作区数据的持久记忆——让它跳过了大部分探索,平均每个任务仅8.3次工具调用——比我们测试的任何智能体都少。这也是上述成本尾部的原因:每个智能体的昂贵运行都由这些发现任务主导,而Genie Code的尾部最短。我们预计这一优势将通过Genie Ontology得到进一步加强;在这次运行中我们禁用了Ontology,因为它尚未对所有客户全球可用。
结论
当我们开始调查时,我们预期在准确率和成本之间存在权衡。相反,在广泛的实际用户任务分布中,我们发现Genie Code能够利用其对数据的强大语义理解,胜过通用编码智能体,既更准确又更便宜。
Genie Code是作为前沿数据智能体构建的,针对在如Databricks工作区这样的高度动态和模糊环境中操作进行了优化。通用编码智能体在这些环境中挣扎:它们最终花费轮次和令牌重新发现Genie Code已经拥有的上下文。这种专业知识同时转化为准确性、速度和成本,而在通用能力上没有权衡。
最后,就像我们的 Databricks代码库上的编码智能体基准,更广泛的经验是,通用排行榜无法衡量用户的日常体验。我们每天都在根据实际任务扩展评估,并将继续发布我们学到的东西。