返回
RSS Databricks Blog AI 逐段翻译 发布 2026-09-09 21:30 收录于 09-10

Databricks推出Adaptive Instructed-Retriever,搜索延迟降低2倍

DataHot 速览

Databricks发布Adaptive Instructed-Retriever,面向企业数据代理的检索层,结合并行检索的速度与顺序搜索的深度。该模型根据请求复杂度自适应决定是否继续搜索,在严格成本和延迟约束下工作。其匹配领先第三方模型质量,延迟降低2倍,并在检索基准上显著优于单步搜索。该技术也服务于Databricks数据代理在大型工作区中查找表、笔记本、仪表盘和文档的需求。

为什么值得关注:数据从业者关注检索效率与质量平衡,该方案展示了Agent检索层如何用受限多步搜索提升复杂问询能力,对搭建ChatBI/Data Agent有直接参考价值。

本文目录 6 节
  1. 训练自适应指令检索器
  2. 用于定制质量-延迟权衡的在线强化学习
  3. 自适应指令检索器制定更高效和更有针对性的搜索
  4. 无需穷举搜索即可验证负面答案
  5. 使用下一轮改变策略
  6. 结论

译文

AI 逐段翻译

高效的企业数据代理需要既准确又快速的搜索。今年早些时候,我们发布了Instructed-Retriever-1,这是一个检索模型,可以整合企业数据模式和自定义指令,同时利用并行测试时扩展来提高检索准确性和低延迟。这种单步搜索方法适用于大部分用户请求。然而,更复杂的多跳问题仍然可以从顺序搜索中受益,模型在多个步骤中迭代收集证据并完善查询——但代价是额外的延迟。

这就是我们引入自适应指令检索器的原因,它结合了并行检索的速度和顺序搜索的性能,同时保持严格的成本和延迟保证。目标很简单:仅在有用时才花费额外的搜索步骤。这也是Genie Code,Databricks的数据代理面临的相同检索效率问题:它必须在一个大型且不断变化的工作空间中快速找到合适的表格、笔记本、仪表板和文档,而不浪费在暴力探索上。自适应指令检索器专为这个检索层设计,当证据明确时能快速返回,仅当更难的请求需要时才使用顺序搜索。正如本文所示,训练后的模型在质量上匹配领先的第三方模型,延迟低2倍,并在我们的检索基准上显著改进单步搜索。

在检索基准套件上测量的得分和端到端延迟

为了构建自适应指令检索器,我们对顺序步骤的数量设定固定上限,并训练代理自适应地决定每个用户请求所需的计算量。当已找到充分证据时,代理提前停止并返回相关证据;当额外的搜索可能提高检索质量时,它可以在步骤限制内继续搜索。

图1. 自适应指令检索器的架构,实现了有界延迟的多步代理式搜索。

训练自适应指令检索器

为了更好地平衡检索质量和顺序扩展的延迟成本,我们训练了自适应指令检索器——一个支持并行单步检索和顺序搜索的小型自定义模型,同时以显著低于领先第三方模型的延迟运行。我们在混合的自定义企业检索和公共检索基准上评估该模型,包括受益于多跳推理的任务。在这些基准上,自适应指令检索器实现了与领先第三方和开源模型相当的性能,同时提供2倍的更低延迟。

为了准备训练数据,我们依赖合成企业检索环境和类似于Instructed-Retriever-1的代理式数据合成过程,并发表在KARL报告中。我们重用Instructed-Retriever-1的现有训练数据,以保留模型进行快速并行单步搜索的能力,并额外引入从多个代理式搜索步骤中受益更多的合成多跳问题。

从基础模型开始,我们使用在线强化学习(ORL)来训练模型,仅在可能提高最终性能时采取额外的搜索步骤。具体来说,我们使用CISPO(裁剪重要性采样策略优化)对模型进行端到端优化,采用平衡轨迹质量和搜索成本的奖励设计:模型因高质量轨迹而获得奖励,同时因未带来相应性能增益的额外搜索步骤而受到惩罚。

我们使用AI Runtime训练模型。AIR也可供Databricks客户使用,使这种方法对于为客户自身领域和工作负载开发专用模型非常实用。训练配方特意设计为轻量级:我们从预训练的基础模型开始,使用适量的合成数据来专门化其搜索行为。如图2所示,我们的轻量级方法能够很好地泛化到新的搜索任务和领域。

图2. 自适应指令检索器实现了与Claude Sonnet 5和GPT-5.6 Luna相当的性能,但延迟显著更低。结果基于七个留出的内部和外部基准混合报告,涵盖多种搜索难度级别和领域。

图2将自适应指令检索器与两个领先的第三方模型(Claude Sonnet 5和GPT-5.6 Luna)以及一个开源模型(DeepSeek-V4-Flash)进行比较。我们绘制每个模型的检索质量与平均端到端延迟的关系。浅色柱显示单步搜索的检索得分,深色柱显示多步搜索的结果,对照左轴(越高越好);阴影柱显示端到端延迟,对照右轴(越低越好)。自适应指令检索器在匹配领先第三方和开源模型的性能的同时,仅需5.8秒响应,比Claude Sonnet 5、DeepSeek-V4-Flash或GPT-5.6 Luna快2倍以上。

用于定制质量-延迟权衡的在线强化学习

训练自适应指令检索器使我们能够通过调整ORL中使用的步骤惩罚幅度来选择质量-延迟权衡。因此,我们可以训练一组支持自适应指令检索器的检查点,并选择最适合生产工作负载的那个。

图3. 通过在ORL训练期间调整步惩罚权重,我们可以沿着帕累托前沿选择任意工作点,该前沿在整个检索预算范围内优于DeepSeek-V4-Flash、Claude Sonnet 5和GPT-5.6 Luna。

图3展示了通过扫描ORL训练期间惩罚的幅度,我们获得了一系列检查点,每个检查点在质量-延迟平面上落在不同的点上——y轴为得分(越高越好),x轴为端到端延迟(绘制为越快越靠右)。红色曲线将这些工作点连接成一条前沿:较轻的步惩罚允许模型采取更多步骤并达到更高得分,而较重的惩罚则减少其延迟。

训练后的自适应指令检索器模型的完整前沿优于其他替代方案。与未经训练的指令检索器基础模型相比,每个检查点在相似或更低延迟下提供更高质量,这表明收益来自学习何时搜索——以及何时不搜索。在前沿的顶部,我们的模型达到与其他领先模型相当的得分,同时速度快2倍以上。由于训练后的前沿包含具有不同权衡的检查点,我们可以选择最适合每个工作负载和预算的检查点——为交互使用偏好速度,或为更难的离线检索偏好质量。

自适应指令检索器制定更高效和更有针对性的搜索

我们展示了一些示例,比较替代方案和我们训练的自适应指令检索器模型的搜索策略。这些示例说明了自适应指令检索器如何在简单问题上高效搜索,并在更难的问题上更有效地利用其剩余搜索预算。

无需穷举搜索即可验证负面答案

自适应指令检索器比Sonnet提前一步、比Luna提前两步达到相同奖励。

问题:公司X是否明确将重组成本报告为FY2022损益表的行项目?

模型召回率@10搜索努力行为
GPT-5.6 Luna1.004步搜索推测性短语,如“不存在此类成本”和“0百万”。
Claude Sonnet 51.003步检查经营报表、重组附注和相关对账。
自适应指令检索器1.002步检查直接行项目和相关费用类别,一旦确定不存在即停止。

使用下一轮改变策略

自适应指令检索器学会调整搜索策略以提高召回率:从广泛发现转向有针对性的账户搜索。它以最少的步骤(与Sonnet并列)获得最高奖励。

问题:哪些客户正在使用或考虑使用LiteLLM代理?

模型召回率@10搜索努力行为
GPT-5.6 Luna0.624步后续轮次重复引用“LiteLLM”、“代理”和“客户”的组合。
Claude Sonnet 50.502步高效停止,但其通用后续问题遗漏了相关客户。
自适应指令检索器0.752步使用第二轮进行具体账户假设,包括两个相关客户。

结论

自适应指令检索器将先前发布的Instructed-Retriever-1从并行单步检索扩展到自适应多步搜索,使模型能够在复杂查询上花费额外搜索步骤,其中迭代推理和证据收集可以显著提高检索质量,同时在简单查询上提前返回以最小化延迟。这种自适应方法提供比单步搜索显著更强的检索性能,同时以2倍更低的延迟实现与领先第三方模型相当的性能。通过在线强化学习期间变化步惩罚,我们可以明确优化检索质量和推理成本之间的权衡,产生质量-延迟前沿上不同点的检查点,并选择最适合生产工作负载的工作点。

我们的贡献为Databricks中在大型、不断变化的工作区上操作的数据代理提供了实用的检索构建模块。诸如Genie CodeGenie One和Genie Agents等体验必须找到正确的表、笔记本、仪表板和文档,而不花费过多时间和精力进行深度探索。自适应指令检索器为这种设置提供有界策略:在常见查找上快速,在困难发现任务上彻底,并可在产品延迟预算内控制。更广泛地说,这些结果说明了小型专用模型即使对于需要多步推理的任务也具有竞争力。DatabricksAIR允许我们的客户为其自己的领域和性能要求定制专用模型。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存