评估AI Agent:Grounded Reasoning Cup赛事解析
DataHot 速览
Databricks举办首届Grounded Reasoning Cup,11支北美学术团队基于OfficeQA基准开发并优化Agent,决赛采用新基准OfficeQA Pro V2测试泛化能力。斯坦福以63.3%准确率夺冠,比平均团队高约22个百分点,比离线前沿模型基线高约35个百分点,但仍有18.8%的问题无人解出。比赛还揭示了文档预处理、定向检索、并行Agent、结构化工具使用与验证等优化策略的价值,以及使用代表性留出集评估泛化能力的重要性。
为什么值得关注:企业级grounded reasoning评估方法、Agent优化策略与量化基线,对构建和评估数据分析/决策Agent有直接参考价值。
译文
AI 逐段翻译今年,Databricks 举办了首届“有依据推理杯”,这是一场首创的现场 AI 竞赛,旨在评估 AI 智能体对复杂、企业风格文档集合进行推理的能力。通过在实时竞赛条件下对新发布的语料库测试智能体,该竞赛旨在帮助回答 AI 评估中最棘手的问题之一:基准测试上的性能提升在多大程度上能泛化到类似的现实任务中?
比赛汇集了来自美国和加拿大的 11 支顶尖学术团队,并与 OpenAI、Anthropic 和 Google DeepMind 等前沿实验室的资源和支持配对。在两个月的时间里,团队在OfficeQA上开发和优化他们的智能体,这是我们旗舰级的基于依据的推理基准,旨在反映具有经济价值的企业工作流程。在比赛当天,他们被要求实时将这些系统应用到新发布的基于依据的推理基准OfficeQA Pro V2上,以测试他们的改进是否泛化。
斯坦福大学以 63.3% 的准确率获胜,超过团队平均水平约 +22 分,并超过平均前沿智能体离线基线约 +35 分。顶尖团队通过文档预处理、针对性检索、并行智能体、结构化工具使用和验证获得了显著提升。同时,18.8% 的问题没有团队解决,这凸显了企业依据推理仍有很大的提升空间。

在这篇博客文章中,我们回顾了比赛,并讨论了来自“有依据推理杯”获胜团队(斯坦福、马萨诸塞大学阿默斯特分校和耶鲁)的智能体优化策略和见解。
总的来说,我们发现以下几点:
- 泛化需要代表性的、留出评估。 在 OfficeQA 上开发的技术并不总是可靠地转移到我们的新基准。这强调了使用如 OfficeQA Pro V2 这样的留出测试集来确保解决方案泛化到新示例的重要性。
- 智能体的性能取决于整个系统,而不仅仅是模型。 使用相同模型的最高分和最低分团队之间的平均差距为 30.4 分。解析、检索、工具使用、验证、并行性和操作基础设施都决定了智能体能否成功完成端到端的依据推理任务。
- 企业依据推理仍然远未解决。 即使是获胜团队也在基准的许多检索、解析和分析要求上挣扎,留下了大量的研究和改进空间。我们鼓励从业者使用公开的 OfficeQA 基准套件继续推进这项工作。
比赛设置
“有依据推理杯”的目标是汇集顶尖学术团队,开发可泛化的依据推理方法——这是企业环境中常见的任务,涉及使用来自大型、通常是专有的文档集合的证据来回答复杂问题。
代表学术机构的 2-4 人团队与来自 OpenAI、Anthropic 或 Google DeepMind 的行业伙伴配对,他们在开发期间提供访问其模型的权限和指导。团队有大约两个月的时间使用他们认为合适的任何方法来构建智能体,唯一限制是他们必须仅使用伙伴实验室的模型系列来驱动智能体。在此期间,他们使用 OfficeQA 基准来评估他们认为会泛化到类似依据推理任务的新技术。
在比赛当天,团队被要求在新发布的基准上实时应用他们的智能体。比赛受以下规则约束:
- 基准发布: 新语料库(美国财政部收支账簿)在比赛前仅 36 小时发布。这给了团队处理和数据索引的时间,同时限制了方法过拟合新基准的机会。
- 设计约束: 团队可以使用任何智能体框架、语料库版本、检索策略、工具使用设置或人在回路工作流程,只要他们使用其指定的行业实验室伙伴的模型即可。
- 格式: 比赛包括六轮 15 分钟,每轮 15 个问题。轮次在活动过程中逐渐变难。
- 评分: 团队每答对一题得 1 分。为了激励低延迟,如果他们第一个正确回答给定问题,还会获得 0.25 分的速度奖励。在最后一轮(包含最具挑战性的问题)中,分数价值翻倍。每支团队还允许在比赛中有 3 次重新提交机会,他们可以选择用于纠正之前的答案。
团队表现与经验教训
比赛揭示了一点:自我们7个月前发布OfficeQA基准以来,企业风格文档语料上的基于事实的推理有所进步,但仍远未解决。团队平均得分约为41%,而前三名团队的准确率超过50%,斯坦福团队以63.3%的准确率赢得比赛。这些结果既表明了顶尖团队的出色工作,也留下了大量探索空间。
获胜团队策略
虽然每个团队都采取了独特的方法,但在前三名团队构建的智能体中出现了几种模式。强大的系统倾向于结合细致的文档预处理、有针对性的检索、结构化的工具使用和答案验证步骤。在许多情况下,性能更多地取决于整个系统,而不是单一的模型调用:文档如何解析,证据如何检索,中间计算如何执行,以及答案在提交前如何验证。虽然这些是最高性能系统普遍具备的品质,但它们也各自采用了不同且创造性的策略,如下所述。

第一名:斯坦福大学

斯坦福团队的获胜方法源于将常见的基于事实的推理失败模式转化为可复用的操作规程,供其Claude Opus 4.8 Claude Code智能体学习并应用于比赛问题。在公共OfficeQA基准的开发过程中,包括使用Opus 4.8甚至Fable 5(可用时)进行消融实验,团队反复将错误答案追溯到智能体的具体失误,然后将这些模式转化为表格定位、答案格式化、常见金融措辞澄清等技能。团队还整合了技能,决定何时在解析的语料文本和类似Markdown的文档表示中进行搜索,以及当解析文本缺乏完整上下文时,何时回退到源PDF。到比赛日,斯坦福已为其智能体准备了约100多项技能。在他们尝试的88道题中,答对57道,在准确率上领先所有团队。
尽管有如此深入的准备,斯坦福在比赛中仍需调整策略。在前三轮中,该团队使用另一个Claude Code智能体作为验证器,重新提取中间值,检查常见失败模式,如通过数据血缘追踪修订值和单位换算,并在发现差异时修补计算。但在前三轮仅获得两次速度加成后,斯坦福在最后三轮去掉了额外的验证步骤。这一改变显著降低了延迟,帮助团队在14道题上获得速度加成,并助力其逆转。然而,验证器在最后一轮被证明是决定性的,斯坦福重新启用它,通过最终重新提交纠正了一个答案,最终锁定胜局。
第二名:马萨诸塞大学阿默斯特分校

马萨诸塞大学团队押注速度。他们使用Claude Opus 4.8 Fast作为主要模型,并预处理语料以创建元数据目录,从而实现对解析文档的快速搜索和过滤。为提高答案质量同时保持低延迟,他们对每个问题并行运行三个智能体,然后进行最终的Opus验证调用以选择最佳答案。
这一策略使马萨诸塞大学成为正确答案平均提交时间最快的团队:四分钟,不到团队平均时间八分三十秒的一半。因此,他们获得了36次速度加成,每次0.25分,因为他们是第一个正确回答的团队,是斯坦福第二名16次的两倍多。这些加成帮助他们在半场时建立起对斯坦福10.25分的领先优势,并在进入最后一轮时保持3.75分的优势。马萨诸塞大学一直保持领先,直到比赛最后56秒,斯坦福更慢但更准确的智能体在最棘手的问题上证明是决定性的,最终以1.75分的优势反超获胜。
马萨诸塞大学的方法展示了更快的模型、文档预处理和测试时扩展如何协同工作,在不牺牲太多准确性的情况下实现非常低的延迟。
第三名:耶鲁大学

耶鲁大学团队构建了一个多臂验证框架,旨在当任何单个智能体失败时保持稳健。该系统并行运行四个独立臂,涵盖两种智能体策略。两个臂使用自主ReAct智能体:一个由Gemini 3.1 Pro驱动,另一个由Gemini 3.5 Flash驱动。其余臂使用更结构化的规划器-验证器管道,所有LLM调用由Gemini 3.1 Pro驱动。在该管道中,规划器检查并情境化源文档,组装包含回答问题所需证据的草稿本。然后验证器检查引用的来源并执行最终计算。
一个Gemini 3.1 Pro元验证器审查所有四个臂产生的答案和推理,并选择最终响应。为降低引入新的无依据答案的风险,元验证器只能选择现有臂之一提出的答案。当无法做到时,系统回退到多数投票。通过结合不同的智能体架构和独立、部分去相关的失败模式,耶鲁强调了持续、基于事实的验证。该方法为团队赢得第三名,90道题中答对49道,并在六轮比赛中的四轮中跻身正确率前三。
获胜团队策略总结
这些获胜方法的核心要点之一是,将智能体成功应用于端到端的基于事实的推理任务需要整体系统思维,而不仅仅是模型选择。在获胜方法中,几个关键的设计杠杆尤为重要:
- 解析质量: 顶尖团队使用预解析文档,并经常增强这些解析表示以包含额外元数据(例如图表描述或页面级元数据),并保留指向源 PDF 的路径,以便在解析文本不完整时回退。在我们自己对 OfficeQA Pro V2 的研究中,我们发现使用
ai_parse预解析文档对 Genie 相比基线前沿代理的性能提升 24.0 个百分点贡献显著。 - 检索质量: 强大的系统不依赖通用的 top-k 块搜索。相反,它们使用某种形式的词汇检索(例如 grep),通常与密集检索配对使用,以实现混合方法。
- 工具使用: 成功的代理通常将搜索、文档检查、计算、比较和提交委托给专门工具。
- 验证策略: 多个团队通过验证代理或 LLM 调用构建了某种形式的显式验证检查,以提高答案质量。
- 健壮的框架: 在实时截止压力下,预处理、重试逻辑、并行性和提交脚手架等操作细节对于确保正确答案及时提交至关重要。
这些因素决定了模型能否在截止压力下可靠地找到正确证据、执行正确计算并提交正确答案。
影响与后续步骤
总之,Grounded Reasoning Cup 的结果展示了多个更广泛的教训:
- 泛化必须经过测试,而非假设。 在 OfficeQA 上的改进并不总是迁移到 OfficeQA Pro V2,前沿代理平均仍能正确回答其不到一半的问题。在熟悉的基准上的进展不一定转化为新语料库或任务分布上的进展。
- 代表性、留出的评估至关重要。 它们应评估重要的泛化形式,理想情况下保持任务的核心性质不变(即对文档的扎根推理),同时改变可能变化的任务元素,如语料库。在我们关于 OfficeQA Pro V2 的文章中,我们讨论了如何利用合成数据,结合我们对客户工作流程的了解,快速扩展这些代表性评估。
- 代理性能取决于完整系统。 性能不仅取决于模型,还取决于解析、检索、工具使用、验证以及底层数据和基础设施的质量。获胜团队整体优化了这些组件。类似地,Genie 显著优于基线前沿代理 当使用像
ai_parse这样的工具预解析文档,以及额外的框架优化策略时。
我们感谢所有参与 Databricks 首届 Grounded Reasoning Cup 的团队和行业赞助商,包括 OpenAI、Google DeepMind 和 Anthropic,他们帮助推动了该领域的发展。我们还感谢 USAFacts 的持续合作,从帮助我们确定新语料库并为 OfficeQA Pro V2 创建相关问题,到与我们合作举办竞赛。最后,我们感谢美国财政部帮助确定美国收支账户作为竞赛基准的基础,并首次将数据集作为连贯集合发布。
作者:Krista Opsahl-Ong, Arnav Singhvi, Josh Joseph, Jasmine Collins, Ivan Zhou, Brooke Wenig, Denny Lee, Michael Bendersky, Erich Elsen, Xing Chen, Matei Zaharia
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏