返回
RSS Databricks Blog AI 逐段翻译 精选 发布 2026-08-27 23:00 收录于 08-28

结构化图表提取提升Agent检索与问答准确率

DataHot 速览

Databricks 官方博客指出,企业Agent在处理包含图表的文档时经常出错,例如前沿Agent仅凭图片推理50秒仍得出错误答案17,而Databricks Genie通过ai_parse_document的结构化提取给出正确答案18。文章在OfficeQA Pro基准及客户检索系统中观察到图表类问题表现更差,尤其在金融服务领域。通过结构化图表提取,可同时改善检索和基于图表问题的回答质量,并在ViDoRe V3图表子集和自建Chart-RAG数据集上验证了效果。

为什么值得关注:数据从业者可了解如何通过结构化图表提取增强Agent对多模态文档的理解,提升ChatBI/Data Agent在真实企业场景中的可靠性。

本文目录 8 节
  1. 动机
  2. 评分:我们使用LLM评审(gemini-3-flash)根据标准答案将每个答案评为正确/部分正确/不正确。
  3. 结构化图表数据提高检索和回答质量
  4. 图像进一步提高答案质量
  5. JSON表示与多模态嵌入竞争力相当
  6. ViDoRe V3:
  7. Chart-RAG:
  8. 结论

译文

AI 逐段翻译

动机

越来越多的企业现在要求智能体处理其专有文档并回答关于文档内容的问题。然而,许多重要信息存在于图形和图表中。许多客户发现智能体在回答需要阅读和计数图表中数值的问题时存在困难。为了使智能体在各种企业环境中可靠工作,我们需要使图表更易于解释。

我们如何能让图表更易于智能体理解?我们进行了一个简单快速的测试:我们询问不同的智能体,“这个图表上有多少个局部最大值?”

以下是前沿智能体和Databricks Genie在回答这个问题时的比较。前沿智能体仅传递了图像,花费了50秒推理,但仍然得到了错误的答案17。与此同时,Databricks Genie通过ai_parse_document对图表进行了结构化提取,并得到了正确答案18。

image12.png
image4.png
image10.png
仅使用图像的前沿智能体的响应(错误):使用图表结构化提取的Genie智能体的响应(正确):

我们在OfficeQA Pro基准中注意到这些不足,其中模型在基于图表和多模态问题上的表现不如在不需要图表理解的问题上。我们在客户的信息检索系统中也看到了同样的差距,尤其是在金融服务领域。基于文本的检索系统只能搜索文本空间。常见的解决方案是生成标题来描述图表内容;然而,这可能会错过图表内数字的细粒度问题所需的数据。结果,系统可能检索到错误的页面,或者检索到正确的页面但没有足够的信息来回答问题。

在这篇文章中,我们展示了图表的结构化提取提高了基于图表问题的检索和答案质量。我们在两个数据集上评估了我们的方法:ViDoRe V3中图表密集的子集,这是一个针对视觉丰富文档的检索和问答基准,以及我们称之为Chart-RAG的合成图表聚焦数据集。我们的方法与大型单向量和多向量多模态嵌入模型相比具有竞争力。

image9.png

我们使用Databricks的AI函数端到端构建了一个图表感知的检索流水线,这是一组可组合的函数,使用最先进的研究技术进行优化(见图2)。我们使用ai_parse_document提取文档内容,包括表示为结构化JSON的图表,以及ai_prep_search将内容转换为适合检索的块,并使用轻量级300M参数文本嵌入模型进行索引。我们使用ai_search从块创建索引,并将索引连接到Genie进行检索和回答。图2:使用Databricks AI函数实现的图表提取和检索流水线。image5.pngai_parse_document评估方法我们比较了两个索引,它们使用300M参数的BGE文本嵌入模型创建,基于相同的源PDF构建,唯一区别在于图表图形的表示:仅描述(基线):图形仅由标题表示JSON增强:图表图形由标题和结构化图表JSON表示,嵌入在图形块中。一个图表提取示例:分组柱状图,比较2026年和2027年GDP增长和总体通胀的五个经济预测情景。image3.png

尽管选择了以图表为重点的问题,但许多问题仍然可以使用周围的文本回答。为了隔离图表内容的影响,我们创建了第二个基准,仅聚焦于基于图表的问题,这些问题来自三份复杂的、图表密集的报告(BIS季度评论、IMF世界经济展望、摩根大通长期资本市场假设)。我们根据这三份共378页的文档编写了114个视觉基础问题,构建了合成Chart-RAG数据集。

评分:我们使用LLM评审(gemini-3-flash)根据标准答案将每个答案评为正确/部分正确/不正确。

检索:我们报告Hit Rate@10和nDCG@10。Hit Rate@10检查至少一个黄金页面是否出现在前10个检索结果中。ViDoRe基准的问题可能有多个黄金页面,每个页面的相关分数为1或2。对于Hit Rate@10,我们将分级相关性转换为二元相关性,允许任何分数的页面都算作命中。对于nDCG@10,我们保留原始分级相关性。在Chart-RAG数据集中,每个查询只有一个黄金页面。

  • 为获得稳定的测量,我们每种配置运行三次,并报告置信区间。结构化图表数据提高检索和回答质量
  • 图3:在ViDoRe V3子集和合成Chart-RAG数据集上,仅描述和Chart-JSON增强检索的答案正确率、Hit@10和nDCG@10。结果在三次运行中取平均。image6.png

结构化图表JSON在两个数据集上都提高了答案质量和检索。下面的问题级分析显示了纠正后的答案何时与更好的检索相吻合。

image7.png

我们评估了来自ViDoRe V3基准测试中的310个图表和信息图密集型问题。该基准测试评估了七个领域的检索和回答:就业、能源、制药、物理、金融、计算机科学和工业文档。对于每个实验,我们解析并分块了整个16K页的英文语料库,并对每个查询生成答案,搜索整个索引。

尽管选择了以图表为中心的问题,但许多问题仍然可以通过周围的文本回答。为了隔离图表内容的影响,我们创建了第二个基准测试,该基准测试仅专注于基于图表的问题,这些问题来自三份复杂且图表密集的报告(BIS季度评论IMF世界经济展望摩根大通长期资本市场假设)。我们根据这三份共378页的文档撰写了114个基于视觉的问题,以构建合成Chart-RAG数据集。

评分:我们使用LLM评判器(gemini-3-flash)对照标准答案对每个答案进行正确/部分正确/不正确的评分。

检索:我们报告了Hit Rate@10和nDCG@10。Hit Rate@10检查至少一个标准页面是否出现在前10个检索结果中。ViDoRe基准测试中的问题可能有多个标准页面,每个页面的相关性得分为1或2。对于Hit Rate@10,我们将分级相关性转换为二元相关性,允许任一得分的页面都算作命中。对于nDCG@10,我们保留原始的分级相关性。在Chart-RAG数据集中,每个查询只有一个标准页面。

为了获得稳定的测量结果,我们每次配置运行三次,并报告带有置信区间的结果。

结构化图表数据提高检索和回答质量

image6.png

结构化图表JSON在两个数据集上提高了回答质量和检索效果。下面按问题的分析显示,纠正的答案与更好的检索结果何时重合。

image7.png

以下来自Chart-RAG 数据集的示例展示了JSON表示如何提高检索和答案质量:

image2.png
问题之前的答案使用图表JSON增强的ai_parse_document的答案
Oil VIX在2026年第一季度达到大约多少峰值(百分点)?参考以下图表:"我无法在提供的搜索结果中找到关于Oil VIX在2026年第一季度确切峰值水平的具体信息……""根据提供的数据,Oil VIX在2026年第一季度达到约80个百分点。"

这种检索增益可能不仅限于关于图表的问题。即使答案不直接出现在图表上,提取的图表值和标签也能使页面本身更易于检索。

图像进一步提高答案质量

有些问题取决于图形的外观,而不仅仅是其数值。为了衡量恢复视觉上下文的好处,我们在回答时向代理提供了与由JSON检索到的前三个文本块相对应的图像。

image8.png

在这里,检索保持不变。图像在Chart-RAG数据集上增加了4个百分点,在ViDoRe V3子集上增加了2.6个百分点。

JSON表示与多模态嵌入竞争力相当

一个问题是,我们使用轻量级3亿参数文本嵌入模型的方法与多模态嵌入模型相比如何。我们与四种替代方案进行了基准测试:ColQwen2.5-3B(一种使用后期交互评分的大型多向量多模态嵌入模型)、Qwen3-VL-Embedding-2B(一种大型单向量多模态嵌入模型),以及更轻量的单向量模型Jina CLIP v2(0.9B参数)和CLIP ViT-L/14(428M参数)。每个多模态模型都对每一页进行嵌入。在查询时,我们使用MaxSim对ColQwen2.5-3B进行页面排名,对单向量模型使用余弦相似度,在整个语料库中搜索,并将得分最高的五个页面传递给回答的视觉语言模型。我们使用五个检索到的页面来报告答案正确性,原因有两个。首先,它在ViDoRe子集和Chart-RAG数据集的最佳性能深度之间提供了一个平衡的中间点。其次,五个页面近似于我们方法中使用的平均输入上下文,从而能够进行公平比较。我们仍然报告nDCG@10作为标准检索指标。

ViDoRe V3:

image11.png

Chart-RAG:

image13.png

对于最强的模型,由于语料库规模较小(378页),Chart-RAG数据集上的检索接近于饱和。因此,这里更有趣的比较是答案质量。

在ViDoRe V3上,带有前三个图像的chart-JSON达到了75.9%的正确率。在Chart-RAG上,相同的设置达到了75.1%。两种情况下都超过了四个多模态嵌入基线,同时只向模型传递了三个图像。这种性能来自比ColQwen2.5-3B的多向量、后期交互架构大约小10倍且更简单的替代方案。因此,结构化的图表预处理可以在更小的图像预算和更低的索引和检索开销下提供有竞争力的答案质量。

结论

图表是企业文档中信息的主要形式。使图表信息易于查找和清晰解释对于检索代理的准确性至关重要。结构化的图表JSON通过向检索索引中添加精确值并供代理推理,弥合了经典RAG系统中的差距。我们表明,结构化的图表JSON提高了检索质量和代理答案准确性。未来的工作可以进一步探索不同的结构化提取表示格式如何影响检索和答案准确性。

chart-JSON增强功能即将在ai_parse_document中提供,因此任何解析的文档都将自动包含其图表值作为结构化文本,而无需更改函数的接口。对于检索,我们建议将其与ai_prep_search配合使用。此功能还将为Genie One提供支持,以改善databricks客户对PDF中图表相关问题的回答。

作者:Amrutha Srivatsav, Ivan Zhou, Jasmine Collins, Michael Bendersky, Adyasha Maharana, Erich Elsen, Xing Chen, Matei Zaharia

即将在ai_parse_document中结合ai_prep_search试用,以构建图表感知的检索和回答流水线

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存