返回
RSS InfoQ (AI/数据工程) AI 逐段翻译 发布 2026-09-16 22:42 收录于 09-19

Dropbox 将 Riviera 升级为通用内容处理平台,支撑 AI 负载

DataHot 速览

Dropbox 把内部文件预览服务 Riviera 演进为通用内容处理平台,支持 300 多种文件格式和 100 多项转换能力,每秒处理数十万次转换。平台采用可组合转换管线,将编排与执行分离,通过插件模型扩展新能力。Riviera 现已服务 Search、Replay、Sign、Dash 等产品,AI 负载可直接复用此前为预览构建的处理基础设施。该平台此前日均处理约 25 亿次请求、接近 1EB 数据,并利用缓存中间结果供多个 AI 操作复用。

为什么值得关注:这是数据基础设施与 AI 负载结合的典型第一方工程实践,展示了内容处理管线、转换复用与缓存设计如何支撑 AI 搜索与问答,对数据平台与 AI 应用架构从业者有参考价值。

译文

AI 逐段翻译

Dropbox 已将 Riviera 从一个文件预览服务发展为一个通用内容处理平台,支持 300 多种文件格式和 100 多项转换能力。该平台现在每秒执行数十万次转换,并支持 Search、Replay、Sign 和 Dash,使 AI 工作负载能够复用为早期产品开发的内容处理基础设施。

Riviera 最初是一个内部服务,用于为 Dropbox 的各种文件格式生成预览。工程师们没有为单独的格式和输出创建单独的处理服务,而是将内容处理分解为可复用的转换。例如,PowerPoint 预览可以通过将演示文稿转换为 PDF,再将 PDF 页面转换为图像来生成。这些转换随后可以组合成其他处理流水线。

Riviera 的可组合转换流水线(来源:Dropbox 博客文章

该架构将编排与执行分离。一个中央组件负责验证请求、组合转换流水线、将工作分派给后端工作器并管理缓存。各个工作器实现特定的转换能力,而插件模型允许在不更改核心编排层的情况下添加新能力。

Riviera 在 Dropbox 产品和核心界面中的集成(来源:Dropbox 博客文章

在最近这次扩展之前,Riviera 就已经被用于 AI 处理。Dropbox 此前曾描述过通过链式转换将内容转换为文本和嵌入,以用于 AI 驱动的摘要和问答。当时,该平台支持大约 300 种文件类型,每天处理约 25 亿次请求,代表近 1 EB 的数据。缓存的中间结果使多个 AI 操作能够复用先前生成的内容。

Dash 引入了额外的内容准备需求,因为其搜索和 AI 能力会处理来自 Dropbox 和已连接服务的内容。Riviera 提供转换,在建立索引之前提取和规范化这些内容,使 Dash 能够使用现有的处理流水线。

Dropbox 还通过公共 API开放了 Riviera 的能力。开发者文档描述了用于将文档转换为 Markdown、转录音频和视频以及提取结构化元数据的异步端点。Markdown API 支持索引、渲染以及将文档作为大语言模型输入等应用。应用程序提交作业并使用异步作业标识符进行轮询,完成和失败状态会分别返回。

该平台也正在出现在外部开发者工具中。一位开发者在 Dropbox 社区发布了 conductor-dropbox,这是一个面向 Conductor OSS Orkes 的开源集成,其中包含用于文档和 RAG 工作流的异步 Riviera Markdown 提取。该项目将 Dropbox 操作与工作流编排相结合,用于文档和 AI 处理。

Riviera 不同于 Apache Tika 等通用提取框架,后者提供 API 用于从广泛的文件格式中检测、解析和提取文本及元数据。Riviera 将转换插件与流水线组合、异步执行、缓存和集中式编排结合在一起。 Apache TikaRiviera 不同于 Apache Tika 等通用提取框架,后者提供 API 用于从广泛的文件格式中检测、解析和提取文本及元数据。Riviera 将转换插件与流水线组合、异步执行、缓存和集中式编排结合在一起。

Dropbox 现在通过 API 开放选定的 Riviera 能力,同时继续在文档、多媒体、搜索和 AI 工作负载中使用该平台。外部的 Conductor 集成提供了一个示例,说明 Riviera 的内容提取能力正被纳入更广泛的工作流编排系统。

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存