Google Cloud Dataflow 新增大规模AI工作负载功能
DataHot 速览
Google Cloud 宣布 Dataflow 面向大规模 AI 工作负载的新功能:Dataflow 批处理作业的 Pause/Resume 正式可用,并支持由 NVIDIA RTX PRO 6000 Blackwell Server Edition GPU 驱动的 G4 VM。Pause/Resume 可让失败的长时批处理作业从中断处恢复,而不是从头重跑,也可按优先级暂停/恢复作业以动态重分配 GPU/TPU 等加速资源。G4 VM 支持为训练、评估和推理等场景提供额外推理算力。Google Cloud 称这些能力可提升计算效率、开发效率和成本优化。
为什么值得关注:Dataflow 是 Google Cloud 数据与 AI 管线的重要组件;此次更新涉及长时批处理容错恢复、资源动态调度和 GPU 算力接入,直接影响 AI 数据准备/推理管线的成本与可靠性,值得数据平台与数据工程团队关注。
译文
AI 逐段翻译Efesa Origbo
产品经理,Google Cloud
Danny McCormick
软件工程师,Google Cloud
立即试用 Gemini Enterprise
工作场所中 AI 的前门
概述 随着企业扩展其 AI 和代理工作流,他们需要无服务器平台,使模型训练、评估和推理的数据准备变得轻松高效。 Dataflow 是 Google Cloud AI 技术栈的关键组件。它使我们的客户能够创建批处理和流式管道,支持各种分析和 AI 用例。
今天,我们为 Dataflow 带来了重大增强,直接解决您的首要挑战:为长时间运行的批处理作业最大化计算效率,并为您最苛刻的 AI 工作负载提供额外的推理能力。我们非常高兴地宣布 Dataflow 批处理作业的暂停/恢复功能正式可用,并支持由 NVIDIA RTX PRO 6000 Blackwell 服务器版 GPU 驱动的 G4 虚拟机。借助这些功能,您可以加速 AI 开发生命周期并优化成本。
通过 Dataflow 批处理作业的暂停/恢复功能,回收浪费的计算资源并提高开发人员生产力 Dataflow 客户经常运行大型批处理工作负载,这些工作负载有时会运行几天。当这些作业失败时,Dataflow 用户目前无法访问作业失败前已处理的数据。相反,他们必须重试整个作业,导致计算资源浪费和工程生产力下降。
除了应对大型作业的失败之外,拥有 AI 工作负载的 Dataflow 客户有时希望通过将加速计算资源(如 GPU 和 TPU)从已运行的、优先级较低的 Dataflow 批处理作业动态重新分配到更高优先级的工作负载(如特征工程和 AI 推理),来提高这些资源的利用率。
为了更好地支持这些用例,我们宣布 Dataflow 批处理作业的暂停/恢复功能正式发布。该功能由 Google 内部创新驱动,使 Dataflow 客户能够恢复其失败的长时运行作业,而不是从头开始。它还允许客户根据各自的业务需求暂停和恢复其 Dataflow 批处理作业。
有关更多详细信息,请参阅 手动暂停 Dataflow 作业。
使用 NVIDIA RTX PRO 6000 GPU 加速 AI 推理工作负载 虽然 Dataflow 已支持多种 GPU 和 TPU 来加速 AI 推理工作负载,但我们更进一步,宣布支持由 NVIDIA RTX PRO 6000 Blackwell GPU 驱动的 G4 虚拟机。
与 NVIDIA L4 GPU 相比,NVIDIA RTX PRO 6000 Blackwell GPU 带来了显著的性能提升,提供 96GB vGPU 显存和 1.6 TB/s 的带宽。这意味着您可以在 Dataflow 作业中直接使用高达 700 亿以上参数的模型执行 AI 推理。您可以在继续利用 Dataflow 原生 ML 功能(如 RunInference、 right fitting 和 GPU 启用的自动扩缩容)的同时做到这一点,这些功能让您可以轻松上手并扩展 AI 推理作业,而无需管理底层基础设施或手动处理调优和自动扩缩容等难题。
采取下一步 暂停/恢复和 RTX PRO 6000 Blackwell GPU 共同帮助您在运行苛刻的 AI 工作负载时优化批处理作业成本。我们对 Dataflow 的能力以及它们为客户带来的可能性感到无比兴奋。 立即开始使用 Dataflow,并使用这些功能解决您最艰难的 AI 挑战。我们迫不及待地想看到您构建的成果。
发布于
这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏