Google Cloud 把数据技能带进 IDE 和 CLI
DataHot 速览
Google Cloud 的 Data Agent Kit 把查询优化、数据验证、漂移检测、治理和故障排查等能力封装为可复用技能,并通过 MCP 连接 BigQuery、AlloyDB 和 Cloud Storage,让开发者在 VS Code、Claude Code、Codex、Gemini CLI 等工作环境里完成数据任务。
为什么值得关注:它展现了 Data Agent 的另一条产品路线。团队没有另造一个封闭聊天应用,而是把数据能力拆成可组合的技能与工具,嵌入开发者已有工作流。
本文目录 12 节
译文
AI 逐段翻译数据分析
代理开发的未来:利用数据代理工具包重新定义数据从业者生命周期
2026年5月19日
Brahm Kohli
数据云集团产品经理
Dinesh Chandnani
数据云工程总监
立即试用Gemini Enterprise
工作场所AI的前门
现代软件开发格局不仅仅发生在一个表面上——它正在整个代理工具生态系统中展开。代理正在以前所未有的规模开发,这些代理需要直接访问企业数据以获取上下文和基础支撑。
然而,当前用于构建代理和管理数据的工具极其分散。这可能导致难以访问数据,增加安全风险,并造成断裂的开发体验,从而阻碍创新。
为应对这一挑战,我们最近推出了数据代理工具包,这是一个统一的、开源的集合,包含数据工程和数据科学技能与工具,可直接集成到从业者已使用的环境中,如VS Code、Claude Code、Codex、Gemini CLI和Antigravity CLI。通过将这些核心工具和技能与企业数据无缝结合,数据代理工具包有效充当代理上下文、记忆和个性化的综合框架。它提供:
- 代理技能: 与数据资产交互的预编码路径,涵盖查询优化、机器学习最佳实践、数据验证、数据漂移检查、治理和故障排除。
- 模型上下文协议(MCP)工具: 在代理工作流与云数据平台(如BigQuery、AlloyDB和Google Cloud Storage)之间的安全连接。开发者现在可以为其云数据集和数据引擎配置连接参数,而无需管理复杂的手动管道代码。
- 插件和扩展: 原生IDE集成,实现丰富、上下文感知的开发者交互。
这些数据代理工具包的能力共同帮助数据从业者从手动编写代码转向基于意图的数据科学和工程:定义期望的业务结果、约束和成功标准,并让AI增强系统来规划如何执行。这种转变至关重要,因为如今在构建导航复杂数据架构的代理应用时,常常存在“上下文窗口税”,即开发者必须手动将大量模式元数据粘贴到提示中,消耗令牌限制并增加延迟。同时,数据从业者通常缺乏关于如何高效查询、优化和排解云数据问题的指导,而专业化的、分散的开发环境无法看到整个数据资产。数据代理工具包帮助解决这些和其他挑战,提供数据从业者在新型代理工作方式中所需的基础能力。
继续阅读以了解数据代理工具包的功能和优势、如何安装它并将本地环境连接到数据资产,以及一个基于意图的工程示例。
统一的数据资产和生命周期中心
数据代理工具包使整个数据资产在单一视图中可用。这不仅仅是提供像BigQuery、AlloyDB和Spanner等数据库的简单目录;而是将数据工程和科学任务、编排管道和作业集成到单一界面中。这允许从业者管理整个数据工作流——从发现到生产——无需切换上下文。数据代理工具包的智能路由自动为任务选择最优计算引擎——无论是BigQuery用于SQL原生分析和ELT,还是Spark用于自定义Python转换和分布式机器学习训练。
统一的数据资产和生命周期中心
生态驱动的智能:编码化的代理技能
数据代理工具包提供基于Google Cloud数据工程和科学专业知识的预定义代理技能库(例如,机器学习最佳实践、ELT、构建数据应用程序)。它不依赖通用LLM提示,而是将规范性指南编码到工作流中。这允许您直接将企业级数据智能注入到IDE或CLI中。
浏览预定义的代理数据工程和科学技能列表
通过自然语言转变数据探索
基于这一统一数据,数据代理工具包在工作空间内直接提供原生对话式分析,使探索数据变得容易。由我们第一方代理中的Gemini自然语言到SQL技术驱动(例如,在BigQuery中的对话式BigQuery和Looker),数据代理工具包让您通过自然语言查询来剖析、搜索和可视化数据集。
在数据代理工具包中,您可以使用对话式分析来探索数据
实用演练:统一数据并构建模型
要了解数据代理工具包的技能和MCP工具如何协同工作,考虑一个金融服务场景:您的公司面临欺诈索赔上升。您的交易数据存储在Cloud Storage中,您需要构建高置信度的欺诈检测模型并调度编排管道。传统上,这涉及在多个控制台花费数小时进行数据整理。使用数据代理工具包,您可以在几分钟内直接在IDE或CLI中完成。让我们看看如何操作。
入门:一键设置
您可以通过集成的设置流程在一分钟内开始使用数据代理工具包。
为此,请在您的 IDE 市场(VS Code)中搜索“Google Cloud Data Agent Kit”,或通过下方“立即开始”部分的链接在您的 CLI(Gemini、Antigravity、Claude、Codex)中通过 GitHub 仓库获取。Data Agent Kit 会自动配置依赖项并检查您的 Google Cloud 登录状态。
点击活动栏中的 Google Cloud 图标,通过 IAM 进行身份验证。登录后,您的 Cloud Storage、数据库和目录资产会立即出现在您的工作区中。
使用“设置”菜单设置项目 ID、区域,并验证 MCP 状态,确保所有后端服务都已授权。Data Agent Kit 还包含一份关于使用工具和技能的快速入门指南。
一个意图驱动的数据工程示例
安装 Data Agent Kit 后,您可以跳过手动的 ETL 样板代码,直接用自然语言向您的编码助手(例如 Claude Code、GitHub Copilot)描述您的高层次目标。该助手利用 Data Agent Kit 的技能来规划并执行工作流。
提示:
我有原始交易日志落在GCS 存储桶 gs://fin-clearing-raw/ 中。
首先,创建一个 Spark 笔记本并(1)摄取这些日志到 BigQuery 中的Iceberg 表。
其次,创建一个 dbt 项目来(2)去重它们,(3)删除具有无效交易 ID 的交易并将它们存储在单独的 Iceberg 表中,(4)标准化时间戳并执行任何其他必要的清理任务(5)将输出同步到另一个 Iceberg 表(6)将此输出表与包含付款人和收款人身份的表连接,并将输出写入最终的 Iceberg 表。
第三,我希望您使用笔记本在 Spark 上训练一个 ML 模型来检测输出表中的欺诈性交易。我在考虑 LightGBM 模型,但如果您有任何建议,我也乐于接受。请使用项目中相关的数据集。
最后,使用 Spark 笔记本创建一个推理步骤添加到上述管道中,以执行批量推理并将标记的交易写入 Spanner 表。
创建一个编排管道,先运行摄取,然后运行 dbt,接着运行推理笔记本。
幕后:数据管道步骤
在后台,Data Agent Kit 规划了从探索到推理的整个数据生命周期的稳健的多步骤编排。
步骤 1:笔记本创建、摄取和初始存储
找到您的青铜数据——原始、未过滤的金融交易数据——并在进行转换之前将其导入 Iceberg 表。
- 自动创建一个笔记本以从 Cloud Storage 摄取原始日志。
- 编写必要的SQL,并将摄取的数据存储到 BigQuery 中的Iceberg 表。
摄取到青铜表
步骤 2:转换(dbt 项目)
现在,将青铜数据清理为银级和金级表:
- 数据准备:去重 交易日志。
- 过滤无效 ID:识别具有无效 ID 的交易并将它们存储在单独的 Iceberg 表中。
- 清理和标准化:标准化时间戳并执行其他必要的清理任务。
- 同步:利用 BigQuery MCP 服务器将清理后的数据输出到另一个 Iceberg 表。
- 丰富:将清理后的表与付款人和收款人身份表连接。
- 最终输出:将连接后的数据集写入最终的 Iceberg 表。
数据转换以创建银级和金级表
步骤 3:机器学习和推理
金级表完成后,是时候进行一些数据科学工作了:模型训练和推理。在这里,代理将上一步的干净数据交给模型,以发现欺诈模式。
- 训练:使用 Spark 笔记本训练一个 ML 模型。
- 推理:创建一个 Spark 笔记本推理步骤用于批处理。
- 存储:利用 Spanner MCP 将所有标记的欺诈交易写入 Spanner 表。
机器学习和推理
步骤 4:编排和执行
最后,您准备进入生产环境并调度整个编排管道:摄取 -> 转换 -> 推理。
编排管道和调度运行
当事情出错时:代理事件管理和智能恢复
如果编排管道失败,不必担心,Data Agent Kit 利用其智能事件管理能力简化解决过程:
- 智能诊断:自动进行根因分析以确定失败源
- 自主修复:起草并测试修复方案,免去手动调试
- 自动恢复:通过自动化 Git 工作流验证和部署修复
问题诊断和修复
就这样:您从原始发现到完全自动化的欺诈检测机器,只需几分钟,所有这些都在同一个用户体验中完成。无需在多个浏览器标签页、IDE 界面之间切换,也无需学习数据工程和数据科学最佳实践——Data Agent Kit 利用各种 MCP 工具和编码技能编排了一个干净的端到端流程。最终,这种方法帮助您实现最重要的事情:大规模交付创新、高性能的数据应用程序。
立即开始
Data Agent Kit 目前提供预览版。从在您喜欢的 IDE 或 CLI 中安装开始:
然后访问文档了解更多并开始使用。
发布在
补充来源
1 个信源 · 1 篇报道这篇内容对你有用吗?
反馈只用于改善内容筛选,不等同于收藏