返回
RSS Databricks Blog AI 逐段翻译 发布 2026-08-25 01:01

本地IDE直连Databricks:运行调试扩展工作负载

DataHot 速览

Databricks 推出新的 SSH 隧道功能,让开发者可直接从 VS Code、Cursor 或终端连接 Serverless、AI Runtime 及专用集群,交互式运行和调试 Python/SQL 工作负载。此前非 Spark 工作负载的远程运行和依赖同步存在痛点,现在通过 CLI 或 IDE 扩展即可一键启动 SSH 隧道,并支持 Cursor、Copilot 和 Claude Code 等编码代理获得完整工作区上下文。

为什么值得关注:数据从业者应关注这一更新,它显著降低了本地 IDE 与 Databricks 远程计算之间的开发摩擦,有助于提升大规模数据管道和机器学习模型的开发调试效率。

译文

AI 逐段翻译

Databricks 工作区专为数据分析和数据工程而构建。但是,您可能更倾向于使用本地 IDE 和 CLI,以便利用自己的工具和编码代理,如 Cursor、Copilot 和 Claude Code。在开发复杂的、大规模的数据管道或机器学习模型时尤其如此。

到目前为止,用于 Visual Studio 和 Cursor 的 Databricks 扩展Databricks Connect支持使用 Databricks 计算进行本地 Spark 开发。但在远程运行非 Spark 工作负载以及使依赖项与 Databricks Runtime 保持同步方面仍然存在常见的痛点。

我们现在正在弥合这些差距。随着我们对 IDE 体验的最新更新,您现在可以直接将 VS Code、Cursor 或终端连接到 Databricks 计算。在真实的集群基础设施上运行、调试和扩展 Python 和 SQL 工作负载,同时保留 IDE 的所有人体工程学特性。

无妥协的远程执行

使用我们新的SSH 隧道(参见文档),您可以将本地编辑器或 CLI 连接到 Serverless、AI Runtime 和专用集群:

  • 交互式地运行和调试来自 VS Code、Cursor 或 CLI 的工作区文件和笔记本。展开
  • 在 IDE 和工作区之间使用相同的环境,您的依赖项和文件始终与 Databricks Runtime 和工作区同步。展开
  • 利用编码代理在 SSH 隧道中,以便它们拥有完整的工作区上下文并更有效地使用 Databricks。Cursor 和 Copilot 开箱即用,而其他代理如 Claude Code 可以在 SSH 隧道运行时安装。展开

入门很简单。您可以使用单个命令连接到 SSH 隧道:Databricks CLI

  • databricks ssh connect 连接到 serverless。
  • databricks ssh connect --accelerator <GPU_type> 连接到 AI Runtime,其中 GPU 类型可以是 (GPU_1xA10 或 GPU_8xH100)。
  • databricks ssh connect --cluster <cluster_id> 连接到专用集群。

您还可以在 IDE 中启动 SSH 隧道,方法是将--ide vscode--ide cursor作为附加标志。

或者,您可以直接从最新版本的 IDE 扩展启动 SSH 隧道

启动 SSH 隧道

我们还包含了其他功能,使 CLI 和 IDE 更容易作为您的主要工作场所:

  • 管理项目依赖项(文档): 指定一个工作区基础环境,使用--base-environment标志启动 SSH 隧道,并预装 Python 依赖项。参见
  • 监控使用情况和成本(文档): 附加一个serverless 使用策略,使用--usage-policy-id标志来跟踪 SSH 隧道的成本,按用户、团队或项目。
  • 在 IDE 中使用 Unity Catalog 浏览您的数据资产(文档): 浏览目录、架构和所有数据资产,而无需在开发流程中切换到工作区。

展开

有关连接到 SSH 隧道的详细信息,请参阅文档此处

接下来做什么

  • Unity AI Gateway将自动为 SSH 隧道用户配置,以便您可以管理对每个代理、工具、模型和 MCP 的访问和支出。
  • 现有的IDE 扩展将集成到 SSH 隧道中,以便您可以从 IDE 中的用户界面部署和管理声明式自动化包
  • 非 Python 依赖项和自定义 Docker 镜像将在 SSH 隧道启动时可配置,以便您完全掌控您的环境。

结论

借助这些功能,您可以在偏好的任何环境中进行开发,同时处于数据和 ML 工程的前沿。将您的 IDE 和代理指向 Databricks,针对真实计算运行和调试,并保持快速的开发循环。

了解更多 + 后续步骤

要开始使用博客中展示的开发工具,请参阅以下文档:

  • “SSH 隧道” (AWS | Azure | GCP) 连接到 Databricks 计算,从 IDE 或 CLI 交互式运行 Python 和 SQL 工作负载,同时确保所有代码和数据在 Databricks 工作区内保持安全。
  • “IDE 扩展” (AWS | Azure | GCP) 使用本地文件,并使用 IDE 中的用户界面定义、部署和运行声明式自动化包。
  • “Databricks Connect” (AWS | Azure | GCP) 将您的本地开发环境连接到 Databricks 计算,以远程运行 Spark 工作负载。
  • “Unity AI Gateway” (AWS | Azure | GCP) 控制团队可以使用的 AI 服务,路由和管理 AI 流量,设置护栏,并从单一控制平面监控使用情况。

要了解哪些工具最适合您的需求,请参阅从您的 IDE 连接

这篇内容对你有用吗?

反馈只用于改善内容筛选,不等同于收藏

分享这条资讯
分享海报
保存图片
iOS 也可以长按图片保存