配置您的Databricks项目

Databricks IDE 扩展在扩展内提供了一个 配置 视图,方便你轻松配置和更新 Databricks 项目的设置。 这些功能包括本地文件夹设置、AI工具安装、目标工作区部署选择器、便捷的认证和计算配置、工作区文件夹同步,以及激活调试所需的Python虚拟环境的简单步骤。

只有在 Databricks IDE 扩展中创建项目或将项目迁移为 Databricks 项目后,才能使用 配置 视图。 请参阅创建新的 Databricks 项目

注意

早期版本的 Databricks IDE 扩展在项目 JSON 文件中定义配置设置,环境变量则在终端中设置。 在发布版本中,项目和环境配置位于 databricks.ymldatabricks.env 文件中。

如果项目是 Databricks 资产捆绑包,则 Databricks 扩展 UI 提供捆绑包资源浏览器捆绑包变量视图来管理捆绑包资源和变量。 请参见 打包和浏览器功能

设置本地文件夹

要为你的 Databricks 项目选择不同的本地文件夹,请在配置视图中点击与本地文件夹条目关联的齿轮图标。

安装并使用 AI 工具

Important

此功能在 Beta 版中。

配置视图中的 AI 工具部分允许您安装 AI 工具,使编码代理能有效使用 Azure Databricks。 该扩展会检查 AI 工具是在全局还是项目范围内安装,包括你通过 Azure Databricks CLI 完成的安装,并更新显示状态。 有关AI工具的更多信息,请参见 AI编码助理aitools 指令组的代理技能。

安装AI工具:

  1. 在扩展的 配置 视图中,点击 安装 AI 工具
  2. 按照提示选择安装范围和工具,以完成安装。

安装AI工具后,AI 工具旁边会出现绿色机器人图标。 AI工具会自动更新到最新版本。

Databricks 扩展 AI 工具

要卸载AI工具,右键点击 AI工具 并选择 卸载AI工具

更改目标部署工作区

若要选择或切换 Databricks 项目的部署目标(例如,要从 dev 目标切换到 prod 目标):

  1. 在 Databricks 扩展的配置视图中,单击与目标相关联的齿轮图标(选择 Databricks 资产包目标)。

    选择软件包目标

  2. “命令面板”中,选择所需的部署目标。

配置目标后,将显示“主机”和“部署模式”。 有关声明性自动化捆绑包部署模式的信息,请参阅 声明性自动化捆绑包部署模式

可以通过修改与项目关联的 workspace 配置文件中的目标 databricks.yml 设置来更改工作区主机。 请参阅目标

注意

以下 Databricks IDE 扩展功能仅在目标部署模式为开发时可用:

  • 使用附加的开发集群进行捆绑作业
  • 同步工作区文件夹文件
  • 选择交互式开发群集

为项目配置 Databricks 配置文件

创建 Databricks 项目或 项目转换为 Databricks 项目时,您会配置一个包含连接 Databricks 所需身份验证设置的配置文件。 如果要更改使用的身份验证配置文件,请单击“配置”视图中与 AuthType 关联的齿轮图标。

有关Databricks IDE扩展认证的更多信息,请参见 “设置Databricks IDE扩展的授权”。

选择用于运行代码和作业的计算资源

通过 Databricks IDE 扩展,你可以选择无服务器、选择现有的 Azure Databricks 集群,或创建一个新的 Azure Databricks 集群来运行代码和作业。 连接到计算后,会显示群集的 ID、Databricks Runtime 版本、创建者、状态和访问模式。 还可以启动和停止群集,并直接导航到群集的页面详细信息。

提示

如果不想等待作业群集启动,请在群集选择的正下方检查 “替代作业”群集 ,以使用所选群集在开发模式下运行捆绑作业。 如果使用无服务器计算,则此功能不可用。

使用无服务器

无服务器计算由 Azure Databricks 管理。 在无服务器计算上运行工作负荷时,Azure Databricks 会自动分配和管理必要的计算资源。

  1. 配置 视图中,点击 选择计算 或齿轮(配置计算)图标。

    配置计算资源

  2. 命令面板中,选择“ 无服务器”。

    无服务器计算选择

使用现有群集

如果您有现有的 Azure Databricks 集群要使用:

  1. 配置 视图中,点击 选择计算 或齿轮(配置计算)图标。

  2. 在“命令面板”中,选择要使用的群集。

创建新群集

如果没有现有的 Azure Databricks 群集,或者想要创建一个新群集:

  1. 配置 视图中,点击 选择计算 或齿轮(配置计算)图标。

  2. 在“命令面板”中,单击“创建新群集”。

  3. 当系统提示打开外部网站(你的 Azure Databricks 工作区)时,请单击“打开”。

  4. 根据提示登录到你的 Azure Databricks 工作区。

  5. 按照说明创建群集

    注意

    Databricks 建议创建个人计算群集。 这样就可以立即开始运行工作负载,并最大程度地减少计算管理开销。

  6. 创建并运行群集后,返回 Visual Studio Code。

  7. 配置 视图中,单击集群旁边的齿轮(配置计算资源)图标。

    配置群集图标 3

    在“命令面板”中单击要使用的群集。

将工作区文件夹与 Databricks 同步

你可以通过在 Databricks 扩展配置视图中的“远程文件夹”中点击与 Remote 文件夹关联的同步图标(开始同步)来同步与 Databricks 项目关联的远程 Databricks 工作区文件夹。

注意

Databricks IDE 扩展仅适用于由其创建的工作区目录。 您不能在项目中使用现有的工作区目录,除非该目录由扩展创建。

若要导航到 Databricks 中的工作区视图,请单击与远程文件夹关联的外部链接图标(在外部打开链接)图标。

该扩展根据 file_path 项目关联捆绑配置映射中的 workspace 设置确定要使用的 Azure Databricks 工作区文件夹。 请参阅工作区

注意

Databricks IDE 扩展仅支持将文件更改从本地 Visual Studio Code 项目自动单向同步到远程 Azure Databricks 工作区中的对应工作区文件夹。 此远程工作区目录中的文件是临时文件。 不要从远程工作区内部对这些文件启动更改,因为这些更改不会同步回本地项目。

有关早期版本Databricks IDE扩展工作区目录同步功能的使用详情,请参见“ 选择Databricks IDE扩展的工作区目录”。

启动SSH隧道

Important

此功能在 Beta 版中。

你可以从 Databricks IDE 扩展启动 SSH 隧道,在 Azure Databricks 计算上开启远程开发会话。 这允许你在 Visual Studio Code 内部编辑文件并直接对远程计算运行代码。

  1. 要启动 SSH 隧道,请在扩展中的 SSH 隧道视图中点击“Start SSH Tunnel”按钮。

  2. 接下来,选择要连接到的经典计算或无服务器计算:

    • 集群:集群选择器只显示使用专用(单用户)访问模式的集群。 如果你已经在本地 Visual Studio Code 会话中选中了一个单用户集群,那么该集群会被预先选中用于 SSH 连接。
    • 无服务器:如果你没有选择集群,隧道默认连接到无服务器计算。

当你启动隧道时,会在你当前使用的同一个 IDE 中打开一个新的 Visual Studio Code 实例。 远程会话默认会打开你的主文件夹(users/username@databricks.com),并自动显示你正在编辑的特定文件。 认证是预先配置好的,所以你无需再次登录即可连接远程会话。

设置 Python 环境和 Databricks Connect

“配置”视图的“Python 环境”部分可轻松设置 Python 虚拟开发环境和 Databricks Connect 的安装,以便运行和调试代码和笔记本单元格。 Python虚拟环境确保你的项目使用兼容的Python和Python包版本。

该扩展使用集群的 Databricks 运行时版本或无服务器环境版本,构建一个本地扩展.venv,其 Python 版本和包集与运行时相匹配。 这样可以避免常见的问题:代码本地运行,但在 Azure Databricks 上因 Python 或包版本差异而失败。

自动化设置需要 UV 来创建和管理虚拟环境。 开始安装时,如果尚未安装 uv,扩展会自动安装它。 如果无法自动安装UV,设置会停止并提示你手动 安装UV ,然后再试一次。

要自动配置你的项目的 Python 虚拟环境,请在扩展的配置视图中:

  1. 点击红色的设置 Python 环境
  2. 命令面板中,选择要匹配的计算资源

对于现有项目,设置会将其更改合并到你的 pyproject.toml 中,并写入一个 pyproject.toml.bak 备份,以便你可以查看或回退这些更改。 如果你之后切换了计算资源,扩展会检测到这种偏差,并建议重新运行设置,以匹配新的运行时环境。

或者,你也可以使用 Databricks CLI databricks environments setup-local 命令 来设置本地环境。 这需要在你的 PATH 上安装 uv。

databricks environments setup-local --serverless-version 5

对于已使用 pip、Poetry 或 conda 的项目,该扩展会显示一个分步的 Python 环境检查清单,而非自动 uv 配置。 你也可以通过切换当前活动环境,让该扩展使用现有的 Python 解释器。

若要更改环境,请单击与“活动环境”关联的齿轮图标(“更改虚拟环境”)。

关于使用 Databricks Connect 运行和调试代码及笔记本的信息,请参见 Databricks Connect 的 IDE 扩展中的“使用 Databricks Connect 调试代码”。