Configura tu proyecto Databricks

La extensión IDE de Databricks ofrece una vista de Configuración dentro de la extensión que te permite configurar y actualizar fácilmente la configuración de tu proyecto Databricks. Estas características incluyen la configuración local de carpetas, la instalación de herramientas de IA, un selector de despliegue para el espacio de trabajo objetivo, la configuración sencilla de autenticación y cálculo, la sincronización de carpetas del espacio de trabajo y pasos sencillos para activar el entorno virtual Python necesario para la depuración.

La vista de Configuración dentro de la extensión del IDE Databricks está disponible una vez que has creado o migrado un proyecto a un proyecto Databricks. Vea Creación de un proyecto de Databricks.

Nota:

Las versiones anteriores de la extensión IDE Databricks definían la configuración en un archivo JSON del proyecto y las variables de entorno se establecían en el terminal. En la versión de lanzamiento, la configuración del proyecto y del entorno se encuentra en los archivos databricks.yml y databricks.env.

Si el proyecto es un conjunto de recursos de Databricks, la interfaz de usuario de extensión de Databricks también proporciona un Explorador de recursos de agrupación y una vista Variables de agrupación para administrar los recursos y las variables de la agrupación. Consulta Bundle y funciones del explorador.

Establecer la carpeta local

Para seleccionar una carpeta local diferente para tu proyecto Databricks, haz clic en el icono de engranaje asociado a la entrada de Carpeta Local en la vista de configuración .

Instala y utiliza herramientas de IA

Importante

Esta característica se encuentra en su versión beta.

La sección de herramientas de IA de la vista de Configuración te permite instalar herramientas de IA para que tus agentes de codificación funcionen eficazmente con Azure Databricks. La extensión verifica si las herramientas de IA están instaladas en el ámbito global o del proyecto, incluyendo las instalaciones que realizaste a través de la CLI de Azure Databricks, y actualiza el estado mostrado. Para más información sobre herramientas de IA, consulta Habilidades de agente para asistentes de codificación con IA y aitools grupo de mando.

Para instalar herramientas de IA:

  1. En la vista de configuración de la extensión, haz clic en Instalar herramientas de IA.
  2. Sigue las indicaciones para seleccionar un alcance y herramientas para completar la instalación.

Cuando se instalan herramientas de IA, aparece un icono verde de robot junto a las herramientas de IA. Las herramientas de IA se actualizan automáticamente a la última versión.

Herramientas de IA de extensiones de Databricks

Para desinstalar herramientas de IA, haz clic derecho en herramientas de IA y selecciona Desinstalar herramientas de IA.

Cambiar el área de trabajo de implementación de destino

Para seleccionar o cambiar el destino de implementación del proyecto de Databricks (por ejemplo, para cambiar de un destino de dev a un destino de prod):

  1. En la vista de Configuración de la extensión Databricks, haz clic en el icono de engranaje (Seleccionar un objetivo de paquete de activos Databricks) asociado a Objetivo.

    Seleccione un destino de agrupación

  2. En la Paleta de comandos, seleccione el destino de implementación deseado.

Una vez configurado un destino, se muestran el host y el modo de implementación. Para obtener información sobre los modos de implementación de paquetes de automatización declarativos, consulte Modos de implementación de paquetes de automatización declarativos.

El host del área de trabajo se puede cambiar modificando la configuración de destino workspace en el archivo de configuración de databricks.yml asociado al proyecto. Consulte destinos.

Nota:

Las siguientes características de extensión del IDE de Databricks solo están disponibles cuando el modo de despliegue objetivo es el desarrollo:

  • Utilice el clúster de desarrollo adjunto para trabajos de lotes
  • Sincronización de archivos de carpeta del área de trabajo
  • Selección de un clúster de desarrollo interactivo

Configuración del perfil de Databricks para el proyecto

Al crear un proyecto de Databricks o convertir un proyecto en un proyecto de Databricks, configuras un perfil que incluye la configuración de autenticación que se utiliza para la conexión a Databricks. Si quiere cambiar el perfil de autenticación usado, haga clic en el icono de engranaje asociado a AuthType en la vista Configuración.

Para más información sobre la autenticación de la extensión IDE de Databricks, consulte Configurar autorización para la extensión IDE de Databricks.

Seleccionar capacidad de cómputo para ejecutar código y procesos

Usando la extensión del IDE de Databricks, puedes seleccionar serverless, seleccionar un clúster de Azure Databricks existente o crear un nuevo clúster de Azure Databricks para ejecutar tu código y trabajos. Una vez que se haya conectado a la computación, se muestran el identificador del clúster, la versión de Databricks Runtime, el creador, el estado y el modo de acceso. También puede iniciar y detener un clúster y navegar directamente a los detalles de la página del clúster.

Sugerencia

Si no desea esperar a que se inicie el clúster de trabajos, compruebe Invalidar clúster de trabajos en lote justo debajo de la selección de clúster para usar el clúster seleccionado para ejecutar trabajos de agrupación en modo de desarrollo. Esto no está disponible si está utilizando computación sin servidor.

Utilizar computación sin servidor

La computación sin servidor es gestionada por Azure Databricks. Al ejecutar cargas de trabajo en proceso sin servidor, Azure Databricks asigna y administra automáticamente los recursos de proceso necesarios.

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

    Configurar computación

  2. En la paleta de comandos, seleccione Sin servidor.

    Selección de proceso sin servidor

Uso de un clúster existente

Si tiene un clúster de Azure Databricks existente que quiere usar, haga lo siguiente:

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

  2. En la Paleta de comandos, seleccione el clúster que quiere usar.

Creación de un clúster

Si no tiene un clúster de Azure Databricks existente, o si quiere crear uno nuevo:

  1. En la vista de configuración , haz clic en Seleccionar calcular o en el icono de engranaje (Configurar cálculo).

  2. En la paleta de comandos, haga clic en Crear nuevo clúster.

  3. Cuando se le pida que abra el sitio web externo (el área de trabajo de Azure Databricks), haga clic en Abrir.

  4. Si se le solicita, inicie sesión en el área de trabajo de Azure Databricks.

  5. Siga las instrucciones para crear un clúster.

    Nota:

    Databricks recomienda crear un clúster de proceso personal. Esto le permite empezar a ejecutar cargas de trabajo inmediatamente, lo que minimiza la sobrecarga de administración de procesos.

  6. Una vez creado el clúster y en ejecución, vuelva a Visual Studio Code.

  7. En la vista de configuración , junto al clúster, haz clic en el icono de engranaje (Configurar computación).

    Icono de configuración del clúster 3

    En la paleta de comandos, haga clic en el clúster que quiere usar.

Sincronización de la carpeta del área de trabajo con Databricks

Puedes sincronizar la carpeta remota del espacio de trabajo Databricks asociada a tu proyecto Databricks haciendo clic en el icono de sincronización (iniciar sincronización) asociado a Carpeta Remota en la vista de configuración de la extensión Databricks.

Nota:

La extensión del IDE de Databricks solo funciona con los directorios de espacios de trabajo que crea. No se puede usar un directorio del área de trabajo existente en el proyecto a menos que la extensión la cree.

Para acceder a la vista del área de trabajo en Databricks, haga clic en el icono de vínculo externo (icono Abrir vínculo externamente) asociado con Carpeta remota.

La extensión determina la carpeta del área de trabajo de Azure Databricks que se va a usar en función de la file_path configuración de agrupación asociada del proyecto.workspace Vea Área de trabajo.

Nota:

La extensión IDE de Databricks solo realiza la sincronización automática y unidireccional de los cambios de archivo desde tu proyecto local de Visual Studio Code hacia la carpeta de espacio de trabajo relacionada en tu espacio de trabajo remoto de Azure Databricks. Los archivos de este directorio del área de trabajo remota están diseñados para ser transitorios. No inicie los cambios en estos archivos desde el área de trabajo remota, ya que estos cambios no se sincronizarán con el proyecto local.

Para detalles de uso sobre la función de sincronización de directorios de espacios de trabajo para versiones anteriores de la extensión IDE Databricks, consulte Seleccionar un directorio de espacio de trabajo para la extensión IDE Databricks.

Inicia un túnel SSH

Importante

Esta característica se encuentra en su versión beta.

Puedes iniciar un túnel SSH desde la extensión IDE de Databricks para abrir una sesión de desarrollo remota en Azure Databricks compute. Esto te permite editar archivos y ejecutar código directamente sobre computación remota desde Visual Studio Code.

  1. Para iniciar un túnel SSH, haz clic en el botón Iniciar túnel SSH en la vista del túnel SSH en la extensión.

  2. A continuación, selecciona computación clásica o sin servidor para conectarte:

    • Clúster: El selector de clúster solo muestra clústeres que usan modo de acceso dedicado (de un solo usuario). Si ya tienes seleccionado un clúster de usuario único en tu sesión local de Visual Studio Code, ese clúster está preseleccionado para la conexión SSH.
    • Serverless: Si no seleccionas un clúster, el túnel se conecta por defecto a la computación serverless.

Cuando inicias un túnel, se abre una nueva instancia de Visual Studio Code en el mismo IDE que estás usando actualmente. La sesión remota abre tu carpeta de inicio (users/username@databricks.com) por defecto y muestra automáticamente el archivo específico que estabas editando activamente. La autenticación está preconfigurada, así que no necesitas iniciar sesión de nuevo para conectarte a la sesión remota.

Configuración del entorno de Python y Databricks Connect

La sección Entorno de Python de la vista de la Configuración permite configurar fácilmente el entorno de desarrollo virtual de Python y la instalación de Databricks Connect para ejecutar y depurar código y celdas de cuaderno. Los entornos virtuales de Python se aseguran de que el proyecto usa versiones compatibles de paquetes de Python y Python (en este caso, el paquete Databricks Connect).

Para configurar el entorno virtual de Python para tu proyecto, en la vista de Configuración de la extensión:

  1. Haga clic en el elemento rojo Activar entorno virtual en Entorno de Python.
  2. En la Paleta de comandos, seleccione Venv o Conda.
  3. Seleccione las dependencias que quiere instalar, en caso de que corresponda.

Para cambiar los entornos, haga clic en el icono de engranaje (Cambiar entorno virtual) asociado al Entorno activo.

Para información sobre la instalación de Databricks Connect, que permite ejecutar y depurar código y cuadernos dentro de Visual Studio Code, consulta Depurar código usando Databricks Connect para la extensión del IDE Databricks.