Gestionar dependencias utilizando entornos

Important

Esta característica se encuentra en su versión beta. Los administradores de la cuenta pueden controlar el acceso a esta función desde la página Versiones preliminares de la consola de la cuenta mediante el conmutador Entornos para Cómputo estándar. Consulte Administrar versiones preliminares de Azure Databricks.

En la computación clásica, el modo de dependencia Entornos permite gestionar dependencias a nivel de carga de trabajo usando entornos base en lugar de instalar bibliotecas con alcance computacional. Este es el mismo modelo que usa la informática sin servidor.

La configuración del entorno permanece aislada de los cambios en la capa de proceso, por lo que las cargas de trabajo no dejan de funcionar cuando cambia la capa de proceso subyacente. Y como Azure Databricks almacena en caché los entornos base, las dependencias no se resuelven ni se instalan al iniciar, por lo que el cómputo comienza más rápido y evita fallos por resolución de paquetes, disponibilidad de repositorios o fiabilidad de red.

Después de conectarte a una instancia de proceso que usa el modo de dependencias Environments, puedes seleccionar un entorno base y añadir dependencias desde el panel lateral Entorno del cuaderno. Ver Usar entornos en un cuaderno.

Requisitos

La configuración del modo de dependencia solo está disponible en cálculos que cumplan los siguientes requisitos:

  • Databricks Runtime 19 (Beta) o superior
  • Modo de acceso estándar
  • Cómputo multipropósito ejecutado en cuadernos interactivos

Para más detalles de soporte, consulta Limitaciones.

Establecer el modo de dependencia

Para crear un cómputo que utilice el modo de dependencia de Entornos :

  1. En la barra lateral del espacio de trabajo, haz clic en el icono de cálculoCalcular y luego abre la pestaña de computación multipropósito .

  2. Haga clic en Crear proceso.

  3. En Rendimiento, selecciona 19 Beta o superior en el menú desplegable de la versión de Runtime de Databricks.

  4. Amplía la sección Avanzada y luego haz clic en Dependencias.

  5. Para el modo de dependencia, mantén Auto activado para que Azure Databricks resuelva el modo, o haz clic en Manual y selecciona Entornos para configurarlo tú mismo. Consulta Opciones de modo de dependencia.

    La pestaña de Dependencias en la sección Avanzada del formulario de creación de cómputo, con el modo de dependencia en Auto y resolución en Entornos.

  6. Configura el resto del cómputo y luego haz clic en Crear.

Una vez que el cálculo esté en marcha, conecta un cuaderno y configura su entorno tal y como se describe en Entornos de uso en un cuaderno.

Opciones de modo de dependencia

El control del modo de dependencia tiene dos ajustes que determinan cómo se elige el modo:

  • Auto: Azure Databricks resuelve el modo en función de la configuración de cómputo. Auto se resuelve como Entornos, a menos que el entorno de proceso especifique Docker, variables de entorno de Spark o scripts de inicialización, en cuyo caso se resuelve como Bibliotecas de clúster.
  • Manual: seleccionas tú mismo Entornos o bibliotecas del clúster.

Cuando selecciones Manual, elige el modo que se adapte a tus necesidades:

  • Entornos: Gestionar dependencias a nivel de carga de trabajo utilizando entornos base. Las bibliotecas de clúster, Docker, variables de entorno de Spark y scripts de entrada están deshabilitados. Utiliza este modo para una experiencia de dependencia coherente y portátil que se adapte a la computación sin servidor.
  • Bibliotecas de clúster: El comportamiento clásico. Instala dependencias en el cómputo usando bibliotecas de clúster, scripts de init o Docker. Usa este modo si tu carga de trabajo requiere alguno de esos ajustes.

Actualizar un cómputo existente

Si estás editando la configuración para el cómputo existente, el cambio a modo Entornos se bloquea si el cómputo tiene configuraciones incompatibles, como scripts de iniciación, bibliotecas de clúster o Docker. Si eliminas primero los ajustes incompatibles, puedes entonces editar el modo de dependencia.

Si cambias al modo Bibliotecas de Clúster desde el modo Entornos , los cuadernos conectados mantienen sus selecciones de entorno, pero esas selecciones quedan inactivas. Si vuelves a cambiar el cómputo al modo Entornos , esas selecciones vuelven a activarse.

Utiliza entornos en un cuaderno

Para usar entornos en un cuaderno, asocia el cuaderno a un recurso de proceso clásico que use el modo de dependencia Environments. Después de adjuntar el cuaderno, puedes configurar las dependencias del cuaderno desde el panel lateral panelEnvironment, del mismo modo que en el cómputo serverless.

Configurar el entorno de un portátil desde el panel lateral de Entorno en la computación clásica que utiliza el modo de dependencia de Entornos.

Seleccionar un entorno base

Un entorno base determina las bibliotecas preinstaladas y la versión del entorno disponible para tu portátil. El selector de entorno base del panel lateral Entorno es donde elige el entorno. Databricks recomienda usar la versión más reciente para obtener las características del cuaderno más up-to-date. Para ver detalles sobre cada versión del entorno, véase Versiones del entorno.

El selector de entorno base incluye las siguientes opciones:

  • Estándar: el entorno base predeterminado con bibliotecas proporcionadas por Databricks.
  • ML: un entorno base con los paquetes de sistema y Python de Databricks Runtime para Machine Learning preinstalado.
  • Más: expande para mostrar opciones adicionales:
    • Versiones anteriores de entornos Standard y ML.
    • Personalizado: especifique un entorno personalizado mediante un archivo YAML.
  • Entornos de espacio de trabajo: Lista todos los entornos base compatibles configurados para tu espacio de trabajo por los administradores del espacio de trabajo.

Adición de dependencias al cuaderno

Azure Databricks almacena en caché el entorno virtual del cuaderno, por lo que las dependencias no se vuelven a instalar cada vez que vuelva a abrir un cuaderno o reanude después de la inactividad.

Para instalar individualmente una dependencia:

  1. En la sección de Dependencias , introduce la ruta de la dependencia en el campo y luego haz clic en +Añadir dependencia. Puede especificar una dependencia en cualquier formato que sea válido en un archivo requirements.txt. Archivos de rueda de Python o proyectos de Python (por ejemplo, el directorio que contiene un pyproject.toml o un setup.py) se pueden encontrar en archivos del espacio de trabajo o volúmenes de Unity Catalog.

    • Si usa un archivo del área de trabajo, la ruta de acceso debe ser absoluta e iniciar con /Workspace/.
    • Si se utiliza un archivo en un volumen de Unity Catalog, la ruta debe tener el siguiente formato: /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Haga clic en Apply para instalar las dependencias y reiniciar el proceso de Python.

Important

No instales PySpark ni ninguna biblioteca que lo instale como dependencia de tus portátiles. Si lo hace, se detendrá la sesión y se producirá un error. Si esto ocurre, elimina la biblioteca y reinicia el entorno.

Para ver las dependencias instaladas, haz clic en la pestaña Instaladas del panel lateral Entorno. Abra los registros de instalación de pip del entorno del notebook haciendo clic en registros de pip en la parte inferior del panel.

Limitations

El modo de dependencia de Entornos soporta cargas de trabajo y dependencias en Python en cuadernos interactivos. Se presentan las siguientes limitaciones:

  • Las tareas clásicas no usan el modo de dependencia de entornos. Cuando un trabajo se ejecuta en un compute clásico de uso general que especifica el modo Entornos, la configuración se ignora y el trabajo se ejecuta en el modo Bibliotecas de clúster.
  • %scala El código no está soportado y fallará.
  • Se aplican todas las limitaciones estándar del modo de acceso, incluyendo la ausencia de soporte para R. Consulta Requisitos y limitaciones de computación estándar.
  • Actualmente no puedes imponer la configuración del modo de dependencia usando políticas de cómputo.

Configuraciones incompatibles

Cuando el modo de dependencia de Entornos está activado, se desactivan los siguientes ajustes de cálculo:

  • Docker (Azure Databricks Container Services)
  • Variables del entorno Spark
  • Scripts de inicialización
  • Bibliotecas de clústeres