Configuración del entorno

Importante

Esta característica está en versión preliminar pública.

AI Runtime ofrece dos entornos Python gestionados para el cálculo de GPU sin servidor. El entorno estándar incluye cuda. A partir de la versión 5 del entorno, torch y torchvision ya no vienen preinstalados. El entorno de IA de Databricks está preinstalado con PyTorch, Transformers y otros frameworks de aprendizaje automático y aprendizaje profundo. Elija el entorno Estándar para un control total sobre la pila de dependencias o el entorno de IA para una configuración de entrenamiento lista para usar. Puedes empezar desde cualquiera de los dos entornos e instalar más paquetes tú mismo.

Tip

  • Elige el entorno Standard para el control total de las dependencias, o el entorno de IA Databricks para una pila de ML lista para usar.
  • El estándar incluye cuda. A partir de la versión 5 del entorno, torch y torchvision no están preinstalados. El entorno de IA añade PyTorch, Transformers y más.
  • Instala más paquetes con %uv pip install (versión 5 del entorno y posteriores) o %pip install en un cuaderno, o con environment.dependencies en la CLI.

Qué entorno usar

AI Runtime ofrece dos entornos de Python administrados, el entorno estándar y el entorno de inteligencia artificial de Databricks.

Medio ambiente Características clave Cuándo se deben usar
Entorno estándar Mínimo; incluye cuda. A partir de la versión 5 del entorno, torch y torchvision ya no vienen preinstalados. Desea tener control total sobre la pila de dependencias y prefiere instalar solo lo que necesita.
Entorno de inteligencia artificial de Databricks Precargado con marcos populares de ML como PyTorch, Transformers y más Quiere un entorno completo para el entrenamiento, el ajuste y la experimentación sin la administración manual de dependencias.

También puedes usar un entorno base de espacio de trabajo que un administrador de espacio haya creado para AI Runtime. Consulte Compilación para el proceso de GPU sin servidor (entorno de ejecución de IA).

Para elegir un entorno en un cuaderno, abre el panel lateral de Entorno y selecciona un entorno base:

Seleccionando un entorno base en el panel lateral de Entorno del cuaderno.

Entorno estándar (entorno mínimo)

Un entorno mínimo y estable que contiene solo los paquetes necesarios para la operación en tiempo de ejecución de IA. El entorno incluye cuda por compatibilidad con GPU. A partir de la versión 5 del entorno, torch y torchvision ya no vienen preinstalados. Instala las versiones que tu carga de trabajo necesite con %uv pip install o %pip install. Para los paquetes instalados en cada versión del entorno, consulte las siguientes notas de la versión.

Mejor para: los usuarios que quieren un control total sobre su pila de dependencias y prefieren instalar solo lo que necesitan.

Para seleccionar: En el panel lateral de Entorno , elige Standard v6 como entorno base.

Para obtener más información sobre las versiones de paquete instaladas en distintas versiones, consulte las notas de la versión:

Entorno de inteligencia artificial de Databricks

Disponible en el entorno 4 y versiones posteriores. El entorno de IA se basa en el entorno Estándar con paquetes y paquetes de tiempo de ejecución comunes específicos del aprendizaje automático en GPU. Entre los paquetes preinstalados se incluyen:

  • PyTorch (con compatibilidad con CUDA)
  • Transformadores (Hugging Face)
  • Y las dependencias adicionales de ML/DL

Mejor para: profesionales de ML que desean un entorno completo para entrenar cargas de trabajo, ajustar y experimentar sin administración manual de dependencias.

Para seleccionar: En el panel lateral de Entorno , elige AI v6 como tu entorno base.

Para obtener más información sobre las versiones de paquete instaladas en distintas versiones, consulte las notas de la versión:

Instalar paquetes adicionales

Puedes empezar desde un entorno gestionado o desde un entorno base de espacio de trabajo e instalar tus propios paquetes de Python encima. Cómo los instales depende de cómo te conectes a AI Runtime.

En un cuaderno

Instala paquetes al principio de tu notebook o script de entrenamiento con %uv pip, que usa uv para la instalación y es más rápido que %pip. Fija las versiones para que las ejecuciones sean reproducibles:

%uv pip install "trl==1.1.0"
%uv pip install "transformers==5.5.4"

Para obtener la referencia completa de %pip y %uv pip, incluida la información sobre qué versiones del entorno admiten cada una, consulte Administrar bibliotecas con comandos %uv.

Cuando utilizas el decorador @distributed para cargas de trabajo con varias GPU, los paquetes que instalas antes de llamar a .distributed() se capturan automáticamente en una instantánea y se propagan a todos los procesos distribuidos. El tamaño total de los paquetes instalados no debe superar los 15 GB. Para obtener más información, consulte Adición de dependencias al cuaderno.

Con el CLI

La air CLI utiliza los mismos entornos gestionados. Selecciona uno con environment.version y luego enumera los paquetes que se instalarán además bajo environment.dependencies en el YAML de tu carga de trabajo. La CLI los instala en el entorno seleccionado con UV, así que no gestionas tú mismo un entorno virtual separado:

environment:
  version: '6'
  dependencies:
    - trl==1.1.0
    - transformers==5.5.4

Para empezar con el entorno de IA de Databricks, establezca version en un identificador de entorno de IA, como databricks_ai_v5. Para el formato completo de dependencias, banderas de instalación soportadas y soporte para imágenes Docker personalizadas, véase dependencias de Python.

Entornos básicos de trabajo

Un administrador del área de trabajo puede crear un entorno base de área de trabajo para el proceso de GPU sin servidor, lo que hace que esté disponible para todos los usuarios del área de trabajo a través del menú desplegable Entorno base . Para más información, consulte Compilación para computación sin servidor con GPU (entorno de ejecución de IA).

Para usar un entorno base en una carga de trabajo programada, haga referencia a él por su identificador en el bloque environments de un trabajo o de un paquete. Por ejemplo, esta tarea de Declarative Automation Bundles selecciona el entorno de IA Databricks:

resources:
  jobs:
    train:
      tasks:
        - task_key: train
          environment_key: default
      environments:
        - environment_key: default
          spec:
            base_environment: databricks_ai_v6

Para un ejemplo completo de trabajo, véase Schedule with the Jobs API y Declarative Automation Bundles.

Almacenamiento en caché del entorno y módulos personalizados

¿Cuándo se almacenan en caché los entornos?

AI Runtime almacena en caché el entorno de tu portátil, así que cuando vuelves a abrir el portátil no necesitas reinstalar paquetes. Para más detalles, véase Reiniciar las dependencias del entorno.

La caché se aplica a los cuadernos interactivos. Las cargas de trabajo que se ejecutan a través de la air CLI o como trabajos programados no usan esta caché; cada ejecución instala sus dependencias desde cero.

Como buena práctica, fija los paquetes a una versión específica para que tu entorno en caché siga siendo válido y tus ejecuciones sean reproducibles.

¿Cómo se importan los módulos personalizados?

Los siguientes pasos muestran cómo usar tus propios módulos de Python.

  1. Sincroniza tu código con el espacio de trabajo. Clona un repositorio Git en el espacio de trabajo con una carpeta Git, o sube los archivos directamente como archivos de espacio de trabajo. Guarda el código compartido en /Workspace/Shared para proyectos en equipo, o en la carpeta del usuario para el desarrollo personal. Mantener el código en una carpeta Git mantiene el control de versiones.
  2. Añade la carpeta sys.path e impórtala en la parte superior de tu cuaderno o del script de entrenamiento:
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function

Limitaciones

Las siguientes funcionalidades no están disponibles en el entorno de ejecución de IA:

  • Funciones de Spark: no se pueden importar ni usar funciones de PySpark directamente. AI Runtime es un entorno de solo Python; Spark no está disponible como tiempo de ejecución local. Sin embargo, Spark Connect está disponible para la carga de datos. Consulte Carga de datos en el entorno de ejecución de IA.
  • Bibliotecas de Ml de Databricks Runtime: los paquetes preinstalados no son un reemplazo de Databricks Runtime ML. Es posible que algunas bibliotecas de ML disponibles en Databricks Runtime ML no estén preinstaladas en el entorno de ejecución de IA.
  • Artefactos privados: AI Runtime admite artefactos privados en determinados casos. Póngase en contacto con el equipo de su cuenta para obtener más detalles.