Overview

Importante

Esta característica está en versión preliminar pública.

AI Runtime es una oferta de proceso en Databricks diseñada para cargas de trabajo de aprendizaje profundo y proporciona compatibilidad con GPU para Databricks Serverless. Puede usar AI Runtime para entrenar y ajustar modelos personalizados mediante sus marcos favoritos y obtener una eficiencia, un rendimiento y una calidad de última generación. Para obtener información general sobre cómo encaja el proceso sin servidor en la arquitectura de Databricks, consulte Arquitectura del área de trabajo sin servidor.

Características clave

AI Runtime combina la infraestructura gestionada de GPU con un runtime diseñado para aprendizaje profundo:

  • Infraestructura de GPU totalmente administrada: acceso flexible y sin servidor a GPU y sin configuración del clúster, selección de controladores o directivas de escalado automático para administrar.
  • Un entorno de ejecución dedicado al aprendizaje profundo: elija un entorno estándar mínimo para obtener la máxima flexibilidad sobre las dependencias o un entorno de INTELIGENCIA artificial completo cargado previamente con marcos de APRENDIZAJE automático populares.
  • Se integra de forma nativa en cuadernos, trabajos, Catálogo de Unity y MLflow para el desarrollo sin problemas, el acceso a los datos y el seguimiento de experimentos.

Opciones de hardware

Todos los aceleradores del entorno de ejecución de IA aprovisionan un solo nodo. El número de GPU de ese nodo depende del tipo de acelerador:

Acelerador GPU por nodo Memoria de GPU Más adecuado para Entrenamiento distribuido
1xA10 1 24 GB Tareas de aprendizaje automático pequeño a mediano y aprendizaje profundo, como modelos clásicos de ML o ajuste de modelos de lenguaje más pequeños No es compatible (GPU única)
1xH100 1 80 GB Las cargas de trabajo que necesitan más memoria de GPU que 1xA10 proporcionan, pero no requieren entrenamiento distribuido con varias GPU, como el ajuste de modelos de lenguaje de tamaño medio No es compatible (GPU única)
8xH100 8 80 GB por GPU Cargas de trabajo de inteligencia artificial a gran escala, incluidos el entrenamiento o la optimización de modelos masivos o la ejecución de tareas avanzadas de aprendizaje profundo Compatible mediante el decorador @distributed con gpus=8

Sugerencia

Solo 8xH100 soporta entrenamiento distribuido multi-GPU. Para cargas de trabajo de una sola GPU, elige 1xA10 o 1xH100 según la memoria GPU que necesite tu modelo.

Databricks recomienda AI Runtime para cualquier caso de uso de entrenamiento de modelos personalizados que impliquen aprendizaje profundo, cargas de trabajo clásicas a gran escala o GPU.

Por ejemplo:

  • Ajuste fino de LLM (LoRA, QLoRA, ajuste completo)
  • Computer Vision (detección de objetos, clasificación de imágenes)
  • Sistemas recomendados basados en aprendizaje profundo
  • Aprendizaje de refuerzo
  • Previsión de series temporales basadas en aprendizaje profundo

Requisitos

Antes de empezar, confirma que tu espacio de trabajo cumple estos requisitos:

  • Un área de trabajo en una de las siguientes regiones admitidas por Azure:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3
  • La vista previa de tiempo de ejecución de IA debe estar habilitada mediante la configuración de administrador del espacio de trabajo. Consulta Administrar las versiones preliminares de Databricks.

Limitations

Ten en cuenta las siguientes limitaciones cuando planifiques una carga de trabajo en tiempo de ejecución de IA:

  • AI Runtime solo admite aceleradores A10 y H100.
  • Ai Runtime no admite el perfil de seguridad de cumplimiento para los estándares FedRAMP High o DoD IL5.
  • No se admite la adición de dependencias mediante el panel Entornos para trabajos programados de AI Runtime. Instale las dependencias programáticamente con %pip install en tu notebook.
  • En el caso de los trabajos programados en ai Runtime, no se admite el comportamiento de recuperación automática para versiones de paquetes incompatibles asociadas con el cuaderno.
  • Los intentos de conexión al entorno de ejecución de IA finalizan tras 15 minutos para los cuadernos interactivos y tras 24 horas para los trabajos de cuaderno o los trabajos de CLI. Las sesiones de notebook conectadas y los trabajos de notebook conectados pueden ejecutarse durante un máximo de dos días, y los trabajos de CLI pueden ejecutarse durante un máximo de 14 días. Para trabajos de entrenamiento de modelos de larga duración, implementa puntos de control y reinicia el trabajo cuando se alcance el tiempo máximo de ejecución.
  • AI Runtime proporciona acceso a petición a los recursos de GPU. Aunque esto conduce a un acceso sencillo y flexible a las GPU, puede haber períodos en los que la capacidad está restringida o no disponible en su región.
  • AI Runtime aprovecha las GPU de varias regiones en determinados casos en momentos de alta demanda. Puede haber costos de salida asociados a este uso y la conectividad de red entre regiones puede estar limitada en determinados momentos.

Conexión al entorno de ejecución de IA

Puede conectarse a AI Runtime de forma interactiva desde cuadernos, un terminal IDE mediante un túnel SSH, trabajos programados, la API de trabajos y agrupaciones de automatización declarativa. Para instrucciones paso a paso, consulta Conectar a IA Runtime desde un cuaderno.

Configuración de entorno

Ai Runtime ofrece dos entornos de Python administrados: un entorno estándar mínimo y un entorno completo de inteligencia artificial de Databricks que se carga previamente con marcos de APRENDIZAJE automático populares como PyTorch y Transformers. Para más información sobre cómo elegir un entorno, un comportamiento de almacenamiento en caché, importar módulos personalizados y limitaciones conocidas, consulte Configuración del entorno.

Sugerencia

Elige el entorno Standard para tener control total sobre tu pila de dependencias, o el entorno de IA Databricks para saltarte la instalación de frameworks comunes como PyTorch y Transformers.

Carga de datos en el entorno de ejecución de IA

Comprender cómo funciona el acceso a los datos en el entorno de ejecución de IA es esencial para una experiencia fluida. Para más información, consulte Carga de datos en tiempo de ejecución de IA.

Entrenamiento distribuido

AI Runtime admite el entrenamiento distribuido entre varias GPU en el nodo único al que está conectado el cuaderno. Con el @distributed decorador de la serverless_gpu API de Python, puede iniciar cargas de trabajo de varias GPU con PyTorch DDP, FSDP o DeepSpeed con una configuración mínima. Para obtener más información, consulte Entrenamiento distribuido en cuadernos.

Sugerencia

Valida tu carga de trabajo en una sola GPU antes de escalar a 8xH100 con el @distributed decorador.

Ray en tiempo de ejecución de IA

AI Runtime soporta Ray para cargas de trabajo distribuidas de GPU, incluyendo Ray Core, Ray Data, Ray Train y Ray Tune. Puedes ejecutar trabajos Ray de un solo nodo y de varios nodos en computación de GPU serverless sin configuración de clúster. Para detalles y ejemplos, véase Ray on AI Runtime.

Seguimiento de experimentos y observabilidad

Para la integración de MLflow, la visualización de registros y la administración de puntos de comprobación del modelo, consulte Seguimiento de experimentos y observabilidad.

Llevar las cargas de trabajo de entrenamiento a producción

Despliega una carga de trabajo en tiempo de ejecución de IA con Paquetes de Automatización Declarativa para ejecutar tu propio código de entrenamiento, crea trabajos multitarea que combinen tareas de GPU y CPU, programa pipelines y promueve desde el desarrollo hasta la producción. Consulta Llevar las cargas de trabajo de entrenamiento a producción.

Código de Genie para el aprendizaje profundo

Genie Code puede ayudar a desarrollar y solucionar cargas de trabajo de aprendizaje profundo en AI Runtime. Puede generar código de entrenamiento distribuido, resolver problemas de entorno y dependencias, e investigar fallos de GPU y cargas de trabajo distribuidas. Consulta Usar Genie Code con entorno de ejecución de IA.

Guides

Para la migración desde cargas de trabajo clásicas, cuadernos de ejemplo y solución de problemas, consulte Guías de usuario para el entorno de ejecución de IA.