Guías de usuario para el entorno de ejecución de IA

Importante

Esta característica está en versión preliminar pública.

Supervisa el uso y los costes de la GPU con la tabla del sistema de uso facturable, encuentra cuadernos de ejemplo y soluciona errores comunes.

Migración desde Slurm

Si vienes de un clúster Slurm en lugar de Databricks clásicos, consulta Migrar desde Slurm para ver cómo sbatch, srun/torchrun, particiones y sistemas de archivos compartidos se mapean a la CLI de Databricks.

Seguimiento del uso y los costos

Puede supervisar el gasto de GPU en tiempo de ejecución de IA consultando la tabla del sistema de uso facturable (system.billing.usage). La consulta siguiente devuelve el uso total de las cargas de trabajo de GPU sin servidor:

SELECT
  SUM(usage_quantity)
FROM
  system.billing.usage
WHERE
  product_features.serverless_gpu IS NOT NULL

Para obtener más información sobre el esquema de la tabla del sistema de uso facturable, consulte Referencia de las tablas del sistema de uso facturable.

AI Runtime factura por hora de GPU en el SKU de entrenamiento de modelos según los siguientes precios:

  • H100 a petición: 7,00 USD/hora de GPU (Este de EE. UU.)
  • A10 a petición: 4,90 USD/hora de GPU (Este de EE. UU.)

Cuadernos de ejemplo

Las siguientes categorías de cuadernos de ejemplo están disponibles para ayudarle a empezar:

Categoría Description
Modelos de lenguaje grande (LLM) Ajuste de modelos de lenguaje grande, incluidos métodos eficientes en el uso de parámetros (LoRA, QLoRA)
Computer Vision Detección de objetos, clasificación de imágenes y otras tareas de CV
Sistemas recomendados de aprendizaje profundo Creación de sistemas de recomendación mediante enfoques de aprendizaje profundo modernos como modelos de dos torres
ML Clásico Tareas tradicionales de ML, incluido el entrenamiento del modelo XGBoost y la previsión de series temporales
Entrenamiento distribuido con varias GPU Escalado del entrenamiento entre varias GPU mediante la API de GPU sin servidor

Para obtener la lista completa, consulte Cuadernos de ejemplo de AI Runtime.

Troubleshooting

Genie Code puede ayudar a resolver problemas de entorno y dependencias, así como a investigar fallos de GPU y cargas de trabajo distribuidas en portátiles conectados a AI Runtime. Consulta Usar Genie Code con entorno de ejecución de IA.

Para depurar de forma interactiva en el cómputo, utiliza el terminal web para ejecutar comandos de shell, inspeccionar el uso de la GPU con nvidia-smi, y gestionar archivos. El terminal web está disponible cuando se conecta a un entorno de GPU serverless versión 5 o superior. Consulte Ejecución de comandos de shell en el terminal web de Azure Databricks.

ValueError: el tamaño numpy.dtype cambiado puede indicar incompatibilidad binaria. Se esperaban 96 desde el encabezado de C, pero se obtuvo 88 desde PyObject.

El error suele surgir cuando hay una falta de coincidencia en las versiones de NumPy usadas durante la compilación de un paquete dependiente y la versión de NumPy instalada actualmente en el entorno de tiempo de ejecución. Esta incompatibilidad se produce a menudo debido a cambios en la API de C de NumPy y es especialmente notable de NumPy 1.x a 2.x. Este error indica que el paquete de Python instalado en el cuaderno puede haber cambiado la versión de NumPy.

Solución recomendada:

Compruebe la versión de NumPy en tiempo de ejecución y asegúrese de que es compatible con los paquetes. Consulte las notas de la versión de cómputo de GPU sin servidor para entorno 4 y entorno 3 para obtener información sobre las bibliotecas Python preinstaladas. Si tiene una dependencia en una versión diferente de NumPy, agregue esa dependencia al entorno de proceso.

PyTorch no encuentra libcudnn al instalar torch

Al instalar una versión diferente de torch, es posible que vea el error: ImportError: libcudnn.so.9: cannot open shared object file: No such file or directory. Esto se debe a que torch solo busca la biblioteca cuDNN en la ruta de acceso local.

Solución recomendada:

Vuelva a instalar las dependencias agregando --force-reinstall al instalar torch:

%pip install torch --force-reinstall