Migrar cargas de trabajo clásicas con GPU a un entorno sin servidor

Si va a mover una carga de trabajo de aprendizaje profundo existente desde un clúster de Databricks clásico (con Databricks Runtime ML) a sin servidor (con AI Runtime), siga estos pasos:

  1. Reemplace el código dependiente del clúster. Quite las referencias al entrenamiento distribuido basado en Spark (por ejemplo, TorchDistributor) y reemplácelas por el @distributed decorador de serverless_gpu.
  2. Actualizar la carga de datos. Reemplace las rutas de acceso directas de DBFS con las rutas de acceso de volúmenes del catálogo de Unity (/Volumes/...). Reemplace las operaciones locales de DataFrame de Spark por Spark Connect. Para transmitir en streaming datos de archivos desde volúmenes, use UCVolumeDataset desde databricks.air.data. Consulte Carga de datos en el entorno de ejecución de IA.
  3. Configure el entorno. Algunas bibliotecas preinstaladas de Databricks Runtime ML no están disponibles en AI Runtime. Configura un entorno de GPU sin servidor e instala los paquetes que necesita tu carga de trabajo con %pip install. Consulte Configuración del entorno.
  4. Actualice las rutas de acceso del punto de control. Mover puntos de control de DBFS o almacenamiento local a volúmenes de Unity Catalog (/Volumes/<catalog>/<schema>/<volume>/...). Para el puntos de control distribuidos, use UCVolumeWriter y UCVolumeReader desde databricks.air.data, que canaliza la E/S a través de NVMe local. Consulta checkpoint con punto de control distribuido (DCP).
  5. Revisa tu configuración de MLflow. En AI Runtime, la .distributed() API crea MLflow que se ejecuta automáticamente. Para personalizar el experimento, configúralo con un camino absoluto. Para reanudar las ejecuciones interrumpidas, establece un nombre de ejecución. Consulta qué ofrece MLflow para el aprendizaje profundo.
  6. Pruebe primero de forma interactiva. Valide la carga de trabajo en un cuaderno interactivo antes de programarla como trabajo.