Tâche de Notebook pour les travaux

Utilisez la tâche de notebook pour déployer des notebooks Databricks.

Requirements

  • Votre bloc-notes doit se trouver dans un emplacement accessible par l’utilisateur qui configure le travail.

Configurer une tâche de Notebook

Note

L’interface utilisateur des travaux affiche les options de manière dynamique en fonction d’autres paramètres configurés.

Pour commencer le processus de configuration d'une tâche Notebook :

  1. Accédez à l’onglet Tâches de l’interface utilisateur des travaux.
  2. Cliquez sur l’icône Plus.Ajouter une tâche.
  3. Entrez un nom dans le champ Nom de la tâche .
  4. Dans le menu déroulant Type, sélectionnez Notebook.

Configurer la source

Dans le menu déroulant Source , sélectionnez un emplacement pour le bloc-notes à l’aide de l’une des options suivantes.

Workspace

Utilisez Espace de travail pour configurer un Notebook stocké dans l’espace de travail en procédant comme suit :

  1. Cliquez sur le champ Chemin d’accès. La boîte de dialogue Sélectionner un Notebook s’affiche.
  2. Accédez au Notebook, cliquez pour mettre le fichier en surbrillance, puis cliquez sur Confirmer.

Note

Vous pouvez utiliser cette option pour configurer une tâche pour un Notebook stocké dans un dossier Git Databricks. Databricks recommande d’utiliser l’option Fournisseur Git et un référentiel Git distant pour les ressources de version planifiées avec des travaux.

Fournisseur Git

Utilisez Fournisseur Git pour configurer un Notebook dans un référentiel Git distant.

Les options affichées par l’interface utilisateur dépendent de la configuration ou non d’un fournisseur Git à un autre emplacement. Un seul référentiel Git distant peut être utilisé pour toutes les tâches d’un travail. Voir l'utilisation de Git avec Lakeflow Jobs.

Important

Les notebooks créés par les travaux Lakeflow qui s'exécutent à partir de dépôts Git distants sont éphémères et ne peuvent pas être pris en compte pour suivre les exécutions, les expériences ou les modèles MLflow. Lors de la création d’un notebook à partir d’une tâche, utilisez une expérience MLflow d’espace de travail (au lieu d’une expérience MLflow de notebook) et appelez mlflow.set_experiment("/path/to/experiment") dans le notebook de l’espace de travail avant d’exécuter un code de suivi MLflow. Pour plus d’informations, consultez Empêcher la perte de données dans les expériences MLflow.

Le champ Chemin d’accès s’affiche une fois que vous avez configuré une référence Git.

Entrez le chemin relatif de votre bloc-notes, par exemple etl/bronze/ingest.py.

Important

Lorsque vous entrez le chemin relatif, ne commencez pas par / ou ./. Par exemple, si le chemin absolu du notebook auquel vous souhaitez accéder est /etl/bronze/ingest.py, entrez etl/bronze/ingest.py dans le champ Chemin d’accès.

Configurer des bibliothèques de calcul et les bibliothèques dépendantes

Note

Vous pouvez sélectionner un entrepôt SQL comme ressource de calcul pour une tâche de notebook uniquement si le notebook est entièrement en SQL et que SQL est défini comme langage par défaut. Si le notebook utilise une autre langue par défaut ou combine des langues, sélectionnez un cluster ou un autre calcul pris en charge à la place.

  1. Utilisez Compute pour sélectionner ou configurer un cluster qui prend en charge la logique dans votre notebook.
  2. Si vous utilisez Compute Serverless, installez des bibliothèques directement dans le notebook, à l’aide du volet Environnement ou avec %pip install. Consultez Configurer l’environnement serverless.
  3. Pour toutes les autres configurations de calcul, cliquez sur l’icône Plus.Ajouter sous Bibliothèques dépendantes. La boîte de dialogue Ajouter une bibliothèque dépendante apparaît.
    • Vous pouvez sélectionner une bibliothèque existante ou en charger une nouvelle.
    • Vous pouvez uniquement utiliser des bibliothèques stockées dans un emplacement pris en charge par vos configurations de calcul. Voir Prise en charge des bibliothèques Python.
    • Chaque source de bibliothèque présente un flux différent pour la sélection ou le chargement d’une bibliothèque. Consultez Installer des bibliothèques.

Finaliser la configuration du travail

  1. (Facultatif) Configurez Paramètres en tant que paires clé-valeur accessibles dans le Notebook à l’aide de dbutils.widgets. Consultez Configurer les paramètres de tâche.
  2. (Facultatif) Pour configurer les tentatives de nouvelle exécution, les seuils de durée d’exécution ou de retard de streaming, ou les notifications, consultez les paramètres de tâche avancés.
  3. Cliquez sur Enregistrer la tâche.

Pour modifier, cloner, désactiver ou supprimer cette tâche, consultez Configurer et modifier des tâches dans les travaux Lakeflow.

Préparation des données visuelles

La préparation des données visuelles dans la liste déroulante Type de tâche crée une tâche de notebook pour un fichier de préparation de données visuelles. Vous générez ces fichiers sur un canevas visuel dans Lakeflow Designer, qui enregistre chacun sous la forme d’un bloc-notes nommé <name>.designer.ipynb. Pour l’exécuter en tant que travail, ajoutez une tâche de bloc-notes et sélectionnez son .designer.ipynb fichier comme source. Voir Lakeflow Designer.

Limitations

La sortie totale des cellules du bloc-notes (la sortie combinée de toutes les cellules de bloc-notes) est soumise à une limite de taille de 30 Mo. En outre, la sortie de cellule individuelle est soumise à une limite de taille de 8 Mo. Si la sortie totale de la cellule dépasse 30 Mo de taille ou si la sortie d’une cellule individuelle est supérieure à 8 Mo, l’exécution est annulée et marquée comme ayant échoué.

Si vous avez besoin d’aide pour trouver les cellules proches ou au-delà de la limite, exécutez le bloc-notes sur un cluster généraliste et utilisez cette technique d’enregistrement automatique du bloc-notes.