Configurez votre projet Databricks

L’extension IDE Databricks propose une vue Configuration au sein de l’extension qui vous permet de configurer et de mettre à jour facilement les paramètres de votre projet Databricks. Ces fonctionnalités incluent des réglages locaux de dossiers, l’installation d’outils d’IA, un sélecteur de déploiement de l’espace de travail cible, une configuration facile de l’authentification et du calcul, la synchronisation des dossiers de l’espace de travail, ainsi que des étapes simples pour activer l’environnement virtuel Python nécessaire au débogage.

La vue Configuration dans l’extension IDE Databricks est disponible une fois que vous avez créé ou migré un projet vers un projet Databricks. Consultez Créer un nouveau projet Databricks.

Remarque

Les versions antérieures de l’extension IDE Databricks définissaient les paramètres de configuration dans un fichier JSON de projet et les variables d’environnement étaient définies dans le terminal. Dans la version de mise en production, la configuration du projet et de l’environnement se trouve dans les fichiers databricks.yml et databricks.env.

Si votre projet est un pack de ressources Databricks, l’interface utilisateur d’extension Databricks fournit également un Explorateur de ressources du pack et une Vue des variables du pack pour gérer les ressources et les variables de votre pack. Voir les fonctionnalités de Bundle et de l’Explorateur.

Définir le dossier local

Pour sélectionner un autre dossier local pour votre projet Databricks, cliquez sur l’icône d’engrenage associée à l’entrée du dossier local dans la vue Configuration .

Installer et utiliser des outils d’IA

Important

Cette fonctionnalité est en version bêta.

La section outils IA de la vue Configuration vous permet d’installer des outils d’IA afin que vos agents de codage fonctionnent efficacement avec Azure Databricks. L’extension vérifie si les outils d’IA sont installés à l’échelle globale ou du projet, y compris les installations réalisées via la CLI d’Azure Databricks, et met à jour le statut affiché. Pour plus d’informations sur les outils d’IA, voir Compétences d’agent pour assistants de codage IA et aitools groupe de commandement.

Pour installer des outils d’IA :

  1. Dans la vue Configuration de l’extension, cliquez sur Installer des outils IA.
  2. Suivez les instructions pour choisir une portée et les outils nécessaires pour réaliser l’installation.

Lorsque les outils d’IA sont installés, une icône verte de robot apparaît à côté des outils d’IA. Les outils d’IA se mettent automatiquement à jour vers la dernière version.

Outils d’extension d’IA Databricks

Pour désinstaller les outils d’IA, cliquez droit sur les outils d’IA et sélectionnez Désinstaller les outils d’IA.

Modifier l’espace de travail de déploiement cible

Pour sélectionner ou changer la cible de déploiement de votre projet Databricks (par exemple, pour passer d’une cible dev à une cible prod) :

  1. Dans la vue Configuration de l’extension Databricks, cliquez sur l’icône d’engrenage (Sélectionnez une cible du bundle d’actifs Databricks) associée à la cible.

    Sélectionner une cible groupée

  2. Dans la palette de commandes, sélectionnez la cible de déploiement souhaitée.

Une fois qu’une cible est configurée, l’hôte et le Mode de déploiement s’affiche. Pour plus d’informations sur les modes de déploiement des bundles Automation déclaratifs, consultez Les modes de déploiement de bundles Automation déclaratifs.

L’hôte de l’espace de travail peut être modifié en modifiant le paramètre cible workspace dans le fichier de configuration databricks.yml associé au projet. Voir Cibles.

Remarque

Les fonctionnalités d’extension IDE de Databricks suivantes ne sont disponibles que lorsque le mode de déploiement cible est en développement :

  • Utiliser le cluster de développement attaché pour les travaux groupés
  • Synchroniser les fichiers de dossiers de l’espace de travail
  • Sélectionner un cluster de développement interactif

Configurer le profil Databricks pour le projet

Lorsque vous créez un projet Databricks ou convertissez un projet en projet Databricks, vous configurez un profil qui inclut les paramètres d’authentification utilisés pour vous connecter à Databricks. Si vous souhaitez modifier le profil d’authentification utilisé, cliquez sur l’icône d’engrenage associée à AuthType dans la vue Configuration.

Pour plus d’informations sur l’authentification des extensions IDE Databricks, voir Configurer l’autorisation pour l’extension IDE Databricks.

Sélectionner le calcul pour l’exécution du code et des travaux

En utilisant l’extension IDE Databricks, vous pouvez sélectionner serverless, sélectionner un cluster Azure Databricks existant, ou créer un nouveau cluster Azure Databricks pour exécuter votre code et vos tâches. Une fois que vous êtes connecté au calcul, l’ID d’un cluster, la version de Databricks Runtime, le créateur, l’état et le mode d’accès s’affichent. Vous pouvez également démarrer et arrêter un cluster, puis accéder directement aux détails de la page du cluster.

Conseil

Si vous ne souhaitez pas attendre que le cluster des tâches se mette en route, cochez l'option Remplacer le cluster des tâches dans l’offre groupée juste en dessous de la sélection du cluster pour utiliser le cluster sélectionné pour exécuter des tâches groupées en mode développement. Cela n’est pas disponible si vous utilisez l'informatique sans serveur.

Utiliser des services sans serveur

Le calcul serverless est géré par Azure Databricks. Lorsque vous exécutez des charges de travail sur un calcul serverless, Azure Databricks alloue et gère automatiquement les ressources de calcul nécessaires.

  1. Dans la vue Configuration , cliquez sur Sélectionner calculer ou sur l’icône d’engrenage (Configurer le calcul).

    Configurer le calcul

  2. Dans la palette de commandes, sélectionnez Serverless.

    Sélection de calcul sans serveur

Utiliser un cluster existant

Si vous avez un cluster Azure Databricks existant que vous souhaitez utiliser :

  1. Dans la vue Configuration , cliquez sur Sélectionner calculer ou sur l’icône d’engrenage (Configurer le calcul).

  2. Dans la palette de commandes, sélectionnez le cluster que vous souhaitez utiliser.

Créer un cluster

Si vous n’avez pas de cluster Azure Databricks existant, ou si vous souhaitez en créer un :

  1. Dans la vue Configuration , cliquez sur Sélectionner calculer ou sur l’icône d’engrenage (Configurer le calcul).

  2. Dans la palette de commandes, cliquez sur Create New Cluster (Créer un cluster).

  3. Lorsque vous êtes invité à ouvrir le site web externe (votre espace de travail Azure Databricks), cliquez sur Open (Ouvrir).

  4. Si vous y êtes invité, connectez-vous à votre espace de travail Azure Databricks.

  5. Suivez les instructions pour créer un cluster.

    Remarque

    Databricks vous recommande de créer un cluster Personal Compute. Cela vous permettra d’exécuter des charges de travail immédiatement et donc de réduire les frais de gestion du calcul.

  6. Une fois le cluster créé et en cours d’exécution, revenez à Visual Studio Code.

  7. Dans la vue Configuration, à côté du cluster, cliquez sur l’icône en forme d’engrenage (Configurer les ressources de calcul).

    Configurer l'icône du cluster 3

    Dans la palette de commandes, cliquez sur le cluster que vous souhaitez utiliser.

Synchroniser votre dossier d’espace de travail avec Databricks

Vous pouvez synchroniser le dossier de l’espace de travail Databricks distant associé à votre projet Databricks en cliquant sur l’icône de synchronisation (Démarrer la synchronisation) associée à Dossier Distant dans la vue Configuration de l’extension Databricks.

Remarque

L’extension IDE Databricks fonctionne uniquement avec les répertoires d’espaces de travail qu’elle crée. Vous ne pouvez pas utiliser un répertoire d’espace de travail existant dans votre projet, sauf s’il a été créé par l’extension.

Pour accéder à l’affichage de l’espace de travail dans Databricks, cliquez sur l’icône de lien externe (Ouvrir le lien en externe) associée à dossier distant.

L’extension détermine le dossier de l’espace de travail Azure Databricks à utiliser en fonction du file_path paramètre dans le workspace mappage de la configuration de bundle associée au projet. Consultez Espace de travail.

Remarque

L’extension IDE Databricks ne réalise qu’une synchronisation automatique et unidirectionnelle des modifications de fichiers de votre projet Visual Studio Code local vers le dossier de l’espace de travail associé dans votre espace de travail Azure Databricks distant. Les fichiers de ce répertoire d’espace de travail distant sont destinés à être temporaires. N’initiez pas de modifications à ces fichiers à partir de votre espace de travail distant, car ces modifications ne seront pas synchronisées avec votre projet local.

Pour des détails d’utilisation de la fonction de synchronisation des répertoires de l’espace de travail pour les versions antérieures de l’extension IDE Databricks, voir Sélectionner un répertoire d’espace de travail pour l’extension IDE Databricks.

Ouvrez un tunnel SSH

Important

Cette fonctionnalité est en version bêta.

Vous pouvez lancer un tunnel SSH depuis l’extension IDE Databricks pour ouvrir une session de développement à distance sur Azure Databricks Compute. Cela vous permet d’éditer des fichiers et d’exécuter du code directement sur le calcul à distance depuis Visual Studio Code.

  1. Pour démarrer un tunnel SSH, cliquez sur le bouton Start SSH Tunnel dans la vue tunnel SSH dans l’extension.

  2. Ensuite, sélectionnez la ressource de calcul classique ou serverless à laquelle vous connecter :

    • Cluster : Le sélecteur de cluster n’affiche que les clusters utilisant un mode d’accès dédié (utilisateur unique). Si vous avez déjà sélectionné un cluster utilisateur unique dans votre session locale de Visual Studio Code, ce cluster est présélectionné pour la connexion SSH.
    • Serverless : Si vous ne sélectionnez pas de cluster, le tunnel se connecte par défaut au calcul serverless.

Lorsque vous lancez un tunnel, une nouvelle instance de Visual Studio Code s’ouvre dans le même IDE que vous utilisez actuellement. La session à distance ouvre par défaut votre dossier d’accueil (users/username@databricks.com) et affiche automatiquement le fichier spécifique que vous étiez en train de modifier activement. L’authentification est préconfigurée, donc vous n’avez pas besoin de vous reconnecter pour vous connecter à la session distante.

Configurer votre environnement Python et Databricks Connect

La section Environnement Python de la vue Configuration permet de configurer facilement votre environnement de développement virtuel Python et l’installation de Databricks Connect pour l’exécution et le débogage de cellules de code et de notebook. Les environnements virtuels Python s’assurent que votre projet utilise des versions compatibles de Python et de paquets Python.

L'extension utilise la version Databricks Runtime d'un cluster ou une version d'environnement serverless pour construire un local .venv dont la version Python et l'ensemble de paquets correspondent à l'exécution. Cela évite le problème courant où le code fonctionne localement mais échoue sur Azure Databricks à cause de différences de versions Python ou de paquets.

La configuration automatique nécessite uv pour créer et gérer l’environnement virtuel. Lorsque vous démarrez l’installation, l’extension installe automatiquement uv s’il n’est pas déjà disponible. Si l’UV ne peut pas être installé automatiquement, la configuration s’arrête et vous invite à installer l’UV manuellement, puis à réessayer.

Pour configurer automatiquement l’environnement virtuel Python de votre projet, dans la vue Configuration de l’extension :

  1. Cliquez sur la page rouge Configurer un environnement Python.
  2. Dans la palette de commandes, sélectionnez le calcul que vous souhaitez associer.

Pour un projet existant, Setup fusionne ses modifications dans votre pyproject.toml et écrit une pyproject.toml.bak sauvegarde, ce qui vous permet de revoir ou de revenir sur ces changements. Si vous changez ensuite d’environnement de calcul, l’extension détecte un décalage et propose de relancer la procédure de configuration pour correspondre au nouvel environnement d’exécution.

Sinon, vous pouvez utiliser la commande CLI databricks environments setup-local Databricks pour configurer un environnement local. Cela nécessite des UV sur votre PATH.

databricks environments setup-local --serverless-version 5

Pour les projets qui utilisent déjà pip, Poetry ou conda, l’extension affiche une liste de contrôle Python Environment étape par étape au lieu de la configuration UV automatisée. Vous pouvez aussi pointer l’extension vers un interpréteur Python existant en changeant l’environnement actif.

Pour modifier les environnements, cliquez sur l’icône d’engrenage (Modifier l’environnement virtuel) associée à l’environnement actif.

Pour plus d’informations sur l’exécution et le débogage du code et des notebooks avec Databricks Connect, consultez Déboguer le code à l’aide de Databricks Connect pour l’extension Databricks pour l’IDE.