Nakonfigurujte svůj projekt Databricks

Databricks IDE rozšíření nabízí v rámci rozšíření Konfigurační zobrazení, které vám umožní snadno konfigurovat a aktualizovat nastavení vašeho Databricks projektu. Tyto funkce zahrnují nastavení místních složek, instalaci nástrojů AI, nástroj pro výběr nasazení cílového pracovního prostoru, snadnou konfiguraci ověřování a výpočetních prostředků, synchronizaci složek pracovního prostoru a jednoduchý postup pro aktivaci virtuálního prostředí Pythonu nezbytného pro ladění.

Konfigurační zobrazení v rozšíření Databricks IDE je dostupné, jakmile vytvoříte nebo převedete projekt do projektu Databricks. Viz Vytvoření nového projektu Databricks.

Poznámka:

Starší verze rozšíření Databricks IDE definovaly konfigurační nastavení v JSON souboru projektu a proměnné prostředí byly nastaveny v terminálu. V uvolněné verzi se konfigurace projektu a prostředí nachází v souboru databricks.yml a v souboru databricks.env.

Pokud je vaším projektem sada prostředků Databricks, poskytuje uživatelské rozhraní rozšíření Databricks také Průzkumník zdrojů sady a Zobrazení proměnných sady pro správu vašich prostředků a proměnných. Viz Bundle a funkce Průzkumníka.

Nastavte lokální složku

Chcete-li vybrat jinou lokální složku pro svůj Databricks projekt, klikněte na ikonu ozubeného kola spojenou s položkou Local Folder v zobrazení Configuration .

Instalujte a používejte AI nástroje

Important

Tato funkce je v beta verzi.

Sekce AI nástrojů v zobrazení Konfigurace vám umožňuje instalovat AI nástroje, aby vaši programovací agenti efektivně pracovali s Azure Databricks. Rozšíření kontroluje, zda jsou AI nástroje nainstalovány v globálním nebo projektovém rozsahu, včetně instalací, které jste provedli přes Azure Databricks CLI, a aktualizuje zobrazený stav. Další informace o nástrojích AI najdete v článcích Dovednosti agentů pro asistenty pro kódování s AI a aitools skupina příkazů.

Pro instalaci AI nástrojů:

  1. V zobrazení Konfigurace rozšíření klikněte na Nainstalovat AI nástroje.
  2. Postupujte podle pokynů a vyberte rozsah a nástroje k dokončení instalace.

Když jsou AI nástroje nainstalovány, vedle AI nástrojů se objeví zelená ikona robota. AI nástroje se automaticky aktualizují na nejnovější verzi.

Nástroje AI pro rozšíření Databricks

Pro odinstalaci AI nástrojů klikněte pravým tlačítkem na AI nástroje a vyberte Odstranit AI nástroje.

Změna pracovního prostoru cílového nasazení

Výběr nebo přepnutí cíle nasazení pro váš projekt Databricks (například přepnutí z dev cíle na prod cíl):

  1. V zobrazení Konfigurace v rozšíření Databricks klikněte na ikonu ozubeného kola (Vybrat cíl Databricks Asset Bundle) u položky Target.

    Vyberte cíl balíčku

  2. Na paletě příkazů vyberte požadovaný cíl nasazení.

Po nakonfigurování cíle se zobrazí hostitel a režim nasazení . Informace o režimech nasazení deklarativních automatizačních balíčků najdete v tématu Režimy nasazení deklarativních automatizačních balíčků.

Hostitele pracovního prostoru lze změnit úpravou cílového workspace nastavení v konfiguračním databricks.yml souboru přidruženém k projektu. Podívejte se na cíle.

Poznámka:

Následující funkce rozšíření Databricks IDE jsou k dispozici pouze tehdy, když je cílový režim nasazení nastaven na vývoj:

  • Použijte přiložený vývojový cluster pro úlohy balíčku
  • Synchronizace souborů složek pracovního prostoru
  • Výběr interaktivního vývojového clusteru

Konfigurace profilu Databricks pro projekt

Když vytvoříte projekt Databricks nebo převedete projekt na projekt Databricks, nakonfigurujete profil, který zahrnuje nastavení ověřování používané pro připojení k Databricks. Pokud chcete změnit použitý profil ověřování, klikněte v zobrazení Konfigurace na ikonu ozubeného kola přidruženou k AuthType.

Pro více informací o autentizaci rozšíření Databricks IDE viz Nastavení autorizace pro rozšíření Databricks IDE.

Výběr výpočetních prostředků pro spouštění kódu a úloh

Pomocí rozšíření Databricks IDE můžete zvolit serverless, stávající Azure Databricks cluster nebo vytvořit nový Azure Databricks cluster pro spuštění vašeho kódu a úloh. Po připojení k výpočetním prostředkům se zobrazí ID clusteru, verze Databricks Runtime, tvůrce, stav a režim přístupu. Můžete také spustit a zastavit cluster a přejít přímo na podrobnosti stránky clusteru.

Návod

Pokud nechcete čekat, až se cluster úloh spustí, zaškrtněte Přepsat cluster úloh v sadě těsně pod výběrem clusteru, abyste použili vybraný cluster pro spuštění úloh balíčku ve vývojovém módu. Tato možnost není dostupná, pokud používáte výpočetní prostředky bez serveru.

Použití bezserverové architektury

Bezserverové výpočetní prostředky spravuje Azure Databricks. Když spouštíte úlohy na bezserverových výpočetních prostředcích, Azure Databricks automaticky přidělí a spravuje potřebné výpočetní prostředky.

  1. V zobrazení Konfigurace klikněte na Vybrat výpočetní prostředky nebo na ikonu ozubeného kola (Nastavit výpočetní prostředky).

    Konfigurace výpočetních prostředků

  2. Na paletě příkazů vyberte Bezserverové.

    Výběr výpočetních prostředků bez serveru

Použití existujícího clusteru

Pokud máte existující cluster Azure Databricks, který chcete použít:

  1. V zobrazení Konfigurace klikněte na Vybrat výpočetní prostředky nebo na ikonu ozubeného kola (Konfigurovat výpočetní prostředky).

  2. V paletě příkazů vyberte cluster, který chcete použít.

Vytvoření nového clusteru

Pokud nemáte existující cluster Azure Databricks nebo chcete vytvořit nový cluster:

  1. V zobrazení Konfigurace klikněte na Vybrat výpočetní prostředek nebo na ikonu ozubeného kola (Konfigurovat výpočetní prostředek).

  2. Na paletě příkazů klikněte na Vytvořit nový cluster.

  3. Po zobrazení výzvy k otevření externího webu (pracovního prostoru Azure Databricks) klikněte na Otevřít.

  4. Pokud se zobrazí výzva, přihlaste se k pracovnímu prostoru Azure Databricks.

  5. Podle pokynů vytvořte cluster.

    Poznámka:

    Databricks doporučuje vytvořit osobní výpočetní cluster. Díky tomu můžete okamžitě začít spouštět úlohy, což minimalizuje režijní náklady na správu výpočetních prostředků.

  6. Po vytvoření a spuštění clusteru se vraťte do editoru Visual Studio Code.

  7. V zobrazení Konfigurace , vedle clusteru, klikněte na ikonu ozubeného kolečka (Configure compute).

    Konfigurace ikony clusteru 3

    V paletě příkazů klikněte na cluster, který chcete použít.

Synchronizace složky pracovního prostoru s Databricks

Vzdálenou složku Databricks workspace spojenou s vaším projektem Databricks můžete synchronizovat kliknutím na ikonu synchronizace (Start synchronization) spojenou s Remote Folder v zobrazení Configuration rozšíření Databricks.

Poznámka:

Rozšíření Databricks IDE funguje pouze s adresáři pracovního prostoru, které samo vytváří. Existující adresář pracovního prostoru v projektu nelze použít, pokud ho rozšíření nevytvořilo.

Pokud chcete přejít do zobrazení pracovního prostoru v Databricks, klikněte na ikonu externího odkazu (Otevřít odkaz externě) přidruženou k vzdálené složce.

Rozšíření určuje složku pracovního prostoru Azure Databricks, která se má použít na základě nastavení file_path v workspace mapování konfigurace přidruženého balíčku projektu. Viz pracovní prostor.

Poznámka:

Rozšíření Databricks IDE provádí pouze jednosměrnou, automatickou synchronizaci změn souborů z vašeho lokálního projektu Visual Studio Code do příslušné složky workspace ve vašem vzdáleném pracovním prostoru Azure Databricks. Soubory v tomto adresáři vzdáleného pracovního prostoru jsou určené jako přechodné. Nespouštět změny těchto souborů ze vzdáleného pracovního prostoru, protože tyto změny nebudou synchronizovány zpět do místního projektu.

Pro podrobnosti o použití funkce synchronizace adresářů pracovního prostoru pro starší verze rozšíření Databricks IDE viz Vybrat adresář pracovního prostoru pro rozšíření Databricks IDE.

Začněte tunel SSH

Important

Tato funkce je v beta verzi.

Můžete spustit SSH tunel z rozšíření Databricks IDE a otevřít vzdálenou vývojovou relaci na výpočetní technice Azure Databricks. To vám umožní upravovat soubory a spouštět kód přímo na vzdáleném výpočtu přímo ve Visual Studio Code.

  1. Pro spuštění SSH tunelu klikněte na tlačítko Start SSH tunelu v zobrazení SSH tunelu v rozšíření.

  2. Dále vyberte klasické nebo bezserverové výpočetní prostředí, ke kterému se chcete připojit:

    • Cluster: Cluster picker zobrazuje pouze clustery, které používají dedikovaný (jednouživatelský) přístupový režim. Pokud už máte v lokální relaci Visual Studio Code vybraný cluster pro jednoho uživatele, tento cluster je předem vybrán pro SSH připojení.
    • Serverless: Pokud nevyberete cluster, tunel se ve výchozím nastavení připojí k bezserverovému výpočetnímu výkonu.

Když spustíte tunel, otevře se nová instance Visual Studio Code ve stejném IDE, které právě používáte. Vzdálená relace ve výchozím nastavení otevře vaši domovskou složku (users/username@databricks.com) a automaticky zobrazí konkrétní soubor, který jste aktivně upravovali. Autentizace je přednastavená, takže se nemusíte znovu přihlašovat, abyste se připojili k vzdálené relaci.

Nastavení prostředí Pythonu a Databricks Connect

Část Prostředí Pythonu v zobrazení Konfigurace umožňuje snadnou instalaci virtuálního vývojového prostředí Pythonu a instalaci služby Databricks Connect pro spouštění a ladění kódu a buněk poznámkového bloku. Python virtuální prostředí zajistí, že váš projekt používá kompatibilní verze Python a Python balíčků.

Rozšíření používá verzi Databricks Runtime clusteru nebo verzi bezserverového prostředí k vytvoření místního prostředí .venv, jehož verze Pythonu a sada balíčků odpovídají běhovému prostředí. Tím se vyhnete běžnému problému, kdy kód pracuje lokálně, ale selhává na Azure Databricks kvůli rozdílům ve verzi Python nebo balíčků.

Automatizované nastavení vyžaduje UV pro vytvoření a správu virtuálního prostředí. Když začnete nastavovat, rozšíření automaticky nainstaluje UV, pokud už není dostupné. Pokud UV nelze nainstalovat automaticky, instalace se zastaví a vyzve vás , abyste UV instalovali ručně a pak to zkusili znovu.

Pro automatickou konfiguraci virtuálního prostředí Python pro váš projekt v zobrazení Konfigurace rozšíření:

  1. Klikněte na červené tlačítko Nastavit Python prostředí.
  2. V Paletě příkazůvyberte výpočetní prostředek, který chcete spárovat.

U existujícího projektu instalační program sloučí své změny s vaším pyproject.toml a vytvoří záložní kopii pyproject.toml.bak, abyste mohli změny zkontrolovat nebo vrátit zpět. Pokud později přepnete výpočetní režim, rozšíření detekuje drift a nabídne opětovné spuštění nastavení podle nového runtime.

Alternativně můžete použít příkaz Databricks CLI databricks environments setup-local k nastavení lokálního prostředí. To vyžaduje uv na vašem PATH.

databricks environments setup-local --serverless-version 5

U projektů, které už používají pip, Poetry nebo conda, rozšíření ukazuje krok za krokem kontrolní seznam Python Environment místo automatizovaného UV nastavení. Rozšíření můžete také nasměrovat na existující Python interpreter změnou aktivního prostředí.

Pokud chcete změnit prostředí, klikněte na ikonu ozubeného kola (Změnit virtuální prostředí) přidruženou k Aktivnímu prostředí.

Pro informace o spouštění a ladění kódu a zápisníků s Databricks Connect viz Debug code using Databricks Connect pro rozšíření Databricks IDE.