Správa závislostí pomocí prostředí

Important

Tato funkce je v beta verzi. Správci účtů mohou ovládat přístup k této funkci ze stránky Preview v konzoli účtu pomocí přepínač Environments for Standard Compute . Viz Manage Azure Databricks preview.

Na klasickém výpočetním zdroji, který používá závislostní režim Environments , spravujete závislosti na úrovni zátěže pomocí základních prostředí místo instalace výpočetně zaměřených knihoven.

Nastavení prostředí zůstává izolované od změn na úrovni výpočetních prostředků, takže se úlohy nenaruší, když se podkladové výpočetní prostředky změní. A protože Azure Databricks ukládá základní prostředí do cache, závislosti se neřeší a nenainstalují při startu, takže výpočetní technika startuje rychleji a zabraňuje selháním při řešení balíčků, dostupnosti repozitáře nebo spolehlivosti sítě.

V notebooku připojeném ke klasickému výpočetnímu zdroji, který používá závislostní režim Prostředí , vyberte základní prostředí a přidejte závislosti z bočního panelu Prostředí zápisníku. Pro úkoly práce nakonfigurujte závislosti podle specifikace pracovního prostředí.

Requirements

Nastavení režimu závislosti je dostupné pouze u výpočetního zařízení, které splňuje následující požadavky:

  • Databricks Runtime 19 (Beta) nebo vyšší
  • Standardní režim přístupu
  • Univerzální výpočetní prostředí nebo výpočetní prostředí pro klasické úlohy

Pro podrobnosti o podpoře viz Omezení.

Nastavte režim závislosti

Pro vytvoření klasického výpočetního zdroje, který využívá závislostní režim Environments :

  1. V postranním panelu pracovního prostoru klikněte na ikonu výpočtuVypočítat a poté otevřete záložku Všestranné výpočty .

  2. Klikněte na Vytvořit výpočet.

  3. V sekci Výkon vyberte 19 Beta nebo vyšší z rozbalovacího menu verze Databricks Runtime.

  4. Rozbalte sekci Pokročilé a klikněte na Závislosti.

  5. Pro režim závislostí nechte vybráné Auto, aby Azure Databricks režim vyřešil, nebo klikněte na Manuální a vyberte Prostředí, abyste si ho nastavili sami. Viz možnosti režimu závislostí.

    Záložka Dependencies v sekci Advanced ve formuláři pro tvorbu výpočtů, s nastavením režimu závislostí na Auto a řešením na Environments.

  6. Nakonfigurujte zbytek výpočtu a klikněte na Vytvořit.

Po spuštění výpočtu připojte notebook a nakonfigurujte jeho prostředí podle článku Použít prostředí v notebooku.

Možnosti režimu závislostí

Ovládání režimu závislostí má dvě nastavení, která určují, jak je režim zvolen:

  • Auto: Azure Databricks řeší tento režim na základě konfigurace výpočetní techniky. Automaticky se mapuje na Environments, pokud ovšem výpočet nespecifikuje Docker, proměnné prostředí Sparku nebo inicializační skripty; v takovém případě se mapuje na Knihovny clusteru.
  • Manuál: Sami si vyberete Prostředí nebo knihovny clusteru.

Když zvolíte Manual, vyberte režim, který vám vyhovuje:

  • Prostředí: Spravujte závislosti na úrovni úlohy pomocí základních prostředí. Clusterové knihovny, Docker, proměnné prostředí Spark a init skripty jsou deaktivovány. Použijte tento režim k izolaci závislostí pro každou pracovní zátěž.
  • Clusterové knihovny: Klasické chování. Instalujte závislosti na výpočetním zařízení pomocí clusterových knihoven, init skriptů nebo Dockeru. Tento režim použij, pokud tvůj pracovní zátěž vyžaduje některou z těchto nastavení.

Aktualizujte existující výpočetní soubor

Pokud upravujete nastavení pro stávající výpočetní zařízení, přepnutí do režimu Prostředí je zablokováno, pokud výpočetní zařízení nemá kompatibilní nastavení, jako jsou init skripty, clusterové knihovny nebo Docker. Pokud nejdřív odstraníte nekompatibilní nastavení, můžete pak upravit závislostní režim.

Pokud přepnete z prostředí do režimu clusterových knihoven, připojené notebooky si zachovají výběr prostředí, ale tyto možnosti se stanou neaktivními. Pokud přepnete výpočetní režim zpět do režimu Prostředí , tyto volby se opět aktivují.

Používejte prostředí v zápisníku

Pro použití prostředí v notebooku připojte notebook ke klasickému výpočetnímu zdroji, který používá závislostní režim Environments . Po připojení notebooku nakonfigurujte jeho závislosti v postranním panelu prostředíEnvironment.

Konfigurace prostředí notebooku z bočního panelu Prostředí na klasickém výpočetním zdroji, který využívá závislostní režim Prostředí.

Vyberte základní prostředí

Základní prostředí určuje předinstalované knihovny a verzi prostředí dostupné pro váš notebook. Výběr základního prostředí v podokně Prostředí je místo, kde zvolíte prostředí. Databricks doporučuje používat nejnovější verzi, aby bylo možné využívat nejnovější funkce poznámkového bloku. Pro podrobnosti o každé verzi prostředí viz Verze prostředí.

Selektor základního prostředí obsahuje následující možnosti:

  • Standard: Výchozí základní prostředí s knihovnami poskytovanými službou Databricks.
  • ML: Základní prostředí s Python a systémovými balíčky z Databricks Runtime pro Machine Learning předinstalované.
  • Další: Rozbalí a zobrazí další možnosti.
    • Předchozí verze standardních a ML prostředí.
    • Vlastní: Zadejte vlastní prostředí pomocí souboru YAML.
  • Pracovní prostředí: Uvádí všechna kompatibilní základní prostředí nakonfigurovaná pro váš pracovní prostor administrátory pracovního prostoru.

Přidání závislostí do poznámkového bloku

Azure Databricks ukládá virtuální prostředí poznámkového bloku do mezipaměti, takže závislosti se nepřeinstalují při každém opětovném otevření poznámkového bloku nebo obnovení po nečinnosti.

Postup individuální instalace závislosti:

  1. V sekci Závislosti zadejte cestu závislosti do pole a klikněte na +Přidat závislost. Závislost můžete zadat v libovolném formátu, který je platný v souboru requirements.txt . Soubory kol Pythonu nebo projekty Pythonu (například adresář obsahující a pyproject.toml nebo setup.py) se dají nacházet v souborech pracovního prostoru nebo ve svazcích katalogu Unity.

    • Pokud používáte soubor pracovního prostoru, měla by být cesta absolutní a začínat na /Workspace/.
    • Pokud používáte soubor ve svazku katalogu Unity, měla by být cesta v následujícím formátu: /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Kliknutím na Apply nainstalujte závislosti a restartujte proces Python.

Important

Neinstalujte PySpark ani žádnou knihovnu, která instaluje PySpark jako závislost na vašich noteboích. Pokud tak učiníte, zastavíte relaci a výsledkem bude chyba. Pokud k tomu dojde, odstraň knihovnu a resetuj prostředí.

Pro zobrazení nainstalovaných závislostí klikněte na záložku Installed v panelu Prostředí . Kliknutím na protokoly pip v dolní části podokna otevřete instalační protokoly pip pro prostředí poznámkového bloku.

Používejte prostředí v práci

Pro úlohy úloh, které běží na klasickém výpočetním zdroji používajícím závislostní režim Prostředí , nakonfigurujte závislosti pomocí specifikace pracovního prostředí. Pracovní prostředí specifikuje základní prostředí a jakékoli další závislosti, na které může odkazovat jedna nebo více úloh.

Chcete-li nakonfigurovat prostředí pro úlohu úkolu, proveďte následující kroky:

  1. Vytvořte nebo upravte úkol v práci.
  2. V části Compute vyberte existující klasický výpočetní prostředek, který používá režim závislostí Environments, nebo přidejte výpočetní prostředek pro klasické úlohy.
  3. Pokud přidáte klasické jobs compute, rozšířte Advanced.
  4. Klikněte na Dependencies.
  5. Pro režim závislostí vyberte Manuální a Prostředí, nebo nechte Automatické , pokud se to vyřeší na Prostředí.
  6. V nastavení Prostředí a knihovny v konfiguraci úlohy nakonfigurujte prostředí pro danou úlohu. Viz Konfigurace prostředí pro úlohy, kde najdete možnosti dostupné pro každý typ úlohy.

Úlohy běžící na klasickém výpočetním zdroji používajícím závislostní režim Environments nepodporují nastavení úloh Dependent libraries . Místo toho přidejte závislosti do prostředí.

Limitations

Režim závislostí Prostředí podporuje úlohy v Pythonu a závislosti v interaktivních poznámkových blocích a úkolech úloh. Platí následující omezení:

  • Úlohy Spark JAR nejsou podporovány na klasickém výpočetním zdroji, který používá závislostní režim Environments .
  • Spuštění %scala kódu se nezdaří.
  • Platí všechna standardní omezení přístupových režimů, včetně absence podpory pro R. Viz požadavky a omezení standardního výpočtu.

Nekompatibilní nastavení

Když je režim závislostí prostředí povolen, jsou zakázána následující výpočetní nastavení:

  • Docker (Azure Databricks Container Services)
  • Proměnné prostředí Spark
  • Inicializační skripty
  • Knihovny clusteru