Nastavení správy prostředí pro práci s daty v Microsoft Fabric

Platí pro:✅ Datové inženýrství a datové vědy ve Fabricu

Když vytvoříte pracovní prostor ve Fabric, automaticky se vytvoří startovací pool, který je s tímto pracovním prostorem spojen. S jednodušším nastavením ve Fabric není potřeba vybírat velikost uzlů nebo strojů, protože tyto možnosti řešíte za vás až na pozadí. Tato konfigurace poskytuje rychlejší (5 až 10sekundové) prostředí spuštění relace Apache Sparku pro uživatele, aby mohli začít a spouštět úlohy Apache Sparku v mnoha běžných scénářích, aniž byste se museli starat o nastavení výpočetních prostředků. V případě pokročilých scénářů s konkrétními požadavky na výpočetní prostředky můžou uživatelé vytvořit vlastní fond Apache Sparku a nastavit velikost uzlů na základě jejich požadavků na výkon.

Pokud chcete provést změny nastavení Apache Sparku v pracovním prostoru, měli byste mít pro tento pracovní prostor roli správce. Další informace najdete v tématu Role v pracovních prostorech.

Správa nastavení Sparku pro fond přidružený k vašemu pracovnímu prostoru:

  1. Přejděte do nastavení pracovního prostoru a vyberte možnost Datové inženýrství/Věda pro rozbalení nabídky:

    Screenshot ukazující, kde vybrat Data Engineering v nastavení pracovního prostoru.

  2. V nabídce vlevo se zobrazí možnost Spark Compute :

    Gif znázorňující různé části výpočetních prostředků Apache Sparku v nastavení pracovního prostoru

    Poznámka:

    Pokud změníte výchozí fond ze Starter Pool na vlastní fond Sparku, může trvat delší dobu spuštění relace (přibližně 3 minuty).

Fond

Výchozí fond pro pracoviště

Můžete použít automaticky vytvořený počáteční fond nebo vytvořit vlastní fondy pro pracovní prostor.

  • Startovací pool: Předem hydratované živé pooly se automaticky vytvářejí pro vaše rychlejší používání. Tyto clustery mají střední velikost. Startovní fond je nastavený na výchozí konfiguraci na základě zakoupené SKU kapacity Fabric. Správci můžou přizpůsobit maximální počet uzlů a exekutorů na základě požadavků na škálování úloh Sparku. Další informace naleznete v tématu Konfigurace úvodních fondů

  • Vlastní fond Spark: Můžete nastavit velikost uzlů, automatické škálování a dynamické přidělování spouštěčů na základě požadavků vaší úlohy Spark. Pokud chcete vytvořit vlastní fond Spark, správce kapacity by měl povolit možnost Přizpůsobené fondy pracovního prostoru v Spark Compute části nastavení Správce kapacity.

Poznámka:

Řízení kapacity pro přizpůsobené fondy pracovních prostorů je ve výchozím nastavení povolené. Další informace najdete v tématu Konfigurace a správa nastavení datového inženýrství a datových věd pro kapacity služby Fabric.

Správci můžou vytvářet vlastní fondy Sparku na základě svých požadavků na výpočetní prostředky výběrem možnosti Nový fond .

Snímek obrazovky s možnostmi vytvoření vlastního fondu

Apache Spark for Fabric podporuje clustery s jedním uzlem, což uživatelům umožňuje zvolit minimální konfiguraci uzlu 1, v takovém případě ovladač a executor běží v jednom uzlu. Tyto clustery s jedním uzlem nabízejí obnovitelnou vysokou dostupnost během selhání uzlů a lepší spolehlivost úloh pro úlohy s menšími požadavky na výpočetní prostředky. Můžete také povolit nebo zakázat možnost automatického škálování pro vlastní fondy Sparku. Pokud je povoleno automatické škálování, fond získá nové uzly v rámci maximálního limitu uzlu určeného uživatelem a vyřadí je po spuštění úlohy, aby byl výkon lepší.

Můžete také vybrat možnost dynamicky přidělit optimální počet exekutorů do fondu automaticky v rámci maximálního stanoveného limitu na základě objemu dat pro vyšší výkonnost.

Snímek obrazovky znázorňující možnosti vytvoření vlastního fondu pro automatické škálování a dynamické přidělování

Zjistěte více o výpočetních prostředcích Apache Spark pro Fabric.

  • Přizpůsobení konfigurace výpočetních prostředků pro položky: Jako správce pracovního prostoru můžete uživatelům povolit úpravu výpočetních konfigurací (vlastnosti na úrovni relace, které zahrnují Driver/Executor Core, Driver/Executor Memory) pro jednotlivé položky, jako jsou poznámkové bloky, definice úloh Sparku pomocí prostředí.

Snímek obrazovky s přepínačem pro přizpůsobení výpočtů položek.

Pokud správce pracovního prostoru toto nastavení vypne, použije se výchozí fond a jeho konfigurace výpočetních prostředků pro všechna prostředí v pracovním prostoru.

Prostředí

Prostředí poskytuje flexibilní konfigurace pro spouštění úloh Sparku (poznámkové bloky, definice úloh Sparku). V prostředí můžete nakonfigurovat vlastnosti výpočetních prostředků, vybrat jiný modul runtime, nastavit závislosti balíčků knihoven na základě vašich požadavků na úlohy.

Na kartě prostředí máte možnost nastavit výchozí prostředí. Můžete zvolit, jakou verzi Sparku chcete pro pracovní prostor použít.

Jako správce pracovního prostoru Fabric můžete vybrat prostředí jako výchozí prostředí pracovního prostoru.

Nový můžete vytvořit také v rozevíracím seznamu Prostředí .

Snímek obrazovky s procesem vytváření prostředí prostřednictvím rozevíracího seznamu příloh v nastavení WS

Pokud zakážete možnost mít výchozí prostředí, máte možnost vybrat verzi Fabric runtime z dostupných verzí modulu runtime uvedených v rozevíracím seznamu.

Snímek obrazovky znázorňující, kde vybrat verzi modulu runtime

Přečtěte si další informace o runtimách Apache Sparku.

Úlohy

Nastavení úloh umožňuje správcům řídit logiku přijímání úloh pro všechny úlohy Sparku v daném pracovním prostoru.

Snímek obrazovky s nastavením úloh

Ve výchozím nastavení jsou u všech pracovních prostorů povolené optimistické přidělování úloh. Zjistěte více o přijímání do Spark in Fabric.

Můžete povolit rezervaci maximálního počtu jader pro aktivní úlohy Spark k vypnutí přístupu založeného na optimistickém přístupu a rezervovat maximální počet jader pro úlohy Spark.

Můžete také nastavit časový limit relace Sparku, abyste přizpůsobili vypršení platnosti relace pro všechny interaktivní relace poznámkového bloku.

Poznámka:

Výchozí vypršení platnosti relace je pro interaktivní relace Sparku nastavené na 20 minut.

Nastavte maximální dobu trvání práce

Použijte nastavení Nastavit maximální životnost práce jako zábranu, která zabrání nekontrolovatelným Spark úlohám spotřebovávat výpočetní výkon nad stanovený časový limit. Když zapnete toto nastavení a určíte délku trvání, Fabric automaticky ukončí jakoukoli způsobilou Spark úlohu, která běží déle než je nastavená životnost. Administrátoři pracovního prostoru mohou tuto kontrolu využít k:

  • Zastavte nekontrolované nebo zaseknuté práce dřív, než udrží kapacitu na neurčito, a zablokujte další pracovní zátěže v pracovním prostoru.
  • Vynucujte zásady compliance a správy výpočetního výkonu tím, že omezíte, jak dlouho může běžet jednotlivá úloha.

Screenshot ukazující nastavení maximální životnosti práce v záložce Jobs v nastavení pracovního prostoru.

Pro konfiguraci zapněte Nastavit maximální životnost úkolu, zadejte hodnotu, vyberte časovou jednotku, například hodiny, a poté zvolte Uložit , abyste limit aplikovali na pracovní prostor.

Která pracovní místa jsou ovlivněna

Maximální životnost úkolu se vztahuje pouze na úkoly odeslané uživatelem – úkoly, které uživatel explicitně zahajuje a které běží s jeho identitou. Tyto práce zahrnují například:

  • Interaktivní a plánované běhy notebooků, včetně běhů notebooků orchestrálně řízených pipeline.
  • Definice práce ve Sparku běží, ať už je odesíláte přímo, podle plánu, nebo přes pipeline.
  • Livy dávkové a interaktivní sezení, včetně relací s vysokou souběžností.

Systémově spravované úlohy nejsou tímto nastavením ovlivněny a pokračují v dokončení dokončení. Tyto úkoly jsou spouštěny a spravovány Fabric vaším jménem, například:

  • Údržba stolů v Lakehouse, jako je optimalizace a vysávání.
  • Materializované osvěžení výhledu na jezero.
  • Provoz na platformě, například bezpečnost a vymáhání politik.

Tento rozdíl zajišťuje, že údržba na pozadí a provoz platformy, který udržuje vaše data a pracovní prostor zdravé, nejsou přerušovány, zatímco uživatelské zátěže zůstávají pod ochrannou zábranou.

Poznámka:

Když úkol dosáhne nastavené maximální životnosti, Fabric jej automaticky zruší. Nastavte si limit, který umožní dost času na dokončení vašich nejdéle fungujících legitimních uživatelských úloh.

Vysoká souběžnost

Režim vysoké souběžnosti umožňuje uživatelům sdílet stejné Spark relace v rámci Apache Spark pro úlohy datového inženýrství a datové vědy. Položka, jako je poznámkový blok, používá ke spuštění relaci Sparku a když je tato možnost povolená, umožňuje uživatelům sdílet jednu relaci Sparku napříč několika poznámkovými bloky.

Snímek obrazovky se stránkou nastavení vysoké souběžnosti

Přečtěte si další informace o vysoké souběžnosti v Apache Sparku for Fabric.

Automatické protokolování pro modely a experimenty Machine Learning

Správci teď můžou povolit automatické protokolování pro své modely a experimenty strojového učení. Tato možnost automaticky zaznamenává hodnoty vstupních parametrů, výstupních metrik a výstupních položek modelu strojového učení při trénování. Přečtěte si další informace o automatickémlogování.

Snímek obrazovky se stránkou nastavení autologu