Nastavenia správy pracovného priestoru pre dátové inžinierstvo v Microsoft Fabric

Vzťahuje sa na:✅ Fabric Data Engineering a dátová veda

Keď vytvoríte pracovný priestor v Fabric, štartovací pool, ktorý je s daným pracovným priestorom spojený, sa automaticky vytvorí. S zjednodušeným nastavením v Fabric nie je potrebné vyberať veľkosť uzlov alebo strojov, pretože tieto možnosti sú riešené za vás v pozadí. Táto konfigurácia poskytuje rýchlejšie (5 – 10 sekúnd) spustenie relácie Apache Spark pre používateľov, ktorí môžu začať a spúšťať pracovné miesta v Apache Spark v mnohých bežných scenároch bez toho, aby sa museli starať o nastavenie výpočtu. V prípade pokročilých scenárov so špecifickými požiadavkami na výpočet môžu používatelia vytvoriť vlastný fond Apache Spark a zväčšiť uzly podľa svojich potrieb týkajúcich sa výkonu.

Ak chcete v pracovnom priestore vykonať zmeny v nastaveniach Apache Spark, musíte mať rolu správcu pre tento pracovný priestor. Ďalšie informácie nájdete v téme Roly v pracovných priestoroch.

Ak chcete spravovať nastavenia služby Spark pre fond priradený k vášmu pracovnému priestoru:

  1. Prejdite do nastavení pracovného priestoru vo svojom pracovnom priestore a rozbaľte ponuku výberom možnosti Dátový inžinier ing/Science:

    Snímka obrazovky ukazujúca, kde vybrať Data Engineering v menu nastavení pracovného priestoru.

  2. V ponuke na ľavej strane sa zobrazí možnosť Spark Compute :

    Gif zobrazujúci rôzne časti výpočtov Apache Spark v nastaveniach pracovného priestoru.

    Poznámka

    Ak predvolený fond zmeníte z možnosti Starter Pool na vlastný fond spark, môže sa zobraziť dlhší začiatok relácie (~3 minúty).

Fond

Predvolený fond pre pracovný priestor

Môžete použiť automaticky vytvorený štartovací fond alebo vytvoriť vlastné fondy pre pracovný priestor.

  • Starter Pool: Vopred zhydrované dynamické bazény automaticky vytvorené pre vaše rýchlejšie používanie. Tieto klastre majú strednú veľkosť. Štartovací fond je nastavený na predvolenú konfiguráciu na základe zakúpenej jednotky SKU kapacity služby Fabric. Správcovia môžu prispôsobiť maximálne uzly a spustiteľných vykonávateľov na základe ich požiadaviek na vyťaženie služby Spark. Ďalšie informácie nájdete v téme Konfigurácia štartovacích bazénov

  • Vlastný fond spark: Na základe požiadaviek na prácu v službe Spark môžete nastaviť veľkosť uzlov, automatického škálovania a dynamického prideľovania vykonávateľov. Ak chcete vytvoriť vlastný fond spark, správca kapacity by mal povoliť možnosť Prispôsobiť fondy pracovných priestorov v časti Spark Compute v nastaveniach správcukapacity.

Poznámka

Ovládací prvok úrovne kapacity pre fondy prispôsobených pracovných priestorov je predvolene povolený. Ďalšie informácie nájdete v téme Konfigurácia a spravovanie nastavení dátového inžinierstva a dátovej vedy pre kapacity služby Fabric.

Správcovia môžu vytvoriť vlastné fondy Spark na základe svojich výpočtových požiadaviek výberom možnosti Nový fond .

Snímka obrazovky zobrazujúca možnosti vytvorenia vlastného fondu.

Apache Spark for Fabric podporuje klastre s jedným uzlom, čo umožňuje používateľom zvoliť minimálnu konfiguráciu uzla 1, v takom prípade ovládač a vykonávateľ bežia v jednom uzle. Tieto klastre s jedným uzlom ponúkajú regenerovateľnú vysokú dostupnosť počas zlyhaní uzlov a lepšiu spoľahlivosť práce pre vyťaženia s menšími výpočtovými požiadavkami. Môžete tiež povoliť alebo zakázať možnosť automatického škálovania pre vlastné fondy Spark. Keď je táto možnosť povolená pomocou automatického škálovania, fond získa nové uzly v rámci maximálneho limitu uzla, ktorý zadal používateľ, a po vykonaní úlohy ho vymaže do dôchodku, aby bol lepší výkon.

Môžete tiež vybrať možnosť dynamického prideľovania vykonávateľov tak, aby automaticky vytvorili optimálny počet vykonávateľov v rámci maximálneho objemu určeného na základe objemu údajov pre lepší výkon.

Snímka obrazovky znázorňujúca možnosti vytvorenia vlastného fondu na automatické škálovanie a dynamické prideľovanie.

Ďalšie informácie o výpočte služby Apache Spark pre službu Fabric.

  • Prispôsobenie konfigurácie výpočtových položiek: Ako správca pracovného priestoru môžete používateľom povoliť upravovať výpočtové konfigurácie (vlastnosti na úrovni relácie, ktoré zahŕňajú Ovládač/Spustiteľné jadro, pamäť ovládača/vykonávača) pre jednotlivé položky, ako sú poznámkové bloky, definície úloh spark pomocou prostredia.

Snímka obrazovky zobrazujúca prepínač na prispôsobenie výpočtov pre položky.

Ak správca pracovného priestoru toto nastavenie vypne, predvolený fond a jeho výpočtové konfigurácie sa použijú pre všetky prostredia v pracovnom priestore.

Životné prostredie

Prostredie poskytuje flexibilné konfigurácie na spúšťanie úloh v službe Spark (notebooky, definície úloh Spark). V prostredí môžete nakonfigurovať vlastnosti výpočtu, vybrať rôzne závislosti balíka knižnice runtime a nastaviť knižnicu na základe požiadaviek na vyťaženie.

Na karte prostredia máte možnosť nastaviť predvolené prostredie. Môžete si vybrať, ktorú verziu Služby Spark chcete použiť pre pracovný priestor.

Ako správca pracovného priestoru služby Fabric môžete ako predvolené prostredie vybrať prostredie.

Môžete tiež vytvoriť nový prostredníctvom rozbaľovacieho zoznamu Prostredie .

Snímka obrazovky vytvorenia prostredia prostredníctvom rozbaľovacieho zoznamu príloh v nastavení WS.

Ak zakážete možnosť mať predvolené prostredie, máte možnosť vybrať verziu runtime služby Fabric z dostupných verzií modulu runtime uvedených v rozbaľovacom zozname.

Snímka obrazovky znázorňujúca, kde vybrať verziu modulu runtime.

Ďalšie informácie o moduloch runtime služby Apache Spark.

Úlohy

Nastavenia úloh umožňujú správcom kontrolovať logiku prijímania úloh pre všetky úlohy v službe Spark v pracovnom priestore.

Snímka obrazovky zobrazujúca nastavenia úloh.

Predvolene sú všetky pracovné priestory povolené pri prijatí na optimistickú prácu. Zistite viac o prijímaní do práce v Spark in Fabric.

Môžete povoliť, aby maximálne rezervné jadrá pre aktívne úlohy Spark vypli prístup založený na optimistickom prijatí do zamestnania a maximálne jadrá rezerv pre ich úlohy v Spark.

Môžete tiež nastaviť časový limit relácie Spark a prispôsobiť uplynutie platnosti relácie pre všetky interaktívne relácie poznámkového bloku.

Poznámka

Predvolená doba platnosti relácie je nastavená na 20 minút pre interaktívne relácie služby Spark.

Nastavte maximálnu životnosť práce

Použite nastavenie Nastaviť maximálnu životnosť úlohy ako zábranu, ktorá zabráni tomu, aby Spark úlohy spotrebovávali výpočtovú kapacitu nad stanovený časový limit. Keď zapnete toto nastavenie a určíte trvanie, Fabric automaticky ukončí akúkoľvek oprávnenú Spark úlohu, ktorá beží dlhšie ako je nastavená životnosť. Administrátori pracovného priestoru môžu túto kontrolu použiť na:

  • Zastavte utekajúce alebo zaseknuté práce skôr, než udržia kapacitu na neurčito, a zablokujte ďalšie pracovné záťaže v pracovnom priestore.
  • Vynucujte pravidlá výpočtovej súladu a správy tým, že obmedzíte, ako dlho môže bežať jednotlivá úloha.

Snímka obrazovky zobrazujúca nastavenie maximálnej životnosti úlohy v záložke Jobs v nastaveniach pracovného priestoru.

Na jeho konfiguráciu zapnite Nastaviť maximálnu životnosť úlohy, zadajte hodnotu, vyberte časovú jednotku, napríklad hodiny, a potom vyberte Uložiť , aby ste obmedzenie aplikovali na pracovný priestor.

Ktoré pracovné miesta sú ovplyvnené

Maximálna životnosť práce sa vzťahuje iba na úlohy odosielané používateľom – úlohy, ktoré používateľ explicitne začína a ktoré bežia s jeho identitou. Tieto pracovné miesta zahŕňajú napríklad:

  • Interaktívne a plánované behy notebookov, vrátane behov notebookov orchestrálne cez pipeline.
  • Definícia úlohy v Spark beží, či už ich posielate priamo, podľa harmonogramu alebo cez pipeline.
  • Livy dávkové a interaktívne relácie, vrátane relácií s vysokou súbežnosťou.

Systémovo spravované úlohy nie sú týmto nastavením ovplyvnené a pokračujú v behu až do konca. Tieto úlohy spúšťa a spravuje Fabric vo vašom mene, napríklad:

  • Údržba stola v Lakehouse, ako je optimalizácia a vysávanie.
  • Materializované osvieženie pohľadu na jazero.
  • Prevádzka platforiem, ako je bezpečnosť a presadzovanie politík.

Tento rozdiel zabezpečuje, že údržba na pozadí a prevádzka platformy, ktoré udržiavajú vaše dáta a pracovný priestor zdravé, nie sú prerušené, zatiaľ čo používateľské záťaže zostávajú pod ochranným rámom.

Poznámka

Keď úloha dosiahne nastavenú maximálnu životnosť, Fabric ju automaticky zruší. Nastavte si limit, ktorý umožní dostatok času na dokončenie vašich najdlhšie fungujúcich legitímnych používateľských úloh.

Vysoká súbežnosť

Režim vysokej súbežnosti umožňuje používateľom zdieľať rovnaké relácie Spark v dátovom inžinierstve a vyťažení dátovej vedy služby Apache Spark for Fabric. Položka ako poznámkový blok používa na vykonanie reláciu služby Spark a keď je povolená, používatelia môžu zdieľať jednu reláciu služby Spark vo viacerých poznámkových blokoch.

Snímka obrazovky zobrazujúca stránku s nastaveniami vysokej súbežnosti.

Ďalšie informácie o vysokej súbežnosti v službe Apache Spark for Fabric.

Automatické logovanie pre modely a experimenty Machine Learning

Správcovia teraz môžu povoliť automatické označovanie pre svoje modely strojového učenia a experimenty. Táto možnosť automaticky zaznamenáva hodnoty vstupných parametrov, výstupných metrík a výstupných položiek modelu strojového učenia počas jeho trénovania. Ďalšie informácie o automatickom označovaní.

Snímka obrazovky zobrazujúca stránku s nastaveniami automatického odbavenia.