Poznámka
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete sa skúsiť prihlásiť alebo zmeniť adresáre.
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete skúsiť zmeniť adresáre.
Vzťahuje sa na:✅ Fabric Data Engineering a dátová veda
Keď vytvoríte pracovný priestor v Fabric, štartovací pool, ktorý je s daným pracovným priestorom spojený, sa automaticky vytvorí. S zjednodušeným nastavením v Fabric nie je potrebné vyberať veľkosť uzlov alebo strojov, pretože tieto možnosti sú riešené za vás v pozadí. Táto konfigurácia poskytuje rýchlejšie (5 – 10 sekúnd) spustenie relácie Apache Spark pre používateľov, ktorí môžu začať a spúšťať pracovné miesta v Apache Spark v mnohých bežných scenároch bez toho, aby sa museli starať o nastavenie výpočtu. V prípade pokročilých scenárov so špecifickými požiadavkami na výpočet môžu používatelia vytvoriť vlastný fond Apache Spark a zväčšiť uzly podľa svojich potrieb týkajúcich sa výkonu.
Ak chcete v pracovnom priestore vykonať zmeny v nastaveniach Apache Spark, musíte mať rolu správcu pre tento pracovný priestor. Ďalšie informácie nájdete v téme Roly v pracovných priestoroch.
Ak chcete spravovať nastavenia služby Spark pre fond priradený k vášmu pracovnému priestoru:
Prejdite do nastavení pracovného priestoru vo svojom pracovnom priestore a rozbaľte ponuku výberom možnosti Dátový inžinier ing/Science:
V ponuke na ľavej strane sa zobrazí možnosť Spark Compute :
Poznámka
Ak predvolený fond zmeníte z možnosti Starter Pool na vlastný fond spark, môže sa zobraziť dlhší začiatok relácie (~3 minúty).
Fond
Predvolený fond pre pracovný priestor
Môžete použiť automaticky vytvorený štartovací fond alebo vytvoriť vlastné fondy pre pracovný priestor.
Starter Pool: Vopred zhydrované dynamické bazény automaticky vytvorené pre vaše rýchlejšie používanie. Tieto klastre majú strednú veľkosť. Štartovací fond je nastavený na predvolenú konfiguráciu na základe zakúpenej jednotky SKU kapacity služby Fabric. Správcovia môžu prispôsobiť maximálne uzly a spustiteľných vykonávateľov na základe ich požiadaviek na vyťaženie služby Spark. Ďalšie informácie nájdete v téme Konfigurácia štartovacích bazénov
Vlastný fond spark: Na základe požiadaviek na prácu v službe Spark môžete nastaviť veľkosť uzlov, automatického škálovania a dynamického prideľovania vykonávateľov. Ak chcete vytvoriť vlastný fond spark, správca kapacity by mal povoliť možnosť Prispôsobiť fondy pracovných priestorov v časti Spark Compute v nastaveniach správcukapacity.
Poznámka
Ovládací prvok úrovne kapacity pre fondy prispôsobených pracovných priestorov je predvolene povolený. Ďalšie informácie nájdete v téme Konfigurácia a spravovanie nastavení dátového inžinierstva a dátovej vedy pre kapacity služby Fabric.
Správcovia môžu vytvoriť vlastné fondy Spark na základe svojich výpočtových požiadaviek výberom možnosti Nový fond .
Apache Spark for Fabric podporuje klastre s jedným uzlom, čo umožňuje používateľom zvoliť minimálnu konfiguráciu uzla 1, v takom prípade ovládač a vykonávateľ bežia v jednom uzle. Tieto klastre s jedným uzlom ponúkajú regenerovateľnú vysokú dostupnosť počas zlyhaní uzlov a lepšiu spoľahlivosť práce pre vyťaženia s menšími výpočtovými požiadavkami. Môžete tiež povoliť alebo zakázať možnosť automatického škálovania pre vlastné fondy Spark. Keď je táto možnosť povolená pomocou automatického škálovania, fond získa nové uzly v rámci maximálneho limitu uzla, ktorý zadal používateľ, a po vykonaní úlohy ho vymaže do dôchodku, aby bol lepší výkon.
Môžete tiež vybrať možnosť dynamického prideľovania vykonávateľov tak, aby automaticky vytvorili optimálny počet vykonávateľov v rámci maximálneho objemu určeného na základe objemu údajov pre lepší výkon.
Ďalšie informácie o výpočte služby Apache Spark pre službu Fabric.
- Prispôsobenie konfigurácie výpočtových položiek: Ako správca pracovného priestoru môžete používateľom povoliť upravovať výpočtové konfigurácie (vlastnosti na úrovni relácie, ktoré zahŕňajú Ovládač/Spustiteľné jadro, pamäť ovládača/vykonávača) pre jednotlivé položky, ako sú poznámkové bloky, definície úloh spark pomocou prostredia.
Ak správca pracovného priestoru toto nastavenie vypne, predvolený fond a jeho výpočtové konfigurácie sa použijú pre všetky prostredia v pracovnom priestore.
Životné prostredie
Prostredie poskytuje flexibilné konfigurácie na spúšťanie úloh v službe Spark (notebooky, definície úloh Spark). V prostredí môžete nakonfigurovať vlastnosti výpočtu, vybrať rôzne závislosti balíka knižnice runtime a nastaviť knižnicu na základe požiadaviek na vyťaženie.
Na karte prostredia máte možnosť nastaviť predvolené prostredie. Môžete si vybrať, ktorú verziu Služby Spark chcete použiť pre pracovný priestor.
Ako správca pracovného priestoru služby Fabric môžete ako predvolené prostredie vybrať prostredie.
Môžete tiež vytvoriť nový prostredníctvom rozbaľovacieho zoznamu Prostredie .
Ak zakážete možnosť mať predvolené prostredie, máte možnosť vybrať verziu runtime služby Fabric z dostupných verzií modulu runtime uvedených v rozbaľovacom zozname.
Ďalšie informácie o moduloch runtime služby Apache Spark.
Úlohy
Nastavenia úloh umožňujú správcom kontrolovať logiku prijímania úloh pre všetky úlohy v službe Spark v pracovnom priestore.
Predvolene sú všetky pracovné priestory povolené pri prijatí na optimistickú prácu. Zistite viac o prijímaní do práce v Spark in Fabric.
Môžete povoliť, aby maximálne rezervné jadrá pre aktívne úlohy Spark vypli prístup založený na optimistickom prijatí do zamestnania a maximálne jadrá rezerv pre ich úlohy v Spark.
Môžete tiež nastaviť časový limit relácie Spark a prispôsobiť uplynutie platnosti relácie pre všetky interaktívne relácie poznámkového bloku.
Poznámka
Predvolená doba platnosti relácie je nastavená na 20 minút pre interaktívne relácie služby Spark.
Nastavte maximálnu životnosť práce
Použite nastavenie Nastaviť maximálnu životnosť úlohy ako zábranu, ktorá zabráni tomu, aby Spark úlohy spotrebovávali výpočtovú kapacitu nad stanovený časový limit. Keď zapnete toto nastavenie a určíte trvanie, Fabric automaticky ukončí akúkoľvek oprávnenú Spark úlohu, ktorá beží dlhšie ako je nastavená životnosť. Administrátori pracovného priestoru môžu túto kontrolu použiť na:
- Zastavte utekajúce alebo zaseknuté práce skôr, než udržia kapacitu na neurčito, a zablokujte ďalšie pracovné záťaže v pracovnom priestore.
- Vynucujte pravidlá výpočtovej súladu a správy tým, že obmedzíte, ako dlho môže bežať jednotlivá úloha.
Na jeho konfiguráciu zapnite Nastaviť maximálnu životnosť úlohy, zadajte hodnotu, vyberte časovú jednotku, napríklad hodiny, a potom vyberte Uložiť , aby ste obmedzenie aplikovali na pracovný priestor.
Ktoré pracovné miesta sú ovplyvnené
Maximálna životnosť práce sa vzťahuje iba na úlohy odosielané používateľom – úlohy, ktoré používateľ explicitne začína a ktoré bežia s jeho identitou. Tieto pracovné miesta zahŕňajú napríklad:
- Interaktívne a plánované behy notebookov, vrátane behov notebookov orchestrálne cez pipeline.
- Definícia úlohy v Spark beží, či už ich posielate priamo, podľa harmonogramu alebo cez pipeline.
- Livy dávkové a interaktívne relácie, vrátane relácií s vysokou súbežnosťou.
Systémovo spravované úlohy nie sú týmto nastavením ovplyvnené a pokračujú v behu až do konca. Tieto úlohy spúšťa a spravuje Fabric vo vašom mene, napríklad:
- Údržba stola v Lakehouse, ako je optimalizácia a vysávanie.
- Materializované osvieženie pohľadu na jazero.
- Prevádzka platforiem, ako je bezpečnosť a presadzovanie politík.
Tento rozdiel zabezpečuje, že údržba na pozadí a prevádzka platformy, ktoré udržiavajú vaše dáta a pracovný priestor zdravé, nie sú prerušené, zatiaľ čo používateľské záťaže zostávajú pod ochranným rámom.
Poznámka
Keď úloha dosiahne nastavenú maximálnu životnosť, Fabric ju automaticky zruší. Nastavte si limit, ktorý umožní dostatok času na dokončenie vašich najdlhšie fungujúcich legitímnych používateľských úloh.
Vysoká súbežnosť
Režim vysokej súbežnosti umožňuje používateľom zdieľať rovnaké relácie Spark v dátovom inžinierstve a vyťažení dátovej vedy služby Apache Spark for Fabric. Položka ako poznámkový blok používa na vykonanie reláciu služby Spark a keď je povolená, používatelia môžu zdieľať jednu reláciu služby Spark vo viacerých poznámkových blokoch.
Ďalšie informácie o vysokej súbežnosti v službe Apache Spark for Fabric.
Automatické logovanie pre modely a experimenty Machine Learning
Správcovia teraz môžu povoliť automatické označovanie pre svoje modely strojového učenia a experimenty. Táto možnosť automaticky zaznamenáva hodnoty vstupných parametrov, výstupných metrík a výstupných položiek modelu strojového učenia počas jeho trénovania. Ďalšie informácie o automatickom označovaní.
Súvisiaci obsah
- Prečítajte si o apache Spark Runtimes v službe Fabric – prehľad, tvorba verzií, podpora viacerých modulov runtime a inovácia protokolu Delta Lake.
- Ďalšie informácie nájdete v verejnej dokumentácii k Apache Spark.
- Vyhľadajte odpovede na najčastejšie otázky: Najčastejšie otázky o spravovaní pracovného priestoru Apache Spark.