Správa vyťaženia

Vzťahuje sa na:✅ koncový bod analýzy SQL a sklad v službe Microsoft Fabric

Tento článok popisuje architektúru a riadenie pracovnej záťaže v Fabric Data Warehouse.

Spracovanie údajov

Koncový bod analýzy Warehouse a SQL zdieľa rovnakú základnú architektúru spracovania. Keď Fabric získava alebo prijíma dáta, distribuovaný engine spracováva malé aj veľké dáta a výpočtové funkcie.

Systém spracovania nie je bezserverový v tom, že serverová výpočtová kapacita sa škáluje autonómne tak, aby spĺňala požiadavky na vyťaženie.

Diagram nástroja SQL.

Pri odoslaní dotazu vykoná klientska verzia SQL (FE) optimalizáciu dotazu s cieľom určiť najlepší plán na základe veľkosti údajov a zložitosti. Keď je plán vygenerovaný, je odovzdaný motoru Distributed Query Processing (DQP). DirectQuery zosúlaďuje distribuované vykonanie dotazu tak, že ho rozdelí na menšie dotazy, ktoré sa vykonávajú na serverových výpočtových uzloch. Každý malý dotaz je úloha a predstavuje distribuovanú vykonávaciu jednotku. Číta súbory z OneLake, pripája sa k výsledkom z iných úloh, skupín alebo objednáva údaje získané z iných úloh. V prípade úloh príjmu zapisuje údaje aj do správnych cieľových tabuliek.

Pri spracovaní údajov sa výsledky vrátia na klientske servery SQL, aby sa vrátili používateľovi alebo volajúcemu aplikácii.

Pružnosť a odolnosť

Serverová výpočtová kapacita využíva architektúru rýchleho poskytovania prostriedkov. Aj keď neexistuje SLA pri priraďovaní zdrojov, zvyčajne sa nové uzly získavajú do niekoľkých sekúnd. S rastom dopytu po zdrojoch používajú nové vyťaženia kapacitu, ktorá je škálovaná. Škálovanie je online operácia a spracovanie dotazov neprerušuje.

Diagram, ktorý znázorňuje rýchle poskytovanie prostriedkov.

Systém je odolný voči chybám a ak uzol sa stáva nezdravým, operácie vykonávajúce na uzle sú prerozdelené na zdravé uzly na dokončenie.

Skladové a SQL analytické endpointy poskytujú burstovateľnú kapacitu , ktorá umožňuje záťažiam využívať viac zdrojov na dosiahnutie lepšieho výkonu, a využívajú vyhladzovanie na úľavu pre zákazníkov, ktorí počas špičky vytvárajú náhle výkyvy a v iných časoch majú nevyužitú kapacitu v nečinnosti. Vyrovnávanie zjednodušuje riadenie kapacít rozšírením vyhodnocovania výpočtov, aby sa zabezpečilo plynulé a efektívne spúšťanie úloh zákazníkov.

Plánovanie a opätovné získavanie

Distribuovaný plánovač spracovania dotazov funguje na úrovni úlohy . Dotazy sú pre plánovača uvedené ako cielený acyklický graf úloh. Tento koncept je známy pre používateľov služby Spark. DAG umožňuje paralelizmus a súbežnosť, keďže úlohy, ktoré na sebe nezávisia, môžu byť vykonávané súčasne alebo v inom poradí.

Ako dotazy prichádzajú, ich úlohy sú naplánované na základe princípov first-in-first-out (FIFO). Ak je kapacita nevyužitá, plánovač môže použiť prístup "najlepšieho prispôsobenia" na optimalizáciu súbežnosti.

Keď plánovač identifikuje tlak na opätovné získavanie, vyvolá operáciu mierky. Škálovanie sa spravuje autonómne a backend topológia rastie s rastom súbežnosti. Keďže získavanie uzlov trvá niekoľko sekúnd, systém nie je optimalizovaný na konzistentný výkon podsekundy dotazov, ktoré vyžadujú distribuované spracovanie.

Keď tlak ustupuje, serverová topológia opäť zväčšuje a uvoľní zdroje späť do oblasti.

Izolácia výpočtového bazéna

Vzťahuje sa na:✅ Warehouse v službe Microsoft Fabric

Kapacita SKU priradená pracovnému priestoru určuje celkovú výpočtovú kapacitu dostupnú pre jeho SQL analytický endpoint. Tento výpočet je rovnomerne rozdelený (50/50) do dvoch izolovaných zdrojov pre používateľské dotazy:

  • SELECT Pool - Rieši všetky SELECT dotazy.
  • Non-SELECT Pool - Rieši všetky ne-dotazySELECT , ako sú ETL alebo ingestion operácie.

Každý pool škáluje nezávisle podľa požiadaviek na dotazy, ale nikdy neprekročí 50% celkovej výpočtovej kapacity pre SQL analytický endpoint. Toto oddelenie zabraňuje konkurencii zdrojov, čím zabezpečuje, že príjmové záťaže bežia na dedikovaných výpočtoch optimalizovaných pre ETL bez ovplyvnenia čítacích dotazov. Výsledkom je zlepšený výkon a spoľahlivosť pre oba typy dotazov.

Diagram, ktorý zobrazuje izoláciu aktivít príjmu.

Poznámka

Izolácia SELECT a ne-poolSELECT je predvolené autonómne riadenie pracovnej záťaže aplikované na každý pracovný priestor. Administrátori pracovného priestoru si však môžu toto prispôsobiť pomocou vlastných SQL poolov.

Relácie

Koncový bod analýzy Warehouse a SQL má limit relácie používateľa 2 048 na pracovný priestor. Keď sa dosiahne tento limit, vráti sa chyba: The user session limit for the workspace is 2048 and has been reached.

Poznámka

Keďže služba Microsoft Fabric je platformou SaaS, existuje mnoho systémových pripojení, ktoré sú spustené na nepretržitú optimalizáciu prostredia. Zobrazenia dynamickej správy zobrazujú relácie systému aj používateľov. Ďalšie informácie nájdete v téme Monitorovanie pripojení, relácií a požiadaviek pomocou zobrazenia dynamickej správy.

Osvedčené postupy

Pracovný priestor služby Microsoft Fabric poskytuje prirodzenú oddeľovanú hranicu distribuovaného výpočtového systému. Vyťaženia môžu túto hranicu využiť na spravovanie nákladov aj výkonu.

Skratky OneLake možno používať na vytvorenie replík tabuliek iba na čítanie v iných pracovných priestoroch na distribúciu načítania v rámci viacerých strojov SQL, čím sa vytvorí oddeľovateľná hranica. Môže sa tým efektívne zvýšiť maximálny počet relácií vykonávajúcich dotazy iba na čítanie.

Diagram znázorňujúci izoláciu dvoch pracovných priestorov, napríklad pracovného priestoru Financie a Marketing.