Poznámka
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete sa skúsiť prihlásiť alebo zmeniť adresáre.
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete skúsiť zmeniť adresáre.
Fabric Runtime poskytuje bezproblémovú integráciu v rámci ekosystému Fabric a ponúka robustné prostredie pre projekty dátového inžinierstva a dátovej vedy poháňané Apache Sparkom.
Tento článok predstavuje Fabric Runtime 2.0, najnovší všeobecne dostupný runtime navrhnutý pre výpočty veľkých dát v Microsoft Fabric. Zdôrazňuje kľúčové funkcie a komponenty, ktoré robia toto vydanie významným krokom vpred pre škálovateľnú analytiku a pokročilé pracovné zaťaženia.
Fabric Runtime 2.0 zahŕňa nasledujúce komponenty a vylepšenia navrhnuté na zlepšenie vašich schopností spracovania dát:
- Apache Spark 4.1
- Operačný systém: Azure Linux 3.0 (Mariner 3.0)
- Java: 21
- Scala: 2.13
- Python: 3.13
- Delta Lake: 4,2
- R: 4.5.2
Dôležité
Tím Fabric pripravuje aktualizáciu pre Fabric Runtime 2.0. V rámci tejto aktualizácie prináša aktualizácia Python zásadnú zmenu pre zákazníkov používajúcich environmentálne položky s python a knižnicami kolies. Zákazníci vidia jednu z dvoch chybových hlásení pri vykonávaní definície úlohy v notebooku alebo Spark:
- Chyba: varovanie: 1 zrušenie (od verzie 2.13.0); pre podrobnosti povolte
:setting -deprecationalebo:replay -deprecationZdroj: SparkCoreService. - "LibraryManagementError": "Bola zistená aktualizácia základného prostredia Spark Python. Prosím, znovu zverejnite životné prostredie.|UserError"
Potrebné kroky
Znovu publikujte svoje prostredie (vrátane knižníc). Aby ste to dosiahli, odstráňte všetky knižnice, publikujte prostredie, znovu pridajte všetky knižnice a publikujte znova. Tento proces znovu vytvorí prostredie pomocou aktualizovaného Python runtime a vyrieši problém.
Prepitné
Fabric Runtime 2.0 obsahuje podporu pre Native Execution Engine, ktorý môže výrazne zlepšiť výkon bez vyšších nákladov. Natívny výkonný engine môžete povoliť na úrovni prostredia, aby všetky úlohy a notebooky automaticky zdedili vylepšené výkonnostné schopnosti.
Povoliť Runtime 2.0
Runtime 2.0 môžete povoliť buď na úrovni pracovného priestoru, alebo na úrovni predmetu prostredia. Použite nastavenie workspace na aplikáciu Runtime 2.0 ako predvoleného pre všetky Spark workloady vo vašom workspace. Alternatívne môžete vytvoriť environmentálnu položku v Runtime 2.0 na použitie s konkrétnymi poznámkovými blokmi alebo definíciami úloh v Sparku, ktorá prepíše predvolené nastavenie pracovného priestoru.
Povolte Runtime 2.0 v nastaveniach Workspace
Ak chcete nastaviť Runtime 2.0 ako predvolený pre celý váš pracovný priestor:
Prejdite na stránku nastavení Workspace vo vašom Fabric workspace.
Vyberte záložku Data Engineering/Science a potom nastavenia Spark.
Vyberte kartu Prostredie.
V rozbaľovacom menu Runtime verzie vyberte 2.0 (Spark 4.1, Delta 4.2) a uložte si svoje zmeny.
Runtime 2.0 je nastavený ako predvolený runtime pre váš pracovný priestor.
Povoliť Runtime 2.0 v položke Environment
Na použitie Runtime 2.0 so špecifickými poznámkovými blokmi alebo definíciami úloh v Sparku:
Vytvorte nový predmet Environment alebo otvorte existujúci.
V rozbaľovacom menu Runtime vyberte 2.0 (Spark 4.1, Delta 4.2),Uložiť a Zverejniť svoje zmeny.
Ďalej použite túto položku Environment spolu s definíciou prácev zápisníku alebo Spark.
Teraz môžete začať pracovať s najnovšími vylepšeniami a funkciami predstavenými v Fabric Runtime 2.0 (Spark 4.1 a Delta Lake 4.2).
Poznámka
Hoci je Runtime 2.0 všeobecne dostupný a pripravený na produkčné použitie, zatiaľ nie je predvoleným runtime. Aby mali zákazníci, ktorí sa spoliehajú na aktuálny predvolený runtime, viac času na overenie svojich pracovných záťaží a plánovanie migrácie, musia explicitne zvoliť Runtime 2.0. Plánom je, aby Runtime 2.0 bol predvoleným výberom runtime v používateľskom zážitku a predvoleným runtime pre nové pracovné priestory a environmentálne položky koncom septembra 2026. Tento postupný prístup pomáha zákazníkom prijímať a validovať Runtime 2.0 vlastným tempom a zároveň využívať predvídateľný prechodový harmonogram.
Prepitné
Ak chcete získať aktuálne informácie, podrobný zoznam zmien a konkrétne poznámky k vydaniu modulov CLR služby Fabric, skontrolujte a prihláste sa na odber vydaní a aktualizácií služby Spark Runtime.
Kľúčové zvýraznenia
Vylepšenia výkonnostného a výkonového enginu
Fabric Runtime 2.0 obsahuje Native Execution Engine, ktorý prináša výrazné zlepšenie výkonu oproti open-source Sparku. Engine využíva vektorizované spracovanie na zrýchlenie Spark dotazov na infraštruktúre lakehouse bez potreby zmien kódu.
Kľúčové výkonnostné funkcie v Runtime 2.0:
- Až šesťkrát rýchlejšie: Benchmarky ukazujú až šesťkrát vyšší výkon v porovnaní s open-source Spark na TPC-DS pracovných záťažach.
- Vektorizované CSV parsovanie: Natívny výkonný engine obsahuje vektorizovaný CSV parser, ktorý urýchľuje vkladanie a dotazovanie CSV. Plánované sú vektorizované JSON parsovanie a podpora Spark Structured Streaming pre budúce aktualizácie.
Pre povolenie natívneho vykonávacieho enginu pozri Natívny výkonný engine pre Fabric Data Engineering.
Apache Spark 4.1
Apache Spark 4.0 predstavoval významný míľnik ako prvé vydanie v sérii 4.x, stelesňujúc kolektívne úsilie živej open-source komunity. Fabric Runtime 2.0 teraz beží na Apache Spark 4.1, ktorý na tomto základe stavia s ďalšími vylepšeniami.
V tejto verzii je Spark SQL výrazne obohatený o výkonné nové funkcie navrhnuté na zvýšenie expresívnosti a všestrannosti SQL záťaží, ako je podpora dátových typov VARIANT, SQL používateľom definované funkcie, relačné premenné, syntax potrubia a triedenie reťazcov. PySpark sa neustále venuje svojej funkčnej šírke aj celkovému zážitku vývojárov, prináša natívne API na kreslenie, nové API pre Python Data Source, podporu pre Python UDTF a jednotné profilovanie pre PySpark UDF, spolu s mnohými ďalšími vylepšeniami. Structured Streaming sa vyvíja s kľúčovými doplnkami, ktoré poskytujú väčšiu kontrolu a jednoduchšie ladenie, najmä zavedením Arbitrary State API v2 pre flexibilnejšiu správu stavov a State Data Source pre jednoduchšie ladenie.
Celý zoznam a podrobné zmeny si môžete pozrieť tu:
Poznámka
V Spark 4.x je SparkR zastaraný a môže byť v budúcej verzii odstránený.
Delta Lake 4.2
Delta Lake 4.2 nadväzuje na predchádzajúce vydania Delta Lake a pokračuje v záväzku urobiť Delta Lake interoperabilným naprieč formátmi, jednoduchším na prácu a výkonnejším. Obsahuje silné nové funkcie, optimalizácie výkonu a základné vylepšenia pre budúcnosť otvorených dátových jazerných domov.
Pre úplný zoznam a podrobné zmeny zavedené s Delta Lake 3.3, 4.0, 4.1 a 4.2 pozri:
Rozloženie a optimalizácia dát
Runtime 2.0 podporuje rozloženie dát a optimalizačné funkcie pre tabuľky Delta:
- Z-poradie: Organizujte dáta v tabuľkových súboroch Delta podľa špecifikovaných stĺpcov na zlepšenie výkonu dotazov pre filtrované dotazy.
- Tekuté zhlukovanie: Flexibilný prístup k zhlukovaniu, ktorý automaticky optimalizuje rozloženie dát bez manuálnej údržby.
- Paralelné načítavanie snapshotov Delta: Natívny výkonný engine načítava snapshoty tabuliek Delta paralelne, čím skracuje čas spustenia dotazu pre veľké tabuľky.
Dôležité
Špecifické funkcie Delta Lake 4.2 sú experimentálne a fungujú len na Spark zážitkoch, ako sú Notebooks a Spark Job Definitions. Ak potrebujete používať tie isté Delta Lake tabuľky naprieč viacerými Microsoft Fabric záťažami, tieto funkcie nezapájajte. Ak sa chcete dozvedieť viac o tom, ktoré verzie a funkcie protokolov sú kompatibilné naprieč všetkými Microsoft Fabric zážitkami, pozrite si interoperabilitu formátov tabuliek Delta Lake.
Riadenie výpočtov v Runtime 2.0
Runtime 2.0 podporuje nasledujúce funkcie správy výpočtov:
- Profily zdrojov: Nastavte preddefinované alokácie zdrojov pre Spark relácie tak, aby zodpovedali požiadavkám na pracovnú záťaž a kontrolovali náklady.
- Vlastné živé pooly (preview): Vytvárajte vyhradené, predohriaté Spark pooly, ktoré skracujú čas spustenia relácie. Vlastné živé pooly sú dostupné v náhľade pre pracovné zaťaženia Runtime 2.0.
Obmedzenia a poznámky
- Špecifické funkcie Delta Lake 4.x sú experimentálne a fungujú len na Spark zážitkoch, ako sú notebooky a definície úloh v Sparku. Ak potrebujete používať tie isté Delta Lake tabuľky naprieč viacerými Fabric workloadmi, tieto funkcie nezapájajte. Pre viac informácií pozri interoperabilitu formátov tabuliek Delta Lake.
- Rozšírenie VS Code pre Fabric Spark podporuje Runtime 2.0 pre vývoj definícií úloh v notebookoch a Sparku.
Súvisiaci obsah
- Apache Spark runtime v Fabric – prehľad, verziovanie a podpora viacerých runtime
- Sprievodca migráciou do služby Spark Core
- Príručky migrácie sql, množín údajov a údajového rámca
- Sprievodca migráciou štruktúrovaného streamovania
- Sprievodca migráciou do služby MLlib (strojové učenie)
- Sprievodca migráciou do súboru PySpark (Python on Spark)
- Sprievodca migráciou sparkr (R on Spark)