Fabric Runtime 2.0 (GA)

A Fabric Runtime zökkenőmentes integrációt biztosít a Fabric ökoszisztémában, robusztus környezetet biztosítva adat-mérnöki és adattudományi projektekhez, amelyeket az Apache Spark támogat.

Ez a cikk bemutatja a Fabric Runtime 2.0-t, a legújabb, általánosan elérhető runtime-t, amelyet a Microsoft Fabric nagy adat-számításaihoz terveztek. Kiemeli azokat a főbb funkciókat és összetevőket, amelyek miatt ez a kiadás jelentős előrelépést jelent a méretezhető elemzések és a speciális számítási feladatok számára.

A Fabric Runtime 2.0 az alábbi összetevőket és frissítéseket tartalmazza az adatfeldolgozási képességek javítása érdekében:

  • Apache Spark 4.1
  • Operációs rendszer: Azure Linux 3.0 (Mariner 3.0)
  • Java: 21
  • Scala: 2,13
  • Python: 3.13
  • Delta-tó: 4,2
  • R: 4.5.2

Fontos

A Fabric csapata frissítést indít a Fabric Runtime 2.0-hoz. A frissítés részeként a Python frissítése kompatibilitást megtörő változást vezet be azon ügyfelek számára, akik Python- és wheel-könyvtárakat használó környezetelemeket használnak. Az ügyfelek a notebook vagy Spark feladatdefiníció (SJD) végrehajtásával a két hibaüzenet egyikét látják:

  • Hiba: figyelmeztetés: 1 elavulás (2.13.0 óta); a részletekért engedélyezze a :setting -deprecation vagy :replay -deprecation beállítást. Forrás: SparkCoreService.
  • "LibraryManagementError": "Frissítés észlelhető az alap Spark Python környezetre. Kérjük, tegye közzé újra a környezetet.|UserError"

Szükséges műveletek

Újra kiadd a környezetedet (beleértve a könyvtárakat is). Ehhez töröld az összes könyvtárat, tünd ki a Környezetet, add hozzá újra az összes könyvtárat, és tüntesd ki újra. Ez a folyamat a frissített Python futás idején keresztül újrateremti a környezetet, és megoldja a problémát.

Jótanács

A Fabric Runtime 2.0 támogatja a natív végrehajtási motort, amely nagyobb költségek nélkül jelentősen javíthatja a teljesítményt. A natív végrehajtási motort környezeti szinten is engedélyezheti, így minden feladat és jegyzetfüzet automatikusan örökli a továbbfejlesztett teljesítménybeli képességeket.

Runtime 2.0 engedélyezése

A Futtatókörnyezet 2.0 a munkaterület vagy a környezeti elem szintjén is engedélyezhető. A munkaterület beállításával alapértelmezettként alkalmazza a Runtime 2.0-t a munkaterület összes Spark-számítási feladatára. Másik lehetőségként hozzon létre egy olyan környezeti elemet a Runtime 2.0-val, amely adott jegyzetfüzetekkel vagy Spark-feladatdefiníciókkal használható, amely felülbírálja a munkaterület alapértelmezett beállítását.

Runtime 2.0 engedélyezése a Munkaterület beállításai között

A Runtime 2.0 beállítása alapértelmezettként a teljes munkaterületen:

  1. Lépjen a Munkaterület beállításai lapra a Fabric munkaterületen belül.

    Képernyőkép a munkaterület beállításainak futtatókörnyezeti verziójának kiválasztásáról.

  2. Válassza az Adatelemzés/Tudomány lapot, majd a Spark-beállításokat.

  3. Válassza a Környezet lapot.

  4. A Runtime verzió legördülő menüben válaszd ki a 2.0-t (Spark 4.1, Delta 4.2), és mentsd el a változtatásokat.

  5. Runtime 2.0 a munkaterület alapértelmezett futtatókörnyezete.

A futtatókörnyezet 2.0 engedélyezése egy környezeti elemben

A Runtime 2.0 használata adott jegyzetfüzetekkel vagy Spark-feladatdefiníciókkal:

  1. Hozzon létre egy új környezeti elemet, vagy nyisson meg egy meglévőt.

  2. A Runtime legördülő menüben válaszd ki a 2.0-t (Spark 4.1, Delta 4.2), mentsd és tegyd közzé a változtatásokat.

    Képernyőkép a környezeti elem futtatókörnyezeti verziójának kiválasztásáról.

  3. Ezután használd ezt a Környezet elemet a jegyzetfüzeteddel vagy a Spark Feladat Definíciójával.

Most már elkezdheted használni a Fabric Runtime 2.0-ban bevezetett legújabb fejlesztéseket és funkciókat (Spark 4.1 és Delta Lake 4.2).

Megjegyzés:

Bár a Runtime 2.0 általánosan elérhető és gyártási használatra kész, még nem alapértelmezett runtime. Ahhoz, hogy azok az ügyfelek, akik a jelenlegi alapértelmezett futási időre támaszkodnak, extra időt adjanak a munkaterhelésük érvényesítésére és migrációjuk megtervezésére, kifejezetten be kell választanuk a Runtime 2.0-t. A terv az, hogy a Runtime 2.0 legyen alapértelmezett futási időválasztás a felhasználói élményben, és az új munkaterületek és környezeti elemek alapértelmezett futási ideje 2026 szeptemberének végén. Ez a fázisos megközelítés segít az ügyfeleknek abban, hogy a Runtime 2.0-t saját tempójukban alkalmazzák és validálják, miközben kiszámítható átmeneti idővonal előnyeit élvezik.

Jótanács

Naprakész információkért, a módosítások részletes listájáért és a Fabric-futtatókörnyezetekhez kapcsolódó konkrét kibocsátási megjegyzésekért tekintse meg és iratkozzon fel a Spark Runtimes kiadásaira és frissítéseire.

Főbb kiemelések

Teljesítmény- és végrehajtási motorfejlesztések

A Fabric Runtime 2.0 tartalmazza a natív végrehajtási motort, amely jelentős teljesítménybeli javulást biztosít a nyílt forráskódú Sparkhoz. A motor vektoros feldolgozást használ a Spark-lekérdezések tóházi infrastruktúrán történő felgyorsításához kódmódosítások nélkül.

A Runtime 2.0 főbb teljesítményfunkciói:

  • Akár hatszor gyorsabb: A teljesítménytesztek akár hatszor gyorsabb teljesítményt is mutatnak, mint a nyílt forráskódú Spark TPC-DS számítási feladatokon.
  • Vektorizált CSV-elemzés: A natív végrehajtási motor tartalmaz egy vektoros CSV-elemzőt, amely felgyorsítja a CSV-betöltést és a számítási feladatok lekérdezését. A jövőbeli frissítésekhez vektoros JSON-elemzést és Spark strukturált streamelési támogatást tervezünk.

A natív végrehajtási motor engedélyezéséhez tekintse meg a Fabric Data Engineering natív végrehajtási motorja című témakört.

Apache Spark 4.1

Az Apache Spark 4.0 jelentős mérföldkövet jelentett a 4.x sorozat beiktatási kiadásaként, amely a nyüzsgő nyílt forráskódú közösség kollektív erőfeszítéseit testesíti meg. Fabric Runtime 2.0 mostantól Apache Spark 4.1 rendszeren fut, amely további fejlesztésekkel épül erre az alapra.

Ebben a verzióban a Spark SQL jelentős mértékben bővül az SQL-számítási feladatok expresszivitásának és sokoldalúságának fokozására tervezett hatékony új funkciókkal, például a VARIANT adattípus támogatásával, az SQL felhasználó által definiált függvényeivel, a munkamenet-változókkal, a csőszintaxissal és a sztringek rendezéssel. A PySpark folyamatosan elkötelezett annak érdekében, hogy bővítse a funkciók körét és javítsa a fejlesztői élményt, például natív plotting API-t, új Python-adatforrás API-t, a Python UDTF-k támogatását, a PySpark UDF-ekhez való egységes profilkészítést, és számos egyéb fejlesztést hoz létre. A strukturált streamelés olyan kulcsfontosságú kiegészítésekkel bővül, amelyek nagyobb felügyeletet és egyszerű hibakeresést biztosítanak, nevezetesen az Tetszőleges állapot API v2 bevezetése a rugalmasabb állapotkezeléshez és az állapotadatforráshoz a könnyebb hibakeresés érdekében.

A teljes listát és a részletes módosításokat itt tekintheti meg:

Megjegyzés:

A Spark 4.x-ben a SparkR elavult, és egy későbbi verzióban el lesz távolítva.

Delta Lake 4.2

A Delta Lake 4.2 az előző Delta Lake kiadásokra épül, folytatva azt az elkötelezettséget, hogy a Delta Lake formátumok között interoperábilisabb, könnyebben használható és nagyobb teljesítményű legyen. Hatékony új funkciókat, teljesítményoptimalizálást és alapvető fejlesztéseket tartalmaz a nyitott data lakehouse-k jövőjéhez.

A Delta Lake 3.3, 4.0, 4.1 és 4.2 verzióiban bevezetett változások teljes listáját és részletes leírását lásd itt:

Adatelrendezés és -optimalizálás

A Runtime 2.0 támogatja a Delta-táblák adatelrendezési és optimalizálási funkcióit:

  • Z-rendezés: Adatok rendezése a Delta-táblafájlokban megadott oszlopok szerint a szűrt lekérdezések lekérdezési teljesítményének javítása érdekében.
  • Folyékony fürtözés: Rugalmas fürtözési módszer, amely automatikusan optimalizálja az adatelrendezést manuális karbantartás nélkül.
  • Párhuzamos delta-pillanatkép betöltése: A natív végrehajtási motor párhuzamosan tölti be a Delta-tábla pillanatképeit, csökkentve a nagy táblák lekérdezésindítási idejét.

Fontos

A Delta Lake 4.2 specifikus funkciói kísérleti jellegűek, és csak Spark élményeken működnek, például a jegyzetfüzeteken és a Spark Job Definíciókban. Ha ugyanazt a Delta Lake-táblát több Microsoft Fabric-számítási feladatban is használnia kell, ne engedélyezze ezeket a funkciókat. Ha többet szeretnél megtudni arról, hogy mely protokollverziók és funkciók kompatibilisek minden Microsoft Fabric élményben, lásd a Delta Lake tábla formátum interoperabilitását.

Számításkezelés a Runtime 2.0-ban

A Runtime 2.0 a következő számítási felügyeleti funkciókat támogatja:

  • Erőforrásprofilok: Előre definiált erőforrás-lefoglalások konfigurálása Spark-munkamenetekhez a számítási feladatok követelményeinek és a költségek szabályozásának megfelelően.
  • Egyéni élő készletek (előzetes verzió):Dedikált, előre felmelegített Spark-készletek létrehozása, amelyek csökkentik a munkamenet indítási idejét. Az egyéni élő poolok előzetes verzióban elérhetőek a Runtime 2.0 munkafolyamatokhoz.

Korlátozások és megjegyzések

  • A Delta Lake 4.x egyes funkciói kísérleti jellegűek, és csak Spark-élményeken működnek, például jegyzetfüzeteken és Spark-feladatdefiníciókon. Ha ugyanazt a Delta Lake-táblát több Háló számítási feladatban is használnia kell, ne engedélyezze ezeket a funkciókat. További információ: Delta Lake table format interoperabilitás.
  • A Fabric Spark VS Code-bővítménye támogatja a Runtime 2.0-t a jegyzetfüzetek és a Spark-feladatok definíciójának fejlesztéséhez.