Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
A Fabric Runtime zökkenőmentes integrációt biztosít a Fabric ökoszisztémában, robusztus környezetet biztosítva adat-mérnöki és adattudományi projektekhez, amelyeket az Apache Spark támogat.
Ez a cikk bemutatja a Fabric Runtime 2.0-t, a legújabb, általánosan elérhető runtime-t, amelyet a Microsoft Fabric nagy adat-számításaihoz terveztek. Kiemeli azokat a főbb funkciókat és összetevőket, amelyek miatt ez a kiadás jelentős előrelépést jelent a méretezhető elemzések és a speciális számítási feladatok számára.
A Fabric Runtime 2.0 az alábbi összetevőket és frissítéseket tartalmazza az adatfeldolgozási képességek javítása érdekében:
- Apache Spark 4.1
- Operációs rendszer: Azure Linux 3.0 (Mariner 3.0)
- Java: 21
- Scala: 2,13
- Python: 3.13
- Delta-tó: 4,2
- R: 4.5.2
Fontos
A Fabric csapata frissítést indít a Fabric Runtime 2.0-hoz. A frissítés részeként a Python frissítése kompatibilitást megtörő változást vezet be azon ügyfelek számára, akik Python- és wheel-könyvtárakat használó környezetelemeket használnak. Az ügyfelek a notebook vagy Spark feladatdefiníció (SJD) végrehajtásával a két hibaüzenet egyikét látják:
- Hiba: figyelmeztetés: 1 elavulás (2.13.0 óta); a részletekért engedélyezze a
:setting -deprecationvagy:replay -deprecationbeállítást. Forrás: SparkCoreService. - "LibraryManagementError": "Frissítés észlelhető az alap Spark Python környezetre. Kérjük, tegye közzé újra a környezetet.|UserError"
Szükséges műveletek
Újra kiadd a környezetedet (beleértve a könyvtárakat is). Ehhez töröld az összes könyvtárat, tünd ki a Környezetet, add hozzá újra az összes könyvtárat, és tüntesd ki újra. Ez a folyamat a frissített Python futás idején keresztül újrateremti a környezetet, és megoldja a problémát.
Jótanács
A Fabric Runtime 2.0 támogatja a natív végrehajtási motort, amely nagyobb költségek nélkül jelentősen javíthatja a teljesítményt. A natív végrehajtási motort környezeti szinten is engedélyezheti, így minden feladat és jegyzetfüzet automatikusan örökli a továbbfejlesztett teljesítménybeli képességeket.
Runtime 2.0 engedélyezése
A Futtatókörnyezet 2.0 a munkaterület vagy a környezeti elem szintjén is engedélyezhető. A munkaterület beállításával alapértelmezettként alkalmazza a Runtime 2.0-t a munkaterület összes Spark-számítási feladatára. Másik lehetőségként hozzon létre egy olyan környezeti elemet a Runtime 2.0-val, amely adott jegyzetfüzetekkel vagy Spark-feladatdefiníciókkal használható, amely felülbírálja a munkaterület alapértelmezett beállítását.
Runtime 2.0 engedélyezése a Munkaterület beállításai között
A Runtime 2.0 beállítása alapértelmezettként a teljes munkaterületen:
Lépjen a Munkaterület beállításai lapra a Fabric munkaterületen belül.
Válassza az Adatelemzés/Tudomány lapot, majd a Spark-beállításokat.
Válassza a Környezet lapot.
A Runtime verzió legördülő menüben válaszd ki a 2.0-t (Spark 4.1, Delta 4.2), és mentsd el a változtatásokat.
Runtime 2.0 a munkaterület alapértelmezett futtatókörnyezete.
A futtatókörnyezet 2.0 engedélyezése egy környezeti elemben
A Runtime 2.0 használata adott jegyzetfüzetekkel vagy Spark-feladatdefiníciókkal:
Hozzon létre egy új környezeti elemet, vagy nyisson meg egy meglévőt.
A Runtime legördülő menüben válaszd ki a 2.0-t (Spark 4.1, Delta 4.2), mentsd és tegyd közzé a változtatásokat.
Ezután használd ezt a Környezet elemet a jegyzetfüzeteddel vagy a Spark Feladat Definíciójával.
Most már elkezdheted használni a Fabric Runtime 2.0-ban bevezetett legújabb fejlesztéseket és funkciókat (Spark 4.1 és Delta Lake 4.2).
Megjegyzés:
Bár a Runtime 2.0 általánosan elérhető és gyártási használatra kész, még nem alapértelmezett runtime. Ahhoz, hogy azok az ügyfelek, akik a jelenlegi alapértelmezett futási időre támaszkodnak, extra időt adjanak a munkaterhelésük érvényesítésére és migrációjuk megtervezésére, kifejezetten be kell választanuk a Runtime 2.0-t. A terv az, hogy a Runtime 2.0 legyen alapértelmezett futási időválasztás a felhasználói élményben, és az új munkaterületek és környezeti elemek alapértelmezett futási ideje 2026 szeptemberének végén. Ez a fázisos megközelítés segít az ügyfeleknek abban, hogy a Runtime 2.0-t saját tempójukban alkalmazzák és validálják, miközben kiszámítható átmeneti idővonal előnyeit élvezik.
Jótanács
Naprakész információkért, a módosítások részletes listájáért és a Fabric-futtatókörnyezetekhez kapcsolódó konkrét kibocsátási megjegyzésekért tekintse meg és iratkozzon fel a Spark Runtimes kiadásaira és frissítéseire.
Főbb kiemelések
Teljesítmény- és végrehajtási motorfejlesztések
A Fabric Runtime 2.0 tartalmazza a natív végrehajtási motort, amely jelentős teljesítménybeli javulást biztosít a nyílt forráskódú Sparkhoz. A motor vektoros feldolgozást használ a Spark-lekérdezések tóházi infrastruktúrán történő felgyorsításához kódmódosítások nélkül.
A Runtime 2.0 főbb teljesítményfunkciói:
- Akár hatszor gyorsabb: A teljesítménytesztek akár hatszor gyorsabb teljesítményt is mutatnak, mint a nyílt forráskódú Spark TPC-DS számítási feladatokon.
- Vektorizált CSV-elemzés: A natív végrehajtási motor tartalmaz egy vektoros CSV-elemzőt, amely felgyorsítja a CSV-betöltést és a számítási feladatok lekérdezését. A jövőbeli frissítésekhez vektoros JSON-elemzést és Spark strukturált streamelési támogatást tervezünk.
A natív végrehajtási motor engedélyezéséhez tekintse meg a Fabric Data Engineering natív végrehajtási motorja című témakört.
Apache Spark 4.1
Az Apache Spark 4.0 jelentős mérföldkövet jelentett a 4.x sorozat beiktatási kiadásaként, amely a nyüzsgő nyílt forráskódú közösség kollektív erőfeszítéseit testesíti meg. Fabric Runtime 2.0 mostantól Apache Spark 4.1 rendszeren fut, amely további fejlesztésekkel épül erre az alapra.
Ebben a verzióban a Spark SQL jelentős mértékben bővül az SQL-számítási feladatok expresszivitásának és sokoldalúságának fokozására tervezett hatékony új funkciókkal, például a VARIANT adattípus támogatásával, az SQL felhasználó által definiált függvényeivel, a munkamenet-változókkal, a csőszintaxissal és a sztringek rendezéssel. A PySpark folyamatosan elkötelezett annak érdekében, hogy bővítse a funkciók körét és javítsa a fejlesztői élményt, például natív plotting API-t, új Python-adatforrás API-t, a Python UDTF-k támogatását, a PySpark UDF-ekhez való egységes profilkészítést, és számos egyéb fejlesztést hoz létre. A strukturált streamelés olyan kulcsfontosságú kiegészítésekkel bővül, amelyek nagyobb felügyeletet és egyszerű hibakeresést biztosítanak, nevezetesen az Tetszőleges állapot API v2 bevezetése a rugalmasabb állapotkezeléshez és az állapotadatforráshoz a könnyebb hibakeresés érdekében.
A teljes listát és a részletes módosításokat itt tekintheti meg:
Megjegyzés:
A Spark 4.x-ben a SparkR elavult, és egy későbbi verzióban el lesz távolítva.
Delta Lake 4.2
A Delta Lake 4.2 az előző Delta Lake kiadásokra épül, folytatva azt az elkötelezettséget, hogy a Delta Lake formátumok között interoperábilisabb, könnyebben használható és nagyobb teljesítményű legyen. Hatékony új funkciókat, teljesítményoptimalizálást és alapvető fejlesztéseket tartalmaz a nyitott data lakehouse-k jövőjéhez.
A Delta Lake 3.3, 4.0, 4.1 és 4.2 verzióiban bevezetett változások teljes listáját és részletes leírását lásd itt:
Adatelrendezés és -optimalizálás
A Runtime 2.0 támogatja a Delta-táblák adatelrendezési és optimalizálási funkcióit:
- Z-rendezés: Adatok rendezése a Delta-táblafájlokban megadott oszlopok szerint a szűrt lekérdezések lekérdezési teljesítményének javítása érdekében.
- Folyékony fürtözés: Rugalmas fürtözési módszer, amely automatikusan optimalizálja az adatelrendezést manuális karbantartás nélkül.
- Párhuzamos delta-pillanatkép betöltése: A natív végrehajtási motor párhuzamosan tölti be a Delta-tábla pillanatképeit, csökkentve a nagy táblák lekérdezésindítási idejét.
Fontos
A Delta Lake 4.2 specifikus funkciói kísérleti jellegűek, és csak Spark élményeken működnek, például a jegyzetfüzeteken és a Spark Job Definíciókban. Ha ugyanazt a Delta Lake-táblát több Microsoft Fabric-számítási feladatban is használnia kell, ne engedélyezze ezeket a funkciókat. Ha többet szeretnél megtudni arról, hogy mely protokollverziók és funkciók kompatibilisek minden Microsoft Fabric élményben, lásd a Delta Lake tábla formátum interoperabilitását.
Számításkezelés a Runtime 2.0-ban
A Runtime 2.0 a következő számítási felügyeleti funkciókat támogatja:
- Erőforrásprofilok: Előre definiált erőforrás-lefoglalások konfigurálása Spark-munkamenetekhez a számítási feladatok követelményeinek és a költségek szabályozásának megfelelően.
- Egyéni élő készletek (előzetes verzió):Dedikált, előre felmelegített Spark-készletek létrehozása, amelyek csökkentik a munkamenet indítási idejét. Az egyéni élő poolok előzetes verzióban elérhetőek a Runtime 2.0 munkafolyamatokhoz.
Korlátozások és megjegyzések
- A Delta Lake 4.x egyes funkciói kísérleti jellegűek, és csak Spark-élményeken működnek, például jegyzetfüzeteken és Spark-feladatdefiníciókon. Ha ugyanazt a Delta Lake-táblát több Háló számítási feladatban is használnia kell, ne engedélyezze ezeket a funkciókat. További információ: Delta Lake table format interoperabilitás.
- A Fabric Spark VS Code-bővítménye támogatja a Runtime 2.0-t a jegyzetfüzetek és a Spark-feladatok definíciójának fejlesztéséhez.
Kapcsolódó tartalom
- Apache Spark futtatási környezetek a Fabric rendszerben – Áttekintés, verziózás és több futtatáskörnyezet támogatása
- A Spark Core migrálási útmutatója
- SQL, Adathalmazok és DataFrame migrálási útmutatók
- Strukturált streamelési migrálási útmutató
- MLlib (Machine Learning) migrálási útmutató
- A PySpark (Python a Sparkon) migrálási útmutatója
- SparkR (R a Sparkkal) migrálási útmutató