Fabric Runtime 2.0 (GA)

Fabric Runtime leverer problemfri integration i Fabric-økosystemet og tilbyder et robust miljø for data engineering og data science-projekter drevet af Apache Spark.

Denne artikel introducerer Fabric Runtime 2.0, den nyeste generelt tilgængelige runtime designet til big data-beregninger i Microsoft Fabric. Den fremhæver de vigtigste funktioner og komponenter, der gør denne udgivelse til et betydeligt skridt fremad for skalerbar analyse og avancerede arbejdsbelastninger.

Fabric Runtime 2.0 indeholder følgende komponenter og opgraderinger, der er designet til at forbedre dine databehandlingsmuligheder:

  • Apache Spark 4.1
  • Operativsystem: Azure Linux 3.0 (Mariner 3.0)
  • Java: 21
  • Scala: 2.13
  • Python: 3.13
  • Delta Lake: 4,2
  • R: 4.5.2

Vigtigt

Fabric-teamet ruller en opdatering ud af Fabric Runtime 2.0. Som en del af denne opdatering introducerer Python-opgraderingen en grundlæggende ændring for kunder, der bruger miljøelementer med python- og wheel-biblioteker. Kunder ser en af de to fejlmeddelelser ved notebook- eller Spark-jobdefinition (SJD)-eksekvering:

  • Fejl: advarsel: 1 aflysning (siden 2.13.0); for detaljer, aktiver :setting -deprecation eller :replay -deprecation Kilde: SparkCoreService.
  • "LibraryManagementError": "En opgradering til det grundlæggende Spark Python-miljø er blevet opdaget. Venligst genudgiv miljøet.|UserError"

Påkrævede handlinger

Genudgiv dit miljø (inklusive bibliotekerne). For at gøre dette skal du fjerne alle biblioteker, publicere miljøet, gentilføje alle bibliotekerne og publicere igen. Denne proces genskaber miljøet ved at bruge den opdaterede Python-runtime og løser problemet.

Tips

Fabric Runtime 2.0 inkluderer understøttelse af Native Execution Engine, som kan forbedre ydeevnen betydeligt uden yderligere omkostninger. Du kan aktivere den native eksekveringsmotor på miljøniveau, så alle jobs og notebooks automatisk arver de forbedrede ydeevnemuligheder.

Aktiver Runtime 2.0

Du kan aktivere Runtime 2.0 enten på arbejdsområdeniveau eller miljøobjektniveau. Brug arbejdsområde-indstillingen til at anvende Runtime 2.0 som standard for alle Spark-arbejdsbelastninger i dit arbejdsområde. Alternativt kan du oprette et miljøelement med Runtime 2.0, som kan bruges med specifikke notebooks eller Spark-jobdefinitioner, som tilsidesætter arbejdsområdets standard.

Aktiver Runtime 2.0 i Workspace-indstillingerne

For at sætte Runtime 2.0 som standard for hele dit arbejdsområde:

  1. Gå til siden for arbejdsområdeindstillinger i dit Fabric-arbejdsområde.

    Skærmbillede, der viser, hvor man vælger runtime-versionen for Workspace-indstillinger.

  2. Vælg fanen Data Engineering/Science og vælg derefter Spark-indstillinger.

  3. Vælg fanen Miljø .

  4. Under dropdown-menuen for Runtime-versionen vælger du 2.0 (Spark 4.1, Delta 4.2) og gemmer dine ændringer.

  5. Runtime 2.0 er sat som standardruntime for dit arbejdsområde.

Aktivér Runtime 2.0 i et miljøobjekt

For at bruge Runtime 2.0 med specifikke notebooks eller Spark-jobdefinitioner:

  1. Opret et nyt miljøelement eller åbn et eksisterende.

  2. Under rullemenuen Runtime vælger du 2.0 (Spark 4.1, Delta 4.2),gemmer og udgiver dine ændringer.

    Skærmbillede, der viser, hvor man vælger runtime-version for miljøobjektet.

  3. Dernæst kan du bruge dette Miljø-element med din Notebook - eller Spark-jobdefinition.

Du kan nu begynde at arbejde med de nyeste forbedringer og funktioner, der er introduceret i Fabric Runtime 2.0 (Spark 4.1 og Delta Lake 4.2).

Notat

Selvom Runtime 2.0 generelt er tilgængelig og klar til produktionsbrug, er det endnu ikke standardkørsel. For at give kunder, der er afhængige af den nuværende standard runtime, ekstra tid til at validere deres arbejdsbelastninger og planlægge deres migration, skal de eksplicit vælge Runtime 2.0. Planen er at gøre Runtime 2.0 til standardvalgmuligheden i brugeroplevelsen og standard-runtime for nye arbejdsområder og miljøelementer i slutningen af september 2026. Denne faseopdelte tilgang hjælper kunder med at adoptere og validere Runtime 2.0 i deres eget tempo, samtidig med at de drager fordel af en forudsigelig overgangstidslinje.

Tips

Hvis du vil have opdaterede oplysninger, en detaljeret liste over ændringer og specifikke produktbemærkninger til Fabric-kørsel, skal du kontrollere og abonnere på Spark Runtimes-udgivelser og -opdateringer.

Centrale punkter

Forbedringer af ydeevne og eksekveringsmotor

Fabric Runtime 2.0 inkluderer Native Execution Engine, som giver betydelige ydelsesforbedringer i forhold til open source Spark. Motoren bruger vektoriseret behandling til at accelerere Spark-forespørgsler på lakehouse-infrastruktur uden at kræve kodeændringer.

Nøglefunktioner i Runtime 2.0:

  • Op til seks gange hurtigere: Benchmarks viser op til seks gange hurtigere ydeevne sammenlignet med open source Spark på TPC-DS arbejdsbelastninger.
  • Vektoriseret CSV-parsing: Den native eksekveringsmotor inkluderer en vektoriseret CSV-parser, der accelererer CSV-indlæsning og forespørgselsarbejdsbelastninger. Vectorized JSON-parsing og Spark Structured Streaming-understøttelse er planlagt til fremtidige opdateringer.

For at aktivere den native eksekveringsmotor, se Native eksekveringsmotor for Fabric Data Engineering.

Apache Spark 4.1

Apache Spark 4.0 markerede en vigtig milepæl som den første udgivelse i 4.x-serien, der indkapsler den fælles indsats fra det levende open source-fællesskab. Fabric Runtime 2.0 kører nu på Apache Spark 4.1, som bygger videre på det fundament med yderligere forbedringer.

I denne version er Spark SQL betydeligt beriget med kraftfulde nye funktioner, der skal øge udtryksfuldhed og alsidighed for SQL-arbejdsbelastninger, såsom understøttelse af VARIANT-datatyper, brugerdefinerede SQL-funktioner, sessionsvariabler, pipesyntaks og streng-kollation. PySpark ser en kontinuerlig dedikation til både sin funktionelle bredde og den samlede udvikleroplevelse, idet det bringer en native plotting API, en ny Python Data Source API, understøttelse af Python UDTF'er og samlet profilering af PySpark UDF'er, sammen med adskillige andre forbedringer. Structured Streaming udvikler sig med nøgletilføjelser, der giver større kontrol og nem fejlfinding, især introduktionen af Arbitrary State API v2 for mere fleksibel tilstandsstyring og State Data Source for nemmere fejlfinding.

Du kan se den fulde liste og detaljerede ændringer her:

Notat

I Spark 4.x er SparkR forældet og kan blive fjernet i en fremtidig version.

Delta Lake 4.2

Delta Lake 4.2 bygger videre på tidligere Delta Lake-udgivelser og fortsætter engagementet i at gøre Delta Lake interoperabelt på tværs af formater, lettere at arbejde med og mere ydende. Den indeholder kraftfulde nye funktioner, ydeevneoptimeringer og grundlæggende forbedringer for fremtiden for åbne data-lakehouses.

For den fulde liste og detaljerede ændringer, der blev indført med Delta Lake 3.3, 4.0, 4.1 og 4.2, se:

Datalayout og optimering

Runtime 2.0 understøtter datalayout- og optimeringsfunktioner for Delta-tabeller:

  • Z-orden: Organiser data i Delta-tabelfiler efter specificerede kolonner for at forbedre forespørgselsydelsen for filtrerede forespørgsler.
  • Liquid Clustering: En fleksibel klyngemetode, der automatisk optimerer datalayoutet uden manuel vedligeholdelse.
  • Parallel Delta snapshot-indlæsning: Den native eksekveringsmotor indlæser Delta-tabelsnapshots parallelt, hvilket reducerer opstartstiden for forespørgsler for store tabeller.

Vigtigt

Delta Lake 4.2-specifikke funktioner er eksperimentelle og fungerer kun på Spark-oplevelser, såsom notebooks og Spark-jobdefinitioner. Hvis du skal bruge de samme Delta Lake-tabeller på tværs af flere Fabric-arbejdsbelastninger, skal du ikke aktivere de funktioner. For at lære mere om, hvilke protokolversioner og funktioner der er kompatible på tværs af alle Fabric-oplevelser, se Delta Lake table format interoperability.

Beregningsstyring i Runtime 2.0

Runtime 2.0 understøtter følgende beregningsstyringsfunktioner:

  • Ressourceprofiler: Konfigurer foruddefinerede ressourceallokeringer til Spark-sessioner for at matche arbejdsbelastningens krav og kontrollere omkostningerne.
  • Brugerdefinerede live pools (forhåndsvisning): Opret dedikerede, forudopvarmede Spark-pools, der reducerer opstartstiden for sessioner. Brugerdefinerede live pools er tilgængelige i forhåndsvisning for Runtime 2.0-arbejdsbelastninger.

Begrænsninger og noter

  • Delta Lake 4.x-specifikke funktioner er eksperimentelle og fungerer kun på Spark-oplevelser, såsom notebooks og Spark-jobdefinitioner. Hvis du skal bruge de samme Delta Lake-tabeller på tværs af flere Fabric-arbejdsbelastninger, skal du ikke aktivere de funktioner. For mere information, se Delta Lake tabelformat-interoperabilitet.
  • VS Code-udvidelsen til Fabric Spark understøtter Runtime 2.0 til udvikling af notebook og Spark-jobdefinition.