Data Engineering workspace administrationsindstillinger i Microsoft Fabric

Gælder for:✅ Fabric Data Engineering og Data Science

Når du opretter et arbejdsområde i Fabric, oprettes der automatisk en startpool, der er tilknyttet det arbejdsområde. Med den forenklede opsætning i Fabric behøver du ikke vælge node- eller maskinstørrelser, da disse muligheder håndteres bag kulisserne. Denne konfiguration giver brugerne en hurtigere (5-10 sekunder) startoplevelse af Apache Spark-sessionen, så de kan komme i gang og køre dine Apache Spark-job i mange almindelige scenarier uden at skulle bekymre sig om at konfigurere beregningen. I forbindelse med avancerede scenarier med specifikke beregningskrav kan brugerne oprette en brugerdefineret Apache Spark-pulje og tilpasse nodernes størrelse på baggrund af deres ydeevnebehov.

Hvis du vil foretage ændringer af Apache Spark-indstillingerne i et arbejdsområde, skal du have administratorrollen for det pågældende arbejdsområde. Du kan få mere at vide under Roller i arbejdsområder.

Sådan administrerer du Spark-indstillingerne for den gruppe, der er knyttet til dit arbejdsområde:

  1. Gå til indstillingerne for arbejdsområdet i arbejdsområdet, og vælg indstillingen Dataudvikler/Videnskab for at udvide menuen:

    Skærmbillede, der viser, hvor man vælger Data Engineering i arbejdsområdets indstillingsmenu.

  2. Du kan se indstillingen Spark Compute i menuen til venstre:

    GIF, der viser forskellige sektioner af Apache Spark-beregningen i arbejdsområdeindstillingerne.

    Bemærk

    Hvis du ændrer standardpuljen fra Startpulje til en brugerdefineret Spark-gruppe, kan du se længere sessionstart (~3 minutter).

Pulje

Standardgruppe for arbejdsområdet

Du kan bruge den automatisk oprettede startpulje eller oprette brugerdefinerede puljer for arbejdsområdet.

  • Starter Pool: Prehydrerede live-puljer automatisk oprettet til din hurtigere oplevelse. Disse klynger er mellemstore. Startpuljen er indstillet til en standardkonfiguration baseret på den varenummer for Fabric-kapacitet, der er købt. Administratorer kan tilpasse de maksimale noder og eksekveringsprogrammer baseret på deres Krav til Spark-arbejdsbelastningsskala. Du kan få mere at vide under Konfigurer startpuljer

  • Brugerdefineret Spark-pulje: Du kan tilpasse størrelsen på noderne, autoskalere og tildele eksekveringsfiler dynamisk baseret på dine krav til Spark-job. Hvis du vil oprette en brugerdefineret Spark-gruppe, skal kapacitetsadministratoren aktivere indstillingen Brugerdefinerede arbejdsområdepuljer i afsnittet Spark Compute under Indstillinger for kapacitetsadministrator .

Bemærk

Kontrolelementet på kapacitetsniveau for brugerdefinerede arbejdsområdegrupper er aktiveret som standard. Du kan få mere at vide under Konfigurer og administrer indstillinger for datakonstruktion og datavidenskab for Fabric-kapaciteter.

Administratorer kan oprette brugerdefinerede Spark-puljer baseret på deres beregningskrav ved at vælge indstillingen Ny pulje .

Skærmbillede, der viser indstillinger for oprettelse af brugerdefinerede grupper.

Apache Spark for Fabric understøtter enkelt-node-klynger, hvilket tillader brugere at vælge en minimumsnodekonfiguration på 1, hvor driveren og eksekveren kører i én enkelt node. Disse klynger med en enkelt node tilbyder reaktiverbar høj tilgængelighed under nodefejl og bedre jobpålidelighed for arbejdsbelastninger med mindre beregningskrav. Du kan også aktivere eller deaktivere indstillingen automatisk skalering for dine brugerdefinerede Spark-puljer. Når indstillingen er aktiveret med automatisk skalering, henter gruppen nye noder inden for den maksimale nodegrænse, der er angivet af brugeren, og trækker dem tilbage efter udførelsen af jobbet for at opnå bedre ydeevne.

Du kan også vælge muligheden for dynamisk at tildele eksekveringsfiler til automatisk at gruppere det optimale antal eksekveringsfiler inden for den maksimale grænse, der er angivet, baseret på datamængden for at opnå en bedre ydeevne.

Skærmbillede, der viser indstillinger for oprettelse af brugerdefinerede grupper til automatisk skalering og dynamisk allokering.

Få mere at vide om Apache Spark-beregning for Fabric.

  • Tilpas beregningskonfigurationen for elementer: Som administrator af arbejdsområdet kan du give brugerne mulighed for at justere beregningskonfigurationer (egenskaber på sessionsniveau, som omfatter Driver/Executor Core, Driver/Executor Memory) for individuelle elementer, f.eks. notesbøger, Spark-jobdefinitioner ved hjælp af miljø.

Skærmbillede, der viser kontakten til at tilpasse beregning for elementer.

Hvis indstillingen er slået fra af arbejdsområdeadministratoren, bruges standardpuljen og dens beregningskonfigurationer for alle miljøer i arbejdsområdet.

Miljø

Miljø indeholder fleksible konfigurationer til kørsel af dine Spark-job (notesbøger, Spark-jobdefinitioner). I et miljø kan du konfigurere beregningsegenskaber ved at vælge forskellige afhængigheder af kørsel og konfiguration af bibliotekspakker baseret på dine krav til arbejdsbelastninger.

Under fanen Miljø har du mulighed for at angive standardmiljøet. Du kan vælge, hvilken version af Spark du vil bruge til arbejdsområdet.

Som administrator af Fabric-arbejdsområdet kan du vælge et miljø som standardmiljø for arbejdsområdet.

Du kan også oprette en ny via rullelisten Miljø .

Skærmbillede af oprettelse af miljø via rulleliste med vedhæftede filer i WS-indstilling.

Hvis du deaktiverer indstillingen for at have et standardmiljø, kan du vælge Fabric-kørselsversionen fra de tilgængelige kørselsversioner, der er angivet på rullelisten.

Skærmbillede, der viser, hvor du kan vælge kørselsversion.

Få mere at vide om Apache Spark-kørsel.

Job

Jobindstillinger gør det muligt for administratorer at styre jobadgangslogikken for alle Spark-job i arbejdsområdet.

Skærmbillede, der viser jobindstillingerne.

Alle arbejdsområder er som standard aktiveret med optimistisk jobindtagelse. Lær mere om joboptagelse hos Spark i Fabric.

Du kan aktivere maksimumkernerne Reserve for aktive Spark-job for at deaktivere optimistisk tilgang til jobindtagelse og reservemaks. kerner for deres Spark-job.

Du kan også angive timeout for Spark-sessionen for at tilpasse sessionens udløb for alle interaktive sessioner i notesbogen.

Bemærk

Standardsessionens udløb er angivet til 20 minutter for de interaktive Spark-sessioner.

Sæt maksimal joblevetid

Brug indstillingen Set maksimal joblevetid som en sikkerhedsforanstaltning for at forhindre, at løbske Spark-jobs forbruger beregning ud over en defineret tidsgrænse. Når du slår denne indstilling til og angiver en varighed, afslutter Fabric automatisk ethvert berettiget Spark-job, der varer længere end den konfigurerede levetid. Workspace-administratorer kan bruge denne kontrol til at:

  • Stop løbske eller fastlåste jobs, før de holder kapacitet på ubestemt tid, og bloker andre arbejdsbyrder i arbejdsområdet.
  • Håndhæv overholdelse af beregnings- og styringspolitikker ved at sætte grænser for, hvor længe et enkelt job kan køre.

Skærmbillede, der viser indstillingen Set maksimal joblevetid i fanen Jobs i arbejdsområdets indstillinger.

For at konfigurere det, tænd for Sæt maksimal joblevetid, indtast en værdi, vælg en tidsenhed som timer, og vælg derefter Gem for at anvende grænsen på arbejdsområdet.

Hvilke job er berørt

Den maksimale joblevetid gælder kun for brugerindsendte jobs – jobs, som en bruger eksplicit starter og som kører med brugerens identitet. Disse jobs inkluderer for eksempel:

  • Interaktive og planlagte notebook-kørsler, inklusive notebook-runs, der orkestreres gennem en pipeline.
  • Spark-jobdefinitionen kører, uanset om du indsender dem direkte, efter en tidsplan eller gennem en pipeline.
  • Livy batch- og interaktive sessioner, inklusive sessioner med høj samtidighed.

Systemstyrede jobs påvirkes ikke af denne indstilling og fortsætter med at køre til de er færdige. Disse opgaver udløses og administreres af Fabric på dine vegne, såsom:

  • Lakehouse-bordvedligeholdelsesoperationer, såsom optimer og støvsuger.
  • Materialiseret søudsigt opdateres.
  • Platformoperationer, såsom sikkerhed og håndhævelse af politik.

Denne sondring sikrer, at baggrundsvedligeholdelse og platformdrift, der holder dine data og arbejdspladser sunde, ikke bliver afbrudt, mens brugerarbejdsbelastninger forbliver underlagt sikkerhedsrammen.

Bemærk

Når et job når den konfigurerede maksimale levetid, annullerer Fabric det automatisk. Sæt en grænse, der giver nok tid til, at dine længstvarende legitime brugerjobs kan blive færdige.

Høj samtidighed

Tilstanden Med høj samtidighed giver brugerne mulighed for at dele de samme Spark-sessioner i Apache Spark til Fabric-datakonstruktion og datavidenskabsarbejdsbelastninger. Et element som en notesbog bruger en Spark-session til udførelse, og når det er aktiveret, kan brugerne dele en enkelt Spark-session på tværs af flere notesbøger.

Skærmbillede, der viser siden med indstillinger for høj samtidighed.

Få mere at vide om Høj samtidighed i Apache Spark til Fabric.

Automatisk logning for Machine Learning-modeller og eksperimenter

Administratorer kan nu aktivere automatisklogging af deres modeller og eksperimenter til maskinel indlæring. Denne indstilling registrerer automatisk værdierne for inputparametre, outputmetrik og outputelementer for en model til maskinel indlæring, efterhånden som den oplæres. Få mere at vide om automatisk logning.

Skærmbillede, der viser siden med indstillinger for autolog.