Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Gäller för:✅ Fabric datateknik och datavetenskap
När du skapar en arbetsyta i Fabric skapas automatiskt en startpool som är kopplad till den arbetsytan. Med den förenklade uppsättningen i Fabric behöver du inte välja nod- eller maskinstorlek, eftersom dessa alternativ hanteras bakom kulisserna. Den här konfigurationen ger en snabbare (5–10 sekunder) Startupplevelse för Apache Spark-sessioner så att användarna kan komma igång och köra dina Apache Spark-jobb i många vanliga scenarier utan att behöva oroa sig för att konfigurera beräkningen. För avancerade scenarier med specifika beräkningskrav kan användarna skapa en anpassad Apache Spark-pool och storleksanpassa noderna baserat på deras prestandabehov.
Om du vill göra ändringar i Apache Spark-inställningarna på en arbetsyta bör du ha administratörsrollen för den arbetsytan. Mer information finns i Roller på arbetsytor.
Så här hanterar du Spark-inställningarna för poolen som är associerad med din arbetsyta:
Gå till arbetsytans inställningar i din arbetsyta och välj alternativet Dataingenjörsvetenskap för att expandera menyn:
Du ser alternativet Spark Compute i den vänstra menyn:
Kommentar
Om du ändrar standardpoolen från startpoolen till en anpassad Spark-pool kan du se längre sessionsstart (~3 minuter).
Bassäng
Standardpool för arbetsytan
Du kan använda den automatiskt skapade startpoolen eller skapa anpassade pooler för arbetsytan.
Startpool: Förhydrerade livepooler skapas automatiskt för din snabbare upplevelse. Dessa kluster är medelstora. Startpoolen är inställd på en standardkonfiguration baserat på den SKU för infrastrukturkapacitet som köpts. Administratörer kan anpassa maximalt antal noder och utförare baserat på deras krav på Spark-arbetsbelastningsskalning. Mer information finns i Konfigurera startpooler
Anpassad Spark-pool: Du kan storleksanpassa noderna, autoskalning och dynamiskt allokera exekutorer baserat på dina Krav för Spark-jobb. Om du vill skapa en anpassad Spark-pool bör kapacitetsadministratören aktivera alternativet Anpassade arbetsytepooler i avsnittet Spark Compute i Inställningar för kapacitetsadministratör.
Kommentar
Kapacitetsnivåkontrollen för anpassade arbetsytepooler är aktiverad som standard. Mer information finns i Konfigurera och hantera inställningar för datateknik och datavetenskap för Fabric-kapaciteter.
Administratörer kan skapa anpassade Spark-pooler baserat på deras beräkningskrav genom att välja alternativet Ny pool .
Apache Spark for Fabric stöder kluster med en enda nod, vilket gör det möjligt för användare att välja en minsta nodkonfiguration på 1, i vilket fall drivrutinen och exekutören körs i en enda nod. Dessa kluster med en nod erbjuder återställningsbar hög tillgänglighet vid nodfel och bättre tillförlitlighet för arbetsbelastningar med mindre beräkningskrav. Du kan också aktivera eller inaktivera alternativet automatisk skalning för dina anpassade Spark-pooler. När den är aktiverad med autoskalning hämtar poolen nya noder inom den maximala nodgräns som angetts av användaren och drar tillbaka dem efter jobbkörningen för bättre prestanda.
Du kan också välja alternativet att dynamiskt allokera körningarna till poolen med optimalt automatiskt antal exekutörer inom den maximalt tillåtna gränsen som anges baserat på datavolymen för bättre prestanda.
Läs mer om Apache Spark-beräkning för Fabric.
- Anpassa beräkningskonfigurationen för objekt: Som arbetsyteadministratör kan du tillåta användare att justera beräkningskonfigurationer (egenskaper på sessionsnivå som omfattar Driver/Executor Core, Driver/Executor Memory) för enskilda objekt, till exempel notebook-filer, Spark-jobbdefinitioner med hjälp av miljö.
Om inställningen inaktiveras av arbetsyteadministratören används standardpoolen och dess beräkningskonfigurationer för alla miljöer på arbetsytan.
Miljö
Miljön innehåller flexibla konfigurationer för att köra dina Spark-jobb (notebook-filer, Spark-jobbdefinitioner). I en miljö kan du konfigurera beräkningsegenskaper, välja olika körningsfunktioner och konfigurera beroenden för bibliotekspaket baserat på dina arbetsbelastningskrav.
På fliken Miljö har du möjlighet att ange standardmiljön. Du kan välja vilken version av Spark du vill använda för arbetsytan.
Som administratör för ett Fabric-arbetsyta kan du välja en miljö som standardmiljö för arbetsytan.
Du kan också skapa en ny via listrutan Miljö .
Om du inaktiverar alternativet för att ha en standardmiljö kan du välja Fabric-körningsversionen från de tillgängliga körningsversioner som anges i listrutan.
Läs mer om Apache Spark-miljöer.
Jobb
Med jobbinställningar kan administratörer styra jobbantagningslogiken för alla Spark-jobb på arbetsytan.
Som standardinställning är alla arbetsytor aktiverade med Optimistic Job Admission. Läs mer om jobbantagning för Spark in Fabric.
Du kan aktivera Reservera maximala kärnor för aktiva Spark-jobb för att stänga av den optimistiska jobbantagningsmetoden och reservera maximalt antal kärnor för dina Spark-jobb.
Du kan också ange tidsgränsen för Spark-sessionen för att anpassa sessionens förfallodatum för alla interaktiva sessioner i notebook-filen.
Kommentar
Standardsessionens förfallodatum är inställt på 20 minuter för interaktiva Spark-sessioner.
Sätt maximal jobblivstid
Använd inställningen Sätt maximal jobblivslängd som en skyddsräcke för att förhindra att okontrollerade Spark-jobb förbrukar beräkning utöver en definierad tidsgräns. När du slår på denna inställning och anger en varaktighet, avslutar Fabric automatiskt alla berättigade Spark-jobb som är längre än den konfigurerade livslängden. Arbetsytadministratörer kan använda denna kontroll för att:
- Stoppa okontrollerade eller fastnade jobb innan de har kapacitet på obestämd tid och blockera andra arbetsuppgifter i arbetsmiljön.
- Upprätthåll efterlevnad och styrningspolicys för beräkningar genom att begränsa hur länge ett enskilt jobb kan påbörjas.
För att konfigurera den, slå på Sätt maximal jobblivslängd, ange ett värde, välj en tidsenhet som timmar, och välj sedan Spara för att applicera gränsen på arbetsytan.
Vilka jobb påverkas
Den maximala jobblivslängden gäller endast för användarinskickade jobb – jobb som en användare uttryckligen startar och som körs med användarens identitet. Dessa jobb inkluderar till exempel:
- Interaktiva och schemalagda anteckningsbokskörningar, inklusive anteckningsbokskörningar som orkestrerar genom en pipeline.
- Spark-jobbdefinitionen körs, oavsett om du skickar in dem direkt, enligt schema eller genom en pipeline.
- Livy batch- och interaktiva sessioner, inklusive sessioner med hög samtidighet.
Systemhanterade jobb påverkas inte av denna inställning och fortsätter att köras till slut. Dessa jobb utlöses och hanteras av Fabric på dina vägnar, såsom:
- Underhåll av sjöhusbord, såsom optimera och dammsuga.
- Materialiserad sjövy uppdateras.
- Plattformsverksamhet, såsom säkerhet och policyverkställighet.
Denna skillnad säkerställer att bakgrundsunderhåll och plattformsdrift som håller din data och arbetsplats friska inte avbryts, medan användarnas arbetsbelastningar förblir utsatta för skyddsreglen.
Kommentar
När ett jobb når den konfigurerade maximala livslängden avbryter Fabric det automatiskt. Sätt en gräns som ger tillräckligt med tid för dina längst pågående legitima användarjobb att bli klara.
Hög samtidighet
Med läge för hög samtidighet kan användare dela samma Spark-sessioner i Apache Spark för arbetsbelastningar inom datateknik och datavetenskap. Ett objekt som en notebook-fil använder en Spark-session för körningen och när det är aktiverat kan användare dela en enda Spark-session över flera notebook-filer.
Läs mer om hög samtidighet i Apache Spark för Fabric.
Automatisk loggning för strojové učenie modeller och experiment
Administratörer kan nu aktivera automatisk loggning för sina maskininlärningsmodeller och experiment. Det här alternativet samlar automatiskt in värdena för indataparametrar, utdatamått och utdataobjekt i en maskininlärningsmodell när den tränas. Läs mer om automatisk loggning.
Relaterat innehåll
- Läs mer om Apache Spark Runtimes i Fabric – Översikt, Versionshantering, Stöd för flera körtider och uppgradering av Delta Lake Protocol.
- Läs mer i den offentliga dokumentationen för Apache Spark .
- Hitta svar på vanliga frågor och svar: Vanliga frågor och svar om administration av Apache Spark-arbetsyteinställningar.