Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Effektiv kapacitetsplanering hjälper till att säkerställa att dina Azure Batch arbetsbelastningar har de beräkningsresurser de behöver, när de behöver dem. Den här artikeln beskriver hur Batch-kapaciteten är strukturerad, hur du planerar kvoter för dina arbetsbelastningar och hur du minskar risken för allokeringsfel.
En kvot är en gräns, inte en kapacitetsgaranti. Planering framåt hjälper dig att begära lämplig kvot, välja elastiska konfigurationer och reagera korrekt när kapaciteten är begränsad. De specifika standard- och maxvärdena finns i Batch-tjänstkvoter och -gränser.
Bekräfta att Batch passar din arbetsbelastning
Använd Batch när du vill att Azure ska erbjuda schemaläggning som en tjänst och din applikation kan organisera arbetet i pools, jobb och uppgifter. Innan du planerar batchkapacitet, överväg dessa alternativ:
- Välj Azure CycleCloud när du behöver driva en specifik HPC-schemaläppare, anpassa klustertopologin och mjukvarustacken, eller anpassa dig nära befintliga lokala arbetsflöden.
- Välj Azure CycleCloud Workspace för Slurm när du vill ha en färdig Slurm-miljö med nätverks-, lagrings- och åtkomstkomponenter konfigurerade i din prenumeration.
Om Batch är rätt driftsmodell, använd följande avsnitt för att uppskatta toppbelastning, välja VM:ar, beräkna kvot och definiera reservplan innan du skapar produktionspooler.
Kapacitetshierarki
Batchkapaciteten styrs i flera lager, där varje lager begränsar den under den. Din effektiva kapacitet bestäms av den mest begränsande länken i kedjan.
Längst upp tillhandahåller Azure regionen den fysiska datacenterkapacitet som är tillgänglig för varje VM-familj. Regional kapacitet är inte ett fast värde som du styr. det varierar över tid och efter VM-serier. Din kvot för prenumerationen fastställer sedan den tillåtna gränsen för antal kärnor per VM-familj per region. I allokeringsläge för användarprenumerationspooler gäller dessa prenumerationskvoter direkt för dina Batch-pooler. Batch-kontokvoten anger vilka kärnor, pooler och aktiva jobb som tillåts per Batch-konto. I allokeringsläget för Batch service pool gäller dessa kvoter på kontonivå. Slutligen begränsar poolgränserna antalet noder per pool, baserat på kvoten ovanför poolen och de poolstorleksgränser som anges av Batch-tjänsten.
Att förstå vilket lager som gäller för ditt konto beror på poolallokeringsläget. Mer information finns i Batch-konton och poolallokeringslägen.
Planera dina kapacitetskrav
Innan du skapar produktionspooler bör du uppskatta de resurser som arbetsbelastningen behöver. Gå igenom följande frågor för att översätta arbetsbelastningsegenskaper till en kvotbegäran:
- Arbetsbelastningsprofil. Vilket är det högsta antalet samtidiga jobb och uppgifter? Vad är den genomsnittliga varaktigheten för aktiviteten och minnesbehovet? Behöver uppgifter GPU:er eller MPI-samordning (Multi-Node) ?
- Val av virtuell dator. Vilken VM-familj och storlek matchar bäst arbetsbelastningen? Hur många kärnor och hur mycket minne tillhandahåller varje virtuell dator?
- Storlek på pool. Hur många aktiviteter körs samtidigt per nod (upp till fyra gånger så många nodkärnor som är begränsade till 256 aktivitetsfack per nod)? Hur många noder behöver du med tanke på det högsta antalet samtidiga aktiviteter? Hur delar du upp kapacitet mellan dedikerade noder och spotnoder?
- Kvotkrav. Multiplicera det maximala antalet noder med kärnorna per virtuell dator för att få det totala antalet kärnor som behövs. Jämför den summan med din aktuella kvot för att fastställa den ökning som ska begäras.
- Kostnadsuppskattning. Använd den virtuella datorns timpris och förväntad körningstid för att beräkna den dagliga och månatliga kostnaden. Mer information finns i Planera för att hantera kostnader för Azure Batch.
Information om hur du kontrollerar dina aktuella kvoter och begär en ökning finns i Visa Batch-kvoter och Öka en kvot. Skicka kvotbegäranden i god tid och börja med blygsamma, inkrementella ökningar. Stora kvotökningar kan kräva manuell granskning och kan ta flera dagar till flera veckor.
Hantera kapacitet proaktivt
Planera för kapacitet innan det blir en begränsning:
- Övervaka kvotanvändning. Spåra kärnanvändningen mot din kvot och avisering när användningen närmar sig gränsen, till exempel vid 70–80%. Mer information finns i Övervaka Batch-lösningar.
- Använd automatisk skalning. Konfigurera automatisk skalning så att pooler växer och krymper med efterfrågan i stället för att hålla ett fast, överetablerad nodantal. Ett vanligt mönster bygger på en basnivå av dedikerade noder för garanterad framdrift och skalar upp till Spot-noder för ytterligare genomströmning.
- Fördelat på regioner och konton. Distribuera arbetsbelastningar mellan flera regioner eller Batch-konton för att få åtkomst till mer aggregerad kapacitet. Tjänstkvoter som aktiva jobb och pooler gäller för varje enskilt Batch-konto.
Hantera kapacitetsbegränsningar
Även med planeringen kan det uppstå allokeringsfel. Utforma arbetsflödet så att det är motståndskraftigt:
- Försök igen och diversifiera. Om en pool inte kan nå sin målstorlek försöker du igen efter några minuter, provar en annan VM-storlek eller provar en annan region. Resurstillgänglighet ändras över tid.
- Ändra mål för jobb. Undvik att förlita dig på en enda statisk pool. Se till att du kan omdirigera jobb till en annan pool, möjligen med en annan VM-storlek, om en pool inte kan skalas upp. Mer information finns i Azure Batch metodtips.
- Utforma för avbrytning av Spot-instanser.Spot-noder kan avbrytas när Azure behöver tillbaka kapaciteten. Använd endast spotnoder för feltolerant arbete och kombinera dem med dedikerade noder och autoskalning så att poolen återställs automatiskt.
Detaljerade symptom, orsaker och lösningar på allokerings- och kvotfel finns i felsökningsvägledningen:
Validera kapacitet före produktion
Genomför ett koncepttest med en representativ arbetsbelastning, den förväntade datavolymen och produktionspoolens konfiguration. Godkänn inte designen för produktion förrän du kan dokumentera bevis för varje kriterium:
| Criterion | Bevis att dokumentera |
|---|---|
| Slutförande av arbetsbelastning | Jobbet slutförs korrekt med produktionsuppgiftsberoenden, applikationspaket samt in- och utdatavägar. |
| Skala och kvot | Poolen når det nödvändiga antalet noder i den avsedda regionen utan att överskrida batchkonto, prenumeration eller VM-familjens kvot. |
| Prestanda | Jobbtid från början till slut uppfyller målet, inklusive poolallokering, dataöverföring, beräkning och resultatpersistens. |
| Recovery | Efter en nodförlust, uppgiftsfel eller Spot-preemption om det används, håller sig jobbet inom den registrerade maximala återställningstiden och tillåten checkpointförlust, uppfyller slutförandedeadlinen och använder framgångsrikt den planerade reservreserv-VM-storleken eller poolen. |
| Cost | Uppmätt beräknings-, lagrings-, nätverks- och licenskostnad per slutfört jobb uppfyller målet vid förväntad körfrekvens. |
| Operations | Varningar identifierar kvottryck, allokeringsfel och misslyckade uppgifter, och en ägare kan omdirigera eller återställa arbetsbelastningen. |
Om ett kriterium inte uppfylls, justera poolstorleken, VM-valet, lagringssökvägen, återförsöksbeteendet eller den regionala redundanslösningen och kör samma jobb igen. Ett litet funktionstest fastställer inte produktionskapacitet eftersom det inte utnyttjar toppskala, kvot eller datarörelse.
Regelverk
| Practice | Description |
|---|---|
| Begär kvot tidigt | Skicka kvotbegäranden i god tid. stora ökningar kan ta flera dagar till flera veckor. |
| Planera för utrymme | Begär något mer kvot än din nuvarande topp för att möjliggöra tillväxt. |
| Använda flera regioner | Sprid arbetsbelastningar mellan regioner för att få åtkomst till mer aggregerad kapacitet. |
| Övervaka användning | Avisering när kärnanvändningen når 70–80% av din kvot. |
| Virtuella datorer med rätt storlek | Matcha den virtuella datorns familj och storlek med arbetsbelastningen i stället för överetablering. |
| Använd Spot klokt | Reservera Spot-noder för feltåliga arbetsbelastningar och kombinera dem med dedikerade noder. |
| Rensa resurser | Ta bort oanvända pooler till den kostnadsfria kontokvoten. |