Notitie
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen u aan te melden of de directory te wijzigen.
Voor toegang tot deze pagina is autorisatie vereist. U kunt proberen de mappen te wijzigen.
Dit artikel bevat een beknopt overzicht en een gedetailleerde beschrijving van de quota en limieten voor Azure OpenAI.
Omvang van het quotum
Quota en limieten worden niet afgedwongen op tenantniveau. In plaats daarvan wordt het hoogste niveau van quotumbeperkingen ingesteld op het niveau van het Azure abonnement.
Quotabeheer op abonnementsniveau
Important
Quotabeheer op abonnementsniveau in Microsoft Foundry is gestart na 7 mei 2026.
Vanaf Realtime Vertalen en Realtime Whisper, en binnenkort alle modellen, houdt Foundry het quotum voor implementaties bij op abonnementsniveau in plaats van per resource of per regio. Deze aanpak brengt consistentie en voorspelbaarheid met zich mee hoe het quotum wordt beheerd in implementaties, omdat alle resources en regio's in een abonnement dezelfde quotumgroep delen.
Met deze wijziging wordt het quotum samengevoegd tot gedeelde pools:
- Globale standaard: implementaties van hetzelfde model en dezelfde versie delen één quotumgroep in alle regio's in een abonnement.
- Data Zone Standard: implementaties van hetzelfde model en dezelfde versie delen één quotumgroep per gegevenszone (bijvoorbeeld VS of EU).
Zie Microsoft Quota en limieten voor Foundry Models voor meer informatie over quotumtoewijzing op abonnementsniveau.
Quotumlagen
Microsoft introduceert quotaniveaus om de ervaring met Foundry Models te verbeteren en drempels te verlagen naarmate workloads worden opgeschaald. Quota worden nu automatisch verhoogd met gebruik, waardoor snelheidslimietfouten worden voorkomen en tegelijkertijd een eerlijkere omgeving voor alle gebruikers wordt gemaakt. Er zijn zeven niveaus beschikbaar: het gratis niveau en niveaus 1 tot en met 6, waarbij niveau 6 de hoogste quota biedt. Het aanvankelijk toegewezen niveau van een klant is gebaseerd op hun huidige gebruik van dat model en hun huidige relatie met Microsoft, zoals de status van een Enterprise Agreement (EA of MCA-E).
Wat verandert er voor mij?
Eerder bood Foundry alleen de standaard- en Enterprise-quotaniveaus voor het pay-as-you-go-aanbiedingstype aan, met een groot verschil tussen elk niveau en een langer proces om verhogingen aan te vragen. Met quotumlagen krijgen alle gebruikers een laag toegewezen met quota die gelijk is aan of hoger is dan de vorige niveaus. Eventuele eerder goedgekeurde quotumverhogingen worden bewaard en worden niet verlaagd. Naarmate het gebruik toeneemt, verhoogt Foundry automatisch quota door gebruikers naar hogere lagen te verplaatsen en kunnen er nog steeds extra quota worden aangevraagd via het quotumformulier.
Hoe wordt een klant automatisch van de ene laag naar de andere verplaatst, bijvoorbeeld wat zijn de criteria voor het wijzigen van de laag?
Automatische tier-upgrades hangen voornamelijk af van consumptietrends van klanten binnen Foundry Models in de loop van de tijd. Als het gebruik van een klant zodanig toeneemt dat de huidige quotumlaag de mogelijkheid beperkt om Foundry Models te gebruiken, wordt de klant automatisch bijgewerkt naar de volgende hogere laag. Het systeem beschouwt ook de relatie van een klant met Microsoft. Klanten met Enterprise-relaties (inclusief EA en MCA-E) met Microsoft krijgen hogere quotumlagen toegewezen. Daarnaast beschouwt Microsoft ook de betalingsgeschiedenis van een klant om de geschiktheid voor automatische upgrades te bepalen.
Kan ik me afmelden voor automatische upgrades?
Ja, u kunt zich afmelden voor automatische upgrades om in uw huidige laag te blijven, ongeacht wijzigingen in uw verbruik. Sommige klanten gebruiken quota om hun facturering te beheren. Het gebruik van quota voor het beheren van facturering is niet de Azure best practice, maar als uw systeem op die manier is geconfigureerd, wilt u dit mogelijk niet verbreken. Zie Cost Management voor meer informatie over factureringsbeheer en best practices.
Als u zich wilt afmelden, kunt u de volgende vlag instellen op NoAutoUpgrade:
curl -X PATCH \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers/default?api-version=2025-10-01-preview" \
-H "Authorization: Bearer <YOUR_ACCESS_TOKEN>" \
-H "Content-Type: application/json" \
-d '{
"properties": {
"tierUpgradePolicy": "NoAutoUpgrade"
}
}'
Opmerking
De opt-outfunctie is preview en kan in de toekomst worden gewijzigd of verwijderd.
Kan ik meer quotum aanvragen?
Ja, met behulp van het formulier voor quotumaanvragen kunt u altijd meer quotum aanvragen. Als de aanvraag is goedgekeurd, blijft de huidige laag hetzelfde, maar met meer quota toegewezen.
Hoe controleer ik de quotumlaag van mijn abonnement?
U kunt momenteel de quotumlaag controleren met de API voor het besturingsvlak:
curl -X GET \
"https://management.azure.com/subscriptions/00000000-0000-0000-0000-000000000000/providers/Microsoft.CognitiveServices/quotaTiers?api-version=2025-10-01-preview" \
-H "Authorization: Bearer $(az account get-access-token --resource https://management.azure.com --query accessToken -o tsv)" \
-H "Content-Type: application/json"
Referentie voor quotumlaag
Niveau 1
| Modelnaam | Implementatietype | Aanvragen per minuut (RPM) | Tokens per minuut (TPM) |
|---|---|---|---|
| codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| computergebruik-voorbeeldweergave | GlobalStandard | 4,500 | 450.000 |
| gpt-4.1 | DataZoneStandard | 300 | 300,000 |
| gpt-4.1 | GlobalStandard | 1,000 | 1,000,000 |
| gpt-4.1-mini | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-mini | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4.1-mini | Standaard | 6,000 | 6,000,000 |
| gpt-4.1-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-4.1-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-4o | DataZoneStandard | 300 / 10 seconden | 300,000 |
| gpt-4o-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini | DataZoneStandard | 10.000 | 1,000,000 |
| gpt-4o-mini | GlobalStandard | 20,000 | 2,000,000 |
| gpt-4o-mini-audio-preview | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-4o-mini-realtime-preview | GlobalStandard | 36 | 6,000 |
| gpt-4o-realtime-voorbeeldweergave | GlobalStandard | 36 | 6,000 |
| gpt-5 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-mini | DataZoneStandard | 300 | 300,000 |
| gpt-5-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5-pro | GlobalStandard | 1,600 | 160,000 |
| gpt-5.1 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1 | Standaard | 3,000 | 300,000 |
| gpt-5.1-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.1-codex | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.1-codex-max | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.1-codex-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2 | DataZoneStandard | 3,000 | 300,000 |
| gpt-5.2 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.2-chat | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-chat | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.2-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.3-codex | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4 | DataZoneStandard | 300 | 300,000 |
| gpt-5.4 | GlobalStandard | 10.000 | 1,000,000 |
| gpt-5.4-pro | GlobalStandard | 160 | 160,000 |
| gpt-5.4-mini | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.4-nano | DataZoneStandard | 2.000 | 2,000,000 |
| gpt-5.4-nano | GlobalStandard | 5,000 | 5,000,000 |
| gpt-5.5 | DataZoneStandard | 0 | 0 |
| gpt-5.5 | GlobalStandard | 0 | 0 |
| gpt-5.6-luna | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-luna | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-sol | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-sol | GlobalStandard | 1,000 | 1,000,000 |
| gpt-5.6-terra | DataZoneStandard | 333 | 333,000 |
| gpt-5.6-terra | GlobalStandard | 1,000 | 1,000,000 |
| gpt-chat-latest | GlobalStandard | 10.000 | 1,000,000 |
| gpt-audio | GlobalStandard | 30000 / 10s | 30,000,000 |
| gpt-image-1 | GlobalStandard | 9 | - |
| gpt-image-1-mini | GlobalStandard | 12 | - |
| gpt-image-1.5 | DataZoneStandard | 3 | - |
| gpt-image-1.5 | GlobalStandard | 9 | - |
| gpt-image-2 | DataZoneStandard | 2 | - |
| gpt-image-2 | GlobalStandard | 6 | - |
| gpt-realtime | GlobalStandard | 200 | 100,000 |
| model-router | DataZoneStandard | 300 | 300,000 |
| model-router | GlobalStandard | 1,000 | 1,000,000 |
| o1 | DataZoneStandard | 100 | 600,000 |
| o1 | GlobalStandard | 500 | 3,000,000 |
| o3 | DataZoneStandard | 300 | 300,000 |
| o3 | GlobalStandard | 1,000 | 1,000,000 |
| o3-deep-research | GlobalStandard | 3,000 | 3,000,000 |
| o3-mini | DataZoneStandard | 200 | 2,000,000 |
| o3-mini | GlobalStandard | 500 | 5,000,000 |
| o3-pro | GlobalStandard | 160 | 1,600,000 |
| o4-mini | DataZoneStandard | 300 / 10 seconden | 300,000 |
| o4-mini | GlobalStandard | 1,000 | 1,000,000 |
| tekst-insluiten-3-groot | DataZoneStandard | 1,000 | 1,000,000 |
| tekst-insluiten-3-groot | GlobalStandard | 1000 / 10 seconden | 1,000,000 |
| tekst-insluiten-3-klein | DataZoneStandard | 1,000 | 1,000,000 |
| tekst-insluiten-3-klein | GlobalStandard | 1000 / 10 seconden | 1,000,000 |
Referentie voor quota en limieten
In de volgende sectie vindt u een beknopt overzicht van de standaardquota en limieten die van toepassing zijn op Azure OpenAI:
| Naam beperken | Limietwaarde |
|---|---|
| Azure OpenAI-resources per Azure-abonnement | 30. |
| Standaardlimieten voor GPT-image-1 | 9 aanvragen per minuut |
| Standaardlimieten voor GPT-image-1-miniquota | 12 aanvragen per minuut |
| Standaardlimieten voor GPT-image-1.5 | 9 aanvragen per minuut |
| Standaardlimieten voor GPT-image-2 | 9 aanvragen per minuut |
| Standaardlimieten voor Sora-quota | 60 aanvragen per minuut. |
| Standaardlimieten voor het quotum van Sora 2 | 2 taakaanvragen1 per minuut |
| Standaardlimieten voor audio-naar-tekst-API | 3 aanvragen per minuut. |
| Maximum aantal prompttokens per aanvraag | Verschilt per model. Zie Azure OpenAI-modellen voor meer informatie. |
| Maximum aantal standaardimplementaties per resource | 32. |
| Maximaal afgestemde modelimplementaties | 10. |
| Totaal aantal trainingstaken per resource | 100. |
| Maximaal aantal gelijktijdig uitgevoerde trainingstaken per resource | Standaard- en globale training: 3; Training voor ontwikkelaars: 5 |
| Maximale trainingsopdrachten in de wachtrij | 20. |
| Maximum aantal bestanden per resource (afstemmen) | 100. |
| Totale grootte van alle bestanden per bron (fine-tuning) | 1 GB. |
| Maximale trainingstaaktijd (taak mislukt indien overschreden) | 720 uur. |
Maximale grootte van trainingstaak (tokens in training file) x (# of epochs) |
2 miljard. |
| Maximale grootte van alle bestanden per upload (Azure OpenAI op uw gegevens) | 16 MB. |
Maximum aantal invoer in matrix met /embeddings |
2,048. |
Maximum aantal tokens per /embeddings aanvraag (som voor alle invoer) |
300,000. |
Maximum aantal /chat/completions berichten |
2,048. |
Maximum aantal /chat/completions functies |
128. |
Maximum aantal /chat/completions hulpprogramma's |
128. |
| Maximum aantal ingerichte doorvoereenheden per implementatie | 100,000. |
| Maximum aantal bestanden per assistent of thread | 10.000 bij gebruik van de API of de Microsoft Foundry-portal. |
| Maximale bestandsgrootte voor virtuele assistenten en fine-tuning | 512 MB via de API 200 MB via de Foundry portal. |
| Maximum aantal aanvragen voor het uploaden van bestanden per resource | 30 aanvragen per seconde. |
| Maximale grootte voor alle geüploade bestanden voor assistenten | 200 GB. |
| Tokenlimiet voor assistenten | Limiet van 2.000.000 token. |
GPT-4o en GPT-4.1 maximum aantal afbeeldingen per aanvraag (aantal afbeeldingen in de berichtenmatrix of gespreksgeschiedenis) |
50. |
GPT-4 vision-preview en GPT-4 turbo-2024-04-09 standaard maximumtokens |
16. Verhoog de max_tokens parameterwaarde om afgekapte antwoorden te voorkomen.
GPT-4o maximumtokens zijn standaard ingesteld op 4.096. |
| Maximum aantal aangepaste headers in API-aanvragen2 | 10. |
| Limiet voor berichttekens | 1,048,576. |
| Berichtgrootte voor audiobestanden | 20 MB. |
1 Het Sora 2 RPM-quotum telt alleen aanvragen voor videotaken. Andere soorten aanvragen zijn niet onderhevig aan snelheidsbeperkingen.
2 Onze huidige API's staan maximaal 10 aangepaste headers toe, die worden doorgegeven via de pijplijn en geretourneerd. Sommige klanten overschrijden nu dit aantal headers, wat resulteert in HTTP 431-fouten. Er is geen oplossing voor deze fout, behalve om het volume van de header te verminderen. In toekomstige API-versies worden aangepaste headers niet doorgegeven. We raden klanten aan om niet afhankelijk te zijn van aangepaste headers in toekomstige systeemarchitecturen.
Opmerking
Quotumlimieten kunnen worden gewijzigd.
Batchlimieten
| Naam beperken | Limietwaarde |
|---|---|
| Maximum aantal Batch-invoerbestanden - (geen vervaldatum) | 500 |
| Maximum aantal invoerbestanden voor batch - (vervaldatum ingesteld) | 10.000 |
| Maximale grootte van invoerbestand | 200 MB |
| Maximale grootte van invoerbestand - Bring Your Own Storage (BYOS) | 1 GB |
| Maximum aantal aanvragen per bestand | 100,000 |
Opmerking
Batch-bestandslimieten zijn niet van toepassing op uitvoerbestanden (bijvoorbeeld result.jsonlen error.jsonl). Als u limieten voor batchinvoerbestanden wilt verwijderen, gebruikt u Batch met Azure Blob Storage.
Batchquotum
In de tabel wordt de limiet voor batchquota weergegeven. Quotumwaarden voor globale batch worden weergegeven in termen van enqueued tokens. Wanneer u een bestand verzendt voor batchverwerking, wordt het aantal tokens in het bestand geteld. Totdat de batchtaak een eindstatus heeft bereikt, tellen deze tokens mee voor de totale limiet van wachtrijtokens.
Globale batch
| Model | Enterprise en MCA-E | Standaard | Maandelijkse abonnementen op basis van creditcards | MSDN-abonnementen | Azure voor studenten, gratis proefversies |
|---|---|---|---|---|---|
gpt-4.1 |
5B | 200M | 50M | 90K | N/A |
gpt-4.1 mini |
15B | 1B | 50M | 90K | N/A |
gpt-4.1-nano |
15B | 1B | 50M | 90K | N/A |
gpt-4o |
5B | 200M | 50M | 90K | N/A |
gpt-4o-mini |
15B | 1B | 50M | 90K | N/A |
gpt-4-turbo |
300 mln | 80M | 40M | 90K | N/A |
gpt-4 |
150 miljoen | 30 miljoen | 5M | 100.000 | N/A |
o3-mini |
15B | 1B | 50M | 90K | N/A |
o4-mini |
15B | 1B | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.2 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-nano |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
B = miljard | M = miljoen | K = duizend
Gegevensgebiedbatch
| Model | Enterprise en MCA-E | Standaard | Maandelijkse abonnementen op basis van creditcards | MSDN-abonnementen | Azure voor studenten, gratis proefversies |
|---|---|---|---|---|---|
gpt-4.1 |
500 miljoen | 30 miljoen | 30 miljoen | 90K | N/A |
gpt-4.1-mini |
1,5B | 100M | 50M | 90K | N/A |
gpt-4o |
500 miljoen | 30 miljoen | 30 miljoen | 90K | N/A |
gpt-4o-mini |
1,5B | 100M | 50M | 90K | N/A |
o3-mini |
1,5B | 100M | 50M | 90K | N/A |
gpt-5 |
5B | 200M | 50M | 90K | N/A |
gpt-5.1 |
5B | 200M | 50M | 90K | N/A |
gpt-5.4 |
5B | 200M | 50M | N/A | N/A |
gpt-5.4-mini |
5B | 200M | 50M | N/A | N/A |
gpt-5.5 |
5B | 200M | 50M | 90K | N/A |
gpt-oss
| Model | Tokens per minuut (TPM) | Aanvragen per minuut (RPM) |
|---|---|---|
gpt-oss-120b |
5 miljoen | 5 kB |
Gebruikslagen
Global Standard-implementaties maken gebruik van de globale infrastructuur van Azure. Ze routeren klantverkeer dynamisch naar het datacenter met de beste beschikbaarheid voor de inference-aanvragen van de klant. Op dezelfde manier kunt u met de standaardimplementaties voor gegevenszones de globale infrastructuur van Azure gebruiken om verkeer dynamisch te routeren naar het datacenter binnen de Microsoft gedefinieerde gegevenszone met de beste beschikbaarheid voor elke aanvraag. Deze procedure maakt consistentere latentie mogelijk voor klanten met een laag tot gemiddeld verkeersniveau. Klanten met een hoog blijvend gebruiksniveau kunnen meer variabiliteit in reactielatentie zien.
Azure OpenAI-gebruikslagen zijn ontworpen om consistente prestaties te bieden voor de meeste klanten met een laag tot gemiddeld verkeersniveau. Elke gebruikslaag definieert de maximale doorvoer (tokens per minuut) die u kunt verwachten met voorspelbare latentie. Wanneer uw gebruik binnen uw toegewezen laag blijft, blijft de latentie stabiel en zijn reactietijden consistent.
Wat gebeurt er als u de gebruikslaag overschrijdt?
- Als uw aanvraagdoorvoer uw gebruikslaag overschrijdt, met name tijdens perioden met hoge vraag, kan uw reactielatentie aanzienlijk toenemen.
- Latentie kan variëren en in sommige gevallen kan het meer dan twee keer hoger zijn dan wanneer u binnen uw gebruikslaag werkt.
- Deze variabiliteit is het meest merkbaar voor klanten met een hoog langdurig gebruik of met pieken in het dataverkeer.
Aanbevolen acties als u de gebruikslaag overschrijdt
Als u 429-fouten ondervindt of een verhoogde latentievariabiliteit ondervindt, voert u de volgende stappen uit:
- Vraag een quotumverhoging aan: ga naar de Azure-portal om een hoger quotum voor uw abonnement aan te vragen.
- Overweeg een upgrade uit te voeren naar een Premium-aanbieding (PTU): voor workloads met latentiekritiek of hoog volume, upgraden naar ingerichte doorvoereenheden (PTU). PTU biedt toegewezen middelen, gegarandeerde capaciteit en voorspelbare latentie, zelfs op grote schaal. Dit is de beste keuze voor bedrijfskritieke toepassingen die consistente prestaties vereisen.
- Bewaak uw gebruik: controleer regelmatig uw metrische gebruiksgegevens in de Azure-portal om ervoor te zorgen dat u binnen uw laaglimieten werkt. Pas uw workload- of implementatiestrategie indien nodig aan.
Mogelijk ontvangt u 429 (Te veel aanvragen) antwoorden, zelfs wanneer metrische gegevens over tokengebruik onder uw quotum worden weergegeven. Voor een uitleg van waarom dit gebeurt, raadpleegt u Waarom u mogelijk 429s ziet, zelfs wanneer de metrische gegevens over tokengebruik onder het quotum vallen.
De gebruikslimiet bepaalt het gebruiksniveau waarboven klanten grotere variabiliteit in reactielatentie kunnen zien. Het gebruik van een klant wordt per model gedefinieerd. Dit is het totale aantal tokens dat wordt gebruikt voor alle implementaties in alle abonnementen in alle regio's voor een bepaalde tenant.
Opmerking
Gebruikslagen zijn alleen van toepassing op de implementatietypen Standard, Data Zone Standard en Global Standard. Gebruikslimieten zijn niet van toepassing op wereldwijde batch- en ingerichte verwerkingscapaciteitimplementaties.
Global Standard, Data Zone Standard en Standard
| Model | Gebruiksniveaus per maand |
|---|---|
gpt-5 |
32 miljard tokens |
gpt-5-mini |
160 miljard tokens |
gpt-5-nano |
800 miljard tokens |
gpt-5-chat |
32 miljard tokens |
gpt-4
+
gpt-4-32k (alle versies) |
6 miljard tokens |
gpt-4o |
12 miljard tokens |
gpt-4o-mini |
85 miljard tokens |
o3-mini |
50 miljard tokens |
o1 |
4 miljard tokens |
o4-mini |
50 miljard tokens |
o3 |
5 miljard tokens |
gpt-4.1 |
30 miljard tokens |
gpt-4.1-mini |
150 miljard tokens |
gpt-4.1-nano |
550 miljard tokens |
gpt-5.1 |
86 miljard tokens |
gpt-5.1-codex |
86 miljard tokens |
gpt-5.2 |
60 miljard tokens |
gpt-5.3-codex |
60 miljard tokens |
gpt-5.4 |
50 miljard tokens |
gpt-5.4-mini |
165 miljard tokens |
gpt-5.4-nano |
605 miljard tokens |
gpt-5.5 |
25 miljard tokens |
gpt-5.6-sol |
25 miljard tokens |
Algemene aanbevolen procedures om binnen frequentielimieten te blijven
Als u problemen met betrekking tot frequentielimieten wilt minimaliseren, is het een goed idee om de volgende technieken te gebruiken:
- Implementeer logica voor opnieuw proberen in uw toepassing.
- Vermijd scherpe wijzigingen in de workload. Verhoog de workload geleidelijk.
- Test verschillende patronen voor belastingverhoging.
- Verhoog het quotum dat is toegewezen aan uw implementatie. Quota verplaatsen van een andere uitrol, indien nodig.
Zie Beheer Azure OpenAI in Microsoft Foundry Models quota voor gedetailleerde aanbevolen procedures, codevoorbeelden voor opnieuw proberen met back-off en een handleiding voor probleemoplossing bij 429-fouten.
Verhogingen van aanvraagquotum
Dien het quotaverhogingsformulier in om quotumverhogingen aan te vragen voor Foundry Models die worden verkocht door Azure, Azure OpenAI-modellen en Anthropic modellen. Met uitzondering van Anthropic modellen bieden Models van partners en community geen ondersteuning voor quotumverhogingen.
Aanvragen voor quotumverhoging worden verwerkt in de volgorde waarin ze worden ontvangen en prioriteit gaat naar klanten die hun bestaande quotumtoewijzing actief gebruiken. Aanvragen die niet aan deze voorwaarde voldoen, kunnen worden geweigerd.
Regionale quotumcapaciteitslimieten
U kunt de beschikbaarheid van quota per regio voor uw abonnement bekijken in de Foundry-portal.
Als u quota en capaciteit programmatisch wilt controleren, raadpleegt u Programmatisch quota en capaciteit in de handleiding voor quotumbeheer. In deze sectie worden twee aanvullende REST API's behandeld: de Usages-API voor het controleren van verbruik op basis van limieten en de API voor modelcapaciteit voor het controleren van de beschikbare implementatiecapaciteit per model en regio.
Opmerking
Op dit moment retourneren zowel de Foundry-portal als de capaciteits-API's quotum- en capaciteitsgegevens voor modellen die buiten gebruik worden gesteld en die niet meer beschikbaar zijn voor nieuwe implementaties.
Verwante inhoud
- Ontdek hoe u de quota kunt beheren voor uw Azure OpenAI-implementaties.
- Meer informatie over de onderliggende modellen die gebruikmaken van Azure OpenAI.