Frequentielimieten configureren voor AI-services met behulp van Unity AI Gateway

Important

Deze functie bevindt zich in de bètaversie. Accountbeheerders kunnen de toegang tot deze functie beheren via de pagina Previews van de accountconsole. Zie Azure Databricks previews beheren.

Op deze pagina wordt beschreven hoe u frequentielimieten configureert voor AI-services van Unity AI Gateway . Met frequentielimieten kunt u verbruikslimieten afdwingen voor een modelservice of MCP-service om capaciteit en kosten te beheren.

Requirements

Frequentielimieten configureren voor een modelservice of MCP-service

U kunt frequentielimieten instellen op basis van aanvragen per minuut (QPM) of tokens per minuut (TPM), afhankelijk van het servicetype:

  • Modelservices: Stel aanvragen per minuut (QPM) en TPM-limieten (tokens per minuut) in.
  • MCP-services: Stel limieten voor aanvragen per minuut (QPM) in. Limieten op basis van tokens zijn niet van toepassing op MCP-services.

Als u frequentielimieten wilt inschakelen, selecteert u Frequentielimieten bij het configureren van uw modelservice of MCP-service. U kunt frequentielimieten definiëren op de volgende niveaus:

Field Beschrijving
Service Geef het maximum aantal QPM of TPM op dat door de hele service kan worden verwerkt. Deze limiet geldt voor al het verkeer, ongeacht de gebruiker.
Gebruiker (standaard) Geef een standaardlimiet per gebruiker op die van toepassing is op alle gebruikers van de service, tenzij er een specifiekere, aangepaste frequentielimiet is gedefinieerd.
Aangepaste frequentielimieten Aangepaste frequentielimieten kunnen worden opgegeven voor:
  • Afzonderlijke gebruikers of service-principals: deze hebben prioriteit boven aangepaste frequentielimieten voor gebruikersgroepen.
  • Gebruikersgroepen: Deze limiet is een gedeelde frequentielimiet voor alle leden van de groep.

Details en gedrag

  • Frequentielimieten zijn alleen van toepassing op gebruikers met toestemming om een query uit te voeren op de service.
  • Standaard zijn er geen frequentielimieten geconfigureerd voor gebruikers of de service.
  • De servicesnelheidslimiet is een globaal maximum. Als deze limiet wordt overschreden, worden alle aanvragen voor de service geblokkeerd, ongeacht gebruikersspecifieke of groepsspecifieke frequentielimieten.
  • Als een service, gebruiker of service-principal zowel een frequentielimiet op basis van aanvragen als een op tokens gebaseerde frequentielimiet heeft opgegeven, wordt de meer beperkende frequentielimiet afgedwongen.
  • Aangepaste frequentielimieten overschrijven de frequentielimiet van de gebruiker (standaard ).
    • Als een gebruiker deel uitmaakt van zowel een gebruikersspecifieke limiet als een groepsspecifieke limiet, wordt de gebruikersspecifieke limiet afgedwongen.
    • Als een gebruiker deel uitmaakt van meerdere gebruikersgroepen met verschillende QPM- of TPM-frequentielimieten, is de gebruiker beperkt als deze alle QPM-frequentielimieten of alle TPM-frequentielimieten van hun gebruikersgroepen overschrijdt.

Gedrag van snelheidsbegrenzer

Wanneer een frequentielimiet wordt overschreden, retourneert de service een HTTP 429-antwoord (Te veel aanvragen). Clients moeten herhaal-logica met exponentiële terugval implementeren.

De snelheidsbegrenzer is ontworpen voor lage latentie, wat betekent dat de volgende gedragingen worden verwacht:

  • Gelijktijdige aanvragen worden niet vooraf gecontroleerd. Het systeem registreert het gebruik nadat een antwoord is verzonden, dus als meerdere aanvragen op hetzelfde moment binnenkomen, kunnen ze allemaal doorlopen voordat het gebruik wordt geteld. Latere aanvragen worden vervolgens geweigerd totdat de capaciteit wordt hersteld. In de praktijk kunt u pieken in verkeer zien, gevolgd door korte pauzes in een herhalend patroon.
  • Limieten worden onafhankelijk per service-exemplaar afgedwongen, waardoor korte pieken iets boven de geconfigureerde limiet kunnen optreden, met name direct na het maken of bijwerken van een service.

Gedurende een langere periode wordt de gemiddelde aanvraagsnelheid geconvergeerd naar de geconfigureerde limiet.

Limitations

  • U kunt maximaal 20 frequentielimieten per service opgeven.
  • U kunt maximaal 5 groepsspecifieke frequentielimieten per service opgeven.

Aanvullende informatiebronnen