Konfigurowanie limitów liczby żądań dla usług AI za pomocą bramy Unity AI Gateway

Ważna

Ta funkcja jest dostępna w wersji beta. Administratorzy kont mogą kontrolować dostęp do tej funkcji ze strony podglądów konsoli konta. Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.

Na tej stronie opisano, jak skonfigurować limity liczby żądań dla usług AI Unity AI Gateway. Limity żądań umożliwiają egzekwowanie limitów użycia w usłudze modelowej lub usłudze MCP, aby zarządzać pojemnością i kosztami.

Requirements

Konfigurowanie limitów szybkości w usłudze modelu lub usłudze MCP

Limity szybkości można ustawić na podstawie żądań na minutę (QPM) lub tokenów na minutę (TPM), w zależności od typu usługi:

  • Usługi modelu: ustawianie limitów żądań na minutę (QPM) i tokenów na minutę (TPM).
  • Usługi MCP: ustawianie limitów żądań na minutę (QPM). Limity oparte na tokenach nie mają zastosowania do usług MCP.

Aby włączyć limity szybkości, wybierz pozycję Limity szybkości podczas konfigurowania usługi modelu lub usługi MCP. Limity szybkości można zdefiniować na następujących poziomach:

Field Opis
Usługa Określ maksymalną wartość QPM lub TPM, którą może obsłużyć cała usługa. Ten limit dotyczy całego ruchu niezależnie od użytkownika.
Użytkownik (ustawienie domyślne) Określ domyślny limit liczby użytkowników, który ma zastosowanie do wszystkich użytkowników usługi, chyba że zdefiniowano bardziej szczegółowy niestandardowy limit szybkości.
Niestandardowe limity szybkości Niestandardowe limity częstotliwości można określić dla:
  • Indywidualni użytkownicy lub jednostki usługi: mają one pierwszeństwo przed niestandardowymi limitami szybkości grup użytkowników.
  • Grupy użytkowników: ten limit jest limitem szybkości współużytkowanej dla wszystkich członków grupy.

Szczegóły i zachowanie

  • Limity szybkości dotyczą tylko użytkowników z uprawnieniami do wykonywania zapytań dotyczących usługi.
  • Domyślnie nie ma żadnych limitów szybkości skonfigurowanych dla użytkowników ani usługi.
  • Limit szybkości usługi jest maksymalnym globalnym limitem. Jeśli ten limit zostanie przekroczony, wszystkie żądania do usługi są blokowane, niezależnie od limitów szybkości specyficznych dla użytkownika lub grupy.
  • Jeśli usługa, użytkownik lub jednostka usługi ma określony zarówno limit szybkości oparty na żądaniach, jak i limit szybkości oparty na tokenach, wymuszany jest bardziej restrykcyjny limit szybkości.
  • Niestandardowe limity szybkości zastępują limit szybkości użytkownika (domyślny).
    • Jeśli użytkownik należy zarówno do limitu specyficznego dla użytkownika, jak i limitu specyficznego dla grupy, zostanie wymuszony limit specyficzny dla użytkownika.
    • Jeśli użytkownik należy do wielu grup użytkowników z różnymi limitami liczby operacji QPM lub TPM, ograniczenie następuje, jeśli przekracza wszystkie limity liczby operacji QPM lub wszystkie limity liczby operacji TPM swoich grup użytkowników.

Zachowanie ogranicznika szybkości

Po przekroczeniu limitu szybkości usługa zwraca odpowiedź HTTP 429 (zbyt wiele żądań). Klienci powinni zaimplementować logikę ponawiania prób z wykładniczym odstępem.

Ogranicznik szybkości został zaprojektowany pod kątem małych opóźnień, co oznacza, że oczekiwane są następujące zachowania:

  • Żądania równoczesne nie są sprawdzane z wyprzedzeniem. System rejestruje użycie po wysłaniu odpowiedzi, więc jeśli kilka żądań dotrze w tym samym momencie, wszystkie mogą przejść, zanim zostanie zliczone użycie. Późniejsze żądania są następnie odrzucane do momentu odzyskania pojemności. W praktyce mogą wystąpić nagłe wzrosty ruchu, po których następują krótkie przerwy w powtarzającym się wzorcu.
  • Limity są egzekwowane niezależnie dla poszczególnych instancji usługi, dlatego mogą występować krótkotrwałe skoki nieco powyżej skonfigurowanego limitu, zwłaszcza bezpośrednio po utworzeniu lub zaktualizowaniu usługi.

W dłuższym przedziale czasu średnia szybkość żądań zbliża się do skonfigurowanego limitu.

Ograniczenia

  • Można określić maksymalnie 20 limitów szybkości na usługę.
  • Można określić maksymalnie 5 limitów szybkości specyficznych dla grupy na usługę.

Dodatkowe zasoby