Korzystanie z modeli w usługach Unity AI Gateway

Ważna

Ta funkcja jest dostępna w wersji beta. Administratorzy kont mogą kontrolować dostęp do tej funkcji ze strony podglądów konsoli konta. Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.

Na tej stronie opisano, jak monitorować wykorzystanie usług Unity AI Gateway za pomocą tabeli systemowej śledzenia wykorzystania.

Tabela śledzenia użycia automatycznie zapisuje szczegóły żądań i odpowiedzi dla usługi modelowej, rejestrując kluczowe metryki, takie jak zużycie tokenów i latencja. Dane w tej tabeli umożliwiają monitorowanie użytkowników, śledzenie kosztów i uzyskiwanie wglądu w wydajność i zużycie usługi modelu.

Śledzenie użycia obejmuje również ai_query żądania do usług modeli udostępnianych przez Databricks.

Administratorzy kont i obszarów roboczych mogą wyświetlić skonsolidowane omówienie użycia sztucznej inteligencji na stronie AI w Centrum ładu.

Requirements

Zapytanie do tabeli użycia

Usługa Unity AI Gateway rejestruje dane użycia w tabeli systemowej system.ai_gateway.usage . Tabelę można wyświetlić w interfejsie użytkownika lub wykonać zapytanie za pomocą Databricks SQL albo notebooka.

Note

Domyślnie do wyświetlania tabeli system.ai_gateway.usage lub wykonywania względem niej zapytań wymagane są zarówno rola administratora konta, jak i rola administratora metastore. Administratorzy mogą zarządzać dostępem do tej funkcji na stronie Zapowiedzi konsoli konta. Zobacz Zarządzanie wersjami zapoznawczami usługi Azure Databricks.

Aby wyświetlić tabelę w interfejsie użytkownika, kliknij link do tabeli śledzenia użycia na stronie usługi modelu, aby otworzyć ją w Catalog Explorer.

Aby wysłać zapytanie do tabeli z bazy danych Databricks SQL lub notesu:

SELECT * FROM system.ai_gateway.usage;

Tip

Kod Genie (tryb agenta) może to zrobić za Ciebie. Wypróbuj ten przykładowy monit:

Query the system.ai_gateway.usage table to analyze AI Gateway usage showing request count and total tokens, grouped by endpoint name for the last 7 days.

Wbudowany panel użytkowania

Note

Niektóre obszary robocze nie wyświetlają jeszcze listy rozwijanej Govern. W tych obszarach roboczych zamiast tego użyj oddzielnych przycisków Utwórz dashboard, Wyświetl dashboard i Zaktualizuj na stronie Unity AI Gateway.

Stwórz wbudowany pulpit użytkowy

Administratorzy konta mogą utworzyć wbudowany panel monitorowania użycia bramy Unity AI Gateway, aby monitorować użycie, śledzić koszty i uzyskiwać informacje o wydajności usługi modelu oraz poziomie jej wykorzystania. Na stronie Unity AI Gateway kliknij pozycję Govern w prawym górnym rogu, a następnie kliknij pozycję Utwórz pulpit użycia. Hurtownia danych, w której są uruchamiane zapytania pulpitu nawigacyjnego, jest wybierana automatycznie.

Note

Tworzenie panelu jest dostępne tylko dla administratorów konta, ponieważ wymaga uprawnień SELECT do tabeli system.ai_gateway.usage. Dane pulpitu nawigacyjnego usage podlegają zasadom przechowywania tabeli. Zobacz Które tabele systemowe są dostępne?.

Gdy dostępna jest nowsza wersja wbudowanego pulpitu użycia, administratorzy kont mogą kliknąć Aktualizuj w wierszu wersji pulpitu nawigacyjnego w menu rozwijanym Govern na stronie Unity AI Gateway.

Do zarządzania pulpitem nawigacyjnym można użyć następujących opcji konfiguracji pulpitu nawigacyjnego:

  • Zakres: wybierz, czy chcesz ograniczyć zakres pulpitu nawigacyjnego do konta, czy obszaru roboczego.
  • Uprawnienia: Wybierz, czy zapytania mają być uruchamiane przy użyciu uprawnień właściciela panelu, czy uprawnień każdego użytkownika przeglądającego panel. Zobacz Co to są uprawnienia do danych udostępnionych?.
  • Automatyczne aktualizacje: Po włączeniu tej opcji panel będzie aktualizowany automatycznie za każdym razem, gdy nowsza wersja będzie dostępna, a administrator konta odwiedzi stronę Unity AI Gateway.

Opcje panelu aktualizacji ai-gateway

Po zaktualizowaniu pulpitu nawigacyjnego do wersji 0.3 lub nowszej zostanie automatycznie utworzony harmonogram odświeżania pulpitu nawigacyjnego co 6 godzin. W razie potrzeby ten harmonogram można wyłączyć na pulpicie nawigacyjnym usługi Lakeview. Zobacz Tworzenie harmonogramu.

Zobacz panel użycia

Aby wyświetlić panel, kliknij pozycję Govern w prawym górnym rogu strony Unity AI Gateway, a następnie kliknij pozycję Usage Dashboard. Panel otwiera się w nowej karcie. Wbudowany panel zapewnia pełny wgląd w wykorzystanie, wydajność i koszty usługi modeli Unity AI Gateway. Zawiera wiele stron poświęconych monitorowaniu żądań, zużycia tokenów, metryk opóźnień, współczynników błędów, zestawień kosztów, ruchu do i z zewnętrznych serwerów MCP oraz aktywności agenta kodującego.

dashboard użycia bramy AI

Pulpit nawigacyjny domyślnie udostępnia analizę między obszarami roboczymi. Wszystkie strony pulpitu nawigacyjnego można filtrować według zakresu dat i identyfikatora obszaru roboczego.

  • Karta Przegląd: pokazuje ogólne metryki użycia, w tym dzienny wolumen żądań, trendy użycia tokenów w czasie, najlepsi użytkownicy według zużycia tokenów oraz łączną liczbę unikatowych użytkowników. Użyj tej karty, aby uzyskać szybką migawkę ogólnej aktywności usługi Unity AI Gateway i zidentyfikować najbardziej aktywnych użytkowników i modeli.
  • Karta Wydajność: śledzi kluczowe metryki wydajności, w tym percentyle opóźnienia (P50, P90, P95, P99), czas pierwszego bajtu, współczynniki błędów i dystrybucje kodu stanu HTTP. Ta karta służy do monitorowania stanu usługi modelowej oraz identyfikowania wąskich gardeł wpływających na wydajność i problemów z niezawodnością.
  • Karta „Użycie”: przedstawia szczegółowy podział wykorzystania według usługi modelowej, obszaru roboczego i inicjatora żądania. Na tej karcie przedstawiono wzorce użycia tokenów, rozkład żądań i współczynniki trafień w pamięci podręcznej.
  • Karta obserwowalności kosztów: Pokazuje podział kosztów według usług modeli, modelu docelowego, użytkownika, tagów usług i tagów żądań. Ta zakładka zawiera również szacunkowy koszt modeli zewnętrznych. Zobacz Monitorowanie kosztów Unity AI Gateway.
  • Zewnętrzna karta serwera MCP: pokazuje liczbę żądań, współczynniki błędów, użytkowników i połączenia oraz dzienne trendy użycia dla zewnętrznego ruchu serwera MCP.
  • Karta agentów kodowania: śledzi aktywność zintegrowanych agentów kodowania, w tym Cursor, Claude Code, interfejs wiersza polecenia (CLI) Gemini i CLI Codex. Na tej karcie są wyświetlane metryki, takie jak dni aktywne, sesje kodowania, zatwierdzenia i wiersze kodu dodane lub usunięte w celu monitorowania użycia narzędzi deweloperskich. Aby uzyskać więcej informacji, zobacz Pulpit nawigacyjny agenta kodowania .

Schemat tabeli użycia

Tabela system.ai_gateway.usage ma następujący schemat:

Nazwa kolumny Typ Opis Example
account_id STRING Identyfikator konta. 11d77e21-5e05-4196-af72-423257f74974
workspace_id STRING Identyfikator przestrzeni roboczej. 1653573648247579
request_id STRING Unikalny identyfikator żądania. b4a47a30-0e18-4ae3-9a7f-29bcb07e0f00
invocation_id STRING Unikatowy identyfikator dla każdego poszczególnego wywołania inferencji. Wiele wywołań może współdzielić ten sam request_id, na przykład sprawdzenia guardrail lub wieloturowe wywołania agenta. Użyj invocation_id, aby je rozróżnić. c0a8012e-9f3b-4d21-8a7e-1b2c3d4e5f60
schema_version INTEGER Wersja schematu rekordu użycia. 1
endpoint_id STRING Unikalny identyfikator usługi modelu Unity AI Gateway. 43addf89-d802-3ca2-bd54-fe4d2a60d58a
endpoint_name STRING Nazwa usługi modelu Unity AI Gateway. databricks-gpt-5-2
endpoint_tags MAP Tagi skonfigurowane w usłudze modelowej podczas jej tworzenia lub aktualizacji. Są one stosowane do wszystkich żądań do usługi modelu i są przydatne do kategoryzowania usług według zespołu, centrum kosztów lub projektu. {"team": "engineering"}
endpoint_metadata STRUCT Metadane usługi modelu obejmujące creator, creation_time, last_updated_time, destinations, inference_table i fallbacks. {"creator": "user.name@email.com", "creation_time": "2026-01-06T12:00:00.000Z", ...}
event_time TIMESTAMP Sygnatura czasowa odebrania żądania. 2026-01-20T19:48:08.000+00:00
latency_ms LONG Łączne opóźnienie w milisekundach. 300
time_to_first_byte_ms LONG Czas do pierwszego bajtu w milisekundach. 300
destination_type STRING Typ miejsca docelowego (na przykład model zewnętrzny lub model podstawowy). PAY_PER_TOKEN_FOUNDATION_MODEL
destination_name STRING Nazwa modelu docelowego lub dostawcy. databricks-gpt-5-2
destination_id STRING Unikatowy identyfikator miejsca docelowego. 507e7456151b3cc89e05ff48161efb87
destination_model STRING Określony model używany w ramach żądania. GPT-5.2
requester STRING Identyfikator użytkownika lub jednostki usługi, która złożyła żądanie. user.name@email.com
requester_type STRING Typ obiektu żądającego (użytkownik, jednostka usługi lub grupa użytkowników). USER
ip_address STRING Adres IP obiektu żądającego. 1.2.3.4
url STRING Adres URL żądania. https://<workspace-url>/ai-gateway/mlflow/v1/chat/completions
user_agent STRING Agent użytkownika żądającego. OpenAI/Python 2.13.0
api_type STRING Typ wywołania interfejsu API (na przykład czat, ukończenie lub osadzanie). mlflow/v1/chat/completions
request_tags MAP Tagi dostarczone przez użytkownika wysyłane z poszczególnymi żądaniami przy użyciu nagłówka Databricks-Ai-Gateway-Request-Tags HTTP. Tagi żądań umożliwiają przypisywanie użycia określonych projektów, zespołów, środowisk lub użytkowników końcowych. Zobacz Tag requests for usage tracking and Tag requests for usage tracking (Żądania tagów dotyczące śledzenia użycia i tagów na potrzeby śledzenia użycia). {"project": "chatbot", "team": "ml-platform"}
invocation_metadata STRUCT Metadane wygenerowane przez system dotyczące wywołania wnioskowania. Zawiera source usługę lub ścieżkę, która zainicjowała wywołanie. {"source": "EXTERNAL_CLIENT"}
input_tokens LONG Liczba tokenów wejściowych. 100
output_tokens LONG Liczba tokenów wyjściowych. 100
total_tokens LONG Całkowita liczba tokenów (dane wejściowe i wyjściowe). 200
token_details STRUCT Szczegółowy podział tokenów, w tym cache_read_input_tokens, cache_creation_input_tokensi output_reasoning_tokens. {"cache_read_input_tokens": 100, ...}
response_content_type STRING Typ zawartości odpowiedzi. application/json
status_code INT Kod statusu HTTP odpowiedzi. 200
routing_information STRUCT Szczegóły routingu dla prób powrotu . Zawiera tablicę z elementami attempts, priority, action, destination, destination_id, status_code, error_code, latency_ms, start_time i end_time dla każdego modelu wypróbowanego podczas żądania. {"attempts": [{"priority": "1", ...}]}

Oznacz żądania do śledzenia użycia

Tagi żądań to niestandardowe pary klucz-wartość, które obiekt wywołujący dołącza do poszczególnych żądań. Użyj tagów żądań, aby przypisywać użycie według projektu, zespołu, środowiska, użytkownika końcowego lub dowolnego innego wymiaru istotnego dla organizacji. Tagi żądań są rejestrowane w system.ai_gateway.usage tabeli i mogą służyć do filtrowania, agregowania i analizowania danych użycia.

Aby oznaczyć poszczególne żądania, dołącz nagłówek HTTP Databricks-Ai-Gateway-Request-Tags zawierający obiekt JSON mapujący klucze tekstowe na wartości tekstowe. Tagi żądań są rejestrowane w request_tags kolumnie tabeli użycia oraz w tabelach inferencji.

Przykłady pokazujące, jak ustawiać tagi żądań za pomocą interfejsu API REST, OpenAI SDK i Anthropic SDK, można znaleźć w temacie Tagowanie żądań na potrzeby śledzenia użycia.

Na przykład można agregować użycie według projektu przy użyciu tagów żądań:

SELECT
  request_tags['project'] AS project,
  COUNT(*) AS request_count,
  SUM(total_tokens) AS total_tokens
FROM system.ai_gateway.usage
WHERE request_tags['project'] IS NOT NULL
GROUP BY request_tags['project']
ORDER BY total_tokens DESC;

Limitations

  • Unity AI Gateway nie śledzi użycia tokenów w przypadku odpowiedzi większych niż 1 MiB, które nie są ani strumieniowane, ani osadzeniami.

Dodatkowe zasoby