Riferimento dati di monitoraggio Azure OpenAI

Questo articolo contiene tutte le informazioni di riferimento per il monitoraggio di questo servizio.

Per informazioni dettagliate sui dati che è possibile raccogliere per Azure OpenAI nei modelli Microsoft Foundry e su come usarli, vedere Monitor Azure OpenAI.

Metrics

Questa sezione elenca tutte le metriche raccolte automaticamente per questa piattaforma per questo servizio. Queste metriche fanno anche parte dell'elenco globale delle metriche all supportate in Monitoraggio di Azure.

Per informazioni sulla conservazione delle metriche, vedi Monitoraggio di Azure Panoramica delle metriche.

Metriche supportate per Microsoft. CognitiveServices/account

Monitorare le metriche più importanti per Azure OpenAI. Più avanti in questo articolo è disponibile un elenco più lungo di tutte le metriche disponibili per questo spazio dei nomi, che contiene altri dettagli sulle metriche in questo elenco più breve. Per informazioni sulla data più up-to, vedere l'elenco seguente. Il team Azure sta lavorando per aggiornare le tabelle nelle sezioni seguenti.

Importante

Non confondere le metriche in questa sezione con quelle legacy Latency elencate sotto Cognitive Services - HTTP Requests più avanti in questo articolo. La metrica legacy Latency non è pensata per Azure carichi di lavoro OpenAI e produce risultati fuorvianti quando viene usata per diagnosticare Azure latenza OpenAI. Per Azure monitoraggio della latenza OpenAI, usa Tempo di Risposta (AzureOpenAITimeToResponse), Tempo all'ultimo byte (AzureOpenAITTLTInMS), Tempo tra i token (AzureOpenAINormalizedTBTInMS), o Tempo normalizzato al primo byte (AzureOpenAINormalizedTTFTInMS). Per indicazioni sull'interpretazione di queste metriche, vedi Performance e latency.

  • Azure richieste OpenAI
  • Token attivi
  • Gettoni di completamento generati
  • Elaborato le ore di formazione fineTuned
  • Token di Inferenza Processati
  • Token di prompt processati
  • Utilizzo gestito tramite provisioning V2
  • Tasso di corrispondenza della cache del token prompt
  • Tempo per la risposta
  • Tempo tra i gettoni
  • Tempo per l'ultimo byte
  • Tempo normalizzato al primo byte
  • Gettoni al secondo

È anche possibile monitorare le metriche di Sicurezza del contenuto usate da altri servizi correlati.

  • Volume bloccato
  • Volume dannoso rilevato
  • Potenziale numero di utenti abusivi
  • Evento del Sistema di Sicurezza
  • Volume totale inviato per il controllo di sicurezza

Note

La metrica di utilizzo gestita tramite Provisioned è ora obsoleta e non è più raccomandata. Questa metrica viene sostituita dalla metrica Utilizzo gestito con provisioning V2 . I token al secondo, il tempo di risposta e il tempo tra i token non sono attualmente disponibili per le distribuzioni Standard.

Riferimento rapido: metriche chiave per caso d'uso

Usa questa tabella per trovare la metrica giusta per un obiettivo di monitoraggio specifico. Per indicazioni end-to-end sull'interpretazione di queste metriche, vedi Performance e latency.

Voglio monitorare... Usa questa metrica Nome API REST
Tempo di risposta complessivo Tempo per l'ultimo byte AzureOpenAITTLTInMS
Risposta al primo token (streaming) Tempo per la risposta AzureOpenAITimeToResponse
Velocità di generazione dei token Tempo tra i gettoni AzureOpenAINormalizedTBTInMS
Efficienza del primo token normalizzata in base alla dimensione del prompt Tempo normalizzato al primo byte AzureOpenAINormalizedTTFTInMS
Volume di token di output per richiesta Gettoni di completamento generati GeneratedTokens
Volume di token di input per richiesta Token di prompt processati ProcessedPromptTokens
Utilizzo della capacità PTU Utilizzo gestito tramite provisioning V2 AzureOpenAIProvisionedManagedUtilizationV2
Volume delle richieste ed errori Azure richieste OpenAI AzureOpenAIRequests

Tip

Abbina sempre una metrica di latenza a una metrica di conteggio dei token. Un aumento della latenza senza un corrispondente aumento del token potrebbe indicare un problema reale. Un aumento di latenza con un aumento proporzionale del token è un comportamento atteso.

Warning

Le metriche sotto Cognitive Services - HTTP Requests più avanti in questo articolo sono metriche legacy dei Cognitive Services e non sono progettate per carichi di lavoro Azure OpenAI. In particolare, la metrica Latency in quella categoria non è la stessa delle metriche di latenza di Azure OpenAI (tempo per rispondere, tempo per l'ultimo byte, tempo tra i token, tempo normalizzato fino al primo byte). L'uso della metrica legacy Latency per Azure risoluzione dei problemi OpenAI produce risultati fuorvianti. Utilizza invece le metriche Azure OpenAI elencate in questa sezione.

La tabella seguente elenca le metriche disponibili per Microsoft. CognitiveServices/tipo di risorsa account.

  • Tutte le colonne potrebbero non essere presenti in ogni tabella.
  • Alcune colonne potrebbero essere oltre l'area di visualizzazione della pagina. Seleziona Espandi tabella per visualizzare tutte le colonne disponibili.

Intestazioni di tabella

  • Categoria - Il gruppo o classificazione delle metriche.
  • Metric - Il nome visualizzato metrico così come appare nel portale Azure.
  • Nome nell'API REST - Il nome della metrica come indicato nell'API REST.
  • Unità - Unità di misura.
  • Aggregazione - Il tipo di aggregazione predefinito. Valori validi: Media (Media), Minimo (Min), Massimo (Max), Totale (Somma), Conteggio.
  • Dimensioni - Dimensioni disponibili per la metrica.
  • Granelli - del TempoIntervalli in cui la metrica viene campionata. Ad esempio, PT1M indica che la metrica viene campionata ogni minuto, PT30M ogni 30 minuti, PT1H ogni ora, e così via.
  • DS Export- Se la metrica è esportabile in Monitoraggio di Azure Logs tramite le impostazioni diagnostiche. Per informazioni sull'esportazione delle metriche, consulta Crea impostazioni diagnostiche in Monitoraggio di Azure.

Categoria: Azure OpenAI - Richieste HTTP

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Azure OpenAI Tasso di Disponibilità

Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500.
AzureOpenAIAvailabilityRate No Percentuale Minimo, Massimo, Medio ApiName, OperationName, Region, StreamTypeModelDeploymentName, , ModelNameModelVersion PT1M No
Azure Richieste OpenAI

Numero di chiamate effettuate all'API OpenAI di Azure nel corso del tempo. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go. Per suddividere le richieste API, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion, StatusCode (successo, client errors, errori del server), IsSpillover per le informazioni di spillover, ServiceTier, StreamType (richieste streaming vs non-streaming) e operazione.
AzureOpenAIRequests No Conteggio Totale (somma) ApiName, OperationName, , Region, StreamTypeModelDeploymentName, ModelNameModelVersionStatusCode, IsSpilloverServiceTierRequestServiceTierResponse PT1M

Categoria: Azure OpenAI - Latenza

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Tempo tra i gettoni

Per le richieste di streaming; Tasso di generazione dei token modelli, misurato in millisecondi. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go.
AzureOpenAINormalizedTBTInMS No Millisecondi Massimo, Minimo, Medio Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse PT1M
Tempo normalizzato al primo byte

Per richieste di streaming e non streaming; Il tempo necessario perché il primo byte dei dati di risposta venga ricevuto dopo che la richiesta è stata effettuata dal modello, normalizzata dal token. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go.
AzureOpenAINormalizedTTFTInMS No Millisecondi Massimo, Minimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M
Tempo per la risposta

Misura raccomandata di latenza (reattività) per le richieste di streaming. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Calcolata come tempo impiegato affinché la prima risposta apparga dopo che un utente invia un prompt, misurato dal gateway API. Questo numero aumenta man mano che la dimensione del prompt aumenta e/o la dimensione dei colpi della cache si riduce. Per suddividere la metrica tempo-risposta, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e ModelVersion.

Nota: questa metrica è un'approssimazione, poiché la latenza misurata dipende fortemente da molteplici fattori, inclusi chiamate concorrenti e il modello complessivo di carico di lavoro. Inoltre, non tiene conto di eventuali latenze lato client che possano esistere tra il tuo client e l'endpoint API. Si prega di consultare il tuo logging per un monitoraggio ottimale della latenza.
AzureOpenAITimeToResponse No Millisecondi Minimo, Massimo, Medio ApiName, OperationName, RegionStreamType, , ModelDeploymentName, ModelName, ModelVersion, ,StatusCode PT1M
Gettoni al secondo

Elenca la velocità di generazione per una data risposta del modello Azure OpenAI. Il totale dei token generati viene diviso per il tempo necessario per generarli, in secondi. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go.
AzureOpenAITokenPerSecond No Conteggio Massimo, Minimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M
Tempo per l'ultimo byte

Per richieste di streaming e non streaming; Il tempo impiega perché l'ultimo byte dei dati di risposta venga ricevuto dopo che la richiesta è stata effettuata dal modello. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go.
AzureOpenAITTLTInMS No Millisecondi Massimo, Minimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M

Categoria: Azure OpenAI - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Token attivi

Token totali meno token memorizzati nella cache nel corso del tempo. Si applica alle implementazioni gestite da PTU e PTU. Usa questa metrica per comprendere l'utilizzo basato su TPS o TPM per le PTU e confronta con i tuoi benchmark per il TPS target o TPM per i tuoi scenari. Per suddividere le richieste API, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, e ModelVersion.
ActiveTokens No Conteggio Minimo, Massimo, Medio, Totale (Somma) Region, ModelDeploymentName, ModelName, ModelVersion, ServiceTierRequestServiceTierResponse PT1M
Token di completamento audio

Numero di token audio prompt generati (output) su un modello OpenAI. Si applica alle implementazioni gestite da PTU e modello Pay-as-you-go.
AudioCompletionTokens No Conteggio Totale (somma) ModelDeploymentName, ModelName, ModelVersionRegion PT1M
Gettoni di prompt audio

Numero di token audio prompt elaborati (input) su un modello OpenAI. Si applica alle implementazioni gestite da PTU e modello Pay-as-you-go.
AudioPromptTokens No Conteggio Totale (somma) ModelDeploymentName, ModelName, ModelVersionRegion PT1M
Tasso di corrispondenza della cache del token prompt

Percentuale di token prompt che arrivano nella cache. Si applica alle implementazioni gestite da PTU e PTU.
AzureOpenAIContextTokensCacheMatchRate No Percentuale Minimo, Massimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M No
Utilizzo gestionato tramite provisioning (deprecato)

L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion e StreamType (Richieste streaming vs non streaming)
AzureOpenAIProvisionedManagedUtilization No Percentuale Minimo, Massimo, Medio Region, StreamType, ModelDeploymentName, ModelNameModelVersion PT1M No
Utilizzo gestito tramite provisioning V2

L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName, ModelVersion e StreamType (Richieste streaming vs non streaming)
AzureOpenAIProvisionedManagedUtilizationV2 No Percentuale Minimo, Massimo, Medio Region, StreamType, ModelDeploymentName, ModelNameModelVersion PT1M No
Elaborato le ore di formazione fineTuned

Numero di ore di addestramento elaborate su un modello OpenAI fineTuned
FineTunedTrainingHours No Conteggio Totale (somma) ApiName, ModelDeploymentName, FeatureName, UsageChannelRegion PT1M
Gettoni di completamento generati

Numero di token generati (output) da un modello OpenAI. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName.
GeneratedTokens No Conteggio Totale (somma) ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion PT1M
Token di prompt processati

Numero di token di prompt elaborati (input) su un modello OpenAI. Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName.
ProcessedPromptTokens No Conteggio Totale (somma) ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion PT1M
Secondi API in tempo reale utilizzati

RealtimeAPI numero di secondi utilizzati
RealtimeUsageTime No Conteggio Totale (somma) Region, ModelDeploymentName PT1M
Token di Inferenza Processati

Numero di token di inferenza elaborati su un modello OpenAI. Calcolati come token prompt (input) più token generati (output). Si applica a PTU, PTU-managed e implementazioni Pay-as-you-go. Per suddividere questa metrica, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName e ModelName.
TokenTransaction No Conteggio Totale (somma) ApiName, ModelDeploymentName, FeatureName, UsageChannel, RegionModelVersion PT1M

Categoria: Servizi cognitivi - Richieste HTTP

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Chiamate bloccate

Numero di chiamate che hanno superato il limite di tasso o quota. Non usare per Azure il servizio OpenAI.
BlockedCalls No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Errori del client

Numero di chiamate con errore lato client (codice risposta HTTP 4xx). Non usare per Azure il servizio OpenAI.
ClientErrors No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Dati in entrata

Dimensione dei dati in ingresso in byte. Non usare per Azure il servizio OpenAI.
DataIn No Bytes Totale (somma) ApiName, OperationName, Region PT1M
Dati in uscita

Dimensione dei dati in uscita in byte. Non usare per Azure il servizio OpenAI.
DataOut No Bytes Totale (somma) ApiName, OperationName, Region PT1M
Latenza

Latenza in millisecondi. Non usare per Azure il servizio OpenAI.
Latency No Millisecondi Medio ApiName, OperationName, RegionRatelimitKey PT1M
Ratelimit

Il limite di velocità attuale della chiave di limite di velocità. Non usare per Azure il servizio OpenAI.
Ratelimit No Conteggio Totale (somma) Region, RatelimitKey PT1M
Errori del server

Numero di chiamate con errore interno del servizio (codice risposta HTTP 5xx). Non usare per Azure il servizio OpenAI.
ServerErrors No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Chiamate riuscite

Numero di chiamate riuscite. Non usare per Azure il servizio OpenAI.
SuccessfulCalls No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Totale chiamate

Numero totale di chiamate. Non usare per Azure il servizio OpenAI.
TotalCalls No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Errori totali

Numero totale di chiamate con risposta di errore (codice risposta HTTP 4xx o 5xx). Non usare per Azure il servizio OpenAI.
TotalErrors No Conteggio Totale (somma) ApiName, OperationName, RegionRatelimitKey PT1M
Total chiamate con token

Numero totale di chiamate di token.
TotalTokenCalls No Conteggio Totale (somma) ApiName, OperationName, Region PT1M

Categoria: Servizi Cognitivi - SLI

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
AvailabilityRate

Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500. Non usare per Azure il servizio OpenAI.
SuccessRate No Percentuale Minimo, Massimo, Medio ApiName, OperationName, RegionRatelimitKey PT1M No

Categoria: Comprensione dei contenuti - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Transazioni viso

Numero di chiamate API effettuate al servizio Face
FaceApiTransactions No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Minuti audio elaborati

Minuti di audio elaborati
ProcessedAudioMinutes No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Pagine elaborate

Numero di pagine di documento elaborate
ProcessedDocumentPages No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Immagini elaborate

Numero di immagini elaborate
ProcessedImageCount No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Minuti video processati

Minuti di video elaborati
ProcessedVideoMinutes No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token

Numero di token consumati
Tokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M

Categoria: ContenutiSicurezza - Rischi e Sicurezza

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Volume dannoso rilevato

Numero di chiamate effettuate ad Azure OpenAI API e rilevate come dannose (sia modello a blocchi che modalità annotazione) tramite filtro di contenuto applicato nel tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e TextType.
RAIHarmfulRequests No Conteggio Totale (somma) Region, ModelDeploymentName, ModelNameModelVersion, , ApiName, TextType, Category, ,Severity PT1M
Volume bloccato

Numero di chiamate effettuate a Azure OpenAI API e rifiutate da un filtro di contenuto applicato nel corso del tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e TextType.
RAIRejectedRequests No Conteggio Totale (somma) Region, ModelDeploymentName, ModelName, ModelVersionApiName, , TextTypeCategory PT1M
Evento del Sistema di Sicurezza

Evento di sistema per il monitoraggio dei rischi e della sicurezza. Puoi aggiungere un filtro o applicare la suddivisione per la seguente dimensione: EventType.
RAISystemEvent No Conteggio Medio Region, EventType PT1M
Volume totale inviato per il controllo di sicurezza

Numero di chiamate effettuate all'API OpenAI di Azure e rilevate dal filtro di contenuto applicato nel corso del tempo. Puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName.
RAITotalRequests No Conteggio Totale (somma) Region, ModelDeploymentName, ModelName, ModelVersionApiName PT1M

Categoria: Contenuto Sicurezza - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Conteggio delle chiamate per la moderazione delle immagini

Numero di richieste di moderazione delle immagini.
ContentSafetyImageAnalyzeRequestCount No Conteggio Totale (somma) ApiVersion PT1M
Conteggio delle chiamate per la moderazione dei testi

Numero di richieste di moderazione dei testi.
ContentSafetyTextAnalyzeRequestCount No Conteggio Totale (somma) ApiVersion PT1M

Categoria: Lingua - Lavori

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Durata del lavoro (Anteprima)

Nota: questo valore dipende fortemente dalla dimensione dell'input, dal numero di documenti e dalla complessità del compito. Questo è un valore aggregato per tutte le attività del lavoro.
JobDuration No Millisecondi Minimo, Massimo, Medio JobStatus, JobType PT1M

Categoria: Modelli - Richieste HTTP

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Tasso di disponibilità dei modelli

Percentuale di disponibilità con il seguente calcolo: (Chiamate totali - errori del server)/Chiamate totali. Gli errori del server includono qualsiasi risposta >HTTP =500.
ModelAvailabilityRate No Percentuale Minimo, Massimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M No
Richieste di modello

Numero di chiamate effettuate all'API del modello nel corso del tempo. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
ModelRequests No Conteggio Totale (somma) ApiName, OperationName, , Region, StreamTypeModelDeploymentName, ModelNameModelVersionStatusCode, IsSpilloverServiceTierRequestServiceTierResponse PT1M

Categoria: Modelli - Latenza

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Tempo tra i gettoni

Tasso di generazione dei token modelli, misurato in millisecondi. Si applica alle implementazioni gestite da PTU e PTU. Per le richieste non in streaming, questo valore è una stima.
NormalizedTimeBetweenTokens No Millisecondi Massimo, Minimo, Medio ApiName, OperationName, Region, StreamTypeModelDeploymentName, , ModelNameModelVersion PT1M
Tempo normalizzato al primo byte

Il tempo necessario per ricevere il primo byte dei dati di risposta dopo che la richiesta è stata effettuata dal modello, normalizzata dal token. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. Per le richieste non in streaming, questo valore è una stima.
NormalizedTimeToFirstToken No Millisecondi Massimo, Minimo, Medio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M
Tempo per l'ultimo byte

Il tempo necessario per ricevere l'ultimo byte dei dati di risposta dopo che la richiesta è stata effettuata dal modello. Si applica a PTU, implementazioni gestite da PTU e Pay-as-you-go. Per le richieste non in streaming, questo valore è una stima.
TimeToLastByte No Millisecondi Massimo, Minimo, Medio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M
Tempo per la risposta

Misura consigliata di latenza (reattività). Si applica alle implementazioni gestite da PTU e PTU. Calcolata come tempo impiegato affinché la prima risposta apparga dopo che un utente invia un prompt, misurato dal gateway API. Questo numero aumenta man mano che la dimensione del prompt aumenta e/o la dimensione dei colpi della cache si riduce. Per suddividere la metrica tempo-risposta, puoi aggiungere un filtro o applicare la suddivisione per le seguenti dimensioni: ModelDeploymentName, ModelName e ModelVersion.

Nota: questa metrica è un'approssimazione, poiché la latenza misurata dipende fortemente da molteplici fattori, inclusi chiamate concorrenti e il modello complessivo di carico di lavoro. Inoltre, non tiene conto di eventuali latenze lato client che possano esistere tra il tuo client e l'endpoint API. Per le richieste non in streaming, questo valore è una stima. Si prega di consultare il tuo logging per un monitoraggio ottimale della latenza.
TimeToResponse No Millisecondi Minimo, Massimo, Medio ApiName, OperationName, Region, StreamType, ModelDeploymentName, ModelName, ModelVersion, StatusCode, ServiceTierRequest, ServiceTierResponse PT1M
Gettoni al secondo

Elenca la velocità di generazione per una data risposta del modello. Il totale dei token generati viene diviso per il tempo necessario per generarli, in secondi. Si applica alle implementazioni gestite da PTU e PTU. Per le richieste non in streaming, questo valore è una stima.
TokensPerSecond No Conteggio Massimo, Minimo, Medio ApiName, OperationName, Region, StreamType, ModelDeploymentNameModelName, ModelVersion, , ServiceTierRequestServiceTierResponse PT1M

Categoria: Modelli - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Pagine con annotazioni

Numero totale di pagine elaborate con annotazioni. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
AnnotatedPages No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M
Token di ingresso audio

Numero di token audio prompt elaborati (input) su un modello OpenAI. Si applica alle implementazioni di modelli gestiti da PTU.
AudioInputTokens No Conteggio Totale (somma) ModelDeploymentName, ModelName, ModelVersionRegion PT1M
Token di uscita audio

Numero di token audio prompt generati (output) su un modello OpenAI. Si applica alle implementazioni di modelli gestiti da PTU.
AudioOutputTokens No Conteggio Totale (somma) ModelDeploymentName, ModelName, ModelVersionRegion PT1M
Token prompt letti dalla cache

Numero totale di token letti dalla cache. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_read_input_tokens
cacheReadInputTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength PT1M
Token prompt scritti nella cache (TTL di 1 ora)

Il numero di token prompt usati per creare l'ingresso di 1 ora. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_creation.ephemeral_1h_input_tokens
ephemeral1hInputTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength PT1M
Token prompt scritti nella cache (TTL di 5 minuti)

Il numero di token di prompt usati per creare l'inserimento della cache in 5 minuti. Si applica alle implementazioni di modelli Anthropic. Emerso nella sezione di utilizzo delle risposte come cache_creation.ephemeral_5m_input_tokens
ephemeral5mInputTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelName, ModelVersionContextLength PT1M
Immagini generate

Numero totale di immagini generate. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
GeneratedImages No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M
Token di input

Numero di token prompt elaborati (input) su un modello. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
InputTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M
Token di uscita

Numero di token generati (output) da un modello OpenAI. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
OutputTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M
Utilizzo assegnato

L'utilizzo % per un deployment gestito provvisoriamente, calcolato come (PTU consumate / PTU dispiegate) x 100. Quando l'utilizzo è maggiore o uguale a 100%, le chiamate vengono limitate e viene restituito il codice di errore 429.
ProvisionedUtilization No Percentuale Minimo, Massimo, Medio Region, ModelDeploymentName, ModelNameModelVersion PT1M No
Totale pagine

Numero totale di pagine elaborate. Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
TotalPages No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M
Totale token

Numero di token di inferenza elaborati su un modello. Calcolati come token prompt (input) più token generati (output). Si applica a PTU, PTU-Managed e implementazioni Pay-as-you-go.
TotalTokens No Conteggio Totale (somma) ApiName, Region, ModelDeploymentName, ModelNameModelVersion PT1M

Categoria: Servizi di Voce - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Secondi audio trascritti in batch

Numero di secondi trascritti in batch
AudioSecondsBatchTranscribed No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi audio Sussurro in batch trascritto

Numero di secondi trascritti nel sussurro batch
AudioSecondsBatchWhisperTranscribed No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi audio trascritti rapidamente

Numero rapido di secondi trascritto
AudioSecondsFastTranscribed No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi audio Sussurro Veloce Trascritto

Numero di secondi trascritti in un sussurro veloce
AudioSecondsFastWhisperTranscribed No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi audio trascritti

Numero di secondi trascritti
AudioSecondsTranscribed No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi audio tradotti

Numero di secondi tradotti
AudioSecondsTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Modelli Avatar che ospitano i secondi

Numero di secondi.
AvatarModelHostingSeconds No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi di Addestramento Modello Avatar

Numero di secondi.
AvatarModelTrainingSeconds No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Orari di conduzione del modello di discorso

Numero di ore di conduzione del modello di discorso
SpeechModelHostingHours No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri sintetizzati

Numero di personaggi.
SynthesizedCharacters No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Secondi Video Sintetizzati

Numero di secondi sintetizzati
VideoSecondsSynthesized No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token di ingresso audio live vocale

Numero di token di ingresso audio, esclusi quelli memorizzati nella cache.
VoiceLiveAudioInputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token di uscita audio live vocale

Numero di token di uscita audio.
VoiceLiveAudioOutputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token audio audio in cache Voice Live

Numero di token audio di ingresso memorizzati nella cache.
VoiceLiveCachedAudioInputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token di input di testo in cache Voice Live

Numero di token di input di testo memorizzati nella cache.
VoiceLiveCachedTextInputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token di input vocale Live Text

Numero di token di input testuale, escludendo quelli memorizzati nella cache.
VoiceLiveTextInputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Token di uscita live text vocale

Numero di token di output testuale.
VoiceLiveTextOutputTokens No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Orari di conduzione dei modelli vocali

Numero di ore.
VoiceModelHostingHours No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Minuti di addestramento dei modelli vocali

Numero di minuti.
VoiceModelTrainingMinutes No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M

Categoria: Servizi di traduzione - Utilizzo

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Caratteri del documento tradotti

Numero di caratteri nella richiesta di traduzione del documento.
DocumentCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri personalizzati del documento tradotti

Numero di caratteri nella richiesta di traduzione di un documento personalizzato.
DocumentCustomCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri di sincronizzazione del documento tradotti

Numero di caratteri nella richiesta di traduzione del documento (sincrona).
OneDocumentCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Identificazione Documenti Caratteri Personalizzati Tradotti

Numero di caratteri nella richiesta di traduzione di documento personalizzato (sincrona).
OneDocumentCustomCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri di testo tradotti

Numero di caratteri nella richiesta di traduzione del testo in arrivo.
TextCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri personalizzati di testo tradotti

Numero di caratteri nella richiesta di traduzione di testo personalizzata in arrivo.
TextCustomCharactersTranslated No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Caratteri addestrati al testo

Numero di caratteri addestrati usando la traduzione del testo.
TextTrainedCharacters No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Translator Pro App Secondi

Numero di secondi di utilizzo dell'app Translator Pro.
TranslatorProAppSeconds No Seconds Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M

Categoria: Uso

Metrica Nome nell'API REST Metriche avanzate della piattaforma Unità Aggregation Dimensioni Granularità temporale Esportazione DS
Visione artificiale Transazioni

Numero di transazioni di Visione artificiale
ComputerVisionTransactions No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Tempo di Allenamento Personalizzato per la Visione

Tempo di addestramento Custom Vision
CustomVisionTrainingTime No Seconds Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Transazioni Visioni Personalizzate

Numero di transazioni di previsione Custom Vision
CustomVisionTransactions No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Immagini del volto addestrate

Numero di immagini addestrate. 1.000 immagini addestrate per transazione.
FaceImagesTrained No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Visi archiviati

Numero di volti memorizzati, proporzionato giornalieramente. Il numero di volti memorizzati viene riportato quotidianamente.
FacesStored No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Transazioni viso

Numero di chiamate API effettuate al servizio Face
FaceTransactions No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Immagini archiviate

Numero di immagini Custom Vision memorizzate.
ImagesStored No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Eventi analizzati

Numero di eventi appresi.
LearnedEvents No Conteggio Totale (somma) IsMatchBaseline, Mode, RunId PT1M
Richieste di Intervento LUIS

Numero di richieste di comprensione LUIS dal rapporto tra voce e intento
LUISSpeechRequests No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Richieste di testo LUIS

Numero di richieste di testo LUIS
LUISTextRequests No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Premi corrispondenti

Numero di ricompense abbinate.
MatchedRewards No Conteggio Totale (somma) Mode, RunId PT1M
Eventi Non Attivati

Numero di eventi saltati.
NonActivatedEvents No Conteggio Totale (somma) Mode, RunId PT1M
Ricompense osservate

Numero di ricompense osservate.
ObservedRewards No Conteggio Totale (somma) Mode, RunId PT1M
Caratteri elaborati

Numero di caratteri elaborati da Strumento di lettura immersiva.
ProcessedCharacters No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Cartelle Cliniche Processate

Numero di cartelle cliniche processate
ProcessedHealthTextRecords No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Immagini elaborate

Numero di immagini elaborate
ProcessedImages No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Pagine elaborate

Numero di pagine elaborate
ProcessedPages No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Record di testo processati

Conteggio dei registri di testo.
ProcessedTextRecords No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Registri di testo QA

Numero di record di testo processati
QuestionAnsweringTextRecords No Conteggio Totale (somma) ApiName, FeatureName, UsageChannelRegion PT1M
Totale eventi

Numero di eventi.
TotalEvents No Conteggio Totale (somma) Mode, RunId PT1M
Transazioni totali (Deprecate)

Numero totale di transazioni.
TotalTransactions No Conteggio Totale (somma) <nessuna> PT1M

Dimensioni delle metriche

Per informazioni su quali siano le dimensioni delle metriche, vedi Metriche multidimensionali.

Questo servizio ha le seguenti dimensioni associate alle sue metriche.

  • ApiName
  • NomeCaratteristica
  • ModelDeploymentName
  • ModelName
  • ModelVersion
  • Nome dell'operazione
  • Area geografica
  • Codice di stato
  • StreamType
  • UsageChannel

Log delle risorse

Questa sezione elenca i tipi di log delle risorse che puoi raccogliere per questo servizio. La sezione prende ispirazione dall'elenco dei tipi di categorie all resource logs supportati in Monitoraggio di Azure.

Log di risorse supportati per Microsoft. CognitiveServices/account

Categoria Costi di esportazione Tabella dei log Supporta un piano di log di base Supporta la trasformazione del tempo di ingestione Interrogazioni di esempio
Audit No AzureDiagnostics

Log da più risorse Azure.

No No
AzureOpenAIRequestUsage AzureDiagnostics

Log da più risorse Azure.

No No
ManagedNetworkEvent AzureDiagnostics

Log da più risorse Azure.

No No
Requestresponse No AzureDiagnostics

Log da più risorse Azure.

No No
Traccia No AzureDiagnostics

Log da più risorse Azure.

No No

Tabelle dei log di Monitoraggio di Azure

Questa sezione elenca le tabelle Monitoraggio di Azure Logs rilevanti per questo servizio, che sono disponibili per la query da parte di Log Analytics tramite Kusto queries. Le tabelle contengono dati di log delle risorse e possibilmente anche di più, a seconda di ciò che viene raccolto e instradato ad esse.

Azure OpenAI microsoft.cognitiveservices/accounts

Registro delle attività

La tabella collegata elenca le operazioni che possono essere registrate nel registro attività per questo servizio. Queste operazioni sono un sottoinsieme di tutte le possibili operazioni del fornitore di risorse nel registro attività.

Per ulteriori informazioni sullo schema delle voci del registro delle attività, vedi Schema del registro delle attività.