Panoramica dei costi e dell'utilizzo dei token di Agent Optimizer

L'ottimizzatore dell'agente in Servizio agenti Foundry fornisce una stima dei costi basata su un modello prima di inviare un processo di ottimizzazione. Al termine del processo, il risultato può includere l'utilizzo misurato dei token. Utilizzare la stima ai fini della pianificazione e l'utilizzo effettivo per comprendere l'attività del modello durante l'esecuzione.

La stima pre-esecuzione e il consumo di token post-esecuzione servono a scopi diversi. Nessuno dei due valori è un limite di spesa o una sostituzione per la fattura Azure.

Note

Nel portale Foundry, la stima dei costi prima dell'esecuzione è attualmente disponibile solo per le esecuzioni di ottimizzazione prompt-agent. L'ottimizzazione dell'agente ospitato si basa sulle dipendenze di Azure Developer CLI (azd), quindi i flussi di lavoro dell'agente ospitato attualmente non mostrano la stima nel portale. L'utilizzo del token post-esecuzione è disponibile per entrambi i tipi di agente.

Stima dei costi prima dell'esecuzione per gli agenti di prompt

Prima di creare un processo di ottimizzazione dell'agente prompt nel portale foundry, il passaggio Verifica mostra una stima dei costi per le impostazioni richieste. I flussi di ottimizzazione dell'agente ospitato non mostrano attualmente questa stima preliminare.

La stima prevede le chiamate al modello e i costi dei token. Richiedere una stima non crea un processo di ottimizzazione né invoca i modelli. I conteggi delle chiamate vengono calcolati dagli input del processo. I valori di valuta vengono modellati applicando presupposti di token statici e prezzi del modello di riferimento a tali conteggi delle chiamate.

Il portale mostra tre valori di valuta modellati:

Valore del portale Meaning
Minimo Costo modellato delle valutazioni complete del set di dati necessarie per la baseline e i candidati richiesti.
Stimato Costo modellato previsto in base al tipico comportamento di ottimizzazione, comprese le esecuzioni che terminano prima di utilizzare il budget completo per le chiamate.
Massimo Limite superiore modellato in modo conservativo in base alle impostazioni di ottimizzazione. Non è un limite di spesa applicato.

Il riepilogo identifica il conteggio dei candidati, il numero di righe del set di dati, il conteggio degli analizzatori e la data del prezzo di riferimento. Espandere Suddivisione dei costi (stimata) per esaminare ogni fase.

Note

I prezzi nella schermata seguente sono solo per esempio. I prezzi visualizzati nel portale foundry potrebbero essere diversi in base alla configurazione del progetto.

Screenshot della fase di revisione dell'ottimizzazione dell'agente di prompt che mostra i costi minimi, stimati e massimi con il dettaglio dei costi stimati espanso.

Dati di input della stima

L'ottimizzatore calcola gli intervalli del numero di chiamate a partire dalla configurazione del processo risolta. Il calcolo usa questi input:

Input Impatto sulla stima
Numero massimo di candidati La stima include i candidati migliorati richiesti e una valutazione di base aggiuntiva.
Righe del set di dati di valutazione Ogni valutazione completa richiama l'agente per ogni riga di valutazione. Se non si specifica un set di dati di convalida separato, il set di dati di training viene usato per la valutazione.
Valutatori Ogni risposta dell'agente viene valutata da ogni analizzatore selezionato. L'aggiunta di valutatori aumenta le chiamate al modello di valutazione.
Comportamento di ottimizzazione La generazione dei candidati, la riflessione e l'arresto anticipato influiscono su quale porzione dell'intervallo modellato viene utilizzata durante l'esecuzione.
Models Le distribuzioni del modello di agente, valutazione e ottimizzazione determinano quali prezzi di riferimento si applicano a ogni livello.

Per un set di dati a cui si fa riferimento, il servizio risolve il numero di righe prima di restituire una stima. Se non riesce a risolvere un numero di righe non vuoto, non crea una stima da una dimensione presunta del set di dati.

Nelle esecuzioni di selezione del modello, la stima non calcola separatamente il costo delle chiamate dell'agente per ogni modello nello spazio di ricerca. Usa il modello dell'agente di base configurato quando disponibile. Se il modello non può essere risolto, usa il prezzo del modello di valutazione per il livello agente.

Presupposti di token statici

La stima separa l'attività del modello in livelli in modo da poter vedere quale parte dell'esecuzione contribuisce al totale. Usa i presupposti statici TokensPerCall seguenti:

Livello API Fase del portale Attività inclusa Prompt di token per chiamata Token di completamento per chiamata Modello usato per i prezzi
agent Esecuzione dell'agente Chiamate dell'agente di baseline e dei candidati generati rispetto alle attività di valutazione. 2.000 400 Modello dell'agente di base. Se non è disponibile, il modello di valutazione.
judge Assegnazione dei punteggi alle risposte Chiamate del modello di valutazione che assegnano un punteggio alle risposte dell'agente. Il numero di chiamate è proporzionale al numero di valutatori. 3,000 120 Modello di valutazione.
reflection Generazione di miglioramenti Chiamate al modello di ottimizzazione che analizzano i risultati e generano possibili miglioramenti. 6,000 2.000 Modello di ottimizzazione.

Questi presupposti gestiti dal servizio possono cambiare man mano che lo strumento di stima è calibrato. Per ogni livello, l'ottimizzatore moltiplica l'intervallo del numero di chiamate per le ipotesi statiche sui token di prompt e completamento. Vengono quindi applicati prezzi di riferimento datati per un milione di token:

modeled layer cost = calls × ((prompt tokens × input price) + (completion tokens × output price)) / 1,000,000

Il totale è la somma dei livelli a cui può essere assegnato un prezzo. Se per un livello non sono disponibili un prezzo del modello o un’ipotesi sui token, la stima identifica il livello privo di prezzo e lo esclude dal totale.

Cosa accade durante un'esecuzione di ottimizzazione

Per comprendere i livelli di costo, è utile sapere in che modo l'ottimizzatore usa ogni modello in background. Un processo di ottimizzazione segue questo ciclo sia per gli agenti di prompt che per gli agenti ospitati:

  1. Valutare la linea di base (agente e giudice). L'ottimizzatore invoca il tuo agente per ogni riga del set di dati per raccogliere le risposte. Il modello di valutazione assegna quindi punteggi a ogni risposta per ogni analizzatore per stabilire i punteggi di base.
  2. Genera un candidato (riflessione). Il modello di ottimizzazione riceve i punteggi di base, analizza i punti deboli e produce una configurazione dell'agente migliorata. A seconda del tipo di agente, la configurazione può includere istruzioni riscritte, competenze perfezionate, descrizioni degli strumenti migliori o un modello diverso.
  3. Valutare il candidato (agente e giudice). Optimizer esegue l'agente con la configurazione candidata nelle stesse righe del set di dati e assegna punteggi alle risposte.
  4. Ripeti. I passaggi da 2 a 3 si ripetono per ogni candidato aggiuntivo. Ogni ciclo aggiunge un'ulteriore serie di chiamate di riflessione e valutazione.

I tre livelli di costo corrispondono direttamente a questo ciclo:

  • Esecuzione dell'agente: ogni volta che l'agente viene eseguito su una riga del set di dati (la baseline e per ogni candidato).
  • Assegnazione dei punteggi alle risposte : ogni volta che il modello di valutazione giudica una risposta contro un analizzatore.
  • Generazione di miglioramenti : ogni volta che il modello di ottimizzazione riflette sui risultati e produce un nuovo candidato.

Esempio di lavoro: esecuzione con al massimo 2 candidati

Nell'esempio seguente viene illustrato come la formula si applica a una configurazione di processo concreta. Tutti i prezzi sono solo per illustrazione.

Impostazioni del processo:

Setting Value
Numero massimo di candidati 2
Righe del set di dati 20
Valutatori 2
Modello dell'agente gpt-4.1
Modello di valutazione gpt-4.1-mini
Modello di ottimizzazione gpt-5

Conteggi delle chiamate stimati:

L'ottimizzatore ricava i conteggi delle chiamate dalla configurazione del job:

Livello Calcolo Chiamate stimate
Agente (1 baseline + 2 candidati) × 20 righe 60
Giudice (1 baseline + 2 candidati) × 20 righe × 2 analizzatori 120
Reflection Determinato dall'algoritmo di ottimizzazione per 2 candidati 12

Applicare la formula a ogni livello:

Optimizer cerca i prezzi di input e output di riferimento datati per ogni modello e applica la formula. Ad esempio, il calcolo del livello agente è:

60 × ((2,000 × <input price>) + (400 × <output price>)) / 1,000,000

Lo stesso schema si applica ai livelli di valutazione e riflessione, ciascuno dei quali utilizza le ipotesi sui token e i prezzi di riferimento per il rispettivo modello. Il portale somma quindi tutti i livelli per produrre i valori Minimo, Stimato e Massimo visualizzati nel passaggio Revisione .

In una tipica esecuzione con 2 candidati, il livello di riflessione (modello di ottimizzazione) rappresenta la quota maggiore del costo stimato perché utilizza un modello più potente con tariffe per token più elevate. Il livello del giudice è in genere il meno costoso perché usa un modello di valutazione più piccolo con presupposti di token bassi per ogni chiamata.

Note

I conteggi delle chiamate in questo esempio sono riportati a scopo illustrativo. I conteggi effettivi delle chiamate di riflessione e il comportamento di arresto anticipato variano in base alla configurazione e sono determinati dal servizio al momento della stima. Il portale risolve automaticamente i prezzi di riferimento. Selezionare Visualizza prezzi nel passaggio Rivedi per visualizzare l'origine dei prezzi oppure vedere Servizio Azure OpenAI prezzi.

Presupposti e limitazioni della stima

La stima è un valore di pianificazione anziché un addebito finale perché combina un budget di chiamata algoritmica con l'uso di token modellati.

  • I presupposti dei token sono medie per ogni livello di costo. Il numero effettivo di richieste, risposte, ragionamenti e token memorizzati nella cache varia in base al modello e alla richiesta.
  • Un processo di ottimizzazione può interrompersi presto dopo che non rileva ulteriori miglioramenti. L'arresto anticipato può ridurre l'utilizzo effettivo al di sotto del valore stimato o massimo .
  • L'utilizzo dell'agente varia con istruzioni, turni di conversazione, lunghezza della risposta, chiamate agli strumenti e output degli strumenti.
  • I prezzi dei modelli di riferimento sono datati e possono differire dai prezzi per la sottoscrizione, l'area, il tipo di distribuzione o il contratto.
  • La stima non include addebiti per API esterne, database, servizi di ricerca o altri strumenti chiamati dall'agente.
  • Il valore Massimo non è un limite di spesa.

Utilizzo dei token misurato dopo l'esecuzione

Al termine di un processo di ottimizzazione, il risultato può includere l'utilizzo misurato dei token per ogni fase dell'esecuzione. La visualizzazione Utilizzo token può essere disponibile sia per le esecuzioni dell'agente prompt che dell'agente ospitato.

Per gli agenti ospitati, l'utilizzo di Esecuzione dell'agente è disponibile solo quando il campione di valutazione o la traccia dell'agente includono informazioni sull'utilizzo dei token. Se l'agente ospitato non riporta l'utilizzo, il portale omette la fase relativa all'agente anziché segnalarla come zero. Il portale registra separatamente l'utilizzo di Assegnazione di punteggi alle risposte e Generazione di miglioramenti quando tali chiamate al modello riportano i dati di utilizzo.

La vista può contenere più righe per l'esecuzione dell'agente quando l'ottimizzatore valuta più modelli di agente.

Note

I prezzi nella schermata seguente sono solo per esempio. I prezzi visualizzati nel portale foundry potrebbero essere diversi in base alla configurazione del progetto.

Screenshot della visualizzazione Utilizzo token che mostra input, output, token totali e costi stimati raggruppati per fase di ottimizzazione e modello.

Colonna del portale Meaning
Fase Esecuzione dell'agente, Valutazione delle risposte o Generazione di migliorie.
Modello Modello associato all'utilizzo misurato. Il portale mostra -- quando l'utilizzo non può essere attribuito a un modello.
Inserimento Token di prompt o di input misurati.
Output Token di completamento o di output misurati.
Totale Somma dei token di input e output misurati per la riga. La riga finale riporta il totale dell’utilizzo misurato in tutte le fasi.
Est. costo Costo stimato calcolato in base all'utilizzo dei token misurato e ai prezzi del modello di riferimento.

Il portale calcola un costo stimato rispetto all'utilizzo dei token misurato e ai prezzi del modello di riferimento. Selezionare Visualizza prezzi per esaminare l'origine dei prezzi. La stima non è l'importo finale fatturato.

Un valore di fase o token mancante indica che l'utilizzo non è stato misurato. Non significa che la fase abbia usato zero token o che non abbia comportato alcun addebito. Alcuni agenti ospitati e i processi di ottimizzazione meno recenti potrebbero non fornire dati sull'utilizzo dell'agente.

Il risultato del processo sottostante può contenere più dettagli del token memorizzato nella cache e del token di ragionamento. I token memorizzati nella cache sono un subset di token di input e i token di ragionamento sono un subset di token di output. Non aggiungere questi valori di subset ai totali di input o output.

Calcolare il costo del modello dall'utilizzo misurato

L'utilizzo misurato dei token è più rappresentativo delle stime preliminari, ma riporta il numero di token anziché l'importo finale fatturato. Applicare i prezzi per ogni riga del modello per approssimare il costo del modello:

approximate model cost = ((input tokens × input price) + (output tokens × output price)) / 1,000,000

Se l'utilizzo dettagliato fornisce il numero di token memorizzati nella cache e il modello prevede una tariffa separata per l'input memorizzato nella cache, sottrarre i token memorizzati nella cache dal totale dei token di input e calcolare separatamente il prezzo delle quote memorizzate nella cache e di quelle non memorizzate nella cache.

Calcolare ogni fase e riga del modello separatamente e quindi aggiungere i risultati. Se una riga non identifica un modello, non è possibile applicare in modo affidabile un prezzo specifico della distribuzione a tale utilizzo.

Usare le tariffe applicabili alla sottoscrizione, all'area, al tipo di distribuzione e al contratto di fatturazione. Per le tariffe pubblicate, vedere prezzi Servizio Azure OpenAI. Il risultato esclude comunque gli addebiti da strumenti e servizi esterni.