Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Dopo aver valutato gli errori dei singoli test case, potresti applicare correzioni e comunque non riscontrare miglioramenti significativi nelle prestazioni complessive dell’agente. Questo risultato spesso indica un problema sistemico, non un insieme di errori isolati.
L'analisi dei criteri ti aiuta a esaminare più test case non riusciti per identificare segnali ricorrenti e cause radice condivise. Usa l'analisi dei criteri per concentrarti sulle modifiche che affrontano gruppi di errori contemporaneamente invece di correggere ogni errore singolarmente.
Importante
Usa queste indicazioni dopo aver completato il triage degli errori e applicato le modifiche correttive. L'analisi dei criteri è più utile dopo aver effettuato il triage di almeno cinque errori.
Quando utilizzare l'analisi dei criteri
L'analisi dei criteri è particolarmente utile quando si osserva una o più delle seguenti condizioni:
- Molti errori nello stesso set di valutazione.
- Errori ripetuti con sintomi simili.
- Miglioramenti ai singoli test case che non modificano i punteggi complessivi.
- Miglioramenti in un'area che causano regressioni in un'altra.
Correggere gli errori uno per uno è inefficiente in queste situazioni. L'analisi dei criteri ti aiuta a identificare le caratteristiche comuni degli errori, così da poter risolvere la causa sottostante.
Analisi della concentrazione
Dopo aver classificato singoli errori, cerca i modelli nel set completo.
| Schema | Cosa indica | Azione consigliata |
|---|---|---|
| L'80% o più degli errori sono problemi di configurazione della valutazione | La suite di valutazione necessita di calibrazione, non di modifiche agli agenti | Sospendi l'iterazione dell'agente. Verifica e migliora la qualità della valutazione, poi esegui nuovamente per ottenere un segnale pulito. |
| L'80% o più degli errori sono problemi di configurazione dell'agente concentrati in un'unica area (ad esempio, tutti relativi alla conoscenza) | Lacuna sistemica di configurazione degli agenti | Concentra l'intervento correttivo su quell'area. Questo problema riguarda spesso l’architettura (ad esempio, la struttura della fonte delle informazioni), piuttosto che la correzione di singoli test case. |
| L'80% o più degli errori sono limitazioni della piattaforma | L'agente raggiunge i limiti della piattaforma | Rivaluta l'ambito dell'agente. Esegui l'escalation al team della piattaforma. Regola le soglie o considera gli elementi interessati come limitazioni note, dove appropriato. |
| Gli errori sono distribuiti equamente tra i tipi di cause radice | Nessun problema sistemico singolo | Continua la correzione del caso usando il mapping delle correzioni. |
Come eseguire l’analisi della concentrazione
Conteggia gli errori classificati per tipologia di causa radice:
- Problemi di configurazione della valutazione
- Problemi di configurazione dell'agente
- Limitazioni della piattaforma
- Non classificato
Calcola la percentuale per ogni tipo.
Se un singolo tipo è dell'80% o superiore — indicando un problema sistemico — correggi la categoria, non i singoli casi.
Se i problemi di configurazione dell'agente si concentrano in un segnale di qualità (ad esempio, cinque di sei sono nozioni di base), tale modello punta a una causa radice dell'architettura.
Criteri tra segnali
Quando gli errori si estendono su più set di valutazione, spesso indicano una causa radice comune. Cerca i seguenti criteri:
| Schema | Cosa probabilmente indica | Cosa indagare |
|---|---|---|
| Accuratezza dei fatti e fondamento della conoscenza, entrambi in errore | Problema con la fonte delle informazioni (errata, mancante, inaccessibile o obsoleta) | Configurazione della conoscenza, stato di indicizzazione e aggiornamento dei contenuti |
| La chiamata dello strumento e l'instradamento del trigger entrambi non riusciti | Problema di configurazione dell'orchestrazione—argomenti e strumenti non sono collegati correttamente | Rivedi come gli argomenti sono indirizzati agli strumenti. Controlla se ci sono flussi scollegati o configurati male. |
| Il tono non è stato rispettato ma la precisione è stata mantenuta | L'agente fornisce la risposta corretta ma la comunica in modo inefficace | Concentrati sulle istruzioni relative allo stile del prompt; l'infrastruttura di accuratezza è solida. |
| La precisione non è stata rispettata ma la sicurezza è stata mantenuta | L'agente potrebbe essere eccessivamente vincolato—troppo cauto, rifiuta di rispondere quando dovrebbe | Rivedi le istruzioni di sicurezza per restrizioni troppo ampie che bloccano risposte legittime. |
| Tutto passa ad eccezione dei casi limite | Il comportamento di base è solido | Concentrati sull'espansione della robustezza ai margini; questo andamento è un buon segno. |
| La precisione migliora, ma il tono peggiora | Conflitto di istruzioni—le nuove istruzioni sull'accuratezza potrebbero far passare in secondo piano le indicazioni sul tono | Esamina le modifiche recenti ai prompt e tieni presente il "budget delle istruzioni". |
| Più set di valutazione che si degradano tutti simultaneamente | Probabilmente un'unica causa radice con un impatto significativo | Controlla se sono presenti cambiamenti recenti ai prompt di sistema, aggiornamenti delle fonti delle informazioni o aggiornamenti dei modelli della piattaforma. |
Come gestire i criteri tra segnali
- Identifica la causa radice comune: se due segnali falliscono insieme, probabilmente dipendono dalla stessa fonte delle informazioni, sezione del prompt o configurazione dello strumento.
- Correggi la dipendenza condivisa: non correggere i segnali singolarmente.
- Esegui nuovamente entrambi i set di valutazione: dopo la correzione, conferma che entrambi i set migliorano.
- Se solo uno migliora, i segnali non hanno una causa radice comune. Valuta gli errori rimanenti in modo indipendente.
Analisi delle tendenze attraverso le iterazioni
Monitora come cambiano i punteggi nel corso delle iterazioni per capire se la tua strategia di correzione sta funzionando.
| Tendenza | Interpretazione | Azione |
|---|---|---|
| Punteggi in miglioramento attraverso le iterazioni | La correzione sta funzionando | Continua finché non vengono raggiunte le soglie. |
| Punteggi piatti nonostante i cambiamenti | L'intervento correttivo non affronta la causa radice reale | Nuovo triage; la classificazione della causa principale potrebbe essere errata. |
| I punteggi peggiorano dopo un cambiamento | Regressione: la modifica ha interrotto qualcosa | Esegui il rollback delle modifiche. Analizza cosa ha subito regressione e perché. |
| Un set di valutazione migliora, un altro peggiora | Compromesso: la correzione di una dimensione ha danneggiato un'altra | Indaga sull'accoppiamento, spesso causato da conflitti di istruzioni (fai riferimento a Percorso 3). |
| Punteggi che fluttuano tra le esecuzioni (varianza superiore a +/-10%) | Instabilità del valutatore o non determinismo agente | Verifica prima l'affidabilità del valutatore (fai riferimento a Convalida del valutatore). Esegui almeno tre esecuzioni per iterazione. |
Creazione di una vista delle tendenze
Dopo ogni iterazione, registra:
- Date
- Modifica apportata
- Set valutazione
- Punteggio precedente
- Punteggio successivo
- Delta
Questa informazione consente di:
- Verifica che stai convergendo verso le soglie
- Identifica rapidamente le regressioni
- Rilevare i plateau in anticipo (Percorso 2)
Documenta gli errori
Le registrazioni strutturate degli errori accrescono la conoscenza istituzionale attraverso i cicli di iterazione. In assenza di documentazione, i team spesso ripetono lo stesso lavoro di indagine.
Perché documentare gli errori
- Accelerare la valutazione futura: riconosci immediatamente i modelli di errore noti.
- Creare prove di escalation: accumula record di limitazione della piattaforma per rendere più efficaci i casi al team della piattaforma.
- Abilita l'apprendimento del team: il registro aiuta a prevenire indagini duplicate quando più persone lavorano sullo stesso agente.
- Monitora le lacune note: non dimenticare di monitorare gli errori classificati come "non viene corretto" o "limitazione nota."
Usa il modello del registro degli errori
Usa il modello di registro degli errori per documentare gli errori in formato semplificato o dettagliato, a seconda della dimensione del team e della maturità del processo.
Cosa registrare
Acquisisci almeno le informazioni seguenti per ogni errore di cui è stato eseguito il triage:
- Quale test case non è fallito.
- Quale tipo di causa radice hai classificato come tale.
- Cosa è andato storto nello specifico.
- Cosa hai cambiato per risolverlo.
- Se la correzione ha funzionato.
Per i problemi irrisolti, registra anche:
- Ciò che hai provato finora.
- Perché rimane irrisolto.
- Quando rivalutare (ad esempio, "dopo l'aggiornamento della piattaforma X").
Flusso di lavoro per il miglioramento continuo
Usa questo elenco di controllo dopo ogni ciclo di triage e correzione per confermare di aver documentato i risultati e i prossimi passaggi.
Elenco di controllo post-iterazione
| Dopo aver completato l'operazione, | Attività |
|---|---|
| ✓ | Registra tutti gli errori classificati nel registro dei fallimenti. |
| ✓ | Identifica e annota le concentrazioni delle cause radice. |
| ✓ | Controlla i criteri tra segnali. |
| ✓ | Registra i punteggi per il monitoraggio delle tendenze. |
| ✓ | Documenta i limiti noti con soluzioni alternative. |
| ✓ | Identifica le priorità della prossima iterazione in base agli errori residui. |
| ✓ | Imposta il programma di riesecuzione (quali set di valutazione, quando). |
Quando interrompere l'iterazione
Interrompi l'iterazione quando:
- Tutti i set di valutazione superano le soglie.
- Hai documentato le lacune note.
- I punteggi sono coerenti (< al 5% di varianza).
- Non ci sono problemi di configurazione degli agenti aperti relativi ai segnali bloccanti.
Non interrompere l'iterazione quando:
- Non hai indagato sugli errori persistenti.
- Hai rimosso test case difficili per raggiungere le soglie.
- Non hai documentato i limiti della piattaforma.
Scopri di più in Determinare quando l'iterazione è completa.
Passaggi successivi
- Rivedi esempi pratici che mostrano come i livelli del framework funzionano insieme in scenari reali.
- Usa il modello del log degli errori per tenere traccia delle tue osservazioni.