Nota
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare ad accedere o modificare le directory.
L'accesso a questa pagina richiede l'autorizzazione. È possibile provare a modificare le directory.
Le procedure dettagliate end-to-end illustrano come i livelli del framework di valutazione collaborano nella pratica. Ogni percorso inizia da uno scenario di valutazione diverso e segue un percorso diagnostico distinto.
Le guide dettagliate mostrano come applicare il framework passo dopo passo. Utilizza questi esempi per comprendere come passare dai risultati della valutazione alla diagnosi, alla correzione e alla verifica in scenari reali di valutazione degli agenti.
Suggerimento
Prima di affrontare questi esempi, rivedi gli obiettivi del framework, inclusi i concetti e i principi fondamentali.
| Percorso | Situazione iniziale | Cosa dimostra |
|---|---|---|
| Percorso 1 | Prima esecuzione della valutazione | Flusso end-to-end: interpretare → assegnare priorità → valutare → correggere → verificare |
| Percorso 2 | I punteggi si stabilizzano dopo più iterazioni | Analisi dei modelli, riclassificazione e soluzioni per le limitazioni della piattaforma |
| Percorso 3 | I punteggi regrediscono dopo una modifica | Rilevamento della regressione, diagnosi di conflitti di istruzioni e risoluzione dei compromessi |
Nota
Questi esempi sono illustrativi e si basano su schemi comuni osservati in più esecuzioni di valutazione dei clienti. I test case, i punteggi e i dettagli dell'agente sono compositi rappresentativi anziché record di una singola interazione. Gli approcci diagnostici e le strategie di correzione mostrate riflettono pratiche utilizzate nelle implementazioni reali.
Percorso1: prima esecuzione della valutazione
Esegui la tua suite di valutazione per la prima volta su un agente del servizio clienti. Ecco i risultati:
| Set valutazione | Percentuale di superamento |
|---|---|
| Sicurezza e dati personali | 100% |
| Domande e risposte sull'attività principale | 87% |
| Grounding delle conoscenze | 71% |
| Chiamata allo strumento | 92% |
| Routing dei trigger | 88% |
| Tono e qualità | 83% |
| Riassegnazione | 90% |
| Complessivo | 85% |
Passaggio 1: interpreta i punteggi (livello 1)
Utilizza la tabella di interpretazione dei punteggi per calibrare le soglie e individuare quali set di valutazione sono inferiori alle soglie di blocco.
| Set valutazione | Punteggio | Soglia | Status |
|---|---|---|---|
| Sicurezza e dati personali | 100% | Bloccaggio 95% | Positivo |
| Domande e risposte sull'attività principale | 87% | Bloccaggio 80% | Positivo |
| Grounding delle conoscenze | 71% | Bloccaggio 80% | Sotto la soglia di blocco |
| Chiamata allo strumento | 92% | Bloccaggio 85% | Positivo |
| Routing dei trigger | 88% | Bloccaggio 80% | Positivo |
| Tono e qualità | 83% | Bloccaggio 75% | Positivo |
| Riassegnazione | 90% | Bloccaggio 85% | Positivo |
Valutazione dell'idoneità: iterazione. Il grounding della conoscenza è al di sotto della soglia di blocco. Focalizza la correzione lì.
Passaggio 2: assegna le priorità agli errori (livello 2, passaggio 0)
Situazione: il grounding della conoscenza ha sette test case. Due test case falliscono: KG-003 e KG-005. Entrambi i test case sono in un set di valutazione dell'attività principale, quindi sono di priorità 2. Poiché ci sono solo due elementi, eseguire il triage di entrambi.
Riferimento: assegna la priorità agli errori (livello 2, passaggio 0)
Passaggio 3: eseguire il triage di KG-003 (livello 2, passaggi 1-2)
Caso di test KG-003:
- Input di esempio: "Qual è la vostra politica di reso?"
- Risposta attesa: "Offriamo un periodo di reso di 30 giorni per tutti gli acquisti."
- Risposta dell'agente: "La nostra politica di reso consente resi entro 15 giorni lavorativi dall'acquisto."
- Metodo di valutazione:corrispondenza di parole chiave
- Risultato: Errore (previsto "30 giorni", l'agente ha detto "15 giorni lavorativi")
Verifica la configurazione della valutazione (passaggio 1 del livello 2):
| Domanda | Risposta | Risultato |
|---|---|---|
| La risposta dell'agente è accettabile? | È necessario controllare il documento di origine. | Controlla prima l'origine. |
| La risposta prevista è ancora aggiornata? | Il documento di origine dice "15 giorni lavorativi". La politica è stata aggiornata. | Nr. La risposta prevista è obsoleta. |
Classificazione: problema di configurazione della valutazione. Risposta prevista obsoleta. L'agente è corretto. La valutazione è errata.
Passaggio 4: eseguire il triage di KG-005 (livello 2, passaggi 1-2)
Caso di test KG-005:
- Input di esempio: "Il piano Premium include una garanzia estesa?"
- Risposta attesa: "Il piano Premium include una garanzia standard di due anni." Le opzioni di garanzia estesa sono disponibili per l'acquisto separatamente."
- Risposta dell'agente: "Sì, il piano Premium include una garanzia estesa di tre anni che copre tutte le parti e la manodopera."
- Metodo di valutazione: confronto del significato
- Risultato: Errore (l'agente ha inventato i dettagli della garanzia)
Verifica la configurazione della valutazione (passaggio 1 del livello 2):
| Domanda | Risposta | Risultato |
|---|---|---|
| La risposta dell'agente è accettabile? | Nr. "Garanzia estesa di tre anni" è stata introdotta. | Continua |
| La risposta attesa è aggiornata? | Sì. L'origine conferma la garanzia standard di due anni. | Continua |
| Il test case è realistico? | Sì. Domanda comune di un cliente. | Continua |
| Potrebbe essere corretta una risposta alternativa? | Nr. I dettagli della garanzia sono concreti. | Continua |
| Il metodo di valutazione è appropriato? | Sì.Il confronto del significato è corretto per l'accuratezza semantica. | La valutazione è valida. |
Esegui la diagnostica sull'agente (passaggio 2 del livello 2):
| Domanda | Risposta |
|---|---|
| Il contenuto dell'origine è errato? | Nr. L'origine dice "garanzia standard di due anni". |
| L'agente ha contraddetto le informazioni nell'origine? | Sì. L'origine dice "garanzia standard di due anni", ma l'agente ha detto "garanzia estesa di tre anni". |
| L'agente ha risposto senza usare alcuna origine? | Probabilmente sì. Il dettaglio della "garanzia estesa di tre anni che copre tutte le parti e la manodopera" non è presente in alcuna origine. |
Classificazione: problema di configurazione dell'agente. Gap di conoscenze. L'agente ha prodotto dettagli della garanzia che non sono presenti nelle fonti delle informazioni configurate.
Passaggio 5: correzione (livello 3)
KG-003 (Correzione della configurazione della valutazione):
- Modifica: aggiorna il valore atteso da "finestra di reso di 30 giorni" a "15 giorni lavorativi"
- Nuova esecuzione: solo KG-003
- Risultato atteso: Riuscito
KG-005 (Correzione della configurazione dell'agente):
- Modifica: Aggiungere istruzioni contestuali al prompt di sistema: "Rispondere solo in base alle informazioni trovate nelle fonti delle informazioni. Se le informazioni non sono disponibili, dillo."
- Nuova esecuzione: set di valutazione delle conoscenze contestuali complete (la modifica della configurazione dell'agente può avere effetti più ampi)
- Risultato atteso: KG-005 completato. Altri test case non dovrebbero subire regressioni.
Passaggio 6: verifica
Dopo entrambe le modifiche, rieseguire il set di valutazione del grounding della conoscenza:
| Prima | Dopo |
|---|---|
| 71% (5/7 risultati positivi) | 86% (6/7 risultati positivi) |
Valutazione: il grounding della conoscenza è ora sopra la soglia di blocco dell'80%. Un errore (KG-007) persiste e non blocca l'idoneità. Esaminalo nell'iterazione successiva.
Passaggio 7: documentare (Livello 4)
Registra nel registro degli errori:
| Caso di test | Tipo di causa radice | Problema riscontrato | Modifica applicata | Risolto |
|---|---|---|---|---|
| KG-003 | Configurazione della valutazione | Risposta attesa obsoleta (la politica è stata modificata da 30 giorni a 15 giorni lavorativi). | Valore atteso aggiornato | Sì |
| KG-005 | Configurazione dell'agente | Dettagli di garanzia errati non presenti in alcuna origine. | Aggiunta dell'istruzione di base al prompt di sistema | Sì |
Nota sul modello: verifica i valori attesi rispetto ai documenti di origine prima di ogni esecuzione di valutazione. Aggiungi questo passaggio all'elenco di controllo della pre-valutazione.
Ricontrollo dell'idoneità: tutti i set di valutazione ora al di sopra delle soglie di blocco.
Valutazione dell'idoneità: distribuisci l'agente con lacune note (KG-007 documentato, piano di monitoraggio in essere).
Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente
Percorso 2: punteggio in fase di plateau
Situazione: esegui quattro iterazioni su un agente di supporto al prodotto. L'accuratezza effettiva rimane al 78% in tutte le quattro esecuzioni. Le modifiche al prompt vengono apportate dopo ogni esecuzione, ma non si vede alcun miglioramento.
Passaggio 1: controlla gli schemi (livello 4)
Rivedi il log degli errori in tutte e quattro le iterazioni:
| Iterazione | Punteggio | Modifica applicata | Result |
|---|---|---|---|
| 1 | 78% | (riferimento) | — |
| 2 | 79% | Aggiunto "Sii preciso sulle specifiche del prodotto" | Nessun cambiamento significativo |
| 3 | 77% | Riorganizzato il prompt per dare priorità alle istruzioni sulla precisione | Nessun cambiamento significativo |
| 4 | 78% | Aggiunti esempi risolti di risposte corrette del prodotto | Nessun cambiamento significativo |
Tendenza: costante. L'intervento correttivo non affronta la causa radice effettiva.
Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente
Passaggio 2: analizza i test case non riusciti
Esamina i sei errori persistenti in tutte le iterazioni.
| Caso di test | Fallisce da | Problema riscontrato |
|---|---|---|
| FA-002 | Iterazione 1 | L'agente cita la pagina delle domande frequenti invece del manuale del prodotto |
| FA-005 | Iterazione 1 | L'agente cita la pagina delle domande frequenti invece del manuale del prodotto |
| FA-008 | Iterazione 1 | L'agente cita la pagina delle domande frequenti invece del manuale del prodotto |
| FA-011 | Iterazione 1 | L'agente cita la pagina delle domande frequenti invece del manuale del prodotto |
| FA-014 | Iterazione 1 | L'agente cita la pagina delle domande frequenti invece del manuale del prodotto |
| FA-019 | Iterazione 2 | L'agente fornisce una risposta parziale dalle domande frequenti, senza riportare i dettagli del manuale |
Analisi della concentrazione: cinque errori su sei (83%) hanno la stessa causa radice: l’agente recupera informazioni dalla pagina delle domande frequenti invece che dal manuale del prodotto.
Passaggio 3: nuovo triage (livello 2)
Inizialmente, classifica gli errori come Problema di configurazione dell'agente: origine recuperata errata.
Applica più modifiche alla configurazione dell'agente, inclusa la riformulazione dei prompt, il riordinamento e l'aggiunta di esempi. Questi cambiamenti non portano a miglioramenti misurabili. A questo punto, convalida l'errore a fronte degli indicatori di limitazione della piattaforma.
| Indicatore | Controllo |
|---|---|
| L'errore persiste su più variazioni di prompt o configurazione | Sì. Quattro iterazioni senza modifiche. |
| Il sistema di recupero restituisce costantemente documenti errati nonostante una configurazione corretta dell'origine | Sì. Le domande frequenti vengono recuperate sistematicamente al posto del manuale del prodotto. |
Riclassificazione: questo problema è una limitazione della piattaforma relativa alla classificazione del recupero. La piattaforma assegna costantemente la priorità alle domande frequenti rispetto al manuale del prodotto per queste query e ulteriori modifiche ai prompt o alle istruzioni non modificano il comportamento di recupero.
Riferimento: Livello 2: triage errori dell'agente
Passaggio 4: correzione (livello 3—Limitazione della piattaforma)
Quando si classifica un errore come una limitazione della piattaforma, l’intervento dovrebbe concentrarsi su soluzioni alternative e sulla documentazione, invece che su modifiche alla configurazione dell’agente.
Riferimento: Risposta alla limitazione della piattaforma
Strategia di soluzione alternativa: applica uno o più dei seguenti approcci di mitigazione per ridurre l'impatto:
- Ristruttura il manuale del prodotto con intestazioni di sezione più chiare, allineate al vocabolario utilizzato nelle query degli utenti.
- Duplica le specifiche critiche del prodotto dal manuale nelle domande frequenti per creare percorsi di recupero ridondanti.
- Effettua il refactoring del contenuto del manuale in modo che ogni sezione risponda a una singola domanda ben definita, per migliorare la corrispondenza dei blocchi recuperati.
Queste strategie puntano a influenzare il comportamento del recupero senza ricorrere a modifiche di prompt o istruzioni.
Escalation e monitoraggio: se la limitazione persiste, documenta e inoltra il problema al team della piattaforma.
- Documenta la limitazione come segue: "Le query relative alle <specifiche del prodotto> portano sempre alla pagina delle domande frequenti (ultimo aggiornamento: <data>, <n> pagine) invece che al manuale del prodotto (ultimo aggiornamento: <data>, <N> pagine), nonostante il manuale contenga le informazioni autorevoli."
- Fornisci prove a supporto: includi diversi test case che mostrino la query, l'origine prevista e l'origine effettivamente recuperata.
- Invia per l'indagine.
- Condividi la limitazione documentata e le prove con il team della piattaforma per il monitoraggio e il follow-up.
Passaggio 5: verifica
Dopo aver ristrutturato il manuale del prodotto e aggiunto domande frequenti ridondanti, esegui nuovamente il set di valutazione rilevante per verificarne l'impatto.
| Prima | Dopo |
|---|---|
| 78% (invariato in quattro iterazioni) | 89% |
Valutazione: la soluzione alternativa migliora le prestazioni complessive. Un errore persiste (FA-019). La query è troppo ambigua per recuperare in modo affidabile l'origine corretta, anche con contenuti ristrutturati. Questo errore è registrato come una limitazione nota.
Passaggio 6: documento
Aggiorna il registro degli errori per riflettere la classificazione finale e i risultati.
| Caso di test | Tipo di causa radice | Problema riscontrato | Modifica applicata | Risolto |
|---|---|---|---|---|
| FA-002, 005, 008, 011, 014 | Limitazione della piattaforma | La classificazione del recupero dà priorità alle domande frequenti rispetto al manuale del prodotto | Ristrutturazione delle intestazioni del manuale; duplicazione delle specifiche critiche nelle domande frequenti | Sì |
| FA-019 | Limitazione della piattaforma | La query ambigua non riesce a recuperare in modo affidabile l'origine corretta | Documentato come limitazione nota | No |
Punti chiave: se i punteggi di valutazione rimangono invariati attraverso più modifiche ai prompt o alle istruzioni, è improbabile che la causa radice sia il prompt. Convalida il comportamento dell'infrastruttura e della piattaforma prima di investire di più nella progettazione dei prompt.
Percorso 3: regressione post-aggiornamento
Situazione: hai aggiornato il prompt di sistema per migliorare tono ed empatia. I punteggi di tono sono aumentati, ma l'accuratezza effettiva è diminuita al di sotto della soglia di blocco, introducendo una regressione.
Prima della modifica:
| Set valutazione | Punteggio |
|---|---|
| Accuratezza fattuale | 91% |
| Tono e qualità | 83% |
| Tutti gli altri | Sopra la soglia |
Hai aggiunto la seguente istruzione al prompt di sistema: "Riconosci sempre la preoccupazione del cliente e mostra empatia prima di fornire la tua risposta." Inizia ogni risposta convalidando l'esperienza del cliente."
Dopo la modifica:
| Set valutazione | Prima | Dopo | Delta |
|---|---|---|---|
| Accuratezza fattuale | 91% | 76% | -15% |
| Tono e qualità | 83% | 91% | +8% |
Passaggio 1: interpreta (livello 1)
L'accuratezza fattuale è ora sotto la soglia di blocco dell'80%. Questa modifica introduce una regressione e blocca l'idoneità.
Riferimento: Livello 1: interpreta i punteggi e identifica gli errori
Passaggio 2: controlla gli schemi (livello 4)
Corrispondenza del modello di segnale incrociato: il tono migliora mentre l'accuratezza si riduce.
Causa radice indicata: conflitto di istruzioni.
Le linee guida per il tono appena aggiunte competono con istruzioni di accuratezza per l'attenzione del modello.
Riferimento: Livello 4: analizza gli schemi e migliora continuamente il tuo agente
Passaggio 3: triage dei nuovi errori (livello 2)
Rivedi i casi di test di accuratezza fattuale che venivano superati prima della modifica e ora non vengono più superati.
Caso di test FA-007:
- Input: "Qual è la dimensione massima per il caricamento dei file?"
- Previsto: "La dimensione massima per il caricamento dei file è di 25 MB per gli account standard e 100 MB per gli account aziendali."
- Agente precedente: "La dimensione massima per il caricamento dei file è 25 MB per gli account standard e 100 MB per gli account aziendali."
- Agente dopo: "Capisco perfettamente la tua preoccupazione riguardo alle dimensioni di caricamento dei file: può essere frustrante quando si cerca di caricare documenti importanti!" Voglio assicurarmi che tu abbia tutte le informazioni di cui hai bisogno. La dimensione massima di caricamento è di 25 MB per i piani standard."
Passaggio 1. Verifica la valutazione: La risposta attesa è corretta e la valutazione è valida. La risposta dopo l'aggiornamento omette il dettaglio dell'account aziendale.
Passaggio 2. Esegui la diagnostica: La nuova istruzione sul tono richiede un preambolo di empatia in ogni risposta. Questo requisito consuma il budget di risposta e l'attenzione del modello e porta a risposte fattuali incomplete.
Classificazione: problema di configurazione dell'agente. Conflitto di istruzioni tra tono e indicazioni sull'accuratezza.
Riferimento: Livello 2: triage errori dell'agente
Passaggio 4: correzione (livello 3)
Il problema non è la guida sul tono, ma le priorità concorrenti nel prompt di sistema. La correzione si concentra sulla separazione e sull'assegnazione delle priorità alle istruzioni.
Vecchia istruzione (singola, in conflitto): "Riconosci sempre la preoccupazione del cliente e mostra empatia prima di fornire la tua risposta." Inizia ogni risposta convalidando l'esperienza del cliente."
Nuova istruzione (separata, prioritaria): "Includi sempre la risposta completa e fattuale alla domanda del cliente." Non omettere dettagli per brevità. Inoltre, quando il cliente esprime frustrazione o preoccupazione, riconoscilo brevemente."
Modifiche importanti:
- L'accuratezza ha esplicitamente la priorità.
- La completezza delle risposte fattuali è affermata esplicitamente.
- L'empatia è condizionata, non universale.
- "Brevemente" vincola l'empatia per evitare il troncamento del contenuto.
Riferimento: Livello 3: eseguire il mapping dei modelli di errore alle strategie di correzione
Passaggio 5: verifica
Eseguire nuovamente la suite di valutazione completa, perché le modifiche ai prompt di sistema possono avere un impatto ampio.
| Set valutazione | Prima della modifica | Dopo la regressione | Dopo la modifica |
|---|---|---|---|
| Accuratezza fattuale | 91% | 76% | 90% |
| Tono e qualità | 83% | 91% | 89% |
| Tutti gli altri | Sopra la soglia | Sopra la soglia | Sopra la soglia |
Valutazione: entrambi i segnali ora soddisfano le loro soglie di blocco. Tono non torna completamente al suo picco, ma rimane ben al di sopra della soglia di blocco del 75% e mostra un miglioramento rispetto alla linea di base iniziale.
Passaggio 6: documento
| Caso di test | Tipo di causa radice | Problema riscontrato | Modifica applicata | Risolto |
|---|---|---|---|---|
| FA-007, FA-012, FA-018 (e altri) | Configurazione dell'agente | Le linee guida sul tono hanno prevalso sulla completezza fattuale | Prompt ristrutturato per privilegiare l'accuratezza e applicare empatia condizionale | Sì |
Punto chiave: convalida sempre le modifiche al prompt di sistema sull'intera suite di valutazione, non solo sul segnale di destinazione. Le istruzioni competono per l'attenzione del modello e i miglioramenti in un'area possono introdurre regressioni in altre.
Modello da monitorare: questo scenario è un'istanza del problema del budget delle istruzioni. Man mano che i prompt crescono, i conflitti di istruzione diventano più probabili. Il consolidamento e la semplificazione periodici aiutano a mantenere la stabilità.
Schemi comuni nei diversi percorsi
Ogni percorso inizia da uno scenario diverso per illustrare un percorso diagnostico distinto. Per vedere come un singolo agente progredisce attraverso l'intero ciclo di vita della valutazione—interpretazione del punteggio, triage degli errori, correzione e verifica—consulta Percorso 1, che offre la guida end-to-end più completa.
Questa tabella mette in evidenza i modelli ricorrenti riscontrati nei diversi percorsi e le lezioni pratiche che ne derivano.
| Schema | Dove viene visualizzato | Concetto chiave importante |
|---|---|---|
| Verificare la valutazione prima dell'agente | Percorso 1 | Una causa comune di sforzo inutile è analizzare il comportamento dell'agente quando la valutazione stessa è errata. |
| Punteggi costanti indicano una causa principale erroneamente classificata | Percorso 2 | Se interventi ripetuti non migliorano i risultati, riclassifica la causa. Probabilmente stai affrontando la causa radice sbagliata. |
| Eseguire nuovamente la suite di valutazione completa dopo le modifiche al prompt | Percorso 3 | Le modifiche ai prompt possono influenzare diversi segnali di qualità. Controlla sempre eventuali regressioni fuori dall'area di destinazione. |
| Documentare risultati e decisioni | Tutti i percorsi | Il mantenimento di un registro degli errori impedisce di individuare nuovamente le stesse cause radice nelle iterazioni successive. |
| Le lacune note possono essere accettabili | Percorso 1 (KG-007), Percorso 2 (FA-019) | Non tutti gli errori devono essere risolti prima della spedizione. Documenta le lacune note e monitorale nel tempo. |
Passaggi successivi
Dopo aver esaminato questi esempi, scegli l'azione successiva che meglio si adatta alla tua situazione attuale:
- Inizia con l'interpretazione dei punteggi se hai risultati di valutazione pronti da esaminare.
- Inizia il triage degli errori se devi diagnosticare problemi specifici di test case.
- Applica l'analisi dei criteri se stai lavorando con più errori e vuoi identificare problemi sistemici.
- Configura il log degli errori per tenere traccia di decisioni, risultati e problemi ricorrenti.
- Torna agli obiettivi del framework per rivedere l'approccio completo di triage della valutazione.