Vai al contenuto

Modello

Scorecard per agenti AI: i criteri che cambiano

Scorecard per agenti AI: quali criteri aggiungere, quali criteri pensati per gli operatori togliere e come valutare un agente AI in modo equo e verificabile.

· 7 min di lettura

Revisionato da Dominik Blattner, fondatore di Kaizo

In questa pagina

Un agente AI sbaglia in modo diverso da una persona, quindi la scorecard per agenti AI toglie i criteri validi solo per gli operatori e tiene quelli che riguardano la soluzione del problema. Aggiunge controlli su allucinazioni, escalation non sicure, rispetto del perimetro e capacità di ammettere ciò che l’agente non sa.

In sintesi

  • Il calore del tono dice poco. L’accuratezza dei fatti dice quasi tutto.
  • Valuti ogni conversazione dell’AI, perché gli errori automatizzati si ripetono su larga scala.
  • Gli errori peggiori dell’AI sono silenziosi e non arrivano mai a un’escalation.
  • Non lasci che il team che ha costruito l’agente sia l’unico a valutarlo.

Perché non può riutilizzare la scheda di valutazione degli operatori

Quando si mette in produzione un agente AI, l’istinto è valutarlo con la scheda di valutazione che si ha già. È una tentazione comprensibile, perché l’obiettivo sembra lo stesso: una buona conversazione con il cliente. Ma la scheda costruita per le persone incorpora ipotesi su come sbagliano le persone, e un agente AI smentisce quelle ipotesi in entrambe le direzioni.

Un operatore di solito non si inventa una policy di rimborso che non esiste, ma sotto pressione può essere brusco. Un agente AI non sarà quasi mai brusco, ma enuncerà una policy inventata con totale sicurezza. Valutare l’agente AI sul calore del tono dice poco, perché il tono è ciò che produce in modo più affidabile. Valutare se ogni affermazione fattuale che ha fatto era vera dice quasi tutto, perché è lì che sbaglia davvero. La scorecard deve spostare l’attenzione dove ora sta il rischio. Il nostro metodo completo per il controllo qualità di agenti AI e chatbot copre il processo attorno a questo; la domanda qui è più precisa: che cosa entra davvero nella scheda.

Criteri pensati per gli operatori che perdono senso

Parta togliendo i criteri che misurano qualcosa che un agente AI non ha o su cui non varia.

  • Tono e calore come indicatore di empatia: il tono di un agente AI è fissato dal suo prompt e varia pochissimo, quindi valutarlo misura la configurazione, non l’interazione. L’empatia conta ancora, ma come adeguatezza della risposta allo stato del cliente, di cui si parla più avanti.
  • Impegno e iniziativa: criteri come fare un passo in più presuppongono una persona che sceglie di fare di più. Non si applicano a un sistema che esegue istruzioni.
  • Aderenza a uno script imparato a memoria dall’operatore: sostituita dall’aderenza al perimetro e alle policy, un controllo diverso e più preciso per una macchina.
  • Criteri di sviluppo personale: tutto ciò che riguarda l’apprendimento o il miglioramento dell’agente spetta a chi gestisce il modello, non a un punteggio per conversazione.

Togliere questi criteri non significa abbassare l’asticella. Significa puntarla sugli errori che possono davvero accadere.

Criteri che valgono solo nella scorecard per agenti AI

Sono queste aggiunte a farne una scorecard per agenti AI e non una scheda per operatori riadattata. Ognuna descrive un errore che una persona commette di rado e che una macchina commette di continuo.

CriterioChe cosa verificaPerché un operatore lo fa scattare di rado
Accuratezza fattuale di ogni affermazioneNiente di ciò che l’agente ha detto era inventato o sbagliatoLe persone restano caute quando non sono sicure; i modelli affermano con la stessa sicurezza, che abbiano ragione o torto
Fedeltà alle policyL’agente non ha inventato, ammorbidito né esagerato una policyUn operatore sa di non conoscere una policy; un modello ne genera una plausibile
Rispetto del perimetroL’agente è rimasto entro ciò che può fare o promettereLe persone percepiscono il limite della propria autorità; a un modello va detto, e può superarlo
Comportamento di escalationHa passato la conversazione quando doveva e non ha intrappolato il clienteUn operatore si accorge di essere bloccato; un modello può girare in tondo o finire in un vicolo cieco senza accorgersene
Onestà sull’incertezzaHa detto di non sapere invece di tirare a indovinareIndovinare con sicurezza è il comportamento predefinito di un modello, non di una persona
Gestione sicura delle richieste delicateHa rifiutato o instradato correttamente casi di autolesionismo, frode o rischio legaleIl giudizio che una persona applica d’istinto deve diventare un criterio esplicito per una macchina

Criteri che restano uguali

Alcune cose contano a prescindere da chi o che cosa risponde, e sono la spina dorsale della scorecard.

  • Il problema è stato risolto: il cliente se n’è andato con il problema risolto, non semplicemente senza aver parlato con una persona. È il criterio che un tasso di contenimento (in inglese) salta senza dirlo.
  • Le informazioni erano corrette e complete: in comune con la scheda per gli operatori, ma qui pesa molto di più.
  • Il cliente è stato trattato in modo adeguato: riformulato dal calore all’adeguatezza, cioè se la risposta era adatta alla situazione e allo stato emotivo del cliente.
  • L’interazione è stata efficiente per il cliente: non il tempo di gestione dell’agente, ma se il cliente è arrivato alla soluzione senza giri inutili.

Scrivere criteri QA che un’AI può valutare (in inglese) spiega come formulare ciascuno di questi criteri perché sia verificabile sulla trascrizione e non una questione di opinione.

Come valutare con la scorecard: copertura e tracciabilità

Due cose distinguono una scorecard per agenti AI che funziona da una puramente decorativa.

Valutare tutto, non un campione

Il controllo qualità sugli operatori campionava poche conversazioni per persona perché leggerle costava. Questa logica non regge con gli agenti AI, perché i loro errori sono sistematici: una debolezza del prompt che produce un’allucinazione la produce centinaia di volte, e un campione del 2% di solito non vede lo schema finché non è già diventato un problema. Valutare il 100% delle conversazioni (in inglese) è ciò che trasforma la scorecard in uno strumento di monitoraggio invece che in un controllo a campione. Per UiPath, Kaizo ha automatizzato il 100% del QA con un ROI del 200% e un aumento dell’8% del punteggio di qualità.

Collegare ogni punteggio alla trascrizione

Un punteggio di accuratezza fattuale o di fedeltà alle policy è utile solo se si vedono le righe esatte che lo hanno abbassato. Altrimenti non si può correggere il prompt, né difendere il punteggio quando il team responsabile dell’agente lo contesta. Ogni punteggio di Kaizo rimanda alle prove che lo hanno prodotto.

Non lasciare che chi l’ha costruito sia l’unico a valutarlo

Il punto strutturale scomodo: se il team che ha costruito il suo agente AI è l’unico a valutarlo, i criteri che rischiano di più di essere morbidi sono proprio quelli che farebbero sfigurare l’agente. Valuti criteri come l’accuratezza fattuale e le escalation non sicure con una scorecard propria, e si assicuri che ogni punteggio rimandi alle prove nella conversazione. La tassonomia degli errori silenziosi approfondisce gli errori che un valutatore indulgente tende a non vedere.

Domande frequenti

Che cos’è una scorecard per agenti AI?

È l’insieme dei criteri usati per valutare le conversazioni gestite da un sistema automatizzato invece che da una persona. Si differenzia da una scheda di valutazione per operatori perché toglie i criteri validi solo per le persone, tiene quelli che verificano se il problema del cliente è stato risolto e se le informazioni erano corrette, e aggiunge criteri propri dell’automazione come accuratezza fattuale, fedeltà alle policy, rispetto del perimetro e comportamento di escalation.

Possiamo usare la nostra scheda di valutazione attuale per un agente AI?

Non senza modificarla. Una scheda per operatori incorpora ipotesi su come sbagliano le persone, e gli agenti AI sbagliano in modo diverso. Il calore del tono varia pochissimo in un modello e dice poco, mentre i fatti inventati e le policy inventate, che le persone producono di rado, diventano il rischio principale. Riutilizzare la scheda per operatori punta la sua attenzione sugli errori sbagliati.

Quali criteri sono propri della valutazione di un agente AI?

Accuratezza fattuale di ogni affermazione, fedeltà alle policy (non inventare né esagerare una policy), rispetto del perimetro, comportamento di escalation (passare la conversazione quando è bloccato invece di intrappolare il cliente), onestà sull’incertezza e gestione sicura delle richieste delicate. Ognuno descrive un errore che una persona commette di rado e che un modello commette di continuo.

Dobbiamo valutare tutte le conversazioni dell’agente AI o solo un campione?

Tutte. Gli errori di un agente AI sono sistematici: una debolezza del prompt che produce un’allucinazione la produce centinaia di volte, e un campione del 2% di solito non vede lo schema finché non è già diventato un problema. Valutare il 100% delle conversazioni trasforma la scorecard in uno strumento di monitoraggio invece che in un controllo a campione.

Perché il team che ha costruito l’agente AI non dovrebbe essere l’unico a valutarlo?

Perché i criteri che rischiano di più di essere morbidi sono quelli che farebbero sfigurare l’agente. Valuti l’accuratezza fattuale e le escalation non sicure con una scorecard propria, e colleghi ogni punteggio alle prove nella trascrizione.

Termini correlati

Costruisca una scorecard per agenti AI che colga ciò che conta

Porti le conversazioni che il suo agente AI ha gestito il mese scorso e la scheda di valutazione che usa oggi. Le mostreremo quali criteri perdono senso per una macchina, quali errori la sua scheda attuale non vede e che cosa coglie al loro posto una scorecard costruita per l’automazione. Ogni punteggio rimanda alle righe esatte della trascrizione.

Prenota una demo Scopri Agentic Auto QA

In questa pagina

Lo veda sulle sue conversazioni

Valuteremo un campione dei suoi ticket reali secondo i suoi standard, così l'esempio è il suo.

Scelto da team di assistenza clienti in tutto il mondo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart