Per misurare le prestazioni degli agenti AI, monitori risoluzione, accuratezza, escalation, contenimento e sentiment, poi valuti ogni conversazione gestita dall’AI con una scheda di valutazione della qualità. Usi la stessa scheda per gli operatori e un valutatore indipendente dall’AI che valuta.
In sintesi
- Un tasso di contenimento alto significa poco senza risoluzione e accuratezza.
- Con questi volumi il campionamento non è affidabile, quindi copra il 100% delle conversazioni dell’AI.
- Corregga i prompt, i guardrail e il routing dietro i punteggi bassi, poi misuri di nuovo.
Passo 1: decidere quali metriche contano davvero
Un tasso di contenimento alto sembra ottimo finché non si scopre che il bot ha trattenuto casi che avrebbe dovuto passare in escalation. Le metriche di vanità misurano l’attività, non la qualità: parta quindi scegliendo metriche che dicano se il cliente è stato davvero servito bene.
Le metriche principali delle prestazioni dell’AI
- Tasso di risoluzione: la quota di conversazioni in cui il problema del cliente è stato davvero risolto, non solo chiuso.
- Accuratezza delle informazioni: quanto spesso l’agente ha dato informazioni corrette e fondate invece di inventare dettagli.
- Tasso di escalation: quanto spesso, e con quanta pertinenza, l’agente ha passato la conversazione a un operatore. Sia un valore troppo alto sia uno troppo basso sono un problema.
- Tasso di contenimento: la quota gestita senza un operatore, che è sana solo se accompagnata da risoluzione e accuratezza.
- Sentiment: come si è sentito il cliente durante e dopo la conversazione.
Leggere le metriche insieme, mai da sole
Nessun numero da solo dice la verità. Un contenimento alto con una risoluzione bassa significa che il bot devia il cliente invece di aiutarlo. Le metriche hanno senso solo come insieme, ed è per questo che la valutazione della qualità sta alla base di tutte.
Passo 2: valutare le conversazioni dell’AI con una scheda di valutazione
Le metriche di risultato dicono che cosa è successo, ma non perché una conversazione è andata bene o male. Una scheda di valutazione della qualità trasforma le prestazioni in qualcosa che si può diagnosticare e su cui fare coaching, giudicando ogni conversazione in base a criteri definiti.
Trasformare le metriche in criteri
Costruisca una scheda di valutazione che copra accuratezza, risoluzione, escalation corretta, tono e rispetto delle policy, poi lasci che il sistema valuti automaticamente ogni conversazione dell’AI in base a essa. Kaizo legge le conversazioni in modo nativo da Zendesk e Salesforce e valuta ciascuna appena arriva, così i dati sulle prestazioni sono continui invece di una fotografia mensile.
Coprire tutto, non un campione
L’AI lavora su volumi che nessun team può campionare in modo significativo, e un difetto sistematico si ripete in ogni conversazione che un agente gestisce. Valutare il 100% è ciò che rende i numeri affidabili. In UiPath, Kaizo ha automatizzato il 100% del controllo qualità con un ROI del 200%, dando ai responsabili dati completi su cui misurare invece di una frazione.
Passo 3: confrontare in modo equo AI e operatori
Quando sia l’AI sia gli operatori gestiscono conversazioni, la domanda naturale è come si confrontano. Il confronto ha senso solo se entrambi vengono misurati allo stesso modo.
Usare una sola scheda per entrambi
Valuti le conversazioni gestite dall’AI e quelle gestite dagli operatori con gli stessi criteri, così una differenza nei punteggi riflette una reale differenza di qualità e non due metri di misura diversi. Così emerge anche dove l’AI fa davvero meglio e dove, senza che nessuno se ne accorga, fa peggio, per coda e per argomento.
| Dimensione | Metriche di vanità | Confronto equo |
|---|---|---|
| Base | Volume dell’AI vs volume degli operatori | La stessa scheda applicata a entrambi |
| Risoluzione | Ticket chiusi | Problemi davvero risolti |
| Escalation | Contata come un fallimento dell’AI | Giudicata corretta o scorretta per il caso |
| Copertura | Un campione di ciascuno | Il 100% di entrambi, valutato in continuo |
| Verdetto | Chi ha gestito di più | Chi ha gestito meglio, con le prove |
Passo 4: mantenere il valutatore indipendente
Un dato sulle prestazioni è affidabile solo quanto ciò che lo ha prodotto. Non lasci che il team che ha costruito un agente AI sia l’unico a valutarlo: un team che ha un interesse nel risultato ha un motivo per riportare punteggi lusinghieri, e questo falsa in silenzio ogni metrica a valle.
Le prove rendono credibile la misurazione
Ogni punteggio assegnato da Kaizo rimanda al momento esatto della trascrizione che lo ha generato. Un’affermazione sulle prestazioni si può quindi verificare leggendo, invece di accettarla sulla fiducia, ed è questo che permette ai team di aumentare il tasso di automazione con sicurezza.
Passo 5: agire sui risultati
Una misurazione che non cambia i comportamenti è solo una dashboard. Lo scopo di misurare le prestazioni dell’AI è migliorarle, e i punteggi collegati alle prove rendono il passaggio diretto.
Chiudere il cerchio
- Risalga dagli errori di accuratezza al prompt, alla fonte di conoscenza o alla lacuna di grounding che li ha causati.
- Corregga i trigger di escalation impostati male quando il tasso di escalation sale o scende troppo.
- Raggruppi i punteggi bassi ricorrenti per argomento o per coda, così da correggere lo schema una sola volta, alla fonte.
- Misuri di nuovo dopo ogni modifica, su tutte le conversazioni, per confermare che la correzione regge e non ha causato regressioni altrove.
Poiché la copertura è continua, l’effetto di una modifica emerge sull’intero insieme di dati invece che su un campione che potrebbe non coglierlo.
Errori comuni nel misurare le prestazioni degli agenti AI
Sono gli errori che fanno sembrare i dati sulle prestazioni dell’AI più sani della realtà.
- Inseguire solo il contenimento: un tasso di contenimento alto con una risoluzione bassa significa deviare il cliente, non offrire buone prestazioni.
- Campionare un agente ad alto volume: un piccolo campione quasi sempre non coglie i difetti sistematici.
- Confrontare AI e operatori su scale diverse: senza un’unica scheda condivisa, il confronto non ha senso.
- Lasciare che a valutare l’AI sia solo il team che l’ha costruita: un valutatore con un interesse nel risultato produce numeri lusinghieri e inaffidabili.
- Riportare senza agire: metriche che non cambiano mai un prompt, un guardrail o una regola di routing non portano alcun miglioramento.
Domande frequenti
Come si misurano le prestazioni degli agenti AI nell’assistenza clienti?
Monitori metriche di risultato come tasso di risoluzione, accuratezza delle informazioni, tasso di escalation, contenimento e sentiment, poi valuti ogni conversazione gestita dall’AI con una scheda di valutazione della qualità invece che su un campione. Confronti AI e operatori con la stessa scheda, usi un valutatore indipendente dall’AI valutata e agisca sui risultati correggendo ciò che genera i punteggi bassi.
Quali metriche contano di più per gli agenti AI?
Tasso di risoluzione e accuratezza delle informazioni contano di più, perché mostrano se il cliente è stato davvero aiutato con informazioni corrette. Tasso di escalation, contenimento e sentiment aggiungono un contesto essenziale, ma ingannano se letti da soli. Un contenimento alto con una risoluzione bassa, per esempio, significa che l’agente devia il cliente invece di risolvere il problema.
Come confrontare in modo equo agenti AI e operatori?
Valuti entrambi con la stessa scheda di valutazione della qualità e gli stessi criteri, così una differenza di punteggio riflette una reale differenza di qualità e non due metri di misura diversi. Coprire il 100% di entrambi, in continuo, fa emergere anche dove l’AI fa meglio e dove fa peggio, per coda e per argomento.
Perché un valutatore indipendente è importante per le metriche dell’AI?
Se a valutare l’AI sono solo le persone che l’hanno costruita, i punteggi hanno un incentivo incorporato a sembrare buoni, e questo falsa ogni metrica a valle. Quando ogni punteggio rimanda alla prova nella trascrizione, un’affermazione sulle prestazioni si può verificare leggendo invece di fidarsi alla cieca.
Perché un campione non basta per gli agenti AI?
L’AI lavora su volumi che nessun team può campionare in modo significativo, e un difetto sistematico si ripete in ogni conversazione che un agente gestisce. Un piccolo campione quasi sempre non coglie questi difetti. Solo valutare il 100% delle conversazioni dell’AI rende i numeri affidabili e mostra l’effetto di ogni modifica sull’intero insieme di dati.
Termini correlati
- Controllo qualità degli agenti AI e dei chatbot
- Che cos’è il QA agentico? (in inglese)
- Come valutare il 100% delle conversazioni (in inglese)
- Che cos’è la copertura QA al 100%? (in inglese)
- Guida alla conversation intelligence (in inglese)
Misuri i suoi agenti AI sulle sue conversazioni
Porti una settimana delle sue conversazioni reali gestite dall’AI e le mostreremo risoluzione, accuratezza ed escalation valutate sul 100% delle conversazioni, con ogni numero riconducibile alla trascrizione.