Vai al contenuto

Metriche

Metriche AI nel customer care: quelle che contano

Le metriche AI nel customer care che mostrano se i suoi agenti AI risolvono davvero, e i numeri popolari da smettere di portare al management.

· 16 min di lettura

Revisionato da Dominik Blattner, fondatore di Kaizo

In questa pagina

Tra le metriche AI nel customer care, il tasso di contenimento e il CSAT post-AI sono le due che la maggior parte dei team riporta, e anche le più fuorvianti. Valuti invece ogni conversazione su risoluzione, accuratezza, escalation e ricontatto, con ogni punteggio collegato alle prove presenti nella conversazione.

In sintesi

  • Il contenimento conta un abbandono frustrato come un successo.
  • Il CSAT post-AI non sente mai i clienti che hanno rinunciato.
  • I ricontatti e gli abbandoni silenziosi rivelano ciò che il contenimento nasconde.
  • Ogni punteggio deve essere riconducibile alle prove nella trascrizione.

Perché le due metriche AI più usate nel customer care ingannano

Ogni responsabile dell’assistenza clienti che introduce l’AI riceve dal board la stessa domanda: dimostri che funziona. I due numeri a cui si ricorre per primi sono il tasso di contenimento e il CSAT post-AI, perché sono facili da estrarre e, con un po’ di indulgenza, mostrano entrambi una curva in crescita. Sono anche i due numeri che hanno meno probabilità di descrivere ciò che è davvero successo ai suoi clienti.

Il problema è strutturale, non una questione di messa a punto. Il contenimento misura un esito di instradamento: una persona ha toccato questa conversazione oppure no. Il CSAT post-AI misura un’opinione, ma solo quella di chi ha scelto di darla. Nessuno dei due guarda alla sostanza della conversazione, che è l’unico posto in cui si trova la risposta. È un problema molto diverso da quello risolto dal metodo standard per misurare le prestazioni degli agenti AI, e molto diverso dalla scelta di quali KPI del customer care mettere nella sua dashboard. Qui si tratta di capire quali numeri le stanno mentendo senza che nessuno se ne accorga.

Ecco la versione breve del ragionamento, metrica per metrica, prima di entrare nel dettaglio di ciascuna.

MetricaChe cosa dichiara di mostrareCome ingannaChe cosa misurare invece
Tasso di contenimento / deflessioneL’AI ha gestito la conversazione con successoConta l’abbandono e il muro di gomma come un successo, perché nessuna persona è intervenutaQualità della risoluzione più tasso di abbandono silenzioso
CSAT post-AII clienti sono soddisfatti dell’AIRisponde una minoranza autoselezionata, e i clienti più arrabbiati semplicemente se ne vannoTasso di ricontatto e qualità della risoluzione sul 100% delle conversazioni
Tempo medio di gestione delle conversazioni AIL’AI è veloceUna risposta sbagliata e veloce è più rapida di una corretta e lentaAccuratezza fattuale e costo per contatto realmente risolto
Tasso di escalationMeno escalation significa che l’AI se la cavaSopprimere le escalation è facile e dannoso; contano di più il momento e il passaggio di consegneQualità dell’escalation: momento giusto, contesto completo
Volume gestito dall’AIScala e ROINon dice nulla di ciò che è successo dentro quel volumeRispetto delle policy, valutato con i suoi criteri

Tasso di contenimento: la metrica che premia il muro di gomma

Il tasso di contenimento, a volte chiamato tasso di deflessione, è la quota di conversazioni che si è chiusa senza l’intervento di un operatore. È diventato la metrica AI predefinita perché si collega direttamente al business case: ogni conversazione contenuta è un contatto per cui non ha dovuto pagare una persona.

Il difetto sta nella definizione. Il contenimento non chiede se il cliente ha ottenuto ciò per cui era venuto. Chiede se è stato coinvolto qualcun altro. Questo significa che esiti molto diversi vengono contati tutti allo stesso modo, come un successo:

  • La vera risoluzione: il cliente ha chiesto, l’AI ha risposto correttamente, il cliente se n’è andato soddisfatto. È l’esito che la metrica doveva misurare.
  • L’abbandono: il cliente ha chiesto tre volte, ha ricevuto una variante della stessa risposta inutile e ha chiuso la finestra. Nessuna persona è intervenuta, quindi conta come contenuta.
  • Il muro di gomma: l’AI non poteva o non voleva passare la conversazione, ha continuato a proporre articoli del centro assistenza, e il cliente ha rinunciato ed è andato sui social o nella sezione recensioni dell’app store.
  • Il contatto spostato: il cliente ha chiuso la chat e ha chiamato il numero di assistenza, oppure ha scritto un’email, oppure ha aperto un nuovo ticket il giorno dopo. Contenuto in un canale, ma ancora un costo in un altro.

Tre di questi quattro sono fallimenti, e il muro di gomma è attivamente peggio che non fare nulla. Eppure un numero di contenimento non riesce a distinguerli, perché l’informazione che li distingue è dentro la conversazione, e il contenimento non ci guarda mai.

Questo non è un invito ad abbandonare il contenimento. È un input utile per capacità e costi. È un argomento contro il riportarlo come metrica di qualità, perché ottimizzare direttamente il contenimento significa rendere più difficile per il cliente raggiungere una persona, cioè proprio il comportamento che nessuno vuole e che tutti riconoscono quando sono loro i clienti.

CSAT post-AI: la metrica che non sente mai chi se ne è andato

Il CSAT (in inglese) è una buona metrica nel suo contesto naturale: una conversazione con una persona, un tasso di risposta ragionevole, una popolazione stabile che risponde. Applicato a una conversazione con l’AI sviluppa un punto cieco specifico e serio.

Autoselezione nel momento peggiore

Le risposte ai sondaggi arrivano da una minoranza di clienti, e quella minoranza non è mai casuale. Chi ha provato qualcosa di abbastanza forte da rispondere tende a stare ai due estremi. Ma il fallimento dell’AI che conta di più, il cliente che conclude in silenzio che non si arriverà da nessuna parte e si disimpegna, è proprio il cliente che ha meno probabilità di compilare un sondaggio dopo. Non è rimasto per essere intervistato. Sono i rinunciatari silenziosi, e il CSAT post-AI è strutturalmente sordo nei loro confronti.

Il sondaggio chiede la cosa sbagliata

Anche tra chi risponde, un punteggio di soddisfazione mescola la correttezza della risposta, la gradevolezza del tono e il fatto che l’esito fosse quello che il cliente voleva sentirsi dire. Un’AI affabile e sicura di sé ma sbagliata può ottenere un buon punteggio. Un’AI che comunica correttamente una regola che al cliente non piace può ottenerne uno basso. Nessuno dei due risultati le dice se il sistema funziona.

Il confronto è ingiusto in entrambe le direzioni

I team confrontano spesso il CSAT dell’AI con quello degli operatori e ne traggono conclusioni. Le due popolazioni non sono confrontabili: di solito l’AI prende per prima i contatti semplici, ad alto volume e facili da soddisfare, e passa in escalation quelli difficili. Un CSAT dell’AI lusinghiero può voler dire semplicemente che all’AI è stata data la coda facile. Uno scarso può voler dire che le è stata affidata la coda che nessuno avrebbe potuto vincere.

Tenga il CSAT. Smetta solo di trattarlo come una prova sulla sua AI. Lo consideri un segnale tra tanti, pesato sapendo che sente solo chi è rimasto.

Qualità della risoluzione: la metrica di riferimento

Se deve sostituire il contenimento con una sola cosa, la sostituisca con la qualità della risoluzione: questa conversazione ha davvero risolto il problema del cliente? È il perno dell’intero insieme, perché ogni altra metrica qui è un suo input oppure una sua verifica.

Che cos’è. Un giudizio, espresso sulla trascrizione, sul fatto che il problema di fondo del cliente sia stato affrontato. Non se un ticket è stato chiuso, non se è stata inviata una risposta, non se l’intento è stato riconosciuto. Se ciò che il cliente aveva bisogno che accadesse, è accaduto.

Come misurarla. Come criterio valutato nei suoi criteri di valutazione della qualità, applicato alle conversazioni gestite dall’AI esattamente come a quelle gestite dagli operatori. Il criterio va scritto in modo che un valutatore e un sistema di valutazione automatica lo leggano allo stesso modo: indichi quali prove nella trascrizione contano come risoluzione per ogni tipo principale di contatto. Rimborso richiesto e rimborso confermato. Indirizzo modificato e modifica confermata al cliente. Domanda posta e risposta corretta fornita, con il cliente che ne prende atto.

Come riconoscere un valore critico. Il segnale da osservare non è una soglia assoluta, è il divario tra qualità della risoluzione e contenimento. Se una grande quota di conversazioni risulta contenuta ma una quota molto più piccola viene valutata come risolta, quel divario è la dimensione del suo problema, espressa in conversazioni. È anche il numero che vale la pena mostrare al board, perché è la versione onesta di quello che gli è stato mostrato.

Si noti che questo è volutamente più severo della risoluzione al primo contatto (in inglese), che deduce la risoluzione dall’assenza di un ricontatto. L’FCR è un’approssimazione utile. La qualità della risoluzione legge la trascrizione invece di dedurre qualcosa dal silenzio, e il silenzio è esattamente ciò che produce un cliente che abbandona.

Accuratezza fattuale e tasso di allucinazione

Un agente AI (in inglese) che inventa una finestra di rimborso, indica tempi di consegna sbagliati o descrive con sicurezza una funzionalità che la sua azienda non offre non è un problema di qualità, è un problema di responsabilità. L’accuratezza fattuale è la metrica che lo intercetta, ed è quella che la maggior parte dei team non misura affatto.

Che cos’è. La quota di risposte dell’AI che contiene un’affermazione fattuale verificabile rispetto alla sua knowledge base, ai documenti di policy o ai dati degli ordini, e la quota di quelle affermazioni che è corretta. Il tasso di allucinazione è l’inverso: affermazioni fatte con sicurezza e non supportate da alcuna fonte.

Come misurarla. Ogni affermazione fattuale in una conversazione viene verificata rispetto alla fonte di riferimento. È praticabile solo in modo automatico, sui volumi, e questo è uno degli argomenti più forti per valutare ogni conversazione invece di lavorare a campione: un’allucinazione nel 98% che non ha letto costa esattamente quanto una nel 2% che ha letto. La monitori separatamente per tipo di contatto, perché l’accuratezza è raramente uniforme. Le domande sulla fatturazione e quelle sulle spedizioni di solito si comportano in modo molto diverso.

Come riconoscere un valore critico. Qualsiasi tasso diverso da zero su affermazioni con un peso legale, finanziario o di sicurezza è un valore critico, per quanto piccolo. Sulle affermazioni a rischio più basso conta la direzione: un tasso di allucinazione che sale dopo una modifica della knowledge base o un aggiornamento del modello le sta dicendo qualcosa di specifico e urgente su quella modifica.

Un’avvertenza: l’AI che ha generato la risposta non è un giudice affidabile della sua veridicità. L’accuratezza va valutata da qualcosa di esterno al sistema che l’ha prodotta, lo stesso principio per cui un LLM come giudice (in inglese) resta separato dal modello sotto valutazione.

Qualità dell’escalation: non quanto spesso, ma quanto bene

Il tasso di escalation viene riportato come se più basso fosse meglio. Non è così. L’escalation è una funzione, e un’AI che non passa mai in escalation non è un’AI forte, è un cliente intrappolato. Conta la qualità dell’escalation: se il passaggio di consegne è avvenuto al momento giusto ed è arrivato con il contesto giusto.

Il momento

I due modi di fallire stanno ai due lati di quello corretto. Un’escalation troppo precoce spreca del tutto l’automazione e irrita un cliente che aveva una domanda semplice. Un’escalation troppo tardiva, dopo tre o quattro giri a vuoto, significa che l’operatore eredita un cliente già arrabbiato e una conversazione da ricominciare. Valuti il momento: c’era un turno identificabile in cui sarebbe dovuto avvenire un passaggio competente, ed è avvenuto lì?

Il passaggio del contesto

Il fallimento di escalation più costoso è quello in cui l’operatore apre la conversazione e deve chiedere al cliente di spiegare tutto da capo. Quel solo comportamento cancella la buona volontà dell’intera interazione con l’AI. Valuti se il passaggio ha portato con sé il problema dichiarato dal cliente, ciò che è già stato tentato e tutto il contesto di account o di ordine che l’AI aveva già recuperato.

La correttezza

L’escalation era davvero la scelta giusta? Un’AI che passa in escalation ogni messaggio ambiguo genera lavoro per gli operatori senza motivo, e questo emerge nel costo per contatto risolto più che nei punteggi di qualità. Vanno valutate entrambe le direzioni, altrimenti ottimizzerà l’una fino a trasformarla nell’altra.

Come riconoscere un valore critico. Un tasso di escalation in calo insieme a un punteggio di qualità della risoluzione in calo è il segnale negativo più chiaro di tutto questo articolo. Significa che l’AI sta trattenendo conversazioni che non è in grado di concludere.

Tasso di ricontatto e tasso di abbandono silenzioso

Queste due metriche sono raggruppate perché sono i suoi rilevatori di bugie più economici. Entrambe intercettano fallimenti che il contenimento registra come successi, e nessuna delle due richiede al cliente di compilare qualcosa.

Tasso di ricontatto dopo una conversazione con l’AI

Che cos’è. La quota di clienti che torna entro una finestra definita, su qualsiasi canale, per lo stesso problema di fondo dopo una conversazione gestita dall’AI.

Come misurarlo. Colleghi i contatti per cliente e per problema, non per ticket, e guardi in modo specifico tra i canali. Un cliente che ha abbandonato una chat e poi ha telefonato è in assoluto il caso più importante da intercettare, e una vista per singolo canale lo perde completamente. Imposti la finestra in base al suo prodotto: lo stesso giorno per un problema di consegna, una settimana o più per una contestazione di fatturazione.

Come riconoscere un valore critico. Un tasso di ricontatto che sale dopo la gestione da parte dell’AI rispetto ai contatti equivalenti gestiti dagli operatori è un campanello d’allarme, qualunque sia il suo valore assoluto. Significa che il contenimento ha spostato il lavoro invece di eliminarlo.

Tasso di abbandono silenzioso

Che cos’è. La quota di conversazioni con l’AI da cui il cliente esce senza risoluzione e senza escalation. Nessun sondaggio, nessun reclamo, nessun ricontatto. Queste conversazioni sono identiche ai successi in ogni metrica basata sull’instradamento.

Come misurarlo. Individui le conversazioni che si sono chiuse su un turno del cliente, o con l’ultimo messaggio dell’AI rimasto senza risposta, e valuti se a quel punto il problema era stato risolto. Distinguere le uscite soddisfatte dalle rinunce silenziose è un giudizio sulla trascrizione, ed è proprio per questo che questa metrica non esiste nella maggior parte delle dashboard: non si può contare, va letta.

Come riconoscere un valore critico. Qualsiasi tasso di abbandono silenzioso che sia una frazione significativa del suo tasso di contenimento significa che il suo numero di contenimento è gonfiato esattamente di quella misura. Riportare il contenimento senza di esso significa riportare un numero che sa essere sbagliato.

Rispetto delle policy e costo per contatto realmente risolto

Le ultime due chiudono il cerchio tra qualità e business case.

Rispetto delle policy

Che cos’è. Se l’AI ha seguito le regole che è tenuta a seguire: verificare l’identità prima di rivelare dati dell’account, fornire le informative obbligatorie, rifiutare sconti fuori policy, gestire correttamente un cliente vulnerabile o la segnalazione di un reclamo, restare nel linguaggio regolamentare dove si applica.

Come misurarlo. Sono criteri binari, verificabili con prove, il che li rende la cosa più facile di questo elenco da valutare in automatico e la più dannosa da valutare a campione. Li applichi come controlli superato o non superato su ogni conversazione, e tratti ogni mancato superamento come un incidente da esaminare, non come una percentuale da diluire nella media. È la stessa logica dei criteri con cui viene già valutato il suo team di operatori, ed è proprio questo il punto: il suo punteggio di qualità interno deve coprire anche l’AI, altrimenti ha due standard e nessun confronto.

Come riconoscere un valore critico. Sulla verifica dell’identità e sulle informative regolamentari, un solo mancato superamento è già un valore critico. Non ne faccia la media.

Costo per contatto realmente risolto

Che cos’è. Il costo totale delle conversazioni con l’AI diviso per il numero di conversazioni realmente risolte, non per quello delle conversazioni contenute.

Come misurarlo. Prenda il suo punteggio di qualità della risoluzione, lo applichi al volume contenuto e usi il conteggio risultante come denominatore. Includa il costo a valle generato dall’AI: i ricontatti, il tempo di gestione in più sulle escalation arrivate senza contesto e il tempo degli operatori speso a rimediare.

Come riconoscere un valore critico. Se il costo per contatto realmente risolto non è nettamente migliore dell’equivalente gestito dagli operatori, l’implementazione non si sta ripagando, per quanto bello sembri il grafico del contenimento. È il numero che trasforma un argomento di qualità in un argomento finanziario, che di solito è quello che ottiene il budget.

Perché niente di tutto questo funziona con un campione o un sondaggio

Ripercorra le sette metriche e una cosa vale per ognuna, senza eccezioni: richiede di leggere la conversazione. La qualità della risoluzione è un giudizio sulla trascrizione. Il tasso di allucinazione è una verifica delle affermazioni rispetto alle fonti. La qualità dell’escalation è la valutazione di un turno specifico. L’abbandono silenzioso è l’assenza di un segnale, quindi si trova solo guardando le conversazioni in cui non è successo nulla.

Questo ha due conseguenze che la maggior parte dei programmi di misurazione non ha ancora assimilato.

Il campionamento qui non funziona. Il controllo qualità tradizionale esamina una piccola percentuale di conversazioni, e per un team di operatori di dimensione nota è un compromesso statistico difendibile. Non lo è per l’AI, per due motivi. Primo, i fallimenti dell’AI sono sistematici e non distribuiti: un articolo della knowledge base sbagliato o un caso limite di una policy produce lo stesso fallimento ogni volta che viene toccato, quindi un campione o intercetta l’intero gruppo o lo perde del tutto. Secondo, l’AI gestisce molto più volume, quindi il 2% è una finestra più piccola su un’operazione più grande. Valutare ogni conversazione (in inglese) è la condizione preliminare, non l’obiettivo: elimina il bias di selezione che rende prive di senso le altre sette metriche. Non si tratta di sorvegliare qualcuno, si tratta di non lasciare che una regola di campionamento decida che cosa dicono le sue metriche.

Non dovrebbe dover accettare un punteggio sulla fiducia. Pretenda che ogni punteggio rimandi alla prova esatta nella trascrizione che l’ha prodotto, che ogni punteggio possa essere contestato e deciso da una persona, e che il sistema di valutazione possa essere eseguito su un insieme di conversazioni già valutate dai suoi revisori, così da vedere il tasso di concordanza criterio per criterio prima di riportare qualcosa ai vertici. Un punteggio che si può ricostruire è un punteggio che si può contestare. Un punteggio che non si può ricostruire è una promessa di marketing con un numero allegato.

Kaizo valuta gli agenti AI e il suo team di operatori con un unico insieme di criteri definito da lei, con ogni punteggio ricondotto alla trascrizione e verificabile sul suo insieme di riferimento. Applica quei criteri a tutte le sue conversazioni invece che a una porzione scelta. In UiPath, questo approccio ha automatizzato il 100% del controllo qualità con un ROI del 200% e un aumento dell’8% del punteggio di qualità. In pratica, significa che il controllo qualità degli agenti AI e quello degli operatori smettono di essere due programmi separati che producono due serie di numeri non confrontabili.

Domande frequenti

Quali sono le metriche AI più importanti nel customer care?

Qualità della risoluzione, accuratezza fattuale, qualità dell’escalation, tasso di ricontatto, tasso di abbandono silenzioso, rispetto delle policy e costo per contatto realmente risolto. Queste sette descrivono ciò che è davvero successo dentro la conversazione. Il tasso di contenimento e il CSAT post-AI, le due più riportate, descrivono invece l’instradamento e un’opinione autoselezionata, ed è per questo che ingannano.

Che cos’è il tasso di contenimento e perché è fuorviante?

Il tasso di contenimento, chiamato anche tasso di deflessione, è la quota di conversazioni gestite da un’AI senza l’intervento di una persona. È fuorviante perché misura se è stato coinvolto qualcun altro, non se il cliente è stato aiutato. Un cliente che ha chiesto tre volte, non è arrivato da nessuna parte e ha chiuso la finestra frustrato conta come contenuto, e così anche un cliente che ha rinunciato e ha telefonato.

Il CSAT è un buon modo per misurare gli agenti AI?

Solo come un segnale tra tanti. Al CSAT post-AI risponde un piccolo gruppo autoselezionato, e i clienti con cui la sua AI ha fallito di più sono quelli che hanno meno probabilità di restare a rispondere a un sondaggio. Inoltre mescola correttezza e tono, quindi un’AI sicura di sé ma sbagliata può ottenere un buon punteggio. Lo confronti con misure basate sulla trascrizione invece di trattarlo come una prova a sé.

Come si misura se un agente AI ha davvero risolto un problema?

Valuti la risoluzione come criterio nei suoi criteri di valutazione della qualità, applicato alla trascrizione invece che dedotto dallo stato del ticket. Definisca, per tipo di contatto, quali prove nella conversazione contano come risoluzione: il rimborso confermato, la modifica confermata al cliente, la risposta corretta di cui il cliente prende atto. Poi confronti quella quota di conversazioni risolte con il suo tasso di contenimento. Il divario tra le due è la dimensione del problema.

Che cos’è il tasso di abbandono silenzioso?

È la quota di conversazioni con l’AI da cui un cliente esce senza risoluzione e senza escalation: nessun reclamo, nessun sondaggio, nessun ricontatto. Queste conversazioni sono invisibili a ogni metrica basata sull’instradamento perché nessuna persona è intervenuta, quindi gonfiano il contenimento. Trovarle significa leggere le conversazioni che si sono chiuse su un turno del cliente e giudicare se il problema era stato davvero affrontato.

Come possiamo sapere se possiamo fidarci del sistema che valuta la nostra AI?

Verificandolo invece di fidarsi: chieda se ogni punteggio rimanda alla prova specifica nella trascrizione e se le mostrerà il suo tasso di concordanza con conversazioni già valutate dai suoi revisori.

Termini correlati

Misuri che cosa hanno fatto davvero i suoi agenti AI

Veda il suo tasso di contenimento accanto al punteggio di qualità della risoluzione che c’è dietro, valutato con i suoi criteri. Ogni punteggio rimanda alle prove nella trascrizione, e può verificarlo su conversazioni già valutate dai suoi revisori.

Prenota una demo Scopri Agentic Auto QA Scopri Kaizo Insights

In questa pagina

Lo veda sulle sue conversazioni

Valuteremo un campione dei suoi ticket reali secondo i suoi standard, così l'esempio è il suo.

Scelto da team di assistenza clienti in tutto il mondo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart