Un errore silenzioso è uno sbaglio dell’agente AI che le sue metriche contano come un successo. Il ticket si chiude, il tasso di contenimento registra una vittoria e il cliente se ne va con una risposta sbagliata o un’esigenza non risolta. Tra gli errori silenziosi degli agenti AI, l’escalation mancata, quando l’agente AI tiene un caso che avrebbe dovuto passare a una persona, è uno dei più difficili da vedere, perché nessun evento di escalation viene mai registrato.
In sintesi
- Gli errori silenziosi degli agenti AI si presentano in sei tipi comuni, dall’invenzione sicura di sé alla risposta fluente alla domanda sbagliata.
- L’escalation mancata è il tipo più silenzioso, perché un caso che non viene mai passato a una persona sembra self-service in ogni dashboard.
- Gli errori degli agenti AI si ripetono: una debolezza del prompt causa lo stesso errore ogni volta che le sue condizioni si ripresentano.
- Per trovare gli errori silenziosi, valuti ciò che l’agente AI ha detto, in ogni conversazione, rispetto ai suoi criteri scritti.
Perché gli errori silenziosi sono quelli che fanno più male
Quando un agente AI sbaglia in modo evidente, lei lo sa già. Va in errore, apre un’escalation, dice al cliente che non può aiutarlo, e interviene una persona. È un errore fastidioso ma visibile, e gli errori visibili vengono corretti perché le metriche li intercettano. Gli errori silenziosi non lasciano nulla da intercettare.
Un errore silenzioso è diverso. L’agente conclude la conversazione, la segna come risolta e passa oltre, dopo aver fatto qualcosa di sbagliato che nessuno ha registrato. Il contenimento la conta come contenuta. La dashboard dei volumi la conta come gestita. L’indicatore di risoluzione, se esiste, è stato impostato dall’agente stesso, convinto di esserci riuscito. Tutti i sistemi di monitoraggio che ha concordano che la conversazione è andata bene, e l’unico che sa che non è così è il cliente, che non sta compilando il suo sondaggio.
Ecco perché gli errori silenziosi si accumulano: il ciclo di feedback che li farebbe emergere è proprio quello che manca. Ed ecco perché gli insight sul customer care devono venire da ciò che è stato detto in ogni conversazione, non dagli indicatori di risoluzione e dai sondaggi. La nostra guida al controllo qualità degli agenti AI è costruita per chiudere quel ciclo.
I sei tipi di errori silenziosi degli agenti AI
Sei tipi ricorrenti coprono quasi tutto ciò che va storto in silenzio in un agente AI: invenzione sicura di sé, policy inventata, falsa risoluzione, escalation mancata, sconfinamento di perimetro e risposta alla domanda sbagliata. Dare loro un nome è metà del lavoro, perché non si può valutare un errore che non si è definito, e nessuno di essi genera un errore di sistema.
| Errore silenzioso | Che cosa succede | Perché la dashboard non lo vede |
|---|---|---|
| Invenzione sicura di sé | L’agente afferma un fatto inventato come se ne fosse certo | Non scatta alcun segnale di incertezza e il ticket si chiude normalmente |
| Policy inventata | Genera una regola plausibile su rimborsi, garanzie o requisiti che non esiste | Suona autorevole, quindi nessuno la mette in dubbio finché un cliente non ne pretende il rispetto |
| Falsa risoluzione | Dichiara risolto un problema che non lo è | L’indicatore di risoluzione lo imposta l’agente, e il contenimento lo conta come una vittoria |
| Escalation mancata | Continua a gestire un caso che avrebbe dovuto passare a una persona | Nessun evento di escalation viene registrato, quindi il caso sembra self-service |
| Sconfinamento di perimetro | Risponde o promette oltre ciò che è autorizzato a fare | Sul momento il cliente è contento, quindi i segnali di soddisfazione sembrano buoni |
| Risposta giusta, domanda sbagliata | Risponde con fluidità a una domanda che il cliente non ha fatto | Fluidità e ticket chiuso sembrano un successo |
L’invenzione sicura di sé è ciò che la maggior parte dei team chiama allucinazione. Gli altri cinque tipi possono verificarsi anche quando tutti i fatti sono corretti, ed è per questo che un controllo dei fatti da solo non li trova.
Che cosa deve coprire una policy di escalation per agenti AI
Una policy di escalation per agenti AI è l’insieme di regole scritte che stabilisce quando l’agente deve fermarsi e passare il caso a una persona. Indica i trigger, il passaggio stesso e come ogni caso viene verificato in seguito. Senza di essa l’escalation mancata non si può valutare, perché nessuno ha definito che cosa l’agente avrebbe dovuto fare.
Una policy che funziona risponde a quattro domande:
- Quali richieste vanno sempre a una persona? Per esempio, un cliente che chiede di parlare con una persona, un reclamo che menziona un’azione legale o una richiesta che esce da ciò che l’agente è autorizzato a decidere.
- Quali segnali impongono un passaggio a metà conversazione? Per esempio, la stessa domanda posta due volte senza progressi, una frustrazione crescente o un cliente che sembra vulnerabile.
- Che cosa porta con sé il passaggio? La persona deve ricevere il contesto, così il cliente non deve ripetersi. La nostra guida all’escalation all’operatore umano spiega come valutare questo passaggio.
- Come si verifica ogni caso? Aggiunga “ha fatto escalation quando la policy lo richiedeva” come criterio nella sua scorecard per agenti AI e lo valuti sulle conversazioni che l’agente ha chiuso, non solo su quelle che ha passato.
Anche le conversazioni con escalation hanno bisogno di criteri propri. Come valutare un ticket con escalation spiega come attribuire ogni errore al punto in cui è stato generato.
Perché gli errori degli agenti AI si ripetono invece di disperdersi
Gli errori degli agenti AI si ripetono perché sono strutturali. Nascono dal prompt, dalla conoscenza recuperata, dal modello o dai guardrail, quindi la stessa debolezza produce lo stesso errore silenzioso ogni volta che le condizioni si ripresentano. Gli errori di un operatore sono in gran parte individuali e casuali: una giornata storta, una lettura sbagliata, una lacuna nella formazione di una persona.
Questo cambia la posta in gioco. Una policy inventata è una conversazione andata male. La stessa debolezza del prompt che genera quella policy inventata in ogni conversazione idonea per un mese è un rischio che cresce alla stessa velocità del deployment. Cambia anche la strategia di rilevamento: poiché gli errori sono sistematici, il campionamento è lo strumento sbagliato. Un campione del 2% è pensato per stimare un tasso casuale e mancherà spesso un errore che scatta solo in una condizione specifica, presente in una parte delle conversazioni. Bisogna guardarle tutte.
Come intercettare gli errori silenziosi che le metriche nascondono
Gli errori silenziosi sono invisibili alle metriche di volume e di risoluzione perché queste misurano la forma della conversazione, non il contenuto. Intercettarli significa leggere ciò che l’agente AI ha detto davvero, su larga scala, rispetto a criteri definiti, in ogni conversazione, e ricondurre ogni rilievo alle righe che lo hanno prodotto, così il responsabile può correggerne la causa.
Valuti il contenuto, non l’esito
In ogni conversazione verifichi ciò che un errore silenzioso compromette: ogni affermazione era vera, ogni policy era reale, la risoluzione dichiarata era autentica, l’agente ha fatto escalation quando doveva. Sono i criteri di una scorecard per agenti AI, e sono proprio quelli a cui un log di instradamento non sa rispondere.
Copra tutto
Poiché gli errori sono sistematici, la copertura non è un optional. Valutare il 100% delle conversazioni (in inglese) è ciò che trasforma un errore silenzioso da incidente che prima o poi qualcuno nota a schema che lei vede nella settimana stessa in cui inizia. In UiPath, Kaizo ha automatizzato il 100% del QA con un ROI del 200% e un aumento dell’8% del punteggio di qualità, che è il livello di copertura a cui gli errori sistematici diventano visibili presto.
Lo veda sulle sue conversazioni. Kaizo valuta il 100% delle sue conversazioni di assistenza, comprese quelle gestite dal suo agente AI, secondo i suoi criteri. Prenoti una demo.
Trovi i tipi di errore per cui non ha ancora scritto criteri
Una scorecard intercetta solo gli errori a cui ha dato un nome, quindi cerchi quelli che non ha ancora nominato. Parta dalle conversazioni che l’agente AI ha segnato come risolte in cui il cliente è tornato per lo stesso problema, o in cui il tono è diventato negativo dopo la risposta dell’agente. Quando emerge uno schema nuovo, lo scriva come criterio e lo valuti da quel momento in poi.
Riconduca ogni rilievo alle righe esatte
Un errore silenzioso si può correggere solo quando qualcuno è in grado di indicarlo. Kaizo valuta il 100% delle conversazioni di operatori e agenti AI secondo la sua scorecard, chiama l’invenzione sicura di sé e la falsa risoluzione con il loro nome e riconduce ogni rilievo alle righe esatte che lo hanno prodotto. È questa tracciabilità che le permette di portare un errore silenzioso a chi gestisce il prompt e correggerlo davvero, invece di discutere se sia successo.
Quando una revisione completa degli errori silenziosi non fa per lei
Se il suo agente AI gestisce poche conversazioni a settimana, le legga tutte personalmente; non le serve un software per questo. Se non ha ancora criteri scritti, parta dalla scorecard per agenti AI prima di ogni altra cosa.
E se il suo bot si limita a indirizzare i clienti alla coda giusta senza rispondere, la maggior parte di questi tipi di errore non può verificarsi, e i suoi log di instradamento le diranno quasi tutto ciò che le serve.
Domande frequenti
Che cos’è un errore silenzioso in un agente AI?
Un errore silenzioso è un errore che non lascia traccia nelle metriche che lei osserva. La conversazione finisce, il ticket si chiude, il contenimento lo conta come una vittoria e il cliente se ne va con una risposta sbagliata o un’esigenza non risolta. È pericoloso perché tutti i sistemi di monitoraggio concordano che la conversazione è andata bene, quindi l’errore si accumula senza essere visto.
Quali sono i principali tipi di errori silenziosi degli agenti AI?
Invenzione sicura di sé (affermare fatti inventati), policy inventata (generare regole che non esistono), falsa risoluzione (dichiarare risolto un problema che non lo è), escalation mancata (gestire un caso che avrebbe dovuto passare a una persona), sconfinamento di perimetro (agire oltre la propria autorità) e risposta fluente alla domanda sbagliata. Nessuno di questi genera un errore di sistema o fa scattare un indicatore di risoluzione.
Perché il campionamento non intercetta gli errori silenziosi?
Perché gli errori degli agenti AI sono sistematici, non casuali. Una debolezza del prompt produce lo stesso errore ogni volta che le sue condizioni si ripresentano, spesso in una parte specifica delle conversazioni. Un piccolo campione casuale è pensato per stimare un tasso casuale e mancherà spesso un errore concentrato in condizioni che non ha campionato. È la copertura completa che fa emergere lo schema.
Un errore silenzioso è la stessa cosa di un’allucinazione?
No. L’allucinazione, o invenzione sicura di sé, è uno dei sei tipi. Un agente AI può anche inventare una policy, dichiarare una falsa risoluzione, non fare escalation, agire oltre la propria autorità o rispondere alla domanda sbagliata, a volte anche con tutti i fatti corretti. Un controllo dei fatti da solo trova solo una parte del problema.
Un tasso di contenimento alto significa che l’agente AI funziona?
Non da solo. Il contenimento conta una conversazione come una vittoria quando il cliente non ha raggiunto una persona, e una falsa risoluzione o un’escalation mancata hanno esattamente questo aspetto. Bisogna valutare ciò che l’agente ha detto per sapere se una conversazione contenuta è stata una buona conversazione.
Chi deve correggere un errore silenzioso una volta trovato?
Chi è responsabile della causa: il prompt, la conoscenza recuperata o i guardrail. Poiché gli errori degli agenti AI sono strutturali, il coaching non li corregge come corregge l’errore di una persona. Ogni rilievo deve ricondurre alle righe esatte della trascrizione, così il responsabile vede che cosa cambiare.
Termini correlati
- La scorecard per agenti AI
- Controllo qualità degli agenti AI e dei chatbot
- Tasso di contenimento: come misurarlo onestamente (in inglese)
- Quanto è accurato il controllo qualità con l’AI?
- Come valutare il 100% delle conversazioni (in inglese)
Trovi gli errori che la sua dashboard conta come successi
Porti un mese di conversazioni che il suo agente AI ha segnato come risolte. Le valuteremo secondo i suoi criteri, su ogni conversazione, e le mostreremo le invenzioni sicure di sé, le policy inventate e le false risoluzioni che il contenimento ha contato come successi. Ogni rilievo rimanda alle righe esatte della trascrizione, e i nostri insight sul customer care mostrano quali errori sono sistemici, così può portarli direttamente a chi gestisce il prompt.