Vai al contenuto

Best practice

Controllo qualità degli agenti AI e dei chatbot

Controllo qualità degli agenti AI e dei chatbot: scheda di valutazione, 100% delle conversazioni valutate, punteggi legati alle prove ed errori tipici dell'AI.

· 7 min di lettura

Revisionato da Dominik Blattner, fondatore di Kaizo

In questa pagina

Il controllo qualità degli agenti AI parte da una scheda di valutazione che descrive una buona conversazione gestita dall’AI, e dalla valutazione automatica di ognuna di queste conversazioni. Mantenga il valutatore indipendente dall’AI che valuta e colleghi ogni punteggio alla trascrizione, così da poter correggere l’errore.

In sintesi

  • Il volume dell’AI è troppo alto per un campionamento manuale.
  • Cerchi informazioni sbagliate, escalation mancate, allucinazioni e risposte dal tono sbagliato.
  • Riporti quanto emerso nei prompt, nei guardrail e nel routing.
  • Rivaluti dopo la correzione per confermare che regge.

Passo 1: definire che cosa significa “buono” per un agente AI

Gli agenti AI sbagliano in modo diverso dalle persone, quindi una scheda di valutazione pensata per gli operatori e trasferita così com’è non coglierà proprio gli aspetti più importanti. Inizi mettendo per iscritto com’è, per la sua azienda, una buona conversazione gestita dall’AI, con criteri che una macchina possa giudicare partendo da una trascrizione.

Costruire i criteri attorno agli errori tipici dell’AI

Una buona scheda di valutazione per l’AI copre i comportamenti che fanno perdere fiducia quando un agente li sbaglia:

  • Correttezza delle informazioni: l’agente ha dato informazioni corrette, o si è inventato una policy, un prezzo o un passaggio che non esiste?
  • Risoluzione: ha davvero risolto il problema del cliente, o ha solo chiuso il ticket?
  • Escalation corretta: ha passato la conversazione a un operatore al momento giusto, e non troppo tardi?
  • Tono ed empatia: si è adattato allo stato d’animo del cliente invece di restare robotico?
  • Rispetto di policy e sicurezza: è rimasto entro i limiti che lei ha fissato, rifiutando ciò che doveva rifiutare?

Rendere ogni criterio verificabile con le prove

Scriva i criteri in modo che un esito positivo o negativo si possa ricondurre a una riga precisa della conversazione. Kaizo le permette di costruire la scheda di valutazione che la sua azienda usa davvero e giudica ogni conversazione in base a essa, come farebbe il suo valutatore migliore: così il controllo qualità dell’AI e quello degli operatori restano su un unico standard confrontabile.

Passo 2: valutare il 100% delle conversazioni dell’AI, non un campione

Il QA manuale campiona dal 2% al 5% dei ticket, perché una persona può leggerne solo un certo numero. Con gli agenti AI quel limite diventa insostenibile: lavorano su volumi che nessun team di valutazione può campionare in modo significativo, e un errore raro ma dannoso si troverà quasi sempre nel 95% che nessuno legge.

Automatizzare la valutazione

Colleghi l’helpdesk o il CRM in cui si trovano già le sue conversazioni, poi lasci che il sistema valuti ogni interazione gestita dall’AI appena arriva, in modo continuo e in background. Kaizo si integra in modo nativo con Zendesk e Salesforce e legge le conversazioni direttamente dai sistemi che lei già usa, quindi non c’è una pipeline separata da mantenere. Prenoti una demo per vederlo sulle sue conversazioni.

Perché la copertura completa conta di più per l’AI

Un singolo agente applica lo stesso comportamento a migliaia di conversazioni, quindi un difetto sistematico, una policy interpretata male o un’impostazione predefinita sbagliata, si ripete su larga scala. Valutare il 100% è ciò che fa emergere presto quello schema. In UiPath, Kaizo ha automatizzato il 100% del QA con un ROI del 200%: è il livello di copertura che oggi richiedono i volumi gestiti dall’AI.

Passo 3: mantenere il valutatore indipendente

È il passo che la maggior parte dei team salta, ed è quello che decide se ci si può fidare del controllo qualità dell’AI. Non lasci che il team che ha costruito un agente AI sia l’unico a valutarlo. Un team giudicato in base a quanto l’agente sembra buono non è il giudice migliore per dire se lo è davvero.

Sono le prove a rendere credibile il punteggio

Il valutatore deve applicare la stessa scheda di valutazione sia che la conversazione sia stata gestita da una persona, dal suo bot o dall’AI di un altro fornitore. Kaizo valuta il 100% delle conversazioni di operatori e agenti AI in base alla scheda di valutazione della sua azienda, e ogni punteggio rimanda alle prove nella conversazione: il giudizio su un agente si può quindi verificare, invece di prenderlo sulla fiducia.

Che cosa chiedere a un fornitore di QA

  • Potete valutare un agente AI costruito da qualcun altro con la stessa scheda di valutazione che usiamo noi?
  • Ogni punteggio rimanda alle prove, così da poter verificare il vostro giudizio invece di prenderlo sulla fiducia?

Passo 4: intercettare gli errori tipici dell’AI

Una volta che la valutazione copre ogni conversazione, la orienti verso gli errori propri dell’automazione, o che l’automazione amplifica. Sono queste le categorie che vale la pena isolare e seguire nel tempo.

Tipo di erroreCome si presentaChe cosa verifica la scheda di valutazione
Informazione sbagliataL’agente indica una policy, un prezzo o un passaggio falsoOgni affermazione fattuale era corretta e basata sulle sue fonti?
Escalation mancataL’agente continua a gestire un caso che avrebbe dovuto passare a un operatoreHa fatto escalation al trigger giusto e in tempo?
Sicurezza allucinataUna risposta sbagliata data come se fosse certaL’agente ha evitato di inventare dettagli che non poteva verificare?
Tono sbagliatoLinguaggio robotico o sbrigativo con un cliente frustratoIl tono era adatto allo stato d’animo del cliente?
Violazione di policyL’agente fa qualcosa che avrebbe dovuto rifiutareÈ rimasto entro i suoi limiti di sicurezza e di policy?

Passo 5: riportare quanto emerso e rivalutare

Il controllo qualità ha senso solo se cambia i comportamenti. Poiché ogni punteggio di Kaizo rimanda al momento esatto della trascrizione che lo ha generato, un errore non è solo una segnalazione: è un esempio specifico e riproducibile su cui intervenire.

Chiudere il ciclo

  • Riporti gli errori di correttezza al prompt, alla knowledge base o alla fonte che ha prodotto la risposta sbagliata.
  • Trasformi le escalation mancate in una regola di routing o in un trigger più stringente.
  • Raggruppi gli errori ricorrenti per correggere lo schema una volta sola, invece di rattoppare i casi uno per uno.

Poi rivaluti per confermare che la correzione regge. Una copertura completa e continua le mostra l’effetto di una modifica su tutte le conversazioni, non su un campione che potrebbe non vedere la regressione.

Errori comuni da evitare

Alcuni errori indeboliscono in silenzio i programmi di controllo qualità dell’AI prima ancora che portino valore.

  • Campionare l’AI come si campionavano gli operatori: un campione del 2% di un bot ad alto volume non coglie gli errori sistematici quasi per definizione.
  • Lasciare che sia solo il team che ha costruito l’agente a valutarlo: senza un valutatore indipendente, un bel punteggio non equivale a un buon lavoro.
  • Valutare senza prove: un numero che non si può ricondurre a una riga della trascrizione non si può verificare, usare per il coaching o contestare.
  • Riutilizzare la scheda degli operatori senza modifiche: errori tipici dell’AI come le allucinazioni e la falsa sicurezza richiedono criteri propri.
  • Misurare senza mai riportare i risultati: un QA che non cambia prompt, guardrail o routing è solo reportistica.

Domande frequenti

Come si fa il controllo qualità di un agente AI o di un chatbot?

Costruisca una scheda di valutazione che descriva una buona conversazione gestita dall’AI, con correttezza, risoluzione, escalation corretta, tono e rispetto delle policy. Valuti in automatico il 100% delle conversazioni dell’AI in base a essa, mantenga il valutatore indipendente dall’AI valutata e colleghi ogni punteggio alle prove nella trascrizione, così che gli errori si possano verificare e correggere.

Perché il valutatore deve essere indipendente dall’agente AI?

Se le uniche persone che valutano un agente AI sono quelle che lo hanno costruito, hanno un incentivo a farlo sembrare buono. Un valutatore che collega ogni punteggio alle prove nella conversazione è ciò che rende credibile il punteggio, perché chiunque può verificarlo.

Possiamo usare la stessa scheda di valutazione per agenti AI e operatori?

Può condividere i criteri validi per entrambi, come la risoluzione e il tono, così il controllo qualità dell’AI e quello degli operatori restano confrontabili. L’AI però richiede criteri in più per i suoi errori tipici, come le allucinazioni e la falsa sicurezza: l’approccio più solido è un unico standard con verifiche specifiche per l’AI.

Quali sono gli errori più comuni di un agente AI?

Le cinque categorie da seguire sono informazione sbagliata, escalation mancata, sicurezza allucinata, tono sbagliato e violazione di policy. Ognuna ha un proprio criterio nella scheda di valutazione, così l’errore si può isolare, ricondurre alla trascrizione e seguire nel tempo.

Quante conversazioni dell’AI vanno sottoposte a controllo qualità?

Tutte. L’AI lavora su volumi che nessun team può campionare in modo significativo, e un difetto sistematico si ripete in ogni conversazione gestita dall’agente, quindi un piccolo campione di solito non lo intercetta. La valutazione automatica del 100% delle conversazioni è ciò che fa emergere presto questi schemi.

Termini correlati

In questa pagina

Lo veda sulle sue conversazioni

Valuteremo un campione dei suoi ticket reali secondo i suoi standard, così l'esempio è il suo.

Scelto da team di assistenza clienti in tutto il mondo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart