Vai al contenuto

Best practice

Accuratezza del controllo qualità AI: come misurarla

Accuratezza del controllo qualità AI: dove la valutazione automatica concorda con un revisore calibrato, dove fatica e come verificarla sui propri dati.

· 10 min di lettura

Revisionato da Dominik Blattner, fondatore di Kaizo

In questa pagina

L’accuratezza del controllo qualità con l’AI dipende dallo standard rispetto al quale la si calibra. Sui criteri oggettivi, come la verifica dell’identità o la correttezza delle informazioni, il QA con AI concorda con un revisore umano calibrato nella maggior parte dei casi, ed è più debole sui giudizi soggettivi, come l’empatia più sfumata. L’accuratezza è un numero che si misura sulle proprie conversazioni, non una promessa da accettare sulla fiducia.

In breve

  • L’accuratezza del QA con AI è il tasso di concordanza tra il punteggio automatico e un revisore umano calibrato che applica gli stessi criteri.
  • La valutazione automatica è più accurata sui criteri oggettivi, verificabili con le evidenze, e meno accurata sui giudizi soggettivi.
  • Il suo vero vantaggio sul controllo qualità manuale è la coerenza: gli stessi criteri applicati a ogni conversazione, senza stanchezza e senza deriva.
  • Ogni punteggio dovrebbe ricondurre alla trascrizione, così che ogni singolo risultato possa essere verificato, usato per il coaching o ribaltato.
  • Può misurare e migliorare l’accuratezza in autonomia con un set di riferimento, il confronto criterio per criterio e verifiche periodiche.

Che cosa significa davvero accuratezza nel QA con AI?

Nel QA con AI, accuratezza significa quanto il punteggio automatico concorda con un revisore umano calibrato che applica gli stessi criteri. Non esiste una verità universale sul fatto che una conversazione di assistenza sia andata bene, perché la qualità è definita dalle sue policy, dal suo tono e dalla sua definizione di problema risolto. L’accuratezza è la concordanza con il suo standard, ed è questo che la rende misurabile.

Questo cambio di prospettiva conta, perché non deve accettare un punteggio di QA con AI sulla fiducia. Si costruisce un set di riferimento (in inglese) di conversazioni che revisori esperti hanno già valutato e su cui si sono messi d’accordo, si fa girare il sistema automatico sulle stesse conversazioni e si misura il tasso di concordanza. Per i criteri superato o non superato si può andare oltre e misurare precisione e recall sugli errori bloccanti: tra le conversazioni segnalate dal sistema, quante una persona conferma come errori reali e, tra gli errori reali, quanti ne ha individuati.

Un sistema di QA con AI calibrato su uno standard umano e verificato nel tempo non è una scatola nera. È un metodo di valutazione di cui si può indicare l’accuratezza con un numero. Se sta ancora scegliendo uno strumento, la pagina sul software di controllo qualità automatico mostra come Kaizo lo applica a ogni conversazione, e la guida al controllo qualità automatico offre il quadro completo.

Dove l’accuratezza del controllo qualità AI è più alta?

La valutazione del QA con AI è più accurata sui criteri che si possono verificare con le evidenze presenti nella trascrizione. Più il criterio è chiaro e oggettivo, più alta è la concordanza con un revisore umano. Verifica dell’identità, passaggi e informative obbligatorie e correttezza delle informazioni rispetto alla sua knowledge base ottengono buoni risultati, e la maggior parte di una vera scheda di valutazione è fatta proprio di queste verifiche.

La tabella qui sotto mostra come cambia di solito la concordanza in base al tipo di criterio. Può vedere come questi criteri si combinano in una scheda di valutazione operativa.

Tipo di criterioEsempioQuanto è verificabileAccuratezza tipica
Oggettivo / binarioL’operatore ha verificato l’identità del cliente?Sì o no, visibile nella trascrizioneMolto alta
Rispetto del processoSono stati seguiti i passaggi e le informative obbligatorie?Verificabile rispetto a un processo definitoAlta
Correttezza delle informazioniL’informazione data era davvero corretta?Verificabile rispetto alla sua knowledge baseAlta, con una buona base di riferimento
RisoluzioneIl problema del cliente è stato davvero risolto?In gran parte deducibile dall’esitoDa moderata ad alta
Sfumature soggettiveL’empatia era sincera e al momento giusto?In parte una questione di giudizioModerata, migliora con la calibrazione

Dove il QA con AI è meno accurato, e come gestirlo?

Il QA con AI è meno accurato sui giudizi più soggettivi: se l’empatia è sembrata sincera, se una richiesta ambigua è stata interpretata correttamente, se un caso limite andava passato in escalation. Sono gli stessi giudizi su cui anche i revisori umani sono in disaccordo tra loro, ed è questo il vero motivo per cui sono difficili. Si gestiscono con la calibrazione, un percorso chiaro per le contestazioni e le evidenze dietro ogni punteggio.

La soluzione non è evitarli, ma calibrare

Le persone restano nel processo dove il loro giudizio vale di più. I revisori si mettono d’accordo su alcune conversazioni di riferimento, i criteri vengono resi più precisi perché l’intento sia inequivocabile e la valutazione automatica viene verificata rispetto a quello standard condiviso. I criteri soggettivi non raggiungeranno mai l’accuratezza di una verifica binaria, ma criteri calibrati e un percorso chiaro per le contestazioni (l’operatore può contestare un punteggio e una persona decide) li rendono equi e coerenti, che è ciò di cui i team hanno davvero bisogno.

È anche per questo che ogni punteggio dovrebbe ricondurre all’evidenza esatta che lo ha prodotto. Un numero che si può ricondurre a una riga della trascrizione può essere verificato, usato per il coaching o ribaltato. Un numero che non si può ricondurre a nulla è il punto in cui la fiducia nel QA con AI si incrina.

Perché la valutazione con AI è migliore del controllo qualità umano, anche con errori occasionali?

La valutazione del QA con AI è migliore del controllo qualità manuale, anche con errori occasionali, perché è coerente e copre ogni conversazione. Il controllo manuale viene spesso considerato il riferimento di accuratezza, ma la revisione umana ha due problemi di accuratezza propri: i revisori cambiano metro di giudizio nel tempo e non concordano tra loro, e possono leggere solo un piccolo campione. L’automazione elimina entrambi, quindi il quadro complessivo è più affidabile.

Deriva e incoerenza dei revisori

Due revisori valutano la stessa conversazione in modo diverso, e lo stesso revisore valuta in un modo il venerdì pomeriggio e in un altro il lunedì mattina. Gli standard slittano man mano che il team cambia. Una macchina applica esattamente gli stessi criteri a ogni conversazione, senza stanchezza e senza deriva. Quindi, anche se una singola persona a volte può cogliere qualcosa in più, il team umano nel suo insieme è meno coerente.

Il problema del campionamento

Un revisore perfettamente accurato che legge il 2% delle conversazioni continua a non sapere nulla dell’altro 98%. Gli errori più dannosi si nascondono nelle conversazioni che nessuno ha letto. Valutare automaticamente il 100% delle conversazioni (in inglese) è un altro tipo di accuratezza: accuratezza sull’intera operatività, non su un piccolo campione. Per UiPath, Kaizo ha automatizzato il 100% del QA con un ROI del 200% e un aumento dell’8% del punteggio di qualità. La copertura completa non è un fine in sé; è la condizione che elimina il bias di selezione, così che il numero di accuratezza che misura descriva la sua operatività e non le conversazioni che per caso sono state scelte.

Lo veda sulle sue conversazioni. Kaizo valuta il 100% delle sue conversazioni di assistenza con la sua scheda di valutazione, con le evidenze dietro ogni punteggio. Prenota una demo.

Come misurare e migliorare l’accuratezza del suo QA con AI?

Si misura l’accuratezza del QA con AI confrontando, criterio per criterio, i punteggi automatici con un set di riferimento che i suoi migliori revisori hanno già valutato e su cui si sono messi d’accordo. La si migliora soprattutto riscrivendo i criteri vaghi e poi ripetendo le verifiche periodicamente, così che l’accuratezza non vada alla deriva. Non deve fidarsi dell’accuratezza dichiarata da un fornitore: la misuri sulle sue conversazioni.

  • Costruisca un set di riferimento calibrato: chieda ai suoi migliori revisori di valutare un campione di conversazioni reali e di mettersi d’accordo sulle risposte.
  • Misuri la concordanza: faccia girare la valutazione automatica sullo stesso set e confronti criterio per criterio, così da sapere esattamente dove concorda e dove no.
  • Affini i criteri, non solo il modello: la maggior parte dei disaccordi nasce da un criterio vago. Lo riscriva in modo che una persona e una macchina lo leggano allo stesso modo.
  • Ripeta le verifiche nel tempo: rifaccia il confronto periodicamente, così che l’accuratezza non vada alla deriva in silenzio mentre il prodotto e le policy cambiano.
  • Pretenda la tracciabilità: ogni punteggio dovrebbe indicare le righe della trascrizione che lo hanno prodotto, così che ogni singolo risultato possa essere verificato o ribaltato, invece di diventare oggetto di discussione.

Per una versione passo per passo, veda il protocollo di una settimana per validare la valutazione del QA con AI (in inglese), oppure faccia girare prima i punteggi automatici accanto alle revisioni umane con lo shadow scoring (in inglese) prima di affidarsi a essi.

Kaizo valuta il 100% delle conversazioni di operatori e agenti AI con la scheda di valutazione che la sua azienda usa davvero, riconduce ogni punteggio all’evidenza nella trascrizione e le permette di testarlo sul suo set di riferimento finché non può indicare il suo tasso di concordanza. Un sistema di valutazione i cui punteggi non si possono verificare può solo chiederle di fidarsi del suo numero.

Quali sono gli errori più comuni nel giudicare l’accuratezza del QA con AI?

Gli errori più comuni sono usare come riferimento revisori che non concordano tra loro, giudicare solo sui criteri soggettivi, ignorare il campione su cui si basa il confronto e accettare punteggi privi di evidenze. Ognuno di questi fa sembrare il QA con AI più o meno accurato di quanto sia davvero sulle sue conversazioni, e il numero che indica smette di avere significato.

  • Confrontare il QA con AI con una persona non calibrata: se i suoi revisori non concordano tra loro, non sono un riferimento affidabile per l’accuratezza.
  • Giudicare l’accuratezza solo sui criteri soggettivi: la maggior parte di una scheda di valutazione è oggettiva, dove l’AI è più forte, quindi pesi la valutazione come sono davvero pesati i criteri.
  • Ignorare il campione su cui si giudica: un punteggio un po’ meno accurato su ogni conversazione dice molto di più sulla sua operatività di un punteggio perfetto su una fetta del 2% scelta da qualcuno.
  • Accettare punteggi senza evidenze: se un punteggio non rimanda alla trascrizione, non può verificarne l’accuratezza. Un punteggio che non si può verificare è un’opinione con un numero accanto.

Quando la valutazione con AI non fa per lei

La valutazione del QA con AI non è il primo passo giusto per ogni team. Se gestisce pochi ticket a settimana, un solo revisore può leggerli tutti e la copertura completa aggiunge poco. Se non ha ancora una scheda di valutazione, parta da lì, perché la valutazione automatica è accurata solo quanto i criteri che applica.

Scriva e calibri prima i criteri con i suoi revisori. E se le sue domande sulla qualità riguardano soprattutto casi rari e molto soggettivi, per quelli la revisione umana resta lo strumento migliore.

Quando sarà pronto a valutare ogni conversazione rispetto a uno standard calibrato, veda come lo fa in Kaizo il software di controllo qualità automatico, oppure prenoti una demo e lo faremo girare sulle sue conversazioni.

Domande frequenti

Quanto è accurata la valutazione del QA con AI?

Sui criteri oggettivi e verificabili con le evidenze, come il rispetto del processo e la correttezza delle informazioni, un sistema di QA con AI ben configurato concorda con un revisore umano calibrato nella grande maggioranza dei casi. L’accuratezza è più bassa sui giudizi soggettivi, come l’empatia più sfumata, ed è lì che la calibrazione umana resta nel processo. Il modo migliore per conoscere il proprio numero è misurare la concordanza su un set di conversazioni che i revisori hanno già valutato.

Possiamo fidarci dell’AI per valutare la qualità dell’assistenza clienti?

Sì, quando ogni punteggio rimanda alle evidenze nella trascrizione e ha verificato la sua concordanza con i suoi revisori calibrati. La verifica conta perché le permette di dimostrare se il sistema di valutazione ha ragione o torto sulle sue conversazioni, invece di accettarne la promessa sulla fiducia.

Il QA con AI è più accurato del controllo qualità umano?

È più coerente, e nella pratica questo lo rende più accurato sull’intera operatività. I revisori umani cambiano metro di giudizio nel tempo, non concordano tra loro e possono leggere solo un piccolo campione. L’AI applica gli stessi criteri al 100% delle conversazioni senza stanchezza, quindi individua i problemi sistematici che un campione manuale del 2% non vede. Le persone restano più perspicaci sui casi rari e molto soggettivi.

Come si calibra il QA con AI rispetto ai punteggi del controllo qualità umano?

I revisori valutano un set di riferimento di conversazioni e si mettono d’accordo sulle risposte, poi i punteggi automatici delle stesse conversazioni vengono confrontati criterio per criterio. Dove non concordano, di solito si riscrive il criterio in modo che una persona e una macchina lo leggano allo stesso modo. Il confronto viene ripetuto periodicamente perché i due restino allineati.

Il QA con AI sostituisce i revisori umani?

No. Sostituisce la valutazione manuale di migliaia di conversazioni, e questo libera i revisori umani per il lavoro che solo loro possono fare: calibrare lo standard, gestire le contestazioni e fare coaching sugli errori che il sistema fa emergere. Il modello corretto è l’AI per copertura e coerenza, le persone per calibrazione e giudizio.

Il QA con AI valuta le conversazioni degli agenti AI bene quanto quelle degli operatori?

Sì. Kaizo valuta il 100% delle conversazioni di operatori e agenti AI con la stessa scheda di valutazione, e ogni punteggio è ricondotto alle evidenze nella trascrizione. Così può misurare l’accuratezza allo stesso modo per entrambi, rispetto a un set di riferimento su cui i suoi revisori si sono messi d’accordo.

Termini correlati

In questa pagina

Lo veda sulle sue conversazioni

Valuteremo un campione dei suoi ticket reali secondo i suoi standard, così l'esempio è il suo.

Scelto da team di assistenza clienti in tutto il mondo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart