Nel controllo qualità manuale i revisori valutano a mano un piccolo campione di conversazioni. Nel controllo qualità automatico (Auto QA) gli stessi criteri vengono applicati a ogni conversazione, senza stanchezza né scostamenti, mentre le persone continuano a definire lo standard e a prendere le decisioni soggettive.
In breve
- Il QA manuale costa ore di revisione, e quelle ore crescono con il volume.
- Con l’Auto QA il feedback arriva in giornata, non settimane dopo.
- Un programma completamente nuovo va avviato a mano, perché una macchina non può definire lo standard.
Che cosa significano davvero QA manuale e QA automatico
Il QA manuale è il modello tradizionale. Un revisore, spesso un analista QA dedicato o un team leader che ha il QA tra le proprie responsabilità, apre una conversazione, la legge o la ascolta dall’inizio alla fine e la valuta in base a una scheda di valutazione. Poiché una revisione accurata richiede parecchio tempo, viene valutato solo un campione di conversazioni, di solito scelto a caso o con una regola semplice, come un numero fisso per operatore al mese.
L’Auto QA prende la stessa scheda di valutazione e la applica tramite software. Ogni conversazione viene valutata sugli stessi criteri senza che una persona debba aprirla, e ogni punteggio è collegato all’evidenza nella trascrizione che lo ha prodotto. Invece di un campione, ottiene l’intera popolazione valutata e, invece di una coda di revisioni, il suo team ha una coda di eccezioni che vale la pena guardare.
Conviene essere precisi su che cosa si sta confrontando. I due approcci condividono gli stessi criteri, la stessa definizione di qualità e lo stesso obiettivo di coaching. Cambia chi valuta, quanta parte del lavoro viene valutata, con quale coerenza, con quale rapidità e a quale costo. Tutto ciò che segue confronta queste cinque cose con onestà, compresi i punti in cui l’approccio manuale vince davvero.
Controllo qualità manuale vs automatico in sintesi
Ecco il confronto diretto sulle dimensioni che cambiano davvero il rendimento di un programma di QA. Se ha solo un minuto, legga prima l’ultima colonna: riporta la conseguenza pratica, non la teoria.
| Dimensione | QA manuale | Auto QA | Che cosa significa nella pratica |
|---|---|---|---|
| Voce di costo | Ore dei revisori a costo pieno, che crescono con il volume | Costo del software, quasi fisso al crescere del volume | Il costo manuale cresce con l’azienda, quello automatico per lo più no |
| Copertura | Un campione, spesso una percentuale bassa a una cifra | Ogni conversazione | Un campione non dice nulla delle conversazioni che nessuno ha letto |
| Coerenza | Varia in base al revisore, all’umore, al carico di lavoro e al mese | Gli stessi criteri applicati ogni volta | L’automazione elimina gli scostamenti tra valutatori, una fonte reale di punteggi ingiusti |
| Accuratezza sui criteri oggettivi | Alta ma lenta | Alta e ripetibile | Controlli di processo, di policy e sui fatti sono il punto di forza dell’automazione |
| Accuratezza sulle sfumature soggettive | Migliore, soprattutto sui rari casi limite | Media, migliora con la calibrazione | Lasci alle persone le decisioni che richiedono davvero giudizio |
| Tempo fino al feedback | Da giorni a settimane dopo la conversazione | In giornata | Il coaching arriva mentre l’operatore ricorda ancora l’interazione |
| Scalabilità | Più copertura richiede più revisori | La copertura non dipende dall’organico | I picchi di volume mandano in crisi il QA manuale e sfiorano appena quello automatico |
| Definizione dello standard | Solo persone | Solo persone | Una macchina può applicare uno standard, non può decidere che cosa sia un buon lavoro |
Costi: contare le ore dei revisori, non il prezzo delle licenze
L’errore più comune in questo confronto è mettere il prezzo di un software contro zero. Il QA manuale non è gratuito. Si paga in ore dei revisori, di solito nascoste negli stipendi dei team leader, per cui nessuno ci mette mai un numero sopra. Ci metta un numero e il confronto diventa semplice.
Un modello di costo da applicare ai suoi numeri
Non si fidi del benchmark di nessuno, nemmeno del nostro. Usi i suoi dati:
- Passo 1, ore di revisione al mese: numero di operatori, moltiplicato per le valutazioni per operatore al mese, moltiplicato per i minuti medi per valutazione, diviso per 60.
- Passo 2, aggiunga il lavoro attorno alle revisioni: sommi le ore che il suo team dedica davvero alle sessioni di calibrazione, alle contestazioni dei punteggi, alla preparazione dei report e alla ricerca dei campioni. Le misuri, non le stimi, perché di solito sono più di quanto si pensi.
- Passo 3, converta in denaro: moltiplichi le ore totali per il suo costo orario pieno delle persone che fanno le revisioni. Costo pieno significa stipendio più contributi a carico dell’azienda più costi generali, non lo stipendio base diviso per 2.080.
- Passo 4, dia un prezzo alla copertura che le manca: ripeta il passo 1 sostituendo le valutazioni per operatore con le conversazioni gestite per operatore. È il costo di valutare tutto a mano. Per la maggior parte dei team il numero è assurdo, ed è proprio questo il punto.
Due precisazioni oneste. Primo, anche l’Auto QA ha un costo: il software, più il tempo delle persone per configurare la scheda di valutazione e calibrarla, più il tempo continuo per approfondire ciò che fa emergere. Li includa, altrimenti il confronto non è equo. Secondo, le ore dei revisori che libera non spariscono dal libro paga. Vengono reinvestite nel coaching e nell’analisi delle cause radice. Il risparmio è reale, ma si vede come capacità e risultati, non come un team più piccolo, e qualsiasi business case che prometta il contrario sta vendendo troppo.
Non pubblichiamo qui un costo di riferimento per valutazione né uno stipendio tipico, perché questi numeri variano così tanto per area geografica, seniority e canale che citarne uno sarebbe fuorviante. La parte utile è il calcolo qui sopra.
Copertura: il divario che un campione non può colmare
È la dimensione in cui i due approcci sono meno confrontabili. Il QA manuale valuta un campione. L’Auto QA valuta l’intera popolazione. Tutto il resto è una differenza di grado; questa è una differenza di natura.
Il problema di un campione non è che sia impreciso sulle conversazioni che contiene. È che tace su quelle che restano fuori. Se i suoi revisori leggono una piccola percentuale delle interazioni, la stragrande maggioranza dell’esperienza dei suoi clienti ogni mese semplicemente non viene osservata. Escalation, violazioni delle policy, un nuovo tipo di errore in un’area di prodotto rilasciata la settimana scorsa: nulla di tutto questo è visibile, a meno che non finisca per caso nel campione. E i campioni sono raramente casuali quanto i team credono. I revisori scelgono ticket recenti, ticket brevi, ticket di operatori già sotto osservazione, e il quadro si distorce ancora di più.
C’è poi un problema statistico che chi difende il campionamento tende a saltare. Un campione va bene per stimare una media ampia, come il punteggio qualità complessivo di un team numeroso. È quasi inutile per le domande che si pongono davvero al QA, che sono specifiche: questo operatore sta migliorando, quel cambio di policy ha funzionato, quale tipo di errore sta crescendo. Divida un piccolo campione per operatore, per canale e per mese e le restano poche conversazioni per cella, troppo poche per concludere qualcosa sulle prestazioni di una persona.
La copertura completa sposta la domanda da “che cosa abbiamo visto” a “che cosa sta succedendo”. In UiPath, Kaizo ha automatizzato il 100% del QA, con un ROI del 200% e un aumento dell’8% del punteggio qualità: il tipo di risultato che diventa possibile solo quando viene valutata ogni conversazione, e non una fetta.
Coerenza: scostamenti dei revisori contro gli stessi criteri ogni volta
Il QA manuale ha un problema di equità di cui si parla raramente in modo aperto, perché nominarlo sembra una critica ai revisori. Non è colpa loro. È ciò che succede a qualsiasi persona che applica criteri soggettivi centinaia di volte.
I tre modi in cui i punteggi manuali si spostano
- Tra revisori: due persone valutano diversamente la stessa conversazione. È esattamente il motivo per cui esistono le sessioni di calibrazione, e il fatto stesso che servano ne è la prova.
- Nello stesso revisore nel tempo: la stessa persona è più severa all’inizio di un blocco di revisioni che alla fine, e valuta diversamente in un martedì tranquillo rispetto a un periodo di arretrati. La stanchezza è reale e sposta i punteggi.
- Nell’intero programma: gli standard si spostano man mano che i revisori arrivano e se ne vanno, che i criteri vengono reinterpretati e che si accumulano precedenti informali mai messi per iscritto. Dopo due anni, i punteggi significano qualcosa di diverso rispetto al lancio.
L’automazione non ha questi difetti. Applica gli stessi identici criteri alla conversazione numero uno e alla numero quattrocentomila, con lo stesso standard, senza memoria dell’ultimo punteggio assegnato. Per questo un andamento dei punteggi prodotto da un sistema automatico è affidabile in un modo in cui spesso un andamento manuale non lo è: quando il numero si muove, è cambiato il comportamento, non l’umore del revisore.
Per onestà va aggiunto che coerenza non significa correttezza. Una macchina che applica un criterio scritto male lo applicherà male a tutto, in modo coerente. È un argomento per investire nei criteri e calibrarli, non per accettare gli scostamenti.
Accuratezza: dove ciascun approccio vince davvero
L’accuratezza è la dimensione su cui si discute di più e che si capisce di meno, quindi vale la pena essere diretti sulla divisione.
L’automazione è più forte sui criteri che si possono verificare con le evidenze della trascrizione. L’operatore ha verificato l’identità? Sono state fornite le informative obbligatorie? L’informazione era corretta rispetto alla knowledge base? Il ricontatto promesso è stato davvero programmato? Questi criteri sono la maggior parte di quasi tutte le schede di valutazione reali, e sono controlli in cui una macchina che legge l’intera conversazione supera una persona che la scorre alla fine di un lungo blocco di revisioni.
Le persone sono migliori dove serve davvero giudizio. Quelle scuse erano sincere o di circostanza? Il vero problema del cliente era diverso da quello che ha descritto? Questo caso limite andava portato in escalation, considerando tutto ciò che stava succedendo con quell’account? Sono anche i criteri su cui i revisori umani sono più in disaccordo tra loro, ed è questa la ragione onesta per cui sono difficili, non una critica all’automazione.
La conseguenza pratica è pesare la sua valutazione nel modo in cui è davvero ponderata la sua scheda. Giudicare un sistema automatico solo sul suo criterio soggettivo più difficile, quando quel criterio è una piccola parte del totale, dice molto poco. Trattiamo l’accuratezza in modo approfondito in una pagina dedicata, incluso come misurare la concordanza sulle sue conversazioni invece di fidarsi delle promesse di qualcuno: quanto è accurato il controllo qualità con l’AI. In breve: l’accuratezza si misura rispetto a uno standard umano calibrato, non si accetta sulla fiducia, e ogni punteggio deve rimandare all’evidenza che lo ha prodotto, così che lei possa verificarlo.
La domanda da porsi prima di credere a un punteggio automatico
La domanda è se lei è in grado di dimostrare che è giusto. Chieda tre cose: ogni punteggio ricondotto alle righe precise della trascrizione che lo hanno prodotto, un percorso con cui l’operatore può contestare un punteggio e una persona può ribaltarlo, e un test del valutatore automatico su conversazioni che i suoi revisori hanno già valutato e su cui concordano, così da vedere il tasso di concordanza criterio per criterio prima che qualcuno venga misurato in base a esso. Il QA manuale non ha nulla di equivalente a quest’ultimo test, ed è bene notarlo: nessuno valida un revisore umano rispetto a un set di riferimento.
Velocità del feedback e scalabilità
Queste due ricevono meno attenzione di costi e copertura, eppure cambiano l’esperienza quotidiana di un programma di QA più di entrambi.
Velocità: il coaching arriva in tempo, oppure no
In un programma manuale il ciclo è lungo. La conversazione avviene, aspetta in coda, viene estratta nel campione a fine ciclo, viene revisionata e poi discussa in un colloquio individuale. A quel punto l’operatore potrebbe non ricordare l’interazione e, se la ricorda, ha già ripetuto lo stesso comportamento molte volte. Un feedback che arriva con settimane di ritardo è un documento di conformità, non coaching.
Con la valutazione automatica, una conversazione riceve il punteggio appena viene chiusa. Un comportamento che emerge lunedì può essere affrontato nel coaching lunedì stesso, e l’operatore può vedere i propri punteggi strada facendo invece di avere sorprese al momento della valutazione. Si accorcia la distanza tra comportamento e correzione, che è l’intero meccanismo con cui il QA migliora qualcosa.
Scalabilità: la trappola lineare
Il QA manuale scala in modo lineare. Se il volume delle conversazioni raddoppia, servono il doppio delle ore di revisione per mantenere la stessa copertura. In pratica nessuno raddoppia i revisori, quindi la copertura si dimezza senza che nessuno se ne accorga e il programma si indebolisce in silenzio mentre l’azienda cresce. I picchi stagionali peggiorano le cose: proprio quando il rischio per la qualità è più alto, i revisori vengono spostati sulla coda e il QA è la prima cosa che salta.
La copertura automatica non dipende dall’organico. Il volume può triplicare e ogni conversazione continua a essere valutata. Questa differenza strutturale spiega perché i team che superano una certa dimensione tendono ad arrivare alla stessa conclusione, e il tema è approfondito nella nostra guida al controllo qualità automatico.
Quando il QA manuale resta la scelta giusta
Un confronto equo deve includere i casi in cui l’approccio manuale non è solo accettabile, ma corretto. Ce ne sono diversi.
- Sta avviando un programma di QA da zero. Non si può automatizzare uno standard che non è ancora stato definito. La revisione manuale è il modo in cui un team scopre che cosa significa davvero un buon lavoro nel proprio contesto, quali criteri contano e quali sembrano importanti ma non cambiano mai un risultato. Legga abbastanza conversazioni a mano e i criteri si scrivono da soli. Salti questo passaggio e finirà per automatizzare l’opinione di qualcun altro. La nostra guida per costruire un programma di qualità parte da qui proprio per questo motivo.
- La posta in gioco del singolo caso è molto alta. Decisioni regolamentate, reclami con esposizione legale, escalation di account di alto valore. Meritano la lettura di una persona, qualunque sia il punteggio assegnato da un sistema.
- Sta calibrando. La calibrazione è manuale per natura: persone che leggono le stesse conversazioni e discutono finché non sono d’accordo. Questo lavoro non sparisce quando si automatizza; diventa più importante, perché lo standard concordato è il riferimento rispetto a cui si misura l’automazione.
- Qualcosa non torna e deve capire perché. Un punteggio dice che cosa è successo. Capire perché di solito richiede una persona che legga la conversazione e il contesto attorno. L’automazione è molto brava a indicare le conversazioni giuste e non sostituisce la loro lettura.
- Il suo volume è davvero ridotto. Se un team riesce onestamente a revisionare a mano una parte consistente delle proprie conversazioni, l’argomento della copertura quasi scompare, e coerenza e velocità restano gli unici motivi per automatizzare.
Se dopo aver letto tutto questo conclude di voler mantenere una quota significativa di revisione manuale, è una posizione difendibile. L’errore non è mantenere il QA manuale. L’errore è affidarsi a esso per una copertura che non può garantire.
La conclusione onesta: una divisione del lavoro
Porre la questione in termini di sostituzione porta a una risposta sbagliata in entrambe le direzioni. O i team difendono il QA manuale da una minaccia che non è davvero tale, oppure automatizzano e perdono, senza accorgersene, il giudizio umano che rendeva credibile il programma.
Il modello che funziona è una divisione del lavoro secondo ciò in cui ciascuna parte è davvero brava:
- Le macchine valutano. Ogni conversazione, gli stessi criteri, in giornata, con ogni punteggio ricondotto all’evidenza. È lavoro di volume con un requisito di coerenza, cioè la definizione stessa di un compito da automatizzare.
- Le persone calibrano. Decidono che cosa sia un buon lavoro, scrivono e affinano i criteri, concordano lo standard di riferimento e risolvono le contestazioni. Nessun sistema può farlo e nessuno dovrebbe provarci.
- Le persone indagano. L’automazione fa emergere i valori anomali e i nuovi andamenti. Le persone vanno a capirli, ed è da lì che nascono le cause radice e le correzioni ai processi.
- Le persone fanno coaching. Lo scopo del QA non è mai stato il punteggio. È la conversazione che segue, e in qualunque versione di questo modello è un lavoro umano.
In pratica, il cambiamento riguarda dove va il tempo dei revisori. In un programma manuale la maggior parte se ne va nella valutazione, e quel che resta va al coaching. Automatizzi la valutazione e il rapporto si inverte. Lo stesso team dedica le proprie ore al lavoro che cambia il comportamento degli operatori, che è il risultato per cui il programma è stato finanziato fin dall’inizio. Kaizo è costruita per questa divisione, e costruita per essere verificata. Ogni punteggio rimanda all’evidenza esatta che lo ha prodotto, qualsiasi punteggio può essere contestato e ribaltato da una persona, e lei può testare il valutatore automatico su conversazioni che i suoi revisori hanno già valutato per vedere quanto concorda prima di farci affidamento. Applica la scheda di valutazione definita dal suo team a ogni conversazione, non a un campione scelto, così nessuno finisce sotto la lente solo per una regola di campionamento. Valuta con lo stesso standard il lavoro gestito dall’AI e quello gestito dagli operatori. È nativa in Zendesk e Salesforce, quindi la valutazione avviene dove il lavoro si svolge già.
Se è più all’inizio del percorso, parta dai fondamenti del controllo qualità nel customer care e metta a punto lo standard prima di estenderlo. Automatizzare criteri di cui nessuno si fida produce solo, più in fretta, punteggi di cui nessuno si fida.
Domande frequenti
Qual è la differenza tra QA manuale e Auto QA?
Il QA manuale è un revisore umano che valuta un campione di conversazioni in base a criteri definiti. L’Auto QA è un software che applica gli stessi criteri a ogni conversazione, in automatico. Criteri e obiettivo sono gli stessi; cambiano la copertura, la coerenza, il costo e la velocità con cui il feedback arriva all’operatore.
L’Auto QA costa meno del QA manuale?
Dipende dal suo volume, e il confronto funziona solo se si contano le ore dei revisori a costo pieno invece del prezzo delle licenze. I costi del QA manuale crescono in modo lineare con il volume delle conversazioni e con l’organico, mentre la copertura automatica resta sostanzialmente stabile mentre lei cresce. Faccia il calcolo sui suoi numeri: operatori moltiplicati per le valutazioni, moltiplicati per i minuti per valutazione, diviso per 60, poi moltiplicato per il suo costo orario pieno.
L’Auto QA è più accurato di un revisore umano?
È più coerente, e più accurato sui criteri oggettivi verificabili con le evidenze, come il rispetto delle procedure e la correttezza delle informazioni. I revisori umani restano migliori nelle decisioni rare e molto soggettive, che sono anche i criteri su cui le persone sono più in disaccordo tra loro. Il confronto più utile non riguarda l’accuratezza sulla singola conversazione, ma l’accuratezza sull’intera operatività, dove la copertura completa batte un campione accurato.
L’Auto QA sostituisce gli analisti QA?
No. Sostituisce la valutazione manuale di migliaia di conversazioni, non l’analista. Il ruolo passa dal leggere e assegnare punteggi al calibrare lo standard, approfondire ciò che il sistema fa emergere, risolvere le contestazioni e fare coaching, che è la parte di maggior valore del lavoro e quella che cambia davvero il comportamento degli operatori.
Un piccolo team di assistenza dovrebbe automatizzare il QA?
Se il suo team riesce onestamente a revisionare a mano una parte consistente delle proprie conversazioni, l’argomento della copertura è più debole, e i motivi per automatizzare diventano la coerenza e la velocità del feedback. Anche i team piccoli traggono vantaggio dall’eliminare gli scostamenti tra revisori e dall’avere punteggi in giornata, ma il ritorno è meno marcato rispetto ai team in cui la revisione manuale può raggiungere solo un piccolo campione.
Si possono usare insieme QA manuale e Auto QA?
Sì, ed è il modello a cui arriva la maggior parte dei programmi maturi. L’automazione valuta ogni conversazione e segnala le eccezioni, mentre le persone calibrano lo standard, revisionano a mano i casi ambigui e ad alto rischio e conducono il coaching. Mantenere la revisione manuale non è un’automazione mancata; è il punto in cui il giudizio umano vale di più.
Termini correlati
- Che cos’è l’Auto QA? (in inglese)
- Controllo qualità automatico: guida al QA con l’AI
- Quanto è accurato il controllo qualità con l’AI?
- Che cos’è la copertura QA del 100%? (in inglese)
- Che cos’è la calibrazione del QA?
- Scheda di valutazione QA: struttura, esempi e modello
Verifichi il valutatore sulle sue conversazioni
Porti la sua scheda di valutazione attuale, un mese di conversazioni reali e quelle che i suoi revisori hanno già valutato. Le mostreremo quanto la valutazione automatica concorda con il suo standard, criterio per criterio, con ogni punteggio ricondotto all’evidenza esatta nella trascrizione.
Prenota una demo Scopri l'Agentic Auto QA Confronta i software di QA