La ponderazione dei criteri di valutazione si basa su tre elementi: quanto l’errore danneggia il cliente, quanto rischio comporta per l’azienda e quanto dipende dall’operatore. Se non sa spiegare un peso, il punteggio non sopravvivrà alla prima contestazione.
In sintesi
- Dare a tutti i criteri lo stesso peso significa affermare che contano tutti allo stesso modo. Non è mai vero.
- Il controllo dell’operatore è il fattore che tutti dimenticano, ed è quello che gli operatori contestano di più.
- I criteri critici vanno trasformati in un errore bloccante che fa da sbarramento, non in una voce da 60 punti.
- Testi i nuovi pesi su conversazioni già valutate. Se nessuno cambia fascia, la modifica era solo cosmetica.
Perché i pesi uguali rompono una scheda di valutazione senza che nessuno se ne accorga
Quasi ogni scheda di valutazione QA parte con pesi uguali, perché sembra equo e non richiede riflessione. Non è né l’una né l’altra cosa. Il peso uguale è un’affermazione, e l’affermazione è che dimenticare il saluto costa all’azienda esattamente quanto elaborare il rimborso sbagliato.
Ne derivano tre conseguenze, e arrivano in quest’ordine.
Il punteggio smette di distinguere. Quando dieci criteri valgono dieci punti ciascuno, un errore grave e uno cosmetico costano entrambi dieci. Due operatori finiscono a 90, uno perché è stato sbrigativo e l’altro perché ha dato al cliente informazioni sbagliate sui suoi soldi. Un numero che non distingue questi due casi non sta misurando la qualità.
Gli operatori ottimizzano i criteri facili. Le persone reagiscono al tabellone che lei fornisce. Se tono e saluto sono i punti più facili da difendere e i più difficili da perdere, è lì che va l’impegno. Non è aggirare il sistema: è la scheda che funziona esattamente come è stata progettata.
Il punteggio si scollega dal business. Quando i punteggi di qualità smettono di seguire escalation, riaperture e insoddisfazione dei clienti, la direzione smette di usarli senza dirlo. Il programma continua, le revisioni continuano, e nessuno prende una decisione sulla base dei risultati. È la condizione in cui si trova davvero la maggior parte dei programmi di QA.
Una diagnosi rapida. Prenda i due operatori con i punteggi più alti del mese scorso e i due con i più bassi. Se non riesce a indicare una differenza reale nell’esperienza che hanno offerto ai clienti, i suoi pesi non contengono alcuna informazione. Prima di toccare i pesi, si assicuri che i criteri di base siano solidi, un lavoro a parte trattato in cosa sono i criteri di valutazione QA e come costruirli.
Da ricordare
Il peso uguale non è l’assenza di una decisione. È la decisione che ogni criterio conta allo stesso modo, presa per default e mai rivista.
I tre modelli di ponderazione, e quando usare ciascuno
Nella pratica si usano solo tre modelli. L’errore non è scegliere quello sbagliato, ma sceglierne uno per caso e non rivederlo mai più.
| Modello | Come funziona | Adatto quando | Non funziona quando |
|---|---|---|---|
| Piatto | Ogni criterio vale gli stessi punti | Il programma è nuovo, ha meno di una decina di criteri e non sa ancora davvero cosa conta | Ha dati sui risultati e continua a ignorarli. Il modello piatto dovrebbe essere un punto di partenza, non di arrivo |
| Ponderato per impatto | I criteri valgono punti diversi in base all’impatto sul cliente e sull’azienda | Il programma è abbastanza maturo da avere evidenze, e i revisori sanno spiegare ogni peso | I pesi li decide chi alza di più la voce in riunione, e poi non vengono mai rivisti |
| Detrazione da un massimo | Ogni conversazione parte da 100 e perde punti a ogni errore, con la gravità che stabilisce la detrazione | La maggior parte delle conversazioni va bene e si cercano le eccezioni, oppure il lavoro è molto legato alla conformità | Non c’è un minimo, quindi una sola conversazione negativa scende molto sotto zero e distorce la media dell’operatore |
Come impostare la ponderazione dei criteri di valutazione sui dati e non sulle opinioni
Ponderi su tre fattori, in quest’ordine. Nulla di tutto questo è specifico del QA dell’assistenza clienti: il manuale del governo britannico sull’analisi multicriteri affronta lo stesso problema, valutare delle opzioni rispetto a dei criteri e poi pesare quei criteri, e il suo avvertimento principale è che i pesi incorporano il giudizio di valore, che qualcuno lo ammetta o no.
Impatto sul cliente. Quanto peggiora la giornata di questo cliente perché il criterio non è stato rispettato? Un’informazione sbagliata su un rimborso conta più di un saluto finale mancato, e di molto.
Rischio per l’azienda e rischio normativo. Quanto costa l’errore oltre questa singola conversazione? Tutto ciò che ha conseguenze legali, finanziarie o di protezione dei dati sta in cima, e una parte non dovrebbe nemmeno stare nell’insieme dei criteri pesati.
Controllo dell’operatore. È il fattore che viene saltato, ed è quello che gli operatori notano. Se un criterio dipende da un sistema interno lento, da una policy a cui l’operatore non può derogare o da un passaggio da un altro team, pesarlo molto punisce le persone per i suoi processi. Gli dia un peso basso, oppure corregga il processo e smetta di valutarlo.
I pesi incorporano il giudizio di valore, che qualcuno lo ammetta o no.
Parafrasi del manuale sull’analisi multicriteri del governo britannico
L’ora di analisi che fa quasi tutto il lavoro
Prenda tre mesi di conversazioni che ha già valutato. Per ogni criterio, le divida tra quelle in cui è stato rispettato e quelle in cui non lo è stato, poi confronti un risultato a valle tra i due gruppi. Il tasso di riapertura è la scelta migliore, perché è oggettivo ed è già nel suo helpdesk. Funzionano anche il tasso di escalation e l’insoddisfazione.
Quello che cerca è l’ampiezza della differenza. Un criterio il cui mancato rispetto sposta molto il tasso di riapertura si è guadagnato un peso. Un criterio il cui mancato rispetto non sposta nulla non se l’è guadagnato, e dovrebbe scendere nella scala o uscire del tutto dalla scheda.
Due avvertenze oneste. Si tratta di correlazione, non di causalità, quindi la usi per ordinare i criteri, non per calcolare punteggi esatti. E i criteri che falliscono molto raramente non producono un segnale leggibile, il che di solito indica che appartengono agli errori bloccanti e non all’insieme dei criteri pesati.
Consiglio
Usi il tasso di riapertura come variabile di risultato. È oggettivo, è già nel suo helpdesk e, a differenza della soddisfazione, non dipende da qualcuno che risponde a un sondaggio.
L’errore bloccante è uno sbarramento, non un peso elevato
Ecco l’errore di progettazione più comune in una scheda di valutazione. Un team decide che una violazione della protezione dei dati dei clienti (in inglese) è inaccettabile, quindi le assegna 60 dei 100 punti disponibili.
Non ottiene l’effetto sperato. Un operatore può violare la protezione dei dati e arrivare comunque a 40, e se il resto della scheda è generoso può chiudere il mese con una media rispettabile. Il comportamento che il team ha definito inaccettabile è, aritmeticamente, sopportabile.
Se un comportamento deve annullare l’interazione, deve essere uno sbarramento binario che azzera il punteggio, del tutto fuori dall’insieme dei criteri pesati. È a questo che serve un errore bloccante. Tre regole lo rendono utilizzabile:
- Pochi. Da tre a cinque. Una scheda con una dozzina di errori bloccanti è una scheda in cui tutto è critico, e quindi niente lo è.
- Inequivocabili. A un errore bloccante devono poter rispondere sì o no due revisori che non si sono mai parlati. “È stato scortese” non soddisfa questo requisito. “Ha comunicato i dati dell’account senza completare la verifica dell’identità” sì.
- Con un secondo revisore. Azzerare il punteggio di qualcuno è un atto serio, e farlo deve costare qualcosa al programma.
Una volta tolti gli errori bloccanti, è più facile ragionare sull’insieme dei criteri pesati, perché tutto ciò che resta è una questione di grado e non di natura.
Attenzione
Assegnare 60 punti su 100 a un criterio critico non lo rende un errore bloccante. L’operatore può non rispettarlo e prendere comunque 40, e con una scheda generosa chiudere il mese in modo accettabile. Se un comportamento deve annullare l’interazione, lo blocchi. Non gli dia un prezzo.
La scheda bimodale, e perché gli operatori smettono di crederci
C’è una situazione specifica che vale la pena nominare, perché è comune ed è fatale per la fiducia. Si verifica quando una scheda combina una lunga lista di errori bloccanti con detrazioni pesanti su tutto il resto. Gli operatori descrivono il risultato sempre allo stesso modo: ogni voce o azzera subito il punteggio o costa sedici punti, quindi in pratica gli unici esiti possibili sono il punteggio pieno o il disastro.
Guardi la sua distribuzione. Se i punteggi si concentrano in alto e in basso, con pochissimo in mezzo, la scheda ha smesso di misurare e ha iniziato a smistare. Ne derivano due cose. Obiettivi come il 95% diventano aritmeticamente irraggiungibili per chi gestisce una conversazione difficile, così chi si occupa dei ticket peggiori ottiene i punteggi peggiori. E poiché non c’è una via di mezzo, non c’è nulla verso cui orientare il coaching, solo una promozione o una punizione.
La soluzione è quasi sempre la stessa: meno errori bloccanti e detrazioni più piccole sui criteri che restano.
Come testare i nuovi pesi prima del rilascio
Non pubblichi mai una scheda con nuovi pesi direttamente in produzione. Prima faccia un test retroattivo: richiede un pomeriggio ed evita la maggior parte dei danni.
Prenda un campione di conversazioni già valutate con i vecchi pesi. Ricalcoli i punteggi con quelli nuovi. Non le rivaluti: sta testando l’aritmetica, non il giudizio. Poi confronti la distribuzione.
Tre letture possibili, e ognuna dice qualcosa di preciso.
- Quasi nessuno cambia fascia. La nuova ponderazione è cosmetica. Ha speso capitale politico per una modifica che non cambia nulla, e dovrebbe spingersi oltre oppure lasciar perdere.
- Quasi tutti cambiano fascia. Non ha corretto i pesi, ha cambiato lo standard. Può essere giusto, ma va annunciato come un nuovo standard e non introdotto come una semplice messa a punto, altrimenti perde il consenso del team.
- Alcuni cambiano, e sono le persone sbagliate. Questo è il caso utile. Se operatori che il suo team stima scendono di molto, i nuovi pesi esprimono un’idea di qualità che lei in realtà non condivide. Trovi il criterio che lo causa prima di andare avanti.
Poi organizzi una sessione di calibrazione (in inglese) sui nuovi pesi con tutto il gruppo dei revisori prima di pubblicare qualsiasi cosa. I pesi cambiano ciò su cui i revisori discutono, e lei vuole che quella discussione avvenga in una sala e non durante il colloquio individuale di un operatore. Se parte da una base standard, i modelli di scheda di valutazione QA (in inglese) sono una base ragionevole da ripesare, invece di partire da una pagina bianca.
La ponderazione quando la valutazione la fa l’AI
La valutazione automatica non cambia i principi descritti sopra. Cambia la posta in gioco quando sono sbagliati, in due modi precisi.
Gli errori smettono di essere occasionali e diventano sistematici. Con la revisione manuale sul campione del 3% che usa la maggior parte dei programmi, un criterio pesato male distorce una manciata di conversazioni al mese, e un buon revisore compensa senza dirlo. Con la copertura del 100% (in inglese), che rivela tendenze che un campionamento del 3% non potrebbe mai mostrare, lo stesso peso sbagliato viene applicato a ogni conversazione, in modo coerente, sempre nella stessa direzione. La coerenza è lo scopo dell’automazione, ed è proprio ciò che fa accumulare un errore di ponderazione.
Un peso è difendibile solo quanto la sua spiegazione. Un operatore a cui si dice che ha perso 30 punti chiederà quali 30, e perché. Se il sistema sa produrre solo un totale, i pesi non reggeranno il confronto con il team operativo, per quanto accuratamente li abbia impostati. Ogni detrazione deve indicare il criterio, citare il momento della conversazione che l’ha causata ed essere contestabile. È la differenza tra un punteggio e un verdetto, approfondita in come validare la valutazione QA con l’AI (in inglese).
Due accorgimenti pratici per la valutazione automatica:
- Usi detrazioni ampie e arrotondate. Multipli di cinque o di dieci. Pesi molto fini suggeriscono una precisione che il modello non ha, e invitano a discutere sulla differenza tra un errore da sette punti e uno da otto.
- Dia peso a ciò che un modello legge in modo affidabile. I criteri procedurali e fattuali vengono valutati con coerenza. I giudizi sul tono hanno più variabilità, quindi dia loro una quota minore del totale finché non avrà misurato l’accuratezza della valutazione QA con l’AI su quei criteri.
L’Auto QA di Kaizo applica i pesi della sua scheda di valutazione criterio per criterio e lascia la motivazione collegata alla conversazione, così una detrazione contestata può essere ricondotta allo scambio specifico che l’ha causata invece di essere discussa a memoria.
Quando ripesare, e quando lasciare tutto com’è
Ripesi secondo un calendario, non in risposta a una lamentela. Ogni trimestre, legato a un ciclo di calibrazione QA, è il ritmo che la maggior parte dei team riesce a sostenere. Tra un ciclo e l’altro, raccolga le lamentele invece di intervenire su ciascuna.
Quattro segnali che un peso è davvero scaduto:
- Un criterio viene rispettato in più del 95% circa dei casi per due trimestri di fila. Non distingue più tra gli operatori. O il comportamento è ormai universale, e allora festeggi e lo ritiri, oppure il criterio è troppo facile da soddisfare.
- Un cambiamento di policy o di prodotto ha spostato ciò che conta. Una nuova normativa, una nuova policy sui rimborsi, un nuovo canale.
- Il punteggio ha smesso di seguire i risultati. Ripeta l’analisi descritta prima in questa guida. Se le differenze si sono appiattite, i pesi sono superati.
- I revisori correggono sempre lo stesso criterio. Quando le persone compensano un peso senza dirlo, le stanno segnalando che è sbagliato.
Una regola conta più di tutte: versioni la scheda e non applichi mai i nuovi pesi retroattivamente ai punteggi storici. Il punteggio di marzo di un operatore è stato prodotto con le regole di marzo. Ricalcolarlo a luglio distrugge l’unica cosa su cui si basa un programma di QA, cioè che il numero avesse un significato nel momento in cui è stato dato. Conservi intatta la versione precedente, faccia partire la nuova da una data precisa e lo dica apertamente. È anche ciò che mantiene il suo punteggio di qualità interno confrontabile nel tempo, invece di farlo slittare in silenzio.
Domande frequenti
Quanti criteri dovrebbe avere una scheda di valutazione QA?
Da otto a quindici per la maggior parte dei team di assistenza. Sotto gli otto il punteggio è troppo generico per guidare il coaching. Sopra i quindici i revisori non riescono a tenere a mente tutti i criteri, l’accordo tra loro cala e le revisioni richiedono così tanto tempo che la copertura ne risente. Se servono più di quindici criteri, probabilmente servono due schede per due tipi di lavoro diversi, non una sola scheda lunga.
Ogni criterio dovrebbe avere lo stesso peso?
No. Il peso uguale afferma che ogni comportamento conta allo stesso modo, il che non è mai vero, e produce punteggi che non distinguono un errore grave da uno cosmetico. La ponderazione piatta è un punto di partenza ragionevole per un programma nuovo, senza ancora dati sui risultati, ma va sostituita non appena si possono ordinare i criteri in base al loro effetto su riaperture, escalation o insoddisfazione.
Qual è la differenza tra un peso e un errore bloccante?
Un peso dice quanto costa un errore. Un errore bloccante dice che la conversazione è nulla, indipendentemente da tutto il resto. Sono meccanismi diversi e non vanno usati l’uno al posto dell’altro. Assegnare 60 punti su 100 a un criterio critico è l’errore di progettazione più comune, perché un operatore può non rispettarlo e prendere comunque 40. Se un comportamento deve annullare l’interazione, va bloccato, non pesato.
Come impostiamo i pesi se non abbiamo ancora dati?
Ordini i criteri per impatto sul cliente e rischio insieme ai suoi revisori, li raggruppi in tre fasce (alta, media e bassa) e assegni valori in punti approssimativi alle fasce, non ai singoli criteri. Poi si impegni a rivederli dopo un trimestre, quando avrà abbastanza conversazioni valutate per confrontare i tassi di errore con le riaperture. Meglio approssimativo e rivedibile che preciso e inventato.
Ogni quanto dovrebbero cambiare i pesi della scheda di valutazione QA?
Al massimo una volta a trimestre, legati a un ciclo di calibrazione. Pesi che cambiano più spesso smettono di essere uno standard e diventano un bersaglio mobile, e gli operatori non riescono più a capire che aspetto abbia un buon lavoro. Versioni sempre la scheda quando i pesi cambiano, e non ricalcoli mai i punteggi storici con i nuovi pesi.
Termini correlati
- Cosa sono i criteri di valutazione QA e come costruirli
- Cos’è un errore bloccante e quando usarlo
- Come condurre una sessione di calibrazione QA (in inglese)
- Modelli di scheda di valutazione QA (in inglese)
- Come validare la valutazione QA con l’AI (in inglese)
I suoi pesi dietro ogni conversazione valutata
Porti la scheda di valutazione che usa oggi e un mese di conversazioni che ha già revisionato. Le mostreremo che cosa premiano davvero i suoi pesi attuali, e che cosa cambia quando ogni conversazione viene valutata allo stesso modo.