Bij kwaliteitsscore vs CSAT heeft geen van beide gelijk zolang je niet hebt gecontroleerd of ze over dezelfde gesprekken gaan, want meestal is dat niet zo. Als dat wel zo is, betekent een blijvend verschil dat je scorecard procesnaleving meet in plaats van het resultaat.
In het kort
- Een lage QA-score met een hoge CSAT betekent vaak dat de medewerker van het proces afweek om te helpen.
- Behandel dat als een bevinding over je beleid, niet als een coachingpunt.
- Escalaties, herhaalcontacten en terugbetalingen geven de doorslag, omdat het gedrag is.
- Een kwaliteitsscore die het nooit oneens is met CSAT, is overbodig.
Gaan de twee cijfers wel over dezelfde gesprekken?
Controleer dit voordat je iets diagnosticeert, want het is de meest voorkomende verklaring en bijna niemand controleert het.
Kijk hoe elk cijfer eigenlijk tot stand komt. CSAT komt van klanten die een enquête kregen en besloten die in te vullen, meestal een klein deel van de contacten. Je kwaliteitsscore komt uit gesprekken die een reviewer heeft geselecteerd, meestal zo’n 3% van het volume. Dat zijn twee onafhankelijke selectieprocessen over dezelfde maand, en de overlap tussen die twee is vaak bijna leeg.
Als de twee het oneens zijn, is de eerlijke eerste hypothese dus niet dat een van beide fout zit. Die luidt: je hebt verschillende gesprekken gemeten en behandelt het verschil als een tegenstrijdigheid.
De test van vijf minuten. Haal de gesprekken op die vorige maand een CSAT-reactie kregen. Haal de gesprekken op die zijn gereviewd. Tel de overlap. Zit die onder de tien, dan heb je op dit moment geen vergelijking, en geen enkele analyse bovenop die twee cijfers gaat er een opleveren. De oplossing is om bewust een set gesprekken te reviewen waar een CSAT-reactie bij hoort. Daarmee wordt de vergelijking voor het eerst mogelijk.
Bovenop het eerste selectieprobleem zit een tweede. Wie een enquête beantwoordt, is geen willekeurige groep: mensen die reageren verschillen systematisch van mensen die dat niet doen. Daarom wordt non-responsbias gezien als een kernprobleem van de methode en niet als een afrondingskwestie. Het werk van Pew Research over wat lage responspercentages betekenen voor enquêtes is de helderste beschikbare uitleg, en de gevolgen voor CSAT zijn direct. Een responspercentage van 20% is geen steekproef van 20% van de ervaring van je klanten, het is een volledige steekproef van de klanten die er sterk genoeg over dachten om te reageren.
Let op
Als vorige maand minder dan ongeveer tien gesprekken zowel een CSAT-reactie als een QA-review hebben, zijn je twee metrics het niet oneens. Ze beschrijven verschillende populaties, en het verschil waar je naar kijkt bevat misschien helemaal geen informatie.
Wat meet elk cijfer eigenlijk?
Het zijn geen twee pogingen tot dezelfde meting, en daarom is verwachten dat ze overeenkomen de eigenlijke fout. Ze meten verschillende dingen, en een goed ontworpen paar metrics hoort het soms oneens te zijn.
- Je kwaliteitsscore meet het proces dat je zelf in de hand hebt. Deed de medewerker wat jouw organisatie als goede afhandeling heeft vastgelegd? Hij is intern, vergelijkbaar tussen medewerkers en maar zo goed als het oordeel dat in de beoordelingscriteria is vastgelegd.
- CSAT meet het resultaat, plus al het andere. Het antwoord dat de klant kreeg, het beleid erachter, de wachttijd, het product, de prijs en zijn humeur. Heel weinig daarvan ligt bij de medewerker.
Zo bekeken wordt het verschil informatief in plaats van alarmerend. Een klant kan ontevreden zijn over een correct gebracht nee. Een medewerker kan punten verliezen voor een overgeslagen stap terwijl de klant precies kreeg wat hij nodig had. Beide uitspraken zijn waar, over verschillende dingen, en een interne kwaliteitsscore bestaat juist omdat de beoordeling van de klant je niet kan vertellen wat je moet veranderen.
Een kwaliteitsscore die het altijd eens is met CSAT, meet niets extra’s. Bewegen je twee cijfers precies gelijk op, dan heb je óf een scorecard gebouwd die tevredenheid voorspelt in plaats van de afhandeling te beschrijven, óf iemand scoort met één oog op de klantbeoordeling. Perfecte overeenstemming is een waarschuwingssignaal en geen succesvoorwaarde.
Kwaliteitsscore vs CSAT: de vier kwadranten en wat ze betekenen
Ervan uitgaande dat je het populatieprobleem hebt uitgesloten, zet je de twee tegen elkaar uit. Elk kwadrant heeft een specifieke oorzaak en een specifieke actie, en die zijn niet uitwisselbaar.
| Patroon | Meest waarschijnlijke oorzaak | Hoe je het bevestigt | Wat je doet |
|---|---|---|---|
| Hoge QA, lage CSAT | De scorecard beloont procesnaleving in plaats van oplossing, of de klant is ontevreden over het beleid en niet over de afhandeling | Lees tien hoog scorende gesprekken met een lage beoordeling. Vraag je af of het probleem van de klant echt is opgelost | Herweeg richting oplossing, of herclassificeer de klacht als beleidskwestie en haal die uit de QA |
| Lage QA, hoge CSAT | De medewerker week van het proces af om te helpen, of de scorecard bestraft dingen die klanten niet opmerken | Kijk waarop punten zijn afgetrokken. Gaat het om toon, opmaak of macrogebruik, kijk dan of het criterium zijn gewicht verdient | Dit is een bevinding over beleid of criteria, geen coachingpunt. Coach een medewerker niet voor een tevreden klant |
| Beide laag | Een echt prestatie- of capaciteitsprobleem, of een proces dat bij iedereen faalt | Kijk of het geconcentreerd is bij bepaalde medewerkers of verspreid over iedereen | Verspreid betekent proces. Geconcentreerd betekent coaching. Eerst diagnosticeren, dan handelen |
| Beide hoog, en je gelooft het niet | Toegeeflijke reviewers, een scorecard waar iedereen voor slaagt, of een enquêteselectie die afgehandelde contacten bevoordeelt | Bekijk de verdeling van de scores. Als er bijna niets onvoldoende is, maakt de scorecard geen onderscheid meer | Kalibreer de reviewers opnieuw en kijk of een criterium twee kwartalen lang in 95% van de gevallen is gehaald |
Waarom is hoge QA met lage CSAT het meest voorkomende patroon?
Omdat scorecards afdrijven naar wat makkelijk te observeren is, en wat makkelijk te observeren is, is zelden wat ertoe doet. Begroeting, afsluiting, tagging en toon kun je snel en consequent beoordelen. Of het probleem van de klant echt weg is, vraagt dat je het hele gesprek leest en het beleid kent.
Dus stapelen de criteria die goedkoop te scoren zijn zich op, krijgt het criterium dat het meest telt één regel, en eindig je met een scorecard waarop een gesprek 95% kan halen terwijl de klant achterblijft met een onopgelost probleem en een beleefde afsluiting. De oplossing is herwegen richting resultaat, en de methode is criteria wegen op basis van bewijs: vergelijk het faalpercentage van elk criterium met een uitkomst verderop, zoals herhaalcontact, en laat de criteria die niets voorspellen hun gewicht verliezen.
Er is een tweede oorzaak die je apart moet bekijken, omdat de actie totaal anders is. Soms was de afhandeling echt goed en is de klant ontevreden over het antwoord. Een correct gebrachte weigering, een juist maar onwelkom beleid, een prijs. Dat is geen kwaliteitsfout en daar hoort geen coaching op. Het is een bevinding voor wie het beleid beheert, en het nuttigste wat QA ermee kan doen is tellen, doorsturen en dan stoppen. Het behandelen als ontevredenheid van klanten die je met betere afhandeling kunt verminderen, werkt niet, want de afhandeling was het probleem niet.
Tip
Label lage beoordelingen naar de vraag of de klacht over de afhandeling gaat of over het antwoord. Twee maanden met dat ene onderscheid vertellen je hoeveel van je ontevredenheid überhaupt een supportprobleem is, en dat is meestal minder dan het management aanneemt.
Welk cijfer wint als je moet kiezen?
Geen van beide. Gebruik gedrag als scheidsrechter. Beide cijfers zijn meningen, de ene van een reviewer en de andere van een klant. Wat klanten daarna deden is geen mening, en het staat al in je helpdesk.
Drie manieren om de knoop door te hakken, in volgorde van bruikbaarheid:
- Herhaalcontact binnen zeven dagen. Het zuiverste signaal dat er is. Een klant die terugkomt, zegt daarmee dat het eerste contact het niet heeft opgelost, wat beide cijfers ook zeiden. Leveren je hoog scorende gesprekken herhaalcontacten op, dan zit de scorecard fout.
- Escalaties en klachten. Kostbare, bewuste acties van klanten. Een team met uitstekende beoordelingen en stijgende escalaties heeft ergens een meetprobleem, en de kwaliteit van de escalatieafhandeling is de eerste plek om te kijken.
- Terugbetalingen en compensaties om servicefouten recht te zetten. Geld dat het bedrijf verlaat om iets te herstellen is het minst betwistbare bewijs dat er bestaat.
Doe daarna de controle andersom. Neem de gesprekken die klanten slecht beoordeelden en laat reviewers ze blind scoren, zonder de beoordeling te zien. Scoren reviewers ze consequent goed, dan zijn je criteria en je klanten het oneens over wat goed betekent, en de criteria zijn wat jij kunt veranderen. Dit is hetzelfde mechanisme als een kalibratiesessie (in het Engels), maar dan gericht op de scorecard in plaats van op de reviewers.
Het schaalprobleem moet je benoemen, want dat maakt dit moeilijk in plaats van alleen bewerkelijk. Elk van deze controles heeft genoeg gesprekken met zowel een beoordeling als een review nodig om iets te zeggen, en bij een steekproef van 3% is die overlap te klein om op te splitsen. Kaizo’s Auto QA scoort de hele populatie op jouw eigen criteria, waardoor elk gesprek met een enquête ook een kwaliteitsscore heeft en de vergelijking niet langer afhangt van twee steekproeven die toevallig overlappen. Dat is wat je hier hebt aan 100% dekking, die trends zichtbaar maakt die een steekproef van 3% nooit zou kunnen tonen: geen betere score, maar de mogelijkheid om de vraag überhaupt te stellen.
Wat moet je als eerste veranderen?
Werk in deze volgorde. Elke stap is goedkoop en elke stap sluit een mogelijke verklaring uit. Zo voorkom je dat je een scorecard herweegt om een steekproefartefact op te lossen.
- Meet de overlap. Tel de gesprekken met zowel een beoordeling als een review. Is dat aantal heel klein, los dat dan eerst op door bewust gesprekken met een enquête te reviewen, en stop met analyseren tot je dat hebt gedaan.
- Controleer de overeenstemming tussen reviewers. Als twee reviewers het onderling oneens zijn, is de kwaliteitsscore niet stabiel genoeg om met wat dan ook te vergelijken. Verschillen tussen reviewers vermommen zich vaker als een probleem tussen CSAT en QA dan dat ze worden herkend voor wat ze zijn.
- Scheid klachten over de afhandeling van klachten over het antwoord. Twee maanden labelen vertelt je hoeveel van het verschil überhaupt een supportprobleem is.
- Test elk criterium tegen herhaalcontact. Criteria die falen zonder dat er verderop iets verandert, dragen gewicht dat ze niet hebben verdiend.
- Pas dan herwegen. En als je dat doet, geef de scorecard een versie (in het Engels) zodat de historische scores leesbaar blijven naast de criteria waarmee ze tot stand kwamen.
Wat je niet moet doen, is een doel stellen dat de twee cijfers dwingt overeen te komen. Een kwaliteitsscore die op CSAT wordt gestuurd, is geen onafhankelijke meting meer, maar een tweede, duurdere manier om hetzelfde te rapporteren. De reden om ze allebei bij te houden is dat ze verschillende fouten zien, en wat CSAT wel en niet kan meten (in het Engels) is de bredere versie van dat argument. Ze onafhankelijk houden is precies de bedoeling, en af en toe onenigheid is het bewijs dat dat lukt.
Veelgestelde vragen
Waarom zijn onze QA-scores hoog maar is CSAT laag?
Meestal omdat de scorecard procesnaleving beloont in plaats van oplossing, zodat een gesprek hoog kan scoren terwijl het probleem van de klant onopgelost blijft. De tweede veelvoorkomende oorzaak is dat de klant ontevreden is over het antwoord en niet over de afhandeling. Dat is een bevinding over beleid en daar hoort geen coaching op. Controleer nog vóór beide oorzaken of de gesprekken met een enquête en de gereviewde gesprekken echt dezelfde set zijn, want meestal zijn ze dat niet.
Wat is betrouwbaarder, CSAT of een interne kwaliteitsscore?
Geen van beide, want ze meten verschillende dingen. Een kwaliteitsscore meet het proces dat je in de hand hebt en is vergelijkbaar tussen medewerkers. CSAT meet het resultaat plus het beleid, de wachttijd, het product en het humeur van de klant, en heel weinig daarvan ligt bij de medewerker. Gebruik in plaats daarvan gedrag als scheidsrechter: herhaalcontact, escalaties en terugbetalingen zijn acties, geen meningen.
Horen QA-scores en CSAT overeen te komen?
Nee, en een paar dat het altijd eens is, is een waarschuwingssignaal. Het betekent óf dat de scorecard is gebouwd om tevredenheid te voorspellen in plaats van de afhandeling te beschrijven, óf dat reviewers scoren met één oog op de klantbeoordeling. De reden om beide metrics bij te houden is dat ze verschillende fouten opsporen, dus af en toe onenigheid is het bewijs dat ze onafhankelijk werken. Of QA CSAT überhaupt verhoogt, lees je in verbetert QA de CSAT? (in het Engels).
Wat betekent het als een medewerker lage QA-scores en tevreden klanten heeft?
Meestal dat hij van een proces afweek om de klant te helpen, of dat de scorecard dingen bestraft die klanten niet opmerken, zoals toon, opmaak of macrogebruik. Kijk waarop punten zijn afgetrokken voordat je iemand coacht. Voorspelt het criterium geen enkele uitkomst verderop, zoals herhaalcontact, dan is dit een bevinding over de criteria en niet over de prestaties.
Is een responspercentage van 20% een steekproef van 20%?
Nee. Het is een volledige steekproef van de klanten die er sterk genoeg over dachten om te reageren, en dat is een systematisch andere groep dan de klanten die niet reageerden. Non-responsbias is een goed gedocumenteerd methodologisch probleem en geen afrondingskwestie, en het betekent dat CSAT een zelfgeselecteerde populatie beschrijft. Dat is de belangrijkste reden waarom CSAT een interne meting ernaast nodig heeft, niet in plaats ervan.
Verder lezen
- Voorbij CSAT: wat de score wel en niet kan meten (in het Engels)
- Waar een interne kwaliteitsscore voor dient
- CSAT vs DSAT (in het Engels)
- Criteria van een QA-scorecard wegen
- Een QA-kalibratiesessie organiseren (in het Engels)
- Gesprekskwaliteit meten (in het Engels)
Ontdek of je twee cijfers over dezelfde gesprekken gaan
Neem een maand aan gesprekken met een enquête en je huidige scorecard mee. Wij scoren ze op jouw eigen criteria, zodat je ziet waar de klantbeoordeling en de review echt van elkaar verschillen, en waar ze elkaar nooit hebben ontmoet.