De weging van beoordelingscriteria bepaal je per criterium op basis van drie dingen: hoeveel de fout de klant schaadt, hoeveel risico hij voor het bedrijf meebrengt en in hoeverre de medewerker hem zelf in de hand heeft. Kun je een gewicht niet uitleggen, dan overleeft de score het eerste bezwaar niet.
In het kort
- Gelijke weging beweert dat elk criterium even zwaar telt. Dat klopt nooit.
- De invloed van de medewerker is de factor die iedereen vergeet, en die medewerkers het meest kwalijk nemen.
- Maak van kritieke criteria een knock-out criterium in plaats van een onderdeel van 60 punten.
- Test nieuwe gewichten achteraf op al gescoorde gesprekken. Komt niemand in een andere scorecategorie terecht, dan was het cosmetisch.
Waarom gelijke weging een scorecard ongemerkt onbruikbaar maakt
Bijna elke QA-scorecard begint met gelijke gewichten, omdat dat eerlijk voelt en geen nadenken kost. Het is geen van beide. Gelijke weging is een bewering, en die bewering luidt dat een vergeten begroeting het bedrijf precies evenveel kost als een verkeerd verwerkte terugbetaling.
Daar volgen drie dingen uit, en ze komen in deze volgorde.
De score maakt geen onderscheid meer. Als tien criteria elk tien punten waard zijn, kosten een ernstige en een cosmetische fout allebei tien. Twee medewerkers komen uit op 90, de een omdat hij kortaf was, de ander omdat hij de klant verkeerde informatie over zijn geld gaf. Een getal dat die twee niet uit elkaar kan houden, meet geen kwaliteit.
Medewerkers optimaliseren voor de goedkope criteria. Mensen reageren op het scorebord dat je ze geeft. Als toon en begroeting de punten zijn die het makkelijkst te behouden en het moeilijkst te verliezen zijn, gaat de inspanning daarheen. Dat is geen valsspelen, dat is de scorecard die precies werkt zoals hij is ontworpen.
De score raakt los van het bedrijf. Zodra kwaliteitsscores niet meer meebewegen met escalaties, heropeningen en ontevreden klanten, stopt het management er stilletjes mee ze te gebruiken. Het programma loopt door, de reviews lopen door, en niemand neemt een beslissing op basis van de uitkomst. Dat is de toestand waarin de meeste QA-programma’s zich in werkelijkheid bevinden.
Een snelle diagnose. Pak je twee medewerkers met de hoogste score van vorige maand en je twee met de laagste. Als je geen echt verschil kunt benoemen in de klantervaring die ze leverden, dragen je gewichten geen informatie. Zorg er voordat je aan gewichten komt voor dat de onderliggende criteria deugen. Dat is een aparte klus, die we behandelen in wat een rubric is en hoe je er een opbouwt.
Onthoud
Gelijke weging is niet het ontbreken van een beslissing. Het is de beslissing dat elk criterium even zwaar telt, genomen als standaardinstelling en nooit herzien.
De drie wegingsmodellen en wanneer elk model past
In de praktijk worden maar drie modellen gebruikt. De fout is niet dat je het verkeerde kiest, maar dat je er per ongeluk een kiest en het nooit meer herziet.
| Model | Hoe het werkt | Geschikt als | Gaat mis als |
|---|---|---|---|
| Vlak | Elk criterium levert evenveel punten op | Het programma nieuw is, je minder dan ongeveer tien criteria hebt en je echt nog niet weet wat ertoe doet | Je uitkomstdata hebt en die toch negeert. Vlak hoort een beginpositie te zijn, geen eindstation |
| Gewogen naar impact | Criteria hebben verschillende puntwaarden die de impact op klant en bedrijf weergeven | Het programma volwassen genoeg is om bewijs te hebben en reviewers elk gewicht kunnen uitleggen | Gewichten worden bepaald door wie het hardst praat in de vergadering en daarna nooit meer worden herzien |
| Aftrek vanaf een plafond | Elk gesprek begint op 100 en verliest punten per fout, waarbij de ernst de aftrek bepaalt | De meeste gesprekken in orde zijn en je uitzonderingen zoekt, of het werk sterk door compliance wordt bepaald | Er geen ondergrens is, zodat één slecht gesprek diep negatief uitkomt en het gemiddelde van een medewerker vertekent |
Weging van beoordelingscriteria op basis van bewijs in plaats van mening
Weeg op drie factoren, in deze volgorde. Niets hiervan is uniek voor QA in de klantenservice: de handleiding van de Britse overheid over multicriteria-analyse behandelt hetzelfde probleem van opties scoren op criteria en die criteria vervolgens wegen, en de centrale waarschuwing is dat de gewichten het waardeoordeel dragen, of iemand dat nu toegeeft of niet.
Impact op de klant. Hoeveel slechter is de dag van deze klant doordat het criterium niet werd gehaald? Verkeerde informatie over een terugbetaling weegt zwaarder dan een ontbrekende afsluiting, en het verschil is groot.
Bedrijfs- en regelgevingsrisico. Wat kost de fout buiten dit ene gesprek? Alles met juridische, financiële of privacygevolgen staat bovenaan, en een deel daarvan hoort helemaal niet in het gewogen deel.
Invloed van de medewerker. Dit is de factor die wordt overgeslagen, en het is de factor die medewerkers opmerken. Als een criterium afhangt van een traag intern systeem, een beleid dat de medewerker niet kan oprekken of een overdracht vanuit een ander team, dan straft een hoog gewicht mensen voor jouw proces. Geef het een laag gewicht, of los het proces op en stop met het te scoren.
De gewichten dragen het waardeoordeel, of iemand dat nu toegeeft of niet.
Vrij naar de handleiding voor multicriteria-analyse van de Britse overheid
Het ene uur analyse dat het meeste werk doet
Neem drie maanden aan gesprekken die je al hebt gescoord. Verdeel ze per criterium in gesprekken waarin het werd gehaald en gesprekken waarin het niet werd gehaald, en vergelijk dan een uitkomst verderop in het proces tussen de twee groepen. Het heropeningspercentage is de beste enkele keuze, omdat het objectief is en al in je helpdesk staat. Escalatiepercentage en ontevredenheid werken ook.
Je zoekt naar de grootte van het verschil. Een criterium waarvan het niet halen het heropeningspercentage flink verschuift, heeft gewicht verdiend. Een criterium waarvan het niet halen niets verschuift, heeft dat niet, en het moet ofwel lager op de schaal komen of helemaal van de scorecard af.
Twee eerlijke kanttekeningen. Dit is correlatie, geen causaliteit, dus gebruik het om criteria te rangschikken en niet om exacte puntwaarden te berekenen. En criteria die heel zelden niet worden gehaald, leveren geen leesbaar signaal op. Dat is meestal een hint dat ze thuishoren bij de knock-out criteria en niet in het gewogen deel.
Tip
Gebruik het heropeningspercentage als uitkomstvariabele. Het is objectief, het staat al in je helpdesk en, anders dan tevredenheid, hangt het er niet van af of iemand een enquête invult.
Een knock-out criterium is een poort, geen zwaar gewicht
Dit is de meest voorkomende ontwerpfout bij scorecards. Een team besluit dat een schending van de bescherming van klantgegevens (in het Engels) onaanvaardbaar is, en maakt die daarom 60 van de 100 beschikbare punten waard.
Dat heeft niet het effect dat het team denkt. Een medewerker kan de gegevensbescherming schenden en toch op 40 uitkomen, en als de rest van de scorecard royaal is, de maand afsluiten met een respectabel gemiddelde. Het gedrag dat het team onaanvaardbaar noemde, is rekenkundig gewoon te overleven.
Als een gedraging de interactie ongeldig moet maken, heeft ze een binaire poort nodig die de score op nul zet en volledig buiten het gewogen deel staat. Daar is een knock-out criterium voor. Drie regels houden het werkbaar:
- Houd ze beperkt. Drie tot vijf. Een scorecard met een dozijn knock-out criteria is een scorecard waarop alles kritiek is en dus niets.
- Houd ze ondubbelzinnig. Twee reviewers die elkaar nooit hebben gesproken, moeten een knock-out criterium met ja of nee kunnen beantwoorden. “Was onbeleefd” voldoet daar niet aan. “Gaf accountgegevens vrij zonder de identiteitscontrole af te ronden” wel.
- Vereis een tweede reviewer. Iemands score op nul zetten is een serieuze stap, en het moet het programma iets kosten om dat te doen.
Zodra de knock-out criteria eruit zijn gehaald, is het gewogen deel makkelijker te doorgronden, omdat alles wat erin overblijft een kwestie van gradatie is en niet van soort.
Let op
Een kritiek criterium 60 van de 100 punten waard maken, maakt er geen knock-out criterium van. De medewerker kan het niet halen, toch 40 scoren en met een royale scorecard de maand nog acceptabel afsluiten. Als een gedraging de interactie ongeldig moet maken, zet er een poort voor. Hang er geen prijs aan.
De bimodale scorecard, en waarom medewerkers er niet meer in geloven
Er is een specifieke foutsituatie die het benoemen waard is, omdat ze vaak voorkomt en het vertrouwen vernietigt. Ze ontstaat wanneer een scorecard een lange lijst knock-out criteria combineert met zware aftrek op al het andere. Medewerkers beschrijven het resultaat elke keer hetzelfde: elk onderdeel is ofwel een directe nul of kost zestien punten, dus in de praktijk zijn de enige uitkomsten een perfecte score of een ramp.
Kijk naar je verdeling. Als de scores zich bovenaan en onderaan groeperen met weinig ertussen, is de scorecard gestopt met meten en begonnen met sorteren. Daar volgen twee dingen uit. Doelen als 95% worden rekenkundig onhaalbaar voor iedereen die een lastig gesprek aanneemt, zodat de mensen die je zwaarste tickets afhandelen het slechtst scoren. En omdat er geen midden is, is er niets om naartoe te coachen, alleen een voldoende of een straf.
De oplossing is bijna altijd dezelfde: minder knock-out criteria, en kleinere aftrek op de criteria die overblijven.
Hoe je nieuwe gewichten test voordat je ze uitrolt
Publiceer een opnieuw gewogen scorecard nooit rechtstreeks in productie. Test hem eerst achteraf. Dat kost een middag en voorkomt het grootste deel van de schade.
Neem een steekproef van gesprekken die al onder de oude gewichten zijn gescoord. Bereken hun scores opnieuw met de nieuwe gewichten. Beoordeel ze niet opnieuw, je test rekenwerk, geen oordeel. Vergelijk daarna de verdeling.
Drie mogelijke uitkomsten, en elk vertelt je iets specifieks.
- Bijna niemand komt in een andere scorecategorie terecht. De herweging is cosmetisch. Je hebt politiek kapitaal uitgegeven aan een wijziging die niets verandert, en je moet ofwel verder gaan of het laten zoals het is.
- Bijna iedereen komt in een andere scorecategorie terecht. Je hebt geen gewichten bijgesteld, je hebt de standaard veranderd. Dat kan terecht zijn, maar het moet worden aangekondigd als een nieuwe standaard in plaats van ongemerkt doorgevoerd als een kleine aanpassing, anders verlies je het draagvlak.
- Sommigen veranderen, en het zijn de verkeerde mensen. Dit is het nuttige geval. Als medewerkers die je team respecteert flink dalen, drukken de nieuwe gewichten een opvatting over kwaliteit uit die je eigenlijk niet deelt. Zoek het criterium dat dat veroorzaakt voordat je verdergaat.
Houd daarna één kalibratiesessie (in het Engels) op de nieuwe gewichten met de hele groep reviewers voordat er iets wordt gepubliceerd. Gewichten veranderen waarover reviewers discussiëren, en je wilt dat die discussie in een vergaderruimte plaatsvindt en niet in de one-on-one van een medewerker. Werk je vanuit een standaard startpunt, dan zijn de QA-scorecardtemplates (in het Engels) een redelijke basis om opnieuw te wegen in plaats van met een leeg blad te beginnen.
Weging wanneer een AI de scores geeft
Geautomatiseerd scoren verandert de principes hierboven niet. Het verandert wat er op het spel staat als je ze verkeerd toepast, op twee specifieke manieren.
Fouten zijn niet langer incidenteel, maar systematisch. Bij handmatige review met de steekproef van 3% die de meeste programma’s hanteren, vertekent een slecht gewogen criterium een handvol gesprekken per maand, en een goede reviewer compenseert dat stilletjes. Met 100% dekking (in het Engels), die trends zichtbaar maakt die een steekproef van 3% nooit zou kunnen tonen, wordt datzelfde slechte gewicht op elk gesprek toegepast, consequent en in dezelfde richting. Consistentie is het doel van automatisering, en juist dat maakt dat een wegingsfout zich opstapelt.
Een gewicht is maar zo verdedigbaar als de uitleg erbij. Een medewerker die te horen krijgt dat hij 30 punten is kwijtgeraakt, vraagt welke 30 en waarom. Als het systeem alleen een totaal kan geven, overleven de gewichten het contact met de werkvloer niet, hoe zorgvuldig je ze ook hebt vastgesteld. Elke aftrek moet het criterium noemen, het moment in het gesprek citeren dat hem veroorzaakte en betwistbaar zijn. Dat is het verschil tussen een score en een vonnis, en het wordt uitgebreider behandeld in hoe je AI-QA-scores valideert (in het Engels).
Twee praktische aanpassingen voor geautomatiseerd scoren:
- Houd de aftrek grof. Veelvouden van vijf of tien. Fijnmazige gewichten suggereren een precisie die het model niet heeft, en ze nodigen uit tot discussies over het verschil tussen een misser van zeven en een van acht punten.
- Weeg de dingen die een model betrouwbaar leest. Procedurele en feitelijke criteria worden consistent beoordeeld. Oordelen over toon hebben meer spreiding, dus geef ze een kleiner deel van het totaal tot je hebt gemeten hoe nauwkeurig AI-kwaliteitsbeoordeling daarop is.
Auto QA van Kaizo past de gewichten uit je eigen scorecard per criterium toe en laat de redenering aan het gesprek gekoppeld, zodat een betwiste aftrek terug te voeren is op de specifieke uitwisseling die hem veroorzaakte, in plaats van er uit het geheugen over te discussiëren.
Wanneer je opnieuw weegt en wanneer je het laat
Weeg opnieuw volgens een vast schema, niet naar aanleiding van een klacht. Elk kwartaal, gekoppeld aan een cyclus van QA-kalibratie, is het ritme dat de meeste teams kunnen volhouden. Verzamel tussen die momenten de klachten in plaats van op elke klacht te reageren.
Vier signalen dat een gewicht echt is verlopen:
- Een criterium wordt twee kwartalen op rij in meer dan ongeveer 95% van de gevallen gehaald. Het maakt geen onderscheid meer tussen medewerkers. Ofwel is het gedrag inmiddels universeel, vier dat dan en schrap het criterium, ofwel is het criterium te makkelijk te halen.
- Een beleids- of productwijziging heeft verschoven wat ertoe doet. Nieuwe regelgeving, een nieuw terugbetalingsbeleid, een nieuw kanaal.
- De score volgt de uitkomsten niet meer. Herhaal de analyse van eerder in deze gids. Als de verschillen zijn afgevlakt, zijn de gewichten verouderd.
- Reviewers corrigeren steeds hetzelfde criterium. Als mensen een gewicht stilletjes compenseren, vertellen ze je dat het niet klopt.
Eén regel weegt zwaarder dan alle andere: geef de scorecard een versienummer en pas nieuwe gewichten nooit met terugwerkende kracht toe op historische scores. De maartscore van een medewerker kwam tot stand onder de regels van maart. Die in juli herberekenen vernietigt het enige waar een QA-programma op steunt, namelijk dat het getal iets betekende op het moment dat het werd gegeven. Laat de oude versie intact, start de nieuwe versie vanaf een duidelijke datum en zeg dat hardop. Dat houdt ook je interne kwaliteitsscore vergelijkbaar door de tijd heen, in plaats van dat hij ongemerkt verschuift.
Veelgestelde vragen
Hoeveel criteria moet een QA-scorecard hebben?
Acht tot vijftien voor de meeste supportteams. Onder de acht is de score te grof om coaching te sturen. Boven de vijftien kunnen reviewers niet alle beoordelingscriteria in hun hoofd houden, daalt de overeenstemming tussen hen en duren reviews zo lang dat de dekking eronder lijdt. Heb je er meer dan vijftien nodig, dan heb je waarschijnlijk twee scorecards nodig voor twee verschillende soorten werk in plaats van één lange.
Moet elk criterium hetzelfde gewicht hebben?
Nee. Gelijke weging beweert dat elke gedraging even zwaar telt, wat nooit klopt, en het levert scores op die een ernstige fout niet van een cosmetische kunnen onderscheiden. Vlakke weging is een redelijke beginpositie voor een gloednieuw programma zonder uitkomstdata, maar moet worden vervangen zodra je criteria kunt rangschikken op hun effect op heropeningen, escalaties of ontevredenheid.
Wat is het verschil tussen een gewicht en een knock-out criterium?
Een gewicht zegt hoeveel een fout kost. Een knock-out criterium zegt dat het gesprek ongeldig is, ongeacht al het andere. Het zijn verschillende mechanismen en ze moeten elkaar niet vervangen. Een kritiek criterium 60 van de 100 punten waard maken is de meest voorkomende ontwerpfout, omdat een medewerker het niet kan halen en toch 40 kan scoren. Als een gedraging de interactie ongeldig moet maken, zet er een poort voor in plaats van het te wegen.
Hoe bepaal ik gewichten als ik nog geen data heb?
Rangschik de criteria samen met je reviewers op impact op de klant en risico, deel ze in drie categorieën in (hoog, middel en laag) en ken grove puntwaarden toe aan de categorieën in plaats van aan afzonderlijke criteria. Spreek daarna af dat je na één kwartaal opnieuw kijkt, wanneer je genoeg gescoorde gesprekken hebt om faalpercentages te vergelijken met heropeningen. Grof en herzienbaar wint van precies en verzonnen.
Hoe vaak moeten de gewichten van een QA-scorecard veranderen?
Hooguit eens per kwartaal, gekoppeld aan een kalibratiecyclus. Gewichten die vaker veranderen zijn geen standaard meer maar een bewegend doel, en medewerkers weten niet meer hoe goed werk eruitziet. Geef de scorecard altijd een nieuwe versie als gewichten veranderen, en herbereken historische scores nooit met nieuwe gewichten.
Gerelateerde begrippen
- Wat een rubric is en hoe je er een opbouwt
- Wat een knock-out criterium is, en wanneer je het gebruikt
- Hoe je een QA-kalibratiesessie houdt (in het Engels)
- QA-scorecardtemplates (in het Engels)
- Hoe je AI-QA-scores valideert (in het Engels)
Je eigen gewichten achter elk gescoord gesprek
Neem de scorecard mee die je nu gebruikt en een maand aan gesprekken die je al hebt beoordeeld. We laten je zien wat je huidige gewichten werkelijk belonen, en wat er verandert als elk gesprek op dezelfde manier wordt gescoord.