Een steekproef in kwaliteitsmonitoring betekent dat je een deel van de klantgesprekken beoordeelt, vaak twee of drie tickets per medewerker per week, in plaats van allemaal. Steekproeven bestaan omdat handmatig beoordelen traag is: het is een noodoplossing voor een capaciteitsgrens, en het is maar zo betrouwbaar als de steekproef representatief is.
In het kort
- Een steekproef geeft een ruw beeld van het team, maar is te dun om een individuele medewerker te beoordelen.
- De lastigste gesprekken komen het minst vaak in de steekproef terecht.
- Geautomatiseerd scoren haalt de capaciteitsgrens weg, dus volledige dekking vervangt de steekproef bij het meten van medewerkers.
- Een steekproef blijft nuttig om te controleren of reviewers of een geautomatiseerde beoordelaar consistent scoren.
Wat een steekproef in kwaliteitsmonitoring van de klantenservice betekent
Een steekproef in de kwaliteitscontrole van de klantenservice is simpelweg de keuze om sommige gesprekken te beoordelen en andere niet. Omdat een reviewer per dag maar een beperkt aantal tickets kan lezen of telefoongesprekken kan beluisteren, kiest een QA-team een deel, scoort dat met de scorecard en laat de uitkomst voor het geheel spreken. Een gangbare vorm is een vast aantal per medewerker per week, afgestemd op de tijd die reviewers hebben.
Het sleutelwoord is representatief. De beoordeelde gesprekken staan voor alle gesprekken die niet zijn beoordeeld, en de hele waarde van de oefening hangt af van hoe goed ze dat doen. Geeft de steekproef het geheel goed weer, dan is het een redelijke besparing. Doet ze dat niet, dan rust elke conclusie op gesprekken waar nooit iemand echt naar heeft gekeken.
Eén verduidelijking, omdat de term in veel sectoren voorkomt: een steekproef betekent hier het selecteren van klantgesprekken om te beoordelen. Het heeft niets te maken met statistische steekproefcontrole in de kwaliteitscontrole van de maakindustrie, wat een andere praktijk met een ander doel is.
Waarom teams steekproeven nemen, en wat dat kost
Een steekproef is een antwoord op een harde beperking. Als je team duizenden gesprekken per week afhandelt en je een paar reviewers hebt, is alles lezen onmogelijk, dus lees je een deel. Aan die logica is niets mis. Het probleem is wat dat deel wel en niet kan dragen.
Een kleine steekproef geeft je een ruw idee van hoe een team het in zijn geheel doet, en daarvoor volstaat ze. Ze schiet tekort zodra je haar gebruikt om een individu te beoordelen, want een paar gesprekken zijn een piepkleine en vaak toevallig ongunstige momentopname van iemands maand. Twee medewerkers van gelijke kwaliteit kunnen er in een kleine steekproef heel verschillend uitzien, puur door welke gesprekken toevallig werden getrokken. Daarnaast is er een selectieprobleem: de gesprekken die het meest een beoordeling nodig hebben, de rommelige escalaties en de gesprekken die stilletjes misgingen, komen vaak het minst in de steekproef terecht, omdat reviewers neigen naar gesprekken die snel te scoren zijn. De volledige statistische uitleg staat in waarom een kleine QA-steekproef geen beslissingen over individuele medewerkers kan dragen (in het Engels).
Een uitgewerkt voorbeeld: wat een wekelijkse steekproef ziet
Neem een hypothetische medewerker die per week 100 e-mail- en chatgesprekken afhandelt, waarvan er twee worden getrokken voor beoordeling. De QA-score van die week rust op 2% van het werk van die medewerker. Over een maand staan acht gesprekken voor vierhonderd, en één slechte week kan het gevolg zijn van één ongelukkige trekking.
Kijk nu wat die acht gesprekken moeten dragen. Is het ene gesprek een snelle wachtwoordreset en het andere een lang geschil over een terugbetaling, dan zegt de score vooral iets over welke tickets werden getrokken, niet over hoe de medewerker werkt. Heeft de medewerker die maand drie escalaties slecht afgehandeld, dan is de kans groot dat geen ervan in de steekproef zat, en het coachingsgesprek vindt nooit plaats. De steekproef verhogen naar vijf per week helpt een beetje en kost een reviewer meer uren, precies de extra uren die de steekproef moest voorkomen.
Steekproef of volledige dekking
Een steekproef beoordeelt een deel dat is afgestemd op de capaciteit van de reviewers, terwijl volledige dekking elk gesprek scoort. Een steekproef volstaat voor een ruw beeld van een team; beslissingen over individuele medewerkers en het herkennen van trends vragen om volledige dekking. De beperking die steekproeven nodig maakte, verdwijnt, want geautomatiseerde kwaliteitscontrole kan nu elk gesprek automatisch beoordelen, en dat verandert de keuze.
Geautomatiseerd scoren, zoals Kaizo AutoPilot, past je eigen scorecard toe op alle gesprekken in plaats van op een gekozen deel. Moet je in de tussentijd beslissen hoe groot je steekproef is, dan zet onze gids voor het kiezen van een QA-steekproefplan (in het Engels) de opties naast elkaar.
| Steekproef | Volledige dekking | |
|---|---|---|
| Wat wordt beoordeeld | Een deel, afgestemd op de capaciteit van de reviewers | Elk gesprek |
| Geschikt voor | Een ruw beeld van een team | Beslissingen over individuele medewerkers en trends herkennen |
| Blinde vlek | De gesprekken die nooit worden getrokken, ook de slechtste | Vraagt vertrouwen in de geautomatiseerde beoordelaar, die dus gecontroleerd moet worden |
| Waar de steekproef voor dient | Kwaliteit meten | De beoordelaar controleren, niet medewerkers meten |
Wat teams zien als ze stoppen met steekproeven
Teams die van een handmatige steekproef overstappen op geautomatiseerd scoren, melden meer dekking en minder voorbereidingswerk, niet alleen hogere cijfers. Bij EverHelp ging de kwaliteitscontrole van een met de hand samengestelde steekproef naar geautomatiseerd scoren op de eigen criteria van elk project; de QA-dekking steeg met 270% en de voorbereiding voor coaching daalde met 75% over zestien domeinen.
Het klantverhaal van EverHelp (in het Engels) legt uit hoe dat werkte over veel klantprojecten heen. Bij UiPath automatiseerde Kaizo 100% van de QA, met 200% ROI en een stijging van 8% in de kwaliteitsscore. In beide gevallen was de verandering dezelfde: de score rustte niet langer op een handvol gesprekken waarvoor iemand tijd had om ze te lezen.
Bekijk het op je eigen gesprekken. Kaizo scoort 100% van je supportgesprekken met je eigen scorecard en zet de bevindingen om in coaching. Boek een demo.
Waar de steekproef nog thuishoort
Volledige dekking maakt de steekproef niet nutteloos; ze geeft haar een betere taak. Als elk gesprek automatisch wordt gescoord, neem je geen steekproef meer om medewerkers te meten. Je neemt er een om de meting te controleren: om te bevestigen dat reviewers het met elkaar eens zijn en dat een geautomatiseerde beoordelaar het met je reviewers eens is. Dat telt met automatisering zwaarder, niet minder zwaar.
Dat is een legitiem, doorlopend gebruik van een steekproef, en het wordt belangrijker met automatisering, omdat één beoordelaar nu elke score bepaalt. De verwante praktijken zijn kalibratie in kwaliteitsmonitoring en het valideren van AI-QA-scores (in het Engels).
De stap van steekproef naar volledige dekking zorgt er ook voor dat QA op de werkvloer geen bron van discussie meer is. Rust de score van een medewerker op twee gesprekken, dan is die makkelijk weg te wuiven. Rust ze op alle gesprekken, en is elke score te herleiden tot het bewijs, dan verschuift de discussie van de vraag of de steekproef eerlijk was naar wat de gesprekken echt laten zien. Dat is het pleidooi in 100% van de gesprekken scoren (in het Engels).
Wanneer een steekproef in kwaliteitsmonitoring volstaat
Een steekproef in kwaliteitsmonitoring volstaat als het team klein is, het volume laag en het doel een algemeen beeld van de kwaliteit is in plaats van beslissingen over individuele medewerkers. Handelen een paar medewerkers een bescheiden aantal tickets per week af, dan kan een teamleider er zelf een groot deel van lezen, en zit een steekproef misschien al dicht bij volledige dekking.
Een steekproef is ook een verstandige eerste stap voor een team dat nog geen scorecard heeft. Elk gesprek automatisch scoren helpt pas als je weet waarop je scoort, dus eerst bouw en kalibreer je de scorecard op een handmatige steekproef. Zodra het team groeit, of zodra scores gaan meetellen voor coaching, beoordelingsgesprekken of bonussen, wordt de dunne steekproef het probleem, en dat is het moment om naar geautomatiseerde kwaliteitscontrole te kijken.
Veelgestelde vragen
Wat is een QA-steekproef in de klantenservice?
Het is de praktijk om een deel van de klantgesprekken te beoordelen in plaats van allemaal, meestal een paar per medewerker per periode. Ze bestaat omdat handmatig beoordelen traag is en er altijd meer gesprekken zijn dan reviewers kunnen lezen. De getrokken gesprekken worden als representatief voor het geheel gezien, dus de methode is maar zo goed als de steekproef echt representatief is.
Waarom is een steekproef een probleem bij het beoordelen van individuele medewerkers?
Omdat een paar gesprekken een piepkleine momentopname zijn van de maand van een medewerker, en het enorm uitmaakt welke gesprekken werden getrokken. Twee medewerkers van gelijke kwaliteit kunnen door toeval heel verschillende steekproefscores halen, en de lastigste gesprekken, die het meest een beoordeling nodig hebben, komen vaak het minst in de steekproef terecht. Een steekproef die is afgestemd op de capaciteit van reviewers is te dun om een beslissing over één persoon te dragen.
Hoeveel gesprekken moet een QA-team in de steekproef opnemen?
Er is geen universeel getal. De meeste teams stemmen de steekproef af op de tijd van reviewers, vaak twee of drie gesprekken per medewerker per week, wat genoeg is voor een ruw beeld van het team maar niet voor beslissingen over één medewerker. Tellen scores mee voor coaching of beoordelingen, dan moet de steekproef veel groter zijn, en daarom stappen teams over op het scoren van elk gesprek.
Hoe kies je gesprekken voor een QA-steekproef?
Een aselecte selectie houdt de steekproef het meest representatief, omdat reviewers dan geen gesprekken kunnen kiezen die snel te scoren zijn. Sommige teams voegen gerichte selecties toe, zoals escalaties of lage klantbeoordelingen, om de lastigste gevallen te zien. Houd die twee gescheiden in je rapportage, want een gerichte selectie is niet representatief voor het totale werk van een medewerker.
Is een QA-steekproef hetzelfde als een steekproef in de maakindustrie?
Nee. In de klantenservice betekent een steekproef het selecteren van gesprekken om te beoordelen. Het heeft niets te maken met de statistische acceptatiesteekproef in de kwaliteitscontrole van de maakindustrie, die een deel van de fysieke eenheden toetst aan een fouttolerantie. De twee delen een woord, maar geen doel.
Vervangt volledige QA-dekking de steekproef helemaal?
Ze vervangt de steekproef voor het meten van medewerkers, omdat elk gesprek kan worden gescoord. De steekproef blijft voor een andere taak: de beoordelaar controleren, door te bevestigen dat reviewers het met elkaar eens zijn en dat een geautomatiseerde beoordelaar het met je reviewers eens is. Dat gebruik van de steekproef wordt met automatisering belangrijker, niet minder belangrijk.