Voor kwaliteitsbewaking bij uitbestede klantenservice is een steekproef van 2% niet genoeg: de leverancier leest 2% tot 3% van zijn eigen tickets, beoordeelt zijn eigen werk en laat 97% tot 98% ongelezen. Een BPO aansturen vraagt om de beoordeling van elk gesprek en een scorecard die zowel de opdrachtgever als de leverancier kan controleren.
Deel 1 van 4 in de serie over het aansturen van uitbestede support. Geschreven voor leiders in support, CX en leveranciersmanagement.
In het kort
- Kleine steekproeven missen de zeldzame fouten die klanten kosten.
- Volledige dekking is inmiddels standaard. Het verschil zit in scores die herleidbaar en aanvechtbaar zijn.
- Meerdere leveranciers hebben één gedeelde scorecard nodig om ze te vergelijken of een SLA af te dwingen.
- Een gedeelde scorecard helpt ook de BPO om zijn kwaliteit aan te tonen.
Ga naar
- Wat het vandaag betekent
- Wat een steekproef mist
- Dekking is pas het begin
- Meerdere leveranciers, één basis
- Waarom ook de BPO er beter van wordt
- Zo maak je de overstap
- De vraag die je moet stellen
Wat kwaliteitsbewaking bij uitbestede klantenservice vandaag betekent
Als een groeiend softwarebedrijf de eerstelijns support overdraagt aan een Business Process Outsourcing-partner (BPO), zijn de kosten per eenheid overtuigend. De bereikbaarheid gaat naar 24 uur per dag. Het team groeit zonder eigen wervingstraject. De kosten per contact dalen. Niets daarvan staat ter discussie, en de bedrijven die dit doen, maken geen fout.
Wat vaak niet meegroeit met het team, is de aansturing. De supportgesprekken verhuizen naar het buitenland, maar het meetsysteem dat je vertelt of die gesprekken goed zijn, blijft meestal precies zoals het was toen het team nog in je eigen gebouw zat: een steekproef van tickets, gelezen door een persoon, gescoord op een formulier.
Het verschil is dat de persoon die ze leest nu werkt voor de leverancier die wordt gemeten.
Het personeel uitbesteden is een verstandige commerciële beslissing. De scorecard uitbesteden is een andere beslissing, en de meeste bedrijven nemen die per ongeluk.
In een typische opzet heeft de BPO eigen kwaliteitsanalisten in dienst. Die trekken een steekproef uit de tickets van de week, lezen ze aan de hand van beoordelingscriteria, kennen scores toe en verwerken het resultaat in een maandrapport voor de opdrachtgever. Het rapport komt binnen als spreadsheet. Meestal staat erin dat de kwaliteit hoog is.
Niet dat het cijfer oneerlijk is. Maar niemand aan de kant van de opdrachtgever kan het controleren, want de tickets erachter zijn gekozen door de partij die wordt beoordeeld, en de onderbouwing van elke score is nergens vastgelegd waar de opdrachtgever die kan inzien.
Hoeveel mist een steekproef van 2% eigenlijk?
Neem een middelgrote supportorganisatie die 15.000 gesprekken per maand via een outsourcingpartner afhandelt. Bij een steekproef van 3% leest het kwaliteitsprogramma er 450. De overige 14.550 worden door niemand beoordeeld.
- 450 gesprekken per maand gelezen bij een steekproef van 3% van 15.000
- 14.550 gesprekken die niemand beoordeelt, bij hetzelfde volume
- 1 op 50: een foutpercentage dat een steekproef van 50 tickets meestal volledig mist
Het probleem is niet alleen de omvang van het gat. Het gaat erom welke fouten erin zitten. Een steekproef is goed in het opsporen van wat voortdurend gebeurt en slecht in wat af en toe gebeurt, en de fouten die je echt geld kosten, zijn bijna altijd incidenteel.
Een toonprobleem dat in één op de drie gesprekken voorkomt, duikt in elke steekproef op. Een migratie-instructie die eens per twee weken fout is, gegeven aan de klant die er toevallig naar vraagt, duikt niet op. De statistiek van kleine steekproeven (in het Engels) is hier genadeloos, en geen enkele zorgvuldigheid van een analist lost dat op.
Het tweede steekproefprobleem waar niemand over praat
Een steekproef is alleen zuiver als hij willekeurig wordt getrokken. In de praktijk wordt de ticketselectie vaak aan de analist overgelaten of door gemak bepaald: recente tickets, korte tickets, tickets uit wachtrijen die de analist goed kent. Elk van die gewoonten maakt de score minder representatief dan de steekproefgrootte alleen zou doen vermoeden. Hoe gesprekken worden geselecteerd voor beoordeling (in het Engels) bepaalt stilletjes wat de score betekent.
QA op basis van een steekproef door de leverancier vergeleken met beoordeling van elk gesprek:
| QA op steekproefbasis, gescoord door de leverancier | QA met volledige dekking op een gedeelde scorecard | |
|---|---|---|
| Beoordeelde gesprekken | 2% tot 3%, gekozen door de partij die wordt gemeten | Elk gesprek, door niemand gekozen |
| Van wie de criteria zijn | Elke leverancier onderhoudt zijn eigen | Eén set criteria, identiek toegepast op elke partner |
| Vertraging in rapportage | Maandelijks of tweewekelijks, achteraf | Doorlopend, voor beide kanten tegelijk zichtbaar |
| Zeldzame fouten | Statistisch onzichtbaar | Zichtbaar als patroon zodra ze terugkomen |
| Een score aanvechten | Discussiëren over een cel in een spreadsheet | Het gesprek openen en het bewijs lezen |
| Twee leveranciers vergelijken | Niet mogelijk, verschillende criteria | Direct, hetzelfde model en dezelfde criteria |
Waarom volledige dekking het startpunt is, niet het antwoord
Het zou handig zijn om het betoog hier af te sluiten: scoor elk gesprek in plaats van 3% ervan en het aansturingsprobleem verdwijnt. Een paar jaar geleden was dat een verdedigbare stelling. Nu niet meer.
100% van de gesprekken scoren (in het Engels) is gewoon geworden. De meeste serieuze platforms voor geautomatiseerde kwaliteitscontrole doen het, en wie leveranciers vergelijkt, hoort van allemaal hetzelfde getal. Dekking is de voorwaarde om een uitbestede operatie aan te sturen. Het is niet wat die aansturing betrouwbaar maakt.
Zodra elke leverancier zegt elk gesprek te lezen, blijft er maar één vraag over: kun je dat lezen controleren?
Twee dingen bepalen dat.
Kun je de score herleiden tot het bewijs?
Een kwaliteitsscore is een bewering totdat iemand hem kan openen en het specifieke moment in het gesprek kan zien dat hem opleverde. Krijgt een BPO-medewerker een lagere score voor een compliancefout, dan moet de accountmanager op het criterium kunnen klikken en uitkomen bij de zin die het veroorzaakte. Zonder dat heeft de opdrachtgever het ene niet-controleerbare getal ingeruild voor een ander, sneller getal. Herleidbare scores (in het Engels) maken een gesprek over aansturing mogelijk in plaats van een patstelling.
Is de beoordelaar onafhankelijk van het beoordeelde werk?
Dit is het structurele punt. De leverancier hoort niet de enige auteur van zijn eigen kwaliteitsscore te zijn, om dezelfde reden waarom accountants niet werken voor het bedrijf dat ze controleren.
Hoe dit bij medewerkers aankomt
Volledige dekking is makkelijk verkeerd te brengen. Horen uitbestede medewerkers dat nu elk gesprek wordt gelezen, dan denken ze begrijpelijkerwijs aan toezicht, en QA-programma’s die klinken als monitoring stuiten op weerstand die geen dashboard oplost. De eerlijke uitleg is ook de juiste: dekking haalt de selectiebias weg. Bij een steekproef van 3% bleef het meeste goede werk onzichtbaar en kon één ongelukkig ticket een heel kwartaal bepalen. Programma’s die medewerkers vertrouwen (in het Engels) zijn de programma’s die dat argument als eerste maken.
Wat één gedeelde scorecard verandert bij meerdere leveranciers
Weinig bedrijven blijven bij één partner. Een volwassen organisatie heeft misschien een nachtleverancier in de ene regio, een tweetalige partner in een andere en een intern team voor complexe escalaties van enterprise-klanten. Elk komt met een eigen kwaliteitssysteem, eigen criteria en eigen analisten.
Het resultaat is drie kwaliteitsscores die niet te vergelijken zijn. Leverancier A rapporteert 94%, leverancier B rapporteert 91%, en er is geen manier om te weten of dat verschil echt is of een bijproduct van twee verschillend gewogen sets criteria. Ondertussen wordt het interne team in een vierde systeem gemeten, zodat niemand de enige commercieel relevante vraag kan beantwoorden: wie is er echt beter, en tegen welke kosten?
Alle partners op één scorecard zetten verandert vier dingen tegelijk.
- Vergelijken wordt mogelijk. Dezelfde criteria, op dezelfde manier gewogen, door hetzelfde model toegepast op elk gesprek van elke leverancier. Hoe je de criteria weegt wordt een beslissing die je één keer bewust neemt, in plaats van een die elke leverancier voor je neemt.
- SLA-handhaving krijgt een bewijsbasis. Een contractueel kwaliteitsdoel is alleen afdwingbaar als beide partijen de meting accepteren. Een herleidbare score bij volledige dekking houdt stand in een commerciële review, een zelfgerapporteerde steekproef niet.
- Coaching wordt specifiek. In plaats van een algemene opdracht om de afhandeltijd te verbeteren, zie je dat een bepaalde groep op een bepaald criterium faalt bij een bepaald type ticket. Dat is het detailniveau dat coaching echt nodig heeft (in het Engels).
- Routeringsbeslissingen krijgen bewijs. Welke partner de volgende volumestijging moet opvangen, is dan geen inkooponderhandeling meer maar een datavraag.
Zie je eigen leveranciersmix op één scorecard. Neem de gesprekken van vorige maand van elke partner mee. Wij scoren ze op één set criteria en laten zien waar de leveranciers echt verschillen. Demo boeken
Waarom dit ook goed nieuws is voor de BPO
Het is makkelijk om over uitbestede kwaliteit te schrijven alsof de leverancier het probleem is. Die benadering is populair, ze zet partijen tegen elkaar op en ze klopt grotendeels niet. BPO’s willen geen slechte gesprekken leveren. Hun hele verdienmodel draait om service die de opdrachtgever zelf moeilijk zo goedkoop kan leveren, en een opdrachtgever die de kwaliteit niet kan zien, onderhandelt alleen nog over de prijs.
Een leverancier die zijn kwaliteit niet kan aantonen, kan alleen op tarief concurreren. Bewijs is wat een goede BPO in staat stelt te pleiten voor iets beters dan het goedkoopste bod.
De maandelijkse, zelf beoordeelde spreadsheet is ook voor de outsourcingpartner een slechte deal. Hij wekt wantrouwen waar de partner geen antwoord op heeft, maakt van elk kwaliteitsgesprek een discussie over methodiek en geeft de leverancier geen enkele manier om te laten zien dat zijn team beter is dan een goedkopere concurrent. Een gedeelde, herleidbare scorecard vervangt dat allemaal door een vastlegging die beide kanten op dezelfde manier lezen.
Dit is geen theorie. EverHelp, een outsourcingleverancier, zette zijn eigen operatie over op geautomatiseerde kwaliteitscontrole en verhoogde de QA-beoordelingen met 270% terwijl zijn interne kwaliteitsscore stabiel bleef, en verkortte de tijd die zijn teamleiders kwijt waren aan het voorbereiden van coachingsessies met 75%. Dat is een leverancier die beoordeling gebruikt als commerciële troef, niet een die zich aan een audit onderwerpt. Het volledige verhaal van EverHelp (in het Engels) is het lezen waard als je aan de leverancierskant van deze relatie zit.
Hoe het er van beide kanten goed uitziet
- De opdrachtgever ziet de kwaliteit doorlopend in plaats van maandelijks, en kan elke score die hij in twijfel trekt verklaren.
- De leverancier toont zijn prestaties aan met bewijs in plaats van beweringen, en kan wijzen op de specifieke coaching die hij als reactie heeft gegeven.
- Beide partijen discussiëren over dezelfde gesprekken in plaats van over wiens criteria eerlijker zijn.
- Kalibratie tussen reviewers van de opdrachtgever en reviewers van de leverancier wordt een geplande oefening in plaats van een bron van wrijving. Kalibratiesessies houden (in het Engels) is hoe beide kanten het eens blijven over wat de criteria betekenen.
Zo zet je een uitbesteed programma op één scorecard
Dit hoeft niet te beginnen als heronderhandeling van het contract. In de praktijk is de volgorde die werkt bewust niet bedreigend.
- Spreek de criteria af voordat je iets meet. Schrijf ze samen met de leverancier. Criteria die een partner opgelegd krijgt, leveren geschillen op; criteria die je samen opstelt, leveren een basis op. Wat er in je beoordelingscriteria thuishoort is een lastigere vraag dan het lijkt.
- Begin in schaduwmodus. Scoor elk gesprek zonder consequenties aan de uitkomst te verbinden, en vergelijk het resultaat met de bestaande steekproefscores van de leverancier. Shadow scoring (in het Engels) is hoe beide kanten vertrouwen opbouwen in de beoordelaar voordat er iets van afhangt.
- Valideer de beoordelaar op je eigen gesprekken. Neem een set tickets die je team al met de hand heeft gescoord, haal ze erdoorheen en kijk waar de twee verschillen en waarom. AI-scoring valideren (in het Engels) op een bekende set is de stap die de meeste programma’s overslaan en later betreuren.
- Publiceer vanaf dag één hoe bezwaar werkt. Medewerkers en teamleiders hebben een vaste manier nodig om een score aan te vechten en de herbeoordeling te zien. Een werkend bezwaarproces (in het Engels) is wat een aansturingsinstrument onderscheidt van een instrument voor toezicht.
- Koppel het pas daarna aan de commerciële review. Zodra beide kanten de meting vertrouwen, kan die gewicht krijgen in de SLA.
Is jouw BPO-aansturing controleerbaar? Negen vragen
Vink elke uitspraak aan die je vandaag met bewijs kunt onderbouwen, niet met een toezegging van de leverancier.
- Ik weet welk percentage van mijn uitbestede gesprekken vorige maand is beoordeeld.
- Ik weet wie de beoordeelde gesprekken heeft geselecteerd.
- Elke leverancier en elk intern team wordt gescoord op dezelfde criteria, op dezelfde manier gewogen.
- Ik kan elke afzonderlijke score openen en het bewijs zien in het gesprek dat hem opleverde.
- Ik zou een specifieke score in een leveranciersreview kunnen aanvechten en hem op basis van de vastlegging kunnen afhandelen.
- Ik weet welke foutcategorie me het meest kost, over alle leveranciers heen.
- Medewerkers bij de leverancier hebben een vaste manier om bezwaar te maken tegen een score.
- Mijn kwaliteitsmeting is onafhankelijk van de partij die wordt gemeten.
- Ik zou vandaag kunnen zeggen welke van mijn partners de beste kwaliteit per kosteneenheid levert.
Zes vinkjes of minder betekent dat je kwaliteitsrapportage een bewering is en geen vastlegging. Dat is het normale startpunt, en het is op te lossen zonder van leverancier te wisselen.
De vraag die je bij de volgende leveranciersreview moet stellen
Van de klanten die het afgelopen kwartaal zijn vertrokken: hoeveel hadden gesprekken die door een outsourcingpartner werden afgehandeld, en wat gebeurde er in die gesprekken?
De meeste bedrijven kunnen dat niet beantwoorden, omdat die gesprekken bij de 97% hoorden die niemand las. Het antwoord is niet om support weer in huis te halen. Het is om een zelfgerapporteerde steekproef niet langer als aansturing te accepteren, wanneer het volume, de contractwaarde en de klantrelaties die op het spel staan allemaal een echte vastlegging verdienen.
UiPath automatiseert nu 100% van zijn QA met Kaizo, meet een rendement van 200% ten opzichte van zijn eigen uitgangssituatie en heeft zijn kwaliteitsscore met 8 punten verhoogd, terwijl die kwartaal na kwartaal blijft verbeteren. Op die schaal is kwaliteitsmeting geen operationele taak meer, maar input voor hoe het bedrijf wordt gerund.
Het werk uitbesteden was de juiste keuze. De standaard bewaken is het deel dat je niet delegeert.
Veelgestelde vragen
Wat is kwaliteitscontrole bij een BPO?
Kwaliteitscontrole bij een BPO is het beoordelen van de kwaliteit van klantgesprekken die een outsourcingpartner afhandelt, aan de hand van vastgestelde criteria. Traditioneel doen kwaliteitsanalisten in dienst van de BPO dat: ze beoordelen handmatig een steekproef van 2% tot 3% van de tickets en rapporteren elke maand scores aan de opdrachtgever. Moderne programma’s beoordelen elk gesprek automatisch op één set criteria die opdrachtgever en leverancier delen, zodat beide partijen dezelfde vastlegging lezen.
Welk percentage van de tickets beoordeelt een typisch BPO-kwaliteitsprogramma?
Tussen 2% en 3% van het totale ticketvolume is de gebruikelijke bandbreedte bij handmatige steekproeven, waardoor 97% tot 98% van de gesprekken onbeoordeeld blijft. Bij een volume van 15.000 gesprekken per maand betekent een steekproef van 3% dat 450 gesprekken worden gelezen en 14.550 niet. De omvang van de steekproef doet er minder toe dan het feit dat fouten die af en toe in plaats van voortdurend voorkomen er nauwelijks in terechtkomen.
Waarom is QA op steekproefbasis een probleem als support is uitbesteed?
Twee redenen versterken elkaar. Ten eerste kan een kleine steekproef zeldzame fouten niet betrouwbaar opsporen, en zeldzame fouten zijn meestal de dure. Ten tweede heeft de opdrachtgever geen onafhankelijke manier om het resultaat te controleren als de leverancier de steekproef kiest en scoort. De score kan best kloppen, maar het is een bewering en geen vastlegging, en daar is commercieel moeilijk op te handelen.
Is 100% van de gesprekken scoren genoeg om de aansturing van een BPO op orde te brengen?
Nee. Volledige dekking is inmiddels standaard bij serieuze platforms voor geautomatiseerde kwaliteitscontrole, dus het onderscheidt de ene aanpak niet meer van de andere. Waar het om gaat, is of elke score te herleiden is tot het specifieke bewijs in het gesprek dat hem opleverde, en of de beoordelende partij onafhankelijk is van het beoordeelde werk. Dekking is de voorwaarde; herleidbaarheid en onafhankelijkheid maken de meting betrouwbaar.
Hoe vergelijk je twee BPO-leveranciers eerlijk?
Zet beide op dezelfde criteria, identiek gewogen, door hetzelfde beoordelingsmodel toegepast op elk gesprek van elke leverancier. Zolang elke partner zijn eigen kwaliteitssysteem onderhoudt, zijn de gerapporteerde scores niet vergelijkbaar, want het verschil tussen 94% en 91% kan volledig verklaard worden door hoe elke set criteria is opgebouwd in plaats van door een verschil in de gesprekken.
Werkt deze aanpak voor de BPO net zo goed als voor de opdrachtgever?
Ja, en voor een capabele leverancier is het meestal een betere deal. Zonder gedeeld bewijs kan een BPO alleen op tarief concurreren, omdat hij niet kan aantonen dat zijn service beter is dan een goedkoper bod. Met een herleidbare scorecard kan een leverancier kwaliteit aantonen, gericht coachen en zijn positie verdedigen in een commerciële review. EverHelp, een outsourcingleverancier, verhoogde de QA-beoordelingen met 270% met geautomatiseerde kwaliteitscontrole en verkortte de voorbereidingstijd voor coaching met 75%.
Moeten we van BPO-leverancier wisselen om dit op te lossen?
Meestal niet. De meetlaag ligt via de helpdesk over de bestaande operatie heen in plaats van de tools van de leverancier te vervangen, dus dezelfde partners blijven hetzelfde werk doen terwijl beide kanten een gedeelde vastlegging krijgen. De meeste programma’s beginnen in schaduwmodus, scoren gesprekken zonder commerciële gevolgen en koppelen het resultaat pas aan SLA-reviews als beide partijen de beoordelaar vertrouwen.
Met welke helpdesks werkt Kaizo voor uitbestede operaties?
Kaizo integreert native met Zendesk en Salesforce Service Cloud. Omdat de integratie native is en geen generieke connector, ligt de beoordelingslaag direct over de gesprekken die je leveranciers al afhandelen. Daarom wordt de onboarding gemeten in dagen in plaats van maanden.
Verder lezen
- De kosten per eenheid van uitbestede support zonder toezicht (in het Engels)
- Waarom je BPO productteams nooit vertelt wat er stuk is (in het Engels)
- Kennishiaten bij BPO-medewerkers opsporen (in het Engels)
- Wat is een steekproef in kwaliteitsmonitoring?
- Handmatige vs. geautomatiseerde kwaliteitscontrole
- Herleidbaarheid van QA-scores (in het Engels)
- Kaizo voor BPO’s
Zet elke leverancier op dezelfde scorecard
Neem een maand aan gesprekken mee van elk van je outsourcingpartners. Wij scoren ze allemaal op één set criteria en laten je, met het bewijs erbij, zien waar de leveranciers echt verschillen.
Klaar voor de EU AI Act . SOC 2- en ISO 27001-gecertificeerd . Native integraties met Zendesk en Salesforce Service Cloud