Naar de inhoud

Metrics

KPI's voor AI in de klantenservice die ertoe doen

KPI's voor AI in de klantenservice: welke metrics laten zien of je AI-agents problemen echt oplossen, en welke cijfers je niet meer aan de directie voorlegt.

· 16 min. lezen

Gecontroleerd door Dominik Blattner, oprichter van Kaizo

Op deze pagina

Containment rate en CSAT na een AI-gesprek, de twee KPI’s voor AI in de klantenservice die de meeste teams rapporteren, zijn ook de meest misleidende. Beoordeel in plaats daarvan elk gesprek op oplossing, nauwkeurigheid, escalatie en herhaalcontact, met elke score gekoppeld aan het bewijs in het gesprek.

In het kort

  • Containment telt een gefrustreerde afhaker als succes.
  • CSAT na een AI-gesprek hoort nooit iets van de klanten die het opgaven.
  • Herhaalcontacten en stille afhakers vangen op wat containment verbergt.
  • Elke score moet terug te leiden zijn tot bewijs in het transcript.

Waarom de twee standaard-KPI’s voor AI in de klantenservice misleiden

Elke supportleider die AI inzet, krijgt van de directie dezelfde vraag: bewijs dat het werkt. De twee cijfers waar als eerste naar wordt gegrepen, zijn de containment rate en CSAT na een AI-gesprek, omdat ze allebei makkelijk op te halen zijn en allebei de goede kant op lijken te gaan als je niet al te goed kijkt. Het zijn ook de twee cijfers die het minst zeggen over wat er werkelijk met je klanten is gebeurd.

Het probleem is structureel, geen kwestie van bijstellen. Containment meet een routeringsuitkomst: heeft een mens dit gesprek aangeraakt? CSAT na een AI-gesprek meet een mening, maar alleen de mening van mensen die ervoor kozen er een te geven. Geen van beide kijkt naar de inhoud van het gesprek, en alleen daar ligt het antwoord. Dat is een heel ander probleem dan wat de standaardmethode om de prestaties van een AI-agent te meten oplost, en een heel ander probleem dan kiezen welke van de algemene KPI’s voor de klantenservice op je dashboard thuishoren. Dit gaat over welke cijfers stilletjes tegen je liegen.

Hier is de korte versie van het argument, metric voor metric, voordat we elk ervan in detail bespreken.

MetricWat hij zou laten zienWaarom hij misleidtWat je in plaats daarvan meet
Containment / deflection rateDe AI heeft het gesprek succesvol afgehandeldTelt afhaken en afschepen als succes, omdat er geen mens bij betrokken wasOplossingskwaliteit plus het percentage stille afhakers
CSAT na een AI-gesprekKlanten zijn tevreden over de AIIngevuld door een zelfgeselecteerde minderheid, en de kwaadste klanten vertrekken gewoonHerhaalcontactpercentage en oplossingskwaliteit op 100% van de gesprekken
Gemiddelde afhandeltijd van AI-gesprekkenDe AI is snelEen snel fout antwoord is sneller dan een langzaam goed antwoordFeitelijke nauwkeurigheid en kosten per echt opgelost contact
EscalatiepercentageMinder escalaties betekent dat de AI het redtEscalaties onderdrukken is makkelijk en schadelijk; timing en overdracht zijn belangrijkerEscalatiekwaliteit: het juiste moment, de volledige context
Volume afgehandeld door AISchaal en ROIZegt niets over wat er binnen dat volume is gebeurdNaleving van beleid, gescoord op je eigen criteria

Containment rate: de metric die afschepen beloont

De containment rate, soms deflection rate genoemd, is het aandeel gesprekken dat eindigde zonder dat er een menselijke medewerker bij betrokken raakte. Het werd de standaardmetric voor AI omdat hij direct aansluit op de business case: elk gesprek dat binnen de AI blijft, is een contact waarvoor je geen mens hoefde te betalen.

De fout zit in de definitie. Containment vraagt niet of de klant kreeg waarvoor hij kwam. Het vraagt of er iemand anders bij gehaald moest worden. Dat betekent dat verschillende, heel uiteenlopende uitkomsten allemaal op dezelfde manier als succes worden geteld:

  • De echte oplossing: de klant stelde een vraag, de AI antwoordde correct en de klant vertrok tevreden. Dit is de uitkomst waarvoor de metric is ontworpen.
  • De afhaker: de klant vroeg het drie keer, kreeg een variant van hetzelfde nutteloze antwoord en sloot het venster. Er was geen mens bij betrokken, dus het telt als containment.
  • Het afschepen: de AI kon of wilde niet overdragen, bleef artikelen uit het helpcentrum aanbieden, en de klant gaf het op en ging in plaats daarvan naar social media of de reviews in de app store.
  • Het verplaatste contact: de klant sloot de chat en belde de klantenservicelijn, stuurde een e-mail of opende de volgende dag een nieuw ticket. Binnen het ene kanaal gehouden, maar in een ander kanaal kost het je nog steeds geld.

Drie van die vier zijn mislukkingen, en het afschepen is zelfs erger dan niets doen. Toch kan een containmentcijfer ze niet van elkaar onderscheiden, want de informatie die het verschil maakt zit in het gesprek, en containment kijkt daar nooit.

Dit is geen pleidooi om containment los te laten. Het is een nuttige input voor capaciteit en kosten. Het is een pleidooi om het niet als kwaliteitsmetric te rapporteren, want containment direct optimaliseren betekent dat je het klanten moeilijker maakt om een mens te bereiken. Dat is precies het gedrag dat niemand wil en dat iedereen herkent zodra hij zelf klant is.

CSAT na een AI-gesprek: de metric die nooit hoort van wie vertrok

CSAT (in het Engels) is een goede metric in zijn oorspronkelijke context: een gesprek met een mens, een redelijk responspercentage, een stabiele groep die hem invult. Vastgeschroefd aan een AI-gesprek ontwikkelt hij een specifieke en ernstige blinde vlek.

Zelfselectie op precies het verkeerde moment

Enquêteantwoorden komen van een minderheid van de klanten, en die minderheid is nooit willekeurig. Mensen die er sterk genoeg over denken om te reageren, zitten vaker aan een van beide uitersten. Maar de faalwijze van AI die het meest telt, de klant die stilletjes concludeert dat dit nergens heen gaat en afhaakt, is precies de klant die achteraf de kleinste kans heeft om een enquête in te vullen. Die is niet gebleven om ondervraagd te worden. Dat zijn de stille afhakers, en CSAT na een AI-gesprek is structureel doof voor hen.

De enquête vraagt naar het verkeerde

Zelfs bij de mensen die wel reageren, haalt een tevredenheidsscore door elkaar of het antwoord klopte, of de toon prettig was en of de uitkomst er een was die de klant wilde horen. Een AI die charmant is en vol overtuiging het verkeerde zegt, kan goed scoren. Een AI die correct een beleidsantwoord geeft waar de klant niet blij mee is, kan slecht scoren. Geen van beide uitkomsten vertelt je of het systeem werkt.

De vergelijking is in beide richtingen oneerlijk

Teams vergelijken vaak de CSAT van de AI met de CSAT van menselijke medewerkers en trekken daar conclusies uit. Die twee groepen zijn niet vergelijkbaar: de AI neemt meestal eerst de eenvoudige contacten met hoog volume die makkelijk tevreden te stellen zijn, en escaleert de moeilijke. Een flatterende AI-CSAT kan simpelweg betekenen dat de AI de makkelijke wachtrij kreeg. Een slechte kan betekenen dat de AI de wachtrij kreeg waarop niemand kon winnen.

Blijf CSAT meten. Behandel hem alleen niet langer als bewijs over je AI. Behandel hem als één signaal tussen meerdere, gewogen met de wetenschap dat hij alleen hoort van de mensen die bleven.

Oplossingskwaliteit: de ankermetric

Als je containment door één ding vervangt, vervang het dan door oplossingskwaliteit: heeft dit gesprek het probleem van de klant werkelijk opgelost? Het is het anker van het hele geheel, omdat elke andere metric hier ofwel een input ervoor is, ofwel een controle erop.

Wat het is. Een oordeel, gevormd op basis van het transcript, over de vraag of het onderliggende probleem van de klant is aangepakt. Niet of een ticket is gesloten, niet of er een antwoord is verstuurd, niet of de intentie is herkend. Of datgene wat voor de klant moest gebeuren, ook is gebeurd.

Hoe je het meet. Als gescoord criterium in je beoordelingscriteria voor kwaliteitsmonitoring, toegepast op gesprekken die de AI afhandelt precies zoals op gesprekken die mensen afhandelen. Het criterium moet zo geschreven zijn dat een reviewer en een geautomatiseerde beoordelaar het op dezelfde manier zouden lezen: leg per belangrijk contacttype vast welk bewijs in het transcript als oplossing telt. Terugbetaling gevraagd en terugbetaling bevestigd. Adres gewijzigd en wijziging bevestigd aan de klant. Vraag gesteld en juist antwoord gegeven, waarbij de klant aangeeft het te hebben begrepen.

Hoe een slecht cijfer eruitziet. Het signaal om op te letten is geen absolute drempel, maar het gat tussen oplossingskwaliteit en containment. Als een groot deel van de gesprekken binnen de AI blijft, maar een veel kleiner deel als opgelost wordt gescoord, dan is dat gat de omvang van je probleem, uitgedrukt in gesprekken. Het is ook het cijfer dat het waard is om aan de directie voor te leggen, want het is de eerlijke versie van het cijfer dat ze te zien kregen.

Let op: dit is bewust strenger dan first contact resolution (in het Engels), dat een oplossing afleidt uit het uitblijven van een vervolgcontact. FCR is een nuttige benadering. Oplossingskwaliteit leest het transcript in plaats van conclusies te trekken uit stilte, en stilte is precies wat een afhakende klant oplevert.

Feitelijke nauwkeurigheid en hallucinatiepercentage

Een AI-agent (in het Engels) die een terugbetalingstermijn verzint, een levertermijn verkeerd noemt of vol overtuiging een functie beschrijft die je niet hebt, is geen kwaliteitsprobleem maar een aansprakelijkheidsprobleem. Feitelijke nauwkeurigheid is de metric die dat opvangt, en het is de metric waarvoor de meeste teams helemaal geen meting hebben.

Wat het is. Het aandeel AI-antwoorden met een feitelijke bewering die te controleren is aan de hand van je kennisbank, beleidsdocumenten of bestelgegevens, en het aandeel van die beweringen dat klopt. Het hallucinatiepercentage is het omgekeerde: beweringen die vol overtuiging worden gedaan en door geen enkele bron worden ondersteund.

Hoe je het meet. Elke feitelijke bewering in een gesprek wordt gecontroleerd aan de hand van de bron die als waarheid geldt. Dat is alleen haalbaar als het automatisch gebeurt, op volume, en dat is een van de sterkste argumenten om elk gesprek te scoren in plaats van een steekproef te nemen: een hallucinatie in de 98% die je niet hebt gelezen, kost precies evenveel als een in de 2% die je wel hebt gelezen. Volg het apart per contacttype, want nauwkeurigheid is zelden gelijkmatig. Vragen over facturen en vragen over verzending gedragen zich meestal heel verschillend.

Hoe een slecht cijfer eruitziet. Elk percentage boven nul bij beweringen met juridisch, financieel of veiligheidsgewicht is een slecht cijfer, hoe klein ook. Bij beweringen met minder op het spel gaat het om de richting: een hallucinatiepercentage dat stijgt na een wijziging in de kennisbank of een modelupdate vertelt je iets specifieks en dringends over die wijziging.

Eén waarschuwing: de AI die het antwoord genereerde, is geen betrouwbare rechter over de vraag of dat antwoord klopte. Nauwkeurigheid moet beoordeeld worden door iets buiten het systeem dat het antwoord produceerde. Datzelfde principe zit erachter dat LLM as a judge (in het Engels) gescheiden blijft van het model dat wordt beoordeeld.

Escalatiekwaliteit: niet hoe vaak, maar hoe goed

Het escalatiepercentage wordt gerapporteerd alsof lager beter is. Dat is het niet. Escalatie is een functie, en een AI die nooit escaleert, is geen sterke AI maar een klant die vastzit. Waar het om gaat, is escalatiekwaliteit: vond de overdracht op het juiste moment plaats en kwam ze aan met de juiste context?

Timing

De twee faalwijzen liggen aan weerszijden van het juiste moment. Te vroeg escaleren verspilt de automatisering volledig en irriteert een klant die een eenvoudige vraag had. Te laat escaleren, na drie of vier mislukte rondjes, betekent dat de mens een klant erft die al boos is en een gesprek dat opnieuw moet beginnen. Scoor het moment: was er een herkenbare beurt waarop een competente overdracht had moeten plaatsvinden, en gebeurde het daar?

Overdracht van context

De duurste escalatiefout is die waarbij de menselijke medewerker het gesprek opent en de klant moet vragen alles opnieuw uit te leggen. Dat ene gedrag maakt de goodwill van de hele AI-interactie ongedaan. Scoor of de overdracht het probleem bevatte dat de klant had genoemd, wat er al was geprobeerd en alle account- of bestelcontext die de AI al had opgehaald.

Juistheid

Was escaleren eigenlijk wel de juiste keuze? Een AI die elk dubbelzinnig bericht escaleert, creëert voor niets werk voor mensen, en dat zie je terug in de kosten per opgelost contact in plaats van in de kwaliteitsscores. Beide richtingen moeten gescoord worden, anders verschuif je het probleem bij het optimaliseren alleen van de ene naar de andere kant.

Hoe een slecht cijfer eruitziet. Een dalend escalatiepercentage samen met een dalende score voor oplossingskwaliteit is het duidelijkste slechte signaal in dit hele artikel. Het betekent dat de AI vasthoudt aan gesprekken die hij niet kan afronden.

Herhaalcontactpercentage en percentage stille afhakers

Deze twee staan bij elkaar omdat het je goedkoopste leugendetectors zijn. Ze vangen allebei mislukkingen op die containment als succes telt, en geen van beide vraagt een klant om iets in te vullen.

Herhaalcontactpercentage na een AI-gesprek

Wat het is. Het aandeel klanten dat binnen een vastgestelde periode, via welk kanaal dan ook, terugkomt over hetzelfde onderliggende probleem na een gesprek dat de AI afhandelde.

Hoe je het meet. Koppel contacten per klant en per probleem, niet per ticket, en kijk specifiek over kanalen heen. Een klant die een chat afbrak en daarna belde, is het allerbelangrijkste geval om op te vangen, en een overzicht per kanaal mist die volledig. Stem de periode af op je product: dezelfde dag bij een leveringsprobleem, een week of langer bij een factuurgeschil.

Hoe een slecht cijfer eruitziet. Een herhaalcontactpercentage dat na afhandeling door AI hoger ligt dan bij vergelijkbare contacten die mensen afhandelen, is een alarmsignaal, wat de absolute waarde ook is. Het betekent dat containment werk heeft verplaatst in plaats van weggenomen.

Percentage stille afhakers

Wat het is. Het aandeel AI-gesprekken dat de klant verlaat zonder oplossing en zonder escalatie. Geen enquête, geen klacht, geen vervolgcontact. Deze gesprekken zien er in elke metric die op routering is gebaseerd precies hetzelfde uit als successen.

Hoe je het meet. Zoek de gesprekken die eindigden met een beurt van de klant, of waarbij het laatste bericht van de AI onbeantwoord bleef, en scoor of het probleem op dat moment was opgelost. Tevreden vertrekkers scheiden van stille afhakers is een oordeel op basis van het transcript, en precies daarom staat deze metric op de meeste dashboards niet: je kunt hem niet tellen, je moet hem lezen.

Hoe een slecht cijfer eruitziet. Elk percentage stille afhakers dat een betekenisvol deel van je containment rate is, betekent dat je containmentcijfer met precies dat deel is opgeblazen. Containment rapporteren zonder dit cijfer is een cijfer rapporteren waarvan je weet dat het niet klopt.

Naleving van beleid en kosten per echt opgelost contact

De laatste twee sluiten de cirkel tussen kwaliteit en de business case.

Naleving van beleid

Wat het is. Of de AI de regels volgde die hij moet volgen: de identiteit verifiëren voordat accountgegevens worden gedeeld, verplichte mededelingen doen, kortingen buiten het beleid weigeren, een kwetsbare klant of het melden van een klacht correct afhandelen, en binnen de voorgeschreven formuleringen blijven waar die van toepassing zijn.

Hoe je het meet. Dit zijn binaire criteria die met bewijs te controleren zijn, en daarmee het makkelijkste op deze lijst om automatisch te scoren en het schadelijkste om alleen steekproefsgewijs te controleren. Voer ze uit als checks met geslaagd of niet geslaagd op elk gesprek, en behandel elke keer niet geslaagd als een incident om te beoordelen in plaats van een percentage om weg te middelen. Het is dezelfde logica van beoordelingscriteria waarop je menselijke team al wordt gescoord, en daar draait het om: je interne kwaliteitsscore moet ook de AI omvatten, anders heb je twee standaarden en geen vergelijking.

Hoe een slecht cijfer eruitziet. Bij identiteitsverificatie en wettelijk verplichte mededelingen is één keer niet geslaagd al een slecht cijfer. Neem hier geen gemiddelde van.

Kosten per echt opgelost contact

Wat het is. De totale kosten van de AI-gesprekken gedeeld door het aantal gesprekken dat echt is opgelost, niet door het aantal dat binnen de AI is gebleven.

Hoe je het meet. Neem je score voor oplossingskwaliteit, pas die toe op je containmentvolume en gebruik het aantal dat je dan krijgt als noemer. Tel de kosten mee die de AI verderop in de keten veroorzaakte: herhaalcontacten, de extra afhandeltijd bij escalaties die zonder context binnenkwamen, en de tijd die mensen besteden aan het rechtzetten van fouten.

Hoe een slecht cijfer eruitziet. Als de kosten per echt opgelost contact niet duidelijk beter zijn dan bij de vergelijkbare afhandeling door mensen, verdient de inzet zichzelf niet terug, hoe goed de containmentgrafiek er ook uitziet. Dit is het cijfer dat een kwaliteitsargument verandert in een financieel argument, en dat is meestal het argument dat budget oplevert.

Waarom niets hiervan werkt met een steekproef of een enquête

Loop de zeven metrics nog eens door en voor elk ervan geldt hetzelfde: je moet het gesprek lezen. Oplossingskwaliteit is een oordeel over het transcript. Het hallucinatiepercentage is een controle van beweringen aan de hand van bronnen. Escalatiekwaliteit is een beoordeling van een specifieke beurt. Een stille afhaker is de afwezigheid van een signaal, en dat betekent dat je hem alleen vindt door te kijken naar gesprekken waarin niets gebeurde.

Dat heeft twee gevolgen die de meeste meetprogramma’s nog niet hebben verwerkt.

Steekproeven werken hier niet. Traditionele kwaliteitscontrole beoordeelt een klein percentage van de gesprekken, en voor een menselijk team van bekende omvang is dat een verdedigbaar statistisch compromis. Voor AI is het om twee redenen niet verdedigbaar. Ten eerste zijn AI-fouten systematisch in plaats van verspreid: een slecht kennisbankartikel of een randgeval in het beleid levert elke keer dat het voorkomt dezelfde fout op, dus een steekproef vangt ofwel het hele cluster, ofwel mist hem volledig. Ten tweede handelt AI veel meer volume af, dus is 2% een kleiner venster op een grotere operatie. Elk gesprek scoren (in het Engels) is de voorwaarde en niet het doel: het haalt de selectiebias weg die de andere zeven cijfers betekenisloos maakt. Het gaat er niet om iemand in de gaten te houden, het gaat erom dat je een steekproefregel niet laat bepalen wat je metrics zeggen.

Je zou een score niet op goed vertrouwen moeten hoeven aannemen. Eis dat elke score verwijst naar het exacte bewijs in het transcript waarop hij is gebaseerd, dat elke score kan worden aangevochten en door een mens kan worden beslecht, en dat de beoordelaar kan worden getest op een set gesprekken die je eigen reviewers hebben gescoord, zodat je per criterium het overeenstemmingspercentage ziet voordat je iets naar boven rapporteert. Een score die je kunt herleiden, is een score die je kunt aanvechten. Een score die je niet kunt herleiden, is een marketingclaim met een getal erbij.

Kaizo scoort AI-agents en je menselijke team op één set criteria die jij bepaalt, waarbij elke score terug te leiden is tot het transcript en te toetsen is aan je eigen referentieset. Kaizo past die criteria toe op al je gesprekken in plaats van op een uitgekozen deel. Bij UiPath automatiseerde die aanpak 100% van de kwaliteitscontrole, met 200% ROI en een stijging van 8% in de kwaliteitsscore. In de praktijk betekent het dat kwaliteitscontrole van AI-agents en kwaliteitscontrole van mensen niet langer twee aparte programma’s zijn die twee onvergelijkbare reeksen cijfers opleveren.

Veelgestelde vragen

Wat zijn de belangrijkste KPI’s voor AI in de klantenservice?

Oplossingskwaliteit, feitelijke nauwkeurigheid, escalatiekwaliteit, herhaalcontactpercentage, percentage stille afhakers, naleving van beleid en kosten per echt opgelost contact. Deze zeven beschrijven wat er werkelijk in het gesprek is gebeurd. Containment rate en CSAT na een AI-gesprek, de twee die het vaakst worden gerapporteerd, beschrijven in plaats daarvan routering en een zelfgeselecteerde mening, en daarom misleiden ze.

Wat is de containment rate en waarom is die misleidend?

De containment rate, ook wel deflection rate genoemd, is het aandeel gesprekken dat een AI afhandelde zonder dat er een mens bij betrokken raakte. Hij is misleidend omdat hij meet of er iemand anders bij gehaald moest worden, niet of de klant geholpen is. Een klant die het drie keer vroeg, nergens kwam en gefrustreerd het venster sloot, telt als containment, en een klant die het opgaf en in plaats daarvan belde ook.

Is CSAT een goede manier om AI-agents te meten?

Alleen als één signaal tussen meerdere. CSAT na een AI-gesprek wordt ingevuld door een kleine, zelfgeselecteerde groep, en de klanten bij wie je AI het zwaarst faalde, blijven het minst vaak hangen om een enquête in te vullen. Hij haalt ook juistheid en toon door elkaar, zodat een AI die vol overtuiging het verkeerde zegt goed kan scoren. Vergelijk hem met metingen op basis van het transcript in plaats van hem op zichzelf als bewijs te behandelen.

Hoe meet je of een AI-agent een probleem echt heeft opgelost?

Scoor oplossing als criterium in je QA-criteria, toegepast op het transcript in plaats van afgeleid uit de ticketstatus. Leg per contacttype vast welk bewijs in het gesprek als oplossing telt: de bevestigde terugbetaling, de aan de klant bevestigde wijziging, het juiste antwoord waarvan de klant aangeeft het te hebben begrepen. Vergelijk dat opgeloste aandeel daarna met je containment rate. Het gat tussen die twee is de omvang van het probleem.

Wat is het percentage stille afhakers?

Het is het aandeel AI-gesprekken dat een klant verlaat zonder oplossing en zonder escalatie: geen klacht, geen enquête, geen vervolgcontact. Deze gesprekken zijn onzichtbaar voor elke metric die op routering is gebaseerd, omdat er geen mens bij betrokken was, en zo blazen ze containment op. Om ze te vinden, moet je gesprekken lezen die eindigden met een beurt van de klant en beoordelen of het probleem echt was aangepakt.

Hoe weet je of je de beoordelaar van je AI kunt vertrouwen?

Door hem te controleren in plaats van hem op goed vertrouwen aan te nemen: vraag of elke score verwijst naar het specifieke bewijs in het transcript, en of hij je zijn overeenstemmingspercentage laat zien met gesprekken die je reviewers al hebben gescoord.

Verder lezen

Meet wat je AI-agents echt hebben gedaan

Zie je containment rate naast de score voor oplossingskwaliteit die erachter zit, beoordeeld op je eigen criteria. Elke score leidt terug naar het bewijs in het transcript, en je kunt hem toetsen aan gesprekken die je reviewers al hebben gescoord.

Demo boeken Ontdek Agentic Auto QA Bekijk Kaizo Insights

Op deze pagina

Zie dit op je eigen gesprekken

We scoren een steekproef van je echte tickets op basis van jouw standaarden, zodat het voorbeeld van jou is.

Vertrouwd door internationale supportteams

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart