De deflection rate in je klantenservice telt contacten die nooit bij een mens terechtkwamen, dus hij meet volume, nooit kwaliteit. Een juist antwoord, een klant die het opgaf en een zelfverzekerd fout antwoord zien er hetzelfde uit, en de meeste QA-programma’s beoordelen die gesprekken nooit.
In het kort
- Het zelfverzekerd foute antwoord kost het meest, omdat het nooit escaleert.
- De meeste gepubliceerde benchmarks komen van leveranciers die zelf op deze metric worden afgerekend.
- Herhaalcontact binnen zeven dagen is de goedkoopste check, en die data staat al in je helpdesk.
- Laat je gedeflecte tickets buiten de beoordeling, dan mis je het complete werk van je bot.
Wat meet de deflection rate eigenlijk?
De deflection rate is het aandeel inkomende contacten dat werd afgesloten zonder dat een menselijke medewerker eraan te pas kwam. De gebruikelijke formule is gedeflecte contacten gedeeld door het totaal aantal contacten, waarbij gedeflect betekent dat selfservice of een AI-agent het van begin tot eind afhandelde.
Lees die definitie nog eens, want het hele probleem zit erin. De teller wordt bepaald door iets wat niet gebeurde: er kwam geen mens aan te pas. Niets in de meting vraagt of het probleem van de klant is verdwenen.
Daarom gedraagt de metric zich zo vreemd onder druk. Maak je helpcentrum moeilijker te verlaten en de deflection stijgt. Verstop het contactformulier achter drie klikken en de deflection stijgt. Laat de bot zelfverzekerd antwoorden in plaats van over te dragen als hij twijfelt en de deflection stijgt. In elk geval wordt het getal beter en de klantervaring slechter, en dat is precies het kenmerk van een metric die het verkeerde meet.
Dat maakt het nog geen nutteloos getal. Deflection is een prima maat voor capaciteit, en capaciteit is iets wat je echt moet sturen. Het is niet meer bruikbaar zodra iemand het als kwaliteitsmaat leest, en dat gebeurt in de meeste organisaties ongeveer in de tweede week.
Onthoud
De deflection rate is een volumemetric in de kleren van een kwaliteitsmetric. Hij vertelt je hoeveel werk je bot heeft opgevangen. Hij kan je niet vertellen of dat werk ook gedaan is.
Waarom zien vier verschillende uitkomsten er in de data hetzelfde uit?
Een gedeflect ticket heeft minstens vier mogelijke uitkomsten, en je rapportage vat ze alle vier samen in één rij. Dit is het allerbelangrijkste om te begrijpen over deze metric, en het is de reden dat twee teams met dezelfde deflection rate in totaal verschillende mate in de problemen kunnen zitten.
Loop de tabel hieronder door met je eigen product in gedachten. De meeste teams kunnen binnen een paar minuten van alle vier een echt voorbeeld noemen, en dat is op zich al de bevinding.
| Wat er echt gebeurde | Wat de klant ervoer | Hoe het eruitziet in de deflection-data | Waar het in plaats daarvan opduikt |
|---|---|---|---|
| Echt opgelost | Kreeg het juiste antwoord en ging verder | Gedeflect | Nergens. Dit is het geval waarvoor je betaalt |
| Afgehaakt | Gaf het op en kwam niet terug | Gedeflect, identiek record | Churn, een stille niet-verlenging, een verloren bestelling |
| Door de klant omgeleid | Verliet de chat en belde, mailde of postte publiekelijk | Gedeflect, en het tweede contact telt vaak als nieuw ticket | Herhaalcontact en je eigen inkomende volume |
| Zelfverzekerd fout | Kreeg een duidelijk maar onjuist antwoord en handelde ernaar | Gedeflect, en vaak met positieve signalen aan de oppervlakte | Een terugbetaling, een klacht, een compliance-incident, weken later |
Deflection, containment en oplossing zijn niet hetzelfde getal
Deze drie worden in leveranciersmateriaal door elkaar gebruikt, terwijl ze echt iets anders betekenen. Het loont om ze helder te hebben voordat je over doelen praat.
- Deflection vraagt of het contact een mens bereikte. Het wordt gemeten bij de voordeur en is de losste van de drie.
- Containment vraagt of het gesprek binnen het geautomatiseerde kanaal bleef. Een contained gesprek (in het Engels) kan nog steeds slecht aflopen; het liep dan gewoon slecht af in de bot.
- Oplossing vraagt of het probleem van de klant weg is. Het is de enige van de drie die over de klant gaat, en de enige die je niet kunt meten zonder het de klant te vragen of het gesprek te lezen.
In het gat tussen containment en oplossing zit het geld. Een team dat 70% containment rapporteert en 70% oplossing aanneemt, maakt een ongecontroleerde sprong, en hoe groot die sprong is weet niemand tot iemand het meet. Meestal heeft niemand dat gedaan, want meten betekent hier gesprekken lezen in plaats van een dashboard openen.
Als een leverancier een oplossingspercentage rapporteert, controleer dan of het systeem zichzelf beoordeelt. Een AI-agent die zelf bepaalt of hij iets heeft opgelost, levert geen bewijs maar een zelfbeoordeling, en het NIST AI Risk Management Framework behandelt onafhankelijke meting van de prestaties van een AI-systeem juist als aparte functie omdat zelfgerapporteerde prestaties geen meting zijn. Dezelfde logica geldt andersom voor hoe nauwkeurig AI-beoordeling is: elke beoordelaar, mens of model, heeft een nauwkeurigheid nodig die door iets buiten zichzelf is vastgesteld.
Let op
Als je AI-agent zijn eigen oplossingspercentage rapporteert, is dat getal een zelfbeoordeling en moet het zo worden benoemd in elke presentatie waarin het staat. Het wordt pas bewijs als iets wat onafhankelijk is van de agent een steekproef ervan controleert.
Waarom is het zelfverzekerd foute antwoord het dure?
Een AI-agent die zelfverzekerd faalt, sluit het ticket. Een AI-agent die eerlijk faalt, escaleert het. Die ene asymmetrie bepaalt van welke fouten je hoort.
Elke escalatie is zichtbaar. Ze komt in een wachtrij, een mens leest haar, en als het erg genoeg is zegt iemand er iets van. De escalatieroute meldt zichzelf. Ondertussen wordt het gesprek waarin de bot een retourtermijn verzon, een prijs noemde die al twee jaar niet meer bestaat of iemand geruststelde dat zijn data was verwijderd terwijl dat niet zo was, als opgelost gemarkeerd en verdwijnt het uit beeld.
De fouten waar je vanzelf over hoort, zijn dus systematisch de verkeerde. Je hoort over de bijna-missers van de voorzichtige bot en blijft onwetend over de echte fouten van de zelfverzekerde. Dat zijn stille fouten, en de naam klopt precies: ze zijn niet zeldzaam, ze zijn stil.
Er is een tweede-orde-effect dat het benoemen waard is. Omdat escalaties zichtbaar zijn en deflection wordt beloond, werkt de druk op elke AI-inzet maar in één richting: minder escaleren. Teams stemmen af op zelfverzekerdheid. Een bot die is afgesteld om bij twijfel over te dragen, laat een slechtere deflection rate en een betere klantervaring zien, en als deflection het getal op het dashboard is, wordt die afweging precies verkeerd om gemaakt. Hoe de overdracht zelf is ontworpen en beoordeeld, telt zwaarder dan het percentage aan weerszijden ervan.
Tip
Sorteer je gedeflecte gesprekken op hoe zelfverzekerd het laatste bericht van de bot klinkt, niet op hun lengte. Korte, stellige afsluitende berichten zonder voorbehoud op niet-triviale vragen zijn waar de foute antwoorden zich ophopen.
Hoe audit je je eigen deflection rate?
Dit is het deel dat niemand publiceert. Het kost ongeveer een halve dag, en je kunt de eerste ronde deze week al doen zonder nieuwe tools.
Stap 1. Bouw de populatie op die je tot nu toe uitsloot
Haal elk gesprek uit de laatste volledige maand op dat werd afgesloten zonder mens. Niet de geëscaleerde, geen algemene steekproef van alle tickets: specifiek de gedeflecte populatie. De meeste QA-programma’s filteren deze standaard weg, omdat de beoordelingswachtrij rond medewerkers is gebouwd en aan deze gesprekken geen medewerker hangt. Dat filter is de blinde vlek.
Stap 2. Stratificeer voordat je een steekproef trekt
Trek geen platte willekeurige steekproef. Verdeel de populatie eerst in drie groepen, omdat het basispercentage fouten enorm verschilt tussen die groepen:
- Gedeflect, geen verder contact. De ogenschijnlijke successen, en de groep waarin de zelfverzekerd foute antwoorden het waarschijnlijkst zitten.
- Gedeflect, daarna binnen zeven dagen opnieuw contact. Met afstand de groep die het meest oplevert. Begin hier als je maar een uur hebt.
- Gedeflect bij een onderwerp waarin geld, identiteit of een beleidstoezegging zit. De grootste impact per fout, en waar het risico rond gegevensbescherming (in het Engels) ligt.
Twintig tot dertig gesprekken per groep is genoeg voor een eerste beeld. Je produceert nog geen statistisch verdedigbaar percentage; je stelt vast of er een probleem is en welke vorm het heeft. Wil je daarna een verdedigbaar getal, dan is de logica voor de omvang dezelfde als bij elke andere QA-steekproef.
Stap 3. Beoordeel met criteria die voor een bot zijn geschreven, niet voor een mens
Je bestaande scorecard werkt hier niet. De helft meet dingen die een bot niet slecht kan doen, en meet niet waar hij wel op faalt. Gebruik in plaats daarvan een scorecard voor AI-agents, en beoordeel alleen wat een lezer in het transcript kan controleren. Vier criteria dragen het grootste deel van het signaal:
- Feitelijke juistheid. Klopte elke bewering over beleid, prijs, termijn of recht? Dit is het criterium dat telt, en het criterium dat in je oude beoordelingscriteria vrijwel zeker ontbreekt.
- Volledigheid. Kreeg de klant alles wat hij nodig had, of een half antwoord dat het ticket sluit en een tweede contact garandeert?
- Oordeel over escalatie. Had dit naar een mens moeten gaan, en gebeurde dat?
- Eerlijke onzekerheid. Als de bot het niet wist, zei hij dat dan, of produceerde hij iets wat aannemelijk klonk?
Stap 4. Bereken het getal dat ertoe doet
Je echte getal is het aandeel gedeflecte gesprekken dat correct en volledig is opgelost. Reken erop dat het de eerste keer dat je het meet duidelijk lager ligt dan je gerapporteerde deflection rate. Dat gat is de eigenlijke bevinding, en het is in een gesprek met het management meer waard dan de deflection rate ooit was, omdat het herleidbaar is tot concrete gesprekken (in het Engels) die iedereen kan nalezen.
Doe dit maandelijks, met dezelfde stratificatie, en je hebt een trend. Op dat punt is het geen audit meer, maar kwaliteitscontrole voor je AI-agents.
Welke cijfers horen naast de deflection rate in je klantenservice?
Schrap de deflection rate niet. Omring hem, zodat hij niet los gelezen kan worden. Vier begeleidende cijfers doen het meeste werk, en elk daarvan kun je afleiden uit data die je al hebt.
- Herhaalcontact binnen zeven dagen na een deflection. De beste check qua waarde voor moeite die er is. Hij is objectief, vraagt geen enquête, en een klant die terugkomt is het duidelijkste signaal dat het eerste antwoord niet landde.
- Kwaliteit van escalaties, niet het escalatiepercentage. Als de bot wel overdroeg, was dat de juiste keuze, en kwam het met context aan? Het percentage alleen is dubbelzinnig, want een goede en een slechte inzet kunnen hetzelfde percentage opleveren. De kwaliteit van escalatieafhandeling is de leesbare versie.
- Ontevredenheid specifiek bij gedeflecte gesprekken. Haal die er apart uit in plaats van hem te laten opgaan in het totaalcijfer, waar een klein aantal zeer slechte geautomatiseerde interacties verdwijnt. Het ontevredenheidssignaal (in het Engels) is hier nuttiger dan tevredenheid, omdat de gedeflecte populatie nog minder op enquêtes reageert dan de algemene.
- Geverifieerd oplossingspercentage. De uitkomst van de audit hierboven. Dit is het getal voor het management, en het is het enige op de lijst waarvoor iemand een gesprek gelezen moet hebben.
Met de hand de gedeflecte populatie lezen is waar het begint, en ook waar het vastloopt, omdat het volume groot is en het basispercentage fouten zo laag dat handmatige beoordeling met een steekproef van 3% het niet betrouwbaar boven water haalt. Kaizo’s Auto QA beoordeelt door AI en door mensen afgehandelde gesprekken met dezelfde beoordelingscriteria, en dat maakt de vergelijking eerlijk. Het houdt de onderbouwing bij elk gesprek, zodat een gemarkeerd antwoord gecontroleerd kan worden in plaats van op goed vertrouwen aangenomen. Dat is de 100% dekking die trends laat zien die een steekproef van 3% nooit kon laten zien, toegepast op de populatie die nog nooit in de steekproef zat.
Wil je de bredere set metrics eromheen: prestaties van een AI-agent meten behandelt de operationele laag, en KPI’s voor AI in de klantenservice behandelt wat er op een dashboard hoort.
Waarom zou je elke gepubliceerde benchmark voor deze metric wantrouwen?
Kijk wie benchmarks voor deflection publiceert. Zoek op de term en de resultaten worden gedomineerd door bedrijven die de AI-agent verkopen waarvan de waarde in deflection wordt uitgedrukt. Dat is geen complot, het is een prikkel, en het is goed om die te benoemen omdat hij elk getal kleurt dat je zult vinden.
Drie concrete redenen waarom een gepubliceerde benchmark niet op jou van toepassing is:
- De noemer is niet gedefinieerd. Tellen paginaweergaven in het helpcentrum mee? Chats die binnen vier seconden werden geopend en gesloten? Contacten op kanalen die de bot niet bedient? Verschuif de noemer en je kunt de deflection twintig punten verplaatsen zonder dat er iets echts verandert.
- De contactmix bepaalt de uitkomst. Een team dat wachtwoordresets en bestelstatus afhandelt, haalt een hogere deflection dan een team dat factuurgeschillen afhandelt, met een verschil dat niets zegt over de kwaliteit van een van beide. Vergelijken over verschillende mixen heen is zinloos.
- Niemand publiceert zijn fouten. Benchmarks komen uit inzetten die bereid zijn geciteerd te worden, en dat is per definitie een gefilterde populatie.
De nuttige vergelijking is niet die met een branchecijfer, maar die met jezelf. Je geverifieerde oplossingspercentage van deze maand tegenover vorige maand, met dezelfde contactmix en dezelfde beoordelingscriteria, vertelt je iets wat waar is. Een branchebenchmark vertelt je iets wat citeerbaar is.
Veelgestelde vragen
Wat is een goede deflection rate?
Er is geen overdraagbaar antwoord, en elk getal dat als zodanig wordt genoemd verdient wantrouwen. Deflection hangt bijna volledig af van je contactmix en van hoe de noemer is gedefinieerd, dus een team dat bestelstatus afhandelt laat een veel hoger percentage zien dan een team met factuurgeschillen, zonder enig verschil in kwaliteit. De vergelijking die iets betekent, is je eigen geverifieerde oplossingspercentage van maand tot maand bij een stabiele contactmix.
Wat is het verschil tussen deflection rate en containment rate?
Deflection vraagt of een contact een mens bereikte. Containment vraagt of het gesprek binnen het geautomatiseerde kanaal bleef. Geen van beide vraagt of het probleem van de klant is opgelost, en dat is oplossing; oplossing kun je niet meten zonder het de klant te vragen of het gesprek te lezen. Een contained gesprek kan nog steeds slecht zijn afgelopen.
Hoe weet ik of mijn AI-agent foute antwoorden geeft?
Lees een gestratificeerde steekproef van de gesprekken die hij zonder escalatie afsloot, precies de populatie die de meeste QA-programma’s wegfilteren. Begin met gedeflecte gesprekken waarbij de klant binnen zeven dagen opnieuw contact opnam, omdat het foutpercentage in die groep veel hoger ligt dan in de algemene populatie. Beoordeel ze op feitelijke juistheid en volledigheid in plaats van op toon.
Betekent een hoge deflection rate dat mijn klanten tevreden zijn?
Nee, en het kan het tegenovergestelde betekenen. Deflection telt de afwezigheid van een mens, dus een klant die het opgaf, naar een ander kanaal overstapte of een zelfverzekerd fout antwoord accepteerde, levert hetzelfde record op als een klant die echt geholpen is. Een mens moeilijker bereikbaar maken verhoogt de deflection en verlaagt de tevredenheid, en daarom moet je de metric samen met herhaalcontact lezen.
Moet ik door AI afgehandelde gesprekken opnemen in mijn QA-programma?
Ja, en de meeste programma’s doen dat nu niet, omdat beoordelingswachtrijen rond medewerkers zijn gebouwd en aan deze gesprekken geen medewerker hangt. Als gedeflecte tickets buiten je steekproef vallen, heeft je zicht op kwaliteit een gat dat precies zo groot is als het werk van je bot. Beoordeel ze met criteria die voor een geautomatiseerde beantwoorder zijn geschreven, in plaats van de scorecard voor medewerkers te hergebruiken.
Gerelateerde onderwerpen
- Je AI-agent sluit tickets. Wie controleert hem? (in het Engels)
- Stille fouten van AI-agents
- Wat de containment rate wel en niet zegt (in het Engels)
- De scorecard voor AI-agents
- Kwaliteitscontrole voor AI-agents en chatbots
- QA van de overdracht tussen AI-agent en medewerker
Ontdek wat je deflection rate je echt heeft opgeleverd
Neem een maand aan gesprekken mee die je AI-agent zelf heeft afgesloten. We beoordelen ze met dezelfde beoordelingscriteria als je door mensen afgehandelde tickets en laten je het gat zien tussen gedeflect en echt opgelost.