Om de prestaties van een AI-agent te meten, volg je oplossing, nauwkeurigheid, escalatie, containment en sentiment, en beoordeel je daarna elk gesprek dat de AI afhandelt met een kwaliteitsscorecard. Gebruik dezelfde scorecard voor menselijke medewerkers, en een beoordelaar die onafhankelijk is van de AI die hij beoordeelt.
In het kort
- Een hoge containment rate zegt weinig zonder oplossing en nauwkeurigheid.
- Door het volume is een steekproef onbetrouwbaar, dus dek 100% van de AI-gesprekken af.
- Pak de prompts, guardrails en routing achter slechte scores aan, en meet daarna opnieuw.
Stap 1: Bepaal welke metrics er echt toe doen
Een hoge containment rate ziet er prachtig uit, totdat je ontdekt dat de bot zaken heeft vastgehouden die hij had moeten escaleren. Vanity metrics meten activiteit, geen kwaliteit. Kies daarom eerst metrics die laten zien of de klant echt goed geholpen is.
De belangrijkste prestatiemetrics voor AI
- Oplossingspercentage: het aandeel gesprekken waarin het probleem van de klant echt is opgelost, en niet alleen gesloten.
- Feitelijke nauwkeurigheid: hoe vaak de agent juiste, onderbouwde informatie gaf in plaats van details te verzinnen.
- Escalatiepercentage: hoe vaak, en hoe terecht, de agent overdroeg aan een mens. Te hoog en te laag zijn allebei een probleem.
- Containment rate: het aandeel dat zonder mens is afgehandeld. Dat is alleen gezond in combinatie met oplossing en nauwkeurigheid.
- Sentiment: hoe de klant zich voelde tijdens en na het gesprek.
Lees metrics altijd samen, nooit los
Geen enkel getal vertelt in zijn eentje de waarheid. Hoge containment met een laag oplossingspercentage betekent dat de bot klanten afhoudt in plaats van ze te helpen. De metrics zijn alleen zinvol als geheel, en daarom vormt kwaliteitsbeoordeling de basis onder al die metrics.
Stap 2: Prestaties van een AI-agent meten met een scorecard
Uitkomstmetrics vertellen je wat er gebeurde, maar niet waarom een gesprek goed of slecht was. Een kwaliteitsscorecard maakt van prestaties iets wat je kunt analyseren en waarop je kunt coachen, omdat elk gesprek wordt beoordeeld op vaste criteria.
Maak van metrics criteria
Bouw een scorecard die nauwkeurigheid, oplossing, juiste escalatie, toon en naleving van beleid vastlegt, en laat het systeem elk AI-gesprek daar automatisch op beoordelen. Kaizo leest gesprekken native uit Zendesk en Salesforce en beoordeelt elk gesprek zodra het binnenkomt. Zo zijn je prestatiegegevens doorlopend in plaats van een maandelijkse momentopname.
Dek alles af, geen steekproef
AI werkt op volumes waar geen team een zinvolle steekproef uit kan trekken, en een systematische fout herhaalt zich in elk gesprek dat een agent behandelt. Pas door 100% te beoordelen worden de cijfers betrouwbaar. Bij UiPath automatiseerde Kaizo 100% van de QA met 200% ROI, waardoor leidinggevenden volledige data hadden om op te meten in plaats van een fractie.
Stap 3: Vergelijk AI en mensen eerlijk
Zodra AI en mensen allebei gesprekken afhandelen, is de logische vraag hoe ze zich tot elkaar verhouden. Die vergelijking is alleen zinvol als beide op dezelfde manier worden gemeten.
Eén scorecard voor allebei
Beoordeel gesprekken die door AI en door mensen zijn afgehandeld op dezelfde criteria. Dan weerspiegelt een verschil in scores een echt kwaliteitsverschil, en niet twee verschillende meetlatten. Zo zie je ook waar AI echt beter presteert en waar ze ongemerkt achterblijft, per wachtrij en per onderwerp.
| Dimensie | Vanity-weergave | Eerlijke vergelijking |
|---|---|---|
| Basis | AI-volume tegenover menselijk volume | Dezelfde scorecard voor allebei |
| Oplossing | Gesloten tickets | Echt opgeloste problemen |
| Escalatie | Geteld als falen van de AI | Beoordeeld als terecht of onterecht voor het specifieke geval |
| Dekking | Van elk een steekproef | 100% van allebei, doorlopend beoordeeld |
| Oordeel | Wie meer afhandelde | Wie het beter afhandelde, met bewijs |
Stap 4: Houd de beoordelaar onafhankelijk
Een prestatiecijfer is maar zo betrouwbaar als wat het heeft voortgebracht. Laat het team dat een AI-agent heeft gebouwd niet de enige zijn die hem beoordeelt. Een team met belang bij de uitkomst heeft een reden om gunstige scores te rapporteren, en dat tast ongemerkt elke metric verderop aan.
Bewijs maakt de meting geloofwaardig
Elke score die Kaizo geeft, linkt naar het exacte moment in het transcript waaruit die score voortkomt. Een uitspraak over prestaties kun je dus controleren door te lezen in plaats van op vertrouwen aan te nemen, en dat is precies wat teams in staat stelt de automatiseringsgraad met een gerust hart te verhogen.
Stap 5: Handel op basis van de resultaten
Een meting die geen gedrag verandert, is gewoon een dashboard. Het doel van AI-prestaties meten is ze verbeteren, en scores die aan bewijs gekoppeld zijn, maken dat direct mogelijk.
Maak de cirkel rond
- Herleid nauwkeurigheidsfouten tot de prompt, de kennisbron of het gat in de onderbouwing dat ze veroorzaakte.
- Corrigeer verkeerd ingestelde escalatietriggers als het escalatiepercentage te hoog of te laag wordt.
- Groepeer terugkerende lage scores per onderwerp of wachtrij, zodat je het patroon één keer bij de bron oplost.
- Meet na elke wijziging opnieuw over alle gesprekken, om te bevestigen dat de oplossing standhoudt en elders niets is verslechterd.
Omdat de dekking doorlopend is, zie je het effect van een wijziging in de volledige dataset en niet in een steekproef die het zou kunnen missen.
Veelgemaakte fouten
Dit zijn de fouten waardoor prestatiedata van AI er gezonder uitzien dan de werkelijkheid.
- Alleen op containment sturen: een hoge containment rate met een laag oplossingspercentage betekent afhouden, geen prestatie.
- Een steekproef nemen bij een agent met veel volume: een kleine steekproef mist systematische fouten bijna altijd.
- AI en mensen op verschillende schalen vergelijken: zonder één gedeelde scorecard is de vergelijking betekenisloos.
- Het team dat de AI bouwde hem alleen laten beoordelen: een beoordelaar met belang bij de uitkomst levert gunstige, onbetrouwbare cijfers op.
- Rapporteren zonder te handelen: metrics die nooit een prompt, guardrail of routingregel veranderen, leveren geen verbetering op.
Veelgestelde vragen
Hoe meet je de prestaties van een AI-agent in de klantenservice?
Volg uitkomstmetrics zoals oplossingspercentage, feitelijke nauwkeurigheid, escalatiepercentage, containment en sentiment, en beoordeel daarna elk gesprek dat de AI afhandelt met een kwaliteitsscorecard in plaats van een steekproef. Vergelijk AI en mensen met dezelfde scorecard, gebruik een beoordelaar die onafhankelijk is van de AI die wordt beoordeeld, en handel op de resultaten door aan te pakken wat slechte scores veroorzaakt.
Welke metrics zijn het belangrijkst voor AI-agents?
Oplossingspercentage en feitelijke nauwkeurigheid zijn het belangrijkst, omdat ze laten zien of de klant echt geholpen is met juiste informatie. Escalatiepercentage, containment en sentiment geven onmisbare context, maar zijn misleidend als je ze los bekijkt. Hoge containment met een laag oplossingspercentage betekent bijvoorbeeld dat de agent klanten afhoudt in plaats van problemen op te lossen.
Hoe vergelijk je AI-agents eerlijk met menselijke medewerkers?
Beoordeel beide met dezelfde kwaliteitsscorecard op dezelfde criteria, zodat een verschil in scores een echt kwaliteitsverschil weerspiegelt en niet twee verschillende meetlatten. Als je 100% van allebei doorlopend afdekt, zie je bovendien waar AI beter en waar ze slechter presteert, per wachtrij en per onderwerp.
Waarom is een onafhankelijke beoordelaar belangrijk voor AI-metrics?
Als alleen de mensen die de AI hebben gebouwd hem beoordelen, hebben de scores een ingebouwde prikkel om er goed uit te zien, en dat tast elke metric verderop aan. Als elke score naar het bewijs in het transcript linkt, kun je een uitspraak over prestaties controleren door te lezen in plaats van die blind te vertrouwen.
Waarom is een steekproef niet genoeg bij AI-agents?
AI werkt op volumes waar geen team een zinvolle steekproef uit kan trekken, en een systematische fout herhaalt zich in elk gesprek dat een agent behandelt. Een kleine steekproef mist zulke fouten bijna altijd. Pas als je 100% van de AI-gesprekken beoordeelt, worden de cijfers betrouwbaar en zie je het effect van elke wijziging in de volledige dataset.
Verder lezen
- Kwaliteitscontrole van AI-agents en chatbots
- Wat is agentische QA? (in het Engels)
- Zo beoordeel je 100% van de gesprekken (in het Engels)
- Wat is 100% QA-dekking? (in het Engels)
- Gids voor conversation intelligence (in het Engels)
Meet je AI-agents op je eigen gesprekken
Neem een week aan echte gesprekken mee die je AI heeft afgehandeld. Wij laten je oplossing, nauwkeurigheid en escalatie zien, beoordeeld op 100% daarvan, en elk cijfer is terug te leiden tot het transcript.