Kwaliteitscontrole van AI-agents en chatbots begint met een scorecard die beschrijft hoe een goed gesprek dat AI afhandelt eruitziet. Scoor daarna elk van die gesprekken automatisch. Houd de beoordelaar onafhankelijk van de AI die hij beoordeelt, en koppel elke score aan het transcript, zodat je de fout kunt oplossen.
In het kort
- Het volume dat AI afhandelt is te groot om handmatig steekproeven te nemen.
- Let op foute informatie, gemiste escalaties, hallucinaties en antwoorden met de verkeerde toon.
- Laat de bevindingen terugvloeien naar prompts, guardrails en routering.
- Scoor daarna opnieuw om te bevestigen dat de oplossing standhoudt.
Stap 1: bepaal wat goed is voor een AI-agent
AI-agents maken andere fouten dan mensen. Een scorecard voor medewerkers die je ongewijzigd overneemt, mist daardoor juist wat het zwaarst weegt. Schrijf eerst op hoe een goed gesprek dat AI afhandelt er voor jouw bedrijf echt uitziet, in criteria die een machine aan een transcript kan toetsen.
Bouw criteria rond de typische fouten van AI
Een sterke AI-scorecard dekt het gedrag dat vertrouwen schaadt als een agent het fout doet:
- Feitelijke juistheid: gaf de agent correcte informatie, of verzon hij een beleidsregel, prijs of stap die niet bestaat?
- Oplossing: heeft hij het probleem van de klant echt opgelost, of alleen het ticket gesloten?
- Juiste escalatie: droeg hij het gesprek op het juiste moment over aan een mens, en niet te laat?
- Toon en empathie: sloot hij aan bij de emotionele toestand van de klant, in plaats van robotachtig te blijven?
- Naleving van beleid en veiligheid: bleef hij binnen de grenzen die je hebt gesteld, en weigerde hij wat hij moest weigeren?
Maak elk criterium toetsbaar aan bewijs
Formuleer criteria zo dat een voldoende of onvoldoende terug te voeren is op een specifieke regel in het gesprek. Met Kaizo bouw je de scorecard die je bedrijf echt gebruikt, en Kaizo beoordeelt elk gesprek daaraan, net zoals je beste reviewer dat zou doen. Zo blijven AI-QA en QA van medewerkers op één vergelijkbare standaard.
Stap 2: kwaliteitscontrole van AI-agents op 100% van de gesprekken, niet op een steekproef
Handmatige QA neemt een steekproef van 2% tot 5% van de tickets, omdat een mens er maar een beperkt aantal kan lezen. Bij AI-agents is dat plafond onhoudbaar: ze draaien op volumes waaruit geen reviewteam zinvol een steekproef kan nemen, en een zeldzame maar schadelijke fout zit vrijwel altijd in de 95% die niemand leest.
Automatiseer het scoren
Koppel de helpdesk of het CRM waar je gesprekken al staan, en laat het systeem elke interactie die AI afhandelt scoren zodra die binnenkomt, doorlopend en op de achtergrond. Kaizo integreert native met Zendesk en Salesforce en leest gesprekken rechtstreeks uit de systemen die je al gebruikt, dus er is geen aparte pipeline om te onderhouden.
Waarom volledige dekking bij AI zwaarder weegt
Eén AI-agent past hetzelfde gedrag toe op duizenden gesprekken. Eén systematische fout, een verkeerd begrepen beleid of een slechte standaardinstelling, herhaalt zich dus op grote schaal. Pas als je 100% van de gesprekken scoort, komt dat patroon vroeg boven water. Bij UiPath automatiseerde Kaizo 100% van de QA met 200% ROI: precies de dekking die het volume dat AI afhandelt nu vraagt.
Zie het op je eigen gesprekken. Kaizo scoort 100% van je supportgesprekken en zet de resultaten om in coaching. Demo boeken.
Stap 3: houd de beoordelaar onafhankelijk
Dit is de stap die de meeste teams overslaan, en het is de stap die bepaalt of je AI-QA te vertrouwen is. Laat het team dat een AI-agent heeft gebouwd niet de enige zijn die hem beoordeelt. Een team dat wordt afgerekend op hoe goed de agent eruitziet, is niet de beste rechter over de vraag of hij goed is.
Bewijs maakt de score geloofwaardig
De beoordelaar moet dezelfde scorecard toepassen, of een gesprek nu is afgehandeld door een mens, je eigen bot of de AI van een derde partij. Kaizo scoort 100% van de gesprekken van medewerkers en AI-agents met je eigen scorecard, en elke score verwijst naar het bewijs in het gesprek. Het oordeel over een agent kun je dus controleren, in plaats van het op goed vertrouwen aan te nemen.
Wat je een QA-leverancier vraagt
- Kunnen jullie een AI-agent die door iemand anders is gebouwd scoren met dezelfde scorecard als de onze?
- Verwijst elke score naar het bewijs, zodat we jullie oordeel kunnen controleren in plaats van het op goed vertrouwen aan te nemen?
Stap 4: vang de typische fouten van AI af
Zodra het scoren op elk gesprek draait, richt je het op de fouten die uniek zijn voor automatisering, of erdoor worden versterkt. Dit zijn de categorieën die het waard zijn om apart te bekijken en door de tijd te volgen.
| Type fout | Hoe het eruitziet | Wat de scorecard controleert |
|---|---|---|
| Foute informatie | De agent noemt een beleidsregel, prijs of stap die niet klopt | Was elke feitelijke bewering correct en gebaseerd op je bronnen? |
| Gemiste escalatie | De agent blijft een case behandelen die hij aan een mens had moeten overdragen | Escaleerde hij bij de juiste trigger en op tijd? |
| Gehallucineerde zekerheid | Een fout antwoord, gebracht alsof het zeker is | Verzon de agent geen details die hij niet kon verifiëren? |
| Verkeerde toon | Robotachtige of afwijzende taal bij een gefrustreerde klant | Paste de toon bij de emotionele toestand van de klant? |
| Beleidsschending | De agent doet iets wat hij moest weigeren | Bleef hij binnen zijn veiligheids- en beleidsgrenzen? |
Stap 5: koppel bevindingen terug en scoor opnieuw
QA heeft alleen zin als het tot ander gedrag leidt. Omdat elke Kaizo-score verwijst naar het exacte moment in het transcript waar hij vandaan komt, is een fout niet alleen een markering, maar een concreet, reproduceerbaar voorbeeld waarmee je aan de slag kunt.
Maak de cirkel rond
- Stuur fouten in juistheid terug naar de prompt, de kennisbank of de bron die het foute antwoord opleverde.
- Maak van gemiste escalaties een strakkere routeringsregel of trigger.
- Groepeer terugkerende fouten, zodat je het patroon één keer oplost in plaats van gevallen één voor één op te lappen.
Scoor daarna opnieuw om te bevestigen dat de oplossing standhoudt. Met volledige, doorlopende dekking zie je het effect van een wijziging in alle gesprekken, niet in een steekproef die de terugval kan missen.
Veelgemaakte fouten
Een paar fouten ondermijnen QA-programma’s voor AI ongemerkt, nog voordat ze iets opleveren.
- AI steekproefsgewijs controleren zoals je dat bij mensen deed: een steekproef van 2% van een bot met een hoog volume mist systematische fouten bijna per definitie.
- Het team dat de agent bouwde hem alleen laten beoordelen: zonder onafhankelijke beoordelaar is een score die er goed uitziet niet hetzelfde als goed werk.
- Scoren zonder bewijs: een cijfer dat je niet kunt herleiden tot een regel in het transcript, kun je niet controleren, niet gebruiken voor coaching en niet aanvechten.
- De scorecard voor medewerkers ongewijzigd hergebruiken: typische AI-fouten zoals hallucinatie en valse zekerheid hebben eigen criteria nodig.
- Meten maar nooit terugkoppelen: QA die prompts, guardrails of routering niet verandert, is alleen rapportage.
Veelgestelde vragen
Hoe doe je kwaliteitscontrole op een AI-agent of chatbot?
Bouw een scorecard die een goed gesprek dat AI afhandelt definieert, met juistheid, oplossing, juiste escalatie, toon en naleving van beleid. Scoor 100% van de AI-gesprekken daar automatisch mee, houd de beoordelaar onafhankelijk van de AI die wordt beoordeeld, en koppel elke score aan het bewijs in het transcript, zodat fouten te controleren en op te lossen zijn.
Waarom moet de beoordelaar onafhankelijk zijn van de AI-agent?
Als alleen de mensen die een AI-agent hebben gebouwd hem beoordelen, hebben ze er belang bij dat de agent er goed uitziet. Een beoordelaar die elke score koppelt aan het bewijs in het gesprek, maakt de score geloofwaardig, omdat iedereen hem kan controleren.
Kun je dezelfde scorecard gebruiken voor AI-agents en medewerkers?
Je kunt de criteria delen die voor allebei gelden, zoals oplossing en toon, zodat AI-QA en QA van medewerkers vergelijkbaar blijven. Maar AI heeft extra criteria nodig voor zijn eigen fouten, zoals hallucinatie en valse zekerheid. De sterkste aanpak is dus één standaard, aangevuld met AI-specifieke controles.
Hoeveel van de AI-gesprekken moet je controleren?
Allemaal. AI draait op volumes waaruit geen team zinvol een steekproef kan nemen, en een systematische fout herhaalt zich in elk gesprek dat de agent afhandelt, dus een kleine steekproef mist hem meestal. Automatisch scoren van 100% van de gesprekken brengt die patronen vroeg aan het licht.
Welke fouten van een AI-agent moet een scorecard volgen?
Vijf categorieën zijn het waard om apart te volgen: foute informatie, gemiste escalaties, gehallucineerde zekerheid, verkeerde toon en beleidsschendingen. Voor elk daarvan toetst de scorecard een concrete vraag, bijvoorbeeld of elke feitelijke bewering gebaseerd was op je bronnen of dat de agent op tijd escaleerde.
Verder lezen
- Wat is agentische QA? (in het Engels)
- Wat is Auto QA? (in het Engels)
- Wat is een AI-agent? (in het Engels)
- De prestaties van een AI-agent meten
- Wat is LLM as a judge? (in het Engels)
- Hoe nauwkeurig is AI-kwaliteitsbeoordeling?
- Beoordelingscriteria schrijven die een AI echt kan scoren (in het Engels)
- AI-QA-scores in een week valideren (in het Engels)
- False positives bij geautomatiseerde QA (in het Engels)