Naar de inhoud

Best practice

Kwaliteitscontrole van AI-agents en chatbots

Kwaliteitscontrole van AI-agents en chatbots: bouw een scorecard, scoor 100% van de AI-gesprekken, koppel elke score aan bewijs en vang typische AI-fouten af.

· 7 min. lezen

Gecontroleerd door Dominik Blattner, oprichter van Kaizo

Op deze pagina

Kwaliteitscontrole van AI-agents en chatbots begint met een scorecard die beschrijft hoe een goed gesprek dat AI afhandelt eruitziet. Scoor daarna elk van die gesprekken automatisch. Houd de beoordelaar onafhankelijk van de AI die hij beoordeelt, en koppel elke score aan het transcript, zodat je de fout kunt oplossen.

In het kort

  • Het volume dat AI afhandelt is te groot om handmatig steekproeven te nemen.
  • Let op foute informatie, gemiste escalaties, hallucinaties en antwoorden met de verkeerde toon.
  • Laat de bevindingen terugvloeien naar prompts, guardrails en routering.
  • Scoor daarna opnieuw om te bevestigen dat de oplossing standhoudt.

Stap 1: bepaal wat goed is voor een AI-agent

AI-agents maken andere fouten dan mensen. Een scorecard voor medewerkers die je ongewijzigd overneemt, mist daardoor juist wat het zwaarst weegt. Schrijf eerst op hoe een goed gesprek dat AI afhandelt er voor jouw bedrijf echt uitziet, in criteria die een machine aan een transcript kan toetsen.

Bouw criteria rond de typische fouten van AI

Een sterke AI-scorecard dekt het gedrag dat vertrouwen schaadt als een agent het fout doet:

  • Feitelijke juistheid: gaf de agent correcte informatie, of verzon hij een beleidsregel, prijs of stap die niet bestaat?
  • Oplossing: heeft hij het probleem van de klant echt opgelost, of alleen het ticket gesloten?
  • Juiste escalatie: droeg hij het gesprek op het juiste moment over aan een mens, en niet te laat?
  • Toon en empathie: sloot hij aan bij de emotionele toestand van de klant, in plaats van robotachtig te blijven?
  • Naleving van beleid en veiligheid: bleef hij binnen de grenzen die je hebt gesteld, en weigerde hij wat hij moest weigeren?

Maak elk criterium toetsbaar aan bewijs

Formuleer criteria zo dat een voldoende of onvoldoende terug te voeren is op een specifieke regel in het gesprek. Met Kaizo bouw je de scorecard die je bedrijf echt gebruikt, en Kaizo beoordeelt elk gesprek daaraan, net zoals je beste reviewer dat zou doen. Zo blijven AI-QA en QA van medewerkers op één vergelijkbare standaard.

Stap 2: kwaliteitscontrole van AI-agents op 100% van de gesprekken, niet op een steekproef

Handmatige QA neemt een steekproef van 2% tot 5% van de tickets, omdat een mens er maar een beperkt aantal kan lezen. Bij AI-agents is dat plafond onhoudbaar: ze draaien op volumes waaruit geen reviewteam zinvol een steekproef kan nemen, en een zeldzame maar schadelijke fout zit vrijwel altijd in de 95% die niemand leest.

Automatiseer het scoren

Koppel de helpdesk of het CRM waar je gesprekken al staan, en laat het systeem elke interactie die AI afhandelt scoren zodra die binnenkomt, doorlopend en op de achtergrond. Kaizo integreert native met Zendesk en Salesforce en leest gesprekken rechtstreeks uit de systemen die je al gebruikt, dus er is geen aparte pipeline om te onderhouden.

Waarom volledige dekking bij AI zwaarder weegt

Eén AI-agent past hetzelfde gedrag toe op duizenden gesprekken. Eén systematische fout, een verkeerd begrepen beleid of een slechte standaardinstelling, herhaalt zich dus op grote schaal. Pas als je 100% van de gesprekken scoort, komt dat patroon vroeg boven water. Bij UiPath automatiseerde Kaizo 100% van de QA met 200% ROI: precies de dekking die het volume dat AI afhandelt nu vraagt.

Zie het op je eigen gesprekken. Kaizo scoort 100% van je supportgesprekken en zet de resultaten om in coaching. Demo boeken.

Stap 3: houd de beoordelaar onafhankelijk

Dit is de stap die de meeste teams overslaan, en het is de stap die bepaalt of je AI-QA te vertrouwen is. Laat het team dat een AI-agent heeft gebouwd niet de enige zijn die hem beoordeelt. Een team dat wordt afgerekend op hoe goed de agent eruitziet, is niet de beste rechter over de vraag of hij goed is.

Bewijs maakt de score geloofwaardig

De beoordelaar moet dezelfde scorecard toepassen, of een gesprek nu is afgehandeld door een mens, je eigen bot of de AI van een derde partij. Kaizo scoort 100% van de gesprekken van medewerkers en AI-agents met je eigen scorecard, en elke score verwijst naar het bewijs in het gesprek. Het oordeel over een agent kun je dus controleren, in plaats van het op goed vertrouwen aan te nemen.

Wat je een QA-leverancier vraagt

  • Kunnen jullie een AI-agent die door iemand anders is gebouwd scoren met dezelfde scorecard als de onze?
  • Verwijst elke score naar het bewijs, zodat we jullie oordeel kunnen controleren in plaats van het op goed vertrouwen aan te nemen?

Stap 4: vang de typische fouten van AI af

Zodra het scoren op elk gesprek draait, richt je het op de fouten die uniek zijn voor automatisering, of erdoor worden versterkt. Dit zijn de categorieën die het waard zijn om apart te bekijken en door de tijd te volgen.

Type foutHoe het eruitzietWat de scorecard controleert
Foute informatieDe agent noemt een beleidsregel, prijs of stap die niet kloptWas elke feitelijke bewering correct en gebaseerd op je bronnen?
Gemiste escalatieDe agent blijft een case behandelen die hij aan een mens had moeten overdragenEscaleerde hij bij de juiste trigger en op tijd?
Gehallucineerde zekerheidEen fout antwoord, gebracht alsof het zeker isVerzon de agent geen details die hij niet kon verifiëren?
Verkeerde toonRobotachtige of afwijzende taal bij een gefrustreerde klantPaste de toon bij de emotionele toestand van de klant?
BeleidsschendingDe agent doet iets wat hij moest weigerenBleef hij binnen zijn veiligheids- en beleidsgrenzen?

Stap 5: koppel bevindingen terug en scoor opnieuw

QA heeft alleen zin als het tot ander gedrag leidt. Omdat elke Kaizo-score verwijst naar het exacte moment in het transcript waar hij vandaan komt, is een fout niet alleen een markering, maar een concreet, reproduceerbaar voorbeeld waarmee je aan de slag kunt.

Maak de cirkel rond

  • Stuur fouten in juistheid terug naar de prompt, de kennisbank of de bron die het foute antwoord opleverde.
  • Maak van gemiste escalaties een strakkere routeringsregel of trigger.
  • Groepeer terugkerende fouten, zodat je het patroon één keer oplost in plaats van gevallen één voor één op te lappen.

Scoor daarna opnieuw om te bevestigen dat de oplossing standhoudt. Met volledige, doorlopende dekking zie je het effect van een wijziging in alle gesprekken, niet in een steekproef die de terugval kan missen.

Veelgemaakte fouten

Een paar fouten ondermijnen QA-programma’s voor AI ongemerkt, nog voordat ze iets opleveren.

  • AI steekproefsgewijs controleren zoals je dat bij mensen deed: een steekproef van 2% van een bot met een hoog volume mist systematische fouten bijna per definitie.
  • Het team dat de agent bouwde hem alleen laten beoordelen: zonder onafhankelijke beoordelaar is een score die er goed uitziet niet hetzelfde als goed werk.
  • Scoren zonder bewijs: een cijfer dat je niet kunt herleiden tot een regel in het transcript, kun je niet controleren, niet gebruiken voor coaching en niet aanvechten.
  • De scorecard voor medewerkers ongewijzigd hergebruiken: typische AI-fouten zoals hallucinatie en valse zekerheid hebben eigen criteria nodig.
  • Meten maar nooit terugkoppelen: QA die prompts, guardrails of routering niet verandert, is alleen rapportage.

Veelgestelde vragen

Hoe doe je kwaliteitscontrole op een AI-agent of chatbot?

Bouw een scorecard die een goed gesprek dat AI afhandelt definieert, met juistheid, oplossing, juiste escalatie, toon en naleving van beleid. Scoor 100% van de AI-gesprekken daar automatisch mee, houd de beoordelaar onafhankelijk van de AI die wordt beoordeeld, en koppel elke score aan het bewijs in het transcript, zodat fouten te controleren en op te lossen zijn.

Waarom moet de beoordelaar onafhankelijk zijn van de AI-agent?

Als alleen de mensen die een AI-agent hebben gebouwd hem beoordelen, hebben ze er belang bij dat de agent er goed uitziet. Een beoordelaar die elke score koppelt aan het bewijs in het gesprek, maakt de score geloofwaardig, omdat iedereen hem kan controleren.

Kun je dezelfde scorecard gebruiken voor AI-agents en medewerkers?

Je kunt de criteria delen die voor allebei gelden, zoals oplossing en toon, zodat AI-QA en QA van medewerkers vergelijkbaar blijven. Maar AI heeft extra criteria nodig voor zijn eigen fouten, zoals hallucinatie en valse zekerheid. De sterkste aanpak is dus één standaard, aangevuld met AI-specifieke controles.

Hoeveel van de AI-gesprekken moet je controleren?

Allemaal. AI draait op volumes waaruit geen team zinvol een steekproef kan nemen, en een systematische fout herhaalt zich in elk gesprek dat de agent afhandelt, dus een kleine steekproef mist hem meestal. Automatisch scoren van 100% van de gesprekken brengt die patronen vroeg aan het licht.

Welke fouten van een AI-agent moet een scorecard volgen?

Vijf categorieën zijn het waard om apart te volgen: foute informatie, gemiste escalaties, gehallucineerde zekerheid, verkeerde toon en beleidsschendingen. Voor elk daarvan toetst de scorecard een concrete vraag, bijvoorbeeld of elke feitelijke bewering gebaseerd was op je bronnen of dat de agent op tijd escaleerde.

Verder lezen

Op deze pagina

Zie dit op je eigen gesprekken

We scoren een steekproef van je echte tickets op basis van jouw standaarden, zodat het voorbeeld van jou is.

Vertrouwd door internationale supportteams

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart