Naar de inhoud

Best practice

Stille fouten van AI-agents: zo spoor je ze op

Stille fouten van AI-agents: onveilige niet-escalatie en vijf andere fouten die je dashboard als succes telt, met de signalen die ze op tijd zichtbaar maken.

· 9 min. lezen

Gecontroleerd door Dominik Blattner, oprichter van Kaizo

Op deze pagina

Stille fouten van AI-agents zijn fouten die je metrics als succes tellen. Het ticket gaat dicht, de containment rate boekt een winst, en de klant vertrekt met een verkeerd antwoord of een onopgeloste vraag. Onveilige niet-escalatie, waarbij de AI-agent een case houdt die hij aan een mens had moeten overdragen, is een van de lastigste om te zien, omdat er nooit een escalatie wordt gelogd.

In het kort

  • Stille fouten van AI-agents komen in zes gangbare soorten voor, van zelfverzekerd verzinnen tot vloeiend de verkeerde vraag beantwoorden.
  • Onveilige niet-escalatie is de stilste soort, omdat een case die nooit escaleert op elk dashboard op selfservice lijkt.
  • Fouten van AI-agents herhalen zich: één zwakke plek in de prompt veroorzaakt dezelfde fout telkens als de omstandigheden terugkomen.
  • Om stille fouten te vinden, beoordeel je wat de AI-agent zei, in elk gesprek, aan de hand van je eigen vastgelegde criteria.

Waarom juist stille fouten pijn doen

Als een AI-agent luidruchtig faalt, weet je dat al. Hij geeft een foutmelding, hij escaleert, hij vertelt de klant dat hij niet kan helpen, en een mens neemt het over. Zo’n fout is vervelend maar zichtbaar, en zichtbare fouten worden opgelost omdat de metrics ze oppikken. Stille fouten laten niets achter wat de metrics kunnen oppikken.

Een stille fout is anders. De agent rondt het gesprek af, markeert het als afgehandeld en gaat verder, terwijl hij iets fout heeft gedaan wat niemand heeft gelogd. De containment rate telt het als afgehandeld zonder medewerker. Het volumedashboard telt het als behandeld. De resolutievlag, als die er is, is door de agent zelf gezet, en die dacht dat het gelukt was. Al je monitoringsystemen zijn het erover eens dat het gesprek goed ging, en de enige die beter weet is de klant, die jouw enquête niet invult.

Daarom stapelen stille fouten zich op: precies de feedbacklus die ze zichtbaar zou maken, ontbreekt. Daarom moeten inzichten uit de klantenservice ook komen uit wat er in elk gesprek is gezegd, niet uit resolutievlaggen en enquêtes. Onze gids over kwaliteitscontrole voor AI-agents is erop gebouwd om die lus te sluiten.

De zes soorten stille fouten van AI-agents

Zes terugkerende soorten dekken het meeste van wat er ongemerkt misgaat bij een AI-agent: zelfverzekerd verzinnen, verzonnen beleid, schijnoplossing, onveilige niet-escalatie, buiten het mandaat treden en de verkeerde vraag beantwoorden. Ze een naam geven is het halve werk, want je kunt niet scoren op een fout die je niet hebt gedefinieerd, en geen van deze fouten geeft een foutmelding.

Stille foutWat er gebeurtWaarom het dashboard het mist
Zelfverzekerd verzinnenDe agent brengt een verzonnen feit alsof het zeker isEr gaat geen onzekerheidsvlag af, en het ticket wordt normaal gesloten
Verzonnen beleidHij bedenkt een plausibele regel voor terugbetaling, garantie of aanspraak die niet bestaatHet klinkt gezaghebbend, dus niemand trekt het in twijfel tot een klant je eraan houdt
SchijnoplossingHij verklaart het probleem opgelost terwijl dat niet zo isDe resolutievlag wordt door de agent gezet, en de containment rate telt het als winst
Onveilige niet-escalatieHij blijft een case behandelen die hij aan een mens had moeten overdragenEr wordt geen escalatie gelogd, dus de case lijkt selfservice
Buiten het mandaat tredenHij antwoordt of belooft meer dan waartoe hij bevoegd isDe klant is op dat moment tevreden, dus de tevredenheidssignalen zien er goed uit
Goed antwoord, verkeerde vraagHij beantwoordt vloeiend een vraag die de klant niet steldeVloeiende taal en een gesloten ticket lijken op succes

Zelfverzekerd verzinnen is wat de meeste teams een hallucinatie noemen. De andere vijf kunnen gebeuren terwijl elk feit klopt, en daarom vindt een feitencheck alleen ze niet.

Wat een beleid voor niet-escalatie van AI-agents moet regelen

Een beleid voor niet-escalatie van AI-agents is de vastgelegde set regels voor wanneer de agent moet stoppen en de case aan een mens moet overdragen. Het benoemt de triggers, de overdracht zelf en hoe elke case achteraf wordt gecontroleerd. Zonder zo’n beleid kun je onveilige niet-escalatie niet scoren, omdat niemand heeft vastgelegd wat de agent had moeten doen.

Een werkbaar beleid beantwoordt vier vragen:

  1. Welke verzoeken gaan altijd naar een mens? Bijvoorbeeld een klant die naar een persoon vraagt, een klacht waarin juridische stappen worden genoemd, of een verzoek buiten wat de agent mag beslissen.
  2. Welke signalen dwingen midden in het gesprek een overdracht af? Bijvoorbeeld dezelfde vraag die twee keer zonder vooruitgang wordt gesteld, oplopende frustratie, of een klant die kwetsbaar lijkt.
  3. Wat neemt de overdracht mee? De mens moet de context krijgen, zodat de klant zichzelf niet hoeft te herhalen. Onze gids over kwaliteitscontrole van de overdracht van AI-agent naar medewerker laat zien hoe je die stap scoort.
  4. Hoe wordt elke case gecontroleerd? Neem “escaleerde wanneer het beleid dat vereiste” op als criterium in je scorecard voor AI-agents, en scoor het op de gesprekken die de agent afsloot, niet alleen op de gesprekken die hij doorgaf.

Geëscaleerde gesprekken hebben ook hun eigen beoordelingscriteria nodig. Hoe je een geëscaleerd ticket scoort legt uit hoe je elke fout toeschrijft aan het punt waar die is ontstaan.

Waarom fouten van AI-agents zich herhalen in plaats van verspreid op te treden

Fouten van AI-agents herhalen zich omdat ze structureel zijn. Ze komen uit de prompt, de opgehaalde kennis, het model of de guardrails, dus dezelfde zwakke plek veroorzaakt dezelfde stille fout telkens als de omstandigheden terugkomen. De fouten van een menselijke medewerker zijn grotendeels individueel en willekeurig: een slechte dag, iets verkeerd gelezen, een gat in de training van één persoon.

Dat verandert wat er op het spel staat. Eén verzonnen beleid is één slecht gesprek. Dezelfde zwakke plek in de prompt die dat verzonnen beleid een maand lang in elk gesprek waarop het van toepassing is genereert, is een aansprakelijkheid die net zo snel groeit als de uitrol. Het verandert ook de detectiestrategie: omdat de fouten systematisch zijn, is een steekproef het verkeerde instrument. Een steekproef van 2% is bedoeld om een willekeurig percentage te schatten, en mist geregeld een fout die alleen optreedt onder een specifieke omstandigheid die in een deel van de gesprekken voorkomt. Je moet ze allemaal bekijken.

Zo vang je stille fouten die de metrics verbergen

Stille fouten zijn onzichtbaar voor volume- en resolutiemetrics, omdat die de vorm van het gesprek meten, niet de inhoud. Om ze te vangen, lees je wat de AI-agent werkelijk zei, op schaal, aan de hand van vastgelegde criteria, in elk gesprek, en herleid je elke bevinding naar de regels die haar veroorzaakten, zodat de eigenaar de oorzaak kan oplossen.

Scoor de inhoud, niet de uitkomst

Controleer in elk gesprek de dingen die een stille fout breekt: was elke feitelijke bewering waar, bestond elk beleid echt, was de verklaarde oplossing echt, escaleerde de agent toen dat moest? Dat zijn de criteria van een scorecard voor AI-agents, en het zijn precies de vragen die een routinglog niet kan beantwoorden.

Dek alles af

Omdat de fouten systematisch zijn, is dekking geen extraatje. 100% van de gesprekken scoren (in het Engels) maakt van een stille fout die iemand uiteindelijk opmerkt een patroon dat je ziet in de week dat het begint. Bij UiPath automatiseerde Kaizo 100% van de QA, met 200% ROI en een stijging van de kwaliteitsscore met 8%. Dat is het dekkingsniveau waarop systematische fouten vroeg zichtbaar worden.

Zie het in je eigen gesprekken. Kaizo scoort 100% van je supportgesprekken aan de hand van je eigen criteria, ook de gesprekken die je AI-agent behandelt. Demo boeken.

Vind faalpatronen waarvoor je nog geen criteria hebt

Een scorecard vangt alleen fouten die je hebt benoemd, dus zoek naar de fouten die je nog niet hebt benoemd. Begin bij de gesprekken die de AI-agent als afgehandeld markeerde waarbij de klant terugkwam over hetzelfde probleem, of waarbij de toon negatief werd na het antwoord van de agent. Als er een nieuw patroon opduikt, leg het vast als criterium en scoor het vanaf dat moment.

Herleid elke bevinding naar de exacte regels

Een stille fout is pas op te lossen als iemand ernaar kan wijzen. Kaizo scoort 100% van de gesprekken van medewerkers en AI-agents aan de hand van je eigen scorecard, noemt zelfverzekerd verzinnen en schijnoplossingen bij hun naam, en herleidt elke bevinding naar de exacte regels die haar veroorzaakten. Die herleidbaarheid zorgt ervoor dat je een stille fout terug kunt leggen bij de eigenaar van de prompt en hem echt kunt oplossen, in plaats van te discussiëren over de vraag of hij wel gebeurde.

Wanneer een volledige review op stille fouten niets voor jou is

Als je AI-agent een handvol gesprekken per week behandelt, lees ze dan allemaal zelf; daar heb je geen software voor nodig. Heb je nog geen vastgelegde criteria, begin dan eerst met de scorecard voor AI-agents. En als je bot klanten alleen naar de juiste wachtrij doorstuurt zonder ze te antwoorden, kunnen de meeste van deze soorten fouten niet optreden, en vertellen je routinglogs je het meeste van wat je moet weten.

Veelgestelde vragen

Wat is een stille fout bij een AI-agent?

Een stille fout is een fout die geen spoor achterlaat in de metrics die je volgt. Het gesprek eindigt, het ticket gaat dicht, de containment rate telt het als winst, en de klant vertrekt met een verkeerd antwoord of een onopgeloste vraag. Het is gevaarlijk omdat elk monitoringsysteem het erover eens is dat het gesprek goed ging, waardoor de fout zich ongezien opstapelt.

Wat zijn de belangrijkste soorten stille fouten van AI-agents?

Zelfverzekerd verzinnen (verzonnen feiten brengen), verzonnen beleid (regels genereren die niet bestaan), schijnoplossing (een probleem opgelost verklaren terwijl dat niet zo is), onveilige niet-escalatie (een case behandelen die hij had moeten overdragen), buiten het mandaat treden (handelen buiten zijn bevoegdheid) en vloeiend de verkeerde vraag beantwoorden. Geen van deze geeft een foutmelding of zet een resolutievlag.

Waarom mist een steekproef stille fouten?

Omdat fouten van AI-agents systematisch zijn, niet willekeurig. Een zwakke plek in de prompt veroorzaakt dezelfde fout telkens als de omstandigheden terugkomen, vaak in een specifiek deel van de gesprekken. Een kleine willekeurige steekproef is bedoeld om een willekeurig percentage te schatten en mist geregeld een fout die geconcentreerd zit in omstandigheden die toevallig niet in de steekproef zaten. Volledige dekking maakt het patroon zichtbaar.

Is een stille fout hetzelfde als een hallucinatie?

Nee. Een hallucinatie, of zelfverzekerd verzinnen, is een van de zes soorten. Een AI-agent kan ook beleid verzinnen, een schijnoplossing melden, niet escaleren, buiten zijn bevoegdheid handelen of de verkeerde vraag beantwoorden, soms terwijl elk feit klopt. Een feitencheck alleen vindt maar een deel van het probleem.

Betekent een hoge containment rate dat de AI-agent goed werkt?

Niet op zichzelf. De containment rate telt een gesprek als winst wanneer de klant geen mens heeft bereikt, en een schijnoplossing of een onveilige niet-escalatie ziet er precies zo uit. Je moet scoren wat de agent zei om te weten of een gesprek zonder overdracht een goed gesprek was.

Wie moet een stille fout oplossen als die gevonden is?

De eigenaar van de oorzaak: de prompt, de opgehaalde kennis of de guardrails. Omdat fouten van AI-agents structureel zijn, lost coaching ze niet op zoals het de fout van een mens oplost. Elke bevinding moet terug te voeren zijn op de exacte regels in het transcript, zodat de eigenaar ziet wat er moet veranderen.

Gerelateerde begrippen

Vind de fouten die je dashboard als winst telt

Neem een maand aan gesprekken mee die je AI-agent als afgehandeld markeerde. We scoren ze allemaal met je eigen criteria en laten je de zelfverzekerde verzinsels, het verzonnen beleid en de schijnoplossingen zien die de containment rate als succes telde. Elke bevinding is terug te voeren op de exacte regels in het transcript, en onze inzichten uit de klantenservice laten zien welke fouten systemisch zijn, zodat je ze direct bij de eigenaar van de prompt kunt leggen.

Demo boeken Ontdek Agentic Auto QA

Op deze pagina

Zie dit op je eigen gesprekken

We scoren een steekproef van je echte tickets op basis van jouw standaarden, zodat het voorbeeld van jou is.

Vertrouwd door internationale supportteams

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart