Een AI-agent maakt andere fouten dan een mens, dus de scorecard voor een AI-agent schrapt de criteria die alleen voor mensen gelden en houdt de criteria die gaan over het oplossen van het probleem. Daarnaast komen er controles bij op hallucinaties, onveilige escalatie, binnen de eigen grenzen blijven en toegeven wat hij niet weet.
In het kort
- Een warme toon zegt weinig. Feitelijke juistheid zegt bijna alles.
- Scoor elk AI-gesprek, want geautomatiseerde fouten herhalen zich op grote schaal.
- De ergste AI-fouten zijn stil en worden nooit geëscaleerd.
- Laat het team dat de agent bouwde niet de enige beoordelaar zijn.
Waarom je de scorecard voor medewerkers niet kunt hergebruiken
Wie een AI-agent inzet, wil die meestal scoren met de scorecard die er al is. Dat is verleidelijk, want het doel lijkt hetzelfde: een goed klantgesprek. Maar de scorecard die je voor mensen hebt gebouwd, gaat uit van aannames over hoe mensen fouten maken, en een AI-agent doorbreekt die aannames in beide richtingen.
Een medewerker verzint meestal geen terugbetalingsbeleid dat niet bestaat, maar kan onder druk kortaf zijn. Een AI-agent is bijna nooit kortaf, maar noemt een verzonnen beleid met volle overtuiging. De AI-agent scoren op een warme toon zegt weinig, want de toon is precies wat hij het betrouwbaarst levert. Scoren of elke feitelijke bewering klopte, zegt bijna alles, want daar gaat het echt mis. De scorecard moet haar aandacht verleggen naar waar het risico nu zit. Onze volledige methode voor kwaliteitscontrole van AI-agents en chatbots beschrijft de workflow eromheen; de vraag hier is smaller: wat er echt op de scorecard hoort.
Criteria voor mensen die niet meer zinvol zijn
Begin met het schrappen van criteria die iets meten wat een AI-agent niet heeft of waarin hij niet varieert.
- Toon en warmte als graadmeter voor empathie: de toon van een AI-agent ligt vast in zijn prompt en varieert nauwelijks, dus wie die scoort, meet de configuratie en niet de interactie. Empathie telt nog steeds, maar als de vraag of het antwoord paste bij de gemoedstoestand van de klant. Dat komt hieronder aan bod.
- Inzet en initiatief: criteria als “een stapje extra zetten” gaan uit van een mens die ervoor kiest meer te doen. Ze passen niet op een systeem dat instructies uitvoert.
- Een uit het hoofd geleerd script volgen: vervangen door het naleven van grenzen en beleid, een andere en scherpere controle voor een machine.
- Criteria voor persoonlijke ontwikkeling: alles over leren of beter worden van de agent hoort bij de eigenaar van het model, niet in een score per gesprek.
Deze criteria schrappen is de lat niet lager leggen. Het is de lat richten op de fouten die echt kunnen voorkomen.
Criteria op een scorecard voor een AI-agent
Deze toevoegingen maken er een scorecard voor een AI-agent van in plaats van een omgebouwde scorecard voor mensen. Elk criterium beschrijft een fout die een mens zelden maakt en een machine routinematig.
| Criterium | Wat het controleert | Waarom een mens het zelden activeert |
|---|---|---|
| Feitelijke juistheid van elke bewering | Niets van wat de agent zei, was verzonnen of fout | Mensen nemen een slag om de arm als ze twijfelen; modellen beweren met dezelfde stelligheid, of ze nu gelijk hebben of niet |
| Trouw aan het beleid | De agent heeft geen beleid verzonnen, afgezwakt of overdreven | Een mens weet dat hij een beleid niet kent; een model genereert een plausibel beleid |
| Binnen de grenzen blijven | De agent bleef bij wat hij mag doen of beloven | Mensen voelen de grens van hun bevoegdheid; een model moet die verteld worden en kan er ongemerkt overheen gaan |
| Escalatiegedrag | Hij droeg over wanneer dat moest en hield de klant niet vast | Een mens merkt dat hij vastzit; een model kan in een lus of doodlopend spoor belanden zonder het te merken |
| Eerlijkheid over onzekerheid | Hij zei dat hij het niet wist in plaats van te gokken | Zelfverzekerd gokken is het standaardgedrag van een model, niet van een mens |
| Veilige omgang met gevoelige verzoeken | Hij heeft gevallen van zelfbeschadiging, fraude of juridisch risico correct geweigerd of doorgezet | Een oordeel dat een mens instinctief velt, moet voor een machine een expliciet criterium zijn |
Criteria die hetzelfde blijven
Sommige dingen tellen ongeacht wie of wat antwoordt, en die vormen de ruggengraat van de scorecard.
- Is het probleem opgelost: de klant vertrok met een opgelost probleem, niet alleen zonder een mens te spreken. Dit is het criterium dat een containment rate (in het Engels) stilletjes overslaat.
- Was de informatie juist en volledig: gedeeld met de scorecard voor medewerkers, maar hier veel zwaarder.
- Werd de klant passend behandeld: herformuleerd van warmte naar gepastheid, dus of het antwoord paste bij de situatie en de gemoedstoestand van de klant.
- Verliep de interactie efficiënt voor de klant: niet de afhandeltijd van de agent, maar of de klant zonder onnodige lussen bij zijn doel kwam.
Criteria schrijven die een AI kan scoren (in het Engels) laat zien hoe je elk van deze criteria zo formuleert dat het aan het transcript te toetsen is in plaats van een kwestie van mening.
Zo scoor je ermee: dekking en herleidbaarheid
Twee dingen onderscheiden een werkende scorecard voor een AI-agent van een decoratieve.
Scoor alles, geen steekproef
De kwaliteitscontrole van medewerkers beoordeelde maar een paar gesprekken per medewerker, omdat lezen duur was. Die logica werkt niet voor AI-agents, want hun fouten zijn systematisch: een zwakte in de prompt die één hallucinatie oplevert, levert die honderden keren op, en een steekproef van 2% mist het patroon meestal tot het al een probleem is. 100% van de gesprekken scoren (in het Engels) maakt van de scorecard een monitoringinstrument in plaats van een steekproefcontrole. Bij UiPath automatiseerde Kaizo 100% van de kwaliteitscontrole, met 200% ROI en een stijging van 8% in de kwaliteitsscore.
Herleid elke score naar het transcript
Een score voor feitelijke juistheid of trouw aan het beleid is alleen bruikbaar als je de exacte regels ziet waarop hij onderuitging. Anders kun je de prompt niet verbeteren en de score niet verdedigen als het team dat eigenaar is van de agent tegenspreekt. Elke Kaizo-score verwijst naar het bewijs waaruit hij voortkwam.
Laat de bouwer niet de enige beoordelaar zijn
Het ongemakkelijke structurele punt: als het team dat je AI-agent bouwde de enige is die hem beoordeelt, zijn juist de criteria die de agent in een slecht daglicht zouden stellen het vaakst te soepel. Scoor criteria als feitelijke juistheid en onveilige escalatie met je eigen scorecard, en zorg dat elke score linkt naar het bewijs in het gesprek. De indeling van stille fouten gaat dieper in op de fouten die een milde beoordelaar vaak mist.
Veelgestelde vragen
Wat is een scorecard voor een AI-agent?
Dat is de set criteria waarmee je gesprekken beoordeelt die een geautomatiseerd systeem voerde in plaats van een mens. Hij verschilt van een QA-scorecard voor medewerkers, omdat hij criteria schrapt die alleen voor mensen gelden, de criteria behoudt die gaan over de vraag of het probleem van de klant is opgelost en de informatie klopte, en criteria toevoegt die alleen bij automatisering horen, zoals feitelijke juistheid, trouw aan het beleid, binnen de grenzen blijven en escalatiegedrag.
Kan ik mijn bestaande QA-scorecard gebruiken voor een AI-agent?
Niet zonder hem aan te passen. Een scorecard voor medewerkers gaat uit van aannames over hoe mensen fouten maken, en AI-agents maken andere fouten. Een warme toon varieert nauwelijks bij een model en zegt weinig, terwijl verzonnen feiten en verzonnen beleid, die mensen zelden produceren, het grootste risico worden. Wie de scorecard voor medewerkers hergebruikt, richt de aandacht op de verkeerde fouten.
Welke criteria gelden alleen bij het scoren van een AI-agent?
Feitelijke juistheid van elke bewering, trouw aan het beleid (geen beleid verzinnen of overdrijven), binnen de grenzen blijven, escalatiegedrag (overdragen als hij vastzit in plaats van de klant vast te houden), eerlijkheid over onzekerheid en veilige omgang met gevoelige verzoeken. Elk criterium beschrijft een fout die een mens zelden maakt en een model routinematig.
Moet je elk gesprek van een AI-agent scoren of een steekproef?
Elk gesprek. De fouten van AI-agents zijn systematisch: een zwakte in de prompt die één hallucinatie oplevert, levert die honderden keren op, en een steekproef van 2% mist het patroon meestal tot het al een probleem is. Wie 100% van de gesprekken scoort, maakt van de scorecard een monitoringinstrument in plaats van een steekproefcontrole.
Waarom mag het team dat de AI-agent bouwde niet de enige beoordelaar zijn?
Omdat juist de criteria die de agent in een slecht daglicht zouden stellen het vaakst te soepel zijn. Scoor feitelijke juistheid en onveilige escalatie met je eigen scorecard, en herleid elke score naar het bewijs in het transcript.
Gerelateerde onderwerpen
- Kwaliteitscontrole van AI-agents en chatbots
- Stille fouten bij AI-agents: een indeling
- QA-criteria schrijven die een AI kan scoren (in het Engels)
- De prestaties van een AI-agent meten
- 100% van de gesprekken scoren (in het Engels)
Bouw een scorecard voor je AI-agent die ziet wat telt
Neem de gesprekken mee die je AI-agent vorige maand voerde en de scorecard die je vandaag gebruikt. We laten je zien welke criteria voor een machine niet meer zinvol zijn, welke fouten je huidige scorecard niet ziet en wat een scorecard die voor automatisering is gebouwd wel opvangt. Elke score is te herleiden naar de exacte regels in het transcript.