Qualitätssicherung für KI-Agenten und Chatbots beginnt mit einer Scorecard, die festlegt, wie eine gute, von KI bearbeitete Konversation aussieht. Bewerten Sie damit jede einzelne Konversation automatisch. Halten Sie die Bewertung unabhängig von der KI, die bewertet wird, und verknüpfen Sie jeden Score mit dem Transkript, damit Sie den Fehler beheben können.
Kurz gesagt
- Das Volumen von KI-Agenten ist zu hoch für manuelle Stichproben.
- Achten Sie auf falsche Informationen, verpasste Eskalationen, Halluzinationen und unpassenden Ton.
- Lassen Sie die Ergebnisse in Prompts, Guardrails und Routing einfließen.
- Bewerten Sie danach erneut, um zu prüfen, ob die Korrektur hält.
Schritt 1: Legen Sie fest, was „gut“ für einen KI-Agenten bedeutet
KI-Agenten scheitern anders als Menschen. Eine Scorecard für menschliche Agents, die Sie unverändert übernehmen, übersieht deshalb genau das, worauf es am meisten ankommt. Schreiben Sie zuerst auf, wie eine gute, von KI bearbeitete Konversation in Ihrem Unternehmen tatsächlich aussieht, und zwar in Kriterien, die eine Maschine an einem Transkript prüfen kann.
Kriterien entlang der Fehlerbilder von KI aufbauen
Eine starke KI-Scorecard deckt die Verhaltensweisen ab, die Vertrauen zerstören, wenn ein Agent sie falsch macht:
- Sachliche Richtigkeit: Hat der Agent korrekte Informationen gegeben, oder hat er eine Richtlinie, einen Preis oder einen Schritt erfunden, den es nicht gibt?
- Lösung: Hat er das Problem des Kunden wirklich gelöst oder nur das Ticket geschlossen?
- Richtige Eskalation: Hat er im richtigen Moment an einen Menschen übergeben, und nicht zu spät?
- Ton und Empathie: Hat er die Gefühlslage des Kunden getroffen, statt roboterhaft zu bleiben?
- Einhaltung von Richtlinien und Sicherheitsvorgaben: Ist er innerhalb der Grenzen geblieben, die Sie gesetzt haben, und hat er abgelehnt, was er ablehnen sollte?
Jedes Kriterium anhand von Belegen prüfbar machen
Formulieren Sie Kriterien so, dass sich ein Bestanden oder Nicht bestanden auf eine bestimmte Zeile der Konversation zurückführen lässt. Mit Kaizo bauen Sie die Scorecard, die Ihr Unternehmen tatsächlich nutzt, und Kaizo bewertet jede Konversation daran, so wie es Ihr bester Reviewer tun würde. So bleiben KI-QA und menschliche QA bei einem vergleichbaren Standard.
Schritt 2: Qualitätssicherung für KI-Agenten über 100 % der Konversationen, nicht per Stichprobe
Manuelle QA prüft eine Stichprobe von 2 % bis 5 % der Tickets, weil ein Mensch nur eine begrenzte Zahl lesen kann. Bei KI-Agenten ist diese Obergrenze nicht mehr haltbar, denn sie laufen mit Volumen, die kein Reviewteam sinnvoll per Stichprobe abdecken kann, und ein seltener, aber folgenreicher Fehler steckt fast immer in den 95 %, die niemand liest.
Die Bewertung automatisieren
Verbinden Sie den Helpdesk oder das CRM, in dem Ihre Konversationen bereits liegen, und lassen Sie das System jede von KI bearbeitete Interaktion bewerten, sobald sie eingeht, laufend und im Hintergrund. Kaizo ist nativ mit Zendesk und Salesforce integriert und liest Konversationen direkt aus den Systemen, die Sie bereits nutzen. Eine separate Pipeline müssen Sie also nicht pflegen.
Warum vollständige Abdeckung bei KI wichtiger ist
Ein einzelner KI-Agent wendet dasselbe Verhalten auf Tausende Konversationen an. Ein systematischer Fehler, etwa eine falsch verstandene Richtlinie oder eine schlechte Standardeinstellung, wiederholt sich deshalb in großem Maßstab. Erst wenn Sie 100 % bewerten, wird dieses Muster früh sichtbar. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI: genau die Abdeckung, die von KI bearbeitetes Volumen heute verlangt.
Sehen Sie es an Ihren eigenen Konversationen. Kaizo bewertet 100 % Ihrer Supportkonversationen und macht aus den Ergebnissen Coaching. Demo buchen.
Schritt 3: Halten Sie die Bewertung unabhängig
Diesen Schritt übersehen die meisten Teams, und er entscheidet darüber, ob man Ihrer KI-QA vertrauen kann. Lassen Sie einen KI-Agenten nicht ausschließlich von dem Team bewerten, das ihn gebaut hat. Ein Team, das daran gemessen wird, dass der Agent gut aussieht, ist nicht der beste Richter darüber, ob er gut ist.
Belege machen den Score glaubwürdig
Die bewertende Instanz sollte dieselbe Scorecard anwenden, ob eine Konversation von einem Menschen, Ihrem eigenen Bot oder der KI eines Drittanbieters bearbeitet wurde. Kaizo bewertet 100 % der Konversationen von Menschen und KI-Agenten anhand Ihrer eigenen Scorecard, und jeder Score verweist auf die Belege in der Konversation. So lässt sich das Urteil über einen Agenten überprüfen, statt es einfach glauben zu müssen.
Was Sie einen QA-Anbieter fragen sollten
- Können Sie einen KI-Agenten, den jemand anderes gebaut hat, mit derselben Scorecard bewerten wie unsere?
- Verweist jeder Score auf die Belege, damit wir Ihr Urteil prüfen können, statt es einfach zu glauben?
Schritt 4: Erkennen Sie die typischen Fehlerbilder von KI
Sobald die Bewertung auf jeder Konversation läuft, richten Sie sie auf die Fehler, die nur bei Automatisierung auftreten oder durch sie verstärkt werden. Diese Kategorien lohnt es sich, getrennt zu erfassen und über die Zeit zu verfolgen.
| Fehlerbild | Wie es aussieht | Was die Scorecard prüft |
|---|---|---|
| Falsche Information | Der Agent nennt eine Richtlinie, einen Preis oder einen Schritt, der nicht stimmt | War jede sachliche Aussage korrekt und durch Ihre Quellen gedeckt? |
| Verpasste Eskalation | Der Agent bearbeitet einen Fall weiter, den er an einen Menschen hätte übergeben müssen | Hat er beim richtigen Auslöser und rechtzeitig eskaliert? |
| Halluzinierte Sicherheit | Eine falsche Antwort, vorgetragen, als wäre sie sicher | Hat der Agent darauf verzichtet, Details zu erfinden, die er nicht prüfen konnte? |
| Unpassender Ton | Roboterhafte oder abweisende Sprache bei einem frustrierten Kontakt | Passte der Ton zur Gefühlslage des Kunden? |
| Richtlinienverstoß | Der Agent tut etwas, das er ablehnen sollte | Ist er innerhalb seiner Sicherheits- und Richtliniengrenzen geblieben? |
Schritt 5: Ergebnisse zurückspielen und erneut bewerten
QA lohnt sich nur, wenn sie Verhalten verändert. Weil jeder Kaizo-Score auf die genaue Stelle im Transkript verweist, aus der er stammt, ist ein Fehler nicht nur eine Markierung, sondern ein konkretes, reproduzierbares Beispiel, mit dem Sie arbeiten können.
Den Kreislauf schließen
- Spielen Sie Fehler bei der Richtigkeit an den Prompt, die Wissensdatenbank oder die Quelle zurück, aus der die falsche Antwort kam.
- Machen Sie aus verpassten Eskalationen eine schärfere Routing-Regel oder einen schärferen Auslöser.
- Fassen Sie wiederkehrende Fehler zusammen, damit Sie das Muster einmal beheben, statt Fälle einzeln zu flicken.
Bewerten Sie danach erneut, um zu prüfen, ob die Korrektur hält. Vollständige, laufende Abdeckung heißt: Sie sehen die Wirkung einer Änderung über alle Konversationen hinweg, nicht in einer Stichprobe, die den Rückschritt übersehen könnte.
Häufige Fehler, die Sie vermeiden sollten
Ein paar Fehler untergraben QA-Programme für KI leise, bevor sie Nutzen bringen.
- KI so stichprobenartig prüfen wie früher Menschen: Eine 2-%-Stichprobe eines Bots mit hohem Volumen übersieht systematische Fehler fast zwangsläufig.
- Das Team, das den Agenten gebaut hat, allein bewerten lassen: Ohne unabhängige Bewertung ist ein gut aussehender Score nicht dasselbe wie gute Arbeit.
- Ohne Belege bewerten: Eine Zahl, die Sie nicht auf eine Zeile im Transkript zurückführen können, lässt sich weder überprüfen noch für Coaching nutzen noch anfechten.
- Die Scorecard für Menschen unverändert übernehmen: Fehlerbilder von KI wie Halluzination und falsche Sicherheit brauchen eigene Kriterien.
- Messen, aber nie zurückspielen: QA, die Prompts, Guardrails oder Routing nicht verändert, ist nur Reporting.
Häufig gestellte Fragen
Wie funktioniert die Qualitätssicherung für einen KI-Agenten oder Chatbot?
Bauen Sie eine Scorecard, die eine gute, von KI bearbeitete Konversation definiert, mit Richtigkeit, Lösung, richtiger Eskalation, Ton und Einhaltung von Richtlinien. Bewerten Sie 100 % der KI-Konversationen automatisch daran, halten Sie die Bewertung unabhängig von der bewerteten KI, und verknüpfen Sie jeden Score mit den Belegen im Transkript, damit sich Fehler prüfen und beheben lassen.
Warum muss die Bewertung unabhängig vom KI-Agenten sein?
Wenn nur die Menschen einen KI-Agenten bewerten, die ihn gebaut haben, haben sie einen Anreiz, den Agenten gut aussehen zu lassen. Erst eine Bewertung, die jeden Score mit den Belegen in der Konversation verknüpft, macht den Score glaubwürdig, weil jeder ihn prüfen kann.
Kann man dieselbe Scorecard für KI-Agenten und menschliche Agents nutzen?
Die Kriterien, die für beide gelten, etwa Lösung und Ton, können Sie teilen. So bleiben KI-QA und menschliche QA vergleichbar. KI braucht aber zusätzliche Kriterien für ihre eigenen Fehlerbilder, etwa Halluzination und falsche Sicherheit. Am stärksten ist deshalb ein gemeinsamer Standard, ergänzt um KI-spezifische Prüfungen.
Wie viele KI-Konversationen sollten Sie prüfen?
Alle. KI läuft mit Volumen, die kein Team sinnvoll per Stichprobe abdecken kann, und ein systematischer Fehler wiederholt sich in jeder Konversation, die der Agent bearbeitet. Eine kleine Stichprobe übersieht ihn deshalb meist. Die automatische Bewertung von 100 % der Konversationen macht solche Muster früh sichtbar.
Welche Fehlerbilder von KI-Agenten sollte eine Scorecard erfassen?
Fünf Kategorien lohnt es sich, getrennt zu verfolgen: falsche Informationen, verpasste Eskalationen, halluzinierte Sicherheit, unpassender Ton und Richtlinienverstöße. Für jede prüft die Scorecard eine konkrete Frage, zum Beispiel ob jede sachliche Aussage durch Ihre Quellen gedeckt war oder ob der Agent rechtzeitig eskaliert hat.
Weiterlesen
- Was ist agentische QA? (auf Englisch)
- Was ist Auto QA? (auf Englisch)
- Was ist ein KI-Agent? (auf Englisch)
- Die Leistung von KI-Agenten messen
- Was ist LLM as a Judge? (auf Englisch)
- Wie genau ist KI-QA?
- Ein Bewertungsschema, das eine KI wirklich bewerten kann (auf Englisch)
- KI-QA-Bewertungen in einer Woche validieren (auf Englisch)
- False Positives in der automatisierten QA (auf Englisch)