Wer Fehler von KI-Agenten erkennen will, muss vor allem die stillen finden: Fehler eines KI-Agenten, die Ihre Kennzahlen als Erfolg zählen. Das Ticket wird geschlossen, das Containment verbucht einen Erfolg, und der Kunde geht mit einer falschen Antwort oder einem offenen Anliegen. Unsichere Nicht-Eskalation, bei der der KI-Agent einen Fall behält, den er an einen Menschen hätte übergeben müssen, gehört zu den am schwersten sichtbaren, weil nie ein Eskalationsereignis protokolliert wird.
Kurz gesagt
- Stille Fehler von KI-Agenten treten in sechs gängigen Typen auf, von selbstsicherer Erfindung bis zur flüssigen Antwort auf die falsche Frage.
- Unsichere Nicht-Eskalation ist der leiseste Typ, denn ein Fall, der nie eskaliert, sieht auf jedem Dashboard wie Self-Service aus.
- Fehler von KI-Agenten wiederholen sich: Eine Schwäche im Prompt erzeugt denselben Fehler jedes Mal, wenn ihre Bedingungen wieder eintreten.
- Um stille Fehler zu finden, bewerten Sie, was der KI-Agent gesagt hat, in jeder Konversation und anhand Ihrer eigenen schriftlichen Kriterien.
Warum gerade stille Fehler schaden
Wenn ein KI-Agent laut scheitert, wissen Sie es bereits. Er bricht mit einem Fehler ab, er eskaliert, er sagt dem Kunden, dass er nicht helfen kann, und ein Mensch übernimmt. Dieser Fehler ist ärgerlich, aber sichtbar, und sichtbare Fehler werden behoben, weil die Kennzahlen sie erfassen. Stille Fehler hinterlassen nichts, was die Kennzahlen erfassen könnten.
Ein stiller Fehler ist anders. Der Agent beendet die Konversation, markiert sie als gelöst und macht weiter, nachdem er etwas falsch gemacht hat, das niemand protokolliert hat. Das Containment verbucht sie als ohne Menschen gelöst. Das Volumen-Dashboard zählt sie als bearbeitet. Das Lösungs-Flag, falls es eines gibt, hat der Agent selbst gesetzt, und er glaubte, erfolgreich gewesen zu sein. Jedes Ihrer Monitoring-Systeme ist sich einig, dass die Konversation gut gelaufen ist, und die einzige Partei, die es besser weiß, ist der Kunde, der Ihre Umfrage nicht ausfüllt.
Deshalb sammeln sich stille Fehler an: Genau die Feedbackschleife, die sie sichtbar machen würde, fehlt. Deshalb müssen Kundenservice-Insights auch aus dem kommen, was in jeder Konversation gesagt wurde, nicht aus Lösungs-Flags und Umfragen. Unser Leitfaden zur Qualitätssicherung für KI-Agenten ist darauf ausgelegt, diese Schleife zu schließen.
Die sechs Typen stiller Fehler von KI-Agenten
Sechs wiederkehrende Typen decken das meiste ab, was bei einem KI-Agenten unbemerkt schiefgeht: selbstsichere Erfindung, erfundene Richtlinie, falsche Lösung, unsichere Nicht-Eskalation, Kompetenzüberschreitung und die Antwort auf die falsche Frage. Sie zu benennen ist die halbe Arbeit, denn Sie können keinen Fehler bewerten, den Sie nicht definiert haben, und keiner von ihnen löst eine Fehlermeldung aus.
| Stiller Fehler | Was passiert | Warum das Dashboard ihn übersieht |
|---|---|---|
| Selbstsichere Erfindung | Der Agent nennt eine erfundene Tatsache, als wäre sie sicher | Kein Unsicherheits-Flag schlägt an, und das Ticket wird normal geschlossen |
| Erfundene Richtlinie | Er erzeugt eine plausible Regel zu Erstattung, Garantie oder Berechtigung, die es nicht gibt | Sie klingt verbindlich, also hinterfragt sie niemand, bis ein Kunde Sie beim Wort nimmt |
| Falsche Lösung | Er erklärt das Problem für gelöst, obwohl es das nicht ist | Das Lösungs-Flag setzt der Agent selbst, und das Containment zählt es als Erfolg |
| Unsichere Nicht-Eskalation | Er bearbeitet einen Fall weiter, den er an einen Menschen hätte übergeben müssen | Es wird kein Eskalationsereignis protokolliert, also wirkt der Fall wie Self-Service |
| Kompetenzüberschreitung | Er antwortet oder verspricht über das hinaus, wozu er befugt ist | Der Kunde ist im Moment zufrieden, also sehen die Zufriedenheitssignale gut aus |
| Richtige Antwort, falsche Frage | Er beantwortet flüssig eine Frage, die der Kunde nicht gestellt hat | Flüssige Sprache und ein geschlossenes Ticket sehen nach Erfolg aus |
Selbstsichere Erfindung ist das, was die meisten Teams Halluzination nennen. Die anderen fünf können auftreten, obwohl jede Tatsache stimmt, und deshalb findet ein Faktencheck allein sie nicht.
Was eine Richtlinie zur Nicht-Eskalation für KI-Agenten regeln sollte
Eine Richtlinie zur Nicht-Eskalation für KI-Agenten ist das schriftliche Regelwerk dafür, wann der Agent aufhören und den Fall an einen Menschen übergeben muss. Sie nennt die Auslöser, die Übergabe selbst und wie jeder Fall danach geprüft wird. Ohne sie lässt sich unsichere Nicht-Eskalation nicht bewerten, weil niemand festgelegt hat, was der Agent hätte tun sollen.
Eine praxistaugliche Richtlinie beantwortet vier Fragen:
- Welche Anfragen gehen immer an einen Menschen? Zum Beispiel ein Kunde, der nach einer Person fragt, eine Beschwerde, die rechtliche Schritte erwähnt, oder eine Anfrage außerhalb dessen, was der Agent entscheiden darf.
- Welche Signale erzwingen mitten in der Konversation eine Übergabe? Zum Beispiel dieselbe Frage, die zweimal ohne Fortschritt gestellt wird, wachsender Frust oder ein Kunde, der schutzbedürftig wirkt.
- Was nimmt die Übergabe mit? Der Mensch sollte den Kontext erhalten, damit der Kunde sich nicht wiederholen muss. Unser Leitfaden zur Qualitätssicherung der Übergabe zwischen KI-Agent und Mensch zeigt, wie Sie diesen Schritt bewerten.
- Wie wird jeder Fall geprüft? Nehmen Sie „eskaliert, wenn die Richtlinie es verlangt hat“ als Kriterium in Ihre Scorecard für KI-Agenten auf, und bewerten Sie es bei den Konversationen, die der Agent abgeschlossen hat, nicht nur bei denen, die er weitergegeben hat.
Eskalierte Konversationen brauchen ebenfalls ein eigenes Bewertungsschema. Wie Sie ein eskaliertes Ticket bewerten erklärt, wie Sie jeden Fehler der Stelle zuordnen, an der er entstanden ist.
Warum sich Fehler von KI-Agenten wiederholen, statt sich zu verteilen
Fehler von KI-Agenten wiederholen sich, weil sie strukturell sind. Sie stammen aus dem Prompt, dem abgerufenen Wissen, dem Modell oder den Guardrails, also erzeugt dieselbe Schwäche jedes Mal denselben stillen Fehler, wenn die Bedingungen wieder eintreten. Die Fehler eines menschlichen Agenten sind dagegen weitgehend individuell und zufällig: ein schlechter Tag, ein Missverständnis, eine Lücke in der Schulung einer Person.
Das verändert, was auf dem Spiel steht. Eine erfundene Richtlinie ist eine schlechte Konversation. Dieselbe Schwäche im Prompt, die diese erfundene Richtlinie einen Monat lang in jeder passenden Konversation erzeugt, ist ein Haftungsrisiko, das so schnell wächst wie der Einsatz selbst. Es verändert auch die Strategie zur Erkennung: Weil die Fehler systematisch sind, ist die Stichprobe das falsche Werkzeug. Eine 2-%-Stichprobe ist darauf ausgelegt, eine zufällige Quote zu schätzen, und übersieht regelmäßig einen Fehler, der nur unter einer bestimmten Bedingung auftritt, die in einem Teil der Konversationen vorkommt. Sie müssen sich alle ansehen.
So erkennen Sie Fehler von KI-Agenten, die Ihre Kennzahlen verbergen
Stille Fehler sind für Volumen- und Lösungskennzahlen unsichtbar, weil diese die Form der Konversation messen, nicht ihren Inhalt. Um sie zu finden, lesen Sie, was der KI-Agent tatsächlich gesagt hat, in großem Umfang, anhand definierter Kriterien, in jeder Konversation, und führen jede Feststellung auf die Zeilen zurück, die sie verursacht haben, damit der Verantwortliche die Ursache beheben kann.
Den Inhalt bewerten, nicht das Ergebnis
Prüfen Sie in jeder Konversation die Punkte, die ein stiller Fehler verletzt: War jede Tatsachenbehauptung wahr, war jede Richtlinie echt, war die erklärte Lösung tatsächlich eine, hat der Agent eskaliert, als er hätte eskalieren sollen? Das sind die Kriterien einer Scorecard für KI-Agenten, und es sind genau die, die ein Routing-Log nicht beantworten kann.
Alles abdecken
Weil die Fehler systematisch sind, ist Abdeckung kein Extra. Wer 100 % der Konversationen bewertet (auf Englisch), macht aus einem stillen Fehler, den irgendwann jemand bemerkt, ein Muster, das Sie in der Woche sehen, in der es beginnt. Bei UiPath hat Kaizo die Qualitätssicherung zu 100 % automatisiert, mit 200 % ROI und einer Steigerung des Quality Scores um 8 %. Das ist die Abdeckung, bei der systematische Fehler früh sichtbar werden.
Sehen Sie es in Ihren eigenen Konversationen. Kaizo bewertet 100 % Ihrer Support-Konversationen anhand Ihrer eigenen Kriterien, auch die, die Ihr KI-Agent bearbeitet. Demo buchen.
Fehlermuster finden, für die Sie noch keine Kriterien haben
Eine Scorecard erfasst nur Fehler, die Sie benannt haben, also suchen Sie nach denen, die Sie noch nicht benannt haben. Beginnen Sie mit den Konversationen, die der KI-Agent als gelöst markiert hat und bei denen der Kunde mit demselben Anliegen zurückkam oder bei denen die Stimmung nach der Antwort des Agenten ins Negative kippte. Wenn ein neues Muster auftaucht, schreiben Sie es als Kriterium auf und bewerten Sie es von da an.
Jede Feststellung auf die genauen Zeilen zurückführen
Ein stiller Fehler lässt sich nur beheben, wenn jemand auf ihn zeigen kann. Kaizo bewertet 100 % der Konversationen von Menschen und KI-Agenten anhand Ihrer eigenen Scorecard, benennt selbstsichere Erfindung und falsche Lösung als das, was sie sind, und führt jede Feststellung auf die genauen Zeilen zurück, die sie verursacht haben. Diese Nachvollziehbarkeit erlaubt es Ihnen, einen stillen Fehler zu der Person zurückzubringen, die für den Prompt verantwortlich ist, und ihn tatsächlich zu beheben, statt darüber zu streiten, ob er überhaupt passiert ist.
Wann eine vollständige Prüfung auf stille Fehler nichts für Sie ist
Wenn Ihr KI-Agent nur eine Handvoll Konversationen pro Woche bearbeitet, lesen Sie sie alle selbst; dafür brauchen Sie keine Software. Wenn Sie noch keine schriftlichen Kriterien haben, beginnen Sie vor allem anderen mit der Scorecard für KI-Agenten. Und wenn Ihr Bot Kunden nur in die richtige Warteschlange leitet, ohne ihnen zu antworten, können die meisten dieser Fehlertypen nicht auftreten, und Ihre Routing-Logs sagen Ihnen das meiste, was Sie wissen müssen.
Häufig gestellte Fragen
Was ist ein stiller Fehler bei einem KI-Agenten?
Ein stiller Fehler ist ein Fehler, der in den Kennzahlen, die Sie beobachten, keine Spur hinterlässt. Die Konversation endet, das Ticket wird geschlossen, das Containment zählt sie als Erfolg, und der Kunde geht mit einer falschen Antwort oder einem offenen Anliegen. Er ist gefährlich, weil sich jedes Monitoring-System einig ist, dass die Konversation gut gelaufen ist, und sich der Fehler deshalb unbemerkt ansammelt.
Welches sind die wichtigsten Typen stiller Fehler von KI-Agenten?
Selbstsichere Erfindung (erfundene Tatsachen nennen), erfundene Richtlinie (Regeln erzeugen, die es nicht gibt), falsche Lösung (ein Problem für gelöst erklären, obwohl es das nicht ist), unsichere Nicht-Eskalation (einen Fall bearbeiten, den er hätte übergeben müssen), Kompetenzüberschreitung (über die eigene Befugnis hinaus handeln) und die flüssige Antwort auf die falsche Frage. Keiner davon löst eine Fehlermeldung aus oder setzt ein Lösungs-Flag.
Warum übersieht eine Stichprobe stille Fehler?
Weil Fehler von KI-Agenten systematisch sind, nicht zufällig. Eine Schwäche im Prompt erzeugt denselben Fehler, wann immer ihre Bedingungen wieder eintreten, oft in einem bestimmten Teil der Konversationen. Eine kleine Zufallsstichprobe ist darauf ausgelegt, eine zufällige Quote zu schätzen, und übersieht regelmäßig einen Fehler, der sich auf Bedingungen konzentriert, die sie zufällig nicht erfasst hat. Erst die vollständige Abdeckung macht das Muster sichtbar.
Ist ein stiller Fehler dasselbe wie eine Halluzination?
Nein. Eine Halluzination, also selbstsichere Erfindung, ist einer der sechs Typen. Ein KI-Agent kann auch eine Richtlinie erfinden, eine falsche Lösung melden, nicht eskalieren, über seine Befugnis hinaus handeln oder die falsche Frage beantworten, manchmal obwohl jede Tatsache stimmt. Ein Faktencheck allein findet nur einen Teil des Problems.
Bedeutet eine hohe Containment Rate, dass der KI-Agent funktioniert?
Für sich genommen nicht. Das Containment zählt eine Konversation als Erfolg, wenn der Kunde keinen Menschen erreicht hat, und eine falsche Lösung oder eine unsichere Nicht-Eskalation sieht genau so aus. Sie müssen bewerten, was der Agent gesagt hat, um zu wissen, ob eine Konversation ohne Übergabe an einen Menschen eine gute war.
Wer sollte einen stillen Fehler beheben, sobald er gefunden ist?
Wer die Ursache verantwortet, also den Prompt, das abgerufene Wissen oder die Guardrails. Weil Fehler von KI-Agenten strukturell sind, behebt Coaching sie nicht so, wie es den Fehler eines Menschen behebt. Jede Feststellung sollte auf die genauen Zeilen im Transkript zurückführen, damit der Verantwortliche sieht, was er ändern muss.
Verwandte Begriffe
- Die Scorecard für KI-Agenten
- Qualitätssicherung für KI-Agenten und Chatbots
- Containment Rate ehrlich messen (auf Englisch)
- Wie genau ist KI-gestützte Qualitätsbewertung?
- 100 % der Konversationen bewerten (auf Englisch)
Finden Sie die Fehler, die Ihr Dashboard als Erfolg zählt
Bringen Sie einen Monat an Konversationen mit, die Ihr KI-Agent als gelöst markiert hat. Wir bewerten sie anhand Ihrer eigenen Kriterien über alle Konversationen hinweg und zeigen Ihnen die selbstsicheren Erfindungen, erfundenen Richtlinien und falschen Lösungen, die das Containment als Erfolg gezählt hat. Jede Feststellung führt auf die genauen Zeilen im Transkript zurück, und unsere Kundenservice-Insights zeigen, welche Fehler systemisch sind, damit Sie sie direkt an die Person weitergeben können, die für den Prompt verantwortlich ist.