Ein K.o.-Kriterium in der Qualitätsbewertung (englisch Auto-Fail), auch kritischer Fehler genannt, ist ein QA-Kriterium, das die gesamte Bewertung auf null setzt, sobald es verletzt wird. Es ist für Fehler gedacht, die nichts anderes ausgleichen kann, etwa einen Compliance-Verstoß oder einen Fehler im Umgang mit Daten.
Kurz gesagt
- Ein Kriterium kommt nur infrage, wenn schon ein einziger Verstoß schwer wiegt und überprüfbar ist.
- Eine lange Liste von K.o.-Kriterien ist meist ein Gewichtungsproblem.
- Bei automatisierter Bewertung sind Fehlalarme (False Positives) das größere Risiko.
- Formulieren Sie K.o.-Kriterien eng und führen Sie jedes auf Belege zurück.
Warum sich manche Fehler nicht verrechnen lassen
Die meisten QA-Bewertungen sind eine Durchschnittsrechnung. Eine Scorecard zerlegt eine Konversation in Kriterien, jedes bringt Punkte, und die Summe beschreibt, wie gut die Interaktion war. Das funktioniert, weil sich die meisten Qualitätssignale gegeneinander aufwiegen lassen: Eine langsame Lösung kann durch eine ungewöhnlich klare Erklärung ausgeglichen werden.
Ein K.o.-Kriterium ist die Ausnahme von dieser Logik. Es legt fest, dass eine bestimmte Sache nicht in den Durchschnitt eingeht: Tritt sie ein, ist die Bewertung null, egal was sonst gut lief. Teams sprechen auch von automatischem Nichtbestehen, kritischem Fehler oder schwerwiegendem Fehler, und meist steht es in einem eigenen Abschnitt oben auf der Scorecard statt als gewichtete Position. Der Grund: Manche Fehler sind etwas grundsätzlich anderes als eine niedrige Punktzahl. Eine Kontoänderung ohne Prüfung der Identität des Kunden ist keine mittelmäßige Interaktion. Sie hätte gar nicht stattfinden dürfen, und wer sie gegen einen freundlichen Ton verrechnet, gibt falsch wieder, was tatsächlich passiert ist.
Wann ein Kriterium einen Score auf null setzen darf
Weil ein K.o.-Kriterium alles andere aussticht, sollte es auf einer Scorecard die höchste Hürde haben. Kurz gefasst lautet der Test: Ein einziger Verstoß muss wirklich schwer wiegen, so objektiv sein, dass zwei Reviewer immer übereinstimmen, dass er passiert ist, anhand der Belege im Transkript überprüfbar sein und im Einflussbereich des Agents liegen. Ein Kriterium, das einen dieser Punkte nicht erfüllt, gehört stattdessen mit hoher Gewichtung in den gewichteten Teil. Dort senkt es den Score weiterhin und taucht weiterhin im Coaching auf, setzt aber nicht alles auf null.
Die vollständigen Anforderungen, mit ausführlichen Beispielen dafür, welche Kriterien sie erfüllen und welche nicht, finden Sie in unserem Leitfaden zu Auto-Fail-Kriterien in der QA (auf Englisch). Die Unterscheidung, die Sie hier festhalten sollten, ist einfach: Die Frage lautet nie „Ist das wichtig?“. Fast alles auf einer Scorecard ist wichtig. Die Frage ist, ob sich ein einzelner Fall durch nichts ausgleichen lässt.
Beispiele für K.o.-Kriterien in der Qualitätsbewertung
Ein paar Beispiele machen die Grenze konkret.
| Kriterium | K.o.-Kriterium oder gewichtet | Warum |
|---|---|---|
| Identität vor einer Kontoänderung nicht geprüft | K.o.-Kriterium | Objektiv, im Transkript sichtbar und für sich allein schwerwiegend |
| Vorgeschriebener Hinweis oder Einwilligungstext ausgelassen | K.o.-Kriterium | Die Worte wurden gesagt oder nicht, und das Auslassen kann die Interaktion ungültig machen |
| Sensible Daten falsch behandelt | K.o.-Kriterium | Binär, durch Belege gestützt und durch nichts anderes in der Konversation auszugleichen |
| Unhöflicher oder abweisender Ton | Stark gewichtet | Ernst zu nehmen, aber Reviewer ziehen die Grenze unterschiedlich, deshalb besteht es den Test „immer einig“ nicht |
| Verpasste Upselling-Chance | Gewichtet, niedrig | Eine kommerzielle Präferenz, kein schwerer Fehler |
K.o.-Kriterien bei automatisierter Bewertung
Die Definition ändert sich nicht, wenn eine Maschine bewertet, wohl aber das Risikoprofil. Ein Bewertungssystem kann bei einem K.o.-Kriterium auf zwei Arten danebenliegen: Es schlägt an, obwohl es nicht sollte, oder es übersieht einen echten Verstoß. Diese beiden Fehler wiegen nicht gleich. Ein übersehenes K.o.-Kriterium ist dieselbe Lücke, die schon die manuelle Stichprobe hatte. Ein fälschlich ausgelöstes K.o.-Kriterium gibt jemandem eine Null, der nichts falsch gemacht hat, und sobald das Team erlebt hat, dass das System eine solche Entscheidung falsch trifft, wird jeder andere Score anfechtbar.
Diese Asymmetrie ist der Grund, warum automatisierte K.o.-Kriterien eng formuliert und auf Präzision abgestimmt sein sollten, und warum jede Null auf genau die Zeilen verweisen muss, die sie ausgelöst haben. Einen Score, den Sie auf die Belege zurückführen können, können Sie prüfen und, falls er falsch ist, korrigieren. Ein Score, den Sie nicht zurückführen können, ist nur ein Vorwurf mit einer Zahl daneben. Kaizo verknüpft jeden Score, K.o.-Kriterien eingeschlossen, mit den Belegen in der Konversation. Wenn Sie sehen möchten, wie das an Ihren eigenen Konversationen aussieht, buchen Sie eine Demo. Präzision, Einsprüche und Coaching nach einer Null behandelt ausführlich der Leitfaden zu Auto-Fail-Kriterien (auf Englisch).
Häufig gestellte Fragen
Was ist ein K.o.-Kriterium in der QA?
Ein K.o.-Kriterium, auch automatisches Nichtbestehen oder kritischer Fehler genannt (englisch Auto-Fail), ist ein QA-Kriterium, das eine gesamte Bewertung auf null setzt, sobald es verletzt wird, unabhängig davon, wie der Rest der Konversation verlaufen ist. Es ist für Fehler gedacht, die sich nicht ausgleichen lassen, etwa einen Compliance-Verstoß oder einen Fehler im Umgang mit Daten, den gute Leistung an anderer Stelle nicht wettmachen kann.
Was ist der Unterschied zwischen einem K.o.-Kriterium und einem gewichteten Kriterium?
Ein gewichtetes Kriterium trägt Punkte zu einem Durchschnittsscore bei, ein Fehler senkt also die Summe, macht sie aber nicht zunichte. Ein K.o.-Kriterium steht außerhalb des Durchschnitts und setzt die gesamte Bewertung schon bei einem einzigen Verstoß auf null. Ein Kriterium eignet sich nur dann als K.o.-Kriterium, wenn ein einzelner Fall schwer wiegt, objektiv ist, anhand von Belegen überprüfbar ist und im Einflussbereich des Agents liegt. Andernfalls gehört es in den gewichteten Teil.
Welche Beispiele gibt es für K.o.-Kriterien?
Typische Beispiele sind: die Identität eines Kunden vor einer Kontoänderung nicht zu prüfen, einen vorgeschriebenen Hinweis oder eine Einwilligungserklärung auszulassen, sensible Daten falsch zu behandeln oder eine unzulässige Zusage zu machen, etwa eine Rückerstattung, die die Richtlinie nicht vorsieht. Jedes davon ist objektiv, im Transkript sichtbar und für sich allein schwer genug, um die Interaktion inakzeptabel zu machen.
Kann KI K.o.-Kriterien automatisch anwenden?
Ja, und objektive Kriterien wie die Frage, ob die Identität geprüft wurde, sind genau das, was automatisierte Bewertung am zuverlässigsten leistet. Voraussetzung ist, dass jedes Kriterium an Konversationen überprüft wird, die Reviewer bereits bewertet haben, eng formuliert ist, um Fehlalarme zu vermeiden, und auf die Belege zurückführbar ist, die es ausgelöst haben. So lässt sich eine Null überprüfen, statt dass man sie einfach glauben muss.
Wie viele K.o.-Kriterien sollte eine Scorecard haben?
So wenige wie möglich. Eine lange Liste von K.o.-Kriterien ist meist ein Gewichtungsproblem: Die Frage ist nie, ob ein Kriterium wichtig ist, denn fast alles auf einer Scorecard ist wichtig, sondern ob sich ein einzelner Fall durch nichts ausgleichen lässt. Ein Kriterium, das diesen Test nicht besteht, gehört mit hoher Gewichtung in den gewichteten Teil, wo es den Score weiterhin senkt und im Coaching auftaucht, ohne alles auf null zu setzen.