Die Automatisierungsquote im Kundenservice (im Englischen Deflection Rate) zählt Kontakte, die nie bei einem Menschen ankamen. Sie misst also Volumen, niemals Qualität. Eine richtige Antwort, ein Kunde, der aufgegeben hat, und eine selbstbewusst falsche Antwort sehen gleich aus, und die meisten QA-Programme prüfen genau diese Konversationen nie.
Kurz gesagt
- Die selbstbewusst falsche Antwort kostet am meisten, weil sie nie eskaliert.
- Die meisten veröffentlichten Benchmarks stammen von Anbietern, die an genau dieser Kennzahl gemessen werden.
- Wiederkontakt innerhalb von sieben Tagen ist die günstigste Prüfung und liegt bereits in Ihrem Helpdesk.
- Wer automatisiert abgeschlossene Tickets aus der Bewertung ausklammert, übersieht die gesamte Arbeitslast seines Bots.
Was misst die Automatisierungsquote eigentlich?
Die Automatisierungsquote ist der Anteil eingehender Kontakte, die abgeschlossen wurden, ohne dass ein menschlicher Agent sie berührt hat. Die übliche Formel lautet: abgefangene Kontakte geteilt durch alle Kontakte, wobei abgefangen bedeutet, dass Self-Service oder ein KI-Agent den Kontakt von Anfang bis Ende bearbeitet hat.
Lesen Sie diese Definition noch einmal, denn das ganze Problem steckt darin. Der Zähler wird durch etwas definiert, das nicht passiert ist. Ein Mensch war nicht beteiligt. Nichts an dieser Messung fragt, ob das Problem des Kunden verschwunden ist.
Deshalb verhält sich die Kennzahl unter Druck so seltsam. Machen Sie es schwerer, Ihr Hilfecenter zu verlassen, und die Quote steigt. Verstecken Sie das Kontaktformular hinter drei Klicks, und die Quote steigt. Lassen Sie den Bot selbstbewusst antworten, statt bei Unsicherheit zu übergeben, und die Quote steigt. In jedem Fall verbessert sich die Zahl und das Kundenerlebnis wird schlechter: das typische Zeichen einer Kennzahl, die das falsche Objekt misst.
Nichts davon macht sie zu einer nutzlosen Zahl. Die Automatisierungsquote ist ein völlig brauchbares Maß für Kapazität, und Kapazität ist etwas, das man tatsächlich steuern muss. Nützlich ist sie nicht mehr, sobald jemand sie als Qualitätsmaß liest, was in den meisten Organisationen etwa in der zweiten Woche passiert.
Merke
Die Automatisierungsquote ist eine Volumenkennzahl im Gewand einer Qualitätskennzahl. Sie sagt Ihnen, wie viel Arbeit Ihr Bot aufgenommen hat. Sie kann Ihnen nicht sagen, ob diese Arbeit erledigt wurde.
Warum sehen vier verschiedene Ergebnisse in den Daten gleich aus?
Ein automatisiert abgeschlossenes Ticket hat mindestens vier mögliche Ausgänge, und Ihr Reporting fasst alle vier in einer Zeile zusammen. Das ist das Wichtigste, was man über diese Kennzahl verstehen muss, und es ist der Grund, warum zwei Teams mit derselben Automatisierungsquote in völlig unterschiedlichem Maß in Schwierigkeiten stecken können.
Gehen Sie die Tabelle unten mit Ihrem eigenen Produkt im Kopf durch. Die meisten Teams können innerhalb weniger Minuten für alle vier Fälle ein echtes Beispiel nennen, und genau das ist schon der Befund.
| Was tatsächlich passiert ist | Was der Kunde erlebt hat | Wie es in den Automatisierungsdaten aussieht | Wo es stattdessen auftaucht |
|---|---|---|---|
| Wirklich gelöst | Hat die richtige Antwort bekommen und ist weitergezogen | Abgefangen | Nirgends. Das ist der Fall, für den Sie bezahlen |
| Abgebrochen | Hat aufgegeben und ist nicht zurückgekommen | Abgefangen, identischer Datensatz | Abwanderung, eine stille Nichtverlängerung, eine verlorene Bestellung |
| Vom Kunden umgeleitet | Hat den Chat verlassen und angerufen, gemailt oder öffentlich gepostet | Abgefangen, und der zweite Kontakt zählt oft als neues Ticket | Wiederkontaktrate und Ihr eigenes Eingangsvolumen |
| Selbstbewusst falsch | Hat eine klare, aber falsche Antwort bekommen und danach gehandelt | Abgefangen, und häufig mit positiven Oberflächensignalen | Eine Erstattung, eine Beschwerde, ein Compliance-Vorfall, Wochen später |
Automatisierungsquote, Containment und Lösung sind nicht dieselbe Zahl
Diese drei Begriffe werden in Anbietermaterial austauschbar verwendet, und sie bedeuten wirklich Unterschiedliches. Es lohnt sich, sie zu klären, bevor über Zielwerte gesprochen wird.
- Automatisierungsquote fragt, ob der Kontakt einen Menschen erreicht hat. Sie wird an der Eingangstür gemessen und ist die lockerste der drei.
- Containment fragt, ob die Konversation im automatisierten Kanal geblieben ist. Eine Konversation im Containment (auf Englisch) kann trotzdem schlecht enden; sie endet dann eben schlecht im Bot.
- Lösung fragt, ob das Problem des Kunden weg ist. Sie ist die einzige der drei, bei der es um den Kunden geht, und die einzige, die sich nicht messen lässt, ohne ihn entweder zu fragen oder die Konversation zu lesen.
In der Lücke zwischen Containment und Lösung liegt das Geld. Ein Team, das 70 % Containment meldet und 70 % Lösung annimmt, macht einen ungeprüften Sprung, und wie groß dieser Sprung ist, weiß niemand, bis jemand ihn misst. Meist hat das niemand getan, denn messen heißt hier Konversationen lesen statt ein Dashboard abzurufen.
Wenn ein Anbieter eine Lösungsquote meldet, prüfen Sie, ob das System sich selbst bewertet. Ein KI-Agent, der selbst entscheidet, ob er etwas gelöst hat, ist kein Beleg, sondern eine Selbsteinschätzung, und das NIST AI Risk Management Framework behandelt die unabhängige Messung der Leistung eines KI-Systems gerade deshalb als eigene Funktion, weil selbst gemeldete Leistung keine Messung ist. Dieselbe Logik gilt in umgekehrter Richtung für die Frage, wie genau KI-Bewertung ist: Jeder Bewerter, Mensch oder Modell, braucht eine Genauigkeit, die von etwas außerhalb seiner selbst festgestellt wird.
Achtung
Wenn Ihr KI-Agent seine eigene Lösungsquote meldet, ist diese Zahl eine Selbsteinschätzung und sollte in jeder Präsentation, in der sie auftaucht, auch so gekennzeichnet sein. Zum Beleg wird sie erst, wenn etwas vom Agenten Unabhängiges eine Stichprobe davon prüft.
Warum ist die selbstbewusst falsche Antwort die teure?
Ein KI-Agent, der selbstbewusst scheitert, schließt das Ticket. Ein KI-Agent, der ehrlich scheitert, eskaliert es. Diese eine Asymmetrie entscheidet, von welchen Fehlern Sie erfahren.
Jede Eskalation ist sichtbar. Sie landet in einer Queue, ein Mensch liest sie, und wenn sie schlimm genug ist, sagt jemand etwas. Der Eskalationsweg meldet sich selbst. Die Konversation dagegen, in der der Bot eine Rückgabefrist erfunden, einen Preis genannt hat, den es seit zwei Jahren nicht mehr gibt, oder jemandem versichert hat, seine Daten seien gelöscht, obwohl sie es nicht waren, wird als gelöst markiert und verschwindet aus dem Blickfeld.
Die Fehler, von denen Sie ganz natürlich hören, sind also systematisch die falschen. Sie hören von den Beinahe-Fehlern des vorsichtigen Bots und erfahren nichts von den echten Fehlern des selbstbewussten. Das sind stille Fehler, und der Name ist präzise: Sie sind nicht selten, sie sind leise.
Es gibt einen Folgeeffekt, den man benennen sollte. Weil Eskalationen sichtbar sind und eine hohe Automatisierungsquote belohnt wird, wirkt der Druck auf jeden KI-Einsatz in eine Richtung, nämlich weniger zu eskalieren. Teams optimieren auf Selbstsicherheit. Ein Bot, der bei Unsicherheit übergibt, zeigt eine schlechtere Automatisierungsquote und ein besseres Kundenerlebnis, und wenn die Automatisierungsquote die Zahl auf dem Dashboard ist, wird dieser Tausch verkehrt herum entschieden. Wie die Übergabe selbst gestaltet und geprüft wird, zählt mehr als die Quote auf beiden Seiten davon.
Tipp
Sortieren Sie Ihre automatisiert abgeschlossenen Konversationen danach, wie selbstsicher die letzte Nachricht des Bots klingt, nicht nach ihrer Länge. In kurzen, bestimmten Abschlussnachrichten ohne jede Einschränkung auf nicht triviale Fragen ballen sich die falschen Antworten.
Wie prüfen Sie Ihre eigene Automatisierungsquote?
Das ist der Teil, den niemand veröffentlicht. Er dauert etwa einen halben Tag, und den ersten Durchgang können Sie diese Woche ohne neue Werkzeuge machen.
Schritt 1. Stellen Sie die Grundgesamtheit zusammen, die Sie bisher ausgeklammert haben
Ziehen Sie jede Konversation aus dem letzten vollen Monat, die ohne einen Menschen abgeschlossen wurde. Nicht die eskalierten, keine allgemeine Stichprobe aller Tickets, sondern gezielt die automatisiert abgeschlossene Grundgesamtheit. Die meisten QA-Programme filtern diese standardmäßig heraus, weil die Review-Queue um Agents herum gebaut wurde und an diesen Konversationen kein Agent hängt. Dieser Filter ist der blinde Fleck.
Schritt 2. Schichten Sie, bevor Sie Stichproben ziehen
Ziehen Sie keine einfache Zufallsstichprobe. Teilen Sie die Grundgesamtheit zuerst in drei Gruppen, weil die Grundrate der Fehler zwischen ihnen enorm schwankt:
- Abgefangen, kein weiterer Kontakt. Die scheinbaren Erfolge, und die Gruppe, in der die selbstbewusst falschen Antworten am wahrscheinlichsten stecken.
- Abgefangen, dann innerhalb von sieben Tagen erneut Kontakt. Mit großem Abstand die ergiebigste Gruppe. Beginnen Sie hier, wenn Sie nur eine Stunde haben.
- Abgefangen bei einem Thema mit Geld, Identität oder einer Richtlinienzusage. Die höchste Tragweite pro Fehler, und der Ort, an dem Risiken beim Datenschutz (auf Englisch) liegen.
Zwanzig bis dreißig Konversationen pro Gruppe reichen für einen ersten Eindruck. Sie ermitteln noch keine statistisch belastbare Quote, sondern klären, ob ein Problem existiert und welche Form es hat. Wenn Sie danach eine belastbare Zahl wollen, gilt dieselbe Logik der Größenbestimmung wie für jede andere QA-Stichprobe.
Schritt 3. Bewerten Sie mit einem Bewertungsschema, das für einen Bot geschrieben ist, nicht für einen Menschen
Ihre bestehende Scorecard funktioniert hier nicht. Die Hälfte davon misst Dinge, die ein Bot nicht schlecht machen kann, und das, woran er scheitert, misst sie nicht. Nutzen Sie stattdessen eine Scorecard für KI-Agenten und bewerten Sie nur, was ein Leser anhand des Transkripts prüfen kann. Vier Kriterien tragen den Großteil des Signals:
- Sachliche Richtigkeit. War jede Aussage zu Richtlinie, Preis, Zeitpunkt oder Anspruch korrekt? Das ist das Kriterium, das zählt, und das, das Ihr altes Bewertungsschema mit ziemlicher Sicherheit auslässt.
- Vollständigkeit. Hat der Kunde alles bekommen, was er brauchte, oder eine Teilantwort, die das Ticket schließt und einen zweiten Kontakt garantiert?
- Urteil bei der Eskalation. Hätte der Fall an einen Menschen gehen sollen, und ist er das?
- Ehrliche Unsicherheit. Wenn der Bot etwas nicht wusste, hat er es gesagt, oder hat er etwas Plausibles produziert?
Schritt 4. Berechnen Sie die Zahl, die zählt
Ihre echte Zahl ist der Anteil der automatisiert abgeschlossenen Konversationen, die richtig und vollständig gelöst wurden. Rechnen Sie damit, dass sie beim ersten Messen deutlich unter Ihrer gemeldeten Automatisierungsquote liegt. Diese Lücke ist der eigentliche Befund, und sie ist in einem Gespräch mit der Geschäftsführung mehr wert, als die Automatisierungsquote es je war, weil sie sich auf konkrete Konversationen zurückführen lässt (auf Englisch), die jeder nachlesen kann.
Wiederholen Sie das monatlich mit derselben Schichtung, und Sie haben einen Trend. An diesem Punkt hört es auf, ein Audit zu sein, und wird zu Qualitätssicherung für Ihre KI-Agenten.
Welche Kennzahlen gehören neben die Automatisierungsquote im Kundenservice?
Löschen Sie die Automatisierungsquote nicht. Umgeben Sie sie, damit sie nicht allein gelesen werden kann. Vier Begleiter leisten den Großteil der Arbeit, und jeder davon lässt sich aus Daten ableiten, die Sie bereits haben.
- Wiederkontakt innerhalb von sieben Tagen nach einem automatisierten Abschluss. Die beste Prüfung im Verhältnis zum Aufwand, die es gibt. Sie ist objektiv, braucht keine Umfrage, und ein Kunde, der wiederkommt, ist die klarste verfügbare Aussage, dass die erste Antwort nicht angekommen ist.
- Eskalationsqualität, nicht Eskalationsrate. Wenn der Bot übergeben hat, war das die richtige Entscheidung, und kam der Fall mit Kontext an? Die Rate allein ist mehrdeutig, denn ein guter und ein schlechter Einsatz können dieselbe erzeugen. Die Qualität der Eskalationsbearbeitung ist die lesbare Version.
- Unzufriedenheit speziell bei automatisiert abgeschlossenen Konversationen. Segmentieren Sie sie heraus, statt sie in den Gesamtwert einfließen zu lassen, wo eine kleine Menge sehr schlechter automatisierter Interaktionen verschwindet. Das Unzufriedenheitssignal (auf Englisch) ist hier nützlicher als die Zufriedenheit, weil die automatisiert abgeschlossene Grundgesamtheit noch seltener auf Umfragen antwortet als die allgemeine.
- Verifizierte Lösungsquote. Das Ergebnis des Audits oben. Das ist die Zahl für die Geschäftsführung, und sie ist die einzige auf der Liste, für die jemand eine Konversation gelesen haben muss.
Das Lesen der automatisiert abgeschlossenen Konversationen von Hand ist der Anfang, und genau dort stockt es auch, weil das Volumen groß ist und die Fehlerrate niedrig genug, dass eine manuelle Prüfung mit 3-%-Stichprobe sie nicht zuverlässig sichtbar macht. Kaizos Auto QA bewertet von KI und von Menschen bearbeitete Konversationen mit demselben Bewertungsschema, was den Vergleich ehrlich macht, und hält die Begründung an jeder Konversation fest, sodass eine markierte Antwort überprüft werden kann, statt ihr blind zu vertrauen. Das ist die 100-%-Abdeckung, die Trends sichtbar macht, die eine 3-%-Stichprobe nie zeigen könnte, angewendet auf die Grundgesamtheit, die noch nie in der Stichprobe war.
Wenn Sie das breitere Kennzahlenset drumherum suchen: KI-Agenten-Leistung messen behandelt die operative Ebene, und Kennzahlen für den KI-Kundenservice behandelt, was auf ein Dashboard gehört.
Warum sollten Sie jedem veröffentlichten Benchmark für diese Kennzahl misstrauen?
Schauen Sie, wer Benchmarks zur Automatisierungsquote veröffentlicht. Suchen Sie nach dem Begriff, und die Ergebnisse werden von Unternehmen dominiert, die den KI-Agenten verkaufen, dessen Wert in Automatisierungsquote ausgedrückt wird. Das ist keine Verschwörung, sondern ein Anreiz, und es lohnt sich, ihn zu benennen, weil er jede Zahl prägt, die Sie finden werden.
Drei konkrete Gründe, warum sich ein veröffentlichter Benchmark nicht auf Sie übertragen lässt:
- Der Nenner ist undefiniert. Zählen Seitenaufrufe im Hilfecenter dazu? Chats, die in vier Sekunden geöffnet und geschlossen wurden? Kontakte auf Kanälen, die der Bot nicht abdeckt? Verschieben Sie den Nenner, und Sie können die Automatisierungsquote um zwanzig Punkte bewegen, ohne dass sich irgendetwas Reales ändert.
- Der Kontaktmix bestimmt das Ergebnis. Ein Team, das Passwort-Resets und Bestellstatus bearbeitet, wird ein Team mit Abrechnungsstreitigkeiten in einem Ausmaß übertreffen, das nichts über die Qualität der beiden Einsätze aussagt. Vergleiche über unterschiedliche Mixe hinweg sind bedeutungslos.
- Niemand veröffentlicht seine Fehler. Benchmarks stammen aus Einsätzen, die bereit sind, zitiert zu werden, also aus einer Grundgesamtheit, die schon von vornherein gefiltert ist.
Der nützliche Vergleich ist nicht der mit einem Branchenwert, sondern der mit sich selbst. Ihre verifizierte Lösungsquote in diesem Monat gegenüber dem letzten, bei gleichem Kontaktmix und gleichem Bewertungsschema, sagt Ihnen etwas Wahres. Ein Branchen-Benchmark sagt Ihnen etwas Zitierfähiges.
Häufig gestellte Fragen
Was ist eine gute Automatisierungsquote?
Es gibt keine übertragbare Antwort, und jede Zahl, die als solche genannt wird, sollte mit Misstrauen behandelt werden. Die Automatisierungsquote hängt fast vollständig von Ihrem Kontaktmix und davon ab, wie der Nenner definiert ist. Ein Team, das Bestellstatus bearbeitet, zeigt daher eine weit höhere Quote als ein Team mit Abrechnungsstreitigkeiten, ohne jeden Qualitätsunterschied. Aussagekräftig ist nur der Vergleich Ihrer eigenen verifizierten Lösungsquote von Monat zu Monat bei stabilem Kontaktmix.
Was ist der Unterschied zwischen Automatisierungsquote und Containment-Rate?
Die Automatisierungsquote fragt, ob ein Kontakt einen Menschen erreicht hat. Containment fragt, ob die Konversation im automatisierten Kanal geblieben ist. Keine der beiden fragt, ob das Problem des Kunden gelöst wurde, also nach der Lösung, und die Lösung lässt sich nicht messen, ohne den Kunden zu fragen oder die Konversation zu lesen. Auch eine Konversation im Containment kann schlecht geendet haben.
Woran erkenne ich, ob mein KI-Agent falsche Antworten gibt?
Lesen Sie eine geschichtete Stichprobe der Konversationen, die er ohne Eskalation abgeschlossen hat, also genau die Grundgesamtheit, die die meisten QA-Programme herausfiltern. Beginnen Sie mit automatisiert abgeschlossenen Konversationen, bei denen sich der Kunde innerhalb von sieben Tagen erneut gemeldet hat, denn die Fehlerrate ist in dieser Gruppe weit höher als in der allgemeinen Grundgesamtheit. Bewerten Sie sachliche Richtigkeit und Vollständigkeit statt des Tons.
Bedeutet eine hohe Automatisierungsquote, dass meine Kunden zufrieden sind?
Nein, und sie kann das Gegenteil bedeuten. Die Automatisierungsquote zählt die Abwesenheit eines Menschen. Ein Kunde, der aufgegeben hat, auf einen anderen Kanal gewechselt ist oder eine selbstbewusst falsche Antwort akzeptiert hat, erzeugt daher denselben Datensatz wie einer, dem wirklich geholfen wurde. Wer es schwerer macht, einen Menschen zu erreichen, erhöht die Quote und senkt die Zufriedenheit, und deshalb muss die Kennzahl zusammen mit der Wiederkontaktrate gelesen werden.
Sollte ich von KI bearbeitete Konversationen in mein QA-Programm aufnehmen?
Ja, und die meisten Programme tun es derzeit nicht, weil Review-Queues um Agents herum gebaut wurden und an diesen Konversationen kein Agent hängt. Wenn automatisiert abgeschlossene Tickets aus Ihrer Stichprobe ausgeschlossen sind, hat Ihre Sicht auf die Qualität eine Lücke, die genau so groß ist wie die Arbeitslast Ihres Bots. Bewerten Sie sie mit einem Bewertungsschema, das für einen automatisierten Beantworter geschrieben ist, statt die Scorecard für Menschen wiederzuverwenden.
Verwandte Themen
- Ihr KI-Agent schließt Tickets. Wer prüft ihn? (auf Englisch)
- Stille Fehler von KI-Agenten
- Was die Containment-Rate aussagt und was nicht (auf Englisch)
- Die Scorecard für KI-Agenten
- Qualitätssicherung für KI-Agenten und Chatbots
- Qualitätssicherung bei der Übergabe zwischen Mensch und KI
Finden Sie heraus, was Ihre Automatisierungsquote Ihnen wirklich gebracht hat
Bringen Sie einen Monat an Konversationen mit, die Ihr KI-Agent selbst abgeschlossen hat. Wir bewerten sie mit demselben Bewertungsschema wie Ihre von Menschen bearbeiteten Tickets und zeigen Ihnen die Lücke zwischen automatisiert abgeschlossen und wirklich gelöst.