Zum Inhalt springen

Kennzahlen

KI-Kennzahlen im Kundenservice: was wirklich zählt

Kennzahlen für KI im Kundenservice: welche Werte zeigen, ob Ihre KI-Agenten Probleme wirklich lösen, und welche Zahlen nicht in den Vorstandsbericht gehören.

· 15 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Containment-Rate und CSAT nach KI-Gesprächen sind die beiden Kennzahlen für KI im Kundenservice, die die meisten Teams berichten, und zugleich die irreführendsten. Bewerten Sie stattdessen jede Konversation nach Lösung, Genauigkeit, Eskalation und Wiederholungskontakten, und verknüpfen Sie jeden Score mit den Belegen in der Konversation.

Kurz gesagt

  • Containment zählt einen frustrierten Abbruch als Erfolg.
  • CSAT nach KI-Gesprächen hört nie von den Kunden, die aufgegeben haben.
  • Wiederholungskontakte und stille Abbrüche zeigen, was Containment verbirgt.
  • Jeder Score sollte sich auf Belege im Transkript zurückführen lassen.

Warum die beiden Standard-Kennzahlen für KI im Kundenservice in die Irre führen

Jede Supportleitung, die KI einführt, bekommt von der Geschäftsführung dieselbe Frage gestellt: Beweisen Sie, dass es funktioniert. Die beiden Zahlen, nach denen zuerst gegriffen wird, sind die Containment-Rate und der CSAT nach KI-Gesprächen, weil beide leicht abzurufen sind und beide, wenn man nicht so genau hinsieht, nach oben zeigen. Es sind aber auch die beiden Zahlen, die am wenigsten beschreiben, was Ihren Kunden tatsächlich passiert ist.

Das Problem ist strukturell und keine Frage der Feinabstimmung. Containment misst ein Routing-Ergebnis: ob ein Mensch diese Konversation angefasst hat. CSAT nach KI-Gesprächen misst eine Meinung, aber nur die Meinungen derjenigen, die eine abgeben wollten. Keine der beiden Kennzahlen betrachtet den Inhalt der Konversation, und nur dort liegt die Antwort. Das ist ein ganz anderes Problem als das, was die Standardmethode, um die Leistung von KI-Agenten zu messen, löst, und ein ganz anderes Problem als die Frage, welche der allgemeinen KPIs im Kundenservice auf Ihr Dashboard gehören. Hier geht es darum, welche Zahlen Sie stillschweigend belügen.

Hier die Kurzfassung des Arguments, Kennzahl für Kennzahl, bevor wir auf jede einzeln eingehen.

KennzahlWas sie angeblich zeigtWie sie in die Irre führtWas Sie stattdessen messen sollten
Containment- / Deflection-RateDie KI hat die Konversation erfolgreich bearbeitetZählt Abbrüche und Abwimmeln als Erfolg, weil kein Mensch beteiligt warLösungsqualität plus Rate stiller Abbrüche
CSAT nach KI-GesprächenKunden sind mit der KI zufriedenBeantwortet von einer selbst ausgewählten Minderheit, und die verärgertsten Kunden gehen einfachWiederholungskontaktrate und Lösungsqualität auf 100 % der Konversationen
Durchschnittliche Bearbeitungszeit bei KI-KonversationenDie KI ist schnellEine schnelle falsche Antwort ist schneller als eine langsame richtigeSachliche Genauigkeit und Kosten pro tatsächlich gelöstem Kontakt
EskalationsrateWeniger Eskalationen bedeuten, dass die KI zurechtkommtEskalationen zu unterdrücken ist leicht und schädlich; Zeitpunkt und Übergabe zählen mehrEskalationsqualität: richtiger Moment, vollständiger Kontext
Von der KI bearbeitetes VolumenSkalierung und ROISagt nichts darüber, was innerhalb dieses Volumens passiert istEinhaltung der Richtlinien, bewertet anhand Ihres Bewertungsschemas

Containment-Rate: die Kennzahl, die Abwimmeln belohnt

Die Containment-Rate, manchmal auch Deflection-Rate genannt, ist der Anteil der Konversationen, die endeten, ohne dass ein menschlicher Agent beteiligt wurde. Sie wurde zur Standard-Kennzahl für KI, weil sie sich direkt auf den Business Case abbilden lässt: Jede Konversation im Containment ist ein Kontakt, für dessen Bearbeitung Sie keinen Menschen bezahlt haben.

Der Fehler steckt in der Definition. Containment fragt nicht, ob der Kunde bekommen hat, weswegen er gekommen ist. Es fragt, ob jemand anderes hinzugezogen wurde. Das bedeutet, dass mehrere sehr unterschiedliche Ergebnisse alle gleich als Erfolg gezählt werden:

  • Die echte Lösung: Der Kunde hat gefragt, die KI hat richtig geantwortet, der Kunde ist zufrieden gegangen. Das ist das Ergebnis, für das die Kennzahl entwickelt wurde.
  • Der Abbruch: Der Kunde hat dreimal gefragt, eine Variante derselben nutzlosen Antwort erhalten und das Fenster geschlossen. Kein Mensch war beteiligt, also zählt es als Containment.
  • Das Abwimmeln: Die KI konnte oder wollte nicht übergeben, bot immer wieder Hilfecenter-Artikel an, und der Kunde gab auf und wandte sich stattdessen an Social Media oder die Bewertungen im App Store.
  • Der verlagerte Kontakt: Der Kunde hat den Chat geschlossen und die Hotline angerufen, eine E-Mail geschrieben oder am nächsten Tag ein neues Ticket eröffnet. Im einen Kanal im Containment, im anderen kostet er Sie trotzdem.

Drei dieser vier sind Fehlschläge, und das Abwimmeln ist sogar schlimmer, als gar nichts zu tun. Trotzdem kann eine Containment-Zahl sie nicht unterscheiden, denn die unterscheidende Information steckt in der Konversation, und Containment schaut dort nie hin.

Das ist kein Argument dafür, Containment aufzugeben. Es ist eine nützliche Eingangsgröße für Kapazität und Kosten. Es ist ein Argument dagegen, es als Qualitätskennzahl zu berichten, denn wer Containment direkt optimiert, macht es Kunden schwerer, einen Menschen zu erreichen. Genau dieses Verhalten will niemand, und jeder erkennt es, sobald er selbst Kunde ist.

CSAT nach KI-Gesprächen: die Kennzahl, die nie von denen hört, die gegangen sind

CSAT (auf Englisch) ist in seinem ursprünglichen Kontext eine gute Kennzahl: eine Konversation mit einem Menschen, eine vernünftige Rücklaufquote, eine stabile Gruppe von Antwortenden. An eine KI-Konversation angehängt, entwickelt er einen bestimmten und gravierenden blinden Fleck.

Selbstauswahl genau im falschen Moment

Umfrageantworten kommen von einer Minderheit der Kunden, und diese Minderheit ist nie zufällig. Wer so stark empfindet, dass er antwortet, steht meist an einem der beiden Enden der Skala. Doch der Fehlermodus der KI, der am meisten zählt, ist der Kunde, der still zu dem Schluss kommt, dass das hier nirgendwohin führt, und sich abwendet. Genau dieser Kunde füllt danach mit der geringsten Wahrscheinlichkeit eine Umfrage aus. Er ist nicht geblieben, um befragt zu werden. Er gehört zu den stillen Abbrechern, und für sie ist CSAT nach KI-Gesprächen strukturell taub.

Die Umfrage fragt nach dem Falschen

Selbst bei denen, die antworten, vermischt ein Zufriedenheitswert, ob die Antwort richtig war, ob der Ton angenehm war und ob das Ergebnis eines war, das der Kunde hören wollte. Eine KI, die charmant und selbstbewusst falsch liegt, kann gut abschneiden. Eine KI, die korrekt eine Richtlinienantwort gibt, die dem Kunden missfällt, kann schlecht abschneiden. Keines der beiden Ergebnisse sagt Ihnen, ob das System funktioniert.

Der Vergleich ist in beide Richtungen unfair

Teams vergleichen oft den CSAT der KI mit dem CSAT der menschlichen Agents und ziehen daraus Schlüsse. Diese beiden Gruppen sind nicht vergleichbar: Die KI übernimmt meist zuerst die einfachen, volumenstarken, leicht zufriedenzustellenden Kontakte und eskaliert die schwierigen. Ein schmeichelhafter KI-CSAT kann schlicht bedeuten, dass die KI die einfache Queue bekommen hat. Ein schlechter kann bedeuten, dass sie die Queue bekommen hat, bei der niemand gewinnen konnte.

Behalten Sie CSAT. Hören Sie nur auf, ihn als Beleg für Ihre KI zu behandeln. Behandeln Sie ihn als ein Signal unter mehreren, gewichtet mit dem Wissen, dass er nur von denen hört, die geblieben sind.

Lösungsqualität: die Ankerkennzahl

Wenn Sie Containment durch eine einzige Sache ersetzen, dann durch die Lösungsqualität: Hat diese Konversation das Problem des Kunden tatsächlich gelöst? Sie ist der Anker des gesamten Kennzahlen-Sets, weil jede andere Kennzahl hier entweder eine Eingangsgröße dafür oder eine Kontrolle davon ist.

Was sie ist. Ein Urteil anhand des Transkripts darüber, ob das eigentliche Anliegen des Kunden erledigt wurde. Nicht ob ein Ticket geschlossen wurde, nicht ob eine Antwort verschickt wurde, nicht ob der Intent erkannt wurde. Sondern ob das, was für den Kunden passieren musste, passiert ist.

Wie Sie sie messen. Als bewertetes Kriterium in Ihrem Bewertungsschema für die Qualitätssicherung, angewendet auf von KI bearbeitete Konversationen genau so wie auf von Menschen bearbeitete. Das Kriterium muss so formuliert sein, dass ein Reviewer und ein automatisierter Bewerter es gleich lesen würden: Legen Sie für jeden wichtigen Kontakttyp fest, welche Belege im Transkript als Lösung zählen. Erstattung angefragt und Erstattung bestätigt. Adresse geändert und Änderung dem Kunden bestätigt. Frage gestellt und richtige Antwort gegeben, die der Kunde zur Kenntnis nimmt.

Wie eine schlechte Zahl aussieht. Das Signal, auf das Sie achten sollten, ist kein absoluter Schwellenwert, sondern die Lücke zwischen Lösungsqualität und Containment. Wenn ein großer Anteil der Konversationen im Containment endet, aber ein viel kleinerer Anteil als gelöst bewertet wird, entspricht diese Lücke der Größe Ihres Problems, ausgedrückt in Konversationen. Es ist auch die Zahl, die es wert ist, der Geschäftsführung vorgelegt zu werden, denn sie ist die ehrliche Version der Zahl, die man ihr gezeigt hat.

Beachten Sie, dass dies bewusst strenger ist als die Erstlösungsquote (auf Englisch), die eine Lösung aus dem Ausbleiben einer Nachfrage ableitet. FCR ist ein nützlicher Näherungswert. Die Lösungsqualität liest das Transkript, statt aus Schweigen zu schließen, und Schweigen ist genau das, was ein abbrechender Kunde erzeugt.

Sachliche Genauigkeit und Halluzinationsrate

Ein KI-Agent (auf Englisch), der eine Erstattungsfrist erfindet, einen Liefertermin falsch angibt oder selbstbewusst eine Funktion beschreibt, die Sie nicht haben, ist kein Qualitätsproblem, sondern ein Haftungsproblem. Die sachliche Genauigkeit ist die Kennzahl, die das auffängt, und für sie haben die meisten Teams überhaupt keine Messung.

Was sie ist. Der Anteil der KI-Antworten, die eine sachliche Aussage enthalten, die sich anhand Ihrer Wissensdatenbank, Ihrer Richtliniendokumente oder Ihrer Bestelldaten prüfen lässt, und der Anteil dieser Aussagen, der korrekt ist. Die Halluzinationsrate ist das Gegenstück: Aussagen, die selbstbewusst getroffen werden und von keiner Quelle gestützt sind.

Wie Sie sie messen. Jede sachliche Aussage in einer Konversation wird gegen die maßgebliche Quelle geprüft. Das ist nur automatisiert und in großem Umfang praktikabel, und genau das ist eines der stärksten Argumente dafür, jede Konversation zu bewerten, statt Stichproben zu ziehen: Eine Halluzination in den 98 %, die Sie nicht gelesen haben, kostet genauso viel wie eine in den 2 %, die Sie gelesen haben. Verfolgen Sie sie getrennt nach Kontakttyp, denn die Genauigkeit ist selten einheitlich. Fragen zur Abrechnung und Fragen zum Versand verhalten sich meist sehr unterschiedlich.

Wie eine schlechte Zahl aussieht. Jede Rate über null bei Aussagen mit rechtlichem, finanziellem oder sicherheitsrelevantem Gewicht ist eine schlechte Zahl, egal wie klein sie ist. Bei weniger heiklen Aussagen kommt es auf die Richtung an: Eine Halluzinationsrate, die nach einer Änderung der Wissensdatenbank oder einem Modell-Update steigt, sagt Ihnen etwas Konkretes und Dringendes über diese Änderung.

Eine Warnung: Die KI, die die Antwort erzeugt hat, ist kein verlässlicher Richter darüber, ob die Antwort stimmt. Die Genauigkeit muss von etwas außerhalb des Systems beurteilt werden, das sie erzeugt hat. Dasselbe Prinzip steht dahinter, dass LLM as a Judge (auf Englisch) vom bewerteten Modell getrennt gehalten wird.

Eskalationsqualität: nicht wie oft, sondern wie gut

Die Eskalationsrate wird berichtet, als wäre niedriger besser. Das stimmt nicht. Eskalation ist eine Funktion, und eine KI, die nie eskaliert, ist keine starke KI, sondern ein gefangener Kunde. Was zählt, ist die Eskalationsqualität: ob die Übergabe im richtigen Moment stattfand und mit dem richtigen Kontext ankam.

Zeitpunkt

Die beiden Fehlermodi liegen auf beiden Seiten des richtigen Zeitpunkts. Zu frühes Eskalieren verschenkt die Automatisierung vollständig und verärgert einen Kunden, der eine einfache Frage hatte. Zu spätes Eskalieren, nach drei oder vier gescheiterten Schleifen, bedeutet, dass der Mensch einen Kunden übernimmt, der bereits verärgert ist, und eine Konversation, die neu beginnen muss. Bewerten Sie den Moment: Gab es einen erkennbaren Gesprächszug, an dem eine kompetente Übergabe hätte stattfinden sollen, und fand sie dort statt?

Kontextübergabe

Der teuerste Eskalationsfehler ist der, bei dem der menschliche Agent die Konversation öffnet und den Kunden bitten muss, alles noch einmal zu erklären. Dieses eine Verhalten macht das Wohlwollen der gesamten KI-Interaktion zunichte. Bewerten Sie, ob die Übergabe das vom Kunden genannte Anliegen enthielt, was bereits versucht wurde und welchen Konto- oder Bestellkontext die KI bereits abgerufen hatte.

Richtigkeit

War die Eskalation überhaupt die richtige Entscheidung? Eine KI, die jede mehrdeutige Nachricht eskaliert, erzeugt umsonst Arbeit für Menschen, und das zeigt sich in den Kosten pro gelöstem Kontakt statt in den Qualitäts-Scores. Beide Richtungen müssen bewertet werden, sonst verschieben Sie das Problem beim Optimieren nur von der einen auf die andere Seite.

Wie eine schlechte Zahl aussieht. Eine sinkende Eskalationsrate zusammen mit einem sinkenden Score für die Lösungsqualität ist das deutlichste schlechte Signal in diesem gesamten Artikel. Es bedeutet, dass die KI Konversationen festhält, die sie nicht zu Ende bringen kann.

Wiederholungskontaktrate und Rate stiller Abbrüche

Diese beiden sind zusammengefasst, weil sie Ihre günstigsten Lügendetektoren sind. Beide fangen Fehlschläge auf, die Containment als Erfolge wertet, und keine von beiden verlangt, dass ein Kunde etwas ausfüllt.

Wiederholungskontaktrate nach einer KI-Konversation

Was sie ist. Der Anteil der Kunden, die sich nach einer von KI bearbeiteten Konversation innerhalb eines festgelegten Zeitfensters in einem beliebigen Kanal wegen desselben eigentlichen Anliegens erneut melden.

Wie Sie sie messen. Verknüpfen Sie Kontakte nach Kunde und nach Anliegen, nicht nach Ticket, und schauen Sie gezielt kanalübergreifend. Ein Kunde, der einen Chat abgebrochen und dann angerufen hat, ist der wichtigste Fall, den Sie erfassen müssen, und eine Sicht pro Kanal übersieht ihn komplett. Passen Sie das Zeitfenster an Ihr Produkt an: derselbe Tag bei einem Lieferproblem, eine Woche oder länger bei einem Abrechnungsstreit.

Wie eine schlechte Zahl aussieht. Eine Wiederholungskontaktrate, die nach KI-Bearbeitung höher ausfällt als bei vergleichbaren, von Menschen bearbeiteten Kontakten, ist ein Warnsignal, unabhängig von ihrem absoluten Wert. Sie bedeutet, dass Containment Arbeit verschoben statt beseitigt hat.

Rate stiller Abbrüche

Was sie ist. Der Anteil der KI-Konversationen, die der Kunde ohne Lösung und ohne Eskalation verlässt. Keine Umfrage, keine Beschwerde, keine Nachfrage. Diese Konversationen sehen in jeder Routing-basierten Kennzahl genauso aus wie Erfolge.

Wie Sie sie messen. Identifizieren Sie Konversationen, die mit einem Beitrag des Kunden endeten oder bei denen die letzte Nachricht der KI unbeantwortet blieb, und bewerten Sie, ob das Anliegen zu diesem Zeitpunkt gelöst war. Zufriedene Abgänge von stillen Abbrüchen zu trennen, ist ein Urteil anhand des Transkripts, und genau deshalb steht diese Kennzahl auf den meisten Dashboards nicht: Sie lässt sich nicht zählen, sie muss gelesen werden.

Wie eine schlechte Zahl aussieht. Jede Rate stiller Abbrüche, die einen nennenswerten Bruchteil Ihrer Containment-Rate ausmacht, bedeutet, dass Ihre Containment-Zahl um genau diesen Betrag aufgebläht ist. Containment ohne sie zu berichten heißt, eine Zahl zu berichten, von der Sie wissen, dass sie falsch ist.

Einhaltung der Richtlinien und Kosten pro tatsächlich gelöstem Kontakt

Die letzten beiden schließen den Kreis zwischen Qualität und Business Case.

Einhaltung der Richtlinien

Was sie ist. Ob die KI die Regeln befolgt hat, die sie befolgen muss: die Identität prüfen, bevor Kontodaten offengelegt werden, Pflichthinweise geben, Rabatte außerhalb der Richtlinien ablehnen, einen schutzbedürftigen Kunden oder eine geäußerte Beschwerde korrekt behandeln und, wo es gilt, innerhalb der regulatorischen Formulierungen bleiben.

Wie Sie sie messen. Das sind binäre, anhand von Belegen prüfbare Kriterien, und damit lassen sie sich von allem auf dieser Liste am leichtesten automatisch bewerten, und es schadet am meisten, sie nur per Stichprobe zu prüfen. Führen Sie sie als Bestanden-/Nicht-bestanden-Prüfungen für jede Konversation durch und behandeln Sie jedes Nicht bestanden als Vorfall, der geprüft wird, statt als Prozentwert, der weggemittelt wird. Das ist dieselbe Logik des Bewertungsschemas, nach der Ihr menschliches Team bereits bewertet wird, und genau darum geht es: Ihr Internal Quality Score sollte auch die KI abdecken, sonst haben Sie zwei Standards und keinen Vergleich.

Wie eine schlechte Zahl aussieht. Bei Identitätsprüfung und regulierten Pflichthinweisen ist ein einziges Nicht bestanden eine schlechte Zahl. Mitteln Sie diese nicht.

Kosten pro tatsächlich gelöstem Kontakt

Was sie ist. Die Gesamtkosten der KI-Konversationen geteilt durch die Zahl der Konversationen, die tatsächlich gelöst wurden, nicht durch die Zahl der Konversationen im Containment.

Wie Sie sie messen. Nehmen Sie Ihren Score für die Lösungsqualität, wenden Sie ihn auf Ihr Containment-Volumen an und verwenden Sie die resultierende Anzahl als Nenner. Rechnen Sie die nachgelagerten Kosten ein, die die KI verursacht hat: Wiederholungskontakte, die zusätzliche Bearbeitungszeit bei Eskalationen, die ohne Kontext ankamen, und die Zeit, die Menschen mit dem Aufräumen verbringen.

Wie eine schlechte Zahl aussieht. Wenn die Kosten pro tatsächlich gelöstem Kontakt nicht spürbar besser sind als bei der vergleichbaren Bearbeitung durch Menschen, trägt sich der Einsatz nicht, ganz gleich, wie gut die Containment-Grafik aussieht. Das ist die Zahl, die ein Qualitätsargument in ein Finanzargument verwandelt, und meistens ist es dieses Argument, das Budget bekommt.

Warum nichts davon mit einer Stichprobe oder einer Umfrage funktioniert

Gehen Sie die sieben Kennzahlen noch einmal durch, und eines gilt für jede einzelne: Sie erfordert, die Konversation zu lesen. Die Lösungsqualität ist ein Urteil über das Transkript. Die Halluzinationsrate ist eine Prüfung von Aussagen gegen Quellen. Die Eskalationsqualität ist eine Beurteilung eines bestimmten Gesprächszugs. Ein stiller Abbruch ist das Fehlen eines Signals, das heißt, er lässt sich nur finden, indem man sich Konversationen ansieht, in denen nichts passiert ist.

Das hat zwei Konsequenzen, die die meisten Messprogramme noch nicht verinnerlicht haben.

Stichproben funktionieren hier nicht. Die klassische Qualitätssicherung prüft einen kleinen Prozentsatz der Konversationen, und für ein menschliches Team bekannter Größe ist das ein vertretbarer statistischer Kompromiss. Für KI ist es aus zwei Gründen nicht vertretbar. Erstens sind KI-Fehler systematisch statt verteilt: Ein schlechter Wissensartikel oder ein Grenzfall in einer Richtlinie erzeugt jedes Mal denselben Fehler, wenn er getroffen wird, also erfasst eine Stichprobe entweder den ganzen Cluster oder verfehlt ihn ganz. Zweitens bearbeitet KI weit mehr Volumen, also sind 2 % ein kleineres Fenster auf einen größeren Betrieb. Jede Konversation zu bewerten (auf Englisch) ist die Voraussetzung und nicht der Zweck: Es beseitigt den Auswahlfehler, der die anderen sieben Zahlen bedeutungslos macht. Es geht nicht darum, jemanden zu überwachen, sondern darum, nicht eine Stichprobenregel entscheiden zu lassen, was Ihre Kennzahlen aussagen.

Sie sollten einen Score nicht auf Treu und Glauben hinnehmen müssen. Bestehen Sie darauf, dass jeder Score auf die genauen Belege im Transkript verweist, die ihn erzeugt haben, dass jeder Score angefochten und von einem Menschen entschieden werden kann und dass sich der Bewerter an einer Reihe von Konversationen testen lässt, die Ihre eigenen Reviewer bewertet haben, sodass Sie die Übereinstimmungsrate Kriterium für Kriterium sehen, bevor Sie irgendetwas nach oben berichten. Einen Score, den Sie zurückverfolgen können, können Sie anfechten. Ein Score, den Sie nicht zurückverfolgen können, ist eine Marketingaussage mit angehängter Zahl.

Kaizo bewertet KI-Agenten und Ihr menschliches Team anhand eines Bewertungsschemas, das Sie festlegen, wobei jeder Score auf das Transkript zurückgeführt wird und sich an Ihrem eigenen Referenzsatz testen lässt. Kaizo wendet dieses Schema auf alle Ihre Konversationen an statt auf einen ausgewählten Ausschnitt. Bei UiPath hat dieser Ansatz 100 % der Qualitätssicherung automatisiert, mit 200 % ROI und einer Steigerung des Qualitäts-Scores um 8 %. Praktisch bedeutet das, dass Qualitätssicherung für KI-Agenten und Qualitätssicherung für Menschen keine zwei getrennten Programme mehr sind, die zwei nicht vergleichbare Zahlenreihen liefern.

Häufig gestellte Fragen

Welches sind die wichtigsten Kennzahlen für KI im Kundenservice?

Lösungsqualität, sachliche Genauigkeit, Eskalationsqualität, Wiederholungskontaktrate, Rate stiller Abbrüche, Einhaltung der Richtlinien und Kosten pro tatsächlich gelöstem Kontakt. Diese sieben beschreiben, was innerhalb der Konversation tatsächlich passiert ist. Containment-Rate und CSAT nach KI-Gesprächen, die beiden am häufigsten berichteten, beschreiben stattdessen Routing und eine selbst ausgewählte Meinung, und deshalb führen sie in die Irre.

Was ist die Containment-Rate und warum führt sie in die Irre?

Die Containment-Rate, auch Deflection-Rate genannt, ist der Anteil der Konversationen, die eine KI bearbeitet hat, ohne dass ein Mensch beteiligt wurde. Sie führt in die Irre, weil sie misst, ob jemand anderes hinzugezogen wurde, nicht ob dem Kunden geholfen wurde. Ein Kunde, der dreimal gefragt hat, nicht weiterkam und das Fenster frustriert geschlossen hat, zählt als Containment, ebenso wie ein Kunde, der aufgegeben und stattdessen angerufen hat.

Ist CSAT eine gute Methode, um KI-Agenten zu messen?

Nur als ein Signal unter mehreren. CSAT nach KI-Gesprächen wird von einer kleinen, selbst ausgewählten Gruppe beantwortet, und die Kunden, bei denen Ihre KI am stärksten versagt hat, bleiben am seltensten, um eine Umfrage zu beantworten. Außerdem vermischt er Richtigkeit mit Tonfall, sodass eine selbstbewusst falsche KI gut abschneiden kann. Vergleichen Sie ihn mit Messgrößen, die auf dem Transkript beruhen, statt ihn für sich allein als Beleg zu behandeln.

Wie messen Sie, ob ein KI-Agent ein Anliegen tatsächlich gelöst hat?

Bewerten Sie die Lösung als Kriterium in Ihrem QA-Bewertungsschema, angewendet auf das Transkript statt abgeleitet aus dem Ticketstatus. Legen Sie pro Kontakttyp fest, welche Belege in der Konversation als Lösung zählen: die bestätigte Erstattung, die dem Kunden bestätigte Änderung, die zur Kenntnis genommene richtige Antwort. Vergleichen Sie diesen gelösten Anteil dann mit Ihrer Containment-Rate. Die Lücke zwischen beiden ist die Größe des Problems.

Was ist die Rate stiller Abbrüche?

Es ist der Anteil der KI-Konversationen, die ein Kunde ohne Lösung und ohne Eskalation verlässt: keine Beschwerde, keine Umfrage, keine Nachfrage. Diese Konversationen sind für jede Routing-basierte Kennzahl unsichtbar, weil kein Mensch beteiligt war, und so blähen sie das Containment auf. Um sie zu finden, müssen Sie Konversationen lesen, die mit einem Beitrag des Kunden endeten, und beurteilen, ob das Anliegen tatsächlich erledigt war.

Woran erkennen Sie, dass Sie dem Bewerter Ihrer KI vertrauen können?

Indem Sie ihn überprüfen, statt ihm einfach zu vertrauen: Fragen Sie, ob jeder Score auf die konkreten Belege im Transkript verweist und ob Ihnen der Bewerter seine Übereinstimmungsrate mit Konversationen zeigt, die Ihre Reviewer bereits bewertet haben.

Weiterlesen

Messen Sie, was Ihre KI-Agenten tatsächlich getan haben

Sehen Sie Ihre Containment-Rate neben dem Score für die Lösungsqualität, der dahintersteht, bewertet anhand Ihres eigenen Bewertungsschemas. Jeder Score führt auf die Belege im Transkript zurück, und Sie können ihn mit Konversationen abgleichen, die Ihre Reviewer bereits bewertet haben.

Demo buchen Agentic Auto QA entdecken Kaizo Insights ansehen

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart