Beim Vergleich QA-Score vs. CSAT hat keine der beiden Zahlen recht, solange Sie nicht geprüft haben, ob beide dieselben Konversationen beschreiben, und meist tun sie das nicht. Wenn doch, bedeutet eine dauerhafte Lücke, dass Ihre Scorecard die Einhaltung von Prozessen misst statt des Ergebnisses.
Kurz gesagt
- Ein niedriger QA-Score bei hohem CSAT bedeutet oft, dass der Agent vom Prozess abgewichen ist, um zu helfen.
- Behandeln Sie das als Erkenntnis über Ihre Richtlinien, nicht als Coaching-Thema.
- Eskalationen, Wiederholungskontakte und Rückerstattungen geben den Ausschlag, denn sie sind Verhalten.
- Ein Qualitätsscore, der nie von CSAT abweicht, ist überflüssig.
Beschreiben beide Zahlen überhaupt dieselben Konversationen?
Prüfen Sie das, bevor Sie irgendetwas diagnostizieren, denn es ist die häufigste Erklärung, und fast niemand prüft sie.
Sehen Sie sich an, wie jede Zahl tatsächlich entsteht. CSAT stammt von Kunden, die eine Umfrage erhalten und sich entschieden haben, sie zu beantworten, typischerweise ein kleiner Bruchteil der Kontakte. Ihr Qualitätsscore stammt aus Konversationen, die ein Reviewer ausgewählt hat, typischerweise rund 3 % des Volumens. Das sind zwei unabhängige Auswahlprozesse, die im selben Monat laufen, und ihre Schnittmenge ist oft nahezu leer.
Wenn die beiden voneinander abweichen, lautet die ehrliche erste Hypothese also nicht, dass eine von ihnen falsch ist. Sie lautet, dass Sie unterschiedliche Konversationen gemessen haben und den Unterschied als Widerspruch behandeln.
Der Fünf-Minuten-Test. Ziehen Sie die Konversationen, zu denen es im letzten Monat eine CSAT-Antwort gab. Ziehen Sie die Konversationen, die geprüft wurden. Zählen Sie die Überschneidung. Liegt sie im einstelligen Bereich, haben Sie derzeit keinen Vergleich, und keine noch so gründliche Analyse dieser beiden Zahlen wird einen liefern. Die Lösung: Prüfen Sie gezielt eine Reihe von Konversationen, zu denen CSAT-Antworten vorliegen. Damit wird der Vergleich zum ersten Mal möglich.
Zum ersten Auswahlproblem kommt ein zweites hinzu. Wer an Umfragen teilnimmt, ist nicht zufällig verteilt: Antwortende unterscheiden sich systematisch von Nicht-Antwortenden, weshalb der Non-Response-Bias als zentrales methodisches Problem gilt und nicht als Rundungsfrage. Die Arbeit von Pew Research dazu, was niedrige Rücklaufquoten für Umfragen bedeuten, ist die klarste verfügbare Darstellung, und die Konsequenz für CSAT ist direkt. Eine Rücklaufquote von 20 % ist keine 20-%-Stichprobe der Erfahrungen Ihrer Kunden, sondern eine vollständige Stichprobe der Kunden, denen das Thema wichtig genug war, um zu antworten.
Achtung
Wenn im letzten Monat weniger als etwa zehn Konversationen sowohl eine CSAT-Antwort als auch eine QA-Prüfung haben, widersprechen sich Ihre beiden Kennzahlen nicht. Sie beschreiben getrennte Grundgesamtheiten, und die Lücke, die Sie sehen, enthält womöglich überhaupt keine Information.
Was misst jede Zahl eigentlich?
Es sind nicht zwei Versuche derselben Messung, und genau deshalb ist die Erwartung, dass sie übereinstimmen, der eigentliche Fehler. Sie messen unterschiedliche Dinge, und ein gut konzipiertes Kennzahlenpaar sollte manchmal voneinander abweichen.
- Ihr Qualitätsscore misst den Prozess, den Sie steuern. Hat der Agent getan, was Ihre Organisation als gute Bearbeitung definiert hat? Er ist intern, über Agents hinweg vergleichbar und nur so gut wie das Urteil, das in Ihrem Bewertungsschema steckt.
- CSAT misst das Ergebnis und alles andere dazu. Die Antwort, die der Kunde bekam, die Richtlinie dahinter, die Wartezeit, das Produkt, den Preis und seine Laune. Sehr wenig davon liegt beim Agent.
So betrachtet wird die Abweichung aufschlussreich statt alarmierend. Ein Kunde kann über ein korrekt überbrachtes Nein unzufrieden sein. Ein Agent kann Punkte verlieren, weil er einen Schritt ausgelassen hat, während der Kunde genau das bekam, was er brauchte. Beides sind wahre Aussagen über verschiedene Dinge, und ein interner Qualitätsscore existiert genau deshalb, weil die Bewertung des Kunden Ihnen nicht sagen kann, was Sie ändern sollten.
Ein Qualitätsscore, der immer mit CSAT übereinstimmt, misst nichts Zusätzliches. Bewegen sich Ihre beiden Zahlen im Gleichschritt, haben Sie entweder eine Scorecard gebaut, die Zufriedenheit vorhersagt, statt die Bearbeitung zu beschreiben, oder jemand bewertet mit einem Auge auf die Kundenbewertung. Perfekte Übereinstimmung ist ein Warnsignal und kein Erfolgskriterium.
Die vier Quadranten von QA-Score vs. CSAT und was jeder bedeutet
Vorausgesetzt, Sie haben das Problem der Grundgesamtheit ausgeschlossen, tragen Sie beide Zahlen gegeneinander auf. Jeder Quadrant hat eine bestimmte Ursache und eine bestimmte Maßnahme, und sie sind nicht austauschbar.
| Muster | Wahrscheinlichste Ursache | So bestätigen Sie es | Was zu tun ist |
|---|---|---|---|
| Hoher QA-Score, niedriger CSAT | Die Scorecard belohnt Prozesstreue statt Lösung, oder der Kunde ist über die Richtlinie unzufrieden, nicht über die Bearbeitung | Lesen Sie zehn hoch bewertete Konversationen mit niedriger Kundenbewertung. Fragen Sie, ob das Problem des Kunden tatsächlich gelöst wurde | Die Gewichtung in Richtung Lösung verschieben, oder die Beschwerde als Richtlinienthema einstufen und aus der QA herausleiten |
| Niedriger QA-Score, hoher CSAT | Der Agent ist vom Prozess abgewichen, um zu helfen, oder die Scorecard bestraft Dinge, die Kunden nicht bemerken | Prüfen Sie, wofür Punkte abgezogen wurden. Geht es um Tonalität, Formatierung oder Makro-Nutzung, klären Sie, ob das Kriterium sein Gewicht verdient | Das ist eine Erkenntnis über Richtlinie oder Bewertungsschema, kein Coaching-Thema. Coachen Sie keinen Agent für einen zufriedenen Kunden |
| Beide niedrig | Echtes Leistungs- oder Kapazitätsproblem, oder ein Prozess, der bei allen scheitert | Prüfen Sie, ob es sich auf bestimmte Agents konzentriert oder über alle verteilt | Verteilt heißt Prozess. Konzentriert heißt Coaching. Erst diagnostizieren, dann handeln |
| Beide hoch, und Sie glauben es nicht | Nachsichtige Reviewer, eine Scorecard, die jeder besteht, oder eine Umfrageauswahl, die gelöste Kontakte bevorzugt | Sehen Sie sich die Verteilung der Scores an. Wenn fast nichts durchfällt, unterscheidet die Scorecard nicht mehr | Reviewer neu kalibrieren und prüfen, ob ein Kriterium zwei Quartale lang in 95 % der Fälle bestanden wurde |
Warum ist ein hoher QA-Score bei niedrigem CSAT das häufigste Muster?
Weil Scorecards zu dem driften, was leicht zu beobachten ist, und was leicht zu beobachten ist, ist selten das, was zählt. Begrüßung, Verabschiedung, Tagging und Tonalität lassen sich schnell und einheitlich bewerten. Ob das Problem des Kunden wirklich weg ist, lässt sich nur sagen, wenn man die ganze Konversation liest und die Richtlinie kennt.
Also sammeln sich die Kriterien an, die billig zu bewerten sind, das wichtigste Kriterium bekommt eine einzige Zeile, und am Ende steht eine Scorecard, bei der eine Konversation 95 % erreichen kann, während der Kunde mit einem ungelösten Problem und einer höflichen Verabschiedung zurückbleibt. Die Lösung ist, die Gewichtung in Richtung Ergebnis zu verschieben, und die Methode dafür ist, Kriterien anhand von Belegen zu gewichten: Vergleichen Sie die Fehlerquote jedes Kriteriums mit einem nachgelagerten Ergebnis wie Wiederholungskontakten, und lassen Sie die Kriterien, die nichts vorhersagen, an Gewicht verlieren.
Eine zweite Ursache sollten Sie getrennt betrachten, denn die Maßnahme ist eine völlig andere. Manchmal war die Bearbeitung wirklich gut, und der Kunde ist mit der Antwort unzufrieden. Eine korrekt überbrachte Absage, eine zutreffende, aber unwillkommene Richtlinie, ein Preis. Das ist kein Qualitätsversagen und sollte nicht als solches gecoacht werden. Es ist eine Erkenntnis für die Verantwortlichen der Richtlinie, und das Nützlichste, was QA damit tun kann, ist: zählen, weiterleiten, dann aufhören. Wer es als Kundenunzufriedenheit behandelt, die sich durch bessere Bearbeitung verringern ließe, kommt nicht weiter, denn die Bearbeitung war nicht das Problem.
Tipp
Markieren Sie niedrige Bewertungen danach, ob sich die Beschwerde auf die Bearbeitung oder auf die Antwort bezieht. Zwei Monate mit dieser einen Unterscheidung zeigen Ihnen, wie viel Ihrer Unzufriedenheit überhaupt ein Supportproblem ist, und es ist meist weniger, als die Führungsebene annimmt.
Welche Zahl gewinnt, wenn Sie sich entscheiden müssen?
Keine. Nutzen Sie Verhalten als Entscheidungshilfe. Beide Zahlen sind Meinungen, die eine die eines Reviewers, die andere die eines Kunden. Was Kunden danach getan haben, ist keine Meinung, und es steht bereits in Ihrem Helpdesk.
Drei Entscheidungshilfen, nach Nützlichkeit geordnet:
- Wiederholungskontakt innerhalb von sieben Tagen. Das sauberste verfügbare Signal. Ein Kunde, der wiederkommt, sagt damit, dass der erste Kontakt das Problem nicht gelöst hat, egal was die beiden Zahlen sagten. Erzeugen Ihre hoch bewerteten Konversationen Wiederholungskontakte, liegt die Scorecard falsch.
- Eskalationen und Beschwerden. Aufwendige, bewusste Handlungen von Kunden. Ein Team mit hervorragenden Bewertungen und steigenden Eskalationen hat irgendwo ein Messproblem, und die Qualität des Eskalationsmanagements ist der erste Ort, an dem Sie suchen sollten.
- Rückerstattungen und Kulanz zur Beilegung von Servicefehlern. Geld, das das Unternehmen verlässt, um etwas zu reparieren, ist der am wenigsten bestreitbare Beleg, den es gibt.
Machen Sie dann die Gegenprobe. Nehmen Sie die Konversationen, die Kunden schlecht bewertet haben, und lassen Sie Reviewer sie blind bewerten, ohne die Kundenbewertung zu sehen. Bewerten die Reviewer sie durchweg gut, sind sich Ihr Bewertungsschema und Ihre Kunden uneinig darüber, was gut bedeutet, und das Bewertungsschema ist das, was Sie ändern können. Das ist derselbe Mechanismus wie eine Kalibrierungssitzung (auf Englisch), nur auf die Scorecard gerichtet statt auf die Reviewer.
Das Skalierungsproblem sollte man klar benennen, denn es macht die Sache schwierig statt nur mühsam. Jede dieser Prüfungen braucht genug Konversationen mit Bewertung und Prüfung, um aussagekräftig zu sein, und bei einer Stichprobe von 3 % ist diese Schnittmenge zu klein, um sie zu segmentieren. Kaizos Auto QA bewertet die gesamte Grundgesamtheit nach Ihrem eigenen Bewertungsschema. Damit hat jede befragte Konversation auch einen Qualitätsscore, und der Vergleich hängt nicht mehr davon ab, dass sich zwei Stichproben zufällig überschneiden. Genau das bringt Ihnen hier eine Abdeckung von 100 %, die Trends sichtbar macht, die eine 3-%-Stichprobe nie zeigen könnte: keinen besseren Score, sondern die Möglichkeit, die Frage überhaupt zu stellen.
Was sollten Sie zuerst ändern?
Gehen Sie in dieser Reihenfolge vor. Jeder Schritt ist günstig, und jeder schließt eine mögliche Erklärung aus. Das verhindert, dass Sie eine Scorecard neu gewichten, um ein Stichprobenartefakt zu beheben.
- Messen Sie die Überschneidung. Zählen Sie die Konversationen mit Bewertung und Prüfung. Ist die Zahl winzig, beheben Sie das zuerst, indem Sie gezielt befragte Konversationen prüfen, und stellen Sie die Analyse zurück, bis Sie das getan haben.
- Prüfen Sie die Übereinstimmung der Reviewer. Wenn zwei Reviewer sich uneinig sind, ist der Qualitätsscore nicht stabil genug, um ihn mit irgendetwas zu vergleichen. Abweichungen zwischen Reviewern tarnen sich häufiger als Konflikt zwischen CSAT und QA, als dass sie als das erkannt werden, was sie sind.
- Trennen Sie Beschwerden über die Bearbeitung von Beschwerden über die Antwort. Zwei Monate Markierung zeigen Ihnen, wie viel der Lücke überhaupt ein Supportproblem ist.
- Testen Sie jedes Kriterium gegen Wiederholungskontakte. Kriterien, die durchfallen, ohne ein nachgelagertes Ergebnis zu bewegen, tragen Gewicht, das sie sich nicht verdient haben.
- Erst dann neu gewichten. Und wenn Sie es tun, versionieren Sie die Scorecard (auf Englisch), damit die historischen Scores gegen das Bewertungsschema lesbar bleiben, aus dem sie stammen.
Was Sie nicht tun sollten: ein Ziel setzen, das die beiden Zahlen zur Übereinstimmung zwingt. Ein Qualitätsscore, der auf CSAT hin gesteuert wird, ist keine unabhängige Messung mehr, sondern ein zweiter, teurerer Weg, dasselbe zu berichten. Der Grund, beide zu führen, ist, dass sie unterschiedliche Fehler sehen, und was CSAT messen kann und was nicht (auf Englisch) ist die breitere Fassung dieses Arguments. Sie unabhängig zu halten ist der Sinn der Sache, und gelegentliche Abweichungen sind der Beleg, dass Ihnen das gelingt.
Häufig gestellte Fragen
Warum sind unsere QA-Scores hoch, aber der CSAT niedrig?
Meist, weil die Scorecard Prozesstreue statt Lösung belohnt, sodass eine Konversation hoch bewertet werden kann, obwohl das Problem des Kunden ungelöst bleibt. Die zweite häufige Ursache: Der Kunde ist mit der Antwort unzufrieden, nicht mit der Bearbeitung. Das ist eine Erkenntnis über Richtlinien und sollte nicht gecoacht werden. Prüfen Sie vor beidem, ob die befragten und die geprüften Konversationen tatsächlich dieselben sind, denn meist sind sie es nicht.
Was ist verlässlicher, CSAT oder ein interner Qualitätsscore?
Keines von beiden, denn sie messen unterschiedliche Dinge. Ein Qualitätsscore misst den Prozess, den Sie steuern, und ist über Agents hinweg vergleichbar. CSAT misst das Ergebnis plus die Richtlinie, die Wartezeit, das Produkt und die Laune des Kunden, und sehr wenig davon liegt beim Agent. Nutzen Sie stattdessen Verhalten als Entscheidungshilfe: Wiederholungskontakte, Eskalationen und Rückerstattungen sind Handlungen, keine Meinungen.
Sollten QA-Scores und CSAT übereinstimmen?
Nein, und ein Paar, das immer übereinstimmt, ist ein Warnsignal. Es bedeutet, dass entweder die Scorecard gebaut wurde, um Zufriedenheit vorherzusagen, statt die Bearbeitung zu beschreiben, oder dass Reviewer mit einem Auge auf die Kundenbewertung bewerten. Der Grund, beide Kennzahlen zu führen, ist, dass sie unterschiedliche Fehler erkennen. Gelegentliche Abweichungen belegen also, dass sie unabhängig arbeiten. Ob QA den CSAT überhaupt steigert, behandelt der Beitrag Verbessert QA den CSAT? (auf Englisch).
Was bedeutet es, wenn ein Agent niedrige QA-Scores und zufriedene Kunden hat?
Meist, dass er vom Prozess abgewichen ist, um dem Kunden zu helfen, oder dass die Scorecard Dinge bestraft, die Kunden nicht bemerken, etwa Tonalität, Formatierung oder Makro-Nutzung. Prüfen Sie, wofür Punkte abgezogen wurden, bevor Sie jemanden coachen. Sagt das Kriterium kein nachgelagertes Ergebnis wie Wiederholungskontakte vorher, ist das eine Erkenntnis über das Bewertungsschema, nicht über die Leistung.
Ist eine Rücklaufquote von 20 % eine 20-%-Stichprobe?
Nein. Sie ist eine vollständige Stichprobe der Kunden, denen das Thema wichtig genug war, um zu antworten, und das ist eine systematisch andere Gruppe als die, die nicht geantwortet hat. Der Non-Response-Bias ist ein gut dokumentiertes methodisches Problem und keine Rundungsfrage, und er bedeutet, dass CSAT eine selbst ausgewählte Grundgesamtheit beschreibt. Das ist der Hauptgrund, warum CSAT eine interne Messung neben sich braucht und nicht an ihrer Stelle.
Verwandte Themen
- Jenseits von CSAT: was der Score messen kann und was nicht (auf Englisch)
- Wofür ein interner Qualitätsscore da ist
- CSAT vs. DSAT (auf Englisch)
- Kriterien einer QA-Scorecard gewichten
- Eine QA-Kalibrierungssitzung durchführen (auf Englisch)
- Konversationsqualität messen (auf Englisch)
Finden Sie heraus, ob Ihre beiden Zahlen dieselben Konversationen beschreiben
Bringen Sie einen Monat befragter Konversationen und Ihre aktuelle Scorecard mit. Wir bewerten sie nach Ihrem eigenen Bewertungsschema, damit Sie sehen, wo Kundenbewertung und Prüfung wirklich voneinander abweichen und wo sie sich nie begegnet sind.