Zum Inhalt springen

Leitfaden

Was ist QA-Kalibrierung im Kundenservice?

QA-Kalibrierung im Kundenservice: Mehrere Reviewer bewerten dieselbe Konversation und gleichen die Scores ab. Warum das zählt und wie Sie es umsetzen.

· 6 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Kalibrierung in der Qualitätssicherung (englisch QA calibration) bedeutet, dass mehrere Reviewer dieselbe Konversation bewerten und ihre Ergebnisse vergleichen, damit alle die Scorecard gleich anwenden. Ohne Kalibrierung bewerten zwei Personen dasselbe Ticket unterschiedlich, und die Scores werden unfair. Die Kalibrierung macht aus diesen Abweichungen klarere Kriterien, sodass ein Score die Konversation widerspiegelt und nicht den Reviewer, der sie geöffnet hat.

Kurz gesagt

  • Kalibrierung in der Qualitätssicherung heißt: Mehrere Reviewer bewerten dieselbe Konversation unabhängig voneinander, vergleichen dann und einigen sich auf den richtigen Score.
  • Die Kalibrierung deckt vage Kriterien auf, die Reviewer unterschiedlich lesen, und das ist das Signal, sie neu zu formulieren.
  • Eine Kalibrierungssitzung folgt vier Schritten: eine gemeinsame Stichprobe wählen, blind bewerten, vergleichen und diskutieren, dann die Scorecard anpassen.
  • Feste Sitzungen kosten Reviewer Zeit, die dem Coaching fehlt; der Rhythmus ist deshalb eine Abwägung.
  • Automatisierte Bewertung wendet einen Standard auf jede Konversation an, sodass weniger Kalibrierung nötig ist; Menschen stimmen sich aber weiterhin darüber ab, was gute Arbeit ausmacht.

Was Kalibrierung in einem Supportteam bedeutet

In einem Supportteam ist die Kalibrierung die regelmäßige Prüfung, ob jeder Reviewer eine Konversation gleich bewertet, gemessen an derselben Scorecard. Die Reviewer bewerten eine gemeinsame Stichprobe jeweils allein, vergleichen die Ergebnisse und halten die Lösung jeder Abweichung schriftlich fest, sodass ein Agent denselben Score und dasselbe Feedback bekommt, egal wer ihn prüft.

Der Begriff kommt aus der Messtechnik: Ein Messgerät ist kalibriert, wenn es denselben Wert anzeigt wie eine bekannte Referenz. In der Qualitätssicherung sind die Messgeräte Ihre Reviewer, und die Referenz ist die vereinbarte Lesart jedes Kriteriums auf Ihrer QA-Scorecard. Die Kalibrierungssoftware von Kaizo baut auf derselben Idee auf: dieselbe Konversation, derselbe Score.

Warum Kalibrierung in der Qualitätssicherung wichtig ist

Kalibrierung ist wichtig, weil Qualitätsscores nur dann etwas aussagen, wenn sie konsistent sind. Markiert ein Reviewer eine Konversation als regelkonform und ein anderer dieselbe Konversation als Fehler, verlieren die Agents das Vertrauen in das Programm. Das Coaching wird dann zum Streit über den Score statt über das Verhalten, und die Daten sind nicht mehr nutzbar.

Kalibrierung schützt dieses Vertrauen. Indem sie prüft, ob die Reviewer bei denselben Konversationen übereinstimmen, hält sie die Scorecard fair und belastbar. Sie zeigt außerdem Kriterien auf, die zu subjektiv sind, um verlässlich bewertet zu werden, und das ist ein Signal, sie in etwas Beobachtbares umzuschreiben. Mit der Zeit erfüllt die Kalibrierung drei praktische Aufgaben:

  • Sie macht das Auseinanderdriften der Reviewer sichtbar statt unsichtbar.
  • Sie überführt Grenzfälle in die schriftlichen Kriterien, sodass das Ergebnis nicht nur im Gedächtnis einer einzelnen Person liegt.
  • Sie arbeitet neue Reviewer anhand eines vereinbarten Standards ein.

So läuft eine Kalibrierungssitzung ab

Eine Kalibrierungssitzung läuft in vier wiederholbaren Schritten ab: eine gemeinsame Stichprobe von Konversationen wählen, jeden Reviewer sie unabhängig anhand der Scorecard bewerten lassen, die Scores nebeneinander vergleichen und die Abweichungen besprechen, dann die Formulierung jedes Kriteriums anpassen, das zu Uneinigkeit geführt hat. Die Änderung am Bewertungsschema ist das eigentliche Ergebnis der Sitzung.

Ein typischer Kalibrierungszyklus folgt diesen Schritten:

1. Eine gemeinsame Stichprobe wählen

Wählen Sie eine oder mehrere Konversationen aus, die jeder Reviewer unabhängig bewertet, ohne die Ergebnisse der anderen zu sehen.

2. Anhand der Scorecard bewerten

Jeder Reviewer bewertet die Konversation mit derselben Qualitäts-Scorecard, die das Team im Alltag nutzt.

3. Vergleichen und diskutieren

Das Team legt die Scores nebeneinander, bespricht, wo sie auseinandergehen, und einigt sich auf die richtige Auslegung.

4. Die Scorecard anpassen

Wo ein Kriterium zu Uneinigkeit geführt hat, wird es präzisiert oder umformuliert, damit es beim nächsten Mal gleich bewertet wird.

Zu Rhythmus, Teilnehmern, Auswahl der Stichprobe und Messung der Übereinstimmung zwischen Reviewern lesen Sie unser Playbook, wie Sie QA-Kalibrierungssitzungen durchführen (auf Englisch).

Ein konkretes Beispiel für eine Kalibrierung

Hier ein Beispiel zur Veranschaulichung. Vier Reviewer bewerten dieselbe Chat-Konversation anhand einer Scorecard-Zeile mit dem Wortlaut „Agent hat Empathie gezeigt“, auf einer Skala von 1 bis 4. Sie vergeben 2, 4, 3 und 4. Die Streuung ist der Befund: Vor der nächsten Sitzung muss das Kriterium korrigiert werden, nicht die Reviewer.

In der Diskussion zeigt sich, dass zwei Reviewer eine Entschuldigungsformel angerechnet haben, während die anderen beiden darauf geachtet haben, ob der Agent das konkrete Problem des Kunden aufgegriffen hat. Keine der beiden Lesarten ist falsch, aber die Scorecard hat nie gesagt, welche zählt. Das Team schreibt die Zeile in etwas Beobachtbares um:

VorherNachher
Agent hat Empathie gezeigt (1 bis 4)Agent hat das konkrete Anliegen des Kunden in eigenen Worten aufgegriffen, bevor er zur Lösung übergeht (ja oder nein)

Das umgeschriebene Kriterium lässt sich am Transkript prüfen, daher sollte die nächste Sitzung dort weniger Streuung zeigen. Genau das hinterlässt eine nützliche Kalibrierungssitzung: ein geändertes Bewertungsraster, nicht nur ein Meeting.

Wie Automatisierung den Kalibrierungsbedarf senkt

Automatisierung senkt den Bedarf an Kalibrierung, weil die Inkonsistenz, die Kalibrierung behebt, menschlich ist: Reviewer sind sich untereinander uneinig und mit der Zeit auch mit sich selbst. Werden Konversationen automatisch bewertet, wendet ein Modell denselben Standard auf jede Konversation an. Das Auseinanderdriften zwischen Reviewern verschwindet weitgehend, und die Kalibrierung verlagert sich auf die Definition des Standards selbst.

Kaizo bewertet 100 % der Konversationen automatisch anhand Ihrer Scorecard, und jeder Score verweist auf die Belege im Transkript, sodass die Ergebnisse ohne wiederkehrende Kalibrierungssitzungen konsistent bleiben. AutoPilot, die automatisierte Bewertung von Kaizo, legt das Bewertungsschema jedes Mal identisch aus und muss deshalb nicht kalibriert werden; die Kalibrierung gilt den menschlichen Reviewern, die mit ihm arbeiten. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI, und der Score einer Konversation hängt nicht mehr davon ab, welcher Reviewer sie zufällig geöffnet hat. Bei GAMING1 nutzte das Team Kaizo, um Konversationen konsistent zu bewerten und die Qualitätsbewertungsquote als eigene Kennzahl zu verfolgen; diese Quote stieg zwischen 2021 und 2022 von 78 % auf 82 %.

Sehen Sie es an Ihren eigenen Konversationen. Kaizo bewertet 100 % Ihrer Supportkonversationen und macht aus den Ergebnissen Coaching. Demo buchen.

Kalibrierung hat weiterhin ihren Platz, wenn es darum geht, festzulegen, was gute Arbeit ausmacht, aber sie ist keine Dauerbelastung für die Zeit der Reviewer mehr. Bevor Sie sich auf automatisierte Scores verlassen, vergleichen Sie sie auf derselben Stichprobe mit Ihren kalibrierten Reviewern, wie in unseren Leitfäden zu Shadow Scoring (auf Englisch) und zum Aufbau eines Golden Sets (auf Englisch) beschrieben.

Wann sich Kalibrierungssitzungen nicht lohnen

Kalibrierungssitzungen lohnen sich nicht, wenn nur eine Person Konversationen prüft, denn dann gibt es niemanden, mit dem man uneinig sein könnte, oder wenn Sie noch keine schriftliche Scorecard haben. In diesen Fällen schreiben und testen Sie zuerst die Scorecard. Kalibrierung bringt Menschen auf einen gemeinsamen Standard; aus dem Nichts erschaffen kann sie keinen.

Dasselbe gilt für automatisierte Bewertung. Bearbeitet Ihr Team nur eine Handvoll Konversationen pro Woche und liest eine Teamleitung alle selbst, reichen eine Tabelle und eine klare Scorecard, und ein automatisiertes QA-Tool wie Kaizo ist dann wahrscheinlich mehr, als Sie brauchen.

Häufig gestellte Fragen

Was ist der Unterschied zwischen Kalibrierung und QA-Bewertung?

QA-Bewertung heißt, eine einzelne Konversation anhand Ihrer Scorecard zu bewerten. Kalibrierung ist die übergeordnete Prüfung, die sicherstellt, dass verschiedene Reviewer bei derselben Konversation zum selben Score kommen, damit man der Bewertung selbst vertrauen kann.

Wie oft sollte man kalibrieren?

Die meisten Teams mit manueller QA führen wöchentlich oder monatlich Kalibrierungssitzungen durch, dazu immer dann, wenn sich die Scorecard ändert oder ein neuer Reviewer hinzukommt. Der Rhythmus ist eine Abwägung: Mehr Sitzungen bedeuten mehr Konsistenz, aber weniger Zeit für Coaching.

Braucht automatisierte QA noch Kalibrierung?

Deutlich weniger. Automatisierte Bewertung wendet einen einheitlichen Standard auf jede Konversation an, sodass das Auseinanderdriften zwischen Reviewern verschwindet. Kalibrierung bleibt nützlich, um sich darauf zu einigen, was gute Arbeit ausmacht, wenn Sie die Scorecard erstmals entwerfen oder überarbeiten.

Was führt zu geringer Übereinstimmung bei der Kalibrierung?

Meist vage oder subjektive Kriterien in der Scorecard. Lässt sich eine Regel nicht an etwas Beobachtbarem im Transkript festmachen, legen Reviewer sie unterschiedlich aus. Das ist das Signal, das Kriterium in ein klares, belegbasiertes Kriterium umzuschreiben.

Wer sollte an der Kalibrierung teilnehmen?

Alle, die Konversationen bewerten, auch Teamleitungen, die ihre eigenen Agents prüfen. Neue Reviewer profitieren am meisten, weil die Kalibrierung sie auf den Standard einarbeitet, auf den sich der Rest des Teams bereits geeinigt hat.

Was sollte eine Kalibrierungssitzung ergeben?

Eine Kalibrierungssitzung sollte eine schriftliche Änderung ergeben: ein umformuliertes Kriterium, einen geklärten Grenzfall oder ein zusätzliches Beispiel in der Scorecard. Ändert sich nichts an der Scorecard, kommt dieselbe Uneinigkeit in der nächsten Sitzung wieder.

Verwandte Begriffe

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart