Zum Inhalt springen

Leitfaden

Was ist eine QA-Stichprobe im Kundenservice?

QA-Stichprobe im Kundenservice: was eine kleine Auswahl an Supportkonversationen zeigt, was nicht, und warum volle Abdeckung die Stichprobe gerade ablöst.

· 7 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Eine Stichprobe in der Qualitätssicherung (englisch QA sampling) bedeutet, dass Sie nur einen Teil der Kundenkonversationen prüfen, oft zwei oder drei Tickets pro Agent und Woche, statt alle. Stichproben gibt es, weil manuelle Prüfung langsam ist: Die Stichprobe ist ein Behelf für ein Kapazitätslimit und nur so verlässlich, wie sie repräsentativ ist.

Kurz gesagt

  • Eine Stichprobe liefert ein grobes Bild des Teams, für einzelne Agents ist sie zu dünn.
  • Die schwierigsten Konversationen landen am seltensten in der Stichprobe.
  • Automatisierte Bewertung hebt das Kapazitätslimit auf, deshalb löst volle Abdeckung die Stichprobe bei der Messung von Agents ab.
  • Um zu prüfen, ob Reviewer oder automatische Bewerter einheitlich bewerten, funktioniert die Stichprobe weiterhin.

Was eine Stichprobe in der Qualitätssicherung im Support bedeutet

Eine Stichprobe in der Qualitätssicherung im Kundenservice ist schlicht die Entscheidung, manche Konversationen zu prüfen und andere nicht. Weil ein Reviewer pro Tag nur eine begrenzte Zahl an Tickets lesen oder Anrufen anhören kann, wählt ein QA-Team eine Teilmenge aus, bewertet sie anhand der Scorecard und nimmt das Ergebnis als repräsentativ für das Ganze. Üblich ist eine feste Zahl pro Agent und Woche, abgestimmt auf die verfügbare Zeit der Reviewer.

Entscheidend ist das Wort repräsentativ. Die geprüften Konversationen stehen für alle, die nicht geprüft wurden, und der gesamte Wert der Übung hängt davon ab, wie gut ihnen das gelingt. Bildet die Stichprobe das Ganze gut ab, ist sie eine vernünftige Sparmaßnahme. Tut sie das nicht, beruht jede daraus gezogene Schlussfolgerung auf Konversationen, die sich nie jemand tatsächlich angesehen hat.

Eine Klarstellung, weil der Begriff in vielen Branchen vorkommt: Stichprobe meint hier die Auswahl von Kundenkonversationen zur Prüfung. Mit statistischen Stichprobenprüfungen in der Qualitätskontrolle der Fertigung hat das nichts zu tun; das ist eine andere Praxis mit einem anderen Zweck.

Warum Teams Stichproben ziehen und was das kostet

Stichproben sind die Antwort auf eine harte Grenze. Wenn Ihr Team Tausende Konversationen pro Woche bearbeitet und Sie ein paar Reviewer haben, ist es unmöglich, alles zu lesen, also lesen Sie einen Ausschnitt. An dieser Logik ist nichts falsch. Das Problem ist, was der Ausschnitt tragen kann und was nicht.

Eine kleine Stichprobe gibt Ihnen ein grobes Gefühl dafür, wie ein Team insgesamt dasteht, und dafür reicht sie. Sie stößt an ihre Grenzen, sobald Sie damit eine einzelne Person beurteilen, denn ein paar Konversationen sind ein winziger und oft zufällig ungünstiger Ausschnitt aus dem Monat eines Menschen. Zwei gleich gute Agents können in einer kleinen Stichprobe sehr unterschiedlich aussehen, allein wegen der Konversationen, die zufällig gezogen wurden. Dazu kommt ein Auswahlproblem: Die Konversationen, die eine Prüfung am meisten brauchen, also die verworrenen Eskalationen und die, die unbemerkt schiefgingen, landen oft am seltensten in der Stichprobe, weil Reviewer zu Konversationen greifen, die sich schnell bewerten lassen. Die vollständige statistische Betrachtung finden Sie im Beitrag warum eine kleine QA-Stichprobe keine Entscheidungen über einzelne Agents trägt (auf Englisch).

Ein durchgerechnetes Beispiel: was eine wöchentliche Stichprobe sieht

Nehmen wir einen hypothetischen Agent, der pro Woche 100 E-Mail- und Chat-Konversationen bearbeitet, von denen zwei für die Prüfung gezogen werden. Der QA-Score dieser Woche beruht auf 2 % seiner Arbeit. Über einen Monat stehen acht Konversationen für vierhundert, und eine einzige schlechte Woche kann aus einer unglücklichen Ziehung entstehen.

Sehen Sie sich jetzt an, was diese acht Konversationen tragen müssen. Ist eine davon ein schnelles Zurücksetzen des Passworts und eine andere ein langer Streit um eine Erstattung, spiegelt der Score vor allem wider, welche Tickets gezogen wurden, und nicht, wie der Agent arbeitet. Hat der Agent in diesem Monat drei Eskalationen schlecht gelöst, ist die Wahrscheinlichkeit hoch, dass keine davon in der Stichprobe war, und das Coaching-Gespräch findet nie statt. Die Stichprobe auf fünf pro Woche zu erhöhen, hilft ein wenig und kostet einen Reviewer mehr Stunden, und genau diesen Tausch sollte die Stichprobe vermeiden.

Stichprobe oder volle Abdeckung

Bei der Stichprobe wird eine Teilmenge geprüft, deren Größe sich nach der Kapazität der Reviewer richtet, bei voller Abdeckung wird jede Konversation bewertet. Die Stichprobe reicht für ein grobes Bild des Teams; Entscheidungen über einzelne Agents und das Erkennen von Trends brauchen volle Abdeckung. Die Grenze, die Stichproben nötig machte, fällt weg, weil Auto QA heute jede Konversation automatisch bewerten kann, und das verändert die Entscheidung.

Automatisierte Bewertung, etwa mit Kaizo AutoPilot, wendet Ihre eigene Scorecard auf alle Konversationen an statt auf einen ausgewählten Ausschnitt. Wenn Sie in der Zwischenzeit entscheiden müssen, wie viel Sie prüfen, vergleicht unser Leitfaden zur Wahl eines QA-Stichprobenplans (auf Englisch) die Optionen nebeneinander.

StichprobeVolle Abdeckung
Was geprüft wirdEine Teilmenge, abgestimmt auf die Kapazität der ReviewerJede Konversation
Geeignet fürEin grobes Bild des TeamsEntscheidungen über einzelne Agents und Trenderkennung
Blinder FleckDie nie gezogenen Konversationen, auch die schlechtestenErfordert Vertrauen in die automatische Bewertung, die deshalb überprüft werden muss
Wofür die Stichprobe dientQualität messenDie Bewertung prüfen, nicht die Agents messen

Was Teams sehen, wenn sie keine Stichproben mehr ziehen

Teams, die von einer manuellen Stichprobe auf automatisierte Bewertung umsteigen, berichten von mehr Abdeckung und weniger Vorbereitungsaufwand, nicht nur von größeren Zahlen. Bei EverHelp wechselte die Qualitätskontrolle von einer von Hand zusammengestellten Stichprobe zu automatisierter Bewertung nach den eigenen Kriterien jedes Projekts; die QA-Abdeckung stieg um 270 %, und die Coaching-Vorbereitung sank über sechzehn Domains hinweg um 75 %.

Die Kundenstory von EverHelp (auf Englisch) erklärt, wie das über viele Kundenprojekte hinweg funktionierte. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI und einem Anstieg des Qualitätsscores um 8 %. In beiden Fällen war die Veränderung dieselbe: Der Score beruhte nicht mehr auf einer Handvoll Konversationen, für die jemand Zeit zum Lesen hatte.

Sehen Sie es an Ihren eigenen Konversationen. Kaizo bewertet 100 % Ihrer Support-Konversationen anhand Ihrer eigenen Scorecard und macht aus den Ergebnissen Coaching. Demo buchen.

Wo die Stichprobe weiterhin hingehört

Volle Abdeckung macht Stichproben nicht nutzlos; sie gibt ihnen eine bessere Aufgabe. Wenn jede Konversation automatisch bewertet wird, ziehen Sie keine Stichprobe mehr, um Agents zu messen. Sie ziehen sie, um die Messung zu prüfen: um sicherzustellen, dass Reviewer untereinander übereinstimmen und dass eine automatische Bewertung mit Ihren Reviewern übereinstimmt. Das zählt bei automatisierter Bewertung mehr, nicht weniger.

Das ist eine legitime, dauerhafte Verwendung einer Stichprobe, und sie wird bei automatisierter Bewertung wichtiger, weil nun eine einzige Bewertungsinstanz jeden Score prägt. Die verwandten Praktiken sind die Kalibrierung in der Qualitätssicherung und die Validierung von KI-QA-Scores (auf Englisch).

Der Wechsel von der Stichprobe zur vollen Abdeckung sorgt auch dafür, dass QA im Team nicht länger für Streit sorgt. Beruht der Score eines Agents auf zwei Konversationen, lässt er sich leicht abtun. Beruht er auf allen, und jeder Score verweist auf die Belege, verschiebt sich das Gespräch von der Frage, ob die Stichprobe fair war, zu dem, was die Konversationen tatsächlich zeigen. Genau das ist das Argument im Beitrag 100 % der Konversationen bewerten (auf Englisch).

Wann eine Stichprobe genügt

Eine Stichprobe in der Qualitätssicherung genügt, wenn das Team klein ist, das Volumen gering und das Ziel ein allgemeines Bild der Qualität statt Entscheidungen über einzelne Agents. Wenn wenige Agents pro Woche eine überschaubare Zahl an Tickets bearbeiten, kann eine Teamleitung einen großen Teil davon selbst lesen, und eine Stichprobe kommt der vollen Abdeckung womöglich schon nahe.

Stichproben sind auch ein sinnvoller erster Schritt für ein Team, das noch keine Scorecard hat. Die automatische Bewertung jeder Konversation hilft erst, wenn Sie wissen, wonach Sie bewerten; deshalb kommen Aufbau und Kalibrierung der Scorecard anhand einer manuellen Stichprobe zuerst. Sobald das Team wächst oder Scores in Coaching, Leistungsbeurteilungen oder Boni einfließen, wird die dünne Stichprobe zum Problem, und das ist der Moment, sich Auto QA anzusehen.

Häufig gestellte Fragen

Was ist eine Stichprobe in der Qualitätssicherung im Kundenservice?

Es ist die Praxis, einen Teil der Kundenkonversationen statt aller zu prüfen, typischerweise einige pro Agent und Zeitraum. Es gibt sie, weil manuelle Prüfung langsam ist und es immer mehr Konversationen gibt, als Reviewer lesen können. Die gezogenen Konversationen gelten als repräsentativ für das Ganze, die Methode ist also nur so gut, wie repräsentativ die Stichprobe tatsächlich ist.

Warum ist eine Stichprobe ein Problem, wenn man einzelne Agents beurteilt?

Weil ein paar Konversationen ein winziger Ausschnitt aus dem Monat eines Agents sind und es enorm darauf ankommt, welche Konversationen gezogen wurden. Zwei gleich gute Agents können per Zufall sehr unterschiedliche Stichproben-Scores erzielen, und die schwierigsten Konversationen, die eine Prüfung am meisten brauchen, landen oft am seltensten in der Stichprobe. Eine Stichprobe, die nach der Kapazität der Reviewer bemessen ist, ist zu dünn, um eine Entscheidung über eine Person zu tragen.

Wie viele Konversationen sollte ein QA-Team prüfen?

Es gibt keine allgemeingültige Zahl. Die meisten Teams richten die Stichprobe nach der Zeit der Reviewer aus, oft zwei oder drei Konversationen pro Agent und Woche; das reicht für ein grobes Bild des Teams, aber nicht für Entscheidungen über einen einzelnen Agent. Wenn Scores in Coaching oder Beurteilungen einfließen, muss die Stichprobe weit größer sein, und deshalb gehen Teams dazu über, jede Konversation zu bewerten.

Wie sollten Konversationen für eine QA-Stichprobe ausgewählt werden?

Eine Zufallsauswahl hält die Stichprobe am nächsten an der Repräsentativität, weil sie verhindert, dass Reviewer Konversationen wählen, die sich schnell bewerten lassen. Manche Teams ergänzen gezielte Auswahlen, etwa Eskalationen oder niedrige Kundenbewertungen, um die schwierigsten Fälle zu sehen. Halten Sie beides im Reporting getrennt, denn eine gezielte Auswahl ist nicht repräsentativ für die gesamte Arbeit eines Agents.

Ist eine QA-Stichprobe dasselbe wie eine Stichprobe in der Fertigung?

Nein. Im Kundenservice bedeutet Stichprobe die Auswahl von Konversationen zur Prüfung. Mit der statistischen Annahmestichprobenprüfung in der Qualitätskontrolle der Fertigung, die eine Teilmenge physischer Einheiten gegen eine Fehlertoleranz prüft, hat sie nichts zu tun. Die beiden teilen ein Wort, aber keinen Zweck.

Ersetzt volle QA-Abdeckung Stichproben vollständig?

Sie ersetzt Stichproben für die Messung von Agents, weil jede Konversation bewertet werden kann. Für eine andere Aufgabe bleiben Stichproben bestehen: die Bewertung zu prüfen, indem Sie sicherstellen, dass Reviewer untereinander übereinstimmen und eine automatische Bewertung mit Ihren Reviewern übereinstimmt. Diese Verwendung von Stichproben wird bei automatisierter Bewertung wichtiger, nicht weniger wichtig.

Verwandte Begriffe

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart