Zum Inhalt springen

Leitfaden

QA-Bewertungsraster im Kundenservice erklärt

Ein QA-Bewertungsraster im Kundenservice legt Kriterien, Stufen und Gewichte für die Bewertung von Supportkonversationen fest. Mit Beispiel und Score-Rechnung.

· 11 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Ein Bewertungsraster in der Qualitätssicherung (englisch QA rubric, auch Bewertungsschema) ist die Liste der Kriterien, nach denen ein Supportteam eine Kundenkonversation bewertet, mit einer Beschreibung jeder Bewertungsstufe und dem Gewicht jedes Kriteriums. Es übersetzt „guten Service“ in einzelne Punkte, die zwei Reviewer gleich bewerten können, und es ist die Logik hinter jedem QA-Score.

Kurz gesagt

  • Ein Bewertungsraster hat fünf Bestandteile: Kriterien, eine Bewertungsskala, Stufenbeschreibungen, Gewichte und eine kurze Liste kritischer Punkte.
  • Erst die Stufenbeschreibungen machen aus einer Checkliste ein Bewertungsraster, denn sie sagen dem Reviewer, was „teilweise erfüllt“ tatsächlich bedeutet.
  • Der QA-Score ist die erreichte Punktzahl geteilt durch die mögliche Punktzahl, und der Umgang mit „nicht anwendbar“ kann ihn um zehn Punkte verschieben.
  • Die meisten Supportteams fahren gut mit 5 bis 8 Kriterien, die sich allein anhand des Transkripts prüfen lassen.

Was ein Bewertungsraster in der Qualitätssicherung enthält

Ein Bewertungsraster in der Qualitätssicherung besteht aus fünf Teilen: den Kriterien, die bewertet werden, der Bewertungsskala für jedes Kriterium, einer schriftlichen Beschreibung jeder Stufe dieser Skala, einem Gewicht, das festlegt, wie viel jedes Kriterium zählt, und einigen kritischen Punkten, die die Konversation sofort durchfallen lassen. Fehlt einer davon, füllen Reviewer die Lücke mit ihrem persönlichen Urteil.

Der Begriff „Rubric“ stammt aus dem Bildungswesen. Das Lehrzentrum der Carnegie Mellon University definiert sie als „ein Bewertungsinstrument, das die Leistungserwartungen an eine Aufgabe ausdrücklich darstellt“ (auf Englisch) und hält fest, dass solche Raster in Kursen mit mehreren Bewertenden für einheitliche Noten sorgen. Ein Supportteam mit zehn Reviewern hat genau dieses Problem.

BestandteilWelche Frage er beantwortetBeispiel
KriteriumWas bewerten wir?„Die Antwort war richtig und vollständig“
BewertungsskalaWelche Ergebnisse sind möglich?Erfüllt, teilweise erfüllt, nicht erfüllt, nicht anwendbar
StufenbeschreibungenWie sieht jedes Ergebnis aus?„Teilweise erfüllt: richtig, aber ein nötiges Detail fehlt“
GewichtWie viel zählt es?30 von 100 Punkten
Kritischer PunktWas lässt die ganze Konversation durchfallen?Kontodaten weitergegeben, bevor die Identität geprüft war

Kritische Punkte werden meist als K.-o.-Kriterien bezeichnet (englisch auto-fail): Ein einziger Verstoß setzt den Score auf null, egal was sonst geschah. In einer Software ist das Bewertungsraster die Menge an Kriterien und Beschreibungen, die eine Scorecard-Software für die QA auf jede Konversation anwendet.

Bewertungsraster, Scorecard und Checkliste im Vergleich

Ein Bewertungsraster, eine QA-Scorecard und eine QA-Checkliste beschreiben dieselbe Tätigkeit mit unterschiedlichem Detailgrad. Das Raster ist die Bewertungslogik, die Scorecard das Formular, das ein Reviewer ausfüllt, und eine Checkliste ist eine Liste von Ja-oder-Nein-Punkten ohne Stufenbeschreibungen und meist ohne Gewichte. Viele Teams verwenden die Begriffe synonym.

QA-ChecklisteQA-ScorecardBewertungsraster
LeitfrageIst es passiert?Welchen Score gab es?Was bedeutet jeder Score?
BewertungJa oder neinJa oder nein, oder eine SkalaSkala mit einer Beschreibung pro Stufe
GewichteSeltenMeistensMeistens
Am besten fürProzess- und Compliance-SchritteDie tägliche PrüfungEinigkeit zwischen Reviewern, Einsprüche, Automatisierung

In der Praxis ist Ihre QA-Scorecard das Bewertungsraster plus das Formular drumherum: der Link zur Konversation, der Reviewer, die Kommentare und der Endscore. Hat Ihre Scorecard Kriterien und Gewichte, aber keine schriftliche Beschreibung jeder Stufe, dann haben Sie eine Scorecard, der noch ihr Bewertungsraster fehlt.

Ein Beispiel-Bewertungsraster für Chat- und E-Mail-Support

Hier ist ein vollständiges Bewertungsraster für schriftlichen Support per Chat und E-Mail: sechs gewichtete Kriterien mit zusammen 100 Punkten, eine dreistufige Skala mit einer Beschreibung jeder Stufe und zwei kritische Punkte. Es ist ein Beispiel zum Anpassen, kein Standard. Passen Sie die Kriterien an Ihre Produkte, Richtlinien und Kontaktgründe an.

KriteriumGewichtErfüllt (volle Punkte)Teilweise erfüllt (halbe)Nicht erfüllt (0)
Das eigentliche Anliegen verstanden15Gibt das tatsächliche Problem wieder oder handelt danach, stellt bei unklarer Anfrage eine RückfrageBeantwortet die wörtliche Frage, verfehlt aber das eigentliche BedürfnisBeantwortet eine andere Frage als die gestellte
Richtige und vollständige Antwort30Die Informationen stimmen und decken alles ab, was der Kunde zum Handeln brauchtRichtig, aber ein nötiges Detail fehltFalsche, veraltete oder irreführende Informationen
Vorgeschriebenen Prozess eingehalten20Jeder vorgeschriebene Schritt für diesen Kontaktgrund ist erledigt (Erstattungsrichtlinie, Eskalationsweg, Tagging)Ein kleiner Schritt fehlt, ohne Auswirkung auf den KundenEin vorgeschriebener Schritt fehlt und der Kunde ist betroffen
Klarer nächster Schritt mit Zeitangabe15Sagt, was als Nächstes passiert, wer es tut und bis wannNächster Schritt genannt, Zeitangabe fehltDer Kunde muss raten, wie es weitergeht
Ton passt zur Situation10Erkennt Frust an, wo er da ist, einfache Sprache, keine SchuldzuweisungHöflich, aber generisch oder nach Vorlage, wo das nicht passtAbweisend, schuldzuweisend oder verwirrend
Notizen reichen für die nächste Person10Interne Notiz oder Ticketfelder erlauben einem Kollegen weiterzumachen, ohne den Verlauf erneut zu lesenNotizen vorhanden, aber ein wichtiger Fakt fehltKeine Notizen bei einer Konversation, die eine Übergabe braucht

Kritische Punkte (Score wird auf null gesetzt): Konto- oder personenbezogene Daten weitergegeben, bevor die Identität geprüft war; eine Erstattung oder Gutschrift außerhalb der Richtlinie zugesagt.

Zwei Dinge machen daraus ein Bewertungsraster statt einer Liste. Jede Stufe hat eine Beschreibung, auf die ein Reviewer im Transkript zeigen kann, und „Notizen“ lassen sich als nicht anwendbar markieren, wenn keine Übergabe nötig ist. Fertige Versionen pro Kanal finden Sie in unseren QA-Scorecard-Vorlagen (auf Englisch).

Wie der QA-Score aus dem Bewertungsraster berechnet wird

Ein QA-Score ist die Punktzahl, die eine Konversation erreicht hat, geteilt durch die Punktzahl, die sie hätte erreichen können, angegeben in Prozent. In den meisten Setups fallen Kriterien, die als nicht anwendbar markiert sind, aus beiden Zahlen heraus, und ein kritischer Punkt setzt den Score auf null. Der Durchschnitt dieser Scores über viele Konversationen ergibt den Qualitätsscore eines Agents oder Teams.

Nehmen wir eine E-Mail, die mit dem Raster oben bewertet wurde:

KriteriumGewichtBewertungPunkte
Das eigentliche Anliegen verstanden15Erfüllt15
Richtige und vollständige Antwort30Teilweise erfüllt15
Vorgeschriebenen Prozess eingehalten20Erfüllt20
Klarer nächster Schritt mit Zeitangabe15Nicht erfüllt0
Ton passt zur Situation10Erfüllt10
Notizen für die nächste Person10Nicht anwendbarentfällt

Die Konversation hat 60 von möglichen 90 Punkten erreicht, der Score liegt also bei 67 %. Achten Sie darauf, was die Regel für „nicht anwendbar“ bewirkt. Würde das Team den Punkt als nicht erfüllt werten, läge der Score bei 60 von 100, also 60 %. Würde er als erfüllt gelten, bei 70 von 100, also 70 %. Dieselbe Konversation, zehn Punkte Unterschied, allein wegen einer Regel, die niemand aufgeschrieben hat.

Deshalb gehört die Regel für „nicht anwendbar“ ins Bewertungsraster selbst. Die Gewichte sind genauso wichtig: Ein Ausrutscher im Ton kostet hier 5 Punkte, eine falsche Antwort bis zu 30. Unser Leitfaden zur Gewichtung von Bewertungskriterien zeigt, wie Sie diese Zahlen anhand von Belegen festlegen, und der Beitrag zum Internal Quality Score erklärt, wie die Scores der einzelnen Konversationen zu einer Teamkennzahl zusammenlaufen.

Analytisch oder ganzheitlich: das passende Format wählen

Es gibt zwei Formate für Bewertungsraster. Ein analytisches Raster bewertet jedes Kriterium einzeln und fasst die Ergebnisse dann zusammen, so wie fast jedes Bewertungsraster im Support. Ein ganzheitliches (holistisches) Raster vergibt eine Gesamtbewertung anhand einer einzigen Qualitätsbeschreibung. Das analytische Format braucht mehr Aufwand beim Aufbau, sagt dem Agent aber genau, welchen Teil der Konversation er verbessern muss.

Das Assessment-Büro der University of Oklahoma fasst den Zielkonflikt zusammen: Bei einem analytischen Raster „kann jedes Kriterium gewichtet werden, um die relative Bedeutung jeder Dimension abzubilden“ (auf Englisch), während bei einem holistischen Raster „Kriterien nicht gewichtet werden können“. Dieselbe Seite hält fest, dass analytische Raster mehr Zeit für Entwicklung und Anwendung brauchen.

Für Supportteams ist die Wahl meist einfach:

  • Analytisch für die QA von Agents, für Coaching und für alles, was an ein Ziel oder einen Bonus gekoppelt ist. Agents müssen wissen, welches Kriterium sie Punkte gekostet hat.
  • Ganzheitlich für schnelle Zustandschecks, etwa wenn eine Führungskraft einen Stapel Konversationen mit „gut, verbesserungswürdig, schlecht“ einstuft, um ein Problem zu erkennen, bevor ein vollständiges Raster entsteht.

Welche Qualitätskriterien in ein Bewertungsraster gehören

Ein Kriterium gehört in ein Bewertungsraster, wenn es vier Tests besteht: Ein Reviewer kann es in der Konversation sehen, es prüft genau eine Sache, der Agent hat es selbst in der Hand, und es passt zum bewerteten Kontakttyp. Kriterien, die diese Tests nicht bestehen, erzeugen die Scores, gegen die Agents am häufigsten Einspruch einlegen, weil zwei faire Reviewer zu unterschiedlichen Urteilen kommen können.

  1. Beobachtbar. „Hat Empathie gezeigt“ ist ein Gefühl. „Hat den Frust des Kunden anerkannt, bevor er geantwortet hat“ ist etwas, das man zitieren kann.
  2. Eine Prüfung pro Kriterium. „Hat den Kunden begrüßt und seine Identität geprüft“ sind zwei Kriterien. Trennen Sie alles, was mit „und“ verbunden ist.
  3. In der Hand des Agents. Ein langsames Tool oder eine Richtlinie, die der Agent nicht ändern kann, sollte ihn keine Punkte kosten. Erfassen Sie das stattdessen als Prozessproblem.
  4. Passt zum Kontaktgrund. Beziehungsaufbau ist bei einer Beschwerde sinnvoll und bei einem Passwort-Reset kaum. In einem Reddit-Thread über QA-Scores beklagte sich ein Agent eines Energieversorgers, dass er danach bewertet wurde, ob er „den Kunden auf eine Reise mitgenommen“ hatte, obwohl der Kunde nur eine Zahlung leisten wollte.

Bei der Anzahl landen die meisten Praktiker bei einer kurzen Liste. Ein Kommentator in einem Reddit-Thread über den Neuaufbau der QA in einer Tabelle riet, ein Raster auf „5 bis 7 Kriterien“ zu kürzen und „die meisten davon am Tickettext prüfbar“ zu machen. Wenn Sie die Bewertung automatisieren wollen, liegt die Latte noch höher; unser Leitfaden, wie Sie Kriterien schreiben, die eine KI bewerten kann (auf Englisch), formuliert gängige vage Kriterien in prüfbare um.

In sechs Schritten ein Bewertungsraster aufbauen

Ein Bewertungsraster entsteht in sechs Schritten: die Ergebnisse festlegen, die es schützen soll, die Verhaltensweisen auflisten, die zu diesen Ergebnissen führen, jede als beobachtbares Kriterium formulieren, jede Bewertungsstufe beschreiben, Gewichte und kritische Punkte festlegen und das Raster dann mit mehreren Reviewern an echten Konversationen testen, bevor ein Agent auch nur einen Score sieht.

  1. Bei den Ergebnissen anfangen. Schreiben Sie die drei oder vier Dinge auf, die eine gute Konversation für Ihr Unternehmen erreichen muss: eine richtige Antwort, ein gelöstes Anliegen, ein regelkonformer Prozess, ein Kunde, der weiß, wie es weitergeht.
  2. Die Verhaltensweisen dahinter auflisten. Lesen Sie 20 bis 30 aktuelle Konversationen, gute wie schlechte, und notieren Sie, was die Agents getan haben, das den Unterschied gemacht hat.
  3. Die Kriterien formulieren. Machen Sie aus jeder Verhaltensweise eine einzelne, beobachtbare Aussage und wenden Sie dabei die vier Tests oben an.
  4. Jede Stufe beschreiben. Schreiben Sie für jedes Kriterium auf, wie erfüllt, teilweise erfüllt und nicht erfüllt aussehen, mit einem kurzen Beispiel aus einem echten Transkript.
  5. Gewichte und kritische Punkte festlegen. Geben Sie die meisten Punkte dem, was Kunden am meisten schadet. Beschränken Sie kritische Punkte auf die zwei oder drei Fehler, die wirklich nicht verhandelbar sind.
  6. Vor dem Rollout testen. Lassen Sie drei oder vier Reviewer dieselben zehn Konversationen unabhängig voneinander bewerten und vergleichen Sie. Wo sie sich uneinig sind, ist die Beschreibung unklar, nicht der Reviewer.

Schritt 6 ist der, den Teams überspringen. In einem Reddit-Thread über QA-Scorecard-Tools beschrieb ein Kommentator, wie zwei Reviewer dasselbe Ticket mit 60 und 85 bewerteten, weil „hat Empathie gezeigt“ für beide etwas anderes bedeutete, und dass die Agents daraufhin „der Zahl nicht mehr vertrauten“. Regelmäßige Kalibrierung in der Qualitätssicherung sorgt dafür, dass sich diese Lücke nach dem Start nicht wieder öffnet. Ein Kommentator zur selben Frage, gepostet in einem zweiten Subreddit, machte einen weiteren praktischen Punkt: Abrechnungstickets, Bug-Eskalationen und Erstattungsanfragen brauchen womöglich getrennte Raster, weil sie „keine gemeinsamen Kriterien haben“.

Ein Bewertungsraster auf jede Konversation anwenden

Ein Bewertungsraster zahlt sich erst aus, wenn es auf jede Konversation gleich angewendet wird, und genau dort stößt die manuelle Prüfung an ihre Grenzen. Ein Reviewer, der eine kleine Stichprobe liest, kann bei großem Volumen nicht einheitlich bewerten, und jeder Reviewer driftet mit der Zeit ein wenig ab. Die automatisierte Bewertung wendet einen schriftlichen Standard auf alle Konversationen an, ohne dass jemand müde oder in Eile ist.

Kaizo übernimmt Ihre bestehenden Kriterien, statt Ihnen eine Vorlage aufzuzwingen, und bewertet 100 % Ihrer Supportkonversationen danach, egal ob ein Mensch oder ein KI-Agent geantwortet hat, mit den Belegen zu jedem Score. Wenn Sie die Beschreibung eines Kriteriums ändern, gilt die Änderung für jede künftige Bewertung, sodass niemand ein Team von Reviewern neu einweisen muss. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI. Bei EverHelp (auf Englisch) sank der Aufwand für die Coaching-Vorbereitung um 75 %.

Sehen Sie es an Ihren eigenen Konversationen. Kaizo bewertet 100 % Ihrer Supportkonversationen nach Ihrem eigenen Bewertungsraster und macht aus den Ergebnissen Coaching. Demo buchen oder sehen Sie, wie die Scorecard-Software für die QA funktioniert.

Wann sich ein formales Bewertungsraster nicht lohnt

Ein vollständiges, gewichtetes Bewertungsraster mit Stufenbeschreibungen lohnt sich nicht für jedes Team. Wenn ein oder zwei Personen ein paar Dutzend Tickets pro Woche bearbeiten, deckt eine Führungskraft, die Konversationen liest und direkt Feedback gibt, dasselbe mit weniger Aufwand ab. Eine kurze Ja-oder-Nein-Checkliste reicht, bis Meinungsverschiedenheiten über die Qualität auftauchen.

Ein Bewertungsraster behebt auch kein Prozessproblem. Wenn Agents durchweg am selben Kriterium scheitern, liegt die Ursache meist in einer Richtlinie, einem Tool oder der Schulung, und eine strengere Bewertung lässt die Scores nur schlechter aussehen. Erstellen Sie das Raster, wenn Sie mehrere Reviewer haben, Agents fragen, warum sie Punkte verloren haben, oder wenn Sie Konversationen automatisch bewerten wollen.

Häufig gestellte Fragen

Was bedeutet QA rubric?

QA rubric bezeichnet den Bewertungsleitfaden, mit dem ein QA-Team Kundenkonversationen bewertet, auf Deutsch meist Bewertungsraster oder Bewertungsschema. Er listet die Kriterien, die Bewertungsskala, wie jede Stufe aussieht und wie viel jedes Kriterium zählt. „Quality Assurance Rubric“ und „Quality Scorecard“ sind gängige Namen für dasselbe.

Was ist ein QA-Score?

Ein QA-Score ist das Ergebnis, wenn das Bewertungsraster auf eine Konversation angewendet wird: erreichte Punkte geteilt durch mögliche Punkte, in Prozent. Als nicht anwendbar markierte Kriterien fallen meist aus beiden Zahlen heraus, und ein kritischer Punkt setzt den Score auf null. Die Qualitätsscores von Teams und Agents sind Durchschnitte dieser Scores pro Konversation.

Wie viele Kriterien sollte ein Bewertungsraster haben?

Die meisten Supportteams fahren gut mit 5 bis 8 Kriterien, die sich jeweils am Transkript prüfen lassen. Weniger decken Richtigkeit, Prozess und Kommunikation selten gemeinsam ab, und deutlich längere Listen sind langsam in der Prüfung und schwer einheitlich zu bewerten. Teams mit sehr unterschiedlichen Kontakttypen führen oft ein kurzes Raster pro Typ statt eines langen.

Sollte ein Bewertungsraster Ja oder Nein oder eine Skala von 1 bis 5 nutzen?

Nutzen Sie Ja oder Nein für Schritte, die entweder passiert sind oder nicht, etwa die Identitätsprüfung oder einen vorgeschriebenen Hinweis. Nutzen Sie eine dreistufige Skala (erfüllt, teilweise erfüllt, nicht erfüllt) für Verhaltensweisen mit echten Abstufungen, etwa die Vollständigkeit einer Antwort. Fünfstufige Skalen lohnen sich nur, wenn jede Stufe ihre eigene schriftliche Beschreibung hat.

Wie oft sollte man ein Bewertungsraster aktualisieren?

Überprüfen Sie das Raster, wenn sich Produkte, Richtlinien oder Kontaktgründe ändern, und mindestens einige Male im Jahr. Ändern Sie jeweils nur ein Kriterium und notieren Sie das Datum, denn jede Änderung verschiebt die Scores und erschwert den Vergleich von Trends vor und nach der Änderung.

Lässt sich ein Bewertungsraster für KI-Agenten verwenden?

Ja. Dasselbe Raster kann Konversationen bewerten, die ein KI-Agent geführt hat, und solche, die Menschen geführt haben, sodass die Qualität über beide hinweg vergleichbar bleibt. Die Kriterien müssen im Transkript beobachtbar sein, was für die Prüfung durch Menschen ohnehin gute Praxis ist.

Verwandte Begriffe

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart