Zum Inhalt springen

Vorlage

Gewichtung der Bewertungskriterien ohne Bauchgefühl

Gleiche Gewichte schwächen fast jede QA-Scorecard. So leiten Sie die Gewichtung der Bewertungskriterien aus Belegen ab und testen sie vor dem Rollout.

· 12 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Die Gewichtung der Bewertungskriterien leiten Sie aus drei Faktoren ab: wie sehr der Fehler dem Kunden schadet, welches Risiko er für das Unternehmen birgt und wie weit der Agent ihn selbst in der Hand hat. Wenn Sie ein Gewicht nicht begründen können, übersteht der Score den ersten Einspruch nicht.

Kurz gesagt

  • Gleiche Gewichtung behauptet, dass jedes Kriterium gleich viel zählt. Das stimmt nie.
  • Der Einfluss des Agents ist der Faktor, den alle vergessen, und den Agents am meisten übelnehmen.
  • Machen Sie kritische Kriterien zu einem K.o.-Kriterium statt zu einem Posten mit 60 Punkten.
  • Testen Sie neue Gewichte rückwirkend an bereits bewerteten Konversationen. Wechselt niemand die Bewertungsstufe, war es Kosmetik.

Warum gleiche Gewichtung eine Scorecard schleichend unbrauchbar macht

Fast jede QA-Scorecard beginnt mit gleichen Gewichten, weil das fair wirkt und kein Nachdenken erfordert. Es ist weder das eine noch das andere. Gleiche Gewichtung ist eine Behauptung, nämlich dass eine vergessene Begrüßung das Unternehmen genau so viel kostet wie eine falsch bearbeitete Erstattung.

Daraus folgen drei Dinge, und zwar in dieser Reihenfolge.

Der Score unterscheidet nicht mehr. Wenn zehn Kriterien je zehn Punkte wert sind, kosten ein schwerer und ein kosmetischer Fehler beide zehn. Zwei Agents landen bei 90, der eine, weil er kurz angebunden war, der andere, weil er dem Kunden falsche Informationen über sein Geld gegeben hat. Eine Zahl, die diese beiden Fälle nicht auseinanderhalten kann, misst keine Qualität.

Agents optimieren auf die billigen Kriterien. Menschen reagieren auf die Anzeigetafel, die Sie ihnen geben. Wenn Ton und Begrüßung die Punkte sind, die sich am leichtesten halten und am schwersten verlieren lassen, fließt die Mühe genau dorthin. Das ist kein Austricksen, das ist die Scorecard, die genau so funktioniert, wie sie gebaut wurde.

Der Score löst sich vom Geschäft. Sobald Qualitätsscores nicht mehr mit Eskalationen, erneut geöffneten Tickets und Kundenunzufriedenheit zusammenhängen, hört die Führung still und leise auf, sie zu nutzen. Das Programm läuft weiter, die Prüfungen laufen weiter, und niemand trifft mit dem Ergebnis eine Entscheidung. In diesem Zustand befinden sich die meisten QA-Programme tatsächlich.

Ein schneller Test: Nehmen Sie Ihre zwei Agents mit den höchsten Scores aus dem letzten Monat und Ihre zwei mit den niedrigsten. Wenn Sie keinen echten Unterschied im Kundenerlebnis benennen können, das sie geliefert haben, tragen Ihre Gewichte keine Information. Bevor Sie Gewichte anfassen, stellen Sie sicher, dass die zugrunde liegenden Kriterien solide sind. Das ist eine eigene Aufgabe, die wir in was ein Bewertungsschema ist und wie Sie eines aufbauen behandeln.

Merke

Gleiche Gewichtung ist nicht das Fehlen einer Entscheidung. Es ist die Entscheidung, dass jedes Kriterium gleich viel zählt, getroffen per Voreinstellung und nie überprüft.

Die drei Gewichtungsmodelle und wann welches passt

Im praktischen Einsatz gibt es nur drei Modelle. Der Fehler besteht nicht darin, das falsche zu wählen, sondern darin, eines zufällig zu wählen und es nie zu überprüfen.

ModellWie es funktioniertPassend, wennScheitert, wenn
FlachJedes Kriterium bringt dieselbe PunktzahlDas Programm neu ist, Sie weniger als etwa zehn Kriterien haben und wirklich noch nicht wissen, was zähltSie Ergebnisdaten haben und sie trotzdem ignorieren. Flach sollte eine Startposition sein, kein Dauerzustand
Nach Wirkung gewichtetKriterien haben unterschiedliche Punktwerte, die die Wirkung auf Kunden und Unternehmen abbildenDas Programm reif genug ist, um Belege zu haben, und Reviewer jedes Gewicht erklären könnenGewichte von dem festgelegt werden, der im Meeting am lautesten ist, und danach nie wieder überprüft werden
Abzug von einer ObergrenzeJede Konversation startet bei 100 und verliert pro Fehler Punkte, die Schwere bestimmt den AbzugDie meisten Konversationen in Ordnung sind und Sie Ausnahmen suchen, oder die Arbeit stark von Compliance geprägt istEs keine Untergrenze gibt, sodass eine schlechte Konversation tief ins Minus fällt und den Durchschnitt eines Agents verzerrt

Gewichtung der Bewertungskriterien aus Belegen statt aus Meinungen

Gewichten Sie nach drei Faktoren, in dieser Reihenfolge. Nichts davon ist eine Besonderheit der Support-QA: Das Handbuch der britischen Regierung zur multikriteriellen Analyse behandelt dasselbe Problem, Optionen anhand von Kriterien zu bewerten und diese Kriterien dann zu gewichten. Seine zentrale Warnung lautet, dass die Gewichte das Werturteil tragen, ob das jemand zugibt oder nicht.

Wirkung auf den Kunden. Wie viel schlechter ist der Tag dieses Kunden, weil das Kriterium nicht erfüllt wurde? Falsche Informationen zu einer Erstattung wiegen schwerer als eine fehlende Verabschiedung, und zwar mit großem Abstand.

Geschäftliches und regulatorisches Risiko. Was kostet der Fehler über diese eine Konversation hinaus? Alles mit rechtlichen, finanziellen oder datenschutzrechtlichen Folgen gehört nach oben, und manches davon sollte gar nicht im gewichteten Teil stehen.

Einfluss des Agents. Diesen Faktor überspringen alle, und genau ihn bemerken die Agents. Wenn ein Kriterium von einem langsamen internen System abhängt, von einer Richtlinie, die der Agent nicht beugen kann, oder von einer Übergabe aus einem anderen Team, bestraft ein hohes Gewicht die Menschen für Ihren Prozess. Gewichten Sie es entweder niedrig, oder beheben Sie den Prozess und bewerten Sie es nicht mehr.

Die Gewichte tragen das Werturteil, ob das jemand zugibt oder nicht.

Sinngemäß nach dem Handbuch zur multikriteriellen Analyse der britischen Regierung

Die eine Stunde Analyse, die den Großteil der Arbeit erledigt

Nehmen Sie drei Monate an Konversationen, die Sie bereits bewertet haben. Teilen Sie sie für jedes Kriterium in die, bei denen es erfüllt war, und die, bei denen es nicht erfüllt war, und vergleichen Sie dann ein nachgelagertes Ergebnis zwischen den beiden Gruppen. Die Quote erneut geöffneter Tickets ist die beste Einzelwahl, weil sie objektiv ist und bereits in Ihrem Helpdesk liegt. Eskalationsquote und Unzufriedenheit funktionieren ebenfalls.

Sie suchen nach der Größe des Abstands. Ein Kriterium, dessen Nichterfüllung die Quote erneut geöffneter Tickets deutlich verschiebt, hat sich Gewicht verdient. Ein Kriterium, dessen Nichterfüllung nichts bewegt, hat das nicht, und es sollte entweder auf der Skala nach unten rutschen oder ganz von der Scorecard verschwinden.

Zwei ehrliche Einschränkungen. Das ist Korrelation, nicht Kausalität, also nutzen Sie es, um Kriterien in eine Rangfolge zu bringen, nicht um exakte Punktwerte zu berechnen. Und Kriterien, die sehr selten nicht erfüllt werden, liefern kein lesbares Signal. Das ist meist ein Hinweis darauf, dass sie zu den K.o.-Kriterien gehören und nicht in den gewichteten Teil.

Tipp

Nutzen Sie die Quote erneut geöffneter Tickets als Ergebnisgröße. Sie ist objektiv, liegt bereits in Ihrem Helpdesk und hängt, anders als die Zufriedenheit, nicht davon ab, dass jemand eine Umfrage beantwortet.

Ein K.o.-Kriterium ist eine Schranke, kein hohes Gewicht

Das ist der häufigste Designfehler bei Scorecards. Ein Team beschließt, dass ein Verstoß gegen den Schutz von Kundendaten (auf Englisch) inakzeptabel ist, und macht ihn deshalb 60 der 100 möglichen Punkte wert.

Das bewirkt nicht, was das Team denkt. Ein Agent kann gegen den Datenschutz verstoßen und trotzdem bei 40 landen, und wenn der Rest der Scorecard großzügig ist, beendet er den Monat mit einem respektablen Durchschnitt. Das Verhalten, das das Team inakzeptabel nannte, ist rechnerisch überlebbar.

Wenn ein Verhalten die Interaktion ungültig machen soll, braucht es eine binäre Schranke, die den Score auf null setzt und vollständig außerhalb des gewichteten Teils steht. Genau dafür ist ein K.o.-Kriterium da. Drei Regeln halten es praxistauglich:

  • Wenige. Drei bis fünf. Eine Scorecard mit einem Dutzend K.o.-Kriterien ist eine Scorecard, auf der alles kritisch ist und deshalb nichts.
  • Eindeutig. Ein K.o.-Kriterium muss von zwei Reviewern, die nie miteinander gesprochen haben, mit Ja oder Nein beantwortet werden können. „War unhöflich“ erfüllt das nicht. „Hat Kontodaten offengelegt, ohne die Identitätsprüfung abzuschließen“ schon.
  • Zweiter Reviewer Pflicht. Den Score eines Menschen auf null zu setzen, ist ein ernster Schritt, und er sollte das Programm etwas kosten.

Sind die K.o.-Kriterien erst herausgelöst, lässt sich über den gewichteten Teil leichter nachdenken, weil alles, was darin bleibt, eine Frage des Grades ist und nicht der Art.

Achtung

Ein kritisches Kriterium mit 60 von 100 Punkten zu bewerten, macht es nicht zu einem K.o.-Kriterium. Der Agent kann es verfehlen, trotzdem 40 erreichen und mit einer großzügigen Scorecard den Monat noch ordentlich abschließen. Wenn ein Verhalten die Interaktion ungültig machen soll, setzen Sie eine Schranke. Geben Sie ihm keinen Preis.

Die bimodale Scorecard und warum Agents ihr nicht mehr glauben

Es gibt einen bestimmten Fehlerzustand, den man benennen sollte, weil er häufig ist und das Vertrauen zerstört. Er entsteht, wenn eine Scorecard eine lange Liste von K.o.-Kriterien mit hohen Abzügen auf alles andere kombiniert. Agents beschreiben das Ergebnis jedes Mal gleich: Jeder Punkt ist entweder eine sofortige Null oder kostet sechzehn Punkte, also gibt es in der Praxis nur einen perfekten Score oder eine Katastrophe.

Sehen Sie sich Ihre Verteilung an. Wenn sich die Scores oben und unten ballen und dazwischen kaum etwas liegt, misst die Scorecard nicht mehr, sie sortiert nur noch. Daraus folgen zwei Dinge. Ziele wie 95 % werden für alle, die schwierige Konversationen übernehmen, rechnerisch unerreichbar, sodass die Menschen mit Ihren schlimmsten Tickets am schlechtesten abschneiden. Und weil es keine Mitte gibt, gibt es nichts, worauf man hincoachen kann, nur Bestehen oder Strafe.

Die Lösung ist fast immer dieselbe: weniger K.o.-Kriterien und kleinere Abzüge bei den Kriterien, die bleiben.

Wie Sie neue Gewichte vor dem Rollout testen

Veröffentlichen Sie eine neu gewichtete Scorecard nie direkt im Produktivbetrieb. Testen Sie sie zuerst rückwirkend. Das dauert einen Nachmittag und verhindert den Großteil des Schadens.

Nehmen Sie eine Stichprobe von Konversationen, die bereits mit den alten Gewichten bewertet wurden. Berechnen Sie ihre Scores mit den neuen Gewichten neu. Prüfen Sie sie nicht erneut, Sie testen Arithmetik, nicht Urteilsvermögen. Vergleichen Sie dann die Verteilung.

Drei mögliche Befunde, und jeder sagt Ihnen etwas Bestimmtes.

  • Fast niemand wechselt die Bewertungsstufe. Die Neugewichtung ist kosmetisch. Sie haben politisches Kapital für eine Änderung ausgegeben, die nichts verändert, und sollten entweder weiter gehen oder es lassen.
  • Fast alle wechseln die Bewertungsstufe. Sie haben nicht die Gewichte angepasst, Sie haben den Standard geändert. Das kann richtig sein, muss aber als neuer Standard angekündigt werden und nicht als Feinjustierung durchrutschen, sonst verlieren Sie den Rückhalt im Team.
  • Einige wechseln, und es sind die Falschen. Das ist der nützliche Fall. Wenn Agents, die Ihr Team respektiert, stark abfallen, bilden die neuen Gewichte eine Vorstellung von Qualität ab, die Sie gar nicht teilen. Finden Sie das Kriterium, das das verursacht, bevor Sie weitermachen.

Führen Sie dann eine Kalibrierungssitzung (auf Englisch) mit der ganzen Reviewer-Gruppe auf Basis der neuen Gewichte durch, bevor irgendetwas veröffentlicht wird. Gewichte verändern, worüber Reviewer streiten, und dieser Streit soll in einem Raum stattfinden und nicht im Einzelgespräch mit einem Agent. Wenn Sie von einer Standardvorlage ausgehen, sind die QA-Scorecard-Vorlagen (auf Englisch) eine brauchbare Basis zum Neugewichten, statt mit einem leeren Blatt anzufangen.

Gewichtung, wenn eine KI bewertet

Automatisierte Bewertung ändert nichts an den Prinzipien oben. Sie ändert, was auf dem Spiel steht, wenn man sie falsch umsetzt, und zwar auf zwei bestimmte Arten.

Fehler sind nicht mehr gelegentlich, sondern systematisch. Bei manueller Prüfung mit der 3-%-Stichprobe, die die meisten Programme ziehen, verzerrt ein schlecht gewichtetes Kriterium eine Handvoll Konversationen im Monat, und ein guter Reviewer gleicht das stillschweigend aus. Mit 100 % Abdeckung (auf Englisch), die Trends sichtbar macht, die eine 3-%-Stichprobe nie zeigen könnte, wird dasselbe schlechte Gewicht auf jede Konversation angewendet, konsistent und in dieselbe Richtung. Konsistenz ist der Sinn der Automatisierung, und genau deshalb potenziert sich ein Gewichtungsfehler.

Ein Gewicht ist nur so belastbar wie seine Begründung. Ein Agent, dem gesagt wird, er habe 30 Punkte verloren, fragt, welche 30 und warum. Wenn das System nur eine Summe liefern kann, überleben die Gewichte den Kontakt mit dem Team nicht, egal wie sorgfältig Sie sie festgelegt haben. Jeder Abzug muss das Kriterium benennen, die Stelle in der Konversation zitieren, die ihn ausgelöst hat, und anfechtbar sein. Das ist der Unterschied zwischen einem Score und einem Urteil, ausführlicher behandelt in wie Sie KI-QA-Bewertungen validieren (auf Englisch).

Zwei praktische Anpassungen für die automatisierte Bewertung:

  • Abzüge grob halten. Vielfache von fünf oder zehn. Feinkörnige Gewichte unterstellen eine Präzision, die das Modell nicht hat, und laden zu Diskussionen über den Unterschied zwischen einem Fehler für sieben und einem für acht Punkte ein.
  • Das gewichten, was ein Modell zuverlässig liest. Prozedurale und faktische Kriterien werden konsistent bewertet. Ermessensfragen zum Ton schwanken stärker, also geben Sie ihnen einen kleineren Anteil, bis Sie gemessen haben, wie genau die KI-Bewertung bei ihnen ist.

Kaizos Auto QA wendet die Gewichte aus Ihrer eigenen Scorecard pro Kriterium an und lässt die Begründung an der Konversation hängen. So lässt sich ein angefochtener Abzug auf den konkreten Wortwechsel zurückführen, der ihn verursacht hat, statt aus dem Gedächtnis darüber zu streiten.

Wann Sie neu gewichten und wann Sie es lassen

Gewichten Sie nach Plan neu, nicht nach Beschwerde. Quartalsweise, gekoppelt an einen Zyklus der QA-Kalibrierung, ist der Rhythmus, den die meisten Teams durchhalten. Sammeln Sie dazwischen die Beschwerden, statt auf jede einzelne zu reagieren.

Vier Signale, dass ein Gewicht wirklich ausgedient hat:

  • Ein Kriterium wird zwei Quartale in Folge in mehr als etwa 95 % der Fälle erfüllt. Es unterscheidet nicht mehr zwischen Agents. Entweder ist das Verhalten inzwischen selbstverständlich, dann feiern Sie und nehmen es heraus, oder das Kriterium ist zu leicht zu erfüllen.
  • Eine Richtlinien- oder Produktänderung hat verschoben, was zählt. Neue Regulierung, eine neue Erstattungsrichtlinie, ein neuer Kanal.
  • Der Score bildet die Ergebnisse nicht mehr ab. Wiederholen Sie die Analyse von weiter oben in diesem Leitfaden. Wenn die Abstände flacher geworden sind, sind die Gewichte veraltet.
  • Reviewer überstimmen immer wieder dasselbe Kriterium. Wenn Menschen ein Gewicht stillschweigend ausgleichen, sagen sie Ihnen, dass es falsch ist.

Eine Regel zählt mehr als alle anderen: Versionieren Sie die Scorecard und wenden Sie neue Gewichte nie rückwirkend auf historische Scores an. Der März-Score eines Agents entstand nach den Regeln vom März. Ihn im Juli neu zu berechnen, zerstört das Einzige, worauf ein QA-Programm angewiesen ist: dass die Zahl zum Zeitpunkt ihrer Vergabe etwas bedeutet hat. Lassen Sie die alte Version unverändert, starten Sie die neue Version ab einem klaren Datum und sagen Sie das offen. Das hält auch Ihren internen Qualitätsscore über die Zeit vergleichbar, statt dass er unbemerkt abdriftet.

Häufig gestellte Fragen

Wie viele Kriterien sollte eine QA-Scorecard haben?

Acht bis fünfzehn für die meisten Supportteams. Unter acht ist der Score zu grob, um das Coaching zu steuern. Über fünfzehn können Reviewer das ganze Bewertungsschema nicht mehr im Kopf behalten, ihre Übereinstimmung sinkt, und Prüfungen dauern so lange, dass die Abdeckung leidet. Wenn Sie mehr als fünfzehn brauchen, brauchen Sie wahrscheinlich zwei Scorecards für zwei verschiedene Arten von Arbeit statt einer langen.

Sollte jedes Kriterium dasselbe Gewicht haben?

Nein. Gleiche Gewichtung behauptet, dass jedes Verhalten gleich viel zählt. Das stimmt nie, und es entstehen Scores, die einen schweren Fehler nicht von einem kosmetischen unterscheiden können. Flache Gewichtung ist eine vernünftige Startposition für ein ganz neues Programm ohne Ergebnisdaten, sollte aber ersetzt werden, sobald Sie Kriterien nach ihrer Wirkung auf erneut geöffnete Tickets, Eskalationen oder Unzufriedenheit ordnen können.

Was ist der Unterschied zwischen einem Gewicht und einem K.o.-Kriterium?

Ein Gewicht sagt, wie viel ein Fehler kostet. Ein K.o.-Kriterium sagt, dass die Konversation ungültig ist, unabhängig von allem anderen. Es sind verschiedene Mechanismen, und das eine sollte das andere nicht ersetzen. Ein kritisches Kriterium mit 60 von 100 Punkten zu bewerten, ist der häufigste Designfehler, weil ein Agent es verfehlen und trotzdem 40 erreichen kann. Wenn ein Verhalten die Interaktion ungültig machen soll, setzen Sie eine Schranke, statt es zu gewichten.

Wie lege ich Gewichte fest, wenn ich noch keine Daten habe?

Ordnen Sie die Kriterien gemeinsam mit Ihren Reviewern nach Wirkung auf den Kunden und Risiko, fassen Sie sie in drei Stufen zusammen (hoch, mittel und niedrig) und vergeben Sie grobe Punktwerte an die Stufen statt an einzelne Kriterien. Nehmen Sie sich dann fest vor, nach einem Quartal neu zu prüfen, wenn Sie genug bewertete Konversationen haben, um Fehlerquoten mit erneut geöffneten Tickets zu vergleichen. Grob und überprüfbar schlägt präzise und erfunden.

Wie oft sollten sich die Gewichte einer QA-Scorecard ändern?

Höchstens einmal im Quartal, gekoppelt an einen Kalibrierungszyklus. Gewichte, die sich öfter ändern, sind kein Standard mehr, sondern ein bewegliches Ziel, und Agents wissen nicht mehr, wie gute Arbeit aussieht. Versionieren Sie die Scorecard immer, wenn sich Gewichte ändern, und berechnen Sie historische Scores nie mit neuen Gewichten neu.

Verwandte Begriffe

Ihre eigenen Gewichte hinter jeder bewerteten Konversation

Bringen Sie die Scorecard mit, die Sie heute nutzen, und einen Monat an Konversationen, die Sie bereits geprüft haben. Wir zeigen Ihnen, was Ihre aktuellen Gewichte tatsächlich belohnen und was sich ändert, wenn jede Konversation auf dieselbe Weise bewertet wird.

Demo buchen Agentic Auto QA entdecken

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart