Zum Inhalt springen

Best Practice

Qualitätssicherung im Callcenter-Outsourcing (BPO)

Qualitätssicherung im Callcenter-Outsourcing: was eine 2-%-Stichprobe des Dienstleisters übersieht und wie eine gemeinsame Scorecard die QA-Tabelle ersetzt.

· 13 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Bei der Qualitätssicherung im Callcenter-Outsourcing reicht eine 2-%-Stichprobe nicht: Der Dienstleister liest 2 % bis 3 % seiner eigenen Tickets, bewertet seine eigene Arbeit und lässt 97 % bis 98 % ungelesen. Wer einen BPO steuern will, braucht die Bewertung jeder Konversation und eine Scorecard, die Auftraggeber und Dienstleister gleichermaßen prüfen können.

Teil 1 von 4 der Serie zur Steuerung von ausgelagertem Support. Geschrieben für Verantwortliche in Support, CX und Dienstleistersteuerung.

Kurz gesagt

  • Kleine Stichproben übersehen die seltenen Fehler, die Kunden kosten.
  • Volle Abdeckung ist heute Standard. Der Unterschied liegt in nachvollziehbaren, anfechtbaren Scores.
  • Mehrere Dienstleister brauchen eine gemeinsame Scorecard, um sie zu vergleichen oder ein SLA durchzusetzen.
  • Eine gemeinsame Scorecard hilft auch dem BPO, seine Qualität zu belegen.

Direkt zu

  1. Was es heute bedeutet
  2. Was eine Stichprobe übersieht
  3. Abdeckung ist nur der Anfang
  4. Mehrere Dienstleister, eine Basis
  5. Warum auch BPOs profitieren
  6. So gelingt die Umstellung
  7. Die Frage für das nächste Review

Was Qualitätssicherung im Callcenter-Outsourcing heute bedeutet

Wenn ein wachsendes Softwareunternehmen den First-Level-Support an einen Business-Process-Outsourcing-Partner (BPO) übergibt, sind die Stückkosten überzeugend. Der Support ist 24 Stunden am Tag erreichbar. Die Teamgröße skaliert ohne eigene Recruiting-Pipeline. Die Kosten pro Kontakt sinken. Nichts davon ist umstritten, und die Unternehmen, die so vorgehen, machen keinen Fehler.

Was oft nicht mit der Teamgröße mitwächst, ist die Steuerung. Die Support-Konversationen wandern ins Ausland, aber das Messsystem, das Ihnen sagt, ob diese Konversationen gut sind, bleibt meist genau so, wie es war, als das Team noch in Ihrem Gebäude saß: eine Stichprobe von Tickets, gelesen von einer Person, bewertet auf einem Formular.

Der Unterschied: Die Person, die sie liest, arbeitet jetzt für den Dienstleister, der gemessen wird.

Das Personal auszulagern ist eine solide kaufmännische Entscheidung. Die Scorecard auszulagern ist eine andere Entscheidung, und die meisten Unternehmen treffen sie aus Versehen.

In einem typischen Setup beschäftigt der BPO eigene Qualitätsanalysten. Diese ziehen eine Stichprobe aus den Tickets der Woche, lesen sie anhand eines Bewertungsschemas, vergeben Scores und fassen das Ergebnis in einem Monatsbericht für den Auftraggeber zusammen. Der Bericht kommt als Excel-Tabelle. Meist steht darin, dass die Qualität hoch ist.

Nicht, dass die Zahl unehrlich wäre. Aber niemand auf Auftraggeberseite kann sie prüfen, denn die Tickets dahinter hat die bewertete Partei selbst ausgewählt, und die Begründung für jeden Score wurde nirgends festgehalten, wo der Auftraggeber sie sehen kann.

Wie viel übersieht eine 2-%-Stichprobe tatsächlich?

Nehmen wir einen Supportbetrieb im Mittelstand, der 15.000 Konversationen pro Monat über einen Outsourcing-Partner abwickelt. Bei einer 3-%-Stichprobe liest das Qualitätsprogramm 450 davon. Die übrigen 14.550 bewertet niemand.

  • 450 Konversationen pro Monat gelesen, bei einer 3-%-Stichprobe von 15.000
  • 14.550 Konversationen bei gleichem Volumen, die niemand bewertet
  • 1 von 50: eine Fehlerquote, die eine Stichprobe von 50 Tickets meist komplett übersieht

Das Problem ist nicht nur die Größe der Lücke, sondern welche Fehler darin stecken. Stichproben erkennen gut, was ständig passiert, und schlecht, was gelegentlich passiert. Die Fehler, die Sie echtes Geld kosten, sind fast immer gelegentlich.

Ein Tonproblem, das in einer von drei Konversationen auftaucht, zeigt sich in jeder Stichprobe. Eine falsche Migrationsanleitung, die alle zwei Wochen einmal an den Kunden geht, der zufällig fragt, zeigt sich nicht. Die Statistik kleiner Stichproben (auf Englisch) ist hier gnadenlos, und keine noch so große Sorgfalt der Analysten ändert das.

Das zweite Stichprobenproblem, über das niemand spricht

Eine Stichprobe ist nur dann unverzerrt, wenn sie zufällig gezogen wird. In der Praxis bleibt die Ticketauswahl oft dem Analysten überlassen oder folgt der Bequemlichkeit: aktuelle Tickets, kurze Tickets, Tickets aus Queues, die der Analyst gut kennt. Jede dieser Gewohnheiten macht den Score weniger repräsentativ, als die Stichprobengröße allein vermuten lässt. Wie Konversationen für die Prüfung ausgewählt werden (auf Englisch), bestimmt still und leise, was der Score bedeutet.

Stichproben-QA durch den Dienstleister im Vergleich zur Bewertung aller Konversationen:

Stichproben-QA, bewertet vom DienstleisterQA mit voller Abdeckung auf einer gemeinsamen Scorecard
Bewertete Konversationen2 % bis 3 %, ausgewählt von der gemessenen ParteiJede Konversation, ausgewählt von niemandem
Wem das Bewertungsschema gehörtJeder Dienstleister pflegt sein eigenesEin Schema, identisch auf jeden Partner angewendet
Verzögerung im ReportingMonatlich oder zweiwöchentlich, im NachhineinLaufend, für beide Seiten gleichzeitig sichtbar
Seltene FehlerartenStatistisch unsichtbarAls Muster sichtbar, sobald sie wiederkehren
Einen Score anfechtenStreit um eine TabellenzelleDie Konversation öffnen und die Belege lesen
Zwei Dienstleister vergleichenNicht möglich, verschiedene SchemataDirekt, gleiches Modell und gleiche Kriterien

Warum volle Abdeckung der Ausgangspunkt ist, nicht die Antwort

Es wäre bequem, die Argumentation hier zu beenden: Bewerten Sie jede Konversation statt 3 % davon, und das Steuerungsproblem verschwindet. Vor einigen Jahren war das eine vertretbare Aussage. Heute ist es keine mehr.

100 % der Konversationen zu bewerten (auf Englisch) ist alltäglich geworden. Die meisten ernsthaften Plattformen für automatisierte QA tun es, und wer Anbieter vergleicht, hört von allen dieselbe Zahl. Abdeckung ist die Voraussetzung, um einen ausgelagerten Betrieb zu steuern. Sie ist nicht das, was die Steuerung vertrauenswürdig macht.

Sobald jeder Dienstleister behauptet, jede Konversation zu lesen, bleibt nur eine Frage: Können Sie das Lesen überprüfen?

Darüber entscheiden zwei Dinge.

Lässt sich der Score auf die Belege zurückführen?

Ein Qualitäts-Score ist eine Behauptung, bis jemand ihn öffnen und die konkrete Stelle in der Konversation sehen kann, die ihn ausgelöst hat. Wird ein BPO-Agent für einen Compliance-Verstoß abgewertet, sollte der Account Manager das Kriterium anklicken und direkt bei dem Satz landen, der es ausgelöst hat. Ohne das hat der Auftraggeber nur eine nicht prüfbare Zahl gegen eine andere, schnellere getauscht. Nachvollziehbare Scores (auf Englisch) machen aus einer Pattsituation ein Steuerungsgespräch.

Ist der Bewertende unabhängig von der bewerteten Arbeit?

Das ist der strukturelle Punkt. Der Dienstleister sollte nicht der alleinige Urheber seines eigenen Qualitäts-Scores sein, aus demselben Grund, aus dem Wirtschaftsprüfer nicht für das Unternehmen arbeiten, das sie prüfen.

Wie das bei den Agents ankommt

Volle Abdeckung lässt sich leicht schlecht präsentieren. Hören ausgelagerte Agents, dass jetzt jede Konversation gelesen wird, denken sie verständlicherweise an Überwachung, und QA-Programme, die nach Monitoring klingen, stoßen auf Widerstand, den kein Dashboard auflöst. Die ehrliche Darstellung ist auch die zutreffende: Abdeckung beseitigt die Auswahlverzerrung. Bei einer 3-%-Stichprobe blieb die meiste gute Arbeit unsichtbar, und ein einziges unglückliches Ticket konnte ein Quartal prägen. Programme, denen Agents vertrauen (auf Englisch), führen genau dieses Argument zuerst an.

Was eine gemeinsame Scorecard bei mehreren Dienstleistern ändert

Nur wenige Unternehmen bleiben bei einem Partner. Ein reifer Betrieb hat vielleicht einen Nachtdienstleister in einer Region, einen zweisprachigen Partner in einer anderen und ein internes Team für komplexe Enterprise-Eskalationen. Jeder bringt sein eigenes Qualitätssystem, sein eigenes Bewertungsschema und seine eigenen Analysten mit.

Das Ergebnis sind drei Qualitäts-Scores, die sich nicht vergleichen lassen. Dienstleister A meldet 94 %, Dienstleister B meldet 91 %, und niemand weiß, ob der Abstand echt ist oder ein Artefakt zweier unterschiedlich gewichteter Schemata. Das interne Team wird zugleich in einem vierten System gemessen, sodass niemand die einzige kaufmännisch relevante Frage beantworten kann: Wer ist tatsächlich besser, und zu welchen Kosten?

Alle Partner auf eine Scorecard zu bringen, ändert vier Dinge auf einmal.

  • Vergleich wird möglich. Dieselben Kriterien, gleich gewichtet, vom selben Modell auf jede Konversation jedes Dienstleisters angewendet. Wie Sie die Kriterien gewichten, wird zu einer Entscheidung, die Sie einmal und bewusst treffen, statt dass jeder Dienstleister sie für Sie trifft.
  • Die Durchsetzung von SLAs bekommt eine Beweisgrundlage. Ein vertragliches Qualitätsziel ist nur durchsetzbar, wenn beide Parteien die Messung akzeptieren. Ein nachvollziehbarer Score bei voller Abdeckung hält in einem kaufmännischen Review stand, ein selbst gemeldetes Stichprobenergebnis nicht.
  • Coaching wird konkret. Statt der pauschalen Anweisung, die Lösungszeit zu verbessern, sehen Sie, dass eine bestimmte Gruppe ein bestimmtes Kriterium bei einem bestimmten Tickettyp verfehlt. Genau diesen Detailgrad braucht Coaching (auf Englisch).
  • Routing-Entscheidungen bekommen Belege. Welcher Partner das nächste Volumenplus übernehmen soll, ist dann keine Einkaufsverhandlung mehr, sondern eine Datenfrage.

Sehen Sie Ihren eigenen Dienstleister-Mix auf einer Scorecard. Bringen Sie die Konversationen des letzten Monats von jedem Partner mit. Wir bewerten sie nach einem einzigen Bewertungsschema und zeigen Ihnen, wo sich die Dienstleister wirklich unterscheiden. Demo buchen

Warum das auch für den BPO eine gute Nachricht ist

Man schreibt leicht über ausgelagerte Qualität, als wäre der Dienstleister das Problem. Diese Sicht ist beliebt, sie ist konfrontativ, und sie ist größtenteils falsch. BPOs wollen keine schlechten Konversationen liefern. Ihr gesamtes Geschäftsmodell beruht darauf, Service zu liefern, den der Auftraggeber selbst kaum so günstig liefern könnte, und ein Auftraggeber, der die Qualität nicht sieht, verhandelt nur noch über den Preis.

Ein Dienstleister, der seine Qualität nicht belegen kann, kann nur über den Preis konkurrieren. Belege ermöglichen es einem guten BPO, für mehr als das billigste Angebot zu argumentieren.

Die monatliche, selbst bewertete Tabelle ist auch für den Outsourcing-Partner ein schlechtes Geschäft. Sie erzeugt Misstrauen, auf das er keine Antwort hat, sie macht jedes Qualitätsgespräch zu einer Methodendebatte, und sie gibt dem Dienstleister keinen Weg zu zeigen, dass sein Team besser ist als ein günstigerer Wettbewerber. Eine gemeinsame, nachvollziehbare Scorecard ersetzt all das durch eine Aufzeichnung, die beide Seiten gleich lesen.

Das ist keine Theorie. EverHelp, ein Outsourcing-Dienstleister, hat seinen eigenen Betrieb auf automatisierte QA umgestellt, die QA-Bewertungen um 270 % gesteigert, während sein Internal Quality Score stabil blieb, und die Zeit, die seine Teamleitungen für die Coaching-Vorbereitung aufwenden, um 75 % gesenkt. Hier nutzt ein Dienstleister die Bewertung als kaufmännischen Vorteil, statt sich einem Audit zu unterwerfen. Die vollständige EverHelp-Story (auf Englisch) lohnt sich, wenn Sie in dieser Beziehung auf der Dienstleisterseite stehen.

Wie gute Zusammenarbeit von beiden Seiten aussieht

  • Der Auftraggeber sieht die Qualität laufend statt monatlich und kann jeden Score erklären, den er hinterfragt.
  • Der Dienstleister untermauert seine Leistung mit Belegen statt mit Behauptungen und kann auf konkretes Coaching verweisen, das er daraufhin durchgeführt hat.
  • Beide Parteien diskutieren über dieselben Konversationen statt darüber, wessen Bewertungsschema fairer ist.
  • Die Kalibrierung zwischen Reviewern des Auftraggebers und des Dienstleisters wird zu einem festen Termin statt zu einer Quelle von Reibung. Kalibrierungssitzungen durchzuführen (auf Englisch), hält beide Seiten bei der Bedeutung der Kriterien auf einer Linie.

So bringen Sie ein ausgelagertes Programm auf eine Scorecard

Das muss nicht mit einer Neuverhandlung des Vertrags beginnen. In der Praxis ist die Reihenfolge, die funktioniert, bewusst unbedrohlich.

  1. Einigen Sie sich auf das Bewertungsschema, bevor Sie etwas messen. Schreiben Sie die Kriterien gemeinsam mit dem Dienstleister. Ein aufgezwungenes Schema erzeugt Streit, ein gemeinsam verfasstes Schema eine Basis. Was in ein Bewertungsschema gehört, ist eine schwierigere Frage, als sie aussieht.
  2. Starten Sie im Schattenbetrieb. Bewerten Sie jede Konversation, ohne an das Ergebnis Konsequenzen zu knüpfen, und vergleichen Sie es mit den bisherigen Stichproben-Scores des Dienstleisters. Shadow Scoring (auf Englisch) ist der Weg, auf dem beide Seiten Vertrauen in die Bewertung aufbauen, bevor etwas davon abhängt.
  3. Validieren Sie die Bewertung an Ihren eigenen Konversationen. Nehmen Sie Tickets, die Ihr Team bereits von Hand bewertet hat, lassen Sie sie durchlaufen und prüfen Sie, wo beide voneinander abweichen und warum. KI-Bewertungen zu validieren (auf Englisch) an einem bekannten Set ist der Schritt, den die meisten Programme auslassen und später bereuen.
  4. Veröffentlichen Sie den Weg für Einsprüche vom ersten Tag an. Agents und Teamleitungen brauchen einen festgelegten Weg, einen Score anzufechten und die Prüfung nachzuverfolgen. Ein funktionierender Einspruchsprozess (auf Englisch) unterscheidet ein Steuerungswerkzeug von einem Überwachungswerkzeug.
  5. Knüpfen Sie die Bewertung erst dann an das kaufmännische Review. Sobald beide Seiten der Messung vertrauen, kann sie SLA-Gewicht tragen.

Ist Ihre BPO-Steuerung prüfbar? Neun Fragen

Haken Sie jede Aussage ab, die Sie heute mit Belegen stützen können, nicht mit einer Zusicherung des Dienstleisters.

  • Ich weiß, welcher Anteil meiner ausgelagerten Konversationen letzten Monat bewertet wurde.
  • Ich weiß, wer die bewerteten Konversationen ausgewählt hat.
  • Jeder Dienstleister und jedes interne Team wird nach demselben Bewertungsschema bewertet, gleich gewichtet.
  • Ich kann jeden einzelnen Score öffnen und die Belege in der Konversation sehen, die ihn ausgelöst haben.
  • Ich könnte einen bestimmten Score in einem Dienstleister-Review anfechten und ihn anhand der Aufzeichnung klären.
  • Ich weiß, welche Fehlerkategorie mich über alle Dienstleister hinweg am meisten kostet.
  • Agents beim Dienstleister haben einen festgelegten Weg, einen Score anzufechten.
  • Meine Qualitätsmessung ist unabhängig von der gemessenen Partei.
  • Ich könnte heute sagen, welcher meiner Partner die beste Qualität pro Kosteneinheit liefert.

Sechs oder weniger Haken bedeuten, dass Ihr Qualitätsreporting eine Behauptung ist und keine Aufzeichnung. Das ist der normale Ausgangspunkt, und er lässt sich beheben, ohne den Dienstleister zu wechseln.

Die Frage für das nächste Dienstleister-Review

Wie viele der Kunden, die Sie im letzten Quartal verloren haben, hatten Konversationen mit einem Outsourcing-Partner, und was ist in diesen Konversationen passiert?

Die meisten Unternehmen können das nicht beantworten, weil diese Konversationen zu den 97 % gehörten, die niemand gelesen hat. Die Antwort ist nicht, den Support wieder ins Haus zu holen. Sie besteht darin, eine selbst gemeldete Stichprobe nicht länger als Steuerung zu akzeptieren, wenn Volumen, Vertragswert und Kundenbeziehungen eine echte Aufzeichnung verdienen.

UiPath automatisiert heute 100 % seiner QA mit Kaizo, misst einen ROI von 200 % gegenüber der eigenen Ausgangsbasis und hat seinen Qualitäts-Score um 8 Punkte gesteigert, mit weiteren Verbesserungen von Quartal zu Quartal. Auf dieser Größenordnung ist Qualitätsmessung keine operative Aufgabe mehr, sondern eine Grundlage dafür, wie das Unternehmen geführt wird.

Die Arbeit auszulagern war die richtige Entscheidung. Den Standard zu halten ist der Teil, den Sie nicht delegieren.

Häufig gestellte Fragen

Was ist Qualitätssicherung im BPO?

Qualitätssicherung im BPO ist die Bewertung der Kundenkonversationen, die ein Outsourcing-Partner führt, anhand festgelegter Kriterien. Traditionell übernehmen das Qualitätsanalysten des BPO, die eine Stichprobe von 2 % bis 3 % der Tickets manuell prüfen und dem Auftraggeber monatlich Scores melden. Moderne Programme bewerten jede Konversation automatisch nach einem einzigen Bewertungsschema, das Auftraggeber und Dienstleister teilen, sodass beide Parteien dieselbe Aufzeichnung lesen.

Welchen Anteil der Tickets prüft ein typisches BPO-Qualitätsprogramm?

Üblich sind bei manuellen Stichproben 2 % bis 3 % des gesamten Ticketvolumens, sodass 97 % bis 98 % der Konversationen unbewertet bleiben. Bei 15.000 Konversationen im Monat bedeutet eine 3-%-Stichprobe, dass 450 Konversationen gelesen werden und 14.550 nicht. Wichtiger als die Größe der Stichprobe ist, dass Fehler, die gelegentlich statt ständig auftreten, darin kaum vorkommen.

Warum ist Stichproben-QA ein Problem, wenn der Support ausgelagert ist?

Zwei Gründe verstärken sich. Erstens kann eine kleine Stichprobe seltene Fehlerarten nicht zuverlässig erkennen, und seltene Fehler sind meist die teuren. Zweitens hat der Auftraggeber keine unabhängige Möglichkeit, das Ergebnis zu prüfen, wenn der Dienstleister die Stichprobe auswählt und bewertet. Der Score mag stimmen, aber er ist eine Behauptung statt einer Aufzeichnung, und damit kaufmännisch schwer verwertbar.

Reicht es, 100 % der Konversationen zu bewerten, um die BPO-Steuerung zu verbessern?

Nein. Volle Abdeckung ist bei ernsthaften Plattformen für automatisierte QA inzwischen Standard und unterscheidet einen Ansatz daher nicht mehr vom anderen. Entscheidend ist, ob sich jeder Score auf die konkreten Belege in der Konversation zurückführen lässt und ob die bewertende Partei unabhängig von der bewerteten Arbeit ist. Abdeckung ist die Voraussetzung, Nachvollziehbarkeit und Unabhängigkeit machen die Messung vertrauenswürdig.

Wie vergleicht man zwei BPO-Dienstleister fair?

Bringen Sie beide auf dasselbe Bewertungsschema, identisch gewichtet und vom selben Bewertungsmodell auf jede Konversation jedes Dienstleisters angewendet. Solange jeder Partner sein eigenes Qualitätssystem pflegt, sind die gemeldeten Scores nicht vergleichbar, denn der Unterschied zwischen 94 % und 91 % kann allein am Aufbau der Schemata liegen statt an den Konversationen.

Funktioniert dieser Ansatz für den BPO ebenso wie für den Auftraggeber?

Ja, und für einen leistungsfähigen Dienstleister ist er meist das bessere Geschäft. Ohne gemeinsame Belege kann ein BPO nur über den Preis konkurrieren, weil er nicht zeigen kann, dass sein Service besser ist als ein günstigeres Angebot. Eine nachvollziehbare Scorecard lässt einen Dienstleister Qualität belegen, gezielt coachen und seine Position im kaufmännischen Review verteidigen. EverHelp, ein Outsourcing-Dienstleister, steigerte die QA-Bewertungen mit automatisierter QA um 270 % und senkte die Coaching-Vorbereitungszeit um 75 %.

Müssen wir den BPO-Dienstleister wechseln, um das zu beheben?

In der Regel nicht. Die Messebene liegt über dem bestehenden Betrieb, angebunden über den Helpdesk, statt die Tools des Dienstleisters zu ersetzen. Dieselben Partner erledigen also dieselbe Arbeit, und beide Seiten gewinnen eine gemeinsame Aufzeichnung. Die meisten Programme starten im Schattenbetrieb, bewerten Konversationen ohne kaufmännische Folgen und knüpfen das Ergebnis erst an SLA-Reviews, wenn beide Parteien der Bewertung vertrauen.

Mit welchen Helpdesks arbeitet Kaizo bei ausgelagerten Betrieben?

Kaizo ist nativ in Zendesk und Salesforce Service Cloud integriert. Weil die Integration nativ ist und kein generischer Connector, liegt die Bewertungsebene direkt über den Konversationen, die Ihre Dienstleister ohnehin bearbeiten. Deshalb dauert das Onboarding Tage statt Monate.

Weiterlesen

Alle Dienstleister auf dieselbe Scorecard

Bringen Sie einen Monat Konversationen von jedem Ihrer Outsourcing-Partner mit. Wir bewerten sie alle nach einem einzigen Bewertungsschema und zeigen Ihnen, mit den Belegen dazu, wo sich die Dienstleister wirklich unterscheiden.

Demo buchen Kaizo für BPOs

Bereit für den EU AI Act . SOC 2 und ISO 27001 zertifiziert . Native Integrationen für Zendesk und Salesforce Service Cloud

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart