Zum Inhalt springen

Best Practice

Zendesk AI Agents: Qualitätssicherung für Ihren Bot

Qualitätssicherung für Zendesk AI Agents: was Zendesk selbst meldet, welche Bot-Konversationen Sie zuerst prüfen, eine Muster-Scorecard und Korrekturen.

· 12 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Qualitätssicherung für Zendesk-KI-Agenten bedeutet, die Konversationen, die Ihr Zendesk-KI-Agent führt, zu lesen und anhand eines schriftlichen Standards zu bewerten. So wissen Sie, ob seine Antworten richtig waren, und nicht nur, ob der Kunde gegangen ist. Sie brauchen dafür eine Scorecard für den Bot, eine Möglichkeit, jede Konversation des KI-Agenten zu bewerten, und einen Ablauf, der jeden Fehler in eine Korrektur in Zendesk übersetzt.

Kurz gesagt

  • Eine automatisierte Lösung in Zendesk sagt Ihnen, dass der Kunde keinen Menschen erreicht hat, nicht, dass die Antwort richtig war.
  • Beginnen Sie mit den Konversationen des KI-Agenten, bei denen eine falsche Antwort Geld kostet: Erstattungen, Preise, Ausnahmen von Richtlinien und Kontoänderungen.
  • Bewerten Sie den Bot nach Richtigkeit, Quellenbezug, Eskalation und Übergabe, nicht nur nach Begrüßung und Empathie.
  • Jeder Fehler sollte mit einer konkreten Änderung enden: einem Hilfecenter-Artikel, einer Prozedur, einer Eskalationsregel oder einem gesperrten Thema.
  • Bewerten Sie nach jeder Änderung neu, denn die Korrektur einer Antwort kann eine andere verschlechtern.

Dieser Leitfaden ist die Zendesk-Version unseres allgemeinen Leitfadens zur Qualitätssicherung von KI-Agenten. Wenn Sie das Tool selbst suchen, zeigt die Seite zum Zendesk-QA-Tool, wie Kaizo Zendesk-Konversationen bewertet, auch die, die Zendesks KI-Agenten führen.

Was zeigt Ihnen Zendesk über die Qualität des KI-Agenten?

Zendesk zeigt Ihnen Volumen und Ergebnisse: wie viele Konversationen der KI-Agent gelöst hat, welche nicht, und die Transkripte zu beiden. Für sich genommen sagt Zendesk Ihnen nicht, ob jede Antwort richtig war oder Ihrer Richtlinie entsprach. Dafür brauchen Sie eine Prüfung, entweder in Zendesk QA oder in einem separaten QA-Tool.

In der Praxis hat ein Zendesk-Admin heute drei Stellen, an denen er nachsehen kann:

WoWas Sie bekommenWas Sie nicht erfahren
Insights und Transkripte des KI-AgentenAutomatisierte Lösungen und ungelöste Konversationen, mit TranskriptenOb eine gelöste Konversation eine richtige Antwort war
Anzahl automatisierter LösungenWie viele Anfragen der KI-Agent ohne Eskalation an einen Menschen gelöst hatOb der Kunde wiederkam oder aufgegeben hat
Zendesk QA (kostenpflichtiges Add-on)Prüfungen und automatische Bewertung von Konversationen, auch von Bots, die Sie als prüfbar markierenOb die Antwort Ihrer eigenen Richtlinie folgte, es sei denn, Ihre Scorecard prüft das

Zwei Details sind wichtig. Laut Zendesks Help Center zeigt die Transkriptansicht, die Sie über den Tab Insights in den Einstellungen des KI-Agenten öffnen, die ersten 100 Nachrichten zwischen einem KI-Agenten und einem Nutzer, und nur Konversationen, die länger als 72 Stunden inaktiv waren, erscheinen unter den automatisierten Lösungen. Derselbe Artikel kennzeichnet diese Ansicht als Legacy und sagt, dass sie nach dem 10. Dezember 2026 nicht mehr verfügbar ist. Klären Sie also, wo Ihr Team nach diesem Datum Transkripte liest.

Warum ist eine automatisierte Lösung kein Qualitätsscore?

Zendesk misst die Nutzung des KI-Agenten in automatisierten Lösungen und berechnet nur Kundenanfragen, die ein KI-Agent erfolgreich gelöst hat, ohne Eskalation an einen menschlichen Agenten. Diese Definition sagt Ihnen, dass die Konversation ohne einen Menschen endete. Sie kann Ihnen nicht sagen, ob die Antwort richtig, vollständig oder zulässig war.

Die Lücke zeigt sich auf drei Arten:

  1. Der Kunde hat aufgegeben. Eine falsche oder allgemeine Antwort, dann Stille. Keine Eskalation, also zählt die Konversation als gelöst.
  2. Die Antwort war fast richtig. Der Bot nennt die richtige Richtlinie, lässt aber eine Bedingung weg, oder das richtige Produkt, aber den alten Preis. Jede Systemkennzahl bleibt grün.
  3. Der Bot hat etwas versprochen, das Sie nicht anbieten. Eine Erstattung außerhalb der Frist, eine erlassene Gebühr, ein Liefertermin, den niemand halten kann. Der Kunde ist zufrieden, bis das Versprechen platzt.

Supportteams beschreiben dasselbe Muster öffentlich. In einem Thread auf r/Zendesk schrieb ein Team, das Tickets prüfte, die „started and finished with the AI Agent (no human touch)“, es habe „high value customers getting iffy or bad answers and then abandoning the chat“ gesehen, also wertvolle Kunden, die zweifelhafte oder schlechte Antworten bekamen und den Chat dann abbrachen. Das ist die Aussage eines einzelnen Teams, aber genau der Fall, den die Anzahl automatisierter Lösungen nicht zeigen kann. Die längere Liste dieser stillen Fehler behandeln wir im Beitrag über stille Fehler von KI-Agenten.

Wie richten Sie die Qualitätssicherung für Zendesk-KI-Agenten ein?

Richten Sie die Qualitätssicherung für Zendesk-KI-Agenten in sechs Schritten ein: Wählen Sie zuerst die riskanten Themen, schreiben Sie eine Scorecard für den Bot, bewerten Sie jede Konversation des KI-Agenten, prüfen Sie die Übergabe an Ihre menschlichen Agents, führen Sie jeden Fehler auf eine Korrektur in Zendesk zurück und bewerten Sie nach jeder Änderung neu. Die ersten beiden Schritte erledigen Sie einmal, der Rest ist eine wöchentliche Routine.

Schritt 1: Entscheiden Sie, welche Konversationen des KI-Agenten am wichtigsten sind

Nicht jede Bot-Konversation trägt dasselbe Risiko. Eine falsche Antwort zu Öffnungszeiten ist ärgerlich. Eine falsche Antwort zu einer Erstattung, einer Kündigungsgebühr oder einer Datenanfrage kostet Geld oder schafft ein Compliance-Problem. Listen Sie die Themen auf, bei denen eine falsche Antwort schadet, und sorgen Sie dafür, dass Ihre Prüfung diese zuerst abdeckt:

  • Erstattungen, Gutschriften, Entschädigungen und erlassene Gebühren
  • Preise, Tarife und alles, worin eine Zahl vorkommt
  • Ausnahmen von Richtlinien und Anspruchsregeln
  • Kontoänderungen, Kündigungen und personenbezogene Daten
  • Beschwerden und Abwanderungsdrohungen

Markieren Sie außerdem Konversationen mit umsatzstarken Kunden und jede Konversation, bei der derselbe Kunde innerhalb weniger Tage mit demselben Thema zurückkommt.

Schritt 2: Schreiben Sie eine Scorecard für den KI-Agenten

Ihre Scorecard für menschliche Agents ist ein Ausgangspunkt, nicht die Lösung. Begrüßung und Rechtschreibung sind bei einem Bot selten das Problem. Er scheitert an Richtigkeit, am Bezug auf Ihre eigenen Inhalte und daran, zu wissen, wann er aufhören muss. Beschränken Sie sich auf 6 bis 8 Kriterien, jedes davon etwas, das ein Reviewer am Transkript prüfen kann. Der nächste Abschnitt enthält ein ausgearbeitetes Beispiel, und unser Leitfaden zur Scorecard für KI-Agenten erklärt, welche Kriterien für menschliche Agents Sie streichen sollten.

Schritt 3: Bewerten Sie jede Konversation des KI-Agenten, nicht nur eine Stichprobe

Ein Bot wiederholt denselben Fehler meist in allen Konversationen zum selben Thema, weil er jedes Mal aus denselben Inhalten antwortet. Eine Stichprobe von 2 % übersieht ihn womöglich ganz oder findet ihn einmal und hält ihn für Rauschen. Wenn Sie jede Konversation des KI-Agenten bewerten, wird das Muster sichtbar: ein Artikel, eine Prozedur oder eine Regel hinter Dutzenden schlechter Antworten.

Mit Kaizo verbinden Sie Zendesk, wählen eine Scorecard und schalten AutoPilot ein. AutoPilot bewertet jede Konversation, sobald sie gelöst ist, anhand Ihrer Kriterien und hängt einen Kommentar an das Ticket, der den Score erklärt. Sie können festlegen, welche Queues, Kanäle oder Teams bewertet werden.

Schritt 4: Prüfen Sie die Übergabe an Ihre menschlichen Agents

Wenn der KI-Agent eskaliert, kann zweierlei schiefgehen: Er eskaliert zu spät, wenn der Kunde schon frustriert ist, oder er übergibt ohne Kontext, sodass der Kunde alles wiederholen muss. Bewerten Sie beides auf der Seite des Bots (hat er beim richtigen Auslöser eskaliert, hat er eine Zusammenfassung übergeben) und auf der Seite des Agents (hat der Agent sie gelesen). Unser Leitfaden zur Bewertung der Übergabe behandelt beide Richtungen.

Schritt 5: Führen Sie jeden Fehler auf eine Korrektur in Zendesk zurück

Ein QA-Score, der den Bot nicht verändert, ist nur ein Bericht. Entscheiden Sie bei jedem nicht erfüllten Kriterium, was den Fehler verursacht hat und wo die Korrektur hingehört:

Was schiefgingWahrscheinliche UrsacheWo Sie es korrigieren
Falsche oder veraltete FaktenDer Quellartikel ist falsch, alt oder fehltDen Hilfecenter-Artikel, aus dem der Bot antwortet, aktualisieren oder ergänzen
Richtige Richtlinie, fehlende BedingungDer Artikel versteckt die Bedingung, oder zwei Artikel widersprechen sichDen Artikel so umschreiben, dass die Bedingung in der Antwort selbst steht
Etwas Unzulässiges versprochenNichts hält den Bot bei diesem Thema aufDas Thema an einen Menschen geben oder den Bot daran hindern, es zu beantworten
Zu spät eskaliertDie Bedingungen für die Übergabe sind zu engSie erweitern: Thema, Anzeichen von Frustration, dieselbe Frage zweimal gestellt
Übergabe ohne KontextKeine Zusammenfassung an den AgentDie Übergabe so ändern, dass der Agent eine Zusammenfassung der Konversation erhält

Gruppieren Sie Fehler nach Ursache, bevor Sie etwas korrigieren. Zehn schlechte Antworten, die auf einen Artikel zurückgehen, brauchen eine Korrektur, nicht zehn.

Schritt 6: Bewerten Sie nach jeder Änderung neu

Inhaltsänderungen haben Nebenwirkungen. Ein umgeschriebener Erstattungsartikel kann die Antworten zu Erstattungen korrigieren und die verwandten Antworten zu Kündigungen verschlechtern. Sehen Sie sich nach jeder Änderung die Scores für das betroffene Thema in der folgenden Woche an und vergleichen Sie sie mit der Woche davor. Wenn Sie jede Konversation bewerten, liegt dieser Vergleich bereits vor.

Wie sieht eine Scorecard für einen Zendesk-KI-Agenten aus?

Eine Scorecard für einen Zendesk-KI-Agenten prüft, ob die Antwort des Bots richtig war, sich auf Ihre eigenen Inhalte stützte, von der Richtlinie gedeckt war und im richtigen Moment übergeben wurde. Sie braucht weniger Soft-Skill-Kriterien als eine Scorecard für Menschen und mehr Kriterien zu Fakten und Eskalation. Hier ein ausgearbeitetes Beispiel für ein Supportteam im Handel.

KriteriumFrage, die der Reviewer beantwortetTyp
Richtige AntwortWar jede Tatsache in der Antwort für den Fall dieses Kunden zutreffend?Bestanden / nicht bestanden, Auto-Fail bei Geldthemen
Auf unsere Inhalte gestütztLässt sich jede Aussage auf einen Hilfecenter-Artikel oder eine Prozedur zurückführen?Bestanden / nicht bestanden
Richtlinie eingehaltenBlieb der Bot innerhalb der Regeln zu Erstattungen, Gebühren und Anspruch?Bestanden / nicht bestanden, Auto-Fail
Anliegen verstandenHat er die Frage beantwortet, die der Kunde gestellt hat, und nicht eine ähnliche?1 bis 3
Eskaliert, wenn nötigHat er beim richtigen Auslöser übergeben, bevor der Kunde sich wiederholte?Bestanden / nicht bestanden
Kontext bei der ÜbergabeHat der menschliche Agent eine Zusammenfassung bekommen, mit der er arbeiten konnte?Bestanden / nicht bestanden
TonfallPasste der Ton zu einem verärgerten Kunden?1 bis 3

Und so sollte ein Kommentar aussehen, den ein Reviewer oder AutoPilot am Ticket hinterlässt:

Richtlinie eingehalten: nicht bestanden. Der Kunde bat an Tag 34 um eine Erstattung. Der KI-Agent bestätigte die Erstattung, die Rückgaberichtlinie erlaubt aber 30 Tage. Quelle: Hilfecenter-Artikel „Rückgaben und Erstattungen“, der die 30-Tage-Frist erst im letzten Absatz nennt. Vorgeschlagene Korrektur: die Frist in den ersten Satz des Artikels verschieben und eine Eskalationsregel für Erstattungsanfragen nach Tag 30 hinzufügen.

Ein solcher Kommentar macht den Score nützlich: Er nennt das Kriterium, den Beleg im Transkript, die Fehlerquelle und die Korrektur. Bevor Sie einem automatischen Score vertrauen, testen Sie ihn an Konversationen, die Ihr Team bereits bewertet hat, und sehen Sie nach, wo er abweicht. Unser Leitfaden zur Validierung der KI-QA-Bewertung führt durch diesen Test.

Welche Ergebnisse können Sie von vollständiger Abdeckung erwarten?

Die veröffentlichten Ergebnisse stammen aus der QA von Supportkonversationen im Allgemeinen. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI und einer Steigerung des Qualitätsscores um 8 %. Bei SteelSeries, einem Supportteam mit 30 Personen, das mit Zendesk angefangen hat, haben KI-Zusammenfassungen den Zeitaufwand für die QA halbiert, ohne dass weniger gefunden wurde.

Keines der beiden Ergebnisse bezieht sich nur auf Konversationen von KI-Agenten. Der Mechanismus ist aber derselbe: Sobald jede Konversation bewertet wird, ist ein wiederkehrender Fehler keine Anekdote mehr, sondern eine Zahl, die Sie korrigieren und verfolgen können.

Sehen Sie es in Ihrem eigenen Zendesk. Kaizo bewertet jede Zendesk-Konversation anhand Ihrer eigenen Kriterien, auch die, die Zendesks KI-Agenten führen, und hängt die Erklärung an das Ticket. Demo buchen.

Sollten Sie Zendesk QA oder ein separates QA-Tool nutzen?

Nutzen Sie Zendesk QA, wenn Sie das Add-on bereits bezahlen und seine Scorecards zu der Art passen, wie Sie den Bot prüfen wollen. Nutzen Sie ein separates QA-Tool, wenn Sie eine Scorecard und ein Reporting für Konversationen menschlicher Agents und KI-Agenten wollen, aufgebaut auf Ihren eigenen Kriterien. Beides kann funktionieren; die Scorecard und die Nacharbeit zählen mehr als das Tool.

Was Zendesk QA laut Zendesks Help Center für Bots bietet:

  • Sie markieren jeden Bot als prüfbar oder nicht. Prüfbare Bots werden in die automatische Bewertung und in manuelle Prüfungen einbezogen.
  • Sie können Konversationen nach Teilnehmer, Bot, Bot-Typ (Workflow oder generativ) und Anzahl der Bot-Antworten filtern.
  • Die AutoQA-Kategorien sind Begrüßung, Empathie, Rechtschreibung und Grammatik, Abschluss, angebotene Lösung, Tonfall, Lesbarkeit und Verständnis, und Agents und Bots werden getrennt bewertet.
  • Es setzt das Add-on Quality Assurance oder Workforce Engagement Management voraus.

Fragen, die Sie jedem Tool stellen sollten, Zendesk QA eingeschlossen:

  1. Kann es die Kriterien bewerten, die für einen Bot zählen, etwa Richtigkeit gegenüber Ihren eigenen Inhalten und Richtlinien, und nicht nur die Standardkategorien?
  2. Liefert es zu jedem Score eine Erklärung, die sich auf das Transkript bezieht?
  3. Können Sie es anhand Ihrer eigenen früheren Bewertungen testen, bevor es live bewertet?
  4. Bewertet es jede Konversation des KI-Agenten oder nur eine Stichprobe?
  5. Sehen die Personen, die den Bot korrigieren, die Fehler nach Ursache gruppiert?

Wenn Sie die beiden direkt vergleichen, zeigt unsere Seite zur Zendesk-QA-Alternative die Unterschiede, und die Seite Kaizo für Zendesk zeigt, wie die Einrichtung funktioniert.

Wann das nichts für Sie ist

Eine formale Qualitätssicherung für KI-Agenten lohnt sich nicht überall. Wenn Ihr Zendesk-KI-Agent ein paar Dutzend Konversationen pro Woche führt, lesen Sie sie selbst: Eine Stunde pro Woche mit den Transkripten und einer kurzen Checkliste findet die meisten Probleme. Wenn der Bot nur risikoarme Fragen beantwortet, etwa zu Öffnungszeiten und Links zur Sendungsverfolgung, reicht eine monatliche Stichprobe.

Es ist auch zu früh, wenn Sie noch keinen schriftlichen Standard dafür haben, wie eine gute Antwort aussieht. Schreiben Sie ihn zuerst, auch als einseitige Liste, denn kein Tool kann anhand eines Standards bewerten, den es nicht gibt. Und wenn Ihre Hilfecenter-Inhalte durchgehend veraltet sind, bringen Sie zuerst die Inhalte in Ordnung, bevor Sie den Bot messen: Die QA wird Ihnen sonst vor allem sagen, was Sie schon wissen.

Häufig gestellte Fragen

Kann Zendesk QA Konversationen prüfen, die KI-Agenten geführt haben?

Ja. Zendesk QA kann Bots, die Sie als prüfbar markieren, in die automatische Bewertung und in manuelle Prüfungen einbeziehen, und Sie können Konversationen nach Bot und Bot-Typ filtern. Es setzt das Add-on Quality Assurance oder Workforce Engagement Management voraus.

Funktioniert Kaizo mit Zendesk-KI-Agenten?

Ja. Kaizo verbindet sich mit Zendesk, und AutoPilot bewertet jede Zendesk-Konversation anhand Ihrer eigenen Kriterien, auch die, die Zendesks KI-Agenten führen. Zu jedem Score gibt es einen Kommentar, der ihn erklärt.

Wie viele Konversationen eines Zendesk-KI-Agenten sollten Sie prüfen?

Bewerten Sie alle, wenn Sie können, denn ein Bot wiederholt denselben Fehler meist in allen Konversationen zum selben Thema. Wenn Sie manuell prüfen, beginnen Sie mit den riskanten Themen wie Erstattungen, Preisen und Ausnahmen von Richtlinien, und lesen Sie zuerst jede einzelne dieser Konversationen.

Können Sie dieselbe Scorecard für Ihre menschlichen Agents und Ihren KI-Agenten verwenden?

Sie können die Kriterien teilen, die für beide gelten, etwa richtige Antwort und Tonfall, damit die Ergebnisse vergleichbar bleiben. Der KI-Agent braucht zusätzliche Kriterien für den Bezug auf Ihre Inhalte, die Grenzen der Richtlinie und die Eskalation, und weniger Gewicht auf Begrüßung und Rechtschreibung.

Wie lange dauert die Einrichtung der QA für einen Zendesk-KI-Agenten?

Die meiste Arbeit besteht darin, die riskanten Themen auszuwählen und die erste Scorecard zu schreiben, und das machen Sie einmal. Mit Kaizo dauert es Tage, Zendesk zu verbinden und AutoPilot einzuschalten, kein Connector-Projekt, und Sie können die Bewertung anhand Ihrer früheren Bewertungen testen, bevor sie live geht.

Was sollten Sie tun, wenn der KI-Agent eine falsche Antwort gibt?

Finden Sie zuerst die Quelle der Antwort: meist einen Hilfecenter-Artikel, der falsch, veraltet oder unklar ist. Korrigieren Sie den Artikel oder fügen Sie eine Eskalationsregel für das Thema hinzu, und prüfen Sie dann die Scores für dieses Thema in der folgenden Woche, um zu bestätigen, dass die Korrektur wirkt.

Weiterlesen

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart