Zum Inhalt springen

Kennzahlen

KI-Agenten-Leistung messen: Kennzahlen und Scorecard

KI-Agenten-Leistung im Kundenservice messen: die Kennzahlen, die zählen, Bewertung per Scorecard und ein fairer Vergleich zwischen KI und menschlichen Agents.

· 6 Min. Lesezeit

Geprüft von Dominik Blattner, Gründer von Kaizo

Auf dieser Seite

Um die Leistung von KI-Agenten zu messen, verfolgen Sie Lösungsquote, Genauigkeit, Eskalation, Containment und Stimmung und bewerten dann jede von KI bearbeitete Konversation anhand einer Qualitäts-Scorecard. Nutzen Sie dieselbe Scorecard für menschliche Agents und eine Bewertung, die unabhängig von der KI ist, die sie bewertet.

Kurz gesagt

  • Eine hohe Containment-Rate sagt wenig ohne Lösung und Genauigkeit.
  • Bei großem Volumen sind Stichproben unzuverlässig, deshalb bewerten Sie 100 % der KI-Konversationen.
  • Beheben Sie die Prompts, Guardrails und das Routing hinter schlechten Scores und messen Sie dann erneut.

Schritt 1: Legen Sie fest, welche Kennzahlen wirklich zählen

Eine hohe Containment-Rate sieht großartig aus, bis Sie feststellen, dass der Bot Fälle gehalten hat, die er hätte eskalieren müssen. Vanity-Metriken messen Aktivität, nicht Qualität. Wählen Sie deshalb zuerst Kennzahlen, die zeigen, ob der Kunde tatsächlich gut bedient wurde.

Die zentralen Leistungskennzahlen für KI

  • Lösungsquote: der Anteil der Konversationen, in denen das Problem des Kunden wirklich gelöst und nicht nur geschlossen wurde.
  • Sachliche Genauigkeit: wie oft der Agent korrekte, belegte Informationen gegeben hat, statt Details zu erfinden.
  • Eskalationsrate: wie oft und wie angemessen der Agent an einen Menschen übergeben hat. Zu hoch und zu niedrig sind beide ein Problem.
  • Containment-Rate: der Anteil, der ohne Menschen bearbeitet wurde. Sie ist nur dann gesund, wenn Lösung und Genauigkeit stimmen.
  • Stimmung: wie sich der Kunde während und nach der Konversation gefühlt hat.

Kennzahlen immer zusammen lesen, nie allein

Keine einzelne Zahl sagt die Wahrheit. Hohes Containment bei niedriger Lösungsquote bedeutet, dass der Bot abwimmelt, statt zu helfen. Die Kennzahlen ergeben nur als Set einen Sinn, und deshalb bildet die Qualitätsbewertung die Grundlage für alle.

Schritt 2: KI-Agenten-Leistung mit einer Scorecard messen

Ergebniskennzahlen sagen Ihnen, was passiert ist, aber nicht, warum eine Konversation gut oder schlecht war. Eine Qualitäts-Scorecard macht Leistung zu etwas, das Sie analysieren und coachen können, denn sie beurteilt jede Konversation anhand definierter Kriterien.

Aus Kennzahlen werden Kriterien

Bauen Sie eine Scorecard, die Genauigkeit, Lösung, korrekte Eskalation, Ton und Einhaltung von Richtlinien erfasst, und lassen Sie das System jede KI-Konversation automatisch daran bewerten. Kaizo liest Konversationen nativ aus Zendesk und Salesforce und bewertet jede einzelne, sobald sie eingeht. So sind Ihre Leistungsdaten fortlaufend statt eine monatliche Momentaufnahme.

Alles abdecken, nicht nur eine Stichprobe

KI arbeitet mit Volumina, aus denen kein Team sinnvolle Stichproben ziehen kann, und ein systematischer Fehler wiederholt sich in jeder Konversation, die ein Agent bearbeitet. Erst die Bewertung von 100 % macht die Zahlen verlässlich. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI. Die Verantwortlichen haben damit vollständige Daten, an denen sie messen können, statt nur einen Bruchteil.

Schritt 3: KI und Menschen fair vergleichen

Sobald KI und Menschen beide Konversationen bearbeiten, stellt sich ganz natürlich die Frage, wie sie im Vergleich abschneiden. Der Vergleich ist nur aussagekräftig, wenn beide auf dieselbe Weise gemessen werden.

Eine Scorecard für beide

Bewerten Sie von KI und von Menschen bearbeitete Konversationen nach denselben Kriterien. Dann spiegelt ein Unterschied in den Scores einen echten Qualitätsunterschied wider und nicht zwei verschiedene Maßstäbe. So sehen Sie auch, wo die KI wirklich besser ist und wo sie unbemerkt schlechter abschneidet, pro Queue und pro Thema.

DimensionVanity-SichtFairer Vergleich
GrundlageKI-Volumen gegen menschliches VolumenDieselbe Scorecard für beide
LösungGeschlossene TicketsTatsächlich gelöste Probleme
EskalationAls Versagen der KI gezähltFür den Fall als richtig oder falsch beurteilt
AbdeckungJe eine Stichprobe100 % von beiden, fortlaufend bewertet
UrteilWer mehr bearbeitet hatWer besser bearbeitet hat, mit Belegen

Schritt 4: Halten Sie die Bewertung unabhängig

Eine Leistungszahl ist nur so vertrauenswürdig wie das, was sie erzeugt hat. Lassen Sie das Team, das einen KI-Agenten gebaut hat, nicht als einziges darüber urteilen. Ein Team mit Eigeninteresse am Ergebnis hat einen Grund, schmeichelhafte Scores zu melden, und das verfälscht unbemerkt jede nachgelagerte Kennzahl.

Belege machen die Messung glaubwürdig

Jeder Score, den Kaizo vergibt, verweist auf die genaue Stelle im Transkript, aus der er entstanden ist. Eine Leistungsaussage lässt sich also durch Nachlesen prüfen, statt dass man ihr vertrauen muss. Genau das erlaubt es Teams, die Automatisierungsquote mit Zuversicht zu erhöhen.

Schritt 5: Handeln Sie auf Basis der Ergebnisse

Eine Messung, die kein Verhalten ändert, ist nur ein Dashboard. Der Sinn der Leistungsmessung bei KI ist, sie zu verbessern, und Scores mit Belegen machen das direkt möglich.

Den Kreis schließen

  • Führen Sie Genauigkeitsfehler auf den Prompt, die Wissensquelle oder die fehlende Faktenbasis zurück, die sie verursacht hat.
  • Korrigieren Sie falsch eingestellte Eskalationsauslöser, wenn die Eskalationsrate zu hoch oder zu niedrig wird.
  • Gruppieren Sie wiederkehrende niedrige Scores nach Thema oder Queue, damit Sie das Muster einmal an der Quelle beheben.
  • Messen Sie nach jeder Änderung erneut über alle Konversationen, um zu bestätigen, dass die Korrektur hält und an anderer Stelle nichts verschlechtert hat.

Weil die Abdeckung fortlaufend ist, zeigt sich die Wirkung einer Änderung im vollständigen Datensatz und nicht in einer Stichprobe, die sie übersehen könnte.

Häufige Fehler, die Sie vermeiden sollten

Diese Fehler lassen Leistungsdaten von KI gesünder aussehen, als sie sind.

  • Nur auf Containment schauen: Eine hohe Containment-Rate bei niedriger Lösungsquote bedeutet Abwimmeln, nicht Leistung.
  • Stichproben bei einem Agenten mit hohem Volumen: Eine kleine Stichprobe übersieht systematische Fehler fast immer.
  • KI und Menschen auf verschiedenen Skalen vergleichen: Ohne eine gemeinsame Scorecard ist der Vergleich bedeutungslos.
  • Das Team, das die KI gebaut hat, allein bewerten lassen: Wer ein Eigeninteresse am Ergebnis hat, liefert schmeichelhafte, unzuverlässige Zahlen.
  • Berichten, ohne zu handeln: Kennzahlen, die nie einen Prompt, eine Guardrail oder eine Routing-Regel ändern, bringen keine Verbesserung.

Häufig gestellte Fragen

Wie misst man die Leistung von KI-Agenten im Kundenservice?

Verfolgen Sie Ergebniskennzahlen wie Lösungsquote, sachliche Genauigkeit, Eskalationsrate, Containment und Stimmung und bewerten Sie dann jede von KI bearbeitete Konversation anhand einer Qualitäts-Scorecard statt nur einer Stichprobe. Vergleichen Sie KI und Menschen mit derselben Scorecard, nutzen Sie eine Bewertung, die unabhängig von der bewerteten KI ist, und handeln Sie auf Basis der Ergebnisse, indem Sie beheben, was schlechte Scores verursacht.

Welche Kennzahlen sind bei KI-Agenten am wichtigsten?

Lösungsquote und sachliche Genauigkeit sind am wichtigsten, denn sie zeigen, ob dem Kunden wirklich mit korrekten Informationen geholfen wurde. Eskalationsrate, Containment und Stimmung liefern wichtigen Kontext, führen aber allein betrachtet in die Irre. Hohes Containment bei niedriger Lösungsquote bedeutet zum Beispiel, dass der Agent abwimmelt, statt zu lösen.

Wie vergleicht man KI-Agenten fair mit menschlichen Agents?

Bewerten Sie beide mit derselben Qualitäts-Scorecard nach denselben Kriterien. Dann spiegelt ein Unterschied in den Scores einen echten Qualitätsunterschied wider und nicht zwei verschiedene Maßstäbe. Wenn Sie 100 % von beiden fortlaufend abdecken, sehen Sie außerdem, wo die KI pro Queue und Thema besser und wo sie schlechter abschneidet.

Warum ist eine unabhängige Bewertung für KI-Kennzahlen wichtig?

Wenn nur die Menschen die KI bewerten, die sie gebaut haben, haben die Scores einen eingebauten Anreiz, gut auszusehen, und das verfälscht jede nachgelagerte Kennzahl. Wenn jeder Score auf den Beleg im Transkript verweist, lässt sich eine Leistungsaussage durch Nachlesen prüfen, statt dass man ihr blind vertrauen muss.

Warum reicht eine Stichprobe bei KI-Agenten nicht aus?

KI arbeitet mit Volumina, aus denen kein Team sinnvolle Stichproben ziehen kann, und ein systematischer Fehler wiederholt sich in jeder Konversation, die ein Agent bearbeitet. Eine kleine Stichprobe übersieht solche Fehler fast immer. Erst die Bewertung von 100 % der KI-Konversationen macht die Zahlen verlässlich und zeigt die Wirkung jeder Änderung im vollständigen Datensatz.

Weiterlesen

Messen Sie Ihre KI-Agenten an Ihren eigenen Konversationen

Bringen Sie eine Woche Ihrer echten, von KI bearbeiteten Konversationen mit. Wir zeigen Ihnen Lösungsquote, Genauigkeit und Eskalation, bewertet auf 100 % davon, und jede Zahl lässt sich bis ins Transkript zurückverfolgen.

Demo buchen Agentic Auto QA entdecken

Auf dieser Seite

Sehen Sie das an Ihren eigenen Konversationen

Wir bewerten eine Stichprobe Ihrer echten Tickets nach Ihren Standards, damit das Beispiel Ihres ist.

Von globalen Supportteams genutzt

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart