Ein KI-Agent scheitert anders als ein Mensch. Deshalb streicht eine Scorecard für KI-Agenten die Kriterien, die nur für Menschen gelten, und behält die, bei denen es um die Lösung des Problems geht. Dazu kommen Prüfungen auf Halluzinationen, unsichere Eskalation, das Einhalten des eigenen Zuständigkeitsbereichs und das Eingeständnis, etwas nicht zu wissen.
Kurz gesagt
- Ein warmer Ton sagt wenig aus. Die sachliche Richtigkeit sagt fast alles.
- Bewerten Sie jede KI-Konversation, denn automatisierte Fehler wiederholen sich in großem Maßstab.
- Die schlimmsten KI-Fehler bleiben still und werden nie eskaliert.
- Das Team, das den Agenten gebaut hat, sollte ihn nicht als einziges bewerten.
Warum Sie die Scorecard für menschliche Agents nicht wiederverwenden können
Wer einen KI-Agenten einführt, will ihn meist mit der Scorecard bewerten, die schon existiert. Das liegt nahe, weil das Ziel gleich aussieht: ein gutes Kundengespräch. Doch die Scorecard, die Sie für Menschen gebaut haben, enthält Annahmen darüber, wie Menschen Fehler machen, und ein KI-Agent bricht diese Annahmen in beide Richtungen.
Ein menschlicher Agent erfindet normalerweise keine Erstattungsrichtlinie, die es nicht gibt, kann unter Druck aber kurz angebunden sein. Ein KI-Agent ist so gut wie nie kurz angebunden, nennt aber eine erfundene Richtlinie mit voller Überzeugung. Den KI-Agenten nach der Wärme seines Tons zu bewerten, sagt wenig aus, denn der Ton ist genau das, was er am zuverlässigsten liefert. Ihn danach zu bewerten, ob jede seiner Sachaussagen stimmte, sagt fast alles, denn genau dort scheitert er. Die Scorecard muss ihre Aufmerksamkeit dorthin verlagern, wo das Risiko jetzt liegt. Unsere vollständige Methode zur Qualitätssicherung von KI-Agenten und Chatbots beschreibt den Workflow drumherum; hier geht es um die engere Frage, was tatsächlich auf die Scorecard gehört.
Kriterien für Menschen, die keinen Sinn mehr ergeben
Streichen Sie zuerst die Kriterien, die etwas messen, das ein KI-Agent nicht hat oder bei dem er nicht schwankt.
- Ton und Wärme als Ersatz für Empathie: Der Ton eines KI-Agenten wird durch seinen Prompt festgelegt und schwankt kaum, also misst eine Bewertung die Konfiguration, nicht die Interaktion. Empathie zählt weiterhin, aber als Frage, ob die Antwort zur Lage des Kunden passte. Das deckt ein Kriterium weiter unten ab.
- Einsatz und Eigeninitiative: Kriterien wie „die Extrameile gehen“ setzen einen Menschen voraus, der sich entscheidet, mehr zu tun. Auf ein System, das Anweisungen ausführt, lassen sie sich nicht übertragen.
- Einhalten eines auswendig gelernten Skripts: ersetzt durch das Einhalten von Zuständigkeitsbereich und Richtlinien, eine andere und schärfere Prüfung für eine Maschine.
- Kriterien zur persönlichen Entwicklung: Alles, was mit Lernen oder Besserwerden des Agenten zu tun hat, ist Sache des Verantwortlichen für das Modell, nicht einer Bewertung pro Konversation.
Diese Kriterien zu streichen, senkt die Messlatte nicht. Es richtet sie auf die Fehler, die tatsächlich passieren können.
Kriterien einer Scorecard für KI-Agenten
Diese Ergänzungen machen daraus eine Scorecard für KI-Agenten statt einer umfunktionierten Scorecard für Menschen. Jedes Kriterium beschreibt einen Fehler, den ein Mensch selten macht und eine Maschine routinemäßig.
| Kriterium | Was es prüft | Warum ein Mensch es selten auslöst |
|---|---|---|
| Sachliche Richtigkeit jeder Aussage | Nichts, was der Agent sagte, war erfunden oder falsch | Menschen sichern sich ab, wenn sie unsicher sind; Modelle behaupten mit derselben Überzeugung, ob richtig oder falsch |
| Treue zu den Richtlinien | Der Agent hat keine Richtlinie erfunden, abgeschwächt oder übertrieben | Ein Mensch weiß, wenn er eine Richtlinie nicht kennt; ein Modell erzeugt eine plausible |
| Einhalten des Zuständigkeitsbereichs | Der Agent blieb bei dem, was er tun oder zusagen darf | Menschen spüren die Grenze ihrer Befugnis; einem Modell muss man sie sagen, und es kann darüber hinausdriften |
| Eskalationsverhalten | Er hat übergeben, wenn er sollte, und den Kunden nicht festgehalten | Ein Mensch merkt, wenn er feststeckt; ein Modell kann in Schleifen oder Sackgassen landen, ohne es zu bemerken |
| Ehrlichkeit bei Unsicherheit | Er sagte, dass er es nicht weiß, statt zu raten | Selbstsicheres Raten ist das Standardverhalten eines Modells, nicht eines Menschen |
| Sicherer Umgang mit sensiblen Anfragen | Er hat Fälle zu Selbstverletzung, Betrug oder rechtlichem Risiko korrekt abgelehnt oder weitergeleitet | Ein Urteil, das ein Mensch instinktiv fällt, muss für eine Maschine ein ausdrückliches Kriterium sein |
Kriterien, die gleich bleiben
Manches zählt unabhängig davon, wer oder was antwortet, und das bildet das Rückgrat der Scorecard.
- Wurde das Anliegen gelöst: Der Kunde ging mit gelöstem Problem, nicht bloß ohne Kontakt zu einem Menschen. Genau dieses Kriterium überspringt die Containment-Rate (auf Englisch) stillschweigend.
- War die Information korrekt und vollständig: auch Teil der Scorecard für Menschen, hier aber deutlich stärker gewichtet.
- Wurde der Kunde angemessen behandelt: umformuliert von Wärme zu Angemessenheit, also ob die Antwort zur Situation und zur Gefühlslage des Kunden passte.
- War die Interaktion für den Kunden effizient: nicht die Bearbeitungszeit des Agenten, sondern ob der Kunde ohne unnötige Schleifen ans Ziel kam.
Ein Bewertungsschema, nach dem eine KI bewerten kann (auf Englisch) zeigt, wie Sie jedes dieser Kriterien so formulieren, dass es sich am Transkript prüfen lässt, statt Ansichtssache zu sein.
So bewerten Sie danach: Abdeckung und Nachvollziehbarkeit
Zwei Dinge unterscheiden eine funktionierende Scorecard für KI-Agenten von einer dekorativen.
Alles bewerten, keine Stichprobe
Die QA für menschliche Agents hat pro Agent nur wenige Konversationen als Stichprobe geprüft, weil das Lesen teuer war. Bei KI-Agenten greift diese Logik nicht, denn ihre Fehler sind systematisch: Eine Schwäche im Prompt, die eine Halluzination erzeugt, erzeugt sie hunderte Male, und eine Stichprobe von 2 % übersieht das Muster meist, bis es schon ein Problem ist. Erst wenn Sie 100 % der Konversationen bewerten (auf Englisch), wird die Scorecard zu einem Überwachungsinstrument statt einer Stichprobenkontrolle. Bei UiPath hat Kaizo 100 % der QA automatisiert, mit 200 % ROI und einer Steigerung des Qualitätsscores um 8 %.
Jede Bewertung auf das Transkript zurückführen
Eine Bewertung der sachlichen Richtigkeit oder der Treue zu den Richtlinien nützt nur, wenn Sie die genauen Zeilen sehen, an denen sie gescheitert ist. Sonst können Sie den Prompt nicht korrigieren und die Bewertung nicht verteidigen, wenn das Team, dem der Agent gehört, widerspricht. Jede Kaizo-Bewertung verweist auf die Belege, aus denen sie entstanden ist.
Den Entwickler nicht allein bewerten lassen
Der unbequeme strukturelle Punkt: Wenn das Team, das Ihren KI-Agenten gebaut hat, ihn als einziges bewertet, sind ausgerechnet die Kriterien am ehesten weich, die den Agenten schlecht aussehen lassen würden. Bewerten Sie Kriterien wie sachliche Richtigkeit und unsichere Eskalation anhand Ihrer eigenen Scorecard, und sorgen Sie dafür, dass jede Bewertung auf die Belege in der Konversation verweist. Die Systematik stiller Fehler geht tiefer auf die Fehler ein, die ein nachsichtiger Bewerter gern übersieht.
Wenn Sie sehen möchten, wie das an Ihren eigenen Konversationen aussieht, buchen Sie eine Demo.
Häufig gestellte Fragen
Was ist eine Scorecard für KI-Agenten?
Es ist der Satz an Kriterien, mit dem Konversationen bewertet werden, die ein automatisiertes System statt eines Menschen geführt hat. Sie unterscheidet sich von einer QA-Scorecard für Menschen, weil sie Kriterien streicht, die nur für Menschen gelten, die Kriterien dazu behält, ob das Anliegen des Kunden gelöst wurde und die Information korrekt war, und Kriterien ergänzt, die nur bei Automatisierung auftreten, etwa sachliche Richtigkeit, Treue zu den Richtlinien, Einhalten des Zuständigkeitsbereichs und Eskalationsverhalten.
Kann ich meine bestehende QA-Scorecard für einen KI-Agenten verwenden?
Nicht ohne sie anzupassen. Eine Scorecard für Menschen enthält Annahmen darüber, wie Menschen Fehler machen, und KI-Agenten scheitern anders. Ein warmer Ton schwankt bei einem Modell kaum und sagt wenig aus, während erfundene Fakten und erfundene Richtlinien, die Menschen selten produzieren, zum Hauptrisiko werden. Wer die Scorecard für Menschen wiederverwendet, richtet die Aufmerksamkeit auf die falschen Fehler.
Welche Kriterien gibt es nur bei der Bewertung eines KI-Agenten?
Sachliche Richtigkeit jeder Aussage, Treue zu den Richtlinien (keine Richtlinie erfinden oder übertreiben), Einhalten des Zuständigkeitsbereichs, Eskalationsverhalten (übergeben, wenn er feststeckt, statt den Kunden festzuhalten), Ehrlichkeit bei Unsicherheit und sicherer Umgang mit sensiblen Anfragen. Jedes beschreibt einen Fehler, den ein Mensch selten macht und ein Modell routinemäßig.
Sollte ich jede Konversation eines KI-Agenten bewerten oder nur eine Stichprobe?
Jede. Die Fehler von KI-Agenten sind systematisch: Eine Schwäche im Prompt, die eine Halluzination erzeugt, erzeugt sie hunderte Male, und eine Stichprobe von 2 % übersieht das Muster meist, bis es schon ein Problem ist. Wer 100 % der Konversationen bewertet, macht die Scorecard zu einem Überwachungsinstrument statt einer Stichprobenkontrolle.
Warum sollte nicht nur das Team, das den KI-Agenten gebaut hat, ihn bewerten?
Weil ausgerechnet die Kriterien am ehesten weich sind, die den Agenten schlecht aussehen lassen würden. Bewerten Sie sachliche Richtigkeit und unsichere Eskalation anhand Ihrer eigenen Scorecard, und führen Sie jede Bewertung auf die Belege im Transkript zurück.
Verwandte Begriffe
- Qualitätssicherung für KI-Agenten und Chatbots
- Stille Fehler bei KI-Agenten: eine Systematik
- Ein QA-Bewertungsschema, nach dem eine KI bewerten kann (auf Englisch)
- Die Leistung von KI-Agenten messen
- 100 % der Konversationen bewerten (auf Englisch)
Eine Scorecard für KI-Agenten, die erkennt, worauf es ankommt
Bringen Sie die Konversationen mit, die Ihr KI-Agent im letzten Monat geführt hat, und die Scorecard, die Sie heute nutzen. Wir zeigen Ihnen, welche Kriterien für eine Maschine keinen Sinn mehr ergeben, welche Fehler Ihre aktuelle Scorecard nicht sieht und was eine für Automatisierung gebaute Scorecard stattdessen erkennt. Jede Bewertung lässt sich auf die genauen Zeilen im Transkript zurückführen.