Przejdź do treści

Szablon

Karta oceny agenta AI: co oceniać, a co pominąć

Karta oceny agenta AI: jakie kryteria dodać, które kryteria dla konsultantów usunąć i jak uczciwie oceniać agenta AI, łącząc każdy wynik z zapisem rozmowy.

· 6 min czytania

Zweryfikowane przez Dominik Blattner, założyciel Kaizo

Na tej stronie

Agent AI popełnia inne błędy niż człowiek, dlatego karta oceny agenta AI pomija kryteria, które dotyczą wyłącznie konsultantów, i zostawia te, które mówią o rozwiązaniu problemu klienta. Dochodzą do niej sprawdzenia halucynacji, niebezpiecznej eskalacji, trzymania się zakresu i przyznawania się do tego, czego agent nie wie.

W skrócie

  • Ciepły ton mówi niewiele. Poprawność faktów mówi prawie wszystko.
  • Proszę oceniać każdą rozmowę AI, bo błędy automatyzacji powtarzają się na dużą skalę.
  • Najgorsze błędy AI są ciche i nigdy nie trafiają do eskalacji.
  • Zespół, który zbudował agenta, nie powinien być jedynym, który go ocenia.

Dlaczego nie można użyć karty oceny konsultantów

Po wdrożeniu agenta AI pierwszy odruch to ocenianie go kartą oceny, którą już Państwo mają. To kuszące, bo cel wydaje się ten sam: dobra rozmowa z klientem. Jednak karta zbudowana dla ludzi zawiera założenia o tym, jak mylą się ludzie, a agent AI łamie te założenia w obie strony.

Konsultant zwykle nie wymyśli polityki zwrotów, która nie istnieje, ale pod presją może odpowiedzieć szorstko. Agent AI prawie nigdy nie będzie szorstki, za to z pełnym przekonaniem przedstawi zmyśloną politykę. Ocenianie agenta AI za ciepły ton mówi niewiele, bo ton to rzecz, którą agent zapewnia najbardziej niezawodnie. Ocenianie, czy każde stwierdzenie faktyczne było prawdziwe, mówi prawie wszystko, bo właśnie tam agent naprawdę zawodzi. Karta oceny musi przesunąć uwagę tam, gdzie teraz leży ryzyko. Nasza pełna metoda kontroli jakości agentów AI i chatbotów opisuje cały proces wokół tego; tutaj pytanie jest węższe: co faktycznie trafia do karty.

Kryteria dla konsultantów, które tracą sens

Proszę zacząć od usunięcia kryteriów, które mierzą coś, czego agent AI nie ma albo w czym się nie zmienia.

  • Ton i ciepło jako wskaźnik empatii: ton agenta AI wynika z promptu i prawie się nie zmienia, więc jego ocena mierzy konfigurację, a nie interakcję. Empatia nadal ma znaczenie, ale jako to, czy odpowiedź była odpowiednia do stanu klienta, o czym niżej.
  • Zaangażowanie i inicjatywa: kryteria w rodzaju „zrobić więcej, niż trzeba” zakładają człowieka, który sam decyduje się zrobić więcej. Nie pasują do systemu, który wykonuje instrukcje.
  • Trzymanie się skryptu, którego konsultant nauczył się na pamięć: zastępuje je zgodność z zakresem i politykami, czyli inne i ostrzejsze sprawdzenie dla maszyny.
  • Kryteria rozwoju osobistego: wszystko, co dotyczy uczenia się lub doskonalenia agenta, należy do właściciela modelu, a nie do wyniku pojedynczej rozmowy.

Usunięcie tych kryteriów nie obniża poprzeczki. Kieruje ją na błędy, które naprawdę mogą się zdarzyć.

Kryteria, które ma tylko karta oceny agenta AI

To te dodatki sprawiają, że powstaje karta oceny agenta AI, a nie przerobiona karta dla konsultantów. Każdy opisuje błąd, który człowiek popełnia rzadko, a maszyna regularnie.

KryteriumCo sprawdzaDlaczego konsultant rzadko go narusza
Poprawność każdego stwierdzeniaNic, co powiedział agent, nie było zmyślone ani błędneLudzie asekurują się, gdy nie są pewni; modele mówią z tą samą pewnością, czy mają rację, czy nie
Wierność politykomAgent nie wymyślał polityk ani ich nie łagodził czy wyolbrzymiałKonsultant wie, że nie zna danej polityki; model wygeneruje wiarygodnie brzmiącą
Trzymanie się zakresuAgent pozostał w granicach tego, co może zrobić lub obiecaćLudzie wyczuwają granicę swoich uprawnień; modelowi trzeba ją wskazać, a i tak może ją przekroczyć
Zachowanie przy eskalacjiPrzekazał rozmowę, kiedy powinien, i nie zostawił klienta w pułapceKonsultant zauważa, że utknął; model może kręcić się w kółko lub trafić w ślepy zaułek, nie zauważając tego
Przyznawanie się do niewiedzyPowiedział, że nie wie, zamiast zgadywaćPewne siebie zgadywanie to domyślne zachowanie modelu, nie człowieka
Bezpieczna obsługa wrażliwych próśbPrawidłowo odmówił lub przekierował sprawy dotyczące samookaleczenia, oszustwa lub ryzyka prawnegoOsąd, który człowiek stosuje instynktownie, dla maszyny musi być jawnym kryterium

Kryteria, które się nie zmieniają

Niektóre rzeczy mają znaczenie bez względu na to, kto lub co odpowiada, i stanowią kręgosłup karty oceny.

  • Czy problem został rozwiązany: klient odszedł z rozwiązanym problemem, a nie tylko bez kontaktu z człowiekiem. To kryterium, które wskaźnik containment rate (po angielsku) po cichu pomija.
  • Czy informacja była poprawna i kompletna: wspólne z kartą dla konsultantów, ale tutaj waży znacznie więcej.
  • Czy klient został potraktowany odpowiednio: przeformułowane z ciepła na adekwatność, czyli czy odpowiedź pasowała do sytuacji i stanu emocjonalnego klienta.
  • Czy interakcja była sprawna dla klienta: nie czas obsługi po stronie agenta, ale to, czy klient doszedł do celu bez zbędnych pętli.

Jak pisać kryteria, które AI potrafi ocenić (po angielsku) pokazuje, jak sformułować każde z nich, żeby dało się je sprawdzić w zapisie rozmowy, a nie było kwestią opinii.

Jak oceniać według karty: pokrycie i identyfikowalność

Dwie rzeczy odróżniają działającą kartę oceny agenta AI od dekoracyjnej.

Oceniać wszystko, a nie próbkę

Kontrola jakości konsultantów opierała się na kilku rozmowach na osobę, bo czytanie ich było kosztowne. Ta logika nie sprawdza się przy agentach AI, ponieważ ich błędy są systematyczne: słabość promptu, która raz wywołuje halucynację, wywołuje ją setki razy, a próbka 2% rozmów zwykle przeoczy ten wzorzec, dopóki nie stanie się on problemem. Ocena 100% rozmów (po angielsku) sprawia, że karta oceny staje się narzędziem monitoringu, a nie wyrywkową kontrolą. W UiPath Kaizo zautomatyzowało 100% QA przy ROI 200% i wzroście wyniku jakości o 8%.

Łączyć każdy wynik z zapisem rozmowy

Wynik za poprawność faktów lub wierność politykom jest przydatny tylko wtedy, gdy widać dokładne linijki, przez które kryterium nie zostało spełnione. Inaczej nie da się poprawić promptu ani obronić wyniku, gdy zespół odpowiedzialny za agenta go zakwestionuje. Każdy wynik w Kaizo wskazuje dowody, na podstawie których powstał.

Twórca agenta nie może być jedynym oceniającym

Niewygodna kwestia strukturalna: jeśli zespół, który zbudował Państwa agenta AI, jest jedynym, który go ocenia, najłagodniej traktowane będą właśnie te kryteria, które pokazałyby agenta w złym świetle. Proszę oceniać kryteria takie jak poprawność faktów i niebezpieczna eskalacja według własnej karty oceny i dopilnować, żeby każdy wynik prowadził do dowodów w rozmowie. Taksonomia cichych błędów omawia dokładniej błędy, które pobłażliwy oceniający zwykle przeocza.

Najczęściej zadawane pytania

Czym jest karta oceny agenta AI?

To zestaw kryteriów służących do oceny rozmów prowadzonych przez system zautomatyzowany, a nie przez człowieka. Różni się od karty oceny jakości dla konsultantów, bo pomija kryteria dotyczące wyłącznie ludzi, zachowuje te, które sprawdzają, czy problem klienta został rozwiązany i czy informacja była poprawna, oraz dodaje kryteria właściwe dla automatyzacji, takie jak poprawność faktów, wierność politykom, trzymanie się zakresu i zachowanie przy eskalacji.

Czy możemy użyć obecnej karty oceny jakości dla agenta AI?

Nie bez zmian. Karta dla konsultantów zawiera założenia o tym, jak mylą się ludzie, a agenci AI mylą się inaczej. Ciepły ton w przypadku modelu prawie się nie zmienia i mówi niewiele, natomiast zmyślone fakty i wymyślone polityki, których ludzie rzadko się dopuszczają, stają się głównym ryzykiem. Ponowne użycie karty dla konsultantów kieruje uwagę na niewłaściwe błędy.

Jakie kryteria są właściwe tylko dla oceny agenta AI?

Poprawność każdego stwierdzenia, wierność politykom (bez wymyślania ani wyolbrzymiania polityk), trzymanie się zakresu, zachowanie przy eskalacji (przekazanie rozmowy, gdy agent utknął, zamiast zostawiania klienta w pułapce), przyznawanie się do niewiedzy oraz bezpieczna obsługa wrażliwych próśb. Każde z nich opisuje błąd, który człowiek popełnia rzadko, a model regularnie.

Czy oceniać wszystkie rozmowy agenta AI, czy tylko próbkę?

Wszystkie. Błędy agenta AI są systematyczne: słabość promptu, która raz wywołuje halucynację, wywołuje ją setki razy, a próbka 2% rozmów zwykle przeoczy ten wzorzec, dopóki nie stanie się on problemem. Ocena 100% rozmów sprawia, że karta oceny staje się narzędziem monitoringu, a nie wyrywkową kontrolą.

Dlaczego zespół, który zbudował agenta AI, nie powinien być jedynym, który go ocenia?

Bo najłagodniej traktowane będą te kryteria, które pokazałyby agenta w złym świetle. Proszę oceniać poprawność faktów i niebezpieczną eskalację według własnej karty oceny i łączyć każdy wynik z dowodami w zapisie rozmowy.

Czytaj także

Karta oceny agenta AI, która wychwytuje to, co ważne

Proszę przygotować rozmowy, które Państwa agent AI prowadził w zeszłym miesiącu, i kartę oceny, której używają Państwo dziś. Pokażemy, które kryteria tracą sens w przypadku maszyny, których błędów obecna karta nie widzi i co zamiast tego wychwytuje karta oceny zbudowana dla automatyzacji. Każdy wynik prowadzi do dokładnych linijek w zapisie rozmowy.

Umów demo Poznaj Agentic Auto QA

Na tej stronie

Zobacz to na własnych rozmowach

Ocenimy próbkę Państwa prawdziwych zgłoszeń według Państwa standardów, tak aby przykład był Państwa.

Zaufały nam zespoły obsługi klienta na całym świecie

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart