Przejdź do treści

Dobre praktyki

Kontrola jakości agentów AI i chatbotów

Kontrola jakości agentów AI i chatbotów: karta oceny, ocena 100% rozmów AI, każdy wynik powiązany z dowodem w rozmowie i wychwytywanie typowych błędów AI.

· 6 min czytania

Zweryfikowane przez Dominik Blattner, założyciel Kaizo

Na tej stronie

Kontrola jakości agentów AI zaczyna się od karty oceny, która opisuje dobrą rozmowę obsłużoną przez AI, i od automatycznej oceny każdej takiej rozmowy. Oceniający powinien być niezależny od AI, którą ocenia, a każdy wynik powinien prowadzić do transkrypcji, żeby dało się naprawić błąd.

W skrócie

  • Wolumen rozmów AI jest za duży, żeby ręcznie oceniać próbki.
  • Warto szukać błędnych informacji, pominiętych eskalacji, halucynacji i odpowiedzi w niewłaściwym tonie.
  • Wnioski trzeba przenosić do promptów, zabezpieczeń (guardrails) i routingu.
  • Po poprawce należy ocenić rozmowy ponownie, żeby potwierdzić, że zadziałała.

Krok 1: określić, jak wygląda dobra praca agenta AI

Agenci AI popełniają inne błędy niż ludzie, więc karta oceny dla konsultantów przeniesiona bez zmian pominie właśnie to, co najważniejsze. Na początek warto spisać, jak w Państwa firmie wygląda naprawdę dobra rozmowa obsłużona przez AI, w postaci kryteriów, które maszyna może ocenić na podstawie transkrypcji.

Kryteria zbudowane wokół typowych błędów AI

Dobra karta oceny dla AI obejmuje zachowania, które podważają zaufanie, gdy agent popełni w nich błąd:

  • Poprawność informacji: czy agent podał prawidłowe informacje, czy wymyślił zasadę, cenę albo krok, który nie istnieje?
  • Rozwiązanie sprawy: czy naprawdę rozwiązał problem klienta, czy tylko zamknął zgłoszenie?
  • Właściwa eskalacja: czy przekazał rozmowę konsultantowi we właściwym momencie, a nie za późno?
  • Ton i empatia: czy dopasował się do stanu emocjonalnego klienta, zamiast brzmieć jak robot?
  • Przestrzeganie zasad i bezpieczeństwa: czy pozostał w granicach, które Państwo wyznaczyli, i odmówił tego, czego miał odmówić?

Każde kryterium musi dać się sprawdzić na dowodach

Kryteria warto pisać tak, żeby wynik pozytywny lub negatywny dało się powiązać z konkretną linijką rozmowy. Kaizo pozwala zbudować kartę oceny, której Państwa firma faktycznie używa, i ocenia według niej każdą rozmowę tak, jak zrobiłby to Państwa najlepszy recenzent. Dzięki temu kontrola jakości AI i kontrola jakości pracy konsultantów opierają się na jednym, porównywalnym standardzie.

Krok 2: oceniać 100% rozmów AI, a nie próbkę

Ręczna kontrola jakości obejmuje od 2% do 5% zgłoszeń, bo człowiek jest w stanie przeczytać tylko określoną liczbę rozmów. Przy agentach AI ten limit przestaje mieć sens: pracują przy wolumenach, z których żaden zespół oceniający nie pobierze sensownej próbki, a rzadki, ale szkodliwy błąd prawie zawsze znajdzie się w 95%, których nikt nie czyta.

Automatyczna ocena

Wystarczy połączyć helpdesk lub CRM, w którym już znajdują się Państwa rozmowy, i pozwolić systemowi oceniać każdą interakcję obsłużoną przez AI zaraz po jej zakończeniu, w sposób ciągły i w tle. Kaizo ma natywne integracje z Zendesk i Salesforce i czyta rozmowy bezpośrednio z systemów, z których Państwo już korzystają, więc nie ma osobnego pipeline’u do utrzymania. Mogą Państwo umówić demo, żeby zobaczyć to na własnych rozmowach.

Dlaczego pełne pokrycie jest ważniejsze w przypadku AI

Jeden agent stosuje to samo zachowanie w tysiącach rozmów, więc jedna systematyczna wada, źle odczytana zasada albo złe ustawienie domyślne, powtarza się na dużą skalę. Ocena 100% rozmów pozwala wcześnie wychwycić taki wzorzec. W UiPath Kaizo zautomatyzowało 100% kontroli jakości przy ROI na poziomie 200%, a właśnie takiego pokrycia wymaga dziś wolumen obsługiwany przez AI.

Krok 3: zachować niezależność oceniającego

To krok, który większość zespołów pomija, a to on decyduje o tym, czy kontroli jakości AI można ufać. Zespół, który zbudował agenta AI, nie powinien być jedynym, który go ocenia. Zespół rozliczany z tego, czy agent dobrze wygląda, nie jest najlepszym sędzią tego, czy agent dobrze działa.

To dowody sprawiają, że wynik jest wiarygodny

Oceniający powinien stosować tę samą kartę oceny niezależnie od tego, czy rozmowę obsłużył człowiek, Państwa własny bot, czy AI innego dostawcy. Kaizo ocenia 100% rozmów konsultantów i agentów AI według Państwa własnej karty oceny, a każdy wynik prowadzi do dowodu w rozmowie, więc ocenę agenta można sprawdzić, zamiast przyjmować ją na wiarę.

O co zapytać dostawcę rozwiązania QA

  • Czy możecie ocenić agenta AI zbudowanego przez kogoś innego według tej samej karty oceny, której używamy my?
  • Czy każdy wynik prowadzi do dowodu, tak żebyśmy mogli sprawdzić Waszą ocenę, zamiast przyjmować ją na wiarę?

Krok 4: wychwytywać błędy typowe dla AI

Gdy ocena obejmuje już każdą rozmowę, warto skierować ją na błędy, które występują tylko przy automatyzacji albo które automatyzacja wzmacnia. Te kategorie warto wyodrębnić i śledzić w czasie.

Rodzaj błęduJak wyglądaCo sprawdza karta oceny
Błędna informacjaAgent podaje nieprawdziwą zasadę, cenę albo krokCzy każde stwierdzenie było poprawne i oparte na Państwa źródłach?
Pominięta eskalacjaAgent dalej prowadzi sprawę, którą powinien był przekazać konsultantowiCzy eskalował przy właściwym wyzwalaczu i na czas?
Halucynowana pewnośćBłędna odpowiedź podana tak, jakby była pewnaCzy agent unikał wymyślania szczegółów, których nie mógł zweryfikować?
Niewłaściwy tonRobotyczny albo lekceważący język w kontakcie ze sfrustrowanym klientemCzy ton pasował do stanu emocjonalnego klienta?
Naruszenie zasadAgent robi coś, czego miał odmówićCzy pozostał w granicach zasad i bezpieczeństwa?

Krok 5: przekazać wnioski dalej i ocenić ponownie

Kontrola jakości ma sens tylko wtedy, gdy zmienia zachowanie. Każdy wynik w Kaizo prowadzi do dokładnego momentu w transkrypcji, z którego wynika, więc błąd to nie tylko flaga, ale konkretny, powtarzalny przykład, na podstawie którego można działać.

Zamknąć pętlę

  • Błędy poprawności kierować z powrotem do promptu, bazy wiedzy albo źródła, które dało błędną odpowiedź.
  • Pominięte eskalacje zamieniać w zaostrzoną regułę routingu albo wyzwalacz.
  • Powtarzające się błędy grupować, żeby naprawić wzorzec raz, zamiast łatać przypadki jeden po drugim.

Następnie trzeba ocenić rozmowy ponownie, żeby potwierdzić, że poprawka zadziałała. Pełne, ciągłe pokrycie pokazuje efekt zmiany we wszystkich rozmowach, a nie w próbce, która może przeoczyć regresję.

Najczęstsze błędy, których warto unikać

Kilka błędów po cichu osłabia programy kontroli jakości AI, zanim zaczną przynosić wartość.

  • Próbkowanie AI tak samo jak konsultantów: 2-procentowa próbka bota o dużym wolumenie niemal z założenia pomija systematyczne błędy.
  • Ocena agenta wyłącznie przez zespół, który go zbudował: bez niezależnego oceniającego dobrze wyglądający wynik to nie to samo co dobra praca.
  • Ocena bez dowodów: liczby, której nie da się powiązać z linijką transkrypcji, nie można zweryfikować, wykorzystać w coachingu ani zakwestionować.
  • Używanie karty oceny konsultantów bez zmian: typowe błędy AI, takie jak halucynacje i fałszywa pewność, wymagają własnych kryteriów.
  • Mierzenie bez przekazywania wniosków dalej: kontrola jakości, która nie zmienia promptów, zabezpieczeń ani routingu, to tylko raportowanie.

Najczęściej zadawane pytania

Jak prowadzić kontrolę jakości agenta AI lub chatbota?

Należy zbudować kartę oceny, która opisuje dobrą rozmowę obsłużoną przez AI i obejmuje poprawność, rozwiązanie sprawy, właściwą eskalację, ton i przestrzeganie zasad. Według niej trzeba automatycznie oceniać 100% rozmów AI, zachować niezależność oceniającego od ocenianej AI i powiązać każdy wynik z dowodem w transkrypcji, żeby błędy dało się zweryfikować i naprawić.

Dlaczego oceniający musi być niezależny od agenta AI?

Jeśli agenta AI oceniają wyłącznie ci, którzy go zbudowali, mają oni interes w tym, żeby agent dobrze wypadł. Wiarygodność wynikowi daje oceniający, który wiąże każdy wynik z dowodem w rozmowie, bo każdy może go sprawdzić.

Czy można używać tej samej karty oceny dla agentów AI i konsultantów?

Można współdzielić kryteria, które dotyczą obu grup, na przykład rozwiązanie sprawy i ton, dzięki czemu kontrola jakości AI i konsultantów pozostaje porównywalna. AI potrzebuje jednak dodatkowych kryteriów dla własnych typowych błędów, takich jak halucynacje i fałszywa pewność, więc najlepszym podejściem jest jeden standard z dodanymi kontrolami specyficznymi dla AI.

Jakie błędy agentów AI zdarzają się najczęściej?

Pięć kategorii, które warto śledzić, to błędna informacja, pominięta eskalacja, halucynowana pewność, niewłaściwy ton i naruszenie zasad. Każda z nich ma w karcie oceny własne kryterium, dzięki czemu błąd można wyodrębnić, powiązać z transkrypcją i śledzić w czasie.

Jaką część rozmów AI należy objąć kontrolą jakości?

Wszystkie. AI pracuje przy wolumenach, z których żaden zespół nie pobierze sensownej próbki, a systematyczna wada powtarza się w każdej rozmowie obsłużonej przez agenta, więc mała próbka zwykle jej nie wychwyci. Automatyczna ocena 100% rozmów pozwala wcześnie wykryć takie wzorce.

Powiązane artykuły

Na tej stronie

Zobacz to na własnych rozmowach

Ocenimy próbkę Państwa prawdziwych zgłoszeń według Państwa standardów, tak aby przykład był Państwa.

Zaufały nam zespoły obsługi klienta na całym świecie

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart