Kontrola jakości agentów AI zaczyna się od karty oceny, która opisuje dobrą rozmowę obsłużoną przez AI, i od automatycznej oceny każdej takiej rozmowy. Oceniający powinien być niezależny od AI, którą ocenia, a każdy wynik powinien prowadzić do transkrypcji, żeby dało się naprawić błąd.
W skrócie
- Wolumen rozmów AI jest za duży, żeby ręcznie oceniać próbki.
- Warto szukać błędnych informacji, pominiętych eskalacji, halucynacji i odpowiedzi w niewłaściwym tonie.
- Wnioski trzeba przenosić do promptów, zabezpieczeń (guardrails) i routingu.
- Po poprawce należy ocenić rozmowy ponownie, żeby potwierdzić, że zadziałała.
Krok 1: określić, jak wygląda dobra praca agenta AI
Agenci AI popełniają inne błędy niż ludzie, więc karta oceny dla konsultantów przeniesiona bez zmian pominie właśnie to, co najważniejsze. Na początek warto spisać, jak w Państwa firmie wygląda naprawdę dobra rozmowa obsłużona przez AI, w postaci kryteriów, które maszyna może ocenić na podstawie transkrypcji.
Kryteria zbudowane wokół typowych błędów AI
Dobra karta oceny dla AI obejmuje zachowania, które podważają zaufanie, gdy agent popełni w nich błąd:
- Poprawność informacji: czy agent podał prawidłowe informacje, czy wymyślił zasadę, cenę albo krok, który nie istnieje?
- Rozwiązanie sprawy: czy naprawdę rozwiązał problem klienta, czy tylko zamknął zgłoszenie?
- Właściwa eskalacja: czy przekazał rozmowę konsultantowi we właściwym momencie, a nie za późno?
- Ton i empatia: czy dopasował się do stanu emocjonalnego klienta, zamiast brzmieć jak robot?
- Przestrzeganie zasad i bezpieczeństwa: czy pozostał w granicach, które Państwo wyznaczyli, i odmówił tego, czego miał odmówić?
Każde kryterium musi dać się sprawdzić na dowodach
Kryteria warto pisać tak, żeby wynik pozytywny lub negatywny dało się powiązać z konkretną linijką rozmowy. Kaizo pozwala zbudować kartę oceny, której Państwa firma faktycznie używa, i ocenia według niej każdą rozmowę tak, jak zrobiłby to Państwa najlepszy recenzent. Dzięki temu kontrola jakości AI i kontrola jakości pracy konsultantów opierają się na jednym, porównywalnym standardzie.
Krok 2: oceniać 100% rozmów AI, a nie próbkę
Ręczna kontrola jakości obejmuje od 2% do 5% zgłoszeń, bo człowiek jest w stanie przeczytać tylko określoną liczbę rozmów. Przy agentach AI ten limit przestaje mieć sens: pracują przy wolumenach, z których żaden zespół oceniający nie pobierze sensownej próbki, a rzadki, ale szkodliwy błąd prawie zawsze znajdzie się w 95%, których nikt nie czyta.
Automatyczna ocena
Wystarczy połączyć helpdesk lub CRM, w którym już znajdują się Państwa rozmowy, i pozwolić systemowi oceniać każdą interakcję obsłużoną przez AI zaraz po jej zakończeniu, w sposób ciągły i w tle. Kaizo ma natywne integracje z Zendesk i Salesforce i czyta rozmowy bezpośrednio z systemów, z których Państwo już korzystają, więc nie ma osobnego pipeline’u do utrzymania. Mogą Państwo umówić demo, żeby zobaczyć to na własnych rozmowach.
Dlaczego pełne pokrycie jest ważniejsze w przypadku AI
Jeden agent stosuje to samo zachowanie w tysiącach rozmów, więc jedna systematyczna wada, źle odczytana zasada albo złe ustawienie domyślne, powtarza się na dużą skalę. Ocena 100% rozmów pozwala wcześnie wychwycić taki wzorzec. W UiPath Kaizo zautomatyzowało 100% kontroli jakości przy ROI na poziomie 200%, a właśnie takiego pokrycia wymaga dziś wolumen obsługiwany przez AI.
Krok 3: zachować niezależność oceniającego
To krok, który większość zespołów pomija, a to on decyduje o tym, czy kontroli jakości AI można ufać. Zespół, który zbudował agenta AI, nie powinien być jedynym, który go ocenia. Zespół rozliczany z tego, czy agent dobrze wygląda, nie jest najlepszym sędzią tego, czy agent dobrze działa.
To dowody sprawiają, że wynik jest wiarygodny
Oceniający powinien stosować tę samą kartę oceny niezależnie od tego, czy rozmowę obsłużył człowiek, Państwa własny bot, czy AI innego dostawcy. Kaizo ocenia 100% rozmów konsultantów i agentów AI według Państwa własnej karty oceny, a każdy wynik prowadzi do dowodu w rozmowie, więc ocenę agenta można sprawdzić, zamiast przyjmować ją na wiarę.
O co zapytać dostawcę rozwiązania QA
- Czy możecie ocenić agenta AI zbudowanego przez kogoś innego według tej samej karty oceny, której używamy my?
- Czy każdy wynik prowadzi do dowodu, tak żebyśmy mogli sprawdzić Waszą ocenę, zamiast przyjmować ją na wiarę?
Krok 4: wychwytywać błędy typowe dla AI
Gdy ocena obejmuje już każdą rozmowę, warto skierować ją na błędy, które występują tylko przy automatyzacji albo które automatyzacja wzmacnia. Te kategorie warto wyodrębnić i śledzić w czasie.
| Rodzaj błędu | Jak wygląda | Co sprawdza karta oceny |
|---|---|---|
| Błędna informacja | Agent podaje nieprawdziwą zasadę, cenę albo krok | Czy każde stwierdzenie było poprawne i oparte na Państwa źródłach? |
| Pominięta eskalacja | Agent dalej prowadzi sprawę, którą powinien był przekazać konsultantowi | Czy eskalował przy właściwym wyzwalaczu i na czas? |
| Halucynowana pewność | Błędna odpowiedź podana tak, jakby była pewna | Czy agent unikał wymyślania szczegółów, których nie mógł zweryfikować? |
| Niewłaściwy ton | Robotyczny albo lekceważący język w kontakcie ze sfrustrowanym klientem | Czy ton pasował do stanu emocjonalnego klienta? |
| Naruszenie zasad | Agent robi coś, czego miał odmówić | Czy pozostał w granicach zasad i bezpieczeństwa? |
Krok 5: przekazać wnioski dalej i ocenić ponownie
Kontrola jakości ma sens tylko wtedy, gdy zmienia zachowanie. Każdy wynik w Kaizo prowadzi do dokładnego momentu w transkrypcji, z którego wynika, więc błąd to nie tylko flaga, ale konkretny, powtarzalny przykład, na podstawie którego można działać.
Zamknąć pętlę
- Błędy poprawności kierować z powrotem do promptu, bazy wiedzy albo źródła, które dało błędną odpowiedź.
- Pominięte eskalacje zamieniać w zaostrzoną regułę routingu albo wyzwalacz.
- Powtarzające się błędy grupować, żeby naprawić wzorzec raz, zamiast łatać przypadki jeden po drugim.
Następnie trzeba ocenić rozmowy ponownie, żeby potwierdzić, że poprawka zadziałała. Pełne, ciągłe pokrycie pokazuje efekt zmiany we wszystkich rozmowach, a nie w próbce, która może przeoczyć regresję.
Najczęstsze błędy, których warto unikać
Kilka błędów po cichu osłabia programy kontroli jakości AI, zanim zaczną przynosić wartość.
- Próbkowanie AI tak samo jak konsultantów: 2-procentowa próbka bota o dużym wolumenie niemal z założenia pomija systematyczne błędy.
- Ocena agenta wyłącznie przez zespół, który go zbudował: bez niezależnego oceniającego dobrze wyglądający wynik to nie to samo co dobra praca.
- Ocena bez dowodów: liczby, której nie da się powiązać z linijką transkrypcji, nie można zweryfikować, wykorzystać w coachingu ani zakwestionować.
- Używanie karty oceny konsultantów bez zmian: typowe błędy AI, takie jak halucynacje i fałszywa pewność, wymagają własnych kryteriów.
- Mierzenie bez przekazywania wniosków dalej: kontrola jakości, która nie zmienia promptów, zabezpieczeń ani routingu, to tylko raportowanie.
Najczęściej zadawane pytania
Jak prowadzić kontrolę jakości agenta AI lub chatbota?
Należy zbudować kartę oceny, która opisuje dobrą rozmowę obsłużoną przez AI i obejmuje poprawność, rozwiązanie sprawy, właściwą eskalację, ton i przestrzeganie zasad. Według niej trzeba automatycznie oceniać 100% rozmów AI, zachować niezależność oceniającego od ocenianej AI i powiązać każdy wynik z dowodem w transkrypcji, żeby błędy dało się zweryfikować i naprawić.
Dlaczego oceniający musi być niezależny od agenta AI?
Jeśli agenta AI oceniają wyłącznie ci, którzy go zbudowali, mają oni interes w tym, żeby agent dobrze wypadł. Wiarygodność wynikowi daje oceniający, który wiąże każdy wynik z dowodem w rozmowie, bo każdy może go sprawdzić.
Czy można używać tej samej karty oceny dla agentów AI i konsultantów?
Można współdzielić kryteria, które dotyczą obu grup, na przykład rozwiązanie sprawy i ton, dzięki czemu kontrola jakości AI i konsultantów pozostaje porównywalna. AI potrzebuje jednak dodatkowych kryteriów dla własnych typowych błędów, takich jak halucynacje i fałszywa pewność, więc najlepszym podejściem jest jeden standard z dodanymi kontrolami specyficznymi dla AI.
Jakie błędy agentów AI zdarzają się najczęściej?
Pięć kategorii, które warto śledzić, to błędna informacja, pominięta eskalacja, halucynowana pewność, niewłaściwy ton i naruszenie zasad. Każda z nich ma w karcie oceny własne kryterium, dzięki czemu błąd można wyodrębnić, powiązać z transkrypcją i śledzić w czasie.
Jaką część rozmów AI należy objąć kontrolą jakości?
Wszystkie. AI pracuje przy wolumenach, z których żaden zespół nie pobierze sensownej próbki, a systematyczna wada powtarza się w każdej rozmowie obsłużonej przez agenta, więc mała próbka zwykle jej nie wychwyci. Automatyczna ocena 100% rozmów pozwala wcześnie wykryć takie wzorce.
Powiązane artykuły
- Czym jest agentic QA? (po angielsku)
- Czym jest auto QA? (po angielsku)
- Czym jest agent AI? (po angielsku)
- Jak mierzyć skuteczność agentów AI
- Czym jest LLM as a judge? (po angielsku)
- Jak dokładna jest ocena jakości przez AI?
- Jak napisać kryteria oceny, które AI naprawdę oceni (po angielsku)
- Jak zweryfikować ocenę QA przez AI w tydzień (po angielsku)
- Fałszywe alarmy w automatycznej kontroli QA (po angielsku)