Przejdź do treści

Dobre praktyki

Ciche błędy agentów AI i polityka eskalacji

Ciche błędy agentów AI: brak eskalacji i pięć innych błędów, które dashboard liczy jako sukces, oraz sygnały, które ujawnią każdy z nich przed klientami.

· 8 min czytania

Zweryfikowane przez Dominik Blattner, założyciel Kaizo

Na tej stronie

Cichy błąd to pomyłka agenta AI, którą Państwa wskaźniki liczą jako sukces. Zgłoszenie zostaje zamknięte, wskaźnik containment notuje wygraną, a klient odchodzi z błędną odpowiedzią albo niezaspokojoną potrzebą. Wśród cichych błędów agentów AI jednym z najtrudniejszych do zauważenia jest niebezpieczny brak eskalacji, czyli sytuacja, w której agent AI zatrzymuje sprawę, którą powinien był przekazać człowiekowi, bo żadne zdarzenie eskalacji nigdy nie zostaje zarejestrowane.

W skrócie

  • Ciche błędy agentów AI występują w sześciu typowych odmianach, od pewnego siebie zmyślania po płynną odpowiedź na niewłaściwe pytanie.
  • Niebezpieczny brak eskalacji to najcichszy typ, bo sprawa, która nigdy nie trafia do człowieka, na każdym dashboardzie wygląda na samoobsługę.
  • Błędy agentów AI się powtarzają: jedna słabość promptu powoduje ten sam błąd za każdym razem, gdy wracają jej warunki.
  • Aby znaleźć ciche błędy, trzeba oceniać to, co agent AI powiedział, w każdej rozmowie, według własnych spisanych kryteriów.

Dlaczego ciche błędy szkodzą najbardziej

Gdy agent AI zawodzi głośno, od razu Państwo o tym wiedzą. Zgłasza błąd, eskaluje, mówi klientowi, że nie może pomóc, i do rozmowy wchodzi człowiek. Taki błąd jest uciążliwy, ale widoczny, a widoczne błędy są naprawiane, bo wychwytują je wskaźniki. Ciche błędy nie zostawiają wskaźnikom niczego do wychwycenia.

Cichy błąd wygląda inaczej. Agent kończy rozmowę, oznacza ją jako rozwiązaną i przechodzi dalej, choć zrobił coś źle, czego nikt nie zarejestrował. Containment liczy ją jako obsłużoną bez człowieka. Dashboard wolumenu liczy ją jako załatwioną. Flagę rozwiązania, jeśli w ogóle istnieje, ustawił sam agent, przekonany, że mu się udało. Każdy Państwa system monitorowania zgadza się, że rozmowa poszła dobrze, a jedyną osobą, która wie, że było inaczej, jest klient, który nie wypełnia Państwa ankiety.

Dlatego ciche błędy się kumulują: brakuje właśnie tej pętli informacji zwrotnej, która by je ujawniła. Dlatego też analityka obsługi klienta musi opierać się na tym, co zostało powiedziane w każdej rozmowie, a nie na flagach rozwiązania i ankietach. Nasz przewodnik po kontroli jakości agentów AI powstał po to, by tę pętlę zamknąć.

Sześć typów cichych błędów agentów AI

Sześć powtarzających się typów obejmuje większość tego, co po cichu idzie źle w agencie AI: pewne siebie zmyślanie, wymyślona polityka, fałszywe rozwiązanie, niebezpieczny brak eskalacji, wychodzenie poza zakres i odpowiedź na niewłaściwe pytanie. Nazwanie ich to połowa pracy, bo nie da się oceniać błędu, którego się nie zdefiniowało, a żaden z nich nie zgłasza błędu systemowego.

Cichy błądCo się dziejeDlaczego dashboard tego nie widzi
Pewne siebie zmyślanieAgent podaje wymyślony fakt tak, jakby był go pewienNie uruchamia się żadna flaga niepewności, a zgłoszenie zamyka się normalnie
Wymyślona politykaTworzy wiarygodnie brzmiącą zasadę zwrotu, gwarancji lub uprawnień, która nie istniejeBrzmi autorytatywnie, więc nikt jej nie kwestionuje, dopóki klient nie zażąda jej dotrzymania
Fałszywe rozwiązanieOgłasza, że problem został rozwiązany, choć nie zostałFlagę rozwiązania ustawia agent, a containment liczy to jako wygraną
Niebezpieczny brak eskalacjiDalej prowadzi sprawę, którą powinien był przekazać człowiekowiNie zostaje zarejestrowane żadne zdarzenie eskalacji, więc sprawa wygląda na samoobsługę
Wychodzenie poza zakresOdpowiada lub obiecuje więcej, niż pozwalają mu uprawnieniaKlient jest w danej chwili zadowolony, więc sygnały satysfakcji wyglądają dobrze
Dobra odpowiedź, złe pytaniePłynnie odpowiada na pytanie, którego klient nie zadałPłynność i zamknięte zgłoszenie wyglądają na sukces

Pewne siebie zmyślanie to to, co większość zespołów nazywa halucynacją. Pozostałe pięć może wystąpić nawet wtedy, gdy wszystkie fakty są poprawne, dlatego samo sprawdzanie faktów ich nie wykrywa.

Co powinna obejmować polityka eskalacji dla agentów AI

Polityka eskalacji dla agentów AI to spisany zestaw reguł określających, kiedy agent musi się zatrzymać i przekazać sprawę człowiekowi. Wskazuje wyzwalacze, samo przekazanie i sposób, w jaki każda sprawa jest potem sprawdzana. Bez niej niebezpiecznego braku eskalacji nie da się oceniać, bo nikt nie określił, co agent powinien był zrobić.

Dobra polityka odpowiada na cztery pytania:

  1. Które prośby zawsze trafiają do człowieka? Na przykład klient, który prosi o rozmowę z człowiekiem, reklamacja wspominająca o krokach prawnych albo prośba wykraczająca poza to, o czym agent ma prawo decydować.
  2. Które sygnały wymuszają przekazanie w trakcie rozmowy? Na przykład to samo pytanie zadane dwa razy bez postępu, rosnąca frustracja albo klient, który sprawia wrażenie osoby w trudnej sytuacji.
  3. Co zawiera przekazanie? Człowiek powinien otrzymać kontekst, żeby klient nie musiał się powtarzać. Nasz przewodnik po przekazaniu rozmowy od bota do konsultanta wyjaśnia, jak oceniać ten krok.
  4. Jak sprawdzana jest każda sprawa? Proszę dodać „eskalował, gdy wymagała tego polityka” jako kryterium w karcie oceny agenta AI i oceniać je w rozmowach, które agent zamknął, a nie tylko w tych, które przekazał.

Rozmowy eskalowane też potrzebują własnych kryteriów. Jak ocenić eskalowane zgłoszenie wyjaśnia, jak przypisać każdy błąd do miejsca, w którym powstał.

Dlaczego błędy agentów AI się powtarzają, a nie rozpraszają

Błędy agentów AI się powtarzają, bo są strukturalne. Biorą się z promptu, pobranej wiedzy, modelu albo zabezpieczeń, więc ta sama słabość daje ten sam cichy błąd za każdym razem, gdy wracają te same warunki. Błędy konsultanta są w dużej mierze indywidualne i przypadkowe: gorszy dzień, źle odczytana wiadomość, luka w szkoleniu jednej osoby.

To zmienia stawkę. Jedna wymyślona polityka to jedna zła rozmowa. Ta sama słabość promptu, która przez miesiąc generuje tę wymyśloną politykę w każdej kwalifikującej się rozmowie, to ryzyko, które rośnie tak szybko jak samo wdrożenie. Zmienia to też sposób wykrywania: skoro błędy są systematyczne, próbkowanie jest złym narzędziem. Próbka 2% służy do szacowania przypadkowego odsetka i regularnie przeoczy błąd, który pojawia się tylko w określonym warunku, obecnym w części rozmów. Trzeba przejrzeć wszystkie.

Jak wychwycić ciche błędy, które ukrywają wskaźniki

Ciche błędy są niewidoczne dla wskaźników wolumenu i rozwiązań, bo mierzą one kształt rozmowy, a nie jej treść. Wychwycenie ich oznacza czytanie tego, co agent AI faktycznie powiedział, na dużą skalę, według zdefiniowanych kryteriów, w każdej rozmowie, i powiązanie każdego ustalenia z linijkami, które je spowodowały, tak by właściciel mógł usunąć przyczynę.

Ocena treści, a nie wyniku

W każdej rozmowie należy sprawdzić to, co psuje cichy błąd: czy każde twierdzenie było prawdziwe, czy każda polityka istniała, czy ogłoszone rozwiązanie było prawdziwe, czy agent eskalował, gdy powinien. To kryteria karty oceny agenta AI i właśnie na nie log routingu nie potrafi odpowiedzieć.

Pełne pokrycie

Skoro błędy są systematyczne, pokrycie nie jest dodatkiem. Ocena 100% rozmów (po angielsku) zamienia cichy błąd z incydentu, który ktoś w końcu zauważy, we wzorzec widoczny w tygodniu, w którym się zaczyna. W UiPath Kaizo zautomatyzowało 100% QA, osiągając 200% ROI i wzrost wyniku jakości o 8%, a to właśnie poziom pokrycia, przy którym błędy systematyczne stają się widoczne wcześnie.

Proszę zobaczyć to na własnych rozmowach. Kaizo ocenia 100% Państwa rozmów z obsługi klienta, także tych prowadzonych przez agenta AI, według Państwa własnych kryteriów. Umów demo.

Szukanie błędów, dla których nie ma jeszcze kryteriów

Karta oceny wychwytuje tylko błędy, które zostały nazwane, więc trzeba szukać tych, których jeszcze nie nazwano. Warto zacząć od rozmów, które agent AI oznaczył jako rozwiązane, a klient wrócił z tym samym problemem, albo w których ton stał się negatywny po odpowiedzi agenta. Gdy pojawi się nowy wzorzec, należy zapisać go jako kryterium i od tej pory go oceniać.

Powiązanie każdego ustalenia z dokładnymi linijkami

Cichy błąd da się naprawić tylko wtedy, gdy ktoś potrafi go wskazać. Kaizo ocenia 100% rozmów konsultantów i agentów AI według Państwa karty oceny, nazywa pewne siebie zmyślanie i fałszywe rozwiązanie po imieniu i wiąże każde ustalenie z dokładnymi linijkami, które je spowodowały. Właśnie ta identyfikowalność pozwala zanieść cichy błąd do osoby odpowiedzialnej za prompt i naprawdę go naprawić, zamiast spierać się, czy w ogóle wystąpił.

Kiedy pełny przegląd cichych błędów nie jest dla Państwa

Jeśli agent AI prowadzi kilka rozmów tygodniowo, wystarczy przeczytać je wszystkie samodzielnie; nie potrzeba do tego oprogramowania. Jeśli nie mają Państwo jeszcze spisanych kryteriów, proszę zacząć od karty oceny agenta AI, zanim zrobią Państwo cokolwiek innego.

A jeśli bot tylko kieruje klientów do właściwej kolejki, nie odpowiadając im, większość tych typów błędów nie może wystąpić, a logi routingu powiedzą Państwu większość tego, czego Państwo potrzebują.

Najczęściej zadawane pytania

Czym jest cichy błąd agenta AI?

Cichy błąd to pomyłka, która nie zostawia śladu we wskaźnikach, które Państwo obserwują. Rozmowa się kończy, zgłoszenie zostaje zamknięte, containment liczy to jako wygraną, a klient odchodzi z błędną odpowiedzią albo niezaspokojoną potrzebą. Jest niebezpieczny, bo każdy system monitorowania zgadza się, że rozmowa poszła dobrze, więc błąd kumuluje się niezauważony.

Jakie są główne typy cichych błędów agentów AI?

Pewne siebie zmyślanie (podawanie wymyślonych faktów), wymyślona polityka (tworzenie zasad, które nie istnieją), fałszywe rozwiązanie (ogłaszanie, że problem został rozwiązany, choć nie został), niebezpieczny brak eskalacji (prowadzenie sprawy, którą należało przekazać), wychodzenie poza zakres (działanie ponad przyznane uprawnienia) i płynna odpowiedź na niewłaściwe pytanie. Żaden z nich nie zgłasza błędu systemowego ani nie uruchamia flagi rozwiązania.

Dlaczego próbkowanie nie wychwytuje cichych błędów?

Bo błędy agentów AI są systematyczne, a nie przypadkowe. Słabość promptu daje ten sam błąd za każdym razem, gdy wracają jej warunki, często w określonej części rozmów. Mała losowa próbka służy do szacowania przypadkowego odsetka i regularnie przeoczy błąd skupiony w warunkach, których akurat nie objęła. Wzorzec ujawnia dopiero pełne pokrycie.

Czy cichy błąd to to samo co halucynacja?

Nie. Halucynacja, czyli pewne siebie zmyślanie, to jeden z sześciu typów. Agent AI może też wymyślić politykę, ogłosić fałszywe rozwiązanie, nie eskalować, działać ponad swoje uprawnienia albo odpowiedzieć na niewłaściwe pytanie, czasem nawet przy poprawnych faktach. Samo sprawdzanie faktów wykrywa tylko część problemu.

Czy wysoki wskaźnik containment oznacza, że agent AI działa?

Sam w sobie nie. Containment liczy rozmowę jako wygraną, gdy klient nie dotarł do człowieka, a fałszywe rozwiązanie albo niebezpieczny brak eskalacji wyglądają dokładnie tak samo. Trzeba ocenić, co agent powiedział, żeby wiedzieć, czy rozmowa obsłużona bez człowieka była dobra.

Kto powinien naprawić cichy błąd, gdy zostanie znaleziony?

Ten, kto odpowiada za przyczynę: prompt, pobraną wiedzę albo zabezpieczenia. Ponieważ błędy agentów AI są strukturalne, coaching nie naprawia ich tak, jak naprawia pomyłkę człowieka. Każde ustalenie powinno prowadzić do dokładnych linijek transkrypcji, żeby właściciel widział, co zmienić.

Powiązane artykuły

Znajdźmy błędy, które dashboard liczy jako sukces

Prosimy przynieść miesiąc rozmów, które agent AI oznaczył jako rozwiązane. Ocenimy je według Państwa własnych kryteriów, w każdej rozmowie, i pokażemy pewne siebie zmyślenia, wymyślone polityki i fałszywe rozwiązania, które containment policzył jako sukces. Każde ustalenie prowadzi do dokładnych linijek transkrypcji, a nasza analityka obsługi klienta pokazuje, które błędy są systemowe, żeby mogli Państwo zanieść je prosto do osoby odpowiedzialnej za prompt.

Umów demo Poznaj Agentic Auto QA

Na tej stronie

Zobacz to na własnych rozmowach

Ocenimy próbkę Państwa prawdziwych zgłoszeń według Państwa standardów, tak aby przykład był Państwa.

Zaufały nam zespoły obsługi klienta na całym świecie

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart