Wskaźnik deflekcji liczy kontakty, które nigdy nie trafiły do konsultanta, więc mierzy wolumen, a nigdy jakość. Trafna odpowiedź, klient, który się poddał, i pewna siebie błędna odpowiedź wyglądają tak samo, a większość programów kontroli jakości w ogóle tych rozmów nie ocenia.
W skrócie
- Najwięcej kosztuje pewna siebie błędna odpowiedź, bo nigdy nie kończy się eskalacją.
- Większość publikowanych benchmarków pochodzi od dostawców, których rozlicza się właśnie z tego wskaźnika.
- Ponowny kontakt w ciągu siedmiu dni to najtańszy test, a dane już są w Państwa helpdesku.
- Jeśli zgłoszenia obsłużone bez konsultanta wypadają z oceny, umyka Państwu cała praca bota.
Co naprawdę mierzy wskaźnik deflekcji?
Wskaźnik deflekcji to odsetek kontaktów przychodzących zamkniętych bez udziału konsultanta. Typowy wzór to liczba kontaktów zdeflektowanych podzielona przez liczbę wszystkich kontaktów, przy czym zdeflektowany oznacza, że kontakt od początku do końca obsłużyła samoobsługa albo agent AI.
Warto przeczytać tę definicję jeszcze raz, bo cały problem tkwi właśnie w niej. Licznik definiuje coś, co się nie wydarzyło. Człowiek się nie włączył. Nic w tym pomiarze nie pyta, czy problem klienta zniknął.
Dlatego ten wskaźnik zachowuje się tak dziwnie pod presją. Wystarczy utrudnić wyjście z centrum pomocy, a deflekcja rośnie. Wystarczy ukryć formularz kontaktowy za trzema kliknięciami, a deflekcja rośnie. Wystarczy pozwolić botowi odpowiadać pewnie, zamiast przekazywać rozmowę, gdy nie jest pewien, a deflekcja rośnie. Za każdym razem liczba się poprawia, a doświadczenie klienta się pogarsza, co jest znakiem rozpoznawczym wskaźnika mierzącego niewłaściwą rzecz.
Nie czyni go to bezużyteczną liczbą. Deflekcja to całkiem dobra miara przepustowości, a przepustowością naprawdę trzeba zarządzać. Przestaje być przydatna w chwili, gdy ktoś zaczyna ją czytać jako miarę jakości, co w większości organizacji dzieje się mniej więcej w drugim tygodniu.
Warto zapamiętać
Wskaźnik deflekcji to miara wolumenu przebrana za miarę jakości. Mówi, ile pracy wchłonął Państwa bot. Nie powie, czy ta praca została wykonana.
Dlaczego cztery różne wyniki wyglądają w danych identycznie?
Zdeflektowane zgłoszenie ma co najmniej cztery możliwe zakończenia, a raportowanie sprowadza wszystkie cztery do jednego wiersza. To najważniejsza rzecz, jaką trzeba zrozumieć o tym wskaźniku, i powód, dla którego dwa zespoły z tym samym wskaźnikiem deflekcji mogą mieć kłopoty zupełnie różnej skali.
Proszę przejść przez poniższą tabelę z myślą o własnym produkcie. Większość zespołów w kilka minut potrafi podać prawdziwy przykład każdego z czterech przypadków, i to samo w sobie jest wnioskiem.
| Co naprawdę się stało | Czego doświadczył klient | Jak wygląda to w danych o deflekcji | Gdzie widać to zamiast tego |
|---|---|---|---|
| Rzeczywiście rozwiązane | Dostał właściwą odpowiedź i poszedł dalej | Zdeflektowane | Nigdzie. To przypadek, za który Państwo płacą |
| Porzucone | Poddał się i nie wrócił | Zdeflektowane, identyczny rekord | Odejście klienta, ciche nieodnowienie umowy, utracone zamówienie |
| Przekierowane przez klienta | Wyszedł z czatu i zadzwonił, napisał e-mail albo opisał sprawę publicznie | Zdeflektowane, a drugi kontakt często liczy się jako nowe zgłoszenie | Wskaźnik ponownych kontaktów i Państwa własny wolumen przychodzący |
| Pewnie, ale błędnie | Dostał jasną, ale nieprawdziwą odpowiedź i na jej podstawie działał | Zdeflektowane, często z pozytywnymi sygnałami na powierzchni | Zwrot pieniędzy, reklamacja, incydent zgodności, kilka tygodni później |
Deflekcja, zatrzymanie i rozwiązanie to nie ta sama liczba
W materiałach dostawców te trzy pojęcia używane są zamiennie, a znaczą naprawdę różne rzeczy. Warto je uporządkować przed jakąkolwiek rozmową o celach.
- Deflekcja pyta, czy kontakt trafił do człowieka. Mierzy się ją przy wejściu i jest najluźniejsza z tych trzech.
- Zatrzymanie (containment) pyta, czy rozmowa pozostała w kanale zautomatyzowanym. Zatrzymana rozmowa wciąż może skończyć się źle; po prostu skończyła się źle u bota.
- Rozwiązanie pyta, czy problem klienta zniknął. To jedyna z trzech miar, która dotyczy klienta, i jedyna, której nie da się zmierzyć bez zapytania go albo przeczytania rozmowy.
Pieniądze leżą w luce między zatrzymaniem a rozwiązaniem. Zespół, który raportuje 70% zatrzymania i zakłada 70% rozwiązania, robi niezweryfikowany skok, a jego wielkość pozostaje nieznana, dopóki ktoś jej nie zmierzy. Zwykle nikt tego nie zrobił, bo pomiar oznacza czytanie rozmów zamiast wyciągania danych z dashboardu.
Gdy dostawca raportuje rozwiązanie, warto sprawdzić, czy system nie ocenia sam siebie. Agent AI, który sam decyduje, czy coś rozwiązał, nie jest dowodem, tylko samooceną, a NIST AI Risk Management Framework traktuje niezależny pomiar działania systemu AI jako osobną funkcję właśnie dlatego, że deklarowana przez sam system skuteczność nie jest pomiarem. Ta sama logika dotyczy dokładności oceny jakości przez AI w przeciwnym kierunku: każdy oceniający, człowiek czy model, potrzebuje, by jego dokładność potwierdziło coś z zewnątrz.
Uwaga
Jeśli Państwa agent AI raportuje własny wskaźnik rozwiązań, ta liczba jest samooceną i powinna być tak oznaczona w każdej prezentacji, w której się pojawia. Dowodem staje się wtedy, gdy coś niezależnego od agenta sprawdzi jej próbkę.
Dlaczego pewna siebie błędna odpowiedź kosztuje najwięcej?
Agent AI, który myli się pewnie, zamyka zgłoszenie. Agent AI, który myli się uczciwie, eskaluje je. Ta jedna asymetria decyduje o tym, o których błędach się Państwo dowiadują.
Każda eskalacja jest widoczna. Trafia do kolejki, czyta ją człowiek i jeśli jest wystarczająco źle, ktoś to mówi. Ścieżka eskalacji sama się zgłasza. Tymczasem rozmowa, w której bot wymyślił termin na zwrot, podał cenę nieobowiązującą od dwóch lat albo zapewnił kogoś, że jego dane usunięto, choć tak nie było, zostaje oznaczona jako rozwiązana i opuszcza firmę.
W efekcie zbiór błędów, o których naturalnie się Państwo dowiadują, jest systematycznie niewłaściwy. Słyszą Państwo o prawie-błędach ostrożnego bota, a nie wiedzą nic o prawdziwych błędach bota pewnego siebie. To ciche błędy, a nazwa jest precyzyjna: nie są rzadkie, są ciche.
Jest jeszcze efekt drugiego rzędu, który warto nazwać. Ponieważ eskalacje są widoczne, a deflekcja jest nagradzana, presja na każde wdrożenie AI działa w jednym kierunku: eskalować mniej. Zespoły stroją bota w stronę pewności. Bot ustawiony tak, by przekazywać rozmowę, gdy nie jest pewien, pokaże gorszy wskaźnik deflekcji i lepsze doświadczenie klienta, a jeśli na dashboardzie widnieje deflekcja, ten kompromis zostaje rozstrzygnięty odwrotnie. To, jak zaprojektowane i oceniane jest samo przekazanie rozmowy od bota do konsultanta, ma większe znaczenie niż wskaźnik po którejkolwiek stronie.
Wskazówka
Proszę posortować zdeflektowane rozmowy według tego, jak pewnie brzmi ostatnia wiadomość bota, a nie według ich długości. Krótkie, pewne, pozbawione zastrzeżeń wiadomości końcowe przy nietrywialnych pytaniach to miejsce, w którym skupiają się błędne odpowiedzi.
Jak przeprowadzić audyt własnego wskaźnika deflekcji?
Tej części nikt nie publikuje. Zajmuje mniej więcej pół dnia, a pierwsze podejście można zrobić jeszcze w tym tygodniu, bez nowych narzędzi.
Krok 1. Zbudować operat losowania, który dotąd był pomijany
Proszę pobrać wszystkie rozmowy z ostatniego pełnego miesiąca, które zamknięto bez udziału człowieka. Nie eskalowane, nie ogólną próbkę wszystkich zgłoszeń: konkretnie populację zdeflektowaną. Większość programów kontroli jakości domyślnie je odfiltrowuje, bo kolejkę ocen zbudowano wokół konsultantów, a do tych rozmów żaden konsultant nie jest przypisany. Ten filtr to martwe pole.
Krok 2. Najpierw warstwy, potem próbka
Proszę nie losować prostej próby losowej. Najpierw należy podzielić operat na trzy grupy, bo bazowy odsetek błędów różni się między nimi diametralnie:
- Zdeflektowane, bez dalszego kontaktu. Pozorne sukcesy i grupa, w której najpewniej kryją się pewne siebie błędne odpowiedzi.
- Zdeflektowane, a potem ponowny kontakt w ciągu siedmiu dni. Zdecydowanie najbardziej wydajna grupa. Jeśli mają Państwo tylko godzinę, warto zacząć tutaj.
- Zdeflektowane w temacie dotyczącym pieniędzy, tożsamości albo zobowiązania wynikającego z zasad. Najwyższe konsekwencje pojedynczego błędu i miejsce, gdzie leży ryzyko w obszarze ochrony danych.
Na pierwsze odczytanie wystarczy od dwudziestu do trzydziestu rozmów na grupę. Nie chodzi jeszcze o statystycznie obronny odsetek, tylko o ustalenie, czy problem istnieje i jaki ma kształt. Jeśli potem potrzebna będzie obronna liczba, logika doboru wielkości próby jest taka sama jak przy każdym innym próbkowaniu rozmów do oceny jakości.
Krok 3. Oceniać według kryteriów napisanych dla bota, nie dla człowieka
Obecna karta oceny tu nie zadziała. Połowa z niej mierzy rzeczy, których bot nie może zrobić źle, i nie mierzy tego, w czym bot zawodzi. Zamiast niej warto użyć karty oceny agenta AI i oceniać tylko to, co czytelnik może sprawdzić w transkrypcji. Większość sygnału niosą cztery kryteria:
- Poprawność faktów. Czy każde stwierdzenie o zasadach, cenie, terminach albo uprawnieniach było prawdziwe? To kryterium, które się liczy, i to, którego stara karta oceny niemal na pewno nie zawiera.
- Kompletność. Czy klient dostał wszystko, czego potrzebował, czy częściową odpowiedź, która zamyka zgłoszenie i gwarantuje drugi kontakt?
- Ocena eskalacji. Czy to powinno trafić do człowieka i czy trafiło?
- Uczciwa niepewność. Gdy bot nie wiedział, czy to powiedział, czy wyprodukował coś wiarygodnie brzmiącego?
Krok 4. Obliczyć liczbę, która się liczy
Prawdziwa liczba to odsetek zdeflektowanych rozmów, które rozwiązano poprawnie i w całości. Przy pierwszym pomiarze należy się spodziewać, że będzie wyraźnie niższa od raportowanego wskaźnika deflekcji. Ta luka jest właściwym wnioskiem i w rozmowie z zarządem jest warta więcej, niż kiedykolwiek był wart wskaźnik deflekcji, bo da się ją prześledzić do konkretnych rozmów, które każdy może otworzyć i przeczytać.
Jeśli powtarzają to Państwo co miesiąc, na tych samych warstwach, powstaje trend. W tym momencie przestaje to być audytem, a staje się kontrolą jakości Państwa agentów AI.
Jakie liczby powinny stać obok wskaźnika deflekcji?
Nie należy usuwać wskaźnika deflekcji. Trzeba go otoczyć, żeby nie dało się go czytać w oderwaniu. Większość pracy wykonują cztery towarzyszące miary, a każdą da się wyliczyć z danych, które już Państwo mają.
- Ponowny kontakt w ciągu siedmiu dni od deflekcji. Najlepszy test pod względem stosunku wartości do wysiłku. Jest obiektywny, nie wymaga ankiety, a klient, który wraca, to najwyraźniejszy możliwy sygnał, że pierwsza odpowiedź nie trafiła.
- Jakość eskalacji, a nie ich odsetek. Gdy bot przekazał rozmowę, czy była to właściwa decyzja i czy przekazanie zawierało kontekst? Sam odsetek jest niejednoznaczny, bo dobre i złe wdrożenie mogą dać ten sam wynik. Jakość obsługi eskalacji to wersja, którą da się odczytać.
- Niezadowolenie konkretnie w zdeflektowanych rozmowach. Należy je wyodrębnić, zamiast pozwolić mu rozpłynąć się w średniej, w której niewielki wolumen bardzo złych zautomatyzowanych interakcji znika. Sygnał niezadowolenia jest tu bardziej przydatny niż zadowolenie, bo zdeflektowana populacja odpowiada na ankiety jeszcze rzadziej niż ogół klientów.
- Zweryfikowany wskaźnik rozwiązań. Wynik opisanego wyżej audytu. To liczba, którą warto pokazać zarządowi, i jedyna na tej liście, która wymaga, by ktoś przeczytał rozmowę.
Ręczne czytanie zdeflektowanej populacji to punkt startu, ale też miejsce, w którym wszystko staje, bo wolumen jest duży, a bazowy odsetek błędów na tyle niski, że ręczna ocena próbki 3% nie wychwyci go w wiarygodny sposób. Auto QA od Kaizo ocenia rozmowy obsłużone przez AI i przez konsultantów według tych samych kryteriów, dzięki czemu porównanie jest uczciwe, i zachowuje uzasadnienie przy każdej rozmowie, więc oznaczoną odpowiedź można sprawdzić, zamiast przyjmować ją na wiarę. To 100% pokrycia, które ujawnia trendy niewidoczne przy próbkowaniu 3%, zastosowane do populacji, która nigdy nie trafiła do próbki.
Jeśli interesuje Państwa szerszy zestaw wskaźników wokół tego tematu, mierzenie skuteczności agentów AI opisuje warstwę operacyjną, a wskaźniki AI w obsłudze klienta to, co powinno trafić na dashboard.
Dlaczego nie warto ufać żadnemu publikowanemu benchmarkowi tego wskaźnika?
Warto spojrzeć, kto publikuje benchmarki deflekcji. Po wpisaniu tego hasła wyniki zdominowane są przez firmy sprzedające agenta AI, którego wartość wyraża się właśnie w deflekcji. To nie spisek, tylko kwestia bodźców, i warto ją nazwać, bo kształtuje każdą liczbę, na jaką Państwo trafią.
Trzy konkretne powody, dla których publikowany benchmark nie przenosi się na Państwa sytuację:
- Mianownik nie jest zdefiniowany. Czy obejmuje odsłony stron centrum pomocy? Czaty otwarte i zamknięte w cztery sekundy? Kontakty w kanałach, których bot nie obsługuje? Wystarczy przesunąć mianownik, by zmienić deflekcję o dwadzieścia punktów, nie zmieniając niczego realnego.
- Struktura kontaktów decyduje o wyniku. Zespół obsługujący resetowanie haseł i status zamówień osiągnie wyższą deflekcję niż zespół zajmujący się sporami o rozliczenia, z różnicą, która nie mówi nic o jakości żadnego z wdrożeń. Porównywanie różnych struktur kontaktów nie ma sensu.
- Nikt nie publikuje swoich porażek. Benchmarki pochodzą z wdrożeń, które zgadzają się na cytowanie, czyli z populacji z definicji przefiltrowanej.
Użyteczne porównanie to nie porównanie z liczbą branżową, tylko z samym sobą. Zweryfikowany wskaźnik rozwiązań z tego miesiąca w zestawieniu z poprzednim, przy tej samej strukturze kontaktów i tych samych kryteriach, mówi coś prawdziwego. Benchmark branżowy mówi coś, co dobrze się cytuje.
Najczęściej zadawane pytania
Jaki wskaźnik deflekcji jest dobry?
Nie ma odpowiedzi, którą dałoby się przenieść, a każdą liczbę podawaną jako taką należy traktować podejrzliwie. Deflekcja zależy niemal wyłącznie od struktury kontaktów i od tego, jak zdefiniowano mianownik, więc zespół obsługujący status zamówień pokaże znacznie wyższy wskaźnik niż zespół zajmujący się sporami o rozliczenia, bez żadnej różnicy w jakości. Porównanie, które coś znaczy, to własny zweryfikowany wskaźnik rozwiązań z miesiąca na miesiąc, przy stabilnej strukturze kontaktów.
Czym różni się wskaźnik deflekcji od wskaźnika zatrzymania?
Deflekcja pyta, czy kontakt trafił do człowieka. Zatrzymanie pyta, czy rozmowa pozostała w kanale zautomatyzowanym. Żaden z nich nie pyta, czy problem klienta został rozwiązany, czyli o rozwiązanie, a rozwiązania nie da się zmierzyć bez zapytania klienta albo przeczytania rozmowy. Zatrzymana rozmowa wciąż mogła skończyć się źle.
Skąd wiadomo, że agent AI udziela błędnych odpowiedzi?
Należy przeczytać warstwową próbkę rozmów, które zamknął bez eskalacji, czyli populacji, którą większość programów kontroli jakości odfiltrowuje. Warto zacząć od zdeflektowanych rozmów, po których klient skontaktował się ponownie w ciągu siedmiu dni, bo odsetek błędów jest w tej grupie znacznie wyższy niż w całej populacji. Oceniać je trzeba pod kątem poprawności faktów i kompletności, a nie tonu.
Czy wysoki wskaźnik deflekcji oznacza, że klienci są zadowoleni?
Nie, a może oznaczać coś odwrotnego. Deflekcja liczy brak człowieka, więc klient, który się poddał, przeszedł do innego kanału albo przyjął pewną siebie błędną odpowiedź, tworzy taki sam rekord jak ten, któremu naprawdę pomogono. Utrudnianie kontaktu z człowiekiem podnosi deflekcję i obniża zadowolenie, dlatego ten wskaźnik trzeba czytać razem z odsetkiem ponownych kontaktów.
Czy rozmowy obsłużone przez AI powinny być objęte programem kontroli jakości?
Tak, a większość programów dziś ich nie obejmuje, bo kolejki ocen zbudowano wokół konsultantów, a do tych rozmów żaden konsultant nie jest przypisany. Jeśli zdeflektowane zgłoszenia są wyłączone z próbki, w widoczności jakości powstaje luka dokładnie tak duża jak praca wykonywana przez bota. Należy je oceniać według kryteriów napisanych dla automatycznego systemu odpowiedzi, a nie powielać karty oceny konsultantów.
Czytaj także
- Your AI agent is closing tickets. Who is checking it?
- Ciche błędy agentów AI
- What containment rate does and does not tell you
- Karta oceny agenta AI
- Kontrola jakości agentów AI i chatbotów
- Przekazanie rozmowy od bota do konsultanta
Co naprawdę dał Państwu wskaźnik deflekcji
Prosimy przynieść miesiąc rozmów, które agent AI zamknął samodzielnie. Ocenimy je według tych samych kryteriów co zgłoszenia obsłużone przez konsultantów i pokażemy lukę między tym, co zdeflektowane, a tym, co naprawdę rozwiązane.