Dokładność oceny jakości przez AI jest tak dobra, jak standard, względem którego się ją kalibruje. Przy kryteriach obiektywnych, takich jak weryfikacja tożsamości czy poprawność informacji, QA oparte na AI w większości przypadków zgadza się z recenzentem po kalibracji, a najsłabiej radzi sobie z ocenami subiektywnymi, takimi jak niuanse empatii. Dokładność to liczba, którą mierzy się na własnych rozmowach, a nie obietnica, którą trzeba przyjąć na wiarę.
W skrócie
- Dokładność QA opartego na AI to odsetek zgodności między wynikiem automatycznym a oceną recenzenta po kalibracji, który stosuje te same kryteria.
- Automatyczna ocena jest najdokładniejsza przy kryteriach obiektywnych, które można sprawdzić na podstawie dowodów, a najmniej dokładna przy ocenach subiektywnych.
- Jej prawdziwa przewaga nad ręczną kontrolą jakości to spójność: te same kryteria stosowane do każdej rozmowy, bez zmęczenia i bez dryfu.
- Każdy wynik powinien prowadzić do transkrypcji, tak aby każdy pojedynczy rezultat można było sprawdzić, wykorzystać w coachingu albo podważyć.
- Dokładność można samodzielnie zmierzyć i poprawić dzięki zestawowi referencyjnemu, porównaniu kryterium po kryterium i okresowym ponownym sprawdzeniom.
Co właściwie oznacza dokładność w QA opartym na AI?
Dokładność w QA opartym na AI oznacza, w jakim stopniu wynik automatyczny zgadza się z recenzentem po kalibracji, który stosuje te same kryteria. Nie istnieje uniwersalna prawda o tym, czy rozmowa z obsługą klienta była dobra, bo jakość definiują Państwa procedury, ton komunikacji i definicja rozwiązanej sprawy. Dokładność to zgodność z Państwa standardem i właśnie dlatego da się ją zmierzyć.
Ta zmiana perspektywy ma znaczenie, bo wyniku QA opartego na AI nie trzeba przyjmować na wiarę. Buduje się zestaw referencyjny (po angielsku) z rozmów, które doświadczeni recenzenci już ocenili i co do których się zgodzili, uruchamia się system automatyczny na tych samych rozmowach i mierzy odsetek zgodności. Przy kryteriach typu zaliczone lub niezaliczone można pójść dalej i zmierzyć precyzję i czułość (precision i recall) dla błędów krytycznych: ile z rozmów oznaczonych przez system człowiek uznaje za rzeczywiste błędy oraz ile rzeczywistych błędów system wychwycił.
System QA oparty na AI, który jest skalibrowany względem ludzkiego standardu i regularnie sprawdzany, nie jest czarną skrzynką. To metoda oceny, której dokładność można wyrazić liczbą. Jeśli wciąż wybierają Państwo narzędzie, strona o oprogramowaniu do automatycznej kontroli jakości pokazuje, jak Kaizo stosuje to do każdej rozmowy, a przewodnik po automatycznej kontroli jakości przedstawia szerszy obraz.
Kiedy dokładność oceny jakości przez AI jest najwyższa?
Ocena QA przez AI jest najdokładniejsza przy kryteriach, które można sprawdzić na podstawie dowodów w transkrypcji. Im jaśniejsze i bardziej obiektywne kryterium, tym wyższa zgodność z recenzentem. Weryfikacja tożsamości, obowiązkowe kroki i informacje oraz poprawność merytoryczna względem bazy wiedzy wypadają dobrze, a większość prawdziwej karty oceny jakości składa się właśnie z takich sprawdzeń.
Poniższa tabela pokazuje, jak zgodność zwykle zmienia się w zależności od rodzaju kryterium. Jak te kryteria łączą się w działającą całość, widać na karcie oceny rozmów.
| Rodzaj kryterium | Przykład | Na ile da się sprawdzić | Typowa dokładność |
|---|---|---|---|
| Obiektywne / binarne | Czy konsultant zweryfikował tożsamość klienta? | Tak lub nie, widoczne w transkrypcji | Bardzo wysoka |
| Zgodność z procesem | Czy wykonano obowiązkowe kroki i przekazano wymagane informacje? | Do sprawdzenia względem zdefiniowanego procesu | Wysoka |
| Poprawność merytoryczna | Czy przekazana informacja była naprawdę poprawna? | Do sprawdzenia względem bazy wiedzy | Wysoka przy dobrym oparciu w źródłach |
| Rozwiązanie sprawy | Czy problem klienta został naprawdę rozwiązany? | W większości do wywnioskowania z wyniku | Umiarkowana do wysokiej |
| Subiektywne niuanse | Czy empatia była szczera i we właściwym momencie? | Częściowo kwestia oceny | Umiarkowana, rośnie dzięki kalibracji |
Gdzie QA oparte na AI jest najmniej dokładne i jak sobie z tym radzić?
QA oparte na AI jest najmniej dokładne przy najbardziej subiektywnych ocenach: czy empatia wydawała się szczera, czy niejednoznaczna prośba została dobrze zrozumiana, czy przypadek graniczny powinien trafić do eskalacji. To te same oceny, co do których recenzenci nie zgadzają się między sobą, i to jest prawdziwy powód, dla którego są trudne. Można sobie z nimi poradzić dzięki kalibracji, jasnej ścieżce odwołań i dowodom za każdym wynikiem.
Rozwiązaniem nie jest ich unikanie, tylko kalibracja
Ludzie pozostają w procesie tam, gdzie ich osąd jest najcenniejszy. Recenzenci uzgadniają oceny kilku rozmów referencyjnych, kryteria są doprecyzowane tak, aby ich intencja była jednoznaczna, a automatyczna ocena jest sprawdzana względem tego uzgodnionego standardu. Kryteria subiektywne nigdy nie osiągną dokładności binarnego sprawdzenia, ale skalibrowane kryteria i jasna ścieżka odwołań (konsultant może zakwestionować wynik, a decyzję podejmuje człowiek) sprawiają, że są sprawiedliwe i spójne, a tego właśnie potrzebują zespoły.
Dlatego też każdy wynik powinien prowadzić do konkretnego dowodu, który go uzasadnia. Liczbę, którą można powiązać z linijką w transkrypcji, da się sprawdzić, wykorzystać w coachingu albo podważyć. Liczba, której nie da się z niczym powiązać, to miejsce, w którym zaufanie do QA opartego na AI się załamuje.
Dlaczego ocena przez AI jest lepsza od ludzkiej kontroli jakości, nawet przy sporadycznych błędach?
Ocena QA przez AI jest lepsza od ręcznej kontroli jakości, nawet przy sporadycznych błędach, ponieważ jest spójna i obejmuje każdą rozmowę. Ręczna kontrola jakości jest często traktowana jako dokładny punkt odniesienia, ale ludzka ocena ma dwa własne problemy z dokładnością: recenzenci z czasem zmieniają sposób oceniania i nie zgadzają się ze sobą, a przeczytać mogą tylko niewielką próbkę. Automatyzacja usuwa oba problemy, więc ogólny obraz jest bardziej wiarygodny.
Dryf i niespójność recenzentów
Dwóch recenzentów ocenia tę samą rozmowę inaczej, a ten sam recenzent ocenia inaczej w piątek po południu niż w poniedziałek rano. Standardy przesuwają się wraz ze zmianami w zespole. Maszyna stosuje identyczne kryteria do każdej rozmowy, bez zmęczenia i bez dryfu, więc nawet jeśli pojedynczy człowiek czasem dostrzeże więcej, zespół ludzi jako całość jest mniej spójny.
Problem próbkowania
Idealnie dokładny recenzent, który czyta 2% rozmów, nadal nie wie nic o pozostałych 98%. Najbardziej szkodliwe błędy kryją się w rozmowach, których nikt nie przeczytał. Automatyczna ocena 100% rozmów (po angielsku) to inny rodzaj dokładności: dokładność w odniesieniu do całej działalności, a nie jej niewielkiej próbki. W UiPath Kaizo zautomatyzowało 100% QA, osiągając ROI na poziomie 200% i wzrost wyniku jakości o 8%. Pełne pokrycie nie jest celem samym w sobie; to warunek, który usuwa błąd doboru próby, tak aby zmierzona dokładność opisywała Państwa działalność, a nie rozmowy, które akurat zostały wybrane.
Proszę zobaczyć to na własnych rozmowach. Kaizo ocenia 100% Państwa rozmów z obsługi klienta według Państwa własnej karty oceny, z dowodami za każdym wynikiem. Umów demo.
Jak zmierzyć i poprawić dokładność QA opartego na AI?
Dokładność QA opartego na AI mierzy się, porównując kryterium po kryterium wyniki automatyczne z zestawem referencyjnym, który najlepsi recenzenci już ocenili i co do którego się zgodzili. Poprawia się ją przede wszystkim, przepisując niejasne kryteria, a potem regularnie sprawdzając wyniki ponownie, aby dokładność z czasem nie spadała. Nie muszą Państwo ufać deklaracjom dostawcy: wystarczy zmierzyć dokładność na własnych rozmowach.
- Zbudować skalibrowany zestaw referencyjny: najlepsi recenzenci oceniają próbkę prawdziwych rozmów i uzgadniają odpowiedzi.
- Zmierzyć zgodność: uruchomić automatyczną ocenę na tym samym zestawie i porównać kryterium po kryterium, aby wiedzieć dokładnie, gdzie wyniki się zgadzają, a gdzie nie.
- Dopracować kryteria, nie tylko model: większość rozbieżności wynika z niejasnego kryterium. Warto przepisać je tak, aby człowiek i maszyna rozumieli je tak samo.
- Sprawdzać ponownie w czasie: okresowo powtarzać porównanie, aby dokładność nie spadała niepostrzeżenie wraz ze zmianami produktu i procedur.
- Wymagać identyfikowalności: każdy wynik powinien wskazywać linijki transkrypcji, z których wynika, tak aby każdy pojedynczy rezultat można było sprawdzić albo podważyć, zamiast się o niego spierać.
Wersję krok po kroku opisuje tygodniowy protokół walidacji oceny QA przez AI (po angielsku). Można też najpierw uruchomić wyniki automatyczne równolegle z ocenami recenzentów w trybie shadow scoring (po angielsku), zanim zacznie się na nich polegać.
Kaizo ocenia 100% rozmów konsultantów i agentów AI według karty oceny, której Państwa firma faktycznie używa, wiąże każdy wynik z dowodem w transkrypcji i pozwala przetestować tę ocenę na własnym zestawie referencyjnym, aż będą Państwo mogli podać własny wskaźnik zgodności. System oceny, którego wyników nie da się sprawdzić, może jedynie prosić Państwa o przyjęcie jego liczby na wiarę.
Jakie błędy najczęściej popełnia się przy ocenie dokładności QA opartego na AI?
Najczęstsze błędy to porównywanie z recenzentami, którzy nie zgadzają się między sobą, ocenianie wyłącznie na podstawie kryteriów subiektywnych, ignorowanie próbki, na której opiera się porównanie, oraz akceptowanie wyników bez dowodów. Każdy z nich sprawia, że QA oparte na AI wygląda na bardziej lub mniej dokładne, niż jest w rzeczywistości na Państwa rozmowach, a podawana liczba przestaje cokolwiek znaczyć.
- Porównywanie QA opartego na AI z nieskalibrowanym recenzentem: jeśli Państwa recenzenci nie zgadzają się między sobą, nie są wiarygodnym punktem odniesienia dla dokładności.
- Ocenianie dokładności tylko na kryteriach subiektywnych: większość karty oceny to kryteria obiektywne, przy których AI jest najmocniejsze, więc ocenę należy ważyć tak, jak faktycznie ważone są kryteria.
- Ignorowanie próbki, na której się ocenia: nieco mniej dokładny wynik dla każdej rozmowy mówi o Państwa działalności znacznie więcej niż idealny wynik dla wybranego przez kogoś wycinka 2%.
- Akceptowanie wyników bez dowodów: jeśli wynik nie prowadzi do transkrypcji, w ogóle nie da się sprawdzić jego dokładności. Wynik, którego nie można sprawdzić, to opinia z przypisaną liczbą.
Kiedy ocena przez AI nie jest dla Państwa
Ocena QA przez AI nie jest właściwym pierwszym krokiem dla każdego zespołu. Jeśli obsługują Państwo kilka zgłoszeń tygodniowo, jeden recenzent może przeczytać je wszystkie, a pełne pokrycie niewiele wnosi. Jeśli nie mają Państwo jeszcze karty oceny, od niej należy zacząć, bo automatyczna ocena jest tylko tak dokładna, jak kryteria, które stosuje.
Najpierw warto napisać i skalibrować kryteria razem z recenzentami. A jeśli pytania o jakość dotyczą głównie rzadkich, bardzo subiektywnych przypadków, dla nich lepszym narzędziem pozostaje ocena przez człowieka.
Gdy będą Państwo gotowi oceniać każdą rozmowę według skalibrowanego standardu, proszę zobaczyć, jak robi to w Kaizo oprogramowanie do automatycznej kontroli jakości, albo umówić demo, a uruchomimy je na Państwa rozmowach.
Najczęściej zadawane pytania
Jak dokładna jest ocena QA przez AI?
Przy kryteriach obiektywnych, które można sprawdzić na podstawie dowodów, takich jak zgodność z procesem i poprawność merytoryczna, dobrze skonfigurowany system QA oparty na AI zgadza się z recenzentem po kalibracji w zdecydowanej większości przypadków. Dokładność jest niższa przy ocenach subiektywnych, takich jak niuanse empatii, i tam ludzka kalibracja pozostaje w procesie. Najlepszy sposób, by poznać własną liczbę, to zmierzyć zgodność na zestawie rozmów, które recenzenci już ocenili.
Czy można zaufać AI w ocenie jakości obsługi klienta?
Tak, jeśli każdy wynik prowadzi do dowodu w transkrypcji, a zgodność z Państwa skalibrowanymi recenzentami została sprawdzona. Weryfikacja ma znaczenie, bo pozwala na własnych rozmowach wykazać, czy system oceny ma rację, czy nie, zamiast przyjmować deklarację na wiarę.
Czy QA oparte na AI jest dokładniejsze niż ludzka kontrola jakości?
Jest bardziej spójne, co w praktyce czyni je dokładniejszym w odniesieniu do całej działalności. Ludzcy recenzenci z czasem zmieniają sposób oceniania, nie zgadzają się ze sobą i mogą przeczytać tylko niewielką próbkę. AI stosuje te same kryteria do 100% rozmów bez zmęczenia, więc wychwytuje problemy systemowe, które umykają ręcznej próbce 2%. Ludzie pozostają bardziej wnikliwi przy rzadkich, bardzo subiektywnych przypadkach.
Jak kalibruje się QA oparte na AI względem wyników ludzkiej kontroli jakości?
Recenzenci oceniają zestaw referencyjny rozmów i uzgadniają odpowiedzi, a następnie wyniki automatyczne dla tych samych rozmów porównuje się kryterium po kryterium. Tam, gdzie się różnią, zwykle przepisuje się kryterium tak, aby człowiek i maszyna rozumieli je tak samo. Porównanie powtarza się okresowo, aby obie oceny pozostały zgodne.
Czy QA oparte na AI zastępuje recenzentów?
Nie. Zastępuje ręczne ocenianie tysięcy rozmów, dzięki czemu recenzenci mogą zająć się pracą, którą tylko oni mogą wykonać: kalibracją standardu, rozpatrywaniem odwołań i coachingiem w oparciu o błędy, które wychwytuje system. Właściwy model to AI dla pokrycia i spójności, ludzie dla kalibracji i osądu.
Czy QA oparte na AI ocenia rozmowy agentów AI równie dobrze jak rozmowy konsultantów?
Tak. Kaizo ocenia 100% rozmów konsultantów i agentów AI według tej samej karty oceny, a każdy wynik jest powiązany z dowodem w transkrypcji. Dzięki temu dokładność mierzy się w ten sam sposób dla obu, względem zestawu referencyjnego uzgodnionego przez Państwa recenzentów.
Powiązane pojęcia
- Czym jest LLM as a judge? (po angielsku)
- Czym jest auto QA? (po angielsku)
- Kontrola jakości agentów AI i chatbotów
- Czym jest kalibracja oceny jakości?
- Czym jest 100% pokrycia QA? (po angielsku)