Wagi kryteriów oceny warto ustalać na podstawie trzech rzeczy: jak bardzo uchybienie szkodzi klientowi, jakie ryzyko niesie dla firmy i na ile zależy od konsultanta. Jeśli nie da się wyjaśnić danej wagi, wynik nie przetrwa pierwszego odwołania.
W skrócie
- Równe wagi oznaczają, że każde kryterium jest tak samo ważne. To nigdy nie jest prawda.
- Wpływ konsultanta na wynik to czynnik, o którym wszyscy zapominają, a który konsultantom najbardziej przeszkadza.
- Kryteria krytyczne powinny być błędem krytycznym, który działa jak bramka, a nie pozycją wartą 60 punktów.
- Nowe wagi trzeba sprawdzić na już ocenionych rozmowach. Jeśli nikt nie zmienia przedziału, zmiana była kosmetyczna.
Dlaczego równe wagi po cichu psują kartę oceny
Niemal każda karta oceny jakości zaczyna od równych wag, bo wydaje się to sprawiedliwe i nie wymaga namysłu. Nie jest ani jednym, ani drugim. Równe wagi to twierdzenie, a brzmi ono tak: pominięcie powitania kosztuje firmę dokładnie tyle samo, co obsłużenie niewłaściwego zwrotu pieniędzy.
Wynikają z tego trzy rzeczy, w tej kolejności.
Wynik przestaje rozróżniać. Gdy dziesięć kryteriów jest wartych po dziesięć punktów, poważne uchybienie i kosmetyczne kosztują tyle samo. Dwóch konsultantów kończy z wynikiem 90: jeden, bo odpowiadał zdawkowo, drugi, bo przekazał klientowi błędną informację o jego pieniądzach. Liczba, która nie odróżnia tych dwóch przypadków, nie mierzy jakości.
Konsultanci optymalizują tanie kryteria. Ludzie reagują na tablicę wyników, którą się im daje. Jeśli ton i powitanie to punkty najłatwiejsze do utrzymania i najtrudniejsze do stracenia, właśnie tam idzie wysiłek. To nie jest oszukiwanie systemu, tylko karta oceny działająca dokładnie tak, jak ją zaprojektowano.
Wynik odkleja się od biznesu. Gdy wyniki jakości przestają iść w parze z eskalacjami, ponownymi otwarciami i niezadowoleniem klientów, kierownictwo po cichu przestaje z nich korzystać. Program trwa, oceny trwają, a nikt nie podejmuje na ich podstawie żadnej decyzji. W takim stanie jest dziś większość programów kontroli jakości.
Szybka diagnoza. Proszę wziąć dwóch konsultantów z najwyższymi wynikami z zeszłego miesiąca i dwóch z najniższymi. Jeśli nie da się wskazać realnej różnicy w doświadczeniu, jakie zapewnili klientom, wagi nie niosą żadnej informacji. Zanim zmienią Państwo wagi, warto upewnić się, że same kryteria są solidne. To osobne zadanie, opisane w tekście czym są kryteria oceny jakości i jak je zbudować.
Warto zapamiętać
Równe wagi to nie brak decyzji. To decyzja, że każde kryterium jest tak samo ważne, podjęta domyślnie i nigdy nieweryfikowana.
Trzy modele wag i kiedy który jest właściwy
W praktyce stosuje się tylko trzy modele. Błędem nie jest wybór niewłaściwego, tylko wybór przypadkowy i brak powrotu do tej decyzji.
| Model | Jak działa | Właściwy, gdy | Zawodzi, gdy |
|---|---|---|---|
| Płaski | Każde kryterium ma tyle samo punktów | Program jest nowy, kryteriów jest mniej niż około dziesięciu i naprawdę nie wiadomo jeszcze, co jest ważne | Są dane o wynikach biznesowych, a nadal się je ignoruje. Model płaski powinien być punktem wyjścia, a nie stanem docelowym |
| Ważony wpływem | Kryteria mają różną liczbę punktów, zależnie od wpływu na klienta i firmę | Program jest na tyle dojrzały, że ma dane, a recenzenci potrafią uzasadnić każdą wagę | Wagi ustala ten, kto najgłośniej mówi na spotkaniu, i nikt do nich nie wraca |
| Odejmowanie od maksimum | Każda rozmowa zaczyna od 100 i traci punkty za każde uchybienie, a waga uchybienia decyduje o potrąceniu | Większość rozmów jest w porządku i szuka się wyjątków albo praca jest mocno związana ze zgodnością z przepisami | Nie ma dolnej granicy, więc jedna zła rozmowa schodzi głęboko poniżej zera i zaburza średnią konsultanta |
Jak ustalić wagi kryteriów oceny na podstawie danych, a nie opinii
Wagi opiera się na trzech czynnikach, w tej kolejności. Nie jest to nic specyficznego dla kontroli jakości w obsłudze klienta: podręcznik rządu Wielkiej Brytanii poświęcony analizie wielokryterialnej omawia ten sam problem oceniania opcji według kryteriów i nadawania tym kryteriom wag, a jego główne ostrzeżenie brzmi: wagi niosą ocenę wartościującą, niezależnie od tego, czy ktoś to przyznaje.
Wpływ na klienta. O ile gorszy jest dzień tego klienta, bo kryterium nie zostało spełnione? Błędna informacja o zwrocie pieniędzy waży więcej niż brak pożegnania, i to zdecydowanie.
Ryzyko biznesowe i regulacyjne. Ile uchybienie kosztuje poza tą jedną rozmową? Wszystko, co ma skutki prawne, finansowe albo dotyczące ochrony danych, trafia na samą górę, a część z tego w ogóle nie powinna znaleźć się wśród kryteriów z wagami.
Wpływ konsultanta. Ten czynnik się pomija, a konsultanci go zauważają. Jeśli kryterium zależy od wolnego systemu wewnętrznego, procedury, której konsultant nie może nagiąć, albo przekazania sprawy przez inny zespół, wysoka waga karze ludzi za Państwa proces. Albo należy nadać mu niską wagę, albo naprawić proces i przestać to kryterium oceniać.
Wagi niosą ocenę wartościującą, niezależnie od tego, czy ktoś to przyznaje.
Parafraza podręcznika analizy wielokryterialnej rządu Wielkiej Brytanii
Godzina analizy, która załatwia większość pracy
Proszę wziąć rozmowy z trzech miesięcy, które już zostały ocenione. Dla każdego kryterium trzeba podzielić je na te, w których kryterium spełniono, i te, w których nie, a następnie porównać w obu grupach jeden późniejszy wynik. Wskaźnik ponownych otwarć to najlepszy pojedynczy wybór, bo jest obiektywny i już jest w helpdesku. Sprawdzą się też wskaźnik eskalacji i niezadowolenie.
Szuka się wielkości różnicy. Kryterium, którego niespełnienie mocno zmienia wskaźnik ponownych otwarć, zasłużyło na wagę. Kryterium, którego niespełnienie niczego nie zmienia, nie zasłużyło i powinno spaść niżej na skali albo całkiem zniknąć z karty oceny.
Dwa uczciwe zastrzeżenia. To korelacja, a nie przyczynowość, więc ta analiza służy do uszeregowania kryteriów, a nie do wyliczenia dokładnych wartości punktowych. Kryteria, które są niespełniane bardzo rzadko, nie dadzą czytelnego sygnału, a to zwykle wskazówka, że należą do błędów krytycznych, a nie do puli kryteriów z wagami.
Wskazówka
Jako zmienną wynikową warto przyjąć wskaźnik ponownych otwarć. Jest obiektywny, jest już w helpdesku i, w przeciwieństwie do satysfakcji, nie zależy od tego, czy ktoś odpowie na ankietę.
Błąd krytyczny to bramka, a nie wysoka waga
Oto najczęstszy błąd w projektowaniu karty oceny. Zespół uznaje, że naruszenie ochrony danych klienta (po angielsku) jest niedopuszczalne, więc przypisuje mu 60 ze 100 dostępnych punktów.
To nie działa tak, jak zespół zakłada. Konsultant może naruszyć ochronę danych i nadal dostać 40, a jeśli reszta karty jest hojna, może zamknąć miesiąc z przyzwoitą średnią. Zachowanie, które zespół nazwał niedopuszczalnym, jest arytmetycznie do przeżycia.
Jeśli jakieś zachowanie ma unieważniać interakcję, musi być zero-jedynkową bramką, która zeruje wynik i stoi całkowicie poza pulą kryteriów z wagami. Do tego służy błąd krytyczny. Trzy zasady sprawiają, że pozostaje użyteczny:
- Niewiele. Od trzech do pięciu. Karta oceny z tuzinem błędów krytycznych to karta, w której wszystko jest krytyczne, a więc nic nie jest.
- Jednoznacznie. Na pytanie o błąd krytyczny dwóch recenzentów, którzy nigdy ze sobą nie rozmawiali, musi umieć odpowiedzieć tak lub nie. „Był niegrzeczny” tego warunku nie spełnia. „Ujawnił dane konta bez przeprowadzenia weryfikacji tożsamości” spełnia.
- Z drugim recenzentem. Wyzerowanie czyjegoś wyniku to poważny krok i powinno to programowi coś kosztować.
Po wydzieleniu błędów krytycznych łatwiej myśleć o puli kryteriów z wagami, bo wszystko, co w niej zostało, jest kwestią stopnia, a nie rodzaju.
Uwaga
Przypisanie kryterium krytycznemu 60 ze 100 punktów nie czyni go błędem krytycznym. Konsultant może go nie spełnić, nadal dostać 40, a przy hojnej karcie oceny zamknąć miesiąc na akceptowalnym poziomie. Jeśli zachowanie ma unieważniać interakcję, trzeba je zablokować bramką. Nie należy go wyceniać w punktach.
Dwubiegunowa karta oceny i dlaczego konsultanci przestają w nią wierzyć
Jest jeden konkretny stan awarii, który warto nazwać, bo jest częsty i zabójczy dla zaufania. Pojawia się, gdy karta oceny łączy długą listę błędów krytycznych z wysokimi potrąceniami za wszystko inne. Konsultanci opisują efekt zawsze tak samo: każda pozycja albo od razu zeruje wynik, albo kosztuje szesnaście punktów, więc w praktyce jedyne możliwe wyniki to ocena idealna albo katastrofa.
Proszę spojrzeć na rozkład wyników. Jeśli skupiają się na górze i na dole, a pośrodku jest bardzo mało, karta oceny przestała mierzyć i zaczęła sortować. Wynikają z tego dwie rzeczy. Cele takie jak 95% stają się arytmetycznie nieosiągalne dla każdego, kto prowadzi trudną rozmowę, więc osoby obsługujące najtrudniejsze zgłoszenia mają najgorsze wyniki. A ponieważ nie ma środka, nie ma też do czego prowadzić coachingu: jest tylko zaliczenie albo kara.
Rozwiązanie jest niemal zawsze takie samo: mniej błędów krytycznych i mniejsze potrącenia za pozostałe kryteria.
Jak przetestować nowe wagi przed wdrożeniem
Nigdy nie należy publikować karty oceny z nowymi wagami prosto na produkcję. Najpierw trzeba zrobić test wsteczny: zajmuje jedno popołudnie i zapobiega większości szkód.
Proszę wziąć próbkę rozmów ocenionych już według starych wag. Przeliczyć ich wyniki według nowych. Bez ponownej oceny: testuje się arytmetykę, a nie osąd. Następnie porównać rozkład.
Trzy możliwe odczyty, a każdy mówi coś konkretnego.
- Prawie nikt nie zmienia przedziału. Zmiana wag jest kosmetyczna. Wydano kapitał polityczny na zmianę, która niczego nie zmienia, więc trzeba albo pójść dalej, albo zostawić wagi w spokoju.
- Prawie wszyscy zmieniają przedział. To nie korekta wag, tylko zmiana standardu. Może być słuszna, ale trzeba ją ogłosić jako nowy standard, a nie przemycić jako drobne strojenie, bo inaczej straci się zaufanie zespołu.
- Część osób zmienia przedział, i są to niewłaściwe osoby. To przydatny przypadek. Jeśli konsultanci cenieni przez zespół mocno spadają, nowe wagi kodują przekonanie o jakości, którego Państwo tak naprawdę nie podzielają. Zanim pójdą Państwo dalej, trzeba znaleźć kryterium, które za to odpowiada.
Następnie, przed publikacją czegokolwiek, warto przeprowadzić jedną sesję kalibracyjną (po angielsku) na nowych wagach z całą grupą recenzentów. Wagi zmieniają to, o co spierają się recenzenci, a ten spór powinien odbyć się w sali, a nie podczas rozmowy indywidualnej z konsultantem. Jeśli punktem wyjścia ma być gotowy standard, szablony kart oceny QA (po angielsku) są rozsądną bazą do zmiany wag, zamiast zaczynać od pustej strony.
Wagi, gdy ocenia AI
Automatyczna ocena nie zmienia powyższych zasad. Zmienia stawkę w razie błędu, i to na dwa konkretne sposoby.
Błędy przestają być sporadyczne i stają się systemowe. Przy ręcznej ocenie próbki 3%, z jakiej korzysta większość programów, źle ustawiona waga zniekształca kilka rozmów w miesiącu, a dobry recenzent po cichu to koryguje. Przy pełnym, 100-procentowym pokryciu (po angielsku), które ujawnia trendy niewidoczne przy próbce 3%, ta sama zła waga jest stosowana do każdej rozmowy, konsekwentnie, zawsze w tym samym kierunku. Spójność to sens automatyzacji i właśnie dlatego błąd w wagach się kumuluje.
Wagę można obronić tylko na tyle, na ile można ją uzasadnić. Konsultant, który usłyszy, że stracił 30 punktów, zapyta, które 30 i dlaczego. Jeśli system potrafi pokazać tylko sumę, wagi nie przetrwają zderzenia z zespołem, niezależnie od tego, jak starannie je ustalono. Każde potrącenie musi wskazywać kryterium, cytować moment rozmowy, który je wywołał, i dawać się zakwestionować. Na tym polega różnica między wynikiem a wyrokiem. Więcej na ten temat w tekście jak zweryfikować ocenę jakości wykonywaną przez AI (po angielsku).
Dwie praktyczne korekty przy ocenie automatycznej:
- Potrącenia powinny być zgrubne. Wielokrotności pięciu lub dziesięciu. Bardzo drobne wagi sugerują precyzję, której model nie ma, i prowokują spory o różnicę między uchybieniem za siedem a za osiem punktów.
- Wagę warto dawać temu, co model odczytuje niezawodnie. Kryteria proceduralne i merytoryczne są oceniane spójnie. Oceny tonu mają większą zmienność, więc powinny stanowić mniejszą część sumy, dopóki nie zmierzą Państwo, jak dokładna jest ocena jakości przez AI w tych kryteriach.
Auto QA od Kaizo stosuje wagi z Państwa własnej karty oceny dla każdego kryterium osobno i zostawia uzasadnienie przypięte do rozmowy, dzięki czemu zakwestionowane potrącenie można prześledzić aż do konkretnej wymiany zdań, która je wywołała, zamiast spierać się z pamięci.
Kiedy zmieniać wagi, a kiedy zostawić je w spokoju
Wagi zmienia się według harmonogramu, a nie po skardze. Raz na kwartał, razem z cyklem kalibracji oceny jakości, to rytm, który większość zespołów jest w stanie utrzymać. Między tymi momentami warto zbierać uwagi, zamiast reagować na każdą z osobna.
Cztery sygnały, że waga naprawdę się zdezaktualizowała:
- Kryterium jest spełniane w więcej niż około 95% przypadków przez dwa kolejne kwartały. Nie odróżnia już konsultantów. Albo zachowanie stało się powszechne, i wtedy warto to uczcić i wycofać kryterium, albo kryterium jest zbyt łatwe do spełnienia.
- Zmiana procedur lub produktu przesunęła to, co ważne. Nowe przepisy, nowa polityka zwrotów, nowy kanał.
- Wynik przestał iść w parze z wynikami biznesowymi. Proszę powtórzyć analizę opisaną wcześniej w tym przewodniku. Jeśli różnice się spłaszczyły, wagi są nieaktualne.
- Recenzenci ciągle korygują to samo kryterium. Gdy ludzie po cichu kompensują jakąś wagę, sygnalizują, że jest błędna.
Jedna zasada jest ważniejsza od wszystkich pozostałych: trzeba wersjonować kartę oceny i nigdy nie stosować nowych wag wstecz do historycznych wyników. Marcowy wynik konsultanta powstał według marcowych zasad. Przeliczenie go w lipcu niszczy jedyną rzecz, na której opiera się program kontroli jakości: to, że liczba coś znaczyła w chwili, gdy ją wystawiono. Starą wersję należy zachować w nienaruszonym stanie, nową uruchomić od wyraźnej daty i powiedzieć o tym otwarcie. Dzięki temu również wewnętrzny wskaźnik jakości pozostaje porównywalny w czasie, zamiast po cichu dryfować.
Najczęściej zadawane pytania
Ile kryteriów powinna mieć karta oceny jakości?
Od ośmiu do piętnastu w przypadku większości zespołów obsługi klienta. Poniżej ośmiu wynik jest zbyt toporny, by kierować coachingiem. Powyżej piętnastu recenzenci nie są w stanie utrzymać w głowie wszystkich kryteriów, zgodność między nimi spada, a oceny trwają tak długo, że cierpi na tym pokrycie. Jeśli potrzeba więcej niż piętnastu, prawdopodobnie potrzebne są dwie karty oceny dla dwóch różnych rodzajów pracy, a nie jedna długa.
Czy każde kryterium powinno mieć taką samą wagę?
Nie. Równe wagi to twierdzenie, że każde zachowanie jest tak samo ważne, co nigdy nie jest prawdą, a powstające wyniki nie odróżniają poważnego uchybienia od kosmetycznego. Płaskie wagi to rozsądny punkt wyjścia dla zupełnie nowego programu, który nie ma jeszcze danych o wynikach, ale należy je zastąpić, gdy tylko da się uszeregować kryteria według ich wpływu na ponowne otwarcia, eskalacje lub niezadowolenie.
Czym różni się waga od błędu krytycznego?
Waga mówi, ile kosztuje uchybienie. Błąd krytyczny mówi, że rozmowa jest nieważna niezależnie od wszystkiego innego. To różne mechanizmy i nie należy zastępować jednego drugim. Przypisanie kryterium krytycznemu 60 ze 100 punktów to najczęstszy błąd projektowy, bo konsultant może go nie spełnić i nadal dostać 40. Jeśli zachowanie ma unieważniać interakcję, trzeba je zablokować bramką, a nie nadawać mu wagę.
Jak ustalić wagi, gdy nie ma jeszcze danych?
Wspólnie z recenzentami należy uszeregować kryteria według wpływu na klienta i ryzyka, pogrupować je w trzy przedziały (wysoki, średni i niski) i przypisać zgrubne wartości punktowe przedziałom, a nie pojedynczym kryteriom. Potem trzeba zobowiązać się do przeglądu po jednym kwartale, gdy będzie dość ocenionych rozmów, by porównać odsetek uchybień z ponownymi otwarciami. Lepiej zgrubnie i z możliwością korekty niż precyzyjnie, ale na wymyślonych liczbach.
Jak często należy zmieniać wagi w karcie oceny jakości?
Najwyżej raz na kwartał, razem z cyklem kalibracji. Wagi, które zmieniają się częściej, przestają być standardem i stają się ruchomym celem, a konsultanci tracą orientację, jak wygląda dobra praca. Przy każdej zmianie wag należy wersjonować kartę oceny i nigdy nie przeliczać historycznych wyników według nowych wag.
Powiązane pojęcia
- Czym są kryteria oceny jakości i jak je zbudować
- Czym jest błąd krytyczny i kiedy go stosować
- Jak przeprowadzić sesję kalibracyjną QA (po angielsku)
- Szablony kart oceny QA (po angielsku)
- Jak zweryfikować ocenę jakości wykonywaną przez AI (po angielsku)
Państwa własne wagi za każdą ocenioną rozmową
Prosimy przynieść kartę oceny, której używają Państwo dziś, oraz rozmowy z jednego miesiąca, które zostały już ocenione. Pokażemy, co faktycznie nagradzają obecne wagi i co się zmienia, gdy każda rozmowa jest oceniana w ten sam sposób.