Defina o peso dos itens da monitoria a partir de três coisas: o quanto a falha prejudica o cliente, o risco que ela traz para o negócio e o quanto ela depende do atendente. Se você não consegue explicar um peso, a nota não sobrevive à primeira contestação.
Em resumo
- Peso igual para todos os critérios diz que todos importam o mesmo tanto. Isso nunca é verdade.
- O controle do atendente é o fator que todo mundo esquece, e é dele que os atendentes mais reclamam.
- Transforme os critérios críticos em erro crítico, uma barreira, em vez de um item de 60 pontos.
- Teste os novos pesos em conversas já avaliadas. Se ninguém muda de faixa, a mudança foi só cosmética.
Por que pesos iguais quebram um formulário de monitoria sem ninguém perceber
Quase todo formulário de monitoria começa com pesos iguais, porque parece justo e não exige reflexão. Não é nenhuma das duas coisas. Peso igual é uma afirmação, e a afirmação é que esquecer a saudação custa ao negócio exatamente o mesmo que processar o reembolso errado.
Três consequências aparecem, e chegam nesta ordem.
A nota deixa de diferenciar. Quando dez critérios valem dez pontos cada, uma falha grave e uma falha cosmética custam os mesmos dez. Dois atendentes terminam com 90, um porque foi seco e outro porque deu ao cliente uma informação errada sobre o dinheiro dele. Um número que não separa esses dois casos não está medindo qualidade.
Os atendentes otimizam os critérios baratos. As pessoas respondem ao placar que você dá a elas. Se tom e saudação são os pontos mais fáceis de garantir e os mais difíceis de perder, é para lá que o esforço vai. Isso não é burlar o sistema, é o formulário funcionando exatamente como foi desenhado.
A nota se descola do negócio. Quando as notas de qualidade deixam de acompanhar escalonamentos, reaberturas e insatisfação do cliente, a liderança para de usá-las sem alarde. O programa continua, as avaliações continuam, e ninguém toma uma decisão com o resultado. É nesse estado que a maioria dos programas de QA realmente está.
Um diagnóstico rápido. Pegue os dois atendentes com as notas mais altas do mês passado e os dois com as mais baixas. Se você não consegue apontar uma diferença real na experiência que eles entregaram ao cliente, seus pesos não carregam informação nenhuma. Antes de mexer nos pesos, confira se os critérios em si são sólidos, um trabalho à parte explicado em o que é uma rubrica de QA e como montar uma.
Lembre-se
Peso igual não é ausência de decisão. É a decisão de que todo critério importa o mesmo tanto, tomada por padrão e nunca revista.
Os três modelos de peso, e quando cada um é o certo
Só existem três modelos em uso na prática. O erro não é escolher o errado, é escolher um por acaso e nunca mais revisitá-lo.
| Modelo | Como funciona | Certo quando | Falha quando |
|---|---|---|---|
| Plano | Todo critério vale os mesmos pontos | O programa é novo, você tem menos de uns dez critérios e de fato ainda não sabe o que importa | Você tem dados de resultado e continua ignorando. O modelo plano deve ser ponto de partida, não ponto de chegada |
| Ponderado por impacto | Os critérios valem pontos diferentes, conforme o impacto no cliente e no negócio | O programa é maduro o bastante para ter evidências, e os avaliadores conseguem explicar cada peso | Os pesos são definidos por quem fala mais alto na reunião e nunca revistos |
| Dedução a partir de um teto | Toda conversa começa com 100 e perde pontos a cada falha, com a gravidade definindo a dedução | A maioria das conversas está boa e você está caçando exceções, ou o trabalho é pesado em compliance | Não há piso, então uma conversa ruim vai muito para o negativo e distorce a média do atendente |
Como definir o peso dos itens da monitoria com evidências, e não com opinião
Defina o peso com três fatores, nesta ordem. Nada disso é exclusivo do QA de atendimento: o manual do governo do Reino Unido sobre análise multicritério trata do mesmo problema de avaliar opções com base em critérios e depois dar peso a esses critérios, e o alerta central do manual é que os pesos carregam o julgamento de valor, quer alguém admita isso ou não.
Impacto no cliente. Quanto pior fica o dia desse cliente porque o critério falhou? Uma informação errada sobre um reembolso pesa mais do que uma despedida esquecida, e não é por pouco.
Risco para o negócio e risco regulatório. Quanto a falha custa além dessa conversa? Tudo o que tem consequência jurídica, financeira ou de proteção de dados fica no topo, e parte disso nem deveria estar no conjunto de pesos.
Controle do atendente. Este é o fator que costuma ser pulado, e é o que os atendentes percebem. Se um critério depende de um sistema interno lento, de uma política que o atendente não pode flexibilizar ou de uma passagem de outra equipe, dar peso alto a ele pune as pessoas pelo seu processo. Ou dê peso baixo, ou corrija o processo e pare de avaliá-lo.
Os pesos carregam o julgamento de valor, quer alguém admita isso ou não.
Paráfrase do manual de análise multicritério do governo do Reino Unido
A uma hora de análise que faz a maior parte do trabalho
Pegue três meses de conversas que você já avaliou. Para cada critério, separe as conversas em que ele foi atendido das conversas em que falhou, e compare um resultado posterior entre os dois grupos. A taxa de reabertura é a melhor escolha isolada, porque é objetiva e já está no seu helpdesk. Taxa de escalonamento e insatisfação também funcionam.
O que você procura é o tamanho da diferença. Um critério cuja falha mexe muito na taxa de reabertura mereceu peso. Um critério cuja falha não mexe em nada não mereceu, e deve descer na escala ou sair do formulário de vez.
Duas ressalvas honestas. Isto é correlação, não causalidade, então use a análise para ordenar os critérios, e não para calcular pontos exatos. E critérios que falham muito raramente não geram um sinal legível, o que costuma indicar que eles pertencem ao erro crítico, e não ao conjunto de pesos.
Dica
Use a taxa de reabertura como variável de resultado. Ela é objetiva, já está no seu helpdesk e, ao contrário da satisfação, não depende de alguém responder a uma pesquisa.
Erro crítico é uma barreira, não um peso alto
Este é o erro de desenho de formulário mais comum. Uma equipe decide que uma violação de proteção de dados do cliente (em inglês) é inaceitável e faz com que ela valha 60 dos 100 pontos disponíveis.
Isso não faz o que a equipe imagina. Um atendente pode violar a proteção de dados e ainda ficar com 40, e se o resto do formulário for generoso, pode fechar o mês com uma média respeitável. O comportamento que a equipe chamou de inaceitável é, na aritmética, sobrevivível.
Se um comportamento deve anular o atendimento, ele precisa ser uma barreira binária que zera a nota, fora do conjunto de pesos. É para isso que serve um erro crítico. Três regras o mantêm utilizável:
- Poucos. De três a cinco. Um formulário com uma dúzia de erros críticos é um formulário em que tudo é crítico e, portanto, nada é.
- Sem ambiguidade. Um erro crítico precisa poder ser respondido com sim ou não por dois avaliadores que nunca conversaram. “Foi grosseiro” não serve. “Informou dados da conta sem concluir a verificação de identidade” serve.
- Com segundo avaliador. Zerar a nota de alguém é um ato sério, e deve custar algo ao programa fazer isso.
Quando os erros críticos saem, fica mais fácil raciocinar sobre o conjunto de pesos, porque tudo o que resta nele é questão de grau, e não de natureza.
Atenção
Fazer um critério crítico valer 60 de 100 pontos não o transforma em erro crítico. O atendente pode falhar nele e ainda tirar 40 e, com um formulário generoso, ainda fechar o mês de forma aceitável. Se um comportamento deve anular o atendimento, crie uma barreira. Não dê um preço a ele.
O formulário bimodal, e por que os atendentes deixam de acreditar nele
Há um estado de falha específico que vale nomear, porque é comum e destrói a confiança. Ele acontece quando um formulário junta uma longa lista de erros críticos com deduções pesadas em todo o resto. Os atendentes descrevem o resultado sempre do mesmo jeito: cada item ou zera a nota na hora ou custa dezesseis pontos, então na prática os únicos resultados possíveis são nota máxima ou desastre.
Olhe a sua distribuição. Se as notas se concentram no topo e na base, com muito pouco no meio, o formulário parou de medir e passou a classificar. Duas coisas decorrem disso. Metas como 95% ficam aritmeticamente inalcançáveis para quem pega uma conversa difícil, então quem atende os piores tickets tira as piores notas. E como não existe meio-termo, não há para onde orientar o coaching, só aprovação ou punição.
A correção é quase sempre a mesma: menos erros críticos e deduções menores nos critérios que ficam.
Como testar novos pesos antes de colocá-los em uso
Nunca publique um formulário com novos pesos direto em produção. Faça antes um teste retroativo, que leva uma tarde e evita a maior parte do estrago.
Pegue uma amostra de conversas que já foram avaliadas com os pesos antigos. Recalcule as notas com os novos. Não reavalie as conversas: você está testando aritmética, não julgamento. Depois compare a distribuição.
Três leituras possíveis, e cada uma diz algo específico.
- Quase ninguém muda de faixa. A mudança de pesos é cosmética. Você gastou capital político com uma mudança que não altera nada, e deveria ir mais longe ou deixar como está.
- Quase todo mundo muda de faixa. Você não ajustou pesos, você mudou o padrão. Isso pode estar certo, mas precisa ser anunciado como um novo padrão, e não introduzido como um ajuste fino, ou você perde a equipe.
- Algumas pessoas mudam, e são as pessoas erradas. Este é o caso útil. Se atendentes que a sua equipe respeita caem muito, os novos pesos traduzem uma visão de qualidade que você não tem de fato. Encontre o critério que causa isso antes de seguir.
Depois, faça uma sessão de calibração (em inglês) com os novos pesos e com todo o grupo de avaliadores antes de publicar qualquer coisa. Os pesos mudam o que os avaliadores discutem, e você quer que essa discussão aconteça numa sala, e não na reunião individual de um atendente. Se você parte de uma base padrão, os modelos de formulário de monitoria (em inglês) são um ponto de partida razoável para ajustar os pesos, em vez de começar do zero.
O peso dos critérios quando uma IA faz a avaliação
A avaliação automatizada não muda os princípios acima. Ela muda o tamanho do estrago quando eles estão errados, de duas formas específicas.
Os erros deixam de ser ocasionais e passam a ser sistemáticos. Na avaliação manual, com a amostra de 3% que a maioria dos programas usa, um critério com peso ruim distorce um punhado de conversas por mês, e um bom avaliador compensa sem dizer nada. Com uma cobertura de 100% (em inglês), que revela tendências que uma amostragem de 3% nunca revelaria, esse mesmo peso ruim é aplicado a todas as conversas, de forma consistente, sempre na mesma direção. A consistência é o objetivo da automação, e é exatamente o que faz um erro de peso se acumular.
Um peso só se sustenta na medida da sua explicação. Um atendente que ouve que perdeu 30 pontos vai perguntar quais 30, e por quê. Se o sistema só consegue mostrar um total, os pesos não sobrevivem ao contato com a operação, por mais cuidado que você tenha tido ao defini-los. Cada dedução precisa nomear o critério, citar o momento da conversa que a causou e poder ser contestada. Essa é a diferença entre uma nota e um veredito, tratada com mais detalhes em como validar a avaliação de QA com IA (em inglês).
Dois ajustes práticos para a avaliação automatizada:
- Use deduções em valores redondos. Múltiplos de cinco ou de dez. Pesos muito detalhados sugerem uma precisão que o modelo não tem, e abrem discussões sobre a diferença entre uma falha de sete e uma de oito pontos.
- Dê peso ao que um modelo lê com confiabilidade. Critérios de procedimento e de fato são avaliados de forma consistente. Julgamentos sobre tom têm mais variação, então dê a eles uma parte menor do total até medir a precisão da avaliação de QA com IA nesses critérios.
O Auto QA da Kaizo aplica os pesos do seu próprio formulário critério a critério e deixa a justificativa anexada à conversa, para que uma dedução contestada possa ser rastreada até a troca específica que a causou, em vez de ser discutida de memória.
Quando mudar os pesos, e quando deixar como está
Mude os pesos num calendário, não por causa de uma reclamação. Trimestralmente, junto com um ciclo de calibração de monitoria, é a cadência que a maioria das equipes consegue manter. Entre esses momentos, junte as reclamações em vez de agir sobre cada uma.
Quatro sinais de que um peso realmente venceu:
- Um critério é atendido em mais de cerca de 95% das vezes por dois trimestres seguidos. Ele não diferencia mais os atendentes. Ou o comportamento virou regra, e nesse caso comemore e aposente o critério, ou o critério é fácil demais de cumprir.
- Uma mudança de política ou de produto mudou o que importa. Nova regulamentação, nova política de reembolso, novo canal.
- A nota deixou de acompanhar os resultados. Refaça a análise descrita antes neste guia. Se as diferenças se achataram, os pesos estão velhos.
- Os avaliadores corrigem sempre o mesmo critério. Quando as pessoas compensam um peso sem dizer nada, estão avisando que ele está errado.
Uma regra que importa mais do que todas elas: versione o formulário e nunca aplique novos pesos retroativamente a notas antigas. A nota de março de um atendente foi produzida com as regras de março. Recalculá-la em julho destrói a única coisa de que um programa de QA depende, que é o número ter significado algo no momento em que foi dado. Mantenha a versão antiga intacta, comece a nova a partir de uma data limpa e anuncie isso com todas as letras. É também o que mantém a sua nota de qualidade interna comparável ao longo do tempo, em vez de ir mudando sem ninguém perceber.
Perguntas frequentes
Quantos critérios um formulário de monitoria deve ter?
De oito a quinze para a maioria das equipes de atendimento. Abaixo de oito, a nota é genérica demais para orientar o coaching. Acima de quinze, os avaliadores não conseguem guardar a rubrica inteira na cabeça, a concordância entre eles cai e as avaliações demoram tanto que a cobertura sofre. Se você precisa de mais de quinze, provavelmente precisa de dois formulários para dois tipos de trabalho, e não de um formulário longo.
Todo critério deve ter o mesmo peso?
Não. Peso igual é a afirmação de que todo comportamento importa o mesmo tanto, o que nunca é verdade, e gera notas que não separam uma falha grave de uma falha cosmética. O peso plano é um ponto de partida razoável para um programa novo, ainda sem dados de resultado, mas deve ser substituído assim que você puder ordenar os critérios pelo efeito deles em reaberturas, escalonamentos ou insatisfação.
Qual é a diferença entre um peso e um erro crítico?
Um peso diz quanto uma falha custa. Um erro crítico diz que a conversa é anulada, independentemente de todo o resto. São mecanismos diferentes, e um não deve substituir o outro. Fazer um critério crítico valer 60 de 100 pontos é o erro de desenho mais comum, porque o atendente pode falhar nele e ainda tirar 40. Se um comportamento deve anular o atendimento, crie uma barreira em vez de dar peso a ele.
Como definir os pesos quando ainda não tenho dados?
Ordene os critérios por impacto no cliente e por risco junto com os seus avaliadores, agrupe-os em três faixas (alta, média e baixa) e atribua valores de pontos aproximados às faixas, e não a cada critério. Depois, comprometa-se a revisar após um trimestre, quando você terá conversas avaliadas suficientes para comparar as taxas de falha com as reaberturas. Aproximado e revisável é melhor do que preciso e inventado.
Com que frequência os pesos do formulário de monitoria devem mudar?
No máximo uma vez por trimestre, junto com um ciclo de calibração. Pesos que mudam com mais frequência deixam de ser um padrão e viram um alvo móvel, e os atendentes perdem a noção do que é um bom atendimento. Sempre versione o formulário quando os pesos mudarem, e nunca recalcule notas antigas com os novos pesos.
Termos relacionados
- O que é uma rubrica de QA e como montar uma
- O que é um erro crítico, e quando usar
- Como conduzir uma sessão de calibração de QA (em inglês)
- Modelos de formulário de monitoria (em inglês)
- Como validar a avaliação de QA com IA (em inglês)
Seus próprios pesos por trás de cada conversa avaliada
Traga o formulário de monitoria que você usa hoje e um mês de conversas que você já avaliou. Vamos mostrar o que os seus pesos atuais estão de fato premiando, e o que muda quando todas as conversas são avaliadas do mesmo jeito.