Pular para o conteúdo

Modelo

Peso dos itens da monitoria: como definir sem chutar

Pesos iguais quebram a maioria dos formulários de monitoria. Defina o peso dos itens da monitoria com evidências e teste-os com notas reais antes de publicar.

· 13 min de leitura

Revisado por Dominik Blattner, fundador da Kaizo

Nesta página

Defina o peso dos itens da monitoria a partir de três coisas: o quanto a falha prejudica o cliente, o risco que ela traz para o negócio e o quanto ela depende do atendente. Se você não consegue explicar um peso, a nota não sobrevive à primeira contestação.

Em resumo

  • Peso igual para todos os critérios diz que todos importam o mesmo tanto. Isso nunca é verdade.
  • O controle do atendente é o fator que todo mundo esquece, e é dele que os atendentes mais reclamam.
  • Transforme os critérios críticos em erro crítico, uma barreira, em vez de um item de 60 pontos.
  • Teste os novos pesos em conversas já avaliadas. Se ninguém muda de faixa, a mudança foi só cosmética.

Por que pesos iguais quebram um formulário de monitoria sem ninguém perceber

Quase todo formulário de monitoria começa com pesos iguais, porque parece justo e não exige reflexão. Não é nenhuma das duas coisas. Peso igual é uma afirmação, e a afirmação é que esquecer a saudação custa ao negócio exatamente o mesmo que processar o reembolso errado.

Três consequências aparecem, e chegam nesta ordem.

A nota deixa de diferenciar. Quando dez critérios valem dez pontos cada, uma falha grave e uma falha cosmética custam os mesmos dez. Dois atendentes terminam com 90, um porque foi seco e outro porque deu ao cliente uma informação errada sobre o dinheiro dele. Um número que não separa esses dois casos não está medindo qualidade.

Os atendentes otimizam os critérios baratos. As pessoas respondem ao placar que você dá a elas. Se tom e saudação são os pontos mais fáceis de garantir e os mais difíceis de perder, é para lá que o esforço vai. Isso não é burlar o sistema, é o formulário funcionando exatamente como foi desenhado.

A nota se descola do negócio. Quando as notas de qualidade deixam de acompanhar escalonamentos, reaberturas e insatisfação do cliente, a liderança para de usá-las sem alarde. O programa continua, as avaliações continuam, e ninguém toma uma decisão com o resultado. É nesse estado que a maioria dos programas de QA realmente está.

Um diagnóstico rápido. Pegue os dois atendentes com as notas mais altas do mês passado e os dois com as mais baixas. Se você não consegue apontar uma diferença real na experiência que eles entregaram ao cliente, seus pesos não carregam informação nenhuma. Antes de mexer nos pesos, confira se os critérios em si são sólidos, um trabalho à parte explicado em o que é uma rubrica de QA e como montar uma.

Lembre-se

Peso igual não é ausência de decisão. É a decisão de que todo critério importa o mesmo tanto, tomada por padrão e nunca revista.

Os três modelos de peso, e quando cada um é o certo

Só existem três modelos em uso na prática. O erro não é escolher o errado, é escolher um por acaso e nunca mais revisitá-lo.

ModeloComo funcionaCerto quandoFalha quando
PlanoTodo critério vale os mesmos pontosO programa é novo, você tem menos de uns dez critérios e de fato ainda não sabe o que importaVocê tem dados de resultado e continua ignorando. O modelo plano deve ser ponto de partida, não ponto de chegada
Ponderado por impactoOs critérios valem pontos diferentes, conforme o impacto no cliente e no negócioO programa é maduro o bastante para ter evidências, e os avaliadores conseguem explicar cada pesoOs pesos são definidos por quem fala mais alto na reunião e nunca revistos
Dedução a partir de um tetoToda conversa começa com 100 e perde pontos a cada falha, com a gravidade definindo a deduçãoA maioria das conversas está boa e você está caçando exceções, ou o trabalho é pesado em complianceNão há piso, então uma conversa ruim vai muito para o negativo e distorce a média do atendente

Como definir o peso dos itens da monitoria com evidências, e não com opinião

Defina o peso com três fatores, nesta ordem. Nada disso é exclusivo do QA de atendimento: o manual do governo do Reino Unido sobre análise multicritério trata do mesmo problema de avaliar opções com base em critérios e depois dar peso a esses critérios, e o alerta central do manual é que os pesos carregam o julgamento de valor, quer alguém admita isso ou não.

Impacto no cliente. Quanto pior fica o dia desse cliente porque o critério falhou? Uma informação errada sobre um reembolso pesa mais do que uma despedida esquecida, e não é por pouco.

Risco para o negócio e risco regulatório. Quanto a falha custa além dessa conversa? Tudo o que tem consequência jurídica, financeira ou de proteção de dados fica no topo, e parte disso nem deveria estar no conjunto de pesos.

Controle do atendente. Este é o fator que costuma ser pulado, e é o que os atendentes percebem. Se um critério depende de um sistema interno lento, de uma política que o atendente não pode flexibilizar ou de uma passagem de outra equipe, dar peso alto a ele pune as pessoas pelo seu processo. Ou dê peso baixo, ou corrija o processo e pare de avaliá-lo.

Os pesos carregam o julgamento de valor, quer alguém admita isso ou não.

Paráfrase do manual de análise multicritério do governo do Reino Unido

A uma hora de análise que faz a maior parte do trabalho

Pegue três meses de conversas que você já avaliou. Para cada critério, separe as conversas em que ele foi atendido das conversas em que falhou, e compare um resultado posterior entre os dois grupos. A taxa de reabertura é a melhor escolha isolada, porque é objetiva e já está no seu helpdesk. Taxa de escalonamento e insatisfação também funcionam.

O que você procura é o tamanho da diferença. Um critério cuja falha mexe muito na taxa de reabertura mereceu peso. Um critério cuja falha não mexe em nada não mereceu, e deve descer na escala ou sair do formulário de vez.

Duas ressalvas honestas. Isto é correlação, não causalidade, então use a análise para ordenar os critérios, e não para calcular pontos exatos. E critérios que falham muito raramente não geram um sinal legível, o que costuma indicar que eles pertencem ao erro crítico, e não ao conjunto de pesos.

Dica

Use a taxa de reabertura como variável de resultado. Ela é objetiva, já está no seu helpdesk e, ao contrário da satisfação, não depende de alguém responder a uma pesquisa.

Erro crítico é uma barreira, não um peso alto

Este é o erro de desenho de formulário mais comum. Uma equipe decide que uma violação de proteção de dados do cliente (em inglês) é inaceitável e faz com que ela valha 60 dos 100 pontos disponíveis.

Isso não faz o que a equipe imagina. Um atendente pode violar a proteção de dados e ainda ficar com 40, e se o resto do formulário for generoso, pode fechar o mês com uma média respeitável. O comportamento que a equipe chamou de inaceitável é, na aritmética, sobrevivível.

Se um comportamento deve anular o atendimento, ele precisa ser uma barreira binária que zera a nota, fora do conjunto de pesos. É para isso que serve um erro crítico. Três regras o mantêm utilizável:

  • Poucos. De três a cinco. Um formulário com uma dúzia de erros críticos é um formulário em que tudo é crítico e, portanto, nada é.
  • Sem ambiguidade. Um erro crítico precisa poder ser respondido com sim ou não por dois avaliadores que nunca conversaram. “Foi grosseiro” não serve. “Informou dados da conta sem concluir a verificação de identidade” serve.
  • Com segundo avaliador. Zerar a nota de alguém é um ato sério, e deve custar algo ao programa fazer isso.

Quando os erros críticos saem, fica mais fácil raciocinar sobre o conjunto de pesos, porque tudo o que resta nele é questão de grau, e não de natureza.

Atenção

Fazer um critério crítico valer 60 de 100 pontos não o transforma em erro crítico. O atendente pode falhar nele e ainda tirar 40 e, com um formulário generoso, ainda fechar o mês de forma aceitável. Se um comportamento deve anular o atendimento, crie uma barreira. Não dê um preço a ele.

O formulário bimodal, e por que os atendentes deixam de acreditar nele

Há um estado de falha específico que vale nomear, porque é comum e destrói a confiança. Ele acontece quando um formulário junta uma longa lista de erros críticos com deduções pesadas em todo o resto. Os atendentes descrevem o resultado sempre do mesmo jeito: cada item ou zera a nota na hora ou custa dezesseis pontos, então na prática os únicos resultados possíveis são nota máxima ou desastre.

Olhe a sua distribuição. Se as notas se concentram no topo e na base, com muito pouco no meio, o formulário parou de medir e passou a classificar. Duas coisas decorrem disso. Metas como 95% ficam aritmeticamente inalcançáveis para quem pega uma conversa difícil, então quem atende os piores tickets tira as piores notas. E como não existe meio-termo, não há para onde orientar o coaching, só aprovação ou punição.

A correção é quase sempre a mesma: menos erros críticos e deduções menores nos critérios que ficam.

Como testar novos pesos antes de colocá-los em uso

Nunca publique um formulário com novos pesos direto em produção. Faça antes um teste retroativo, que leva uma tarde e evita a maior parte do estrago.

Pegue uma amostra de conversas que já foram avaliadas com os pesos antigos. Recalcule as notas com os novos. Não reavalie as conversas: você está testando aritmética, não julgamento. Depois compare a distribuição.

Três leituras possíveis, e cada uma diz algo específico.

  • Quase ninguém muda de faixa. A mudança de pesos é cosmética. Você gastou capital político com uma mudança que não altera nada, e deveria ir mais longe ou deixar como está.
  • Quase todo mundo muda de faixa. Você não ajustou pesos, você mudou o padrão. Isso pode estar certo, mas precisa ser anunciado como um novo padrão, e não introduzido como um ajuste fino, ou você perde a equipe.
  • Algumas pessoas mudam, e são as pessoas erradas. Este é o caso útil. Se atendentes que a sua equipe respeita caem muito, os novos pesos traduzem uma visão de qualidade que você não tem de fato. Encontre o critério que causa isso antes de seguir.

Depois, faça uma sessão de calibração (em inglês) com os novos pesos e com todo o grupo de avaliadores antes de publicar qualquer coisa. Os pesos mudam o que os avaliadores discutem, e você quer que essa discussão aconteça numa sala, e não na reunião individual de um atendente. Se você parte de uma base padrão, os modelos de formulário de monitoria (em inglês) são um ponto de partida razoável para ajustar os pesos, em vez de começar do zero.

O peso dos critérios quando uma IA faz a avaliação

A avaliação automatizada não muda os princípios acima. Ela muda o tamanho do estrago quando eles estão errados, de duas formas específicas.

Os erros deixam de ser ocasionais e passam a ser sistemáticos. Na avaliação manual, com a amostra de 3% que a maioria dos programas usa, um critério com peso ruim distorce um punhado de conversas por mês, e um bom avaliador compensa sem dizer nada. Com uma cobertura de 100% (em inglês), que revela tendências que uma amostragem de 3% nunca revelaria, esse mesmo peso ruim é aplicado a todas as conversas, de forma consistente, sempre na mesma direção. A consistência é o objetivo da automação, e é exatamente o que faz um erro de peso se acumular.

Um peso só se sustenta na medida da sua explicação. Um atendente que ouve que perdeu 30 pontos vai perguntar quais 30, e por quê. Se o sistema só consegue mostrar um total, os pesos não sobrevivem ao contato com a operação, por mais cuidado que você tenha tido ao defini-los. Cada dedução precisa nomear o critério, citar o momento da conversa que a causou e poder ser contestada. Essa é a diferença entre uma nota e um veredito, tratada com mais detalhes em como validar a avaliação de QA com IA (em inglês).

Dois ajustes práticos para a avaliação automatizada:

  • Use deduções em valores redondos. Múltiplos de cinco ou de dez. Pesos muito detalhados sugerem uma precisão que o modelo não tem, e abrem discussões sobre a diferença entre uma falha de sete e uma de oito pontos.
  • Dê peso ao que um modelo lê com confiabilidade. Critérios de procedimento e de fato são avaliados de forma consistente. Julgamentos sobre tom têm mais variação, então dê a eles uma parte menor do total até medir a precisão da avaliação de QA com IA nesses critérios.

O Auto QA da Kaizo aplica os pesos do seu próprio formulário critério a critério e deixa a justificativa anexada à conversa, para que uma dedução contestada possa ser rastreada até a troca específica que a causou, em vez de ser discutida de memória.

Quando mudar os pesos, e quando deixar como está

Mude os pesos num calendário, não por causa de uma reclamação. Trimestralmente, junto com um ciclo de calibração de monitoria, é a cadência que a maioria das equipes consegue manter. Entre esses momentos, junte as reclamações em vez de agir sobre cada uma.

Quatro sinais de que um peso realmente venceu:

  • Um critério é atendido em mais de cerca de 95% das vezes por dois trimestres seguidos. Ele não diferencia mais os atendentes. Ou o comportamento virou regra, e nesse caso comemore e aposente o critério, ou o critério é fácil demais de cumprir.
  • Uma mudança de política ou de produto mudou o que importa. Nova regulamentação, nova política de reembolso, novo canal.
  • A nota deixou de acompanhar os resultados. Refaça a análise descrita antes neste guia. Se as diferenças se achataram, os pesos estão velhos.
  • Os avaliadores corrigem sempre o mesmo critério. Quando as pessoas compensam um peso sem dizer nada, estão avisando que ele está errado.

Uma regra que importa mais do que todas elas: versione o formulário e nunca aplique novos pesos retroativamente a notas antigas. A nota de março de um atendente foi produzida com as regras de março. Recalculá-la em julho destrói a única coisa de que um programa de QA depende, que é o número ter significado algo no momento em que foi dado. Mantenha a versão antiga intacta, comece a nova a partir de uma data limpa e anuncie isso com todas as letras. É também o que mantém a sua nota de qualidade interna comparável ao longo do tempo, em vez de ir mudando sem ninguém perceber.

Perguntas frequentes

Quantos critérios um formulário de monitoria deve ter?

De oito a quinze para a maioria das equipes de atendimento. Abaixo de oito, a nota é genérica demais para orientar o coaching. Acima de quinze, os avaliadores não conseguem guardar a rubrica inteira na cabeça, a concordância entre eles cai e as avaliações demoram tanto que a cobertura sofre. Se você precisa de mais de quinze, provavelmente precisa de dois formulários para dois tipos de trabalho, e não de um formulário longo.

Todo critério deve ter o mesmo peso?

Não. Peso igual é a afirmação de que todo comportamento importa o mesmo tanto, o que nunca é verdade, e gera notas que não separam uma falha grave de uma falha cosmética. O peso plano é um ponto de partida razoável para um programa novo, ainda sem dados de resultado, mas deve ser substituído assim que você puder ordenar os critérios pelo efeito deles em reaberturas, escalonamentos ou insatisfação.

Qual é a diferença entre um peso e um erro crítico?

Um peso diz quanto uma falha custa. Um erro crítico diz que a conversa é anulada, independentemente de todo o resto. São mecanismos diferentes, e um não deve substituir o outro. Fazer um critério crítico valer 60 de 100 pontos é o erro de desenho mais comum, porque o atendente pode falhar nele e ainda tirar 40. Se um comportamento deve anular o atendimento, crie uma barreira em vez de dar peso a ele.

Como definir os pesos quando ainda não tenho dados?

Ordene os critérios por impacto no cliente e por risco junto com os seus avaliadores, agrupe-os em três faixas (alta, média e baixa) e atribua valores de pontos aproximados às faixas, e não a cada critério. Depois, comprometa-se a revisar após um trimestre, quando você terá conversas avaliadas suficientes para comparar as taxas de falha com as reaberturas. Aproximado e revisável é melhor do que preciso e inventado.

Com que frequência os pesos do formulário de monitoria devem mudar?

No máximo uma vez por trimestre, junto com um ciclo de calibração. Pesos que mudam com mais frequência deixam de ser um padrão e viram um alvo móvel, e os atendentes perdem a noção do que é um bom atendimento. Sempre versione o formulário quando os pesos mudarem, e nunca recalcule notas antigas com os novos pesos.

Termos relacionados

Seus próprios pesos por trás de cada conversa avaliada

Traga o formulário de monitoria que você usa hoje e um mês de conversas que você já avaliou. Vamos mostrar o que os seus pesos atuais estão de fato premiando, e o que muda quando todas as conversas são avaliadas do mesmo jeito.

Agendar demo Conheça o Agentic Auto QA

Nesta página

Veja isso nas suas próprias conversas

Avaliamos uma amostra dos seus tickets reais com os seus próprios padrões, para que o exemplo seja seu.

A escolha de equipes de atendimento no mundo todo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart