A precisão da monitoria com IA é tão boa quanto o padrão contra o qual você a calibra. Em critérios objetivos, como a verificação de identidade ou a informação correta, o QA com IA concorda com um avaliador humano calibrado na maior parte das vezes, e é mais fraco em julgamentos subjetivos, como a empatia com nuances. Precisão é um número que você mede nas suas próprias conversas, não uma promessa em que você precisa acreditar.
Em resumo
- A precisão do QA com IA é a taxa de concordância entre a nota automática e um avaliador humano calibrado que aplica os mesmos critérios.
- A avaliação automática é mais precisa em critérios objetivos, verificáveis por evidência, e menos precisa em julgamentos subjetivos.
- A sua real vantagem sobre a monitoria manual é a consistência: os mesmos critérios aplicados a todas as conversas, sem cansaço e sem desvio.
- Toda nota deve levar de volta à transcrição, para que qualquer resultado possa ser verificado, usado no coaching ou revertido.
- Você pode medir e aumentar a precisão por conta própria com um conjunto de referência, a comparação critério por critério e reavaliações periódicas.
O que precisão significa de fato para o QA com IA?
Precisão no QA com IA é o quanto a nota automática concorda com um avaliador humano calibrado que aplica os mesmos critérios. Não existe uma verdade universal sobre se uma conversa de atendimento foi boa, porque a qualidade é definida pelas suas políticas, pelo seu tom de voz e pela sua definição de problema resolvido. Precisão é concordância com o seu padrão, e é isso que a torna mensurável.
Essa mudança de perspectiva importa, porque você não precisa acreditar cegamente em uma nota de QA com IA. Você monta um conjunto de referência (em inglês) de conversas que avaliadores experientes já avaliaram e sobre as quais chegaram a um acordo, roda o sistema automático nessas mesmas conversas e mede a taxa de concordância. Para critérios de aprovado ou reprovado, dá para ir além e medir a precisão e o recall dos erros críticos: das conversas que o sistema sinalizou, quantas um humano confirma como falhas reais e, das falhas reais, quantas ele detectou.
Um sistema de QA com IA calibrado com base em um padrão humano e reavaliado ao longo do tempo não é uma caixa-preta. É um método de avaliação cuja precisão você consegue expressar em um número. Se você ainda está escolhendo uma ferramenta, a página de software de QA automatizado mostra como a Kaizo aplica isso a todas as conversas, e o guia de QA automatizado traz o panorama completo.
Onde a precisão da monitoria com IA é maior?
A avaliação de QA com IA é mais precisa em critérios que podem ser verificados com base em evidências na transcrição. Quanto mais claro e objetivo o critério, maior a concordância com um avaliador humano. Verificação de identidade, etapas e avisos obrigatórios e a correção das informações em relação à sua base de conhecimento têm boa precisão, e a maior parte de um formulário de monitoria real é feita justamente dessas verificações.
A tabela abaixo mostra como a concordância costuma variar por tipo de critério. Você pode ver como esses critérios se encaixam em um formulário de monitoria na prática.
| Tipo de critério | Exemplo | Quão verificável | Precisão típica |
|---|---|---|---|
| Objetivo / binário | O atendente verificou a identidade do cliente? | Sim ou não, visível na transcrição | Muito alta |
| Aderência ao processo | As etapas e os avisos obrigatórios foram seguidos? | Verificável em relação a um processo definido | Alta |
| Correção das informações | A informação dada estava realmente correta? | Verificável em relação à sua base de conhecimento | Alta, com um bom embasamento |
| Resolução | O problema do cliente foi realmente resolvido? | Em grande parte dedutível pelo desfecho | Moderada a alta |
| Nuance subjetiva | A empatia foi genuína e no momento certo? | Em parte uma questão de julgamento | Moderada, melhora com a calibração |
Onde o QA com IA é menos preciso, e como lidar com isso?
O QA com IA é menos preciso nos julgamentos mais subjetivos: se a empatia pareceu genuína, se um pedido ambíguo foi interpretado corretamente, se um caso-limite deveria ter sido escalonado. São os mesmos julgamentos em que os avaliadores humanos discordam entre si, e esse é o verdadeiro motivo de serem difíceis. Você lida com eles com calibração, um caminho claro de contestação e evidências por trás de cada nota.
A solução não é evitá-los, é calibrar
Você mantém as pessoas no processo onde o julgamento delas vale mais. Os avaliadores chegam a um acordo sobre algumas conversas de referência, os critérios são ajustados para que a intenção fique inequívoca e a avaliação automática é verificada com base nesse padrão acordado. Critérios subjetivos nunca chegam à precisão de uma verificação binária, mas critérios calibrados e um caminho claro de contestação (o atendente pode contestar uma nota e uma pessoa decide) os tornam justos e consistentes, que é do que as equipes realmente precisam.
É também por isso que toda nota deve levar de volta à evidência exata que a gerou. Um número que você consegue rastrear até uma linha da transcrição pode ser verificado, usado no coaching ou revertido. Um número que você não consegue rastrear é onde a confiança no QA com IA se perde.
Por que a avaliação com IA é melhor que a monitoria humana, mesmo com erros ocasionais?
A avaliação de QA com IA é melhor que a monitoria manual, mesmo com erros ocasionais, porque é consistente e cobre todas as conversas. A monitoria manual costuma ser vista como a referência de precisão, mas a avaliação humana tem dois problemas de precisão próprios: os avaliadores mudam de critério e discordam entre si, e só conseguem ler uma pequena amostra. A automação elimina os dois, então o quadro geral fica mais confiável.
Desvio e inconsistência dos avaliadores
Dois avaliadores dão notas diferentes para a mesma conversa, e o mesmo avaliador avalia de um jeito na sexta à tarde e de outro na segunda de manhã. Os padrões se desviam à medida que a equipe muda. Uma máquina aplica exatamente os mesmos critérios a todas as conversas, sem cansaço e sem desvio. Então, mesmo que uma pessoa às vezes tenha uma leitura mais perspicaz, a equipe humana como um todo é menos consistente.
O problema da amostragem
Um avaliador perfeitamente preciso que lê 2% das conversas continua sem saber nada sobre os outros 98%. As falhas mais prejudiciais estão nas conversas que ninguém leu. Avaliar 100% das conversas (em inglês) automaticamente é outro tipo de precisão: precisão sobre toda a sua operação, não sobre uma pequena amostra dela. Na UiPath, a Kaizo automatizou 100% do QA com ROI de 200% e um aumento de 8% na nota de qualidade. A cobertura total não é um fim em si; é a condição que elimina o viés de seleção, para que o número de precisão que você mede descreva a sua operação, e não as conversas que por acaso foram escolhidas.
Veja nas suas próprias conversas. A Kaizo avalia 100% das suas conversas de atendimento com o seu próprio formulário de monitoria, com a evidência por trás de cada nota. Agende uma demo.
Como medir e aumentar a precisão do seu QA com IA?
Você mede a precisão do QA com IA comparando, critério por critério, as notas automáticas com um conjunto de referência que seus melhores avaliadores já avaliaram e sobre o qual chegaram a um acordo. Você a aumenta principalmente reescrevendo critérios vagos e depois reavaliando periodicamente, para que a precisão não se desvie. Você não precisa confiar na promessa de precisão de um fornecedor: meça nas suas próprias conversas.
- Monte um conjunto de referência calibrado: peça aos seus melhores avaliadores que avaliem uma amostra de conversas reais e cheguem a um acordo sobre as respostas.
- Meça a concordância: rode a avaliação automática no mesmo conjunto e compare critério por critério, para saber exatamente onde ela concorda e onde não concorda.
- Ajuste os critérios, não só o modelo: a maior parte das discordâncias vem de um critério vago. Reescreva-o para que uma pessoa e uma máquina o leiam da mesma forma.
- Reavalie ao longo do tempo: repita a comparação periodicamente, para que a precisão não se desvie em silêncio à medida que o seu produto e as suas políticas mudam.
- Exija rastreabilidade: toda nota deve apontar para as linhas da transcrição que a geraram, para que qualquer resultado possa ser verificado ou revertido, em vez de virar discussão.
Para uma versão passo a passo, veja o protocolo de uma semana para validar a avaliação de QA com IA (em inglês), ou rode primeiro as notas automáticas em paralelo às avaliações humanas com o shadow scoring (em inglês) antes de confiar nelas.
A Kaizo avalia 100% das conversas de atendentes e de agentes de IA com o formulário de monitoria que a sua empresa realmente usa, rastreia cada nota até a evidência na transcrição e permite testá-la com o seu próprio conjunto de referência até você conseguir apresentar a sua própria taxa de concordância. Um avaliador cujas notas você não consegue verificar só pode pedir que você acredite no número dele.
Quais são os erros mais comuns ao julgar a precisão do QA com IA?
Os erros mais comuns são usar como referência avaliadores que não concordam entre si, julgar apenas por critérios subjetivos, ignorar a amostra em que a comparação se baseia e aceitar notas sem evidência. Cada um deles faz o QA com IA parecer mais ou menos preciso do que realmente é nas suas conversas, e o número que você apresenta deixa de significar alguma coisa.
- Comparar o QA com IA a um humano não calibrado: se os seus avaliadores não concordam entre si, eles não são uma referência confiável de precisão.
- Julgar a precisão apenas por critérios subjetivos: a maior parte de um formulário de monitoria é objetiva, onde a IA é mais forte, então pondere a avaliação da mesma forma que os critérios são de fato ponderados.
- Ignorar a amostra que você está julgando: uma nota um pouco menos precisa sobre todas as conversas diz muito mais sobre a sua operação do que uma nota perfeita sobre uma fatia de 2% que alguém escolheu.
- Aceitar notas sem evidência: se uma nota não leva à transcrição, você não tem como verificar a precisão dela. Uma nota que você não consegue verificar é uma opinião com um número.
Quando a avaliação com IA não é para você
A avaliação de QA com IA não é o primeiro passo certo para todas as equipes. Se você atende poucos tickets por semana, um único avaliador consegue ler todos, e a cobertura total agrega pouco. Se você ainda não tem um formulário de monitoria, comece por ele, porque a avaliação automática só é tão precisa quanto os critérios que aplica.
Escreva e calibre os critérios com os seus avaliadores primeiro. E se as suas questões de qualidade forem, em sua maioria, sobre casos raros e muito subjetivos, a avaliação humana continua sendo a melhor ferramenta para eles.
Quando você estiver pronto para avaliar todas as conversas com base em um padrão calibrado, veja como o software de QA automatizado faz isso na Kaizo, ou agende uma demo e rodamos a avaliação nas suas próprias conversas.
Perguntas frequentes
Qual é a precisão da avaliação de QA com IA?
Em critérios objetivos e verificáveis por evidência, como a aderência ao processo e a correção das informações, um sistema de QA com IA bem configurado concorda com um avaliador humano calibrado na grande maioria das vezes. A precisão é menor em julgamentos subjetivos, como a empatia com nuances, e é aí que a calibração humana continua no processo. A melhor forma de saber o seu próprio número é medir a concordância com um conjunto de conversas que os seus avaliadores já avaliaram.
Dá para confiar na IA para avaliar a qualidade do atendimento ao cliente?
Dá, quando cada nota leva à evidência na transcrição e você já verificou a concordância dela com os seus próprios avaliadores calibrados. A verificação importa porque permite provar que o avaliador automático está certo ou errado nas suas próprias conversas, em vez de acreditar na promessa.
O QA com IA é mais preciso que a monitoria humana?
Ele é mais consistente, o que na prática o torna mais preciso sobre a sua operação como um todo. Avaliadores humanos mudam de critério, discordam entre si e só conseguem ler uma pequena amostra. A IA aplica os mesmos critérios a 100% das conversas, sem cansaço, então detecta problemas sistemáticos que uma amostra manual de 2% deixa passar. As pessoas continuam mais perspicazes em casos raros e muito subjetivos.
Como o QA com IA é calibrado com as notas da monitoria humana?
Os avaliadores avaliam um conjunto de referência de conversas e chegam a um acordo sobre as respostas; depois, as notas automáticas dessas mesmas conversas são comparadas critério por critério. Onde há discordância, o critério normalmente é reescrito para que uma pessoa e uma máquina o leiam da mesma forma. A comparação é repetida periodicamente para que as duas continuem alinhadas.
O QA com IA substitui os avaliadores humanos?
Não. Ele substitui a avaliação manual de milhares de conversas, o que libera os avaliadores humanos para o trabalho que só eles podem fazer: calibrar o padrão, tratar as contestações e fazer coaching sobre as falhas que o sistema revela. O modelo certo é a IA para cobertura e consistência, e as pessoas para calibração e julgamento.
O QA com IA avalia conversas de agentes de IA tão bem quanto as de atendentes?
Sim. A Kaizo avalia 100% das conversas de atendentes e de agentes de IA com o mesmo formulário de monitoria, e cada nota é rastreada até a evidência na transcrição. Assim, você mede a precisão da mesma forma para os dois, com base em um conjunto de referência sobre o qual os seus avaliadores chegaram a um acordo.
Termos relacionados
- O que é LLM as a judge? (em inglês)
- O que é auto QA? (em inglês)
- Monitoria de qualidade de agentes de IA e chatbots
- O que é calibração de monitoria?
- O que é 100% de cobertura de QA? (em inglês)