Pular para o conteúdo

Boas práticas

Monitoria de qualidade de agentes de IA e chatbots

Monitoria de qualidade de agentes de IA e chatbots: monte o formulário, avalie 100% das conversas, ligue cada nota à evidência e detecte as falhas da IA.

· 7 min de leitura

Revisado por Dominik Blattner, fundador da Kaizo

Nesta página

A monitoria de qualidade de agentes de IA começa por um formulário de monitoria que define o que é uma boa conversa atendida por IA, e por avaliar cada uma delas automaticamente. Mantenha o avaliador independente da IA que ele avalia e ligue cada nota à transcrição, para conseguir corrigir a falha.

Em resumo

  • O volume da IA é alto demais para amostrar à mão.
  • Procure informação errada, escalonamentos perdidos, alucinações e respostas fora do tom.
  • Leve os achados para os prompts, os guardrails e o roteamento.
  • Avalie de novo depois para confirmar que a correção se manteve.

Passo 1: defina o que é bom para um agente de IA

Agentes de IA falham de um jeito diferente das pessoas, então um formulário de monitoria feito para atendentes, copiado sem ajustes, vai deixar passar justamente o que mais importa. Comece escrevendo como é, de fato, uma boa conversa atendida por IA no seu negócio, em critérios que uma máquina consiga julgar a partir de uma transcrição.

Monte os critérios em torno das falhas típicas da IA

Um bom formulário de monitoria para IA cobre os comportamentos que quebram a confiança quando o agente erra:

  • Precisão factual: o agente deu a informação correta, ou inventou uma política, um preço ou uma etapa que não existe?
  • Resolução: ele realmente resolveu o problema do cliente, ou só fechou o ticket?
  • Escalonamento correto: ele passou para um atendente no momento certo, e não tarde demais?
  • Tom e empatia: ele acompanhou o estado emocional do cliente em vez de soar robótico?
  • Respeito às políticas e à segurança: ele ficou dentro dos limites que você definiu, recusando o que deveria recusar?

Torne cada critério verificável pela evidência

Escreva os critérios de modo que um “aprovado” ou “reprovado” possa ser rastreado até uma linha específica da conversa. A Kaizo permite montar o formulário de monitoria que o seu negócio realmente usa e julga cada conversa com base nele, como faria o seu melhor avaliador, o que mantém a monitoria da IA e a dos atendentes num mesmo padrão comparável.

Passo 2: avalie 100% das conversas da IA, não uma amostra

A monitoria manual cobre de 2% a 5% dos tickets, porque uma pessoa só consegue ler até certo ponto. Os agentes de IA tornam esse teto insustentável: eles operam em volumes que nenhuma equipe de avaliação consegue amostrar de forma útil, e uma falha rara, mas grave, quase sempre vai estar nos 95% que ninguém lê.

Automatize a avaliação

Conecte o helpdesk ou o CRM onde as suas conversas já estão e deixe o sistema avaliar cada interação atendida pela IA assim que ela chega, de forma contínua e em segundo plano. A Kaizo tem integração nativa com o Zendesk e o Salesforce e lê as conversas direto dos sistemas que você já usa, então não há um pipeline separado para manter. Agende uma demo para ver isso nas suas próprias conversas.

Por que a cobertura total importa ainda mais para a IA

Um único agente aplica o mesmo comportamento em milhares de conversas, então uma falha sistemática, uma política mal interpretada ou um padrão ruim, se repete em escala. Avaliar 100% é o que revela esse padrão cedo. Na UiPath, a Kaizo automatizou 100% do QA com 200% de ROI, que é o nível de cobertura que o volume atendido por IA agora exige.

Passo 3: mantenha o avaliador independente

Este é o passo que a maioria das equipes pula, e é ele que decide se a sua monitoria de IA merece confiança. Não deixe que a equipe que construiu um agente de IA seja a única a avaliá-lo. Uma equipe cobrada para que o agente pareça bom não é a melhor juíza para dizer se ele é bom.

A evidência é o que dá credibilidade à nota

O avaliador deve aplicar o mesmo formulário de monitoria, seja a conversa atendida por uma pessoa, pelo seu próprio bot ou pela IA de outro fornecedor. A Kaizo avalia 100% das conversas de atendentes e de agentes de IA com base no seu próprio formulário de monitoria, e cada nota leva à evidência na conversa, então o veredito sobre um agente pode ser conferido em vez de aceito na confiança.

O que perguntar a um fornecedor de QA

  • Vocês conseguem avaliar um agente de IA construído por outra empresa com o mesmo formulário de monitoria que o nosso?
  • Cada nota leva à evidência, para que possamos conferir o julgamento de vocês em vez de aceitá-lo na confiança?

Passo 4: detecte as falhas específicas da IA

Com a avaliação rodando em todas as conversas, direcione-a para as falhas que são exclusivas da automação, ou ampliadas por ela. Estas são as categorias que vale isolar e acompanhar ao longo do tempo.

Tipo de falhaComo apareceO que o formulário de monitoria verifica
Informação erradaO agente afirma uma política, um preço ou uma etapa que é falsaCada afirmação factual estava correta e baseada nas suas fontes?
Escalonamento perdidoO agente continua cuidando de um caso que deveria ter passado para um atendenteEle escalonou no gatilho certo e a tempo?
Confiança alucinadaUma resposta errada dada como se fosse certaO agente evitou inventar detalhes que não podia verificar?
Resposta fora do tomLinguagem robótica ou displicente num contato com um cliente frustradoO tom acompanhou o estado emocional do cliente?
Violação de políticaO agente faz algo que foi instruído a recusarEle ficou dentro dos seus limites de segurança e de política?

Passo 5: leve os achados de volta e avalie de novo

A monitoria de qualidade só vale a pena se mudar o comportamento. Como cada nota da Kaizo leva ao momento exato da transcrição que a gerou, uma falha não é só um alerta: é um exemplo específico e reproduzível sobre o qual você pode agir.

Feche o ciclo

  • Encaminhe as falhas de precisão para o prompt, a base de conhecimento ou a fonte de referência que gerou a resposta errada.
  • Transforme escalonamentos perdidos em uma regra de roteamento ou um gatilho mais rigoroso.
  • Agrupe as falhas recorrentes para corrigir o padrão uma vez, em vez de remendar caso a caso.

Depois, avalie de novo para confirmar que a correção se manteve. Uma cobertura total e contínua mostra o efeito de uma mudança em todas as conversas, e não numa amostra que pode deixar a regressão passar.

Erros comuns a evitar

Alguns erros minam em silêncio os programas de monitoria de IA antes que eles gerem valor.

  • Amostrar a IA como se amostravam os atendentes: uma amostra de 2% de um bot de alto volume deixa passar falhas sistemáticas quase por definição.
  • Deixar só a equipe que construiu o agente avaliá-lo: sem um avaliador independente, uma nota bonita não é o mesmo que um bom trabalho.
  • Avaliar sem evidência: uma nota que não pode ser rastreada até uma linha da transcrição não pode ser verificada, usada em coaching nem contestada.
  • Reaproveitar o formulário dos atendentes sem mudanças: falhas típicas da IA, como alucinação e falsa confiança, precisam de critérios próprios.
  • Medir e nunca levar de volta: uma monitoria que não muda prompts, guardrails nem roteamento é só relatório.

Perguntas frequentes

Como fazer a monitoria de qualidade de um agente de IA ou chatbot?

Monte um formulário de monitoria que defina uma boa conversa atendida por IA, cobrindo precisão, resolução, escalonamento correto, tom e respeito às políticas. Avalie 100% das conversas da IA com base nele, de forma automática, mantenha o avaliador independente da IA avaliada e ligue cada nota à evidência na transcrição, para que as falhas possam ser verificadas e corrigidas.

Por que o avaliador precisa ser independente do agente de IA?

Se as únicas pessoas que avaliam um agente de IA são as que o construíram, elas têm um incentivo para fazer o agente parecer bom. Um avaliador que liga cada nota à evidência na conversa é o que dá credibilidade à nota, porque qualquer pessoa pode conferi-la.

Dá para usar o mesmo formulário de monitoria para agentes de IA e atendentes?

Dá para compartilhar os critérios que valem para os dois, como resolução e tom, o que mantém a monitoria da IA e a dos atendentes comparáveis. Mas a IA precisa de critérios extras para as suas próprias falhas, como alucinação e falsa confiança, então a abordagem mais sólida é um único padrão com verificações específicas para a IA.

Quais são as falhas mais comuns de um agente de IA?

As cinco categorias que vale acompanhar são informação errada, escalonamento perdido, confiança alucinada, resposta fora do tom e violação de política. Cada uma tem um critério próprio no formulário de monitoria, para que a falha possa ser isolada, rastreada até a transcrição e acompanhada ao longo do tempo.

Quanto das conversas da IA deve passar pela monitoria?

Todas. A IA opera em volumes que nenhuma equipe consegue amostrar de forma útil, e uma falha sistemática se repete em todas as conversas que o agente atende, então uma amostra pequena normalmente não a pega. A avaliação automática de 100% das conversas é o que revela esses padrões cedo.

Termos relacionados

Nesta página

Veja isso nas suas próprias conversas

Avaliamos uma amostra dos seus tickets reais com os seus próprios padrões, para que o exemplo seja seu.

A escolha de equipes de atendimento no mundo todo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart