Pular para o conteúdo

Modelo

Scorecard de agentes de IA: os critérios que mudam

Scorecard de agentes de IA: que critérios incluir, quais tirar do formulário dos atendentes e como avaliar um agente de IA de forma justa e rastreável.

· 7 min de leitura

Revisado por Dominik Blattner, fundador da Kaizo

Nesta página

Um agente de IA falha de um jeito diferente de uma pessoa, então o scorecard de agentes de IA tira os critérios que só valem para humanos e mantém os que tratam de resolver o problema. Ele acrescenta verificações de alucinação, escalonamento inseguro, respeito ao escopo e honestidade sobre o que o agente não sabe.

Em resumo

  • O tom acolhedor diz pouco. A precisão factual diz quase tudo.
  • Avalie todas as conversas da IA, porque as falhas automatizadas se repetem em escala.
  • As piores falhas da IA são silenciosas e nunca chegam a um escalonamento.
  • Não deixe que a equipe que construiu o agente seja a única a avaliá-lo.

Por que você não pode reaproveitar o formulário de monitoria dos atendentes

Quando você coloca um agente de IA em produção, o instinto é avaliá-lo com o formulário de monitoria que você já tem. É tentador, porque o objetivo parece o mesmo: uma boa conversa com o cliente. Mas o formulário que você criou para pessoas carrega premissas sobre como as pessoas falham, e um agente de IA quebra essas premissas nos dois sentidos.

Um atendente normalmente não inventa uma política de reembolso que não existe, mas pode ser seco sob pressão. Um agente de IA quase nunca vai ser seco, mas vai afirmar uma política inventada com total confiança. Avaliar o agente de IA pelo tom acolhedor diz pouco, porque o tom é o que ele entrega com mais consistência. Avaliar se cada afirmação factual que ele fez era verdadeira diz quase tudo, porque é ali que ele realmente falha. O scorecard precisa levar a atenção para onde o risco está agora. O nosso método completo de monitoria de qualidade de agentes de IA e chatbots cobre o fluxo de trabalho em volta disso; a pergunta aqui é mais específica: o que de fato entra no scorecard.

Critérios humanos que deixam de fazer sentido

Comece tirando os critérios que medem algo que um agente de IA não tem ou em que ele não varia.

  • Tom e acolhimento como indicador de empatia: o tom de um agente de IA é definido pelo prompt e quase não varia, então avaliá-lo mede a configuração, não a interação. A empatia continua importando, mas como a adequação da resposta ao estado do cliente, o que é tratado mais abaixo.
  • Esforço e iniciativa: critérios como ir além do esperado pressupõem uma pessoa que escolhe fazer mais. Eles não se aplicam a um sistema que executa instruções.
  • Aderência a um script que o atendente decorou: substituída pela aderência ao escopo e às políticas, que é uma verificação diferente e mais precisa para uma máquina.
  • Critérios de desenvolvimento pessoal: tudo o que diz respeito ao agente aprender ou melhorar cabe a quem é dono do modelo, não a uma nota por conversa.

Tirar esses critérios não é baixar a régua. É apontar a régua para as falhas que realmente podem acontecer.

Critérios exclusivos do scorecard de agentes de IA

São esses acréscimos que fazem dele um scorecard de agentes de IA, e não um formulário dos atendentes adaptado. Cada um descreve uma falha que uma pessoa raramente comete e que uma máquina comete o tempo todo.

CritérioO que verificaPor que um atendente raramente cai nele
Precisão factual de cada afirmaçãoNada do que o agente afirmou foi inventado ou estava erradoPessoas hesitam quando não têm certeza; modelos afirmam com a mesma confiança, certos ou errados
Fidelidade às políticasO agente não inventou, suavizou nem exagerou uma políticaUm atendente sabe quando não conhece uma política; um modelo gera uma que parece plausível
Aderência ao escopoO agente ficou dentro do que pode fazer ou prometerPessoas percebem o limite da sua autoridade; um modelo precisa ser informado e pode passar do limite
Comportamento de escalonamentoTransferiu quando devia e não prendeu o clienteUm atendente percebe quando está travado; um modelo pode entrar em loop ou chegar a um beco sem saída sem notar
Honestidade sobre a incertezaDisse que não sabia em vez de chutarChutar com confiança é o padrão de um modelo, não de uma pessoa
Tratamento seguro de pedidos sensíveisRecusou ou encaminhou corretamente casos de automutilação, fraude ou risco jurídicoO julgamento que uma pessoa aplica por instinto precisa virar um critério explícito para uma máquina

Critérios que continuam iguais

Algumas coisas importam independentemente de quem ou do que está respondendo, e elas formam a espinha do scorecard.

  • O problema foi resolvido: o cliente saiu com o problema resolvido, e não apenas sem falar com um humano. É o critério que uma taxa de contenção (em inglês) deixa de lado sem alarde.
  • A informação estava correta e completa: também está no formulário dos atendentes, mas aqui pesa muito mais.
  • O cliente foi tratado de forma adequada: reformulado de acolhimento para adequação, ou seja, se a resposta combinou com a situação e o estado emocional do cliente.
  • A interação foi eficiente para o cliente: não o tempo de atendimento do agente, mas se o cliente chegou à solução sem voltas desnecessárias.

Escrever critérios que uma IA consegue avaliar (em inglês) mostra como formular cada um deles para que possa ser verificado na transcrição, em vez de virar questão de opinião.

Como avaliar com o scorecard: cobertura e rastreabilidade

Duas coisas separam um scorecard de agentes de IA que funciona de um que é só decorativo.

Avalie tudo, não uma amostra

A monitoria humana avaliava algumas conversas por atendente porque ler cada uma custava caro. Essa lógica não se sustenta com agentes de IA, porque as falhas deles são sistemáticas: uma fraqueza no prompt que produz uma alucinação produz a mesma alucinação centenas de vezes, e uma amostra de 2% costuma deixar o padrão passar até ele já ser um problema. Avaliar 100% das conversas (em inglês) é o que transforma o scorecard em um instrumento de monitoramento, e não em uma checagem pontual. Na UiPath, a Kaizo automatizou 100% do QA com ROI de 200% e um aumento de 8% na nota de qualidade.

Ligue cada nota à transcrição

Uma nota de precisão factual ou de fidelidade às políticas só é útil se você consegue ver as linhas exatas que a derrubaram. Sem isso, você não consegue corrigir o prompt nem defender a nota quando a equipe dona do agente questionar. Cada nota da Kaizo aponta para a evidência que a gerou.

Não deixe que quem construiu o agente seja o único avaliador

O ponto estrutural desconfortável: se a equipe que construiu o seu agente de IA é a única que o avalia, os critérios com mais chance de ficarem frouxos são justamente os que fariam o agente parecer ruim. Avalie critérios como precisão factual e escalonamento inseguro com o seu próprio scorecard, e garanta que cada nota leve à evidência na conversa. A taxonomia de falhas silenciosas aprofunda as falhas que um avaliador complacente costuma deixar passar.

Perguntas frequentes

O que é um scorecard de agentes de IA?

É o conjunto de critérios usado para avaliar conversas atendidas por um sistema automatizado, e não por uma pessoa. Ele é diferente de um formulário de monitoria humano porque tira os critérios que só valem para pessoas, mantém os que verificam se o problema do cliente foi resolvido e se a informação estava correta, e acrescenta critérios exclusivos da automação, como precisão factual, fidelidade às políticas, aderência ao escopo e comportamento de escalonamento.

Posso usar o meu formulário de monitoria atual para um agente de IA?

Não sem mudá-lo. Um formulário de monitoria dos atendentes carrega premissas sobre como as pessoas falham, e os agentes de IA falham de outro jeito. O tom acolhedor quase não varia em um modelo e diz pouco, enquanto fatos inventados e políticas inventadas, que pessoas raramente produzem, viram o principal risco. Reaproveitar o formulário dos atendentes aponta a sua atenção para as falhas erradas.

Quais critérios são exclusivos da avaliação de um agente de IA?

Precisão factual de cada afirmação, fidelidade às políticas (não inventar nem exagerar uma política), aderência ao escopo, comportamento de escalonamento (transferir quando está travado em vez de prender o cliente), honestidade sobre a incerteza e tratamento seguro de pedidos sensíveis. Cada um descreve uma falha que uma pessoa raramente comete e que um modelo comete o tempo todo.

Devo avaliar todas as conversas do agente de IA ou só uma amostra?

Todas. As falhas de um agente de IA são sistemáticas: uma fraqueza no prompt que produz uma alucinação produz a mesma alucinação centenas de vezes, e uma amostra de 2% costuma deixar o padrão passar até ele já ser um problema. Avaliar 100% das conversas transforma o scorecard em um instrumento de monitoramento, e não em uma checagem pontual.

Por que a equipe que construiu o agente de IA não deve ser a única a avaliá-lo?

Porque os critérios com mais chance de ficarem frouxos são os que fariam o agente parecer ruim. Avalie a precisão factual e o escalonamento inseguro com o seu próprio scorecard, e ligue cada nota à evidência na transcrição.

Termos relacionados

Monte um scorecard de agentes de IA que pegue o que importa

Traga as conversas que o seu agente de IA atendeu no mês passado e o formulário de monitoria que você usa hoje. Vamos mostrar quais critérios deixam de fazer sentido para uma máquina, quais falhas o seu formulário atual não enxerga e o que um scorecard feito para a automação pega no lugar delas. Cada nota leva às linhas exatas da transcrição.

Agendar demo Conheça o Agentic Auto QA

Nesta página

Veja isso nas suas próprias conversas

Avaliamos uma amostra dos seus tickets reais com os seus próprios padrões, para que o exemplo seja seu.

A escolha de equipes de atendimento no mundo todo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart