Pular para o conteúdo

Boas práticas

Falhas silenciosas de agentes de IA e escalonamento

Falhas silenciosas de agentes de IA: o não escalonamento e outras cinco falhas que o seu dashboard conta como sucesso, e os sinais que revelam cada uma delas.

· 9 min de leitura

Revisado por Dominik Blattner, fundador da Kaizo

Nesta página

Uma falha silenciosa é um erro do agente de IA que as suas métricas contam como sucesso. O ticket é fechado, a taxa de contenção registra uma vitória e o cliente sai com uma resposta errada ou uma necessidade não atendida. Entre as falhas silenciosas de agentes de IA, o não escalonamento indevido, quando o agente de IA fica com um caso que deveria ter passado para um humano, é uma das mais difíceis de ver, porque nenhum evento de escalonamento chega a ser registrado.

Em resumo

  • As falhas silenciosas em agentes de IA aparecem em seis tipos comuns, da invenção confiante à resposta fluente para a pergunta errada.
  • O não escalonamento indevido é o tipo mais silencioso, porque um caso que nunca é escalonado parece autoatendimento em todos os dashboards.
  • As falhas de agentes de IA se repetem: uma fraqueza no prompt causa o mesmo erro toda vez que as suas condições voltam a ocorrer.
  • Para encontrar falhas silenciosas, avalie o que o agente de IA disse, em todas as conversas, com base nos seus próprios critérios escritos.

Por que as falhas silenciosas são as que mais doem

Quando um agente de IA falha de forma ruidosa, você já sabe. Ele dá erro, escalona, diz ao cliente que não pode ajudar, e um humano assume. Essa falha incomoda, mas é visível, e falhas visíveis são corrigidas porque as métricas as capturam. As falhas silenciosas não deixam nada para as métricas capturarem.

Uma falha silenciosa é diferente. O agente termina a conversa, marca como resolvida e segue em frente, depois de ter feito algo errado que ninguém registrou. A contenção conta a conversa como contida. O dashboard de volume conta como atendida. O indicador de resolução, se existir, foi marcado pelo próprio agente, que acreditou ter tido sucesso. Todos os sistemas de monitoramento que você tem concordam que a conversa correu bem, e a única pessoa que sabe que não foi assim é o cliente, que não está respondendo à sua pesquisa.

É por isso que as falhas silenciosas se acumulam: o ciclo de feedback que as revelaria é justamente o que está faltando. É também por isso que os insights de atendimento precisam vir do que foi dito em cada conversa, e não de indicadores de resolução e pesquisas. O nosso guia de monitoria de qualidade de agentes de IA foi construído para fechar esse ciclo.

Os seis tipos de falhas silenciosas de agentes de IA

Seis tipos recorrentes cobrem quase tudo o que dá errado em silêncio num agente de IA: invenção confiante, política inventada, falsa resolução, não escalonamento indevido, extrapolação de escopo e resposta à pergunta errada. Dar nome a eles é metade do trabalho, porque não dá para avaliar uma falha que você não definiu, e nenhuma delas gera um erro.

Falha silenciosaO que acontecePor que o dashboard não vê
Invenção confianteO agente afirma um fato inventado como se tivesse certezaNenhum alerta de incerteza dispara, e o ticket fecha normalmente
Política inventadaEle cria uma regra plausível de reembolso, garantia ou elegibilidade que não existeSoa como oficial, então ninguém questiona até que um cliente exija que você a cumpra
Falsa resoluçãoEle declara o problema resolvido quando não foiO indicador de resolução é marcado pelo agente, e a contenção conta como vitória
Não escalonamento indevidoEle continua com um caso que deveria ter passado para um humanoNenhum evento de escalonamento é registrado, então o caso parece autoatendimento
Extrapolação de escopoEle responde ou promete além do que está autorizado a fazerO cliente fica satisfeito na hora, então os sinais de satisfação parecem bons
Resposta certa, pergunta erradaEle responde, com fluência, a uma pergunta que o cliente não fezFluência e ticket fechado parecem sucesso

A invenção confiante é o que a maioria das equipes chama de alucinação. As outras cinco podem acontecer com todos os fatos corretos, e é por isso que uma checagem de fatos sozinha não as encontra.

O que uma política de escalonamento para agentes de IA deve cobrir

Uma política de escalonamento para agentes de IA é o conjunto de regras escritas que define quando o agente deve parar e passar o caso para um humano. Ela nomeia os gatilhos, o próprio transbordo e como cada caso é verificado depois. Sem ela, o não escalonamento indevido não pode ser avaliado, porque ninguém definiu o que o agente deveria ter feito.

Uma política que funciona responde a quatro perguntas:

  1. Quais pedidos sempre vão para um humano? Por exemplo, um cliente que pede para falar com uma pessoa, uma reclamação que menciona ação judicial ou um pedido fora do que o agente está autorizado a decidir.
  2. Quais sinais forçam um transbordo no meio da conversa? Por exemplo, a mesma pergunta feita duas vezes sem avanço, frustração crescente ou um cliente que parece vulnerável.
  3. O que o transbordo leva junto? O humano deve receber o contexto, para que o cliente não precise se repetir. O nosso guia de transbordo para humano explica como avaliar essa etapa.
  4. Como cada caso é verificado? Inclua “escalonou quando a política exigia” como critério no seu scorecard de agentes de IA e avalie esse critério nas conversas que o agente fechou, não só nas que ele repassou.

As conversas escalonadas também precisam de critérios próprios. Como avaliar um ticket escalonado explica como atribuir cada falha ao ponto em que ela foi criada.

Por que as falhas de agentes de IA se repetem em vez de se espalhar

As falhas de agentes de IA se repetem porque são estruturais. Elas vêm do prompt, do conhecimento recuperado, do modelo ou das salvaguardas, então a mesma fraqueza produz a mesma falha silenciosa toda vez que as condições voltam a ocorrer. Os erros de um atendente humano são, em grande parte, individuais e aleatórios: um dia ruim, uma leitura errada, uma lacuna no treinamento de uma pessoa.

Isso muda o que está em jogo. Uma política inventada é uma conversa ruim. A mesma fraqueza no prompt gerando essa política inventada em todas as conversas elegíveis durante um mês é um passivo que cresce na mesma velocidade da implantação. Também muda a estratégia de detecção: como as falhas são sistemáticas, a amostragem é a ferramenta errada. Uma amostra de 2% serve para estimar uma taxa aleatória e vai deixar passar, com frequência, uma falha que só dispara sob uma condição específica presente numa fatia das conversas. É preciso olhar para todas elas.

Como pegar as falhas silenciosas que as métricas escondem

As falhas silenciosas são invisíveis para as métricas de volume e de resolução porque essas métricas medem a forma da conversa, não o conteúdo. Pegá-las significa ler o que o agente de IA realmente disse, em escala, com critérios definidos, em todas as conversas, e ligar cada achado às linhas que o produziram, para que o responsável possa corrigir a causa.

Avalie o conteúdo, não o resultado

Em cada conversa, verifique o que uma falha silenciosa quebra: cada afirmação factual era verdadeira, cada política era real, a resolução declarada era genuína, o agente escalonou quando devia. Esses são os critérios de um scorecard de agentes de IA, e são justamente os que um log de roteamento não consegue responder.

Cubra tudo

Como as falhas são sistemáticas, a cobertura não é um extra. Avaliar 100% das conversas (em inglês) é o que faz uma falha silenciosa deixar de ser um incidente que alguém acaba notando e passar a ser um padrão que você vê na semana em que ele começa. Na UiPath, a Kaizo automatizou 100% do QA com 200% de ROI e um aumento de 8% na nota de qualidade, que é o nível de cobertura em que as falhas sistemáticas ficam visíveis cedo.

Veja isso nas suas próprias conversas. A Kaizo avalia 100% das suas conversas de atendimento, inclusive as que o seu agente de IA atende, com os seus próprios critérios. Agende uma demo.

Encontre modos de falha para os quais você ainda não escreveu critérios

Um scorecard só pega as falhas que você nomeou, então procure as que você ainda não nomeou. Comece pelas conversas que o agente de IA marcou como resolvidas em que o cliente voltou com o mesmo problema, ou em que o tom ficou negativo depois da resposta do agente. Quando surgir um padrão novo, escreva-o como critério e avalie-o a partir de então.

Ligue cada achado às linhas exatas

Uma falha silenciosa só pode ser corrigida quando alguém consegue apontá-la. A Kaizo avalia 100% das conversas de atendentes humanos e de agentes de IA com o seu próprio scorecard, chama a invenção confiante e a falsa resolução pelo que são e liga cada achado às linhas exatas que o produziram. É essa rastreabilidade que permite levar uma falha silenciosa de volta a quem é responsável pelo prompt e corrigi-la de fato, em vez de discutir se ela aconteceu.

Quando uma revisão completa de falhas silenciosas não é para você

Se o seu agente de IA atende um punhado de conversas por semana, leia todas você mesmo; você não precisa de software para isso. Se ainda não tem critérios escritos, comece pelo scorecard de agentes de IA antes de qualquer outra coisa.

E se o seu bot só encaminha os clientes para a fila certa sem responder a eles, a maioria desses tipos de falha não pode acontecer, e os seus logs de roteamento vão mostrar quase tudo o que você precisa.

Perguntas frequentes

O que é uma falha silenciosa em um agente de IA?

Uma falha silenciosa é um erro que não deixa rastro nas métricas que você acompanha. A conversa termina, o ticket fecha, a contenção conta como vitória e o cliente sai com uma resposta errada ou uma necessidade não atendida. Ela é perigosa porque todos os sistemas de monitoramento concordam que a conversa correu bem, então a falha se acumula sem ser vista.

Quais são os principais tipos de falhas silenciosas de agentes de IA?

Invenção confiante (afirmar fatos inventados), política inventada (criar regras que não existem), falsa resolução (declarar um problema resolvido quando não foi), não escalonamento indevido (ficar com um caso que deveria ter sido repassado), extrapolação de escopo (agir além da sua autoridade) e responder com fluência à pergunta errada. Nenhuma delas gera um erro ou aciona um indicador de resolução.

Por que a amostragem não pega as falhas silenciosas?

Porque as falhas de agentes de IA são sistemáticas, não aleatórias. Uma fraqueza no prompt produz a mesma falha sempre que as suas condições voltam a ocorrer, muitas vezes numa fatia específica das conversas. Uma pequena amostra aleatória serve para estimar uma taxa aleatória e vai deixar passar, com frequência, uma falha concentrada em condições que ela por acaso não amostrou. É a cobertura total que revela o padrão.

Uma falha silenciosa é o mesmo que uma alucinação?

Não. A alucinação, ou invenção confiante, é um dos seis tipos. Um agente de IA também pode inventar uma política, declarar uma falsa resolução, deixar de escalonar, agir além da sua autoridade ou responder à pergunta errada, às vezes com todos os fatos corretos. Uma checagem de fatos sozinha encontra só uma parte do problema.

Uma taxa de contenção alta significa que o agente de IA está funcionando?

Não por si só. A contenção conta uma conversa como vitória quando o cliente não chegou a um humano, e uma falsa resolução ou um não escalonamento indevido parecem exatamente isso. Você precisa avaliar o que o agente disse para saber se uma conversa contida foi uma boa conversa.

Quem deve corrigir uma falha silenciosa depois que ela é encontrada?

Quem é responsável pela causa: o prompt, o conhecimento recuperado ou as salvaguardas. Como as falhas de agentes de IA são estruturais, o coaching não as corrige como corrige o erro de uma pessoa. Cada achado deve levar de volta às linhas exatas da transcrição, para que o responsável veja o que mudar.

Termos relacionados

Encontre as falhas que o seu dashboard está contando como sucesso

Traga um mês de conversas que o seu agente de IA marcou como resolvidas. Vamos avaliá-las com os seus próprios critérios, em todas as conversas, e mostrar as invenções confiantes, as políticas inventadas e as falsas resoluções que a contenção contou como sucesso. Cada achado leva de volta às linhas exatas da transcrição, e os nossos insights de atendimento mostram quais falhas são sistêmicas, para que você as leve direto a quem é responsável pelo prompt.

Agendar demo Conheça o Agentic Auto QA

Nesta página

Veja isso nas suas próprias conversas

Avaliamos uma amostra dos seus tickets reais com os seus próprios padrões, para que o exemplo seja seu.

A escolha de equipes de atendimento no mundo todo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart