Aller au contenu

Bonnes pratiques

Erreurs silencieuses des agents IA : les repérer

Erreurs silencieuses des agents IA : la non-escalade risquée et cinq autres erreurs que votre tableau de bord compte comme des succès, avec leurs signaux.

· 10 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Les erreurs silencieuses des agents IA sont des erreurs que vos indicateurs comptent comme des succès. Le ticket se ferme, le taux de contention enregistre une victoire, et le client repart avec une mauvaise réponse ou un besoin non satisfait. La non-escalade risquée, quand l’agent IA garde un dossier qu’il aurait dû confier à un humain, est l’une des plus difficiles à voir, car aucun événement d’escalade n’est jamais enregistré.

En bref

  • Les erreurs silencieuses des agents IA se répartissent en six types courants, de l’invention assurée à la réponse fluide à la mauvaise question.
  • La non-escalade risquée est le type le plus discret, car un dossier qui n’est jamais escaladé ressemble à du self-service sur chaque tableau de bord.
  • Les erreurs des agents IA se répètent : une faiblesse du prompt produit la même erreur chaque fois que ses conditions se reproduisent.
  • Pour trouver les erreurs silencieuses, évaluez ce que l’agent IA a dit, sur chaque conversation, selon vos propres critères écrits.

Pourquoi ce sont les erreurs silencieuses qui font mal

Quand un agent IA échoue bruyamment, vous le savez déjà. Il plante, il escalade, il dit au client qu’il ne peut pas l’aider, et un humain prend le relais. Cet échec est agaçant mais visible, et les échecs visibles sont corrigés parce que les indicateurs les captent. Les erreurs silencieuses ne laissent rien que les indicateurs puissent capter.

Une erreur silencieuse est différente. L’agent termine la conversation, la marque comme résolue et passe à la suite, après avoir fait quelque chose de faux que personne n’a enregistré. Le taux de contention la compte comme contenue. Le tableau de bord des volumes la compte comme traitée. L’indicateur de résolution, s’il existe, a été positionné par l’agent lui-même, qui croyait avoir réussi. Tous vos systèmes de suivi s’accordent à dire que la conversation s’est bien passée, et le seul à savoir le contraire est le client, qui ne remplit pas votre enquête.

C’est pourquoi les erreurs silencieuses s’accumulent : la boucle de retour qui les ferait apparaître est justement celle qui manque. C’est aussi pourquoi le reporting service client doit s’appuyer sur ce qui a été dit dans chaque conversation, et non sur des indicateurs de résolution et des enquêtes. Notre guide du contrôle qualité des agents IA est construit pour refermer cette boucle.

Les six types d’erreurs silencieuses des agents IA

Six types récurrents couvrent l’essentiel de ce qui dérape sans bruit chez un agent IA : l’invention assurée, la politique inventée, la fausse résolution, la non-escalade risquée, le dépassement de périmètre et la réponse à la mauvaise question. Les nommer, c’est déjà la moitié du travail, car on ne peut pas évaluer une erreur que l’on n’a pas définie, et aucune d’elles ne déclenche de message d’erreur.

Erreur silencieuseCe qui se passePourquoi le tableau de bord ne la voit pas
Invention assuréeL’agent présente un fait inventé comme s’il était certainAucun signal d’incertitude ne se déclenche, et le ticket se ferme normalement
Politique inventéeIl génère une règle de remboursement, de garantie ou d’éligibilité plausible qui n’existe pasElle paraît faire autorité, donc personne ne la remet en question jusqu’à ce qu’un client exige que vous l’appliquiez
Fausse résolutionIl déclare le problème résolu alors qu’il ne l’est pasL’indicateur de résolution est positionné par l’agent, et le taux de contention le compte comme une victoire
Non-escalade risquéeIl continue de traiter un dossier qu’il aurait dû confier à un humainAucun événement d’escalade n’est enregistré, donc le dossier ressemble à du self-service
Dépassement de périmètreIl répond ou promet au-delà de ce qu’il est autorisé à faireLe client est satisfait sur le moment, donc les signaux de satisfaction semblent bons
Bonne réponse, mauvaise questionIl répond avec aisance à une question que le client n’a pas poséeL’aisance et un ticket fermé passent pour un succès

L’invention assurée est ce que la plupart des équipes appellent une hallucination. Les cinq autres peuvent se produire alors que chaque fait est exact, et c’est pourquoi une vérification des faits seule ne les trouve pas.

Ce que doit couvrir une politique de non-escalade pour les agents IA

Une politique de non-escalade pour les agents IA est l’ensemble de règles écrites qui fixe quand l’agent doit s’arrêter et confier le dossier à un humain. Elle nomme les déclencheurs, le transfert lui-même et la façon dont chaque dossier est vérifié ensuite. Sans elle, la non-escalade risquée ne peut pas être évaluée, car personne n’a défini ce que l’agent aurait dû faire.

Une politique applicable répond à quatre questions :

  1. Quelles demandes vont toujours à un humain ? Par exemple, un client qui demande à parler à une personne, une réclamation qui mentionne une action en justice, ou une demande qui sort de ce que l’agent est autorisé à décider.
  2. Quels signaux imposent un transfert en cours de conversation ? Par exemple, la même question posée deux fois sans progrès, une frustration croissante, ou un client qui semble vulnérable.
  3. Que transmet le transfert ? L’humain doit recevoir le contexte, pour que le client n’ait pas à se répéter. Notre guide sur le contrôle qualité du transfert entre agent IA et conseiller explique comment évaluer cette étape.
  4. Comment chaque dossier est-il vérifié ? Ajoutez « a escaladé quand la politique l’exigeait » comme critère dans votre grille d’évaluation pour agent IA, et évaluez-le sur les conversations que l’agent a clôturées, pas seulement sur celles qu’il a transmises.

Les conversations escaladées ont aussi besoin de leur propre grille. Comment évaluer un ticket escaladé explique comment attribuer chaque défaillance à l’étape où elle est née.

Pourquoi les erreurs des agents IA se répètent au lieu de se disperser

Les erreurs des agents IA se répètent parce qu’elles sont structurelles. Elles viennent du prompt, des connaissances récupérées, du modèle ou des garde-fous, si bien que la même faiblesse produit la même erreur silencieuse chaque fois que les conditions se reproduisent. Les erreurs d’un conseiller humain sont en grande partie individuelles et aléatoires : un mauvais jour, une mauvaise lecture, une lacune dans la formation d’une personne.

Cela change l’enjeu. Une politique inventée, c’est une mauvaise conversation. La même faiblesse du prompt qui génère cette politique inventée dans chaque conversation concernée pendant un mois, c’est un risque qui grandit aussi vite que le déploiement. Cela change aussi la stratégie de détection : comme les erreurs sont systématiques, l’échantillonnage n’est pas le bon outil. Un échantillon de 2 % est conçu pour estimer un taux aléatoire, et il manquera régulièrement une erreur qui ne se déclenche que dans une condition précise, présente dans une partie des conversations. Il faut toutes les examiner.

Comment repérer les erreurs silencieuses que les indicateurs cachent

Les erreurs silencieuses sont invisibles pour les indicateurs de volume et de résolution, car ceux-ci mesurent la forme de la conversation, pas son contenu. Pour les repérer, il faut lire ce que l’agent IA a réellement dit, à grande échelle, selon des critères définis, sur chaque conversation, et rattacher chaque constat aux lignes qui l’ont produit pour que le responsable puisse corriger la cause.

Évaluer le contenu, pas le résultat

Pour chaque conversation, vérifiez ce qu’une erreur silencieuse met en défaut : chaque affirmation factuelle était-elle vraie, chaque politique existait-elle, la résolution annoncée était-elle réelle, l’agent a-t-il escaladé quand il le fallait ? Ce sont les critères d’une grille d’évaluation pour agent IA, et ce sont ceux auxquels un journal de routage ne peut pas répondre.

Tout couvrir

Comme les erreurs sont systématiques, la couverture n’est pas un bonus. Évaluer 100 % des conversations (en anglais) transforme une erreur silencieuse qu’on finit par remarquer en un schéma que l’on voit dès la semaine où il apparaît. Chez UiPath, Kaizo a automatisé 100 % du contrôle qualité avec un ROI de 200 % et une hausse de 8 % du score qualité : c’est le niveau de couverture auquel les erreurs systématiques deviennent visibles tôt.

Voyez-le sur vos propres conversations. Kaizo évalue 100 % de vos conversations de support, y compris celles que traite votre agent IA, selon vos propres critères. Réserver une démo.

Trouver les erreurs pour lesquelles vous n’avez pas encore de critères

Une grille ne capte que les erreurs que vous avez nommées, alors cherchez celles que vous n’avez pas nommées. Commencez par les conversations que l’agent IA a marquées comme résolues et pour lesquelles le client est revenu sur le même problème, ou dans lesquelles le ton est devenu négatif après la réponse de l’agent. Quand un nouveau schéma apparaît, écrivez-le comme critère et évaluez-le à partir de ce moment.

Rattacher chaque constat aux lignes exactes

Une erreur silencieuse ne se corrige que si quelqu’un peut la montrer du doigt. Kaizo évalue 100 % des conversations des conseillers et des agents IA selon votre propre grille, appelle l’invention assurée et la fausse résolution par leur nom, et rattache chaque constat aux lignes exactes qui l’ont produit. C’est cette traçabilité qui vous permet de ramener une erreur silencieuse à la personne responsable du prompt et de la corriger vraiment, au lieu de débattre de la question de savoir si elle a eu lieu.

Quand une revue complète des erreurs silencieuses n’est pas pour vous

Si votre agent IA traite une poignée de conversations par semaine, lisez-les toutes vous-même : pas besoin d’un logiciel pour cela. Si vous n’avez pas encore de critères écrits, commencez avant tout par la grille d’évaluation pour agent IA. Et si votre bot se contente d’orienter les clients vers la bonne file d’attente sans leur répondre, la plupart de ces types d’erreurs ne peuvent pas se produire, et vos journaux de routage vous diront l’essentiel.

Questions fréquentes

Qu’est-ce qu’une erreur silencieuse chez un agent IA ?

Une erreur silencieuse est une erreur qui ne laisse aucune trace dans les indicateurs que vous suivez. La conversation se termine, le ticket se ferme, le taux de contention la compte comme une victoire, et le client repart avec une mauvaise réponse ou un besoin non satisfait. Elle est dangereuse parce que tous les systèmes de suivi s’accordent à dire que la conversation s’est bien passée, et l’erreur s’accumule donc sans être vue.

Quels sont les principaux types d’erreurs silencieuses des agents IA ?

L’invention assurée (présenter des faits inventés), la politique inventée (générer des règles qui n’existent pas), la fausse résolution (déclarer un problème résolu alors qu’il ne l’est pas), la non-escalade risquée (traiter un dossier qu’il aurait dû transmettre), le dépassement de périmètre (agir au-delà de son autorité) et la réponse fluide à la mauvaise question. Aucune ne déclenche de message d’erreur ni n’active un indicateur de résolution.

Pourquoi l’échantillonnage manque-t-il les erreurs silencieuses ?

Parce que les erreurs des agents IA sont systématiques, pas aléatoires. Une faiblesse du prompt produit la même erreur chaque fois que ses conditions se reproduisent, souvent dans une partie précise des conversations. Un petit échantillon aléatoire est conçu pour estimer un taux aléatoire et manquera régulièrement une erreur concentrée dans des conditions qu’il n’a pas échantillonnées. C’est la couverture complète qui fait apparaître le schéma.

Une erreur silencieuse est-elle la même chose qu’une hallucination ?

Non. Une hallucination, ou invention assurée, est l’un des six types. Un agent IA peut aussi inventer une politique, déclarer une fausse résolution, ne pas escalader, agir au-delà de son autorité ou répondre à la mauvaise question, parfois alors que chaque fait est exact. Une vérification des faits seule ne trouve qu’une partie du problème.

Un taux de contention élevé signifie-t-il que l’agent IA fonctionne ?

Pas à lui seul. Le taux de contention compte une conversation comme une victoire quand le client n’a pas joint d’humain, et une fausse résolution ou une non-escalade risquée ressemble exactement à cela. Il faut évaluer ce que l’agent a dit pour savoir si une conversation contenue était une bonne conversation.

Qui doit corriger une erreur silencieuse une fois qu’elle est trouvée ?

La personne responsable de la cause : le prompt, les connaissances récupérées ou les garde-fous. Comme les erreurs des agents IA sont structurelles, le coaching ne les corrige pas comme il corrige l’erreur d’un humain. Chaque constat doit renvoyer aux lignes exactes de la transcription, pour que le responsable voie ce qu’il faut changer.

Termes associés

Trouvez les erreurs que votre tableau de bord compte comme des victoires

Apportez un mois de conversations que votre agent IA a marquées comme résolues. Nous les évaluerons selon vos propres critères, sur l’ensemble des conversations, et vous montrerons les inventions assurées, les politiques inventées et les fausses résolutions que le taux de contention a comptées comme des succès. Chaque constat renvoie aux lignes exactes de la transcription, et notre reporting service client montre quelles erreurs sont systémiques, pour que vous puissiez les porter directement à la personne responsable du prompt.

Réserver une démo Découvrir Agentic Auto QA

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart