Aller au contenu

Bonnes pratiques

Taux de déflexion : ce qu’il ne vous dit pas

Le taux de déflexion compte les tickets que votre agent IA a clos, pas ceux qu’il a bien traités. Comment les auditer et repérer les échecs silencieux.

· 13 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Le taux de déflexion compte les contacts qui ne sont jamais arrivés jusqu’à un humain : il mesure donc un volume, jamais la qualité. Une bonne réponse, un client qui a abandonné et une réponse fausse donnée avec assurance se ressemblent en tout point, et la plupart des programmes de contrôle qualité ne relisent jamais ces conversations.

En bref

  • La réponse fausse donnée avec assurance coûte le plus cher, car elle n’est jamais escaladée.
  • La plupart des benchmarks publiés viennent d’éditeurs eux-mêmes jugés sur cet indicateur.
  • Le recontact sous sept jours est la vérification la moins coûteuse, et la donnée est déjà dans votre outil de support.
  • Excluez les tickets déflectés de l’évaluation et vous passez à côté de toute la charge de travail de votre bot.

Que mesure réellement le taux de déflexion ?

Le taux de déflexion est la part des contacts entrants clos sans qu’un conseiller humain y touche. La formule habituelle divise les contacts déflectés par le total des contacts, « déflecté » signifiant que le selfcare ou un agent IA a traité la demande de bout en bout.

Relisez cette définition, car tout le problème s’y trouve. Le numérateur est défini par quelque chose qui ne s’est pas produit : aucun humain n’est intervenu. Rien dans cette mesure ne demande si le problème du client a disparu.

C’est pour cela que l’indicateur se comporte si étrangement sous pression. Rendez votre centre d’aide plus difficile à quitter et la déflexion augmente. Cachez le formulaire de contact derrière trois clics et la déflexion augmente. Laissez le bot répondre avec assurance au lieu de passer la main quand il a un doute et la déflexion augmente. Dans chaque cas, le chiffre s’améliore et l’expérience client se dégrade, ce qui est la signature d’un indicateur qui mesure le mauvais objet.

Cela n’en fait pas pour autant un chiffre inutile. La déflexion est une très bonne mesure de capacité, et la capacité se pilote réellement. Elle cesse d’être utile dès que quelqu’un la lit comme une mesure de qualité, ce qui arrive dans la plupart des organisations vers la deuxième semaine.

À retenir

Le taux de déflexion est un indicateur de volume déguisé en indicateur de qualité. Il vous dit quelle quantité de travail votre bot a absorbée. Il ne peut pas vous dire si ce travail a été fait.

Pourquoi quatre issues différentes se ressemblent-elles dans les données ?

Un ticket déflecté a au moins quatre issues possibles, et votre reporting les réduit toutes les quatre à une seule ligne. C’est la chose la plus importante à comprendre sur cet indicateur, et c’est la raison pour laquelle deux équipes au même taux de déflexion peuvent être dans des situations très différentes.

Parcourez le tableau ci-dessous en pensant à votre propre produit. La plupart des équipes trouvent un exemple réel pour chacun des quatre cas en quelques minutes, et c’est déjà en soi le constat.

Ce qui s’est réellement passéCe que le client a vécuCe que montrent les données de déflexionOù cela apparaît à la place
Vraiment résoluA obtenu la bonne réponse et est passé à autre choseDéflectéNulle part. C’est le cas pour lequel vous payez
AbandonnéA renoncé et n’est pas revenuDéflecté, enregistrement identiqueAttrition, un non-renouvellement discret, une commande perdue
Rerouté par le clientA quitté le chat pour appeler, écrire un e-mail ou publier un message publicDéflecté, et le second contact compte souvent comme un nouveau ticketLe taux de recontact et votre propre volume entrant
Faux, avec assuranceA reçu une réponse claire mais incorrecte, et a agi en conséquenceDéflecté, et souvent avec des signaux de surface positifsUn remboursement, une réclamation, un incident de conformité, des semaines plus tard

Déflexion, contention et résolution ne sont pas le même chiffre

Ces trois termes sont employés indifféremment dans les supports des éditeurs, alors qu’ils désignent des choses vraiment différentes. Mieux vaut les clarifier avant toute discussion sur les objectifs.

  • La déflexion demande si le contact a atteint un humain. Elle se mesure à l’entrée, et c’est la plus lâche des trois.
  • La contention demande si la conversation est restée dans le canal automatisé. Une conversation contenue (en anglais) peut quand même mal finir ; elle a simplement mal fini dans le bot.
  • La résolution demande si le problème du client a disparu. C’est la seule des trois qui concerne le client, et la seule qu’on ne peut pas mesurer sans lui poser la question ou lire la conversation.

C’est dans l’écart entre contention et résolution que se trouve l’argent. Une équipe qui affiche 70 % de contention et suppose 70 % de résolution fait un saut non vérifié, dont personne ne connaît l’ampleur tant qu’on ne l’a pas mesuré. En général, personne ne l’a fait, car le mesurer suppose de lire des conversations plutôt que d’ouvrir un tableau de bord.

Quand un éditeur annonce un taux de résolution, vérifiez si le système s’évalue lui-même. Un agent IA qui décide seul s’il a résolu une demande ne fournit pas une preuve, mais une autoévaluation, et le NIST AI Risk Management Framework traite la mesure indépendante de la performance d’un système d’IA comme une fonction distincte précisément parce qu’une performance autodéclarée n’est pas une mesure. La même logique s’applique dans l’autre sens à la fiabilité de l’évaluation par l’IA : tout évaluateur, humain ou modèle, a besoin que sa précision soit établie par quelque chose d’extérieur à lui.

Attention

Si votre agent IA communique son propre taux de résolution, ce chiffre est une autoévaluation et doit être présenté comme tel dans chaque support où il apparaît. Il devient une preuve lorsqu’un contrôle indépendant de l’agent en vérifie un échantillon.

Pourquoi la réponse fausse donnée avec assurance coûte-t-elle si cher ?

Un agent IA qui se trompe avec assurance clôt le ticket. Un agent IA qui échoue honnêtement l’escalade. Cette seule asymétrie décide des échecs dont vous entendez parler.

Chaque escalade est visible. Elle arrive dans une file d’attente, un humain la lit, et si elle est assez grave, quelqu’un le signale. Le chemin de l’escalade se signale de lui-même. Pendant ce temps, la conversation où le bot a inventé un délai de retour, cité un prix qui n’existe plus depuis deux ans ou assuré à quelqu’un que ses données avaient été supprimées alors que ce n’était pas le cas est marquée comme résolue et sort de vos radars.

Les échecs dont vous entendez naturellement parler sont donc systématiquement les mauvais. Vous entendez parler des quasi-erreurs du bot prudent et ignorez les vraies erreurs du bot sûr de lui. Ce sont les erreurs silencieuses, et le nom est juste : elles ne sont pas rares, elles sont discrètes.

Un effet de second ordre mérite d’être nommé. Comme les escalades sont visibles et que la déflexion est récompensée, la pression sur tout déploiement d’IA va dans une seule direction : escalader moins. Les équipes paramètrent leur bot pour qu’il réponde avec assurance. Un bot réglé pour passer la main en cas de doute affichera un taux de déflexion moins bon et une meilleure expérience client, et si la déflexion est le chiffre du tableau de bord, cet arbitrage est fait à l’envers. La façon dont le transfert lui-même est conçu et contrôlé compte davantage que le taux de part et d’autre.

Conseil

Triez vos conversations déflectées selon le degré d’assurance du dernier message du bot, et non selon leur longueur. C’est dans les messages de clôture courts, catégoriques et sans nuance sur des questions non triviales que se concentrent les réponses fausses.

Comment auditer votre propre taux de déflexion ?

C’est la partie que personne ne publie. Elle prend environ une demi-journée, et vous pouvez faire un premier passage dès cette semaine, sans nouvel outil.

Étape 1. Constituer la population que vous excluiez jusqu’ici

Extrayez toutes les conversations du dernier mois complet closes sans intervention humaine. Pas les conversations escaladées, pas un échantillon général de tous les tickets : précisément la population déflectée. La plupart des programmes de contrôle qualité les filtrent par défaut, parce que la file d’évaluation a été conçue autour des conseillers et qu’aucun conseiller n’est rattaché à ces conversations. Ce filtre est l’angle mort.

Étape 2. Stratifier avant d’échantillonner

Ne tirez pas un simple échantillon aléatoire. Répartissez d’abord la population en trois groupes, car le taux d’échec de base varie énormément de l’un à l’autre :

  • Déflecté, sans autre contact. Les succès apparents, et le groupe le plus susceptible de contenir les réponses fausses données avec assurance.
  • Déflecté, puis nouveau contact sous sept jours. De loin le groupe le plus riche en enseignements. Commencez par lui si vous n’avez qu’une heure.
  • Déflecté sur un sujet qui touche à l’argent, à l’identité ou à un engagement contractuel. La gravité la plus forte par échec, et là où se situe l’exposition en matière de protection des données (en anglais).

Vingt à trente conversations par groupe suffisent pour une première lecture. Vous ne produisez pas encore un taux statistiquement défendable : vous établissez s’il existe un problème et quelle forme il a. Si vous voulez ensuite un chiffre défendable, la logique de dimensionnement est la même que pour tout autre échantillonnage de contrôle qualité.

Étape 3. Évaluer avec une grille écrite pour un bot, pas pour une personne

Votre grille d’évaluation actuelle ne fonctionnera pas ici. La moitié mesure des choses qu’un bot ne peut pas mal faire, et elle ne mesure pas ce sur quoi il échoue. Utilisez plutôt une grille d’évaluation pour agent IA, et n’évaluez que ce qu’un lecteur peut vérifier dans la transcription. Quatre critères portent l’essentiel du signal :

  1. Exactitude factuelle. Chaque affirmation sur une règle, un prix, un délai ou un droit était-elle correcte ? C’est le critère qui compte, et celui que votre ancienne grille omet presque à coup sûr.
  2. Complétude. Le client a-t-il obtenu tout ce dont il avait besoin, ou une réponse partielle qui clôt le ticket et garantit un second contact ?
  3. Jugement sur l’escalade. La demande aurait-elle dû aller à un humain, et y est-elle allée ?
  4. Incertitude assumée. Quand le bot ne savait pas, l’a-t-il dit, ou a-t-il produit quelque chose de plausible ?

Étape 4. Calculer le chiffre qui compte

Votre vrai chiffre est la part des conversations déflectées résolues correctement et complètement. Attendez-vous à ce qu’il soit nettement inférieur à votre taux de déflexion affiché la première fois que vous le mesurez. Cet écart est le véritable constat, et il pèse plus dans une discussion avec la direction que le taux de déflexion ne l’a jamais fait, car il est rattaché à des conversations précises (en anglais) que chacun peut aller lire.

Refaites l’exercice chaque mois, avec la même stratification, et vous obtenez une tendance. C’est à ce moment que l’audit devient un contrôle qualité de vos agents IA.

Quels indicateurs placer à côté du taux de déflexion ?

Ne supprimez pas le taux de déflexion. Entourez-le, pour qu’il ne puisse pas être lu seul. Quatre indicateurs complémentaires font l’essentiel du travail, et chacun se calcule à partir de données que vous possédez déjà.

  • Le recontact dans les sept jours suivant une déflexion. Le meilleur rapport valeur/effort qui soit. Il est objectif, ne demande aucune enquête, et un client qui revient est la façon la plus claire de dire que la première réponse n’a pas fonctionné.
  • La qualité des escalades, pas le taux d’escalade. Quand le bot a passé la main, était-ce la bonne décision, et la demande est-elle arrivée avec son contexte ? Le taux seul est ambigu, puisqu’un bon et un mauvais déploiement peuvent produire le même. La qualité de la gestion des escalades en est la version lisible.
  • L’insatisfaction sur les seules conversations déflectées. Isolez-la au lieu de la laisser se fondre dans le chiffre global, où un petit volume d’interactions automatisées très mauvaises disparaît. Le signal d’insatisfaction (en anglais) est plus utile ici que la satisfaction, car la population déflectée répond encore moins aux enquêtes que la population générale.
  • Le taux de résolution vérifié. Le résultat de l’audit ci-dessus. C’est le chiffre à présenter à la direction, et le seul de la liste qui exige que quelqu’un ait lu une conversation.

Lire la population déflectée à la main est le point de départ, et c’est aussi là que tout s’enlise : le volume est important et le taux d’échec de base assez faible pour qu’une relecture manuelle sur un échantillon de 3 % ne le fasse pas apparaître de façon fiable. L’Auto QA de Kaizo évalue les conversations traitées par l’IA et par les humains avec la même grille, ce qui rend la comparaison honnête, et conserve le raisonnement attaché à chaque conversation, pour qu’une réponse signalée puisse être vérifiée plutôt que crue sur parole. C’est la couverture à 100 % qui révèle des tendances qu’un échantillon de 3 % ne pourrait jamais montrer, appliquée à la population qui n’a jamais fait partie de l’échantillon.

Pour l’ensemble plus large d’indicateurs qui l’entoure, mesurer la performance d’un agent IA couvre la couche opérationnelle, et les KPI d’un agent IA au service client couvrent ce qui a sa place dans un tableau de bord.

Pourquoi se méfier de tous les benchmarks publiés pour cet indicateur ?

Regardez qui publie les benchmarks de déflexion. Cherchez le terme et les résultats sont dominés par des entreprises qui vendent l’agent IA dont la valeur s’exprime en déflexion. Ce n’est pas un complot, c’est une incitation, et il vaut la peine de la nommer, car elle façonne chaque chiffre que vous trouverez.

Trois raisons précises pour lesquelles un benchmark publié ne se transpose pas à votre cas :

  • Le dénominateur n’est pas défini. Inclut-il les pages vues du centre d’aide ? Les chats ouverts et fermés en quatre secondes ? Les contacts sur des canaux que le bot ne couvre pas ? Déplacez le dénominateur et vous pouvez faire varier la déflexion de vingt points sans que rien de réel change.
  • La typologie des contacts domine le résultat. Une équipe qui traite des réinitialisations de mot de passe et des suivis de commande affichera une déflexion supérieure à celle d’une équipe qui traite des litiges de facturation, avec un écart qui ne dit rien de la qualité de l’un ou l’autre déploiement. Comparer des typologies différentes n’a aucun sens.
  • Personne ne publie ses échecs. Les benchmarks proviennent de déploiements prêts à être cités, ce qui constitue par construction une population filtrée.

La comparaison utile ne se fait pas avec un chiffre du secteur, mais avec vous-même. Votre taux de résolution vérifié ce mois-ci par rapport au mois dernier, sur la même typologie de contacts et avec la même grille, vous dit quelque chose de vrai. Un benchmark sectoriel vous dit quelque chose de citable.

Questions fréquentes

Qu’est-ce qu’un bon taux de déflexion ?

Il n’existe pas de réponse transposable, et tout chiffre présenté comme tel doit être accueilli avec méfiance. La déflexion dépend presque entièrement de votre typologie de contacts et de la définition du dénominateur : une équipe qui gère des suivis de commande affichera un taux bien plus élevé qu’une équipe qui gère des litiges de facturation, sans aucune différence de qualité. La comparaison qui a du sens est celle de votre propre taux de résolution vérifié, d’un mois à l’autre, sur une typologie de contacts stable.

Quelle est la différence entre taux de déflexion et taux de contention ?

La déflexion demande si un contact a atteint un humain. La contention demande si la conversation est restée dans le canal automatisé. Aucune des deux ne demande si le problème du client a été réglé, ce qui relève de la résolution, et la résolution ne peut pas se mesurer sans interroger le client ou lire la conversation. Une conversation contenue peut tout de même avoir mal fini.

Comment savoir si mon agent IA donne de mauvaises réponses ?

Lisez un échantillon stratifié des conversations qu’il a closes sans escalade, c’est-à-dire la population que la plupart des programmes de contrôle qualité excluent. Commencez par les conversations déflectées où le client vous a recontacté dans les sept jours, car le taux d’échec y est bien plus élevé que dans la population générale. Évaluez-les sur l’exactitude factuelle et la complétude plutôt que sur le ton.

Un taux de déflexion élevé signifie-t-il que mes clients sont satisfaits ?

Non, et il peut signifier le contraire. La déflexion compte l’absence d’un humain : un client qui a abandonné, qui est passé à un autre canal ou qui a accepté une réponse fausse donnée avec assurance produit le même enregistrement qu’un client vraiment aidé. Rendre un humain plus difficile à joindre fait monter la déflexion tout en faisant baisser la satisfaction, et c’est pourquoi l’indicateur doit être lu avec le taux de recontact.

Faut-il inclure les conversations traitées par l’IA dans mon programme de contrôle qualité ?

Oui, et la plupart des programmes ne le font pas aujourd’hui, parce que les files d’évaluation ont été conçues autour des conseillers et qu’aucun conseiller n’est rattaché à ces conversations. Si les tickets déflectés sont exclus de votre échantillon, votre visibilité sur la qualité a un trou exactement de la taille de la charge de travail de votre bot. Évaluez-les avec une grille écrite pour un répondant automatisé plutôt qu’en réutilisant la grille des conseillers.

Pour aller plus loin

Découvrez ce que votre taux de déflexion vous a vraiment rapporté

Apportez un mois de conversations que votre agent IA a closes seul. Nous les évaluerons avec la même grille que vos tickets traités par des conseillers et vous montrerons l’écart entre déflecté et réellement résolu.

Réserver une démo Découvrir Agentic Auto QA

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart