Aller au contenu

Indicateurs

KPI des agents IA au service client : l’essentiel

KPI d’agent IA au service client : les indicateurs qui montrent si vos agents IA résolvent vraiment les demandes, et ceux à ne plus présenter à la direction.

· 17 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Le taux de containment et le CSAT post-IA, les deux KPI d’agent IA au service client que la plupart des équipes présentent, sont aussi les plus trompeurs. Évaluez plutôt chaque conversation sur la résolution, l’exactitude, l’escalade et les recontacts, en reliant chaque note aux éléments de preuve présents dans la conversation.

En bref

  • Le containment compte un abandon frustré comme une réussite.
  • Le CSAT post-IA n’entend jamais les clients qui ont abandonné.
  • Les recontacts et les abandons silencieux révèlent ce que le containment cache.
  • Chaque note doit pouvoir être retracée jusqu’aux éléments de preuve de la transcription.

Pourquoi les deux KPI d’agent IA par défaut sont trompeurs

Chaque responsable support qui déploie l’IA se voit poser la même question par sa direction : prouvez que ça marche. Les deux chiffres que l’on sort en premier sont le taux de containment et le CSAT post-IA, parce que les deux sont faciles à extraire et que les deux semblent progresser si l’on ne regarde pas de trop près. Ce sont aussi les deux chiffres les moins susceptibles de décrire ce qui est réellement arrivé à vos clients.

Le problème est structurel, ce n’est pas une question de réglage. Le containment mesure un résultat de routage : un humain est-il intervenu dans cette conversation ? Le CSAT post-IA mesure une opinion, mais uniquement celle des personnes qui ont choisi d’en donner une. Aucun des deux ne regarde le contenu de la conversation, qui est le seul endroit où se trouve la réponse. C’est un problème très différent de celui que résout la méthode standard pour mesurer la performance d’un agent IA, et très différent du choix des indicateurs généraux du service client à mettre sur votre tableau de bord. Il s’agit ici de savoir quels chiffres vous mentent sans faire de bruit.

Voici la version courte de l’argument, indicateur par indicateur, avant d’entrer dans le détail de chacun.

IndicateurCe qu’il prétend montrerPourquoi il est trompeurCe qu’il faut mesurer à la place
Taux de containment / de déflexionL’IA a traité la conversation avec succèsCompte l’abandon et le blocage comme des réussites, parce qu’aucun humain n’est intervenuQualité de résolution et taux d’abandon silencieux
CSAT post-IALes clients sont satisfaits de l’IARenseigné par une minorité qui se sélectionne elle-même, et les clients les plus mécontents partent tout simplementTaux de recontact et qualité de résolution sur 100 % des conversations
Durée moyenne de traitement des conversations IAL’IA est rapideUne mauvaise réponse rapide est plus rapide qu’une bonne réponse lenteExactitude factuelle et coût par contact réellement résolu
Taux d’escaladeMoins d’escalades signifie que l’IA s’en sortRéduire les escalades est facile et nuisible ; le moment et le transfert comptent davantageQualité de l’escalade : le bon moment, le contexte complet
Volume traité par l’IAPassage à l’échelle et ROINe dit rien de ce qui s’est passé à l’intérieur de ce volumeRespect des procédures, évalué selon votre grille

Le taux de containment : l’indicateur qui récompense le blocage

Le taux de containment, parfois appelé taux de déflexion, est la part des conversations qui se sont terminées sans qu’un conseiller humain intervienne. Il est devenu le KPI d’IA par défaut parce qu’il se rattache directement au business case : chaque conversation contenue est un contact pour lequel vous n’avez pas eu à payer un humain.

Le défaut est dans la définition. Le containment ne demande pas si le client a obtenu ce pour quoi il était venu. Il demande si quelqu’un d’autre a dû intervenir. Plusieurs résultats très différents sont donc tous comptés de la même manière, comme une réussite :

  • La vraie résolution : le client a posé sa question, l’IA a répondu correctement, le client est reparti satisfait. C’est le résultat que l’indicateur a été conçu pour mesurer.
  • L’abandon : le client a demandé trois fois, a reçu une variante de la même réponse inutile et a fermé la fenêtre. Aucun humain n’est intervenu, donc la conversation compte comme contenue.
  • Le blocage : l’IA ne pouvait pas ou ne voulait pas transférer, continuait à proposer des articles du centre d’aide, et le client a abandonné pour aller sur les réseaux sociaux ou laisser un avis sur l’App Store.
  • Le contact déplacé : le client a fermé le chat et a appelé la hotline, ou envoyé un e-mail, ou ouvert un nouveau ticket le lendemain. Contenu dans un canal, il vous coûte toujours dans un autre.

Trois de ces quatre cas sont des échecs, et le blocage est carrément pire que de ne rien faire. Pourtant, un taux de containment ne peut pas les distinguer, parce que l’information qui les distingue se trouve dans la conversation, et le containment n’y regarde jamais.

Ce n’est pas un argument pour abandonner le containment. C’est une donnée utile pour la capacité et les coûts. C’est un argument contre le fait de le présenter comme un indicateur de qualité, parce qu’optimiser directement le containment revient à rendre plus difficile pour les clients de joindre un humain : exactement le comportement que personne ne souhaite et que tout le monde reconnaît dès qu’il est lui-même client.

Le CSAT post-IA : l’indicateur qui n’entend jamais ceux qui sont partis

Le CSAT (en anglais) est un bon indicateur dans son contexte d’origine : une conversation avec un humain, un taux de réponse raisonnable, une population stable qui y répond. Greffé sur une conversation avec une IA, il développe un angle mort précis et sérieux.

Une auto-sélection au pire moment

Les réponses aux enquêtes viennent d’une minorité de clients, et cette minorité n’est jamais aléatoire. Ceux qui ont un avis assez tranché pour répondre se situent plutôt aux deux extrêmes. Mais le mode d’échec de l’IA qui compte le plus, le client qui conclut en silence que cela ne mène nulle part et décroche, est précisément le client le moins susceptible de remplir une enquête ensuite. Il n’est pas resté pour être interrogé. Ce sont les clients qui abandonnent en silence, et le CSAT post-IA est structurellement sourd à leur égard.

L’enquête ne porte pas sur la bonne question

Même parmi ceux qui répondent, une note de satisfaction mélange l’exactitude de la réponse, l’agrément du ton et le fait que le résultat soit celui que le client voulait entendre. Une IA charmante et sûre d’elle qui se trompe peut obtenir une bonne note. Une IA qui donne correctement une réponse conforme à la politique de l’entreprise mais qui déplaît au client peut obtenir une mauvaise note. Aucun de ces résultats ne vous dit si le système fonctionne.

La comparaison est injuste dans les deux sens

Les équipes comparent souvent le CSAT de l’IA à celui des conseillers humains et en tirent des conclusions. Ces deux populations ne sont pas comparables : l’IA prend généralement d’abord les contacts simples, à fort volume et faciles à satisfaire, et escalade les cas difficiles. Un CSAT IA flatteur peut simplement signifier que l’IA a reçu la file facile. Un mauvais peut signifier qu’on lui a confié la file où personne ne pouvait s’en sortir.

Gardez le CSAT. Arrêtez simplement de le traiter comme une preuve concernant votre IA. Considérez-le comme un signal parmi d’autres, pondéré par le fait qu’il n’entend que ceux qui sont restés.

La qualité de résolution : l’indicateur pivot

Si vous ne devez remplacer le containment que par une seule chose, remplacez-le par la qualité de résolution : cette conversation a-t-elle réellement résolu le problème du client ? C’est le pivot de l’ensemble, parce que chaque autre indicateur présenté ici en est soit une donnée d’entrée, soit un contrôle.

Ce que c’est. Un jugement, porté à partir de la transcription, sur le fait que le problème de fond du client a été traité. Pas si un ticket a été clos, pas si une réponse a été envoyée, pas si l’intention a été reconnue. Si ce qui devait se passer pour le client s’est passé.

Comment la mesurer. Comme un critère noté de votre grille d’évaluation qualité, appliqué aux conversations traitées par l’IA exactement comme aux conversations traitées par des humains. Le critère doit être rédigé de façon qu’un évaluateur humain et un évaluateur automatisé le lisent de la même manière : précisez, pour chaque grand type de contact, quels éléments de la transcription comptent comme une résolution. Remboursement demandé et remboursement confirmé. Adresse modifiée et modification confirmée au client. Question posée et bonne réponse donnée, avec un accusé de réception du client.

À quoi ressemble un mauvais chiffre. Le signal à surveiller n’est pas un seuil absolu, c’est l’écart entre la qualité de résolution et le containment. Si une grande part des conversations est contenue mais qu’une part bien plus faible est évaluée comme résolue, cet écart est la taille de votre problème, exprimée en conversations. C’est aussi le chiffre qui mérite d’être présenté à la direction, parce que c’est la version honnête de celui qu’on lui a montré.

Notez que cette mesure est volontairement plus stricte que la résolution au premier contact (en anglais), qui déduit la résolution de l’absence de relance. Le FCR est un indicateur indirect utile. La qualité de résolution lit la transcription au lieu de déduire quoi que ce soit du silence, et le silence est exactement ce que produit un client qui abandonne.

Exactitude factuelle et taux d’hallucination

Un agent IA (en anglais) qui invente un délai de remboursement, se trompe sur un délai de livraison ou décrit avec assurance une fonctionnalité que vous n’avez pas ne pose pas un problème de qualité, mais un problème de responsabilité. L’exactitude factuelle est l’indicateur qui le détecte, et c’est celui que la plupart des équipes ne mesurent pas du tout.

Ce que c’est. La part des réponses de l’IA contenant une affirmation factuelle vérifiable dans votre base de connaissances, vos documents de procédures ou vos données de commande, et la part de ces affirmations qui sont correctes. Le taux d’hallucination en est l’inverse : les affirmations énoncées avec assurance et qu’aucune source n’étaye.

Comment la mesurer. Chaque affirmation factuelle d’une conversation est vérifiée par rapport à la source de référence. Ce n’est faisable qu’automatiquement, à grande échelle, et c’est l’un des arguments les plus forts pour évaluer chaque conversation plutôt qu’un échantillon : une hallucination dans les 98 % que vous n’avez pas lus coûte exactement autant qu’une hallucination dans les 2 % que vous avez lus. Suivez-la séparément par type de contact, car l’exactitude est rarement uniforme. Les questions de facturation et les questions de livraison se comportent généralement de façon très différente.

À quoi ressemble un mauvais chiffre. Tout taux non nul sur des affirmations qui ont un poids juridique, financier ou de sécurité est un mauvais chiffre, aussi faible soit-il. Sur les affirmations à moindre enjeu, c’est la tendance qui compte : un taux d’hallucination qui augmente après une modification de la base de connaissances ou une mise à jour du modèle vous dit quelque chose de précis et d’urgent sur cette modification.

Une mise en garde : l’IA qui a généré la réponse n’est pas un juge fiable de sa véracité. L’exactitude doit être évaluée par quelque chose d’extérieur au système qui l’a produite. C’est le même principe qui veut que le LLM as a judge (en anglais) reste séparé du modèle évalué.

La qualité de l’escalade : pas combien, mais comment

Le taux d’escalade est présenté comme si plus bas valait mieux. Ce n’est pas le cas. L’escalade est une fonctionnalité, et une IA qui n’escalade jamais n’est pas une IA performante, c’est un client pris au piège. Ce qui compte, c’est la qualité de l’escalade : le transfert a-t-il eu lieu au bon moment et est-il arrivé avec le bon contexte ?

Le moment

Les deux modes d’échec se situent de part et d’autre du bon moment. Escalader trop tôt gaspille entièrement l’automatisation et agace un client qui avait une question simple. Escalader trop tard, après trois ou quatre boucles infructueuses, signifie que l’humain hérite d’un client déjà en colère et d’une conversation qu’il faut reprendre depuis le début. Évaluez le moment : y avait-il un échange identifiable où un transfert compétent aurait dû avoir lieu, et a-t-il eu lieu à ce moment-là ?

La transmission du contexte

L’échec d’escalade le plus coûteux est celui où le conseiller ouvre la conversation et doit demander au client de tout réexpliquer. Ce seul comportement réduit à néant la bonne volonté de toute l’interaction avec l’IA. Évaluez si le transfert a transmis le problème exprimé par le client, ce qui avait déjà été tenté, et tout contexte de compte ou de commande que l’IA avait déjà récupéré.

La pertinence

L’escalade était-elle seulement la bonne décision ? Une IA qui escalade chaque message ambigu génère de la charge de travail humaine pour rien, ce qui apparaît dans le coût par contact résolu plutôt que dans les notes qualité. Les deux sens doivent être évalués, sinon vous optimiserez l’un au détriment de l’autre.

À quoi ressemble un mauvais chiffre. Un taux d’escalade en baisse associé à une note de qualité de résolution en baisse est le signal négatif le plus clair de tout cet article. Cela signifie que l’IA retient des conversations qu’elle ne peut pas mener à terme.

Taux de recontact et taux d’abandon silencieux

Ces deux indicateurs sont regroupés parce que ce sont vos détecteurs de mensonges les moins chers. Tous deux repèrent des échecs que le containment compte comme des réussites, et aucun des deux n’exige que le client remplisse quoi que ce soit.

Taux de recontact après une conversation avec l’IA

Ce que c’est. La part des clients qui reviennent dans une période définie, par n’importe quel canal, pour le même problème de fond après une conversation traitée par l’IA.

Comment le mesurer. Reliez les contacts par client et par problème, pas par ticket, et regardez spécifiquement d’un canal à l’autre. Un client qui a abandonné un chat puis a appelé est le cas le plus important à repérer, et une vue par canal le manquera complètement. Adaptez la période à votre produit : le jour même pour un problème de livraison, une semaine ou plus pour un litige de facturation.

À quoi ressemble un mauvais chiffre. Un taux de recontact plus élevé après un traitement par l’IA que pour les contacts équivalents traités par des humains est un signal d’alarme, quelle que soit sa valeur absolue. Cela signifie que le containment a déplacé le travail au lieu de le supprimer.

Taux d’abandon silencieux

Ce que c’est. La part des conversations avec l’IA que le client quitte sans résolution et sans escalade. Pas d’enquête, pas de réclamation, pas de relance. Ces conversations ressemblent en tous points à des réussites dans chaque indicateur fondé sur le routage.

Comment le mesurer. Repérez les conversations qui se sont terminées sur un message du client, ou dont le dernier message de l’IA est resté sans réponse, et évaluez si le problème était résolu à ce moment-là. Distinguer les départs satisfaits des abandons silencieux relève d’un jugement sur la transcription, et c’est exactement pour cela que cet indicateur n’existe pas sur la plupart des tableaux de bord : il ne se compte pas, il se lit.

À quoi ressemble un mauvais chiffre. Tout taux d’abandon silencieux qui représente une part significative de votre taux de containment signifie que votre containment est gonflé d’autant. Présenter le containment sans lui, c’est présenter un chiffre que vous savez faux.

Respect des procédures et coût par contact réellement résolu

Les deux derniers indicateurs font le lien entre la qualité et le business case.

Respect des procédures

Ce que c’est. Le fait que l’IA a suivi les règles qu’elle est tenue de suivre : vérifier l’identité avant de communiquer des informations de compte, donner les mentions obligatoires, refuser les remises hors politique, traiter correctement un client vulnérable ou l’expression d’une réclamation, et rester dans le langage réglementaire lorsqu’il s’applique.

Comment le mesurer. Ce sont des critères binaires, vérifiables par des éléments de preuve, ce qui en fait ce qu’il y a de plus facile à évaluer automatiquement sur cette liste, et de plus dangereux à échantillonner. Appliquez-les comme des contrôles conforme / non conforme sur chaque conversation, et traitez chaque non-conformité comme un incident à examiner plutôt que comme un pourcentage à lisser par la moyenne. C’est la même logique de grille que celle qui sert déjà à évaluer votre équipe humaine, et c’est tout l’intérêt : votre score qualité interne doit couvrir aussi l’IA, sinon vous avez deux standards et aucune comparaison.

À quoi ressemble un mauvais chiffre. Pour la vérification d’identité et les mentions réglementaires, une seule non-conformité est un mauvais chiffre. Ne faites pas de moyenne.

Coût par contact réellement résolu

Ce que c’est. Le coût total des conversations avec l’IA divisé par le nombre de conversations réellement résolues, et non par le nombre de conversations contenues.

Comment le mesurer. Prenez votre note de qualité de résolution, appliquez-la à votre volume contenu, et utilisez le nombre obtenu comme dénominateur. Incluez les coûts induits par l’IA en aval : les recontacts, le temps de traitement supplémentaire sur les escalades arrivées sans contexte, et le temps humain passé à réparer.

À quoi ressemble un mauvais chiffre. Si le coût par contact réellement résolu n’est pas nettement meilleur que celui de l’équivalent traité par des humains, le déploiement n’est pas rentable, quelle que soit la belle allure de la courbe de containment. C’est le chiffre qui transforme un argument qualité en argument financier, et c’est généralement l’argument financier qui obtient le budget.

Pourquoi rien de tout cela ne fonctionne avec un échantillon ou une enquête

Relisez les sept indicateurs : une chose est vraie pour chacun d’eux, il faut lire la conversation. La qualité de résolution est un jugement sur la transcription. Le taux d’hallucination est une vérification des affirmations par rapport aux sources. La qualité de l’escalade est l’évaluation d’un échange précis. L’abandon silencieux est l’absence de signal, ce qui signifie qu’on ne peut le trouver qu’en regardant les conversations où il ne s’est rien passé.

Cela a deux conséquences que la plupart des programmes de mesure n’ont pas encore intégrées.

L’échantillonnage ne fonctionne pas ici. Le contrôle qualité traditionnel évalue un faible pourcentage des conversations, et pour une équipe humaine de taille connue, c’est un compromis statistique défendable. Il ne l’est pas pour l’IA, pour deux raisons. D’abord, les échecs de l’IA sont systématiques plutôt que dispersés : un mauvais article de la base de connaissances ou un cas limite d’une politique produit le même échec à chaque fois qu’il est rencontré, donc un échantillon soit capte tout le groupe, soit le manque entièrement. Ensuite, l’IA traite un volume bien plus important, donc 2 % est une fenêtre plus petite sur une opération plus grande. Évaluer chaque conversation (en anglais) est la condition préalable plutôt que l’objectif : cela supprime le biais de sélection qui rend les sept autres chiffres dénués de sens. Il ne s’agit pas de surveiller qui que ce soit, il s’agit de ne pas laisser une règle d’échantillonnage décider de ce que disent vos indicateurs.

Vous ne devriez pas avoir à croire une note sur parole. Exigez que chaque note renvoie aux éléments de preuve exacts de la transcription qui l’ont produite, que toute note puisse être contestée et arbitrée par un humain, et que l’évaluateur puisse être testé sur un ensemble de conversations que vos propres évaluateurs ont notées, afin que vous voyiez le taux de concordance critère par critère avant de remonter quoi que ce soit. Une note que vous pouvez retracer est une note que vous pouvez contester. Une note que vous ne pouvez pas retracer est un argument marketing assorti d’un chiffre.

Kaizo évalue les agents IA et votre équipe humaine selon une seule grille que vous définissez, chaque note étant retracée jusqu’à la transcription et testable sur votre propre ensemble de référence. Kaizo applique cette grille à toutes vos conversations plutôt qu’à une sélection. Chez UiPath, cette approche a automatisé 100 % du contrôle qualité, avec un ROI de 200 % et une hausse de 8 % de la note qualité. Concrètement, cela signifie que le contrôle qualité des agents IA et le contrôle qualité des humains cessent d’être deux programmes distincts produisant deux séries de chiffres impossibles à comparer.

Questions fréquentes

Quels sont les KPI les plus importants pour un agent IA au service client ?

La qualité de résolution, l’exactitude factuelle, la qualité de l’escalade, le taux de recontact, le taux d’abandon silencieux, le respect des procédures et le coût par contact réellement résolu. Ces sept indicateurs décrivent ce qui s’est réellement passé dans la conversation. Le taux de containment et le CSAT post-IA, les deux plus souvent présentés, décrivent plutôt le routage et une opinion auto-sélectionnée, et c’est pour cela qu’ils sont trompeurs.

Qu’est-ce que le taux de containment et pourquoi est-il trompeur ?

Le taux de containment, aussi appelé taux de déflexion, est la part des conversations qu’une IA a traitées sans qu’un humain intervienne. Il est trompeur parce qu’il mesure si quelqu’un d’autre a dû intervenir, pas si le client a été aidé. Un client qui a demandé trois fois, n’a rien obtenu et a fermé la fenêtre, frustré, compte comme contenu, tout comme un client qui a abandonné et a appelé à la place.

Le CSAT est-il un bon moyen de mesurer les agents IA ?

Seulement comme un signal parmi d’autres. Le CSAT post-IA est renseigné par un petit groupe qui se sélectionne lui-même, et les clients que votre IA a le plus mal servis sont les moins susceptibles de rester pour répondre à une enquête. Il mélange aussi l’exactitude et le ton, si bien qu’une IA qui se trompe avec assurance peut obtenir une bonne note. Comparez-le à des mesures fondées sur la transcription plutôt que de le traiter comme une preuve à lui seul.

Comment savoir si un agent IA a réellement résolu une demande ?

Évaluez la résolution comme un critère de votre grille QA, appliqué à la transcription plutôt que déduit du statut du ticket. Définissez, par type de contact, quels éléments de la conversation comptent comme une résolution : le remboursement confirmé, la modification confirmée au client, la bonne réponse dont le client accuse réception. Comparez ensuite cette part résolue à votre taux de containment. L’écart entre les deux est la taille du problème.

Qu’est-ce que le taux d’abandon silencieux ?

C’est la part des conversations avec l’IA qu’un client quitte sans résolution et sans escalade : ni réclamation, ni enquête, ni relance. Ces conversations sont invisibles pour tous les indicateurs fondés sur le routage, parce qu’aucun humain n’est intervenu, et elles gonflent donc le containment. Pour les trouver, il faut lire les conversations qui se sont terminées sur un message du client et juger si le problème avait réellement été traité.

Comment savoir si l’on peut faire confiance à l’évaluateur qui note votre IA ?

En le vérifiant plutôt qu’en le croyant sur parole : demandez si chaque note renvoie aux éléments de preuve précis de la transcription, et s’il vous montre son taux de concordance avec des conversations que vos évaluateurs ont déjà notées.

Pour aller plus loin

Mesurez ce que vos agents IA ont réellement fait

Voyez votre taux de containment à côté de la note de qualité de résolution qui se cache derrière, évaluée selon votre propre grille. Chaque note renvoie aux éléments de preuve de la transcription, et vous pouvez la confronter aux conversations que vos évaluateurs ont déjà notées.

Réserver une démo Découvrir Agentic Auto QA Voir Kaizo Insights

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart