Aller au contenu

Indicateurs

Mesurer la performance d’un agent IA au support

Mesurer la performance d’un agent IA au service client : les indicateurs qui comptent, l’évaluation par grille et une comparaison équitable entre IA et humains.

· 7 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Pour mesurer la performance d’un agent IA, suivez le taux de résolution, l’exactitude, l’escalade, le taux de containment et le sentiment, puis évaluez chaque conversation traitée par l’IA avec une grille d’évaluation qualité. Utilisez la même grille pour les conseillers humains, et un évaluateur indépendant de l’IA qu’il note.

En bref

  • Un taux de containment élevé ne veut pas dire grand-chose sans résolution ni exactitude.
  • Le volume rend l’échantillonnage peu fiable : couvrez 100 % des conversations de l’IA.
  • Corrigez les prompts, les garde-fous et le routage à l’origine des mauvaises notes, puis mesurez à nouveau.

Étape 1 : choisir les indicateurs qui comptent vraiment

Un taux de containment élevé fait bonne impression, jusqu’au jour où vous découvrez que le bot a gardé des cas qu’il aurait dû escalader. Les indicateurs de vanité mesurent l’activité, pas la qualité. Commencez donc par choisir des indicateurs qui montrent si le client a réellement été bien servi.

Les indicateurs clés de performance de l’IA

  • Taux de résolution : la part des conversations où le problème du client a vraiment été résolu, et pas seulement clôturé.
  • Exactitude factuelle : la fréquence à laquelle l’agent a donné des informations correctes et fondées, au lieu d’inventer des détails.
  • Taux d’escalade : à quelle fréquence, et avec quelle pertinence, l’agent a transmis la conversation à un humain. Trop élevé comme trop bas, c’est un problème.
  • Taux de containment : la part traitée sans humain, qui n’est saine que si la résolution et l’exactitude suivent.
  • Sentiment : ce que le client a ressenti pendant et après la conversation.

Lire les indicateurs ensemble, jamais isolément

Aucun chiffre ne dit la vérité à lui seul. Un containment élevé avec une résolution faible signifie que le bot fait barrage au lieu d’aider. Les indicateurs n’ont de sens qu’ensemble, et c’est pourquoi l’évaluation de la qualité les sous-tend tous.

Étape 2 : mesurer la performance d’un agent IA avec une grille d’évaluation

Les indicateurs de résultat vous disent ce qui s’est passé, mais pas pourquoi une conversation était bonne ou mauvaise. Une grille d’évaluation qualité transforme la performance en quelque chose que vous pouvez diagnostiquer et coacher, en jugeant chaque conversation selon des critères définis.

Transformer les indicateurs en critères

Construisez une grille qui couvre l’exactitude, la résolution, la pertinence de l’escalade, le ton et le respect des procédures, puis laissez le système évaluer automatiquement chaque conversation de l’IA avec cette grille. Kaizo lit les conversations nativement dans Zendesk et Salesforce et évalue chacune dès son arrivée : les données de performance sont continues, au lieu d’un instantané mensuel.

Tout couvrir, pas un échantillon

L’IA fonctionne à des volumes qu’aucune équipe ne peut échantillonner de façon pertinente, et un défaut systématique se répète dans chaque conversation que l’agent traite. C’est l’évaluation de 100 % des conversations qui rend les chiffres fiables. Chez UiPath, Kaizo a automatisé 100 % de la QA avec un ROI de 200 %, ce qui donne aux responsables des données complètes pour mesurer, au lieu d’une fraction.

Étape 3 : comparer équitablement l’IA et les humains

Dès que l’IA et les humains traitent tous deux des conversations, la question se pose naturellement : comment se comparent-ils ? La comparaison n’a de sens que si les deux sont mesurés de la même façon.

Une seule grille pour les deux

Évaluez les conversations traitées par l’IA et celles traitées par des humains selon les mêmes critères. Un écart de notes reflète alors une vraie différence de qualité, et non deux instruments de mesure différents. Vous voyez aussi où l’IA fait réellement mieux et où elle fait discrètement moins bien, par file et par thème.

DimensionVision de vanitéComparaison équitable
BaseVolume de l’IA contre volume des humainsLa même grille appliquée aux deux
RésolutionTickets clôturésProblèmes réellement résolus
EscaladeComptée comme un échec de l’IAJugée correcte ou non selon le cas
CouvertureUn échantillon de chaque100 % des deux, évalués en continu
VerdictQui en a traité le plusQui a le mieux traité, preuves à l’appui

Étape 4 : garder un évaluateur indépendant

Un chiffre de performance n’est fiable que si ce qui l’a produit l’est aussi. Ne laissez pas l’équipe qui a construit un agent IA être la seule à le noter : une équipe qui a un intérêt dans le résultat a une raison de remonter des notes flatteuses, et cela fausse discrètement tous les indicateurs en aval.

Les preuves rendent la mesure crédible

Chaque note attribuée par Kaizo renvoie au passage exact de la transcription qui l’a produite. Une affirmation sur la performance peut donc être vérifiée en lisant, et non prise sur parole, ce qui permet aux équipes d’augmenter le taux d’automatisation en toute confiance.

Étape 5 : agir sur les résultats

Une mesure qui ne change aucun comportement n’est qu’un tableau de bord. L’objectif de la mesure de performance de l’IA est de l’améliorer, et des notes reliées aux preuves rendent cela direct.

Boucler la boucle

  • Remontez chaque erreur d’exactitude jusqu’au prompt, à la source de connaissances ou au manque d’ancrage qui l’a provoquée.
  • Corrigez les déclencheurs d’escalade mal réglés quand le taux d’escalade devient trop élevé ou trop bas.
  • Regroupez les mauvaises notes récurrentes par thème ou par file pour corriger le schéma une seule fois, à la source.
  • Mesurez à nouveau après chaque changement, sur toutes les conversations, pour vérifier que la correction tient et n’a rien dégradé ailleurs.

Comme la couverture est continue, l’effet d’un changement apparaît dans l’ensemble des données plutôt que dans un échantillon qui pourrait le manquer.

Les erreurs fréquentes à éviter

Voici les erreurs qui font paraître les données de performance de l’IA plus saines qu’elles ne le sont.

  • Viser uniquement le containment : un taux de containment élevé avec une résolution faible, c’est du barrage, pas de la performance.
  • Échantillonner un agent à fort volume : un petit échantillon passe presque toujours à côté des défauts systématiques.
  • Comparer l’IA et les humains sur des échelles différentes : sans une grille commune, la comparaison n’a aucun sens.
  • Laisser l’équipe qui a construit l’IA la noter seule : un évaluateur qui a un intérêt dans le résultat produit des chiffres flatteurs et peu fiables.
  • Remonter des chiffres sans agir : des indicateurs qui ne changent jamais un prompt, un garde-fou ou une règle de routage n’apportent aucune amélioration.

Questions fréquentes

Comment mesurer la performance d’un agent IA au service client ?

Suivez des indicateurs de résultat comme le taux de résolution, l’exactitude factuelle, le taux d’escalade, le containment et le sentiment, puis évaluez chaque conversation traitée par l’IA avec une grille d’évaluation qualité plutôt qu’un échantillon. Comparez l’IA et les humains avec la même grille, utilisez un évaluateur indépendant de l’IA notée, et agissez sur les résultats en corrigeant ce qui cause les mauvaises notes.

Quels indicateurs comptent le plus pour un agent IA ?

Le taux de résolution et l’exactitude factuelle comptent le plus, car ils montrent si le client a vraiment été aidé avec des informations correctes. Le taux d’escalade, le containment et le sentiment apportent un contexte essentiel, mais ils induisent en erreur lorsqu’on les lit seuls. Un containment élevé avec une résolution faible, par exemple, signifie que l’agent fait barrage au lieu de résoudre.

Comment comparer équitablement agents IA et conseillers humains ?

Évaluez les deux avec la même grille d’évaluation qualité, selon les mêmes critères, pour qu’un écart de notes reflète une vraie différence de qualité et non deux instruments de mesure différents. Couvrir 100 % des deux, en continu, fait aussi ressortir où l’IA fait mieux et où elle fait moins bien, par file et par thème.

Pourquoi un évaluateur indépendant est-il important pour les indicateurs de l’IA ?

Si les seules personnes qui notent l’IA sont celles qui l’ont construite, les notes ont une incitation intégrée à paraître bonnes, ce qui fausse tous les indicateurs en aval. Quand chaque note renvoie à la preuve dans la transcription, une affirmation sur la performance peut être vérifiée en lisant plutôt qu’acceptée les yeux fermés.

Pourquoi un échantillon ne suffit-il pas pour un agent IA ?

L’IA fonctionne à des volumes qu’aucune équipe ne peut échantillonner de façon pertinente, et un défaut systématique se répète dans chaque conversation que l’agent traite. Un petit échantillon passe presque toujours à côté. Seule l’évaluation de 100 % des conversations de l’IA rend les chiffres fiables et montre l’effet de chaque changement sur l’ensemble des données.

Pour aller plus loin

Mesurez vos agents IA sur vos propres conversations

Apportez une semaine de vos vraies conversations traitées par l’IA : nous vous montrerons la résolution, l’exactitude et l’escalade évaluées sur 100 % d’entre elles, chaque chiffre pouvant être retracé jusqu’à la transcription.

Réserver une démo Découvrir Agentic Auto QA

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart