Le contrôle qualité des agents IA et des chatbots commence par une grille d’évaluation qui décrit une bonne conversation traitée par l’IA. Évaluez ensuite chacune de ces conversations automatiquement. Gardez l’évaluateur indépendant de l’IA qu’il évalue, et reliez chaque note à la transcription pour pouvoir corriger l’erreur.
En bref
- Le volume traité par l’IA est trop élevé pour un échantillonnage manuel.
- Cherchez les informations erronées, les escalades manquées, les hallucinations et les réponses au ton inadapté.
- Réinjectez les constats dans les prompts, les garde-fous et le routage.
- Réévaluez ensuite pour vérifier que la correction tient.
Étape 1 : définir ce qu’est une bonne conversation pour un agent IA
Les agents IA ne se trompent pas comme les humains : une grille conçue pour vos conseillers, reprise telle quelle, passera à côté de ce qui compte le plus. Commencez par écrire à quoi ressemble vraiment une bonne conversation traitée par l’IA pour votre entreprise, sous forme de critères qu’une machine peut vérifier sur une transcription.
Construire les critères autour des défaillances propres à l’IA
Une bonne grille IA couvre les comportements qui détruisent la confiance quand un agent se trompe :
- Exactitude des faits : l’agent a-t-il donné une information correcte, ou a-t-il inventé une règle, un prix ou une étape qui n’existe pas ?
- Résolution : a-t-il réellement résolu le problème du client, ou simplement clôturé le ticket ?
- Escalade au bon moment : a-t-il passé la main à un humain au bon moment, et pas trop tard ?
- Ton et empathie : s’est-il adapté à l’état émotionnel du client au lieu de rester mécanique ?
- Respect des règles et des consignes de sécurité : est-il resté dans les limites que vous avez fixées, en refusant ce qu’il devait refuser ?
Rendre chaque critère vérifiable par des preuves
Rédigez les critères de façon à ce qu’une réussite ou un échec renvoie à une ligne précise de la conversation. Kaizo vous permet de construire la grille d’évaluation que votre entreprise utilise réellement et juge chaque conversation par rapport à elle, comme le ferait votre meilleur évaluateur. Le contrôle qualité de l’IA et celui des conseillers restent ainsi sur un même standard, comparable.
Étape 2 : le contrôle qualité des agents IA sur 100 % des conversations, pas sur un échantillon
Le contrôle qualité manuel porte sur 2 % à 5 % des tickets, parce qu’une personne ne peut en lire qu’un nombre limité. Avec les agents IA, ce plafond n’est plus tenable : ils tournent à des volumes qu’aucune équipe d’évaluation ne peut échantillonner de façon utile, et une défaillance rare mais grave se cachera presque toujours dans les 95 % que personne ne lit.
Automatiser l’évaluation
Connectez le helpdesk ou le CRM où vivent déjà vos conversations, puis laissez le système évaluer chaque interaction traitée par l’IA dès qu’elle arrive, en continu et en arrière-plan. Kaizo s’intègre nativement à Zendesk et Salesforce et lit les conversations directement dans les systèmes que vous utilisez déjà : aucun pipeline séparé à maintenir.
Pourquoi une couverture complète compte davantage pour l’IA
Un seul agent IA reproduit le même comportement sur des milliers de conversations. Un défaut systématique, une règle mal comprise ou un mauvais paramètre par défaut, se répète donc à grande échelle. C’est l’évaluation de 100 % des conversations qui fait apparaître ce schéma tôt. Chez UiPath, Kaizo a automatisé 100 % du contrôle qualité avec un ROI de 200 % : c’est le niveau de couverture qu’exige aujourd’hui le volume traité par l’IA.
Voyez-le sur vos propres conversations. Kaizo évalue 100 % de vos conversations de support et transforme les résultats en coaching. Réserver une démo.
Étape 3 : garder un évaluateur indépendant
C’est l’étape que la plupart des équipes oublient, et c’est elle qui décide si l’on peut se fier à votre contrôle qualité de l’IA. Ne laissez pas l’équipe qui a construit un agent IA être la seule à l’évaluer. Une équipe jugée sur la bonne image de l’agent n’est pas la mieux placée pour dire s’il est bon.
Les preuves rendent la note crédible
L’évaluateur doit appliquer la même grille, que la conversation ait été traitée par un humain, par votre propre bot ou par l’IA d’un tiers. Kaizo évalue 100 % des conversations des conseillers et des agents IA avec votre propre grille, et chaque note renvoie aux preuves dans la conversation : son verdict sur un agent peut donc être vérifié au lieu d’être cru sur parole.
Les questions à poser à un fournisseur de QA
- Pouvez-vous évaluer un agent IA conçu par quelqu’un d’autre avec la même grille que la nôtre ?
- Chaque note renvoie-t-elle aux preuves, pour que nous puissions vérifier votre jugement au lieu de le croire sur parole ?
Étape 4 : repérer les défaillances propres à l’IA
Une fois l’évaluation en place sur chaque conversation, orientez-la vers les défaillances propres à l’automatisation, ou amplifiées par elle. Ce sont les catégories qu’il vaut la peine d’isoler et de suivre dans le temps.
| Défaillance | À quoi elle ressemble | Ce que la grille vérifie |
|---|---|---|
| Information erronée | L’agent énonce une règle, un prix ou une étape qui est faux | Chaque affirmation factuelle était-elle correcte et fondée sur vos sources ? |
| Escalade manquée | L’agent continue de traiter un cas qu’il aurait dû passer à un humain | A-t-il escaladé sur le bon déclencheur et à temps ? |
| Fausse certitude | Une mauvaise réponse donnée comme une certitude | L’agent s’est-il abstenu d’inventer des détails qu’il ne pouvait pas vérifier ? |
| Ton inadapté | Un langage mécanique ou expéditif face à un client agacé | Le ton correspondait-il à l’état émotionnel du client ? |
| Manquement aux règles | L’agent fait quelque chose qu’il avait pour consigne de refuser | Est-il resté dans ses limites de sécurité et de règles ? |
Étape 5 : réinjecter les constats et réévaluer
Le contrôle qualité ne vaut que s’il change les comportements. Comme chaque note Kaizo renvoie au moment exact de la transcription qui l’a produite, un échec n’est pas qu’un signalement : c’est un exemple précis et reproductible sur lequel vous pouvez agir.
Boucler la boucle
- Renvoyez les erreurs d’exactitude vers le prompt, la base de connaissances ou la source qui a produit la mauvaise réponse.
- Transformez les escalades manquées en règle de routage ou en déclencheur plus strict.
- Regroupez les échecs récurrents pour corriger le schéma une fois, au lieu de rapiécer les cas un par un.
Réévaluez ensuite pour vérifier que la correction tient. Une couverture complète et continue vous montre l’effet d’un changement sur toutes les conversations, et non sur un échantillon qui pourrait rater la régression.
Les erreurs fréquentes à éviter
Quelques erreurs sapent discrètement les programmes de contrôle qualité de l’IA avant qu’ils n’apportent de la valeur.
- Échantillonner l’IA comme vous échantillonniez les conseillers : un échantillon de 2 % d’un bot à fort volume rate presque par construction les défaillances systématiques.
- Laisser l’équipe qui a construit l’agent l’évaluer seule : sans évaluateur indépendant, une note flatteuse n’équivaut pas à un bon travail.
- Évaluer sans preuves : une note que vous ne pouvez pas rattacher à une ligne de la transcription ne peut être ni vérifiée, ni utilisée en coaching, ni contestée.
- Reprendre la grille des conseillers sans la modifier : les défaillances propres à l’IA, comme l’hallucination et la fausse certitude, demandent leurs propres critères.
- Mesurer sans jamais réinjecter : un contrôle qualité qui ne change ni les prompts, ni les garde-fous, ni le routage n’est que du reporting.
Questions fréquentes
Comment faire le contrôle qualité d’un agent IA ou d’un chatbot ?
Construisez une grille d’évaluation qui définit une bonne conversation traitée par l’IA, en couvrant l’exactitude, la résolution, l’escalade au bon moment, le ton et le respect des règles. Évaluez automatiquement 100 % des conversations IA avec cette grille, gardez l’évaluateur indépendant de l’IA évaluée, et reliez chaque note aux preuves dans la transcription pour que les échecs puissent être vérifiés et corrigés.
Pourquoi l’évaluateur doit-il être indépendant de l’agent IA ?
Si les seules personnes qui évaluent un agent IA sont celles qui l’ont construit, elles ont intérêt à ce que l’agent paraisse bon. C’est un évaluateur qui relie chaque note aux preuves dans la conversation qui rend la note crédible, parce que n’importe qui peut la vérifier.
Peut-on utiliser la même grille pour les agents IA et les conseillers ?
Vous pouvez partager les critères qui s’appliquent aux deux, comme la résolution et le ton, ce qui garde le contrôle qualité de l’IA et celui des conseillers comparables. Mais l’IA a besoin de critères supplémentaires pour ses propres défaillances, comme l’hallucination et la fausse certitude : la meilleure approche est donc un standard unique, complété par des vérifications propres à l’IA.
Quelle part des conversations IA faut-il contrôler ?
Toutes. L’IA tourne à des volumes qu’aucune équipe ne peut échantillonner de façon utile, et un défaut systématique se répète dans chaque conversation que l’agent traite : un petit échantillon passera donc le plus souvent à côté. C’est l’évaluation automatique de 100 % des conversations qui fait apparaître ces schémas tôt.
Quelles défaillances d’un agent IA une grille doit-elle suivre ?
Cinq catégories méritent d’être suivies séparément : les informations erronées, les escalades manquées, la fausse certitude, le ton inadapté et les manquements aux règles. Pour chacune, la grille vérifie une question précise, par exemple si chaque affirmation factuelle était fondée sur vos sources ou si l’agent a escaladé à temps.
Pour aller plus loin
- Qu’est-ce que la QA agentique ? (en anglais)
- Qu’est-ce que l’Auto QA ? (en anglais)
- Qu’est-ce qu’un agent IA ? (en anglais)
- Mesurer la performance d’un agent IA
- Qu’est-ce que le LLM as a judge ? (en anglais)
- Quelle est la fiabilité du contrôle qualité par IA ?
- Rédiger une grille qu’une IA peut vraiment évaluer (en anglais)
- Valider l’évaluation de la QA par IA en une semaine (en anglais)
- Les faux positifs du contrôle qualité automatisé (en anglais)