Aller au contenu

Bonnes pratiques

Contrôle qualité des agents IA Zendesk : la méthode

Contrôle qualité des agents IA Zendesk : ce que Zendesk mesure seul, les conversations du bot à relire en premier, une grille d'exemple et comment corriger.

· 13 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Le contrôle qualité des agents IA Zendesk consiste à lire et à évaluer les conversations que traite votre agent IA Zendesk, par rapport à un standard écrit, pour savoir si ses réponses étaient justes et pas seulement si le client est reparti. Il vous faut une grille d’évaluation conçue pour le bot, un moyen d’évaluer chaque conversation de l’agent IA et une boucle qui transforme chaque erreur en correction dans Zendesk.

En bref

  • Une résolution automatisée dans Zendesk vous dit que le client n’a pas eu affaire à un humain, pas que la réponse était correcte.
  • Commencez par les conversations de l’agent IA où une mauvaise réponse coûte de l’argent : remboursements, tarifs, exceptions aux règles et modifications de compte.
  • Évaluez le bot sur l’exactitude, l’ancrage dans vos contenus, l’escalade et le transfert, pas seulement sur la formule d’accueil et l’empathie.
  • Chaque erreur doit aboutir à un changement précis : un article du centre d’aide, une procédure, une règle d’escalade ou un sujet bloqué.
  • Réévaluez après chaque changement, car corriger une réponse peut en dégrader une autre.

Ce guide est la version Zendesk de notre guide général sur le contrôle qualité des agents IA. Si vous cherchez l’outil lui-même, la page de l’outil de QA pour Zendesk montre comment Kaizo évalue les conversations Zendesk, y compris celles que traitent les agents IA de Zendesk.

Que vous montre Zendesk sur la qualité de l’agent IA ?

Zendesk vous montre des volumes et des résultats : combien de conversations l’agent IA a résolues, lesquelles il n’a pas résolues, et les transcriptions des unes et des autres. À lui seul, il ne vous dit pas si chaque réponse était exacte ou conforme à votre politique. Pour cela, il faut une évaluation, soit dans Zendesk QA, soit dans un outil de QA distinct.

En pratique, un administrateur Zendesk dispose aujourd’hui de trois endroits où regarder :

OùCe que vous obtenezCe que cela ne vous dit pas
Insights et transcriptions de l’agent IARésolutions automatisées et conversations non résolues, avec transcriptionsSi une conversation résolue correspondait à une réponse juste
Nombre de résolutions automatiséesCombien de demandes l’agent IA a résolues sans escalade vers un humainSi le client est revenu, ou s’il a abandonné
Zendesk QA (module payant)Évaluations et notation automatique des conversations, y compris des bots que vous marquez comme évaluablesSi la réponse respectait votre propre politique, sauf si votre grille le vérifie

Deux détails méritent d’être connus. Selon le centre d’aide de Zendesk, la vue des transcriptions, que vous ouvrez depuis l’onglet Insights des paramètres de l’agent IA, affiche les 100 premiers messages échangés entre un agent IA et un utilisateur, et seules les conversations inactives depuis plus de 72 heures apparaissent parmi les résolutions automatisées. Le même article présente cette vue comme une fonctionnalité héritée (legacy) et précise qu’elle ne sera plus disponible après le 10 décembre 2026 : vérifiez donc où votre équipe lira les transcriptions après cette date.

Pourquoi une résolution automatisée n’est-elle pas une note qualité ?

Zendesk mesure l’usage de l’agent IA en résolutions automatisées et ne facture que les demandes clients résolues avec succès par un agent IA, sans aucune escalade vers un agent humain. Cette définition vous dit que la conversation s’est terminée sans humain. Elle ne peut pas vous dire si la réponse était juste, complète ou autorisée.

L’écart se manifeste de trois façons :

  1. Le client a abandonné. Une réponse fausse ou générique, puis le silence. Pas d’escalade, donc la conversation compte comme résolue.
  2. La réponse était presque juste. Le bot cite la bonne politique mais oublie une condition, ou le bon produit mais l’ancien prix. Tous les indicateurs du système restent au vert.
  3. Le bot a promis quelque chose que vous ne proposez pas. Un remboursement hors délai, des frais annulés, une date de livraison que personne ne peut tenir. Le client est satisfait, jusqu’au moment où la promesse n’est pas tenue.

Des équipes support décrivent publiquement ce même schéma. Dans une discussion sur r/Zendesk, une équipe qui relisait les tickets “started and finished with the AI Agent (no human touch)” écrivait avoir vu “high value customers getting iffy or bad answers and then abandoning the chat”, c’est-à-dire des clients à forte valeur recevant des réponses douteuses ou mauvaises avant d’abandonner le chat. C’est le témoignage d’une seule équipe, mais c’est exactement le cas qu’un nombre de résolutions automatisées ne peut pas montrer. Nous détaillons la liste plus large de ces erreurs discrètes dans notre article sur les erreurs silencieuses des agents IA.

Comment mettre en place le contrôle qualité des agents IA Zendesk ?

Mettez en place le contrôle qualité des agents IA Zendesk en six étapes : choisissez d’abord les sujets à risque, rédigez une grille d’évaluation pour le bot, évaluez chaque conversation de l’agent IA, vérifiez le transfert vers vos conseillers, rattachez chaque erreur à une correction dans Zendesk et réévaluez après chaque changement. Les deux premières étapes se font une fois ; le reste est une routine hebdomadaire.

Étape 1 : déterminer quelles conversations de l’agent IA comptent le plus

Toutes les conversations du bot ne présentent pas le même risque. Une mauvaise réponse sur les horaires d’ouverture est agaçante. Une mauvaise réponse sur un remboursement, des frais de résiliation ou une demande liée aux données coûte de l’argent ou crée un problème de conformité. Listez les sujets où une mauvaise réponse fait des dégâts, puis assurez-vous que votre évaluation les couvre en priorité :

  • Remboursements, avoirs, compensations et annulations de frais
  • Tarifs, offres et tout ce qui contient un chiffre
  • Exceptions aux règles et conditions d’éligibilité
  • Modifications de compte, résiliations et données personnelles
  • Réclamations et menaces de départ

Signalez aussi les conversations des comptes à forte valeur et toute conversation où le même client revient dans les jours qui suivent sur le même sujet.

Étape 2 : rédiger une grille d’évaluation pour l’agent IA

La grille de vos conseillers est un point de départ, pas la réponse. La formule d’accueil et l’orthographe posent rarement problème à un bot. Ses points faibles sont l’exactitude, l’ancrage dans vos propres contenus et le fait de savoir quand s’arrêter. Gardez 6 à 8 critères, chacun vérifiable par un évaluateur dans la transcription. La section suivante donne un exemple détaillé, et notre guide sur la grille d’évaluation d’un agent IA explique quels critères conçus pour les conseillers retirer.

Étape 3 : évaluer chaque conversation de l’agent IA, pas un échantillon

Un bot a tendance à répéter la même erreur dans toutes les conversations qui touchent au même sujet, parce qu’il répond chaque fois à partir des mêmes contenus. Un échantillon de 2 % peut passer complètement à côté, ou la repérer une fois et la prendre pour du bruit. Évaluer chaque conversation de l’agent IA fait apparaître le schéma : un article, une procédure ou une règle derrière des dizaines de mauvaises réponses.

Avec Kaizo, vous connectez Zendesk, choisissez une grille et activez AutoPilot. Il évalue chaque conversation selon vos critères au moment de sa résolution et ajoute au ticket un commentaire qui explique la note. Vous pouvez définir les files, canaux ou équipes qu’il évalue.

Étape 4 : vérifier le transfert vers vos conseillers

Quand l’agent IA fait une escalade, deux choses peuvent mal tourner : il escalade trop tard, alors que le client est déjà agacé, ou il transfère sans le contexte, si bien que le client doit tout répéter. Évaluez les deux côtés : celui du bot (a-t-il escaladé sur le bon déclencheur, a-t-il transmis un résumé) et celui du conseiller (l’a-t-il lu). Notre guide sur l’évaluation du transfert couvre les deux sens.

Étape 5 : rattacher chaque erreur à une correction dans Zendesk

Une note de QA qui ne change rien au bot n’est qu’un rapport. Pour chaque critère non respecté, déterminez la cause et l’endroit où se trouve la correction :

Ce qui a échouéCause probableOù corriger
Fait faux ou périméL’article source est faux, ancien ou manquantMettre à jour ou ajouter l’article du centre d’aide dont le bot tire sa réponse
Bonne politique, condition manquanteL’article noie la condition, ou deux articles se contredisentRéécrire l’article pour que la condition figure dans la réponse elle-même
Promesse non autoriséeRien n’arrête le bot sur ce sujetConfier ce sujet à un humain, ou empêcher le bot d’y répondre
Escalade trop tardiveLes conditions de transfert sont trop étroitesLes élargir : sujet, signes d’agacement, même question posée deux fois
Transfert sans contexteAucun résumé transmis au conseillerModifier le transfert pour que le conseiller reçoive un résumé de la conversation

Regroupez les erreurs par cause avant de corriger quoi que ce soit. Dix mauvaises réponses issues d’un même article demandent une seule correction, pas dix.

Étape 6 : réévaluer après chaque changement

Les changements de contenu ont des effets de bord. Un article sur les remboursements réécrit peut corriger les réponses sur les remboursements et dégrader les réponses voisines sur les résiliations. Après chaque changement, regardez les notes du sujet concerné sur la semaine suivante et comparez-les à celles de la semaine précédente. Si vous évaluez chaque conversation, cette comparaison est déjà disponible.

À quoi ressemble une grille d’évaluation pour un agent IA Zendesk ?

Une grille d’évaluation pour un agent IA Zendesk vérifie si la réponse du bot était juste, ancrée dans vos propres contenus, autorisée par la politique, et si le transfert a eu lieu au bon moment. Elle compte moins de critères de savoir-être qu’une grille pour conseillers et davantage de critères sur les faits et l’escalade. Voici un exemple détaillé pour une équipe support dans le commerce de détail.

CritèreQuestion à laquelle répond l’évaluateurType
Réponse justeChaque fait de la réponse était-il vrai pour le cas de ce client ?Conforme / non conforme, échec automatique sur les sujets d’argent
Ancrée dans nos contenusChaque affirmation peut-elle être rattachée à un article du centre d’aide ou à une procédure ?Conforme / non conforme
Politique respectéeLe bot est-il resté dans les règles de remboursement, de frais et d’éligibilité ?Conforme / non conforme, échec automatique
Demande compriseA-t-il répondu à la question posée par le client, et non à une question voisine ?1 à 3
Escalade quand il le fallaitA-t-il transféré sur le bon déclencheur, avant que le client ne se répète ?Conforme / non conforme
Contexte du transfertLe conseiller a-t-il reçu un résumé exploitable ?Conforme / non conforme
TonLe ton était-il adapté à un client mécontent ?1 à 3

Et voici le type de commentaire qu’un évaluateur, ou AutoPilot, devrait laisser sur le ticket :

Politique respectée : non conforme. Le client a demandé un remboursement au 34e jour. L’agent IA a confirmé le remboursement, alors que la politique de retour autorise 30 jours. Source : l’article du centre d’aide “Retours et remboursements”, qui ne mentionne le délai de 30 jours que dans son dernier paragraphe. Correction proposée : placer le délai dans la première phrase de l’article et ajouter une règle d’escalade pour les demandes de remboursement après le 30e jour.

C’est ce type de commentaire qui rend la note utile : il nomme le critère, la preuve dans la transcription, la source de l’erreur et la correction. Avant de vous fier à une note automatisée, testez-la sur des conversations que votre équipe a déjà évaluées et regardez où elle diverge. Notre guide sur la validation de l’évaluation QA par IA (en anglais) détaille ce test.

Quels résultats attendre d’une couverture complète ?

Les résultats publiés proviennent du contrôle qualité des conversations de support en général. Chez UiPath, Kaizo a automatisé 100 % de la QA, avec un ROI de 200 % et une hausse de 8 % de la note qualité. Chez SteelSeries, une équipe support de 30 personnes qui a démarré sur Zendesk, les résumés générés par IA ont réduit de moitié le temps consacré à la QA sans réduire ce qu’elle détectait.

Aucun de ces résultats ne porte uniquement sur des conversations d’agents IA. Le mécanisme est pourtant le même : dès que chaque conversation est évaluée, une erreur récurrente cesse d’être une anecdote et devient un chiffre que vous pouvez corriger et suivre.

Voyez-le sur votre propre Zendesk. Kaizo évalue chaque conversation Zendesk selon vos propres critères, y compris celles que traitent les agents IA de Zendesk, et ajoute l’explication au ticket. Réserver une démo.

Faut-il utiliser Zendesk QA ou un outil de QA distinct ?

Utilisez Zendesk QA si vous payez déjà le module et si ses grilles correspondent à la façon dont vous voulez évaluer le bot. Utilisez un outil de QA distinct si vous voulez une seule grille et un seul reporting pour les conversations des conseillers et des agents IA, construits autour de vos propres critères. Les deux peuvent fonctionner ; la grille et le suivi comptent plus que l’outil.

Ce que Zendesk QA propose pour les bots, selon le centre d’aide de Zendesk :

  • Vous marquez chaque bot comme évaluable ou non. Les bots évaluables sont inclus dans la notation automatique et les évaluations manuelles.
  • Vous pouvez filtrer les conversations par participant, bot, type de bot (workflow ou génératif) et nombre de réponses du bot.
  • Ses catégories AutoQA sont la formule d’accueil, l’empathie, l’orthographe et la grammaire, la conclusion, la solution proposée, le ton, la lisibilité et la compréhension, et les agents et les bots sont évalués séparément.
  • Il nécessite le module Quality Assurance ou Workforce Engagement Management.

Les questions à poser à tout outil, Zendesk QA compris :

  1. Peut-il évaluer les critères qui comptent pour un bot, comme l’exactitude par rapport à vos propres contenus et à votre politique, et pas seulement les catégories standard ?
  2. Chaque note est-elle accompagnée d’une explication liée à la transcription ?
  3. Pouvez-vous le tester sur vos propres évaluations passées avant qu’il n’évalue en production ?
  4. Évalue-t-il chaque conversation de l’agent IA, ou un échantillon ?
  5. Les personnes qui corrigent le bot voient-elles les erreurs regroupées par cause ?

Si vous comparez directement les deux, notre page sur l’alternative à Zendesk QA présente les différences, et la page Kaizo pour Zendesk montre comment se passe la mise en place.

Quand ce n’est pas pour vous

Un contrôle qualité formel des agents IA ne se justifie pas partout. Si votre agent IA Zendesk traite quelques dizaines de conversations par semaine, lisez-les vous-même : une heure par semaine avec les transcriptions et une courte checklist permet de repérer la plupart des problèmes. Si le bot ne répond qu’à des questions à faible risque, comme les horaires d’ouverture et les liens de suivi de commande, un contrôle ponctuel mensuel suffit.

Il est aussi trop tôt si vous n’avez pas encore de standard écrit décrivant une bonne réponse. Rédigez-le d’abord, même sous forme de liste d’une page, car aucun outil ne peut évaluer par rapport à un standard qui n’existe pas. Et si les contenus de votre centre d’aide sont périmés dans leur ensemble, corrigez les contenus avant de mesurer le bot : sinon, la QA vous dira surtout ce que vous savez déjà.

Questions fréquentes

Zendesk QA peut-il évaluer les conversations traitées par des agents IA ?

Oui. Zendesk QA peut inclure les bots que vous marquez comme évaluables dans la notation automatique et les évaluations manuelles, et vous pouvez filtrer les conversations par bot et par type de bot. Il nécessite le module Quality Assurance ou Workforce Engagement Management.

Kaizo fonctionne-t-il avec les agents IA Zendesk ?

Oui. Kaizo se connecte à Zendesk, et AutoPilot évalue chaque conversation Zendesk selon vos propres critères, y compris celles que traitent les agents IA de Zendesk. Chaque note est accompagnée d’un commentaire qui l’explique.

Combien de conversations d’un agent IA Zendesk faut-il évaluer ?

Évaluez-les toutes si vous le pouvez, car un bot a tendance à répéter la même erreur dans les conversations qui portent sur le même sujet. Si vous évaluez à la main, commencez par les sujets à risque comme les remboursements, les tarifs et les exceptions aux règles, et lisez d’abord chacune de ces conversations.

Peut-on utiliser la même grille pour les conseillers et pour l’agent IA ?

Vous pouvez partager les critères qui s’appliquent aux deux, comme la réponse juste et le ton, ce qui garde les résultats comparables. L’agent IA a besoin de critères supplémentaires sur l’ancrage dans vos contenus, les limites de la politique et l’escalade, et d’un poids moindre sur la formule d’accueil et l’orthographe.

Combien de temps faut-il pour mettre en place le contrôle qualité d’un agent IA Zendesk ?

L’essentiel du travail consiste à choisir les sujets à risque et à rédiger la première grille, ce que vous faites une fois. Avec Kaizo, connecter Zendesk et activer AutoPilot prend quelques jours, pas un projet de connecteur, et vous pouvez tester l’évaluation sur vos évaluations passées avant la mise en production.

Que faire quand l’agent IA donne une mauvaise réponse ?

Trouvez d’abord la source de la réponse : en général, un article du centre d’aide faux, périmé ou ambigu. Corrigez l’article ou ajoutez une règle d’escalade pour ce sujet, puis vérifiez les notes de ce sujet sur la semaine suivante pour confirmer que la correction tient.

Pour aller plus loin

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart