Aller au contenu

Modèle

Grille d’évaluation d’un agent IA : ce qui change

Grille d’évaluation agent IA : les critères à ajouter, ceux de la grille des conseillers à retirer et comment évaluer équitablement un agent IA au support.

· 7 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Un agent IA ne se trompe pas comme un conseiller : sa grille d’évaluation retire donc les critères propres aux humains et garde ceux qui portent sur la résolution du problème. La grille d’évaluation d’un agent IA ajoute des contrôles sur les hallucinations, les escalades risquées, le respect du périmètre et la capacité à admettre ce qu’il ne sait pas.

En bref

  • La chaleur du ton en dit peu. L’exactitude des faits en dit presque tout.
  • Évaluez chaque conversation de l’IA, car les erreurs automatisées se répètent à grande échelle.
  • Les pires erreurs de l’IA sont silencieuses et ne déclenchent jamais d’escalade.
  • Ne laissez pas l’équipe qui a construit l’agent être la seule à l’évaluer.

Pourquoi réutiliser la grille des conseillers ne fonctionne pas

Quand on déploie un agent IA, le premier réflexe est de l’évaluer avec la grille qui existe déjà. C’est tentant, car l’objectif semble le même : une bonne conversation avec le client. Mais la grille conçue pour des personnes repose sur des hypothèses sur la façon dont les personnes se trompent, et un agent IA contredit ces hypothèses dans les deux sens.

Un conseiller n’invente généralement pas une politique de remboursement qui n’existe pas, mais il peut se montrer sec sous la pression. Un agent IA ne sera presque jamais sec, mais il énoncera une politique inventée avec une assurance totale. Évaluer l’agent IA sur la chaleur du ton en dit peu, car le ton est ce qu’il produit de la façon la plus fiable. Vérifier que chacune de ses affirmations factuelles était vraie en dit presque tout, car c’est là qu’il échoue réellement. La grille doit déplacer son attention là où se trouve désormais le risque. Notre méthode complète de contrôle qualité des agents IA et des chatbots couvre le processus autour de cette question ; ici, la question est plus étroite : ce qui figure réellement sur la grille.

Les critères humains qui n’ont plus de sens

Commencez par retirer les critères qui mesurent quelque chose qu’un agent IA ne possède pas ou sur quoi il ne varie pas.

  • Le ton et la chaleur comme indicateur d’empathie : le ton d’un agent IA est fixé par son prompt et varie à peine, donc le noter revient à mesurer la configuration, pas l’échange. L’empathie compte toujours, mais sous la forme d’une question : la réponse était-elle adaptée à l’état du client ? Ce point est traité plus bas.
  • L’effort et l’initiative : des critères comme « aller au-delà des attentes » supposent une personne qui choisit d’en faire plus. Ils ne s’appliquent pas à un système qui exécute des instructions.
  • Le respect d’un script appris par cœur : remplacé par le respect du périmètre et des politiques, un contrôle différent et plus précis pour une machine.
  • Les critères de développement personnel : tout ce qui concerne l’apprentissage ou la progression de l’agent relève du responsable du modèle, pas d’une note conversation par conversation.

Retirer ces critères ne revient pas à baisser l’exigence. Cela revient à la diriger vers les erreurs qui peuvent réellement se produire.

Les critères propres à la grille d’évaluation d’un agent IA

Ce sont ces ajouts qui font une véritable grille d’évaluation pour agent IA, et non une grille de conseiller recyclée. Chacun décrit une erreur qu’une personne commet rarement et qu’une machine commet couramment.

CritèreCe qu’il vérifiePourquoi un conseiller le déclenche rarement
Exactitude de chaque affirmationRien de ce que l’agent a dit n’était inventé ou fauxLes personnes nuancent quand elles doutent ; les modèles affirment avec la même assurance, qu’ils aient raison ou tort
Fidélité aux politiquesL’agent n’a pas inventé, atténué ou exagéré une politiqueUn conseiller sait qu’il ne connaît pas une politique ; un modèle en génère une plausible
Respect du périmètreL’agent est resté dans ce qu’il a le droit de faire ou de promettreLes personnes sentent la limite de leur autorité ; il faut l’indiquer à un modèle, qui peut la franchir
Comportement d’escaladeIl a transféré quand il le fallait et n’a pas piégé le clientUn conseiller se rend compte qu’il est bloqué ; un modèle peut tourner en boucle ou aboutir à une impasse sans s’en apercevoir
Honnêteté face à l’incertitudeIl a dit qu’il ne savait pas plutôt que de devinerDeviner avec assurance est un réflexe par défaut des modèles, pas des personnes
Traitement sûr des demandes sensiblesIl a refusé ou orienté correctement les cas d’automutilation, de fraude ou à risque juridiqueUn jugement qu’une personne applique d’instinct doit devenir un critère explicite pour une machine

Les critères qui restent les mêmes

Certains points comptent quel que soit l’interlocuteur, humain ou machine, et ils forment la colonne vertébrale de la grille.

  • La demande a-t-elle été résolue : le client repart avec son problème réglé, pas simplement sans avoir parlé à un humain. C’est le critère que le taux de contention (en anglais) ignore discrètement.
  • L’information était-elle juste et complète : commun avec la grille des conseillers, mais beaucoup plus lourd ici.
  • Le client a-t-il été traité de manière appropriée : reformulé, de la chaleur vers la pertinence : la réponse correspondait-elle à la situation et à l’état émotionnel du client ?
  • L’échange a-t-il été efficace pour le client : il ne s’agit pas du temps de traitement de l’agent, mais de savoir si le client est arrivé au but sans boucles inutiles.

Rédiger une grille qu’une IA peut évaluer (en anglais) explique comment formuler chacun de ces critères pour qu’il soit vérifiable dans la transcription plutôt qu’une affaire d’opinion.

Comment évaluer avec cette grille : couverture et traçabilité

Deux éléments distinguent une grille d’évaluation d’agent IA qui fonctionne d’une grille décorative.

Tout évaluer, pas un échantillon

Le contrôle qualité des conseillers évaluait quelques conversations par conseiller, parce que les relire coûtait cher. Cette logique ne tient plus pour les agents IA, car leurs erreurs sont systématiques : une faiblesse du prompt qui produit une hallucination la produit des centaines de fois, et un échantillon de 2 % passera généralement à côté du schéma jusqu’à ce qu’il soit déjà devenu un problème. Évaluer 100 % des conversations (en anglais) fait de la grille un instrument de surveillance plutôt qu’un contrôle ponctuel. Chez UiPath, Kaizo a automatisé 100 % du contrôle qualité, avec un ROI de 200 % et une hausse de 8 % de la note qualité.

Relier chaque note à la transcription

Une note d’exactitude ou de fidélité aux politiques n’est utile que si vous voyez les lignes exactes qui l’ont fait baisser. Sinon, vous ne pouvez pas corriger le prompt, ni défendre la note quand l’équipe responsable de l’agent la conteste. Chaque note Kaizo renvoie aux éléments qui l’ont produite.

Ne pas laisser le concepteur être le seul évaluateur

Le point structurel qui dérange : si l’équipe qui a construit votre agent IA est la seule à l’évaluer, les critères les plus susceptibles d’être indulgents sont justement ceux qui donneraient une mauvaise image de l’agent. Évaluez les critères comme l’exactitude des faits et les escalades risquées avec votre propre grille, et assurez-vous que chaque note renvoie aux éléments de la conversation. La typologie des erreurs silencieuses approfondit les erreurs qu’un évaluateur indulgent a tendance à manquer.

Questions fréquentes

Qu’est-ce qu’une grille d’évaluation d’agent IA ?

C’est l’ensemble des critères utilisés pour évaluer les conversations traitées par un système automatisé plutôt que par une personne. Elle diffère d’une grille QA de conseiller : elle retire les critères qui ne concernent que les personnes, garde ceux qui portent sur la résolution de la demande du client et la justesse de l’information, et ajoute des critères propres à l’automatisation comme l’exactitude des faits, la fidélité aux politiques, le respect du périmètre et le comportement d’escalade.

Puis-je utiliser ma grille QA actuelle pour un agent IA ?

Pas sans la modifier. Une grille de conseiller repose sur des hypothèses sur la façon dont les personnes se trompent, et les agents IA se trompent autrement. La chaleur du ton varie à peine chez un modèle et en dit peu, tandis que les faits inventés et les politiques inventées, que les personnes produisent rarement, deviennent le risque principal. Réutiliser la grille des conseillers dirige votre attention vers les mauvaises erreurs.

Quels critères sont propres à l’évaluation d’un agent IA ?

L’exactitude de chaque affirmation, la fidélité aux politiques (ne pas inventer ni exagérer une politique), le respect du périmètre, le comportement d’escalade (transférer quand il est bloqué plutôt que piéger le client), l’honnêteté face à l’incertitude et le traitement sûr des demandes sensibles. Chacun décrit une erreur qu’une personne commet rarement et qu’un modèle commet couramment.

Faut-il évaluer toutes les conversations d’un agent IA ou un échantillon ?

Toutes. Les erreurs des agents IA sont systématiques : une faiblesse du prompt qui produit une hallucination la produit des centaines de fois, et un échantillon de 2 % passe généralement à côté du schéma jusqu’à ce qu’il soit déjà devenu un problème. Évaluer 100 % des conversations fait de la grille un instrument de surveillance plutôt qu’un contrôle ponctuel.

Pourquoi l’équipe qui a construit l’agent IA ne doit-elle pas être la seule à l’évaluer ?

Parce que les critères les plus susceptibles d’être indulgents sont ceux qui donneraient une mauvaise image de l’agent. Évaluez l’exactitude des faits et les escalades risquées avec votre propre grille, et reliez chaque note aux éléments de la transcription.

Pour aller plus loin

Construire une grille d’évaluation d’agent IA qui détecte l’essentiel

Apportez les conversations que votre agent IA a traitées le mois dernier et la grille que vous utilisez aujourd’hui. Nous vous montrerons quels critères n’ont plus de sens pour une machine, quelles erreurs votre grille actuelle ne voit pas et ce qu’une grille conçue pour l’automatisation détecte à la place. Chaque note renvoie aux lignes exactes de la transcription.

Réserver une démo Découvrir Agentic Auto QA

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart