Aller au contenu

Modèle

Pondérer une grille d’évaluation QA sans deviner

Une pondération égale fausse la plupart des grilles d’évaluation QA. Fixez le poids de chaque critère à partir de preuves et testez-le sur de vraies notes.

· 13 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

La pondération d’une grille d’évaluation se fixe critère par critère à partir de trois éléments : à quel point le manquement pénalise le client, quel risque il fait peser sur l’entreprise, et dans quelle mesure le conseiller le maîtrise. Si vous ne pouvez pas justifier un poids, la note ne résistera pas à la première contestation.

En bref

  • Une pondération égale affirme que chaque critère compte autant. Ce n’est jamais vrai.
  • La maîtrise du conseiller est le facteur que tout le monde oublie, et celui que les conseillers vivent le plus mal.
  • Faites des critères critiques un critère éliminatoire plutôt qu’un item à 60 points.
  • Testez les nouveaux poids sur des conversations déjà évaluées. Si personne ne change de tranche, le changement était cosmétique.

Pourquoi une pondération égale fausse discrètement une grille

Presque toutes les grilles d’évaluation QA démarrent avec des poids égaux, parce que cela semble équitable et ne demande aucune réflexion. Ce n’est ni l’un ni l’autre. Une pondération égale est une affirmation, et cette affirmation dit qu’oublier la formule d’accueil coûte exactement autant à l’entreprise que traiter le mauvais remboursement.

Trois conséquences en découlent, et elles arrivent dans cet ordre.

La note ne fait plus la différence. Quand dix critères valent dix points chacun, un manquement grave et un manquement cosmétique coûtent tous deux dix points. Deux conseillers finissent à 90, l’un parce qu’il a été sec, l’autre parce qu’il a donné au client une information fausse sur son argent. Un chiffre incapable de distinguer ces deux cas ne mesure pas la qualité.

Les conseillers optimisent les critères faciles. Chacun réagit au système de points qu’on lui donne. Si le ton et la formule d’accueil sont les points les plus faciles à préserver et les plus difficiles à perdre, c’est là que va l’effort. Ce n’est pas de la triche, c’est la grille qui fonctionne exactement comme elle a été conçue.

La note se déconnecte de l’activité. Dès que les notes qualité ne suivent plus les escalades, les réouvertures et l’insatisfaction client, la direction cesse discrètement de s’en servir. Le programme continue, les évaluations continuent, et personne ne prend de décision à partir du résultat. C’est l’état dans lequel se trouvent en réalité la plupart des programmes de QA.

Un diagnostic rapide. Prenez vos deux conseillers les mieux notés du mois dernier et vos deux moins bien notés. Si vous ne pouvez pas formuler une vraie différence dans l’expérience client qu’ils ont offerte, vos poids ne portent aucune information. Avant de toucher aux poids, assurez-vous que les critères eux-mêmes sont solides : c’est un chantier à part, traité dans ce qu’est une grille de critères qualité et comment la construire.

À retenir

Une pondération égale n’est pas l’absence de décision. C’est la décision que chaque critère compte autant, prise par défaut et jamais réexaminée.

Les trois modèles de pondération, et quand choisir chacun

Seuls trois modèles sont utilisés en pratique. L’erreur n’est pas de choisir le mauvais, c’est d’en choisir un par accident et de ne jamais le réexaminer.

ModèleFonctionnementAdapté quandÉchoue quand
UniformeChaque critère vaut le même nombre de pointsLe programme est récent, vous avez moins d’une dizaine de critères et vous ne savez vraiment pas encore ce qui compteVous avez des données de résultats et vous les ignorez quand même. L’uniforme doit être un point de départ, pas un point d’arrivée
Pondéré selon l’impactLes critères valent des points différents selon leur impact client et métierLe programme est assez mûr pour disposer de preuves, et les évaluateurs savent justifier chaque poidsLes poids sont fixés par la personne qui parle le plus fort en réunion, puis jamais réexaminés
Déduction à partir d’un plafondChaque conversation part de 100 et perd des points à chaque manquement, la gravité fixant la déductionLa plupart des conversations se passent bien et vous cherchez les exceptions, ou l’activité est très encadrée par la conformitéIl n’y a pas de plancher : une seule mauvaise conversation part loin dans le négatif et fausse la moyenne d’un conseiller

Fixer la pondération d’une grille d’évaluation à partir de preuves plutôt que d’opinions

Pondérez selon trois facteurs, dans cet ordre. Rien de tout cela n’est propre à la QA du support : le manuel du gouvernement britannique sur l’analyse multicritère traite exactement le même problème, noter des options selon des critères puis pondérer ces critères, et sa mise en garde centrale est que les poids portent le jugement de valeur, que quelqu’un l’admette ou non.

L’impact client. À quel point la journée de ce client est-elle pire parce que le critère n’a pas été respecté ? Une information fausse sur un remboursement passe loin devant une formule de clôture oubliée.

Le risque métier et réglementaire. Que coûte le manquement au-delà de cette seule conversation ? Tout ce qui a une conséquence juridique, financière ou liée à la protection des données se place en haut, et une partie ne devrait même pas figurer dans la partie pondérée.

La maîtrise du conseiller. C’est le facteur que l’on saute, et c’est celui que les conseillers remarquent. Si un critère dépend d’un système interne lent, d’une règle que le conseiller ne peut pas assouplir ou d’un transfert depuis une autre équipe, lui donner un poids élevé sanctionne les personnes pour votre processus. Soit vous lui donnez un poids faible, soit vous corrigez le processus et cessez de l’évaluer.

Les poids portent le jugement de valeur, que quelqu’un l’admette ou non.

D’après le manuel d’analyse multicritère du gouvernement britannique

L’heure d’analyse qui fait l’essentiel du travail

Prenez trois mois de conversations que vous avez déjà évaluées. Pour chaque critère, séparez celles où il a été respecté de celles où il ne l’a pas été, puis comparez un résultat en aval entre les deux groupes. Le taux de réouverture est le meilleur choix unique, parce qu’il est objectif et qu’il se trouve déjà dans votre helpdesk. Le taux d’escalade et l’insatisfaction fonctionnent aussi.

Vous cherchez la taille de l’écart. Un critère dont le non-respect fait nettement bouger le taux de réouverture a mérité son poids. Un critère dont le non-respect ne fait rien bouger ne l’a pas mérité, et il doit soit descendre dans l’échelle, soit sortir complètement de la grille.

Deux réserves honnêtes. Il s’agit de corrélation, pas de causalité : servez-vous-en pour classer les critères, pas pour calculer des valeurs en points exactes. Et les critères très rarement non respectés ne produisent pas de signal lisible, ce qui indique en général qu’ils relèvent du critère éliminatoire plutôt que de la partie pondérée.

Conseil

Utilisez le taux de réouverture comme variable de résultat. Il est objectif, il est déjà dans votre helpdesk et, contrairement à la satisfaction, il ne dépend pas de la réponse de quelqu’un à une enquête.

Un critère éliminatoire est un verrou, pas un poids élevé

Voici l’erreur de conception de grille la plus fréquente. Une équipe décide qu’un manquement à la protection des données client (en anglais) est inacceptable, et lui attribue donc 60 des 100 points disponibles.

Cela n’a pas l’effet qu’elle croit. Un conseiller peut enfreindre la protection des données et finir quand même à 40 et, si le reste de la grille est généreux, terminer le mois avec une moyenne respectable. Le comportement que l’équipe jugeait inacceptable reste, arithmétiquement, rattrapable.

Si un comportement doit invalider l’interaction, il lui faut un verrou binaire qui ramène la note à zéro, placé entièrement en dehors de la partie pondérée. C’est le rôle d’un critère éliminatoire. Trois règles le gardent utilisable :

  • Peu nombreux. Trois à cinq. Une grille avec une douzaine de critères éliminatoires est une grille où tout est critique, et donc rien.
  • Sans ambiguïté. Deux évaluateurs qui ne se sont jamais parlé doivent pouvoir y répondre par oui ou par non. « A été impoli » ne passe pas ce test. « A communiqué des informations de compte sans terminer la vérification d’identité » le passe.
  • Un second évaluateur obligatoire. Ramener la note de quelqu’un à zéro est un acte sérieux, et cela doit coûter quelque chose au programme.

Une fois les critères éliminatoires sortis, la partie pondérée devient plus facile à analyser, car tout ce qui y reste est une question de degré et non de nature.

Attention

Attribuer 60 points sur 100 à un critère critique n’en fait pas un critère éliminatoire. Le conseiller peut ne pas le respecter et obtenir quand même 40, puis, avec une grille généreuse, terminer le mois correctement. Si un comportement doit invalider l’interaction, verrouillez-le. Ne lui donnez pas un prix.

La grille bimodale, et pourquoi les conseillers n’y croient plus

Il existe un état d’échec précis qui mérite d’être nommé, parce qu’il est courant et qu’il détruit la confiance. Il apparaît quand une grille combine une longue liste de critères éliminatoires avec de lourdes déductions sur tout le reste. Les conseillers décrivent le résultat toujours de la même façon : chaque item est soit un zéro immédiat, soit coûte seize points, donc en pratique les seules issues sont une note parfaite ou un désastre.

Regardez votre distribution. Si les notes se concentrent en haut et en bas avec très peu de choses entre les deux, la grille a cessé de mesurer et s’est mise à trier. Deux conséquences suivent. Des objectifs comme 95 % deviennent arithmétiquement inaccessibles pour quiconque prend une conversation difficile, si bien que les personnes qui traitent vos pires tickets obtiennent les pires notes. Et comme il n’y a pas de milieu, il n’y a rien vers quoi coacher, seulement une réussite ou une sanction.

La solution est presque toujours la même : moins de critères éliminatoires, et des déductions plus faibles sur les critères qui restent.

Comment tester de nouveaux poids avant de les déployer

Ne publiez jamais une grille repondérée directement en production. Testez-la d’abord sur l’historique : cela prend un après-midi et évite l’essentiel des dégâts.

Prenez un échantillon de conversations déjà évaluées avec les anciens poids. Recalculez leurs notes avec les nouveaux. Ne les réévaluez pas : vous testez de l’arithmétique, pas du jugement. Comparez ensuite la distribution.

Trois lectures possibles, et chacune vous apprend quelque chose de précis.

  • Presque personne ne change de tranche. La repondération est cosmétique. Vous avez dépensé du capital politique pour un changement qui ne change rien, et vous devez soit aller plus loin, soit laisser tel quel.
  • Presque tout le monde change de tranche. Vous n’avez pas ajusté des poids, vous avez changé le standard. C’est peut-être justifié, mais cela doit être annoncé comme un nouveau standard et non glissé comme un simple réglage, sinon vous perdrez l’adhésion des équipes.
  • Certains changent, et ce sont les mauvaises personnes. C’est le cas utile. Si des conseillers respectés par votre équipe chutent nettement, les nouveaux poids traduisent une idée de la qualité que vous ne partagez pas vraiment. Trouvez le critère qui en est la cause avant d’aller plus loin.

Organisez ensuite une session de calibrage (en anglais) sur les nouveaux poids avec l’ensemble des évaluateurs avant toute publication. Les poids changent ce sur quoi les évaluateurs débattent, et vous voulez que ce débat ait lieu en salle plutôt que pendant l’entretien individuel d’un conseiller. Si vous partez d’une base standard, les modèles de grille d’évaluation QA (en anglais) sont un point de départ raisonnable à repondérer plutôt que de commencer sur une page blanche.

La pondération quand une IA évalue

L’évaluation automatisée ne change pas les principes ci-dessus. Elle change l’enjeu d’une erreur, de deux façons précises.

Les erreurs ne sont plus ponctuelles, elles deviennent systématiques. En évaluation manuelle sur l’échantillon de 3 % que pratiquent la plupart des programmes, un critère mal pondéré fausse une poignée de conversations par mois, et un bon évaluateur compense discrètement. Avec une couverture à 100 % (en anglais), qui révèle des tendances qu’un échantillon de 3 % ne pourrait jamais montrer, ce même mauvais poids s’applique à chaque conversation, de façon constante et dans le même sens. La constance est tout l’intérêt de l’automatisation, et c’est précisément ce qui fait qu’une erreur de pondération s’accumule.

Un poids ne se défend pas mieux que son explication. Un conseiller à qui l’on dit qu’il a perdu 30 points demandera lesquels, et pourquoi. Si le système ne sait produire qu’un total, les poids ne survivront pas au contact du terrain, quel que soit le soin mis à les fixer. Chaque déduction doit nommer le critère, citer le moment de la conversation qui l’a déclenchée et pouvoir être contestée. C’est la différence entre une note et un verdict, développée dans comment valider une évaluation QA par IA (en anglais).

Deux ajustements pratiques pour l’évaluation automatisée :

  • Gardez des déductions grossières. Des multiples de cinq ou de dix. Des poids très fins supposent une précision que le modèle n’a pas, et invitent à débattre de la différence entre un manquement à sept points et un manquement à huit.
  • Pondérez ce qu’un modèle lit de façon fiable. Les critères procéduraux et factuels sont évalués de façon constante. Les appréciations sur le ton varient davantage : donnez-leur une part plus faible du total tant que vous n’avez pas mesuré la fiabilité de l’évaluation qualité par IA sur ces critères.

L’Auto QA de Kaizo applique critère par critère les poids de votre propre grille et laisse le raisonnement attaché à la conversation. Une déduction contestée peut ainsi être rattachée à l’échange précis qui l’a provoquée, au lieu d’être débattue de mémoire.

Quand repondérer, et quand ne pas y toucher

Repondérez selon un calendrier, pas sur une plainte. Une fois par trimestre, en lien avec un cycle de calibrage qualité, est le rythme que la plupart des équipes peuvent tenir. Entre deux échéances, collectez les plaintes plutôt que de réagir à chacune.

Quatre signaux qu’un poids est vraiment périmé :

  • Un critère est respecté plus d’environ 95 % du temps pendant deux trimestres consécutifs. Il ne distingue plus les conseillers. Soit le comportement est désormais universel, et dans ce cas fêtez-le et retirez le critère, soit le critère est trop facile à satisfaire.
  • Un changement de politique ou de produit a déplacé ce qui compte. Une nouvelle réglementation, une nouvelle politique de remboursement, un nouveau canal.
  • La note ne suit plus les résultats. Refaites l’analyse décrite plus haut dans ce guide. Si les écarts se sont aplatis, les poids sont dépassés.
  • Les évaluateurs corrigent sans cesse le même critère. Quand des personnes compensent discrètement un poids, elles vous disent qu’il est faux.

Une règle compte plus que toutes les autres : versionnez la grille, et n’appliquez jamais de nouveaux poids rétroactivement aux notes passées. La note de mars d’un conseiller a été produite selon les règles de mars. La recalculer en juillet détruit la seule chose dont dépend un programme de QA : que le chiffre ait eu un sens au moment où il a été donné. Gardez l’ancienne version intacte, démarrez la nouvelle à une date nette, et dites-le clairement. C’est aussi ce qui garde votre score de qualité interne comparable dans le temps au lieu de le laisser dériver sans bruit.

Questions fréquentes

Combien de critères une grille d’évaluation QA doit-elle compter ?

Huit à quinze pour la plupart des équipes support. En dessous de huit, la note est trop grossière pour guider le coaching. Au-delà de quinze, les évaluateurs ne peuvent plus garder toute la grille en tête, leur accord diminue, et les évaluations prennent assez de temps pour que la couverture en souffre. Si vous avez besoin de plus de quinze critères, il vous faut sans doute deux grilles pour deux types de travail différents plutôt qu’une seule très longue.

Chaque critère doit-il avoir le même poids ?

Non. Une pondération égale affirme que chaque comportement compte autant, ce qui n’est jamais vrai, et elle produit des notes incapables de distinguer un manquement grave d’un manquement cosmétique. Une pondération uniforme est un point de départ raisonnable pour un programme tout neuf sans données de résultats, mais elle doit être remplacée dès que vous pouvez classer les critères selon leur effet sur les réouvertures, les escalades ou l’insatisfaction.

Quelle différence entre un poids et un critère éliminatoire ?

Un poids dit combien coûte un manquement. Un critère éliminatoire dit que la conversation est invalidée, quel que soit le reste. Ce sont deux mécanismes différents qui ne doivent pas se substituer l’un à l’autre. Attribuer 60 points sur 100 à un critère critique est l’erreur de conception la plus fréquente, car un conseiller peut ne pas le respecter et obtenir quand même 40. Si un comportement doit invalider l’interaction, verrouillez-le au lieu de le pondérer.

Comment fixer des poids quand je n’ai encore aucune donnée ?

Classez les critères selon l’impact client et le risque avec vos évaluateurs, regroupez-les en trois tranches, haute, moyenne et basse, et attribuez des valeurs en points grossières aux tranches plutôt qu’aux critères pris un par un. Engagez-vous ensuite à revoir le tout après un trimestre, quand vous aurez assez de conversations évaluées pour comparer les taux d’échec aux réouvertures. Grossier et révisable vaut mieux que précis et inventé.

À quelle fréquence faut-il modifier la pondération d’une grille QA ?

Une fois par trimestre au maximum, en lien avec un cycle de calibrage. Des poids qui bougent plus souvent cessent d’être un standard et deviennent une cible mouvante, et les conseillers ne savent plus à quoi ressemble un bon travail. Versionnez toujours la grille quand les poids changent, et ne recalculez jamais les notes passées avec les nouveaux poids.

Termes associés

Vos propres poids derrière chaque conversation évaluée

Venez avec la grille que vous utilisez aujourd’hui et un mois de conversations déjà évaluées. Nous vous montrerons ce que vos poids actuels récompensent réellement, et ce qui change quand chaque conversation est évaluée de la même façon.

Réserver une démo Découvrir Agentic Auto QA

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart