Aller au contenu

Guide

Calibrage qualité : définition et méthode

Le calibrage qualité, c’est faire évaluer la même conversation par plusieurs évaluateurs et comparer les notes. Pourquoi il compte et comment le mener.

· 7 min de lecture

Relu par Dominik Blattner, fondateur de Kaizo

Sommaire

Le calibrage qualité (en anglais « QA calibration ») consiste à faire évaluer la même conversation par plusieurs évaluateurs, puis à comparer leurs notes, pour que tout le monde applique la grille d’évaluation de la même façon. Sans calibrage, deux personnes notent différemment le même ticket et les notes deviennent injustes. Le calibrage transforme ces désaccords en critères plus clairs, pour qu’une note reflète la conversation et non l’évaluateur qui l’a ouverte.

En bref

  • Le calibrage qualité, c’est plusieurs évaluateurs qui notent la même conversation chacun de leur côté, puis comparent et s’accordent sur la bonne note.
  • Le calibrage révèle les critères flous que les évaluateurs lisent différemment, ce qui signale qu’il faut les réécrire.
  • Une séance de calibrage suit quatre étapes : choisir un échantillon commun, l’évaluer à l’aveugle, comparer et discuter, puis mettre à jour la grille.
  • Les séances planifiées prennent du temps aux évaluateurs au détriment du coaching : leur fréquence est donc un arbitrage.
  • L’évaluation automatisée applique un même standard à chaque conversation, ce qui réduit le besoin de calibrage, mais les humains continuent de s’accorder sur ce qu’est un bon travail.

Ce que signifie le calibrage qualité dans une équipe support

Dans une équipe support, le calibrage qualité est la vérification régulière que chaque évaluateur note une conversation de la même façon, selon la même grille d’évaluation. Les évaluateurs notent seuls un échantillon commun, comparent leurs résultats et tranchent chaque désaccord par écrit, pour qu’un conseiller reçoive la même note et le même retour, quel que soit l’évaluateur.

Le mot vient de la métrologie : un instrument est calibré quand il affiche la même valeur qu’une référence connue. En contrôle qualité, les instruments sont vos évaluateurs, et la référence est la lecture convenue de chaque critère de votre grille d’évaluation. Le logiciel de calibrage qualité de Kaizo repose sur la même idée : même conversation, même note.

Pourquoi le calibrage qualité compte

Le calibrage qualité compte parce que les notes qualité n’ont de sens que si elles sont cohérentes. Quand un évaluateur juge une conversation conforme et qu’un autre juge la même conversation non conforme, les conseillers perdent confiance dans le programme. Le coaching devient alors un débat sur la note plutôt que sur le comportement, et les données deviennent inutilisables.

Le calibrage protège cette confiance. En vérifiant que les évaluateurs s’accordent sur les mêmes conversations, il garde la grille juste et défendable. Il fait aussi ressortir les critères trop subjectifs pour être notés de manière fiable, ce qui signale qu’il faut les réécrire en quelque chose d’observable. Avec le temps, le calibrage remplit trois fonctions concrètes :

  • Il rend visible la dérive des évaluateurs, au lieu de la laisser passer inaperçue.
  • Il intègre les cas limites aux critères écrits, pour que la décision ne vive pas dans la mémoire de quelqu’un.
  • Il forme les nouveaux évaluateurs à un standard convenu.

Comment se déroule une séance de calibrage

Une séance de calibrage se déroule en quatre étapes reproductibles : choisir un échantillon commun de conversations, faire évaluer chaque conversation par chaque évaluateur de façon indépendante selon la grille, comparer les notes côte à côte et discuter des écarts, puis reformuler tout critère qui a provoqué un désaccord. La modification de la grille est le vrai résultat de la séance.

Un cycle de calibrage type suit ces étapes :

1. Choisir un échantillon commun

Sélectionnez une ou plusieurs conversations que chaque évaluateur notera de façon indépendante, sans voir les résultats des autres.

2. Évaluer selon la grille

Chaque évaluateur note la conversation avec la même grille d’évaluation que celle que l’équipe utilise au quotidien.

3. Comparer et discuter

L’équipe dévoile les notes côte à côte, discute des points de divergence et s’accorde sur la bonne interprétation.

4. Mettre à jour la grille

Quand un critère a provoqué un désaccord, il est clarifié ou reformulé pour être noté de la même façon la fois suivante.

Pour la fréquence, les participants, le choix de l’échantillon et la mesure de l’accord entre évaluateurs, voir notre guide pour animer des séances de calibrage (en anglais).

Un exemple de calibrage pas à pas

Voici un exemple de calibrage, à titre d’illustration. Quatre évaluateurs notent la même conversation par chat selon une ligne de la grille intitulée « Le conseiller a fait preuve d’empathie », sur une échelle de 1 à 4. Ils donnent 2, 4, 3 et 4. L’écart est le constat : c’est le critère, et non les évaluateurs, qu’il faut corriger avant la prochaine séance.

Pendant la discussion, il apparaît que deux évaluateurs ont accordé le point pour une formule d’excuse, tandis que les deux autres cherchaient à savoir si le conseiller avait reconnu le problème précis du client. Aucune des deux lectures n’est fausse, mais la grille n’a jamais dit laquelle compte. L’équipe réécrit la ligne en quelque chose d’observable :

AvantAprès
Le conseiller a fait preuve d’empathie (1 à 4)Le conseiller a reformulé le problème précis du client avec ses propres mots avant de passer à la solution (oui ou non)

Le critère réécrit peut être vérifié dans la transcription, donc la prochaine séance devrait montrer moins d’écart sur ce point. C’est ce que laisse une séance de calibrage utile : une grille de critères qualité modifiée, et pas seulement une réunion.

Comment l’automatisation réduit le besoin de calibrage

L’automatisation réduit le besoin de calibrage parce que l’incohérence que corrige le calibrage est humaine : les évaluateurs ne sont pas d’accord entre eux, ni avec eux-mêmes au fil du temps. Quand les conversations sont évaluées automatiquement, un même modèle applique le même standard à chaque conversation. La dérive d’un évaluateur à l’autre disparaît en grande partie, et le calibrage se recentre sur la définition du standard lui-même.

Kaizo évalue automatiquement 100 % des conversations selon votre grille, chaque note étant reliée aux éléments de preuve dans la transcription, si bien que les résultats restent cohérents sans séances de calibrage récurrentes. AutoPilot, l’évaluation automatisée de Kaizo, interprète la grille de façon identique à chaque fois et n’a donc pas besoin d’être calibré ; le calibrage concerne les évaluateurs humains qui travaillent à ses côtés. Chez UiPath, Kaizo a automatisé 100 % de la QA avec un ROI de 200 %, et la note d’une conversation ne dépend plus de l’évaluateur qui l’a ouverte. Chez GAMING1, l’équipe a utilisé Kaizo pour évaluer les conversations de façon cohérente et suivre le taux d’évaluation de la qualité comme un indicateur à part entière ; ce taux est passé de 78 % à 82 % entre 2021 et 2022.

Voyez-le sur vos propres conversations. Kaizo évalue 100 % de vos conversations support et transforme les résultats en coaching. Réserver une démo.

Le calibrage garde sa place pour définir ce qu’est un bon travail, mais il cesse d’être une ponction permanente sur le temps des évaluateurs. Avant de vous fier aux notes automatisées, comparez-les avec celles de vos évaluateurs calibrés sur le même échantillon, comme l’expliquent nos guides sur le shadow scoring (en anglais) et sur la constitution d’un golden set (en anglais).

Quand les séances de calibrage ne sont pas pour vous

Les séances de calibrage ne sont pas pour vous si une seule personne évalue les conversations, puisqu’il n’y a personne avec qui être en désaccord, ou si vous n’avez pas encore de grille écrite. Dans ces cas, rédigez et testez d’abord la grille. Le calibrage aligne des personnes sur un standard ; il ne peut pas en créer un à partir de rien.

Il en va de même pour l’évaluation automatisée. Si votre équipe ne traite qu’une poignée de conversations par semaine et qu’un seul responsable les lit toutes, un tableur et une grille claire suffisent, et un outil de contrôle qualité automatisé comme Kaizo dépasse probablement vos besoins.

Questions fréquentes

Quelle différence entre calibrage et évaluation qualité ?

L’évaluation qualité consiste à noter une conversation selon votre grille. Le calibrage est la vérification de second niveau qui garantit que différents évaluateurs donnent la même note à la même conversation, pour que l’évaluation elle-même soit fiable.

À quelle fréquence faut-il calibrer ?

La plupart des équipes en contrôle qualité manuel organisent des séances de calibrage chaque semaine ou chaque mois, ainsi qu’à chaque changement de grille ou arrivée d’un nouvel évaluateur. La fréquence est un arbitrage : plus de séances, c’est plus de cohérence, mais moins de temps pour le coaching.

Le contrôle qualité automatisé a-t-il encore besoin de calibrage ?

Beaucoup moins. L’évaluation automatisée applique un standard cohérent à chaque conversation, ce qui fait disparaître la dérive d’un évaluateur à l’autre. Le calibrage reste utile pour s’accorder sur ce qu’est un bon travail lorsque vous concevez ou révisez la grille.

Qu’est-ce qui explique un faible accord en calibrage ?

En général, des critères de grille flous ou subjectifs. Si une règle ne peut pas être rattachée à quelque chose d’observable dans la transcription, les évaluateurs l’interpréteront différemment, ce qui signale qu’il faut la réécrire en un critère clair, fondé sur des éléments de preuve.

Qui doit participer au calibrage ?

Toutes les personnes qui évaluent des conversations, y compris les responsables d’équipe qui évaluent leurs propres conseillers. Les nouveaux évaluateurs en profitent le plus, car le calibrage les forme au standard sur lequel le reste de l’équipe s’est déjà accordé.

Que doit produire une séance de calibrage ?

Une séance de calibrage doit produire une modification écrite : un critère reformulé, un cas limite clarifié ou un exemple ajouté dans la grille. Si rien ne change dans la grille, le même désaccord reviendra à la séance suivante.

Termes associés

Sommaire

Voyez-le sur vos propres conversations

Nous évaluons un échantillon de vos vrais tickets selon vos propres critères : l’exemple, c’est le vôtre.

Adopté par des équipes support du monde entier

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart