La ponderación de una scorecard de call center se define criterio por criterio a partir de tres factores: cuánto perjudica el fallo al cliente, cuánto riesgo supone para el negocio y en qué medida lo controla el agente. Si no puede explicar un peso, la nota no sobrevivirá a la primera disputa.
En resumen
- La ponderación igual afirma que todos los criterios importan lo mismo. Eso nunca es cierto.
- El control del agente es el factor que todos olvidan, y el que más molesta a los agentes.
- Convierta los criterios críticos en un error crítico que actúe como filtro, no en un ítem de 60 puntos.
- Pruebe los nuevos pesos con conversaciones ya evaluadas. Si nadie cambia de franja, el cambio fue cosmético.
Por qué la ponderación igual rompe una scorecard sin que nadie lo note
Casi todas las scorecards de QA empiezan con pesos iguales, porque parece justo y no exige pensar. No es ninguna de las dos cosas. La ponderación igual es una afirmación, y lo que afirma es que olvidar el saludo le cuesta al negocio exactamente lo mismo que tramitar mal un reembolso.
De ahí se derivan tres consecuencias, y llegan en este orden.
La nota deja de discriminar. Cuando diez criterios valen diez puntos cada uno, un fallo grave y uno cosmético cuestan diez. Dos agentes terminan en 90, uno porque fue cortante y otro porque le dio al cliente información errónea sobre su dinero. Un número que no distingue esos dos casos no mide calidad.
Los agentes optimizan los criterios baratos. Las personas responden al marcador que se les da. Si el tono y el saludo son los puntos más fáciles de proteger y los más difíciles de perder, ahí va el esfuerzo. No es hacer trampa: es la scorecard funcionando exactamente como se diseñó.
La nota se desconecta del negocio. En cuanto las notas de calidad dejan de seguir los escalamientos, las reaperturas y la insatisfacción del cliente, la dirección deja de usarlas sin decir nada. El programa sigue, las evaluaciones siguen y nadie toma una decisión con el resultado. Ese es el estado real en el que se encuentran la mayoría de los programas de QA.
Un diagnóstico rápido. Tome a sus dos agentes con mejor nota del mes pasado y a los dos con la peor. Si no puede explicar una diferencia real en la experiencia que dieron al cliente, sus pesos no transmiten ninguna información. Antes de tocar los pesos, asegúrese de que los criterios de base sean sólidos, un trabajo aparte que se explica en qué es una rúbrica de calidad y cómo construirla.
Recuerde
La ponderación igual no es la ausencia de una decisión. Es la decisión de que cada criterio importa lo mismo, tomada por defecto y nunca revisada.
Los tres modelos de ponderación y cuándo conviene cada uno
En la práctica solo se usan tres modelos. El error no es elegir el equivocado, sino elegir uno por accidente y no revisarlo nunca.
| Modelo | Cómo funciona | Adecuado cuando | Falla cuando |
|---|---|---|---|
| Plano | Cada criterio vale los mismos puntos | El programa es nuevo, tiene menos de unos diez criterios y de verdad aún no sabe qué importa | Tiene datos de resultados y aun así los ignora. El modelo plano debe ser un punto de partida, no un punto de llegada |
| Ponderado por impacto | Los criterios tienen valores distintos según su impacto en el cliente y en el negocio | El programa es lo bastante maduro para tener evidencia y los revisores pueden explicar cada peso | Los pesos los fija quien más alto habla en la reunión y luego nadie los revisa |
| Deducción desde un tope | Cada conversación empieza en 100 y pierde puntos por cada fallo, y la gravedad fija la deducción | La mayoría de las conversaciones están bien y usted busca excepciones, o el trabajo tiene mucho peso de cumplimiento normativo | No hay un mínimo, así que una sola mala conversación cae muy por debajo de cero y distorsiona el promedio de un agente |
Cómo definir la ponderación de la scorecard con evidencia y no con opiniones
Pondere según tres factores, en este orden. Nada de esto es exclusivo del QA de atención al cliente: el manual del gobierno británico sobre análisis multicriterio trabaja el mismo problema de puntuar opciones según criterios y después ponderar esos criterios, y su advertencia central es que los pesos llevan el juicio de valor, lo admita alguien o no.
Impacto en el cliente. ¿Cuánto peor es el día de este cliente porque el criterio falló? La información errónea sobre un reembolso pesa más que una despedida omitida, y la diferencia es enorme.
Riesgo de negocio y regulatorio. ¿Qué cuesta el fallo más allá de esta conversación? Todo lo que tiene consecuencias legales, financieras o de protección de datos va arriba del todo, y parte de ello ni siquiera debería estar en el bloque ponderado.
Control del agente. Este es el factor que todos se saltan, y es el que los agentes notan. Si un criterio depende de un sistema interno lento, de una política que el agente no puede flexibilizar o de un traspaso desde otro equipo, darle mucho peso castiga a las personas por los problemas de su proceso. O le da un peso bajo, o arregla el proceso y deja de evaluarlo.
Los pesos llevan el juicio de valor, lo admita alguien o no.
Paráfrasis del manual de análisis multicriterio del gobierno británico
La hora de análisis que hace la mayor parte del trabajo
Tome tres meses de conversaciones que ya haya evaluado. Para cada criterio, sepárelas en las que se cumplió y las que no, y compare un resultado posterior entre los dos grupos. La tasa de reapertura es la mejor opción individual porque es objetiva y ya está en su helpdesk. La tasa de escalamiento y la insatisfacción también sirven.
Lo que busca es el tamaño de la diferencia. Un criterio cuyo incumplimiento mueve la tasa de reapertura por un margen amplio se ha ganado su peso. Un criterio cuyo incumplimiento no mueve nada no se lo ha ganado, y debería bajar en la escala o salir por completo de la scorecard.
Dos advertencias honestas. Esto es correlación, no causalidad, así que úselo para ordenar los criterios, no para calcular valores exactos en puntos. Y los criterios que fallan muy pocas veces no producen una señal legible, lo que suele indicar que su lugar es el error crítico y no el bloque ponderado.
Consejo
Use la tasa de reapertura como variable de resultado. Es objetiva, ya está en su helpdesk y, a diferencia de la satisfacción, no depende de que alguien responda una encuesta.
El error crítico es un filtro, no un peso alto
Este es el error de diseño de scorecard más común. Un equipo decide que una infracción de la protección de datos del cliente (en inglés) es inaceptable y, por eso, le asigna 60 de los 100 puntos disponibles.
Eso no tiene el efecto que el equipo cree. Un agente puede infringir la protección de datos y aun así quedarse en 40 y, si el resto de la scorecard es generoso, terminar el mes con un promedio respetable. El comportamiento que el equipo calificó de inaceptable es, aritméticamente, superable.
Si un comportamiento debe anular la interacción, necesita un filtro binario que deje la nota en cero y que quede totalmente fuera del bloque ponderado. Para eso sirve un error crítico. Tres reglas lo mantienen útil:
- Pocos. De tres a cinco. Una scorecard con una docena de errores críticos es una scorecard en la que todo es crítico y, por lo tanto, nada lo es.
- Sin ambigüedad. Dos revisores que nunca han hablado entre sí deben poder responderlo con sí o no. «Fue grosero» no cumple esa condición. «Reveló datos de la cuenta sin completar la verificación de identidad» sí.
- Con un segundo revisor obligatorio. Dejar en cero la nota de alguien es un acto serio y debería costarle algo al programa.
Una vez separados los errores críticos, es más fácil razonar sobre el bloque ponderado, porque todo lo que queda en él es una cuestión de grado y no de naturaleza.
Atención
Dar a un criterio crítico 60 de 100 puntos no lo convierte en un error crítico. El agente puede incumplirlo, sacar 40 y, con una scorecard generosa, terminar el mes de forma aceptable. Si un comportamiento debe anular la interacción, póngale un filtro. No le ponga precio.
La scorecard bimodal y por qué los agentes dejan de creer en ella
Hay un estado de fallo concreto que vale la pena nombrar, porque es frecuente y destruye la confianza. Aparece cuando una scorecard combina una larga lista de errores críticos con deducciones fuertes en todo lo demás. Los agentes describen el resultado siempre igual: cada ítem es o un cero inmediato o cuesta dieciséis puntos, así que en la práctica solo hay dos resultados, una nota perfecta o un desastre.
Mire su distribución. Si las notas se concentran arriba y abajo con muy poco en medio, la scorecard ha dejado de medir y se ha puesto a clasificar. De ahí se siguen dos cosas. Objetivos como el 95% se vuelven aritméticamente inalcanzables para quien atiende una conversación difícil, de modo que las personas que llevan sus peores tickets obtienen las peores notas. Y como no hay término medio, no hay nada hacia lo que hacer coaching, solo un aprobado o un castigo.
La solución casi siempre es la misma: menos errores críticos y deducciones más pequeñas en los criterios que quedan.
Cómo probar los nuevos pesos antes de aplicarlos
Nunca publique una scorecard reponderada directamente en producción. Pruébela antes con datos históricos: lleva una tarde y evita la mayor parte del daño.
Tome una muestra de conversaciones ya evaluadas con los pesos anteriores. Recalcule sus notas con los nuevos. No las vuelva a revisar: está probando aritmética, no criterio. Después compare la distribución.
Hay tres lecturas posibles, y cada una le dice algo concreto.
- Casi nadie cambia de franja. La reponderación es cosmética. Ha gastado capital político en un cambio que no altera nada, y debería ir más lejos o dejarlo como está.
- Casi todos cambian de franja. No ha ajustado pesos, ha cambiado el estándar. Puede ser lo correcto, pero hay que anunciarlo como un estándar nuevo en lugar de colarlo como un ajuste, o perderá el apoyo del equipo.
- Algunos cambian, y son las personas equivocadas. Este es el caso útil. Si agentes a los que su equipo respeta caen de forma marcada, los nuevos pesos reflejan una idea de la calidad que usted en realidad no comparte. Encuentre el criterio que lo provoca antes de seguir.
Luego haga una sesión de calibración (en inglés) con los nuevos pesos y todo el grupo de revisores antes de publicar nada. Los pesos cambian aquello sobre lo que discuten los revisores, y usted quiere que esa discusión ocurra en una sala y no en la reunión individual de un agente. Si parte de una base estándar, las plantillas de scorecard de QA (en inglés) son una base razonable para reponderar en lugar de empezar desde cero.
La ponderación cuando la evaluación la hace una IA
La evaluación automatizada no cambia los principios anteriores. Cambia lo que está en juego si se aplican mal, de dos maneras concretas.
Los errores dejan de ser ocasionales y se vuelven sistemáticos. Con revisión manual sobre la muestra del 3% que aplican la mayoría de los programas, un criterio mal ponderado distorsiona un puñado de conversaciones al mes, y un buen revisor lo compensa sin decir nada. Con una cobertura del 100% (en inglés), que revela tendencias que una muestra del 3% nunca podría mostrar, ese mismo peso erróneo se aplica a cada conversación, de forma constante y en la misma dirección. La constancia es el sentido de la automatización, y es justo lo que hace que un error de ponderación se acumule.
Un peso solo es tan defendible como su explicación. Un agente al que se le dice que perdió 30 puntos preguntará cuáles y por qué. Si el sistema solo puede dar un total, los pesos no sobrevivirán al contacto con la operación, por mucho cuidado que haya puesto al fijarlos. Cada deducción debe nombrar el criterio, citar el momento de la conversación que la activó y poder disputarse. Esa es la diferencia entre una nota y un veredicto, y se trata con más detalle en cómo validar la evaluación de QA con IA (en inglés).
Dos ajustes prácticos para la evaluación automatizada:
- Mantenga deducciones gruesas. Múltiplos de cinco o de diez. Los pesos muy finos sugieren una precisión que el modelo no tiene e invitan a discutir la diferencia entre un fallo de siete puntos y uno de ocho.
- Pondere lo que un modelo lee de forma fiable. Los criterios de procedimiento y de hechos se evalúan de forma consistente. Los juicios sobre el tono tienen más variación, así que deles una parte menor del total hasta que haya medido la precisión del QA con IA en ellos.
El Auto QA de Kaizo aplica por criterio los pesos de su propia scorecard y deja el razonamiento vinculado a la conversación, de modo que una deducción disputada puede rastrearse hasta el intercambio concreto que la causó en lugar de discutirse de memoria.
Cuándo reponderar y cuándo no tocar nada
Repondere según un calendario, no a raíz de una queja. Una vez por trimestre, ligado a un ciclo de calibración de QA, es el ritmo que la mayoría de los equipos puede mantener. Entre un ciclo y otro, recoja las quejas en lugar de actuar ante cada una.
Cuatro señales de que un peso ha caducado de verdad:
- Un criterio se cumple más de alrededor del 95% de las veces durante dos trimestres seguidos. Ya no distingue entre agentes. O el comportamiento ya es universal, y entonces celébrelo y retírelo, o el criterio es demasiado fácil de cumplir.
- Un cambio de política o de producto movió lo que importa. Una nueva regulación, una nueva política de reembolsos, un nuevo canal.
- La nota dejó de seguir los resultados. Repita el análisis descrito antes en esta guía. Si las diferencias se han aplanado, los pesos están obsoletos.
- Los revisores corrigen una y otra vez el mismo criterio. Cuando las personas compensan un peso sin decirlo, le están diciendo que es incorrecto.
Una regla importa más que todas las demás: versione la scorecard y nunca aplique los nuevos pesos de forma retroactiva a las notas históricas. La nota de marzo de un agente se obtuvo con las reglas de marzo. Recalcularla en julio destruye lo único de lo que depende un programa de QA: que el número significara algo en el momento en que se dio. Mantenga intacta la versión anterior, empiece la nueva a partir de una fecha clara y dígalo abiertamente. Eso también mantiene su puntaje de calidad interno comparable en el tiempo en lugar de dejar que se desvíe sin que nadie lo note.
Preguntas frecuentes
¿Cuántos criterios debe tener una scorecard de QA?
Entre ocho y quince para la mayoría de los equipos de atención al cliente. Con menos de ocho, la nota es demasiado tosca para orientar el coaching. Con más de quince, los revisores no pueden tener toda la rúbrica en la cabeza, el acuerdo entre ellos baja y las evaluaciones tardan tanto que la cobertura se resiente. Si necesita más de quince, probablemente necesite dos scorecards para dos tipos de trabajo distintos y no una muy larga.
¿Todos los criterios deben tener el mismo peso?
No. La ponderación igual afirma que todos los comportamientos importan lo mismo, lo que nunca es cierto, y produce notas que no distinguen un fallo grave de uno cosmético. La ponderación plana es un punto de partida razonable para un programa completamente nuevo y sin datos de resultados, pero debe sustituirse en cuanto pueda ordenar los criterios por su efecto en las reaperturas, los escalamientos o la insatisfacción.
¿Qué diferencia hay entre un peso y un error crítico?
Un peso indica cuánto cuesta un fallo. Un error crítico indica que la conversación queda anulada, pase lo que pase con el resto. Son mecanismos distintos y no deben sustituirse entre sí. Dar a un criterio crítico 60 de 100 puntos es el error de diseño más común, porque un agente puede incumplirlo y aun así sacar 40. Si un comportamiento debe anular la interacción, póngale un filtro en lugar de ponderarlo.
¿Cómo defino los pesos si todavía no tengo datos?
Ordene los criterios por impacto en el cliente y riesgo junto con sus revisores, agrúpelos en tres franjas (alta, media y baja) y asigne valores en puntos gruesos a las franjas, no a cada criterio. Después comprométase a revisarlos al cabo de un trimestre, cuando tenga suficientes conversaciones evaluadas para comparar las tasas de fallo con las reaperturas. Grueso y revisable es mejor que preciso e inventado.
¿Con qué frecuencia debe cambiar la ponderación de una scorecard de QA?
Como máximo una vez por trimestre, ligado a un ciclo de calibración. Los pesos que cambian más a menudo dejan de ser un estándar y se convierten en un blanco móvil, y los agentes ya no saben cómo es un buen trabajo. Versione siempre la scorecard cuando cambien los pesos y nunca recalcule las notas históricas con los pesos nuevos.
Términos relacionados
- Qué es una rúbrica de calidad y cómo construirla
- Qué es un error crítico y cuándo usarlo
- Cómo hacer una sesión de calibración de QA (en inglés)
- Plantillas de scorecard de QA (en inglés)
- Cómo validar la evaluación de QA con IA (en inglés)
Sus propios pesos detrás de cada conversación evaluada
Traiga la scorecard que usa hoy y un mes de conversaciones que ya haya revisado. Le mostraremos qué están premiando realmente sus pesos actuales y qué cambia cuando cada conversación se evalúa de la misma manera.