Cuando un criterio depende de un sistema que falló, de un cliente que se fue o de un equipo que nunca respondió, los agentes pierden puntos por algo que no podían controlar. Corrija la scorecard excluyendo el criterio, marcándolo como no aplicable o derivando el hallazgo a su responsable.
En resumen
- Los agentes detectan en un mes, más o menos, un criterio en el que no pueden influir.
- La opción «no aplicable» debe existir en todos los criterios y reducir el denominador.
- Los fallos concentrados en una cola, una franja horaria o una versión apuntan a un problema del sistema.
- Un proceso roto debe cambiar el proceso, no la nota del agente.
Por qué un solo criterio incontrolable desacredita toda la nota
Hay cuatro situaciones que aparecen una y otra vez cuando los agentes de atención al cliente describen una nota que consideran injusta, y ninguna de ellas es en realidad una discusión sobre criterio.
- Un fallo del sistema hizo que un paso que el agente completó nunca quedara registrado, así que el revisor no pudo verlo y lo evaluó como ausente.
- El cliente se desconectó antes de la secuencia de cierre, y todos los criterios de cierre devolvieron un cero automático.
- Un escalamiento se envió a un supervisor que nunca respondió, y el agente perdió los puntos de resolución y de seguimiento.
- A un cliente se le oía mal, una dirección de correo electrónico volvió mal escrita y un criterio de exactitud de datos lo registró como un fallo de privacidad.
Tome en serio la aritmética del segundo caso, porque es el más claro. Si su sección de cierre tiene cuatro criterios y una desconexión pone a cero tres de ellos, es el comportamiento del cliente, no el del agente, el que decide en qué banda queda ese agente. A los agentes que atienden a los clientes más enfadados son a los que más les cuelgan, así que las personas que gestionan su trabajo más difícil son las que peor nota sacan.
De ahí se siguen dos cosas, en este orden. Primero, la nota deja de transmitir información. Si un revisor no puede decirle si un 72 significa un mal trabajo o una mala tarde con las herramientas, nadie más adelante podrá usar esa cifra para tomar una decisión. Segundo, y más caro, la nota pierde su autoridad ante las personas a las que debería ayudar. En cuanto un agente cree que la cifra es en parte arbitraria, todo el coaching asociado a ella llega ya descontado. Ya no está haciendo coaching, está negociando, y ha perdido las condiciones para llevar un programa de QA en el que los agentes confíen. Deming planteó el caso general con más contundencia que cualquier guía de QA: un mal sistema vencerá siempre a una buena persona, y medir con más dureza a la persona no cambia cuál de los dos está perdiendo.
No es un fallo del equipo de QA. Los revisores trabajan dentro del mismo formulario que todos los demás, y la mayoría de los formularios les dan dos opciones ante un criterio que era imposible cumplir: suspenderlo, o aprobarlo en silencio y esperar que nadie lo audite. Ambas son incorrectas, y no hay una tercera opción a mano. Es un problema de diseño, que se corrige en la rúbrica y no en la discusión sobre la rúbrica.
Cómo encontrar los criterios que dependen de factores externos en su scorecard
Tome su scorecard de QA actual y recórrala línea por línea. Para cada criterio, hágase tres preguntas en este orden.
- ¿Podía el agente cumplirlo con las herramientas, los permisos y la información que tenía en ese momento? No con las herramientas que debería haber tenido. Con las que tenía realmente delante.
- ¿Cumplirlo exige que otra persona actúe antes? Otro equipo, un cliente, un proceso por lotes, una aprobación.
- ¿Podría un buen agente cumplirlo siempre, solo con proponérselo? Si la respuesta honesta es no, el criterio mide las circunstancias además de la habilidad.
Clasifique cada criterio en uno de tres grupos sobre la marcha. Totalmente controlable, donde deberían estar la mayoría de sus criterios de habilidades blandas y de proceso. Condicionalmente controlable, es decir, el agente lo controla solo cuando se cumple una condición previa. No controlable, es decir, cumplirlo depende de algo sobre lo que el agente no tiene ninguna influencia.
El segundo grupo es donde está el trabajo. Para cada criterio condicionalmente controlable, escriba la condición previa en una frase sencilla: el cliente siguió en la línea, la herramienta de reembolsos funcionaba, el equipo de segundo nivel respondió dentro de su nivel de servicio, la grabación captó la llamada completa. Esas frases se convierten en los disparadores de «no aplicable» que necesitará más adelante, y escribirlas es lo que convierte una vaga sensación de injusticia en una regla que un revisor puede aplicar dos veces de la misma manera.
Hágalo con agentes en la sala
Haga esta revisión con dos revisores y dos agentes sénior juntos, no como un ejercicio solo del equipo de QA. Los agentes encontrarán los criterios que dependen de factores externos en una fracción del tiempo, porque llevan meses perdiendo puntos por ellos y pueden nombrar el ticket exacto. También cambia lo que transmite el ejercicio: está pidiendo al equipo que ayude a corregir el formulario en lugar de anunciarle una corrección. Reserve dos horas para una scorecard de quince criterios y cuente con encontrar entre dos y cinco líneas problemáticas.
Las tres categorías de fallos incontrolables
Casi todo lo que encuentre encajará en una de tres categorías, y la categoría le dice qué hacer. La distinción que importa es quién podría haber evitado el fallo, porque es también quien debería recibir el hallazgo.
| Categoría | Cómo se manifiesta | Criterios afectados habitualmente | Tratamiento por defecto |
|---|---|---|---|
| Sistemas y herramientas | Una caída o una herramienta lenta, un paso completado que nunca se escribió en el registro, una grabación o una transcripción que se corta, un campo que no se guardó | Cumplimiento del proceso, documentación, pasos de verificación, tiempo en espera y TMO | No aplicable para esa conversación, y un defecto abierto contra el sistema |
| Comportamiento del cliente | El cliente se desconecta antes del cierre, rechaza la verificación, no se queda para el resumen, interrumpe al agente todo el tiempo, llega ya furioso | Secuencia de cierre, verificación de identidad, criterios ligados a la satisfacción, criterios de tono y de interrupción | Excluir el criterio, o hacerlo condicional a que el cliente se haya quedado y haya participado |
| Equipos previos y adyacentes | Un escalamiento que nadie responde, un retraso acumulado en segundo nivel, una política que prohíbe la resolución que el cliente necesita, un artículo de la base de conocimiento erróneo o inexistente, una macro con una redacción desactualizada | Resolución, resolución en el primer contacto, exactitud, cumplimiento de lo prometido | Evaluar al agente solo por lo que hizo con lo que tenía, y derivar el hallazgo al equipo responsable |
Excluir, marcar como no aplicable o derivar
Tres soluciones, y elegir la equivocada es lo que hace fracasar estas correcciones. La prueba no es lo grave que fue el fallo, sino con qué frecuencia el criterio es imposible y quién es responsable de la causa.
Excluya el criterio cuando no supera la prueba de control la mayoría de las veces. Si un criterio depende de una herramienta poco fiable, o de que el cliente se comporte de una forma concreta, no es un estándar, es lanzar una moneda con puntos en juego. Una regla práctica útil: si nunca haría coaching a alguien sobre ese criterio, no lo evalúe por él.
Márquelo como no aplicable cuando el criterio es normalmente controlable pero fue de verdad imposible en esa conversación concreta. Es el caso habitual, y necesita dos cosas: un disparador con nombre, tomado de las condiciones previas que escribió antes, y evidencia en el registro de que el disparador se produjo. La marca de tiempo de una desconexión antes de la secuencia de cierre es evidencia. La impresión de un revisor no lo es.
Derive el hallazgo cuando el fallo es real, importa al cliente y tiene un responsable. El cliente no recibió su reembolso, lo cual es un auténtico fallo de calidad que conviene conocer, pero la causa fue una política que el agente no puede saltarse. El hallazgo sale del QA como un defecto de proceso con un responsable y una fecha. La nota del agente no se mueve.
Hay una cuarta opción a la que recurren los equipos y que conviene rechazar: suspender el criterio y añadir un comentario diciendo que no fue culpa del agente. El comentario no cambia la cifra, y la cifra es lo que llega a la revisión mensual, al ranking y a la conversación sobre el desempeño. La compasión en un cuadro de texto libre no es un control, y deja al agente sin más recurso que impugnar la nota.
Dé autoridad a los revisores y luego audítela
Los revisores deberían poder aplicar «no aplicable» sin pedir permiso. Los equipos que lo convierten en un escalamiento eliminan la opción en la práctica, porque un revisor con cuarenta evaluaciones pendientes no va a abrir un ticket para saltarse una línea. Contrólelo después: reporte el uso de «no aplicable» por revisor y por criterio, y lleve los casos atípicos a la agenda de su próxima sesión de calibración. Es una conversación mucho mejor que la que provocan los suspensos forzados.
Por qué «no aplicable» tiene que ser una opción de primera clase en todos los criterios
«No aplicable» solo funciona si la aritmética funciona. La nota tiene que ser los puntos obtenidos divididos entre los puntos aplicables, no entre el formulario completo. Si se aplicaban once de quince criterios y el agente cumplió ocho, la nota es ocho de once. Si su formulario deja los quince en el denominador, marcar una línea como no aplicable cuesta exactamente lo mismo que suspenderla, los revisores lo notan en una semana y la opción deja de usarse. Muchos equipos ya evalúan solo sobre las preguntas aplicables. Otros tienen una casilla de «no aplicable» que no hace nada, lo cual es peor que no tenerla, porque parece una solución.
Piense en lo que ocurre en un formulario sin una opción de «no aplicable» que funcione. Los revisores estrictos suspenden el criterio imposible, los generosos lo aprueban, y ambos adivinan una regla que nunca se escribió. Ha fabricado un desacuerdo entre revisores que ninguna calibración resolverá, porque es estructural y no de percepción: dos revisores pueden estar completamente de acuerdo sobre lo que ocurrió y aun así producir notas distintas. Los agentes viven entonces su nota como una función de quién los evaluó, que es la forma más rápida de que un programa de QA pierda credibilidad.
El daño en los datos dura más. Un criterio aprobado cuando nunca se puso a prueba infla su tasa de aprobación. Un criterio suspendido cuando era imposible fabrica un defecto que nunca ocurrió. En ambos casos las estadísticas de ese criterio quedan inservibles, y son justamente las que necesita para ponderar la scorecard con sensatez y para detectar los problemas del sistema de la sección siguiente.
Cuatro requisitos, y todos baratos:
- Disponible en todos los criterios, no en unos pocos elegidos. El que no habilitó es el que fallará.
- Un código de motivo de una lista corta, cinco o seis opciones, para que el uso se pueda contar. El texto libre no se puede contar.
- Visible para el agente en la evaluación, para que vea que el revisor se dio cuenta. La mitad del resentimiento en todo este tema viene de agentes que suponen que nadie lo hizo.
- Reportado cada mes por criterio y por motivo.
Un umbral que vale la pena adoptar. Si un criterio vuelve como no aplicable en más de aproximadamente un tercio de las conversaciones, no pertenece a esa scorecard. Pertenece a una específica de un canal o de una cola, porque le está pidiendo a un solo formulario que evalúe dos tipos de trabajo distintos.
Cómo detectar el problema en sus datos antes de que un agente se lo diga
Las quejas son un indicador tardío, y llegan de sus agentes más seguros de sí mismos, no de los más afectados. Los datos llegan antes, y el método se puede hacer en una hoja de cálculo.
Para cada criterio, tome su tasa de fallo del último trimestre y desglósela por hora del día, cola o skill, canal, tramo de antigüedad del agente, y frente a las fechas de las versiones y de los cambios de política. La habilidad de los agentes se reparte de forma bastante uniforme entre esos grupos. Los problemas del sistema no, y esa asimetría es todo el diagnóstico. Un criterio que falla el 6% de las veces en total pero el 35% en una cola entre las dos y las cinco de la tarde no le está hablando de coaching.
Cuatro patrones y lo que suele significar cada uno:
- Concentrado en una franja horaria. Falta de personal, presión en la cola o un proceso por lotes que bloquea un sistema cada tarde. Compruebe qué más ocurre a esa hora antes de escribir una nota de coaching.
- Concentrado en una cola, skill o canal. Una herramienta que solo usa ese grupo, una regla de enrutamiento o una scorecard que no encaja con el trabajo de ese grupo.
- Un salto en una fecha. Una versión, un cambio de política o un cambio en la propia scorecard. Un criterio que iba bien en marzo y falla constantemente desde abril no se volvió más difícil porque sus agentes empeoraran.
- Repartido por igual entre todos, incluidos sus mejores agentes. El criterio es ambiguo o imposible. Si su decil superior lo suspende más o menos tan a menudo como su decil inferior, no está midiendo habilidad.
Este método esconde un problema de muestreo, y conviene nombrarlo. Con la muestra del 3% que usan la mayoría de los programas, no se puede aplicar. Desglose un criterio por cola y por hora y la mayoría de las celdas quedan vacías, así que el patrón que habría exculpado al agente es invisible y la anécdota gana la discusión. Este es el argumento práctico para evaluarlo todo: la cobertura del 100% revela tendencias que un muestreo del 3% nunca podría mostrar. La cuestión no es que se vea más, sino que desaparece el sesgo de selección, de modo que un fallo concentrado se puede reconocer como concentrado.
El Auto QA de Kaizo evalúa todas las conversaciones según su propia scorecard y mantiene la evidencia adjunta criterio por criterio, así que puede filtrar los fallos de un criterio por cola y por hora y ver si se concentran antes de hacer coaching a nadie por ellos. Esa trazabilidad importa más que la cobertura: la pregunta útil no es cuántas conversaciones se evaluaron, sino si puede mostrar por qué un criterio concreto falló en una conversación concreta. Más sobre el lado de la cobertura en qué significa realmente la cobertura total de QA.
Envíe el hallazgo a su responsable, no a la nota del agente
Todo lo anterior apunta a un principio. Un hallazgo que se remonta a un proceso roto debe actualizar el proceso, no la nota de la persona. El QA lee más de lo que realmente les ocurre a los clientes que cualquier otra función, lo que lo convierte en el mejor sistema de detección de defectos que tienen la mayoría de las organizaciones de atención al cliente. Gastar esa señal en restar puntos a individuos es desperdiciarla.
La mecánica es corriente, y justamente de eso se trata:
- Etiquete al responsable durante la evaluación. Producto, workforce management, segundo nivel, base de conocimiento, políticas. Hacerlo durante la evaluación lleva segundos. Reconstruirlo en una retrospectiva mensual lleva una tarde y se acaba saltando.
- Dé al hallazgo los campos de un defecto. Qué falló, con qué frecuencia, en qué colas, cuánto cuesta en reaperturas o en TMO. Un hallazgo de proceso con una cifra se corrige. Una queja no. Es el análisis de causa raíz de siempre, aplicado a la propia scorecard en lugar de al ticket.
- Suspenda el criterio mientras el defecto siga abierto, y dígalo en voz alta al equipo. Este es el paso que recupera la credibilidad, porque demuestra que la scorecard responde a la evidencia.
- Reporte las correcciones junto a las notas. Criterios suspendidos, defectos abiertos, defectos cerrados. Cambia la idea de para qué sirve el QA, y le da a su equipo una segunda serie de cifras que no es la nota media.
Lo que queda tras este trabajo es la parte que el agente controla de verdad, que es la única que merece una reunión individual. El coaching deja de empezar con una discusión sobre si la nota era justa, y convertir los datos de QA en coaching resulta más fácil porque todos los hallazgos son cosas que una persona puede cambiar. El AI Coaching de Kaizo construye sus tarjetas de coaching a partir de los criterios evaluados, así que los criterios que excluye o condiciona dejan de generar ruido en el coaching además de dejar de restar puntos.
Dos reglas de orden para terminar. Cree una nueva versión de la scorecard cada vez que elimine o condicione un criterio, y nunca vuelva a calcular notas antiguas con reglas nuevas, porque una nota de marzo se produjo con el formulario de marzo. Y anuncie cada cambio antes de que entre en vigor, con el motivo. Una scorecard que se corrige de forma visible se percibe de un modo muy distinto a una que aparece en silencio en una nueva versión cada trimestre.
Preguntas frecuentes
¿Se debe evaluar a los agentes por cosas que no pueden controlar?
No. Un criterio en el que el agente no puede influir mide las circunstancias y no el desempeño, y vuelve la nota total inservible para el coaching o para el ranking. Puede que el fallo merezca registrarse igualmente, pero debe registrarse contra el sistema, la situación del cliente o el equipo que lo causó. Clasifique cada criterio como totalmente controlable, condicionalmente controlable o no controlable, y luego excluya, marque como no aplicable o derive según corresponda.
¿Qué hacer cuando un agente suspende el QA por un motivo que no fue culpa suya?
No lo corrija con una nota en los comentarios, porque el comentario no cambia la cifra que llega a su evaluación. Si el criterio era imposible en esa conversación concreta, márquelo como no aplicable para que salga del denominador. Si el criterio es imposible con regularidad, elimínelo de la scorecard. Si el fallo fue real pero lo causó otro equipo, conserve el hallazgo, asígnele un responsable y deje intacta la nota del agente.
¿Cómo se gestiona una llamada en la que el cliente colgó antes del guion de cierre?
Active el estado «no aplicable» en todos los criterios de cierre, con la marca de tiempo de la desconexión como evidencia, en lugar de dejar que devuelvan ceros automáticos. Evalúe las partes de la conversación que sí ocurrieron. Una desconexión que pone a cero tres o cuatro criterios de cierre puede mover a un agente a otra banda de desempeño solo por el comportamiento del cliente, y afecta sobre todo a los agentes que atienden a los clientes más difíciles.
¿Debe una scorecard de QA tener la opción «no aplicable»?
Sí, en todos los criterios, y debe sacar ese criterio del denominador para que la nota sea puntos obtenidos sobre puntos aplicables. Una opción «no aplicable» que deja el total intacto equivale aritméticamente a un suspenso, y los revisores dejan de usarla. Exija un código de motivo de una lista corta, muestre el estado al agente en la evaluación y reporte el uso por revisor y por criterio para que la calibración pueda auditarlo.
¿Cómo se distingue un problema del sistema de un problema del agente en los datos de QA?
Desglose la tasa de fallo de cada criterio por hora del día, cola, canal, antigüedad y fecha de versión. La habilidad se reparte de forma bastante uniforme entre esos grupos, así que un criterio que falla mucho más en una cola, en una franja horaria o a partir de una fecha de versión es casi siempre un problema del sistema o del proceso. Un criterio que suspenden en proporciones parecidas sus mejores y sus peores agentes es ambiguo o imposible.
¿Cómo se usa el análisis de causa raíz en el control de calidad?
Pregúntese qué tendría que haber sido cierto para que el agente cumpliera, y siga esa cadena hasta llegar a algo que tenga un responsable. Si la cadena termina en una herramienta que no guardó un campo, un artículo de la base de conocimiento erróneo o un escalamiento que nadie respondió, el hallazgo pertenece a ese responsable como un defecto con una frecuencia y un coste, y el criterio de la scorecard debería suspenderse hasta que se corrija. Un hallazgo que se remonta a un proceso roto debe actualizar el proceso, no la nota de la persona.
Lecturas relacionadas
- Qué es una rúbrica de calidad en call center
- How to run a QA program agents trust
- Análisis de causa raíz en call center
- Calibración en call center: qué es y cómo hacerla
- How to turn QA data into coaching
Descubra qué criterios sus agentes no pueden cumplir en realidad
Traiga la scorecard que usa hoy y un trimestre de conversaciones evaluadas. Le mostraremos qué criterios fallan con patrones que siguen a sus colas y a sus fechas de versión, y no a sus agentes.