Saltar al contenido

Métricas

Nota de calidad vs CSAT: ¿cuál tiene razón?

Nota de calidad vs CSAT: notas de QA altas con clientes insatisfechos suelen deberse a una de cinco causas. Compruebe antes si miden las mismas conversaciones.

· 11 min de lectura

Revisado por Dominik Blattner, fundador de Kaizo

En esta página

En la comparación nota de calidad vs CSAT, ninguna de las dos tiene razón hasta que compruebe que ambas describen las mismas conversaciones, porque normalmente no es así. Si lo hacen, una brecha persistente significa que su scorecard mide el cumplimiento del proceso en lugar del resultado.

En resumen

  • Una nota de QA baja con un CSAT alto suele significar que el agente se saltó el proceso para ayudar.
  • Trátelo como un hallazgo sobre sus políticas, no como un tema de coaching.
  • Los escalamientos, los contactos repetidos y los reembolsos desempatan, porque son comportamiento.
  • Una nota de calidad que nunca discrepa del CSAT es redundante.

¿Describen las dos cifras siquiera las mismas conversaciones?

Compruébelo antes de diagnosticar nada, porque es la explicación más común y casi nadie la comprueba.

Piense en cómo se produce realmente cada cifra. El CSAT procede de los clientes que recibieron una encuesta y decidieron responderla, normalmente una pequeña fracción de los contactos. Su nota de calidad procede de las conversaciones que seleccionó un revisor, normalmente alrededor del 3% del volumen. Son dos procesos de selección independientes que abarcan el mismo mes, y la intersección entre ellos suele estar casi vacía.

Así que, cuando las dos discrepan, la primera hipótesis honesta no es que una de ellas esté equivocada. Es que ha medido conversaciones distintas y está tratando la diferencia como una contradicción.

La prueba de cinco minutos. Extraiga las conversaciones que recibieron una respuesta de CSAT el mes pasado. Extraiga las conversaciones que se revisaron. Cuente cuántas coinciden. Si son menos de diez, ahora mismo no tiene una comparación, y ningún análisis sobre esas dos cifras va a producirla. La solución es revisar deliberadamente un conjunto de conversaciones que tengan respuestas de CSAT asociadas, lo que hace posible la comparación por primera vez.

Sobre el primer problema de selección hay un segundo. La respuesta a las encuestas no es aleatoria: quienes responden difieren sistemáticamente de quienes no lo hacen, y por eso el sesgo de no respuesta se trata como un problema metodológico central y no como una cuestión de redondeo. El trabajo de Pew Research sobre lo que significan las tasas de respuesta bajas para las encuestas es el tratamiento más claro disponible, y la implicación para el CSAT es directa. Una tasa de respuesta del 20% no es una muestra del 20% de la experiencia de sus clientes: es una muestra completa de los clientes que tenían una opinión lo bastante fuerte como para responder.

Atención

Si menos de unas diez conversaciones del mes pasado tienen a la vez una respuesta de CSAT y una revisión de QA, sus dos métricas no están en desacuerdo. Describen poblaciones distintas, y la brecha que está viendo puede no contener ninguna información.

¿Qué mide realmente cada cifra?

No son dos intentos de la misma medición, y por eso esperar que coincidan es el error de fondo. Miden objetos distintos, y un par de métricas bien diseñado debería discrepar a veces.

  • Su nota de calidad mide el proceso que usted controla. ¿Hizo el agente lo que su organización decidió que constituye una buena gestión? Es interna, es comparable entre agentes y solo es tan buena como el criterio plasmado en la rúbrica.
  • El CSAT mide el resultado y todo lo demás. La respuesta que obtuvo el cliente, la política que hay detrás, la espera, el producto, el precio y su estado de ánimo. Muy poco de eso depende del agente.

Planteado así, el desacuerdo pasa de alarmante a informativo. Un cliente puede estar descontento con un no comunicado correctamente. A un agente le pueden bajar la nota por saltarse un paso mientras el cliente obtenía exactamente lo que necesitaba. Ambas afirmaciones son ciertas sobre cosas distintas, y una nota de calidad interna existe precisamente porque la valoración del cliente no puede decirle qué cambiar.

Una nota de calidad que siempre coincide con el CSAT no mide nada adicional. Si sus dos cifras se mueven al unísono, o ha construido una scorecard que predice la satisfacción en lugar de describir la gestión, o alguien evalúa con un ojo puesto en la valoración. El acuerdo perfecto es una señal de alarma, no una condición de éxito.

Nota de calidad vs CSAT: los cuatro cuadrantes y qué significa cada uno

Suponiendo que ha descartado el problema de la población, cruce las dos cifras. Cada cuadrante tiene una causa concreta y una acción concreta, y no son intercambiables.

PatrónCausa más probableCómo confirmarloQué hacer
QA alto, CSAT bajoLa scorecard premia el cumplimiento del proceso en lugar de la resolución, o el cliente está descontento con la política y no con la gestiónLea diez conversaciones con nota alta y valoración baja. Pregúntese si el problema del cliente se resolvió realmenteReponderar hacia la resolución, o reclasificar la queja como un tema de política y sacarla del QA
QA bajo, CSAT altoEl agente se saltó el proceso para ayudar, o la scorecard penaliza cosas que los clientes no notanRevise por qué le bajaron la nota. Si es tono, formato o uso de macros, valore si el criterio justifica su pesoEs un hallazgo sobre la política o la rúbrica, no un tema de coaching. No haga coaching a un agente por un cliente satisfecho
Ambos bajosProblema real de desempeño o de capacidad, o un proceso que está fallando a todosCompruebe si se concentra en agentes concretos o se reparte entre todosRepartido significa proceso. Concentrado significa coaching. Diagnostique antes de actuar
Ambos altos, y usted no se lo creeRevisores indulgentes, una scorecard que aprueba todo el mundo, o una selección de encuestas que favorece los contactos resueltosMire la distribución de las notas. Si casi nada suspende, la scorecard ha dejado de discriminarRecalibre a los revisores y compruebe si algún criterio se ha aprobado el 95% de las veces durante dos trimestres

¿Por qué QA alto con CSAT bajo es el patrón más común?

Porque las scorecards derivan hacia lo que es fácil de observar, y lo que es fácil de observar rara vez es lo que importa. El saludo, la despedida, el etiquetado y el tono se pueden evaluar de forma rápida y coherente. Saber si el problema del cliente ha desaparecido de verdad exige leer toda la conversación y conocer la política.

Así que se acumulan los criterios baratos de evaluar, el criterio que más importa se queda en una línea, y acaba con una scorecard en la que una conversación puede obtener un 95% dejando al cliente con un problema sin resolver y una despedida cortés. La solución es reponderar hacia el resultado, y el método es ponderar los criterios a partir de la evidencia: compare la tasa de fallo de cada criterio con un resultado posterior, como el contacto repetido, y deje que los criterios que no predicen nada pierdan peso.

Hay una segunda causa que conviene separar, porque la acción es completamente distinta. A veces la gestión fue realmente buena y el cliente está descontento con la respuesta. Una negativa comunicada correctamente, una política exacta pero mal recibida, un precio. Eso no es un fallo de calidad y no debe tratarse con coaching. Es un hallazgo para quien sea responsable de la política, y lo más útil que puede hacer el QA con él es contarlo, derivarlo y parar ahí. Tratarlo como insatisfacción del cliente que se reduce con una mejor gestión no funcionará, porque la gestión no era el problema.

Consejo

Etiquete las valoraciones bajas según si la queja es sobre la gestión o sobre la respuesta. Dos meses con esa única distinción le dicen qué parte de su insatisfacción es realmente un problema de atención al cliente, y suele ser menos de lo que supone la dirección.

¿Qué cifra gana cuando tiene que elegir?

Ninguna. Use el comportamiento para desempatar. Ambas cifras son opiniones, una de un revisor y otra de un cliente. Lo que los clientes hicieron después no es una opinión, y ya está en su helpdesk.

Tres criterios de desempate, por orden de utilidad:

  1. Contacto repetido en un plazo de siete días. La señal más clara de la que dispone. Un cliente que vuelve está diciendo que el primer contacto no lo resolvió, digan lo que digan las dos cifras. Si sus conversaciones con nota alta generan contactos repetidos, la scorecard está equivocada.
  2. Escalamientos y quejas. Acciones costosas y deliberadas del cliente. Un equipo con valoraciones excelentes y escalamientos en aumento tiene un problema de medición en algún sitio, y la calidad de la gestión de escalamientos es el primer lugar donde mirar.
  3. Reembolsos y compensaciones concedidas para resolver fallos de servicio. El dinero que sale de la empresa para arreglar algo es la evidencia más difícil de negar que existe.

Después haga la comprobación a la inversa. Tome las conversaciones que los clientes valoraron mal y pida a los revisores que las evalúen a ciegas, sin ver la valoración. Si los revisores las evalúan bien de forma sistemática, su rúbrica y sus clientes no se ponen de acuerdo sobre qué significa hacerlo bien, y la rúbrica es lo que usted puede cambiar. Es el mismo mecanismo que una sesión de calibración (en inglés), aplicado a la scorecard en lugar de a los revisores.

Conviene ponerle nombre al problema de escala, porque es lo que hace que esto sea difícil y no solo tedioso. Cualquiera de estas comprobaciones necesita suficientes conversaciones con valoración y revisión para ser interpretable, y con una muestra del 3% esa intersección es demasiado pequeña para segmentarla. El Auto QA de Kaizo evalúa toda la población con su propia rúbrica, lo que significa que cada conversación encuestada tiene también una nota de calidad, y la comparación deja de depender de que dos muestras coincidan por casualidad. Eso es lo que le aporta aquí una cobertura del 100%, que revela tendencias que un muestreo del 3% nunca podría mostrar: no una nota mejor, sino la posibilidad de plantear la pregunta.

¿Qué debería cambiar primero?

Siga este orden. Cada paso es barato y cada uno descarta una posible explicación, lo que evita que repondere una scorecard para corregir un artefacto del muestreo.

  1. Mida la coincidencia. Cuente las conversaciones que tienen valoración y revisión. Si son muy pocas, corrija eso primero revisando deliberadamente conversaciones encuestadas, y deje de analizar hasta haberlo hecho.
  2. Compruebe el acuerdo entre revisores. Si dos revisores no coinciden entre sí, la nota de calidad no es lo bastante estable para compararla con nada. La variación entre revisores se disfraza de problema entre CSAT y QA más a menudo de lo que se diagnostica como lo que es.
  3. Separe las quejas sobre la gestión de las quejas sobre la respuesta. Dos meses de etiquetado le dicen qué parte de la brecha es siquiera un problema de atención al cliente.
  4. Pruebe cada criterio frente al contacto repetido. Los criterios que fallan sin mover ningún resultado posterior tienen un peso que no se han ganado.
  5. Solo entonces repondere. Y cuando lo haga, versione la scorecard (en inglés) para que las notas históricas sigan siendo interpretables con la rúbrica que las produjo.

Lo que no debe hacer es fijar un objetivo que obligue a las dos cifras a coincidir. Una nota de calidad gestionada hacia el CSAT deja de ser una medición independiente y se convierte en una segunda forma, más cara, de informar de lo mismo. La razón para mantener ambas es que ven fallos distintos, y lo que el CSAT puede y no puede medir (en inglés) es la versión amplia de este argumento. Mantenerlas independientes es lo importante, y un desacuerdo ocasional es la prueba de que lo ha conseguido.

Preguntas frecuentes

¿Por qué nuestras notas de QA son altas pero el CSAT es bajo?

Lo más habitual es que la scorecard premie el cumplimiento del proceso en lugar de la resolución, de modo que una conversación puede obtener una nota alta dejando sin resolver el problema del cliente. La segunda causa común es que el cliente está descontento con la respuesta y no con la gestión, lo que es un hallazgo sobre la política y no debe tratarse con coaching. Antes de cualquiera de las dos, compruebe si las conversaciones encuestadas y las revisadas son realmente el mismo conjunto, porque normalmente no lo son.

¿Qué es más fiable, el CSAT o una nota de calidad interna?

Ninguno, porque miden objetos distintos. Una nota de calidad mide el proceso que usted controla y es comparable entre agentes. El CSAT mide el resultado más la política, la espera, el producto y el estado de ánimo del cliente, y muy poco de eso depende del agente. Use en su lugar el comportamiento para desempatar: el contacto repetido, los escalamientos y los reembolsos son acciones, no opiniones.

¿Deberían coincidir las notas de QA y el CSAT?

No, y un par que siempre coincide es una señal de alarma. Significa que la scorecard se construyó para predecir la satisfacción en lugar de describir la gestión, o que los revisores evalúan con un ojo puesto en la valoración. La razón para mantener ambas métricas es que detectan fallos distintos, así que un desacuerdo ocasional es la prueba de que funcionan de forma independiente. Si el QA mejora o no el CSAT se trata en ¿mejora el QA el CSAT? (en inglés).

¿Qué significa que un agente tenga notas de QA bajas y clientes satisfechos?

Normalmente, que se saltó un proceso para ayudar al cliente, o que la scorecard penaliza cosas que los clientes no notan, como el tono, el formato o el uso de macros. Revise por qué perdió puntos antes de hacer coaching a nadie. Si el criterio no predice ningún resultado posterior, como el contacto repetido, es un hallazgo sobre la rúbrica y no sobre el desempeño.

¿Una tasa de respuesta del 20% es una muestra del 20%?

No. Es una muestra completa de los clientes que tenían una opinión lo bastante fuerte como para responder, un grupo sistemáticamente distinto del que no respondió. El sesgo de no respuesta es un problema metodológico bien documentado y no una cuestión de redondeo, y significa que el CSAT describe una población autoseleccionada. Esa es la razón principal por la que necesita una medida interna a su lado y no en su lugar.

Términos relacionados

Descubra si sus dos cifras describen las mismas conversaciones

Traiga un mes de conversaciones encuestadas y su scorecard actual. Las evaluaremos con su propia rúbrica para que vea dónde la valoración y la revisión discrepan de verdad, y dónde nunca llegaron a coincidir.

Reservar una demo Explorar Insights

En esta página

Véalo en sus propias conversaciones

Evaluaremos una muestra de sus tickets reales con sus propios estándares, para que el ejemplo sea el suyo.

La confianza de equipos de atención al cliente de todo el mundo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart