Saltar al contenido

Buenas prácticas

Tasa de deflexión de tickets: lo que oculta

La tasa de deflexión cuenta los tickets que su agente de IA cerró, no los que resolvió bien. Cómo auditar esas conversaciones y hallar los fallos silenciosos.

· 13 min de lectura

Revisado por Dominik Blattner, fundador de Kaizo

En esta página

La tasa de deflexión cuenta los contactos que nunca llegaron a una persona, así que mide volumen, nunca calidad. Una respuesta correcta, un cliente que se rindió y una respuesta incorrecta dada con total seguridad se ven igual, y la mayoría de los programas de QA nunca revisan esas conversaciones.

En resumen

  • La respuesta incorrecta dada con seguridad es la que más cuesta, porque nunca se escala.
  • La mayoría de los benchmarks publicados provienen de proveedores a los que se mide precisamente con esta métrica.
  • El recontacto en un plazo de siete días es la comprobación más barata y ya está en su helpdesk.
  • Si deja fuera de la evaluación los tickets deflectados, se pierde toda la carga de trabajo de su bot.

¿Qué mide realmente la tasa de deflexión?

La tasa de deflexión es el porcentaje de contactos entrantes que se cerraron sin que ningún agente humano interviniera. La fórmula habitual divide los contactos deflectados entre el total de contactos, y deflectado significa que el autoservicio o un agente de IA lo gestionó de principio a fin.

Vuelva a leer esa definición, porque todo el problema está dentro de ella. El numerador se define por algo que no ocurrió: no intervino ninguna persona. Nada en la medición pregunta si el problema del cliente desapareció.

Por eso la métrica se comporta de forma tan extraña bajo presión. Haga que sea más difícil salir de su centro de ayuda y la deflexión sube. Esconda el formulario de contacto detrás de tres clics y la deflexión sube. Deje que el bot responda con seguridad en lugar de derivar cuando no está seguro y la deflexión sube. En todos los casos el número mejora y la experiencia del cliente empeora, que es la señal inequívoca de una métrica que mide el objeto equivocado.

Nada de esto la convierte en un número inútil. La deflexión es una medida perfectamente válida de capacidad, y la capacidad es algo real que hay que gestionar. Deja de ser útil en el momento en que alguien la lee como una medida de calidad, lo que en la mayoría de las organizaciones ocurre más o menos en la segunda semana.

Recuerde

La tasa de deflexión es una métrica de volumen disfrazada de métrica de calidad. Le dice cuánto trabajo absorbió su bot. No puede decirle si ese trabajo se hizo.

¿Por qué cuatro resultados distintos se ven iguales en los datos?

Un ticket deflectado tiene al menos cuatro finales posibles, y sus reportes reducen los cuatro a una sola fila. Es lo más importante que hay que entender sobre esta métrica, y es la razón por la que dos equipos con la misma tasa de deflexión pueden tener problemas de magnitudes completamente distintas.

Recorra la siguiente tabla pensando en su propio producto. La mayoría de los equipos pueden nombrar un ejemplo real de los cuatro casos en pocos minutos, y eso ya es en sí mismo el hallazgo.

Lo que realmente pasóLo que vivió el clienteCómo aparece en los datos de deflexiónDónde aparece en cambio
Resuelto de verdadObtuvo la respuesta correcta y siguió con lo suyoDeflectadoEn ningún sitio. Es el caso por el que usted paga
AbandonadoSe rindió y no volvióDeflectado, registro idénticoPérdida de clientes, una renovación que no llega, un pedido perdido
Redirigido por el clienteSalió del chat y llamó, escribió un correo o publicó en públicoDeflectado, y el segundo contacto suele contar como un ticket nuevoLa tasa de recontacto y su propio volumen entrante
Incorrecto con seguridadRecibió una respuesta clara pero incorrecta y actuó según ellaDeflectado, y con frecuencia con señales superficiales positivasUn reembolso, una queja, un incidente de cumplimiento, semanas después

Deflexión, contención y resolución no son el mismo número

En el material de los proveedores estos tres términos se usan indistintamente, y significan cosas realmente distintas. Vale la pena aclararlos antes de cualquier conversación sobre objetivos.

  • La deflexión pregunta si el contacto llegó a una persona. Se mide en la puerta de entrada y es la más laxa de las tres.
  • La contención pregunta si la conversación se quedó dentro del canal automatizado. Una conversación contenida (en inglés) puede terminar mal igualmente; simplemente terminó mal dentro del bot.
  • La resolución pregunta si el problema del cliente desapareció. Es la única de las tres que trata del cliente, y la única que no se puede medir sin preguntarle o sin leer la conversación.

El dinero está en la brecha entre contención y resolución. Un equipo que reporta un 70 % de contención y da por hecho un 70 % de resolución está dando un salto sin verificar, y nadie conoce el tamaño de ese salto hasta que alguien lo mide. Normalmente nadie lo ha hecho, porque medirlo implica leer conversaciones en lugar de consultar un dashboard.

Cuando un proveedor reporte una tasa de resolución, compruebe si el sistema se está evaluando a sí mismo. Un agente de IA que decide por sí mismo si resolvió algo no es una prueba, es una autoevaluación, y el NIST AI Risk Management Framework trata la medición independiente del desempeño de un sistema de IA como una función aparte precisamente porque el desempeño autodeclarado no es una medición. La misma lógica se aplica en sentido contrario a la precisión de la evaluación con IA: cualquier evaluador, humano o modelo, necesita que su precisión la establezca algo externo a él.

Atención

Si su agente de IA reporta su propia tasa de resolución, esa cifra es una autoevaluación y debe identificarse como tal en cualquier presentación en la que aparezca. Se convierte en prueba cuando algo independiente del agente revisa una muestra.

¿Por qué la respuesta incorrecta dada con seguridad es la más cara?

Un agente de IA que falla con seguridad cierra el ticket. Un agente de IA que falla con honestidad lo escala. Esa sola asimetría decide de qué fallos se entera usted.

Cada escalamiento es visible. Llega a una cola, lo lee una persona y, si es lo bastante grave, alguien lo dice. La vía de escalamiento se reporta sola. Mientras tanto, la conversación en la que el bot se inventó un plazo de devolución, citó un precio que no existe desde hace dos años o aseguró a alguien que sus datos se habían borrado cuando no era así queda marcada como resuelta y sale por la puerta.

Así que los fallos de los que usted se entera de forma natural son, sistemáticamente, los equivocados. Se entera de los casi errores del bot prudente y no sabe nada de los errores reales del bot seguro de sí mismo. Son fallos silenciosos, y el nombre es preciso: no son raros, son callados.

Hay un efecto de segundo orden que conviene nombrar. Como los escalamientos son visibles y la deflexión se premia, la presión sobre cualquier despliegue de IA va en una sola dirección: escalar menos. Los equipos ajustan el bot hacia la seguridad. Un bot ajustado para derivar cuando no está seguro mostrará una peor tasa de deflexión y una mejor experiencia del cliente, y si la deflexión es el número del dashboard, esa decisión se toma al revés. Cómo se diseña y se revisa la derivación en sí importa más que la tasa a cualquiera de los dos lados.

Consejo

Ordene sus conversaciones deflectadas según lo seguro que suena el último mensaje del bot, no según su longitud. Es en los mensajes de cierre cortos, rotundos y sin matices sobre preguntas no triviales donde se concentran las respuestas incorrectas.

¿Cómo auditar su propia tasa de deflexión?

Esta es la parte que nadie publica. Lleva aproximadamente media jornada y puede hacer la primera pasada esta misma semana, sin herramientas nuevas.

Paso 1. Construya el marco de muestreo que ha estado excluyendo

Extraiga todas las conversaciones del último mes completo que se cerraron sin intervención humana. No las escaladas, ni una muestra general de todos los tickets: específicamente la población deflectada. La mayoría de los programas de QA las filtran por defecto, porque la cola de revisión se construyó en torno a los agentes y estas conversaciones no tienen ningún agente asociado. Ese filtro es el punto ciego.

Paso 2. Estratifique antes de muestrear

No tome una muestra aleatoria simple. Divida primero el marco en tres grupos, porque la tasa base de fallos varía muchísimo entre ellos:

  • Deflectado, sin contacto posterior. Los éxitos aparentes, y el grupo con más probabilidades de contener las respuestas incorrectas dadas con seguridad.
  • Deflectado y con un nuevo contacto en un plazo de siete días. El grupo que más rinde, con mucha diferencia. Empiece por aquí si solo tiene una hora.
  • Deflectado en un tema que implica dinero, identidad o un compromiso basado en las políticas de la empresa. La mayor consecuencia por fallo, y donde está la exposición en protección de datos (en inglés).

Entre veinte y treinta conversaciones por grupo bastan para una primera lectura. Todavía no está produciendo una tasa estadísticamente defendible: está estableciendo si existe un problema y qué forma tiene. Si después quiere una cifra defendible, la lógica de dimensionamiento es la misma que para cualquier otro muestreo de QA.

Paso 3. Evalúe con una rúbrica escrita para un bot, no para una persona

Su scorecard actual no sirve aquí. La mitad mide cosas que un bot no puede hacer mal y no mide aquello en lo que falla. Use en su lugar una scorecard para agentes de IA y califique solo lo que un lector puede verificar en la transcripción. Cuatro criterios concentran la mayor parte de la señal:

  1. Exactitud de los hechos. ¿Cada afirmación sobre políticas, precios, plazos o derechos era correcta? Este es el criterio que importa, y casi con seguridad el que su rúbrica anterior omite.
  2. Exhaustividad. ¿Obtuvo el cliente todo lo que necesitaba, o una respuesta parcial que cierra el ticket y garantiza un segundo contacto?
  3. Criterio de escalamiento. ¿Debería haber pasado a una persona, y pasó?
  4. Incertidumbre honesta. Cuando el bot no sabía algo, ¿lo dijo, o produjo algo verosímil?

Paso 4. Calcule el número que importa

Su cifra real es el porcentaje de conversaciones deflectadas que se resolvieron de forma correcta y completa. Cuente con que la primera vez que la mida estará claramente por debajo de su tasa de deflexión reportada. Esa brecha es el verdadero hallazgo, y vale más en una conversación con la dirección de lo que nunca valió la tasa de deflexión, porque es trazable hasta conversaciones concretas (en inglés) que cualquiera puede ir a leer.

Repítalo cada mes, con la misma estratificación, y tendrá una tendencia. En ese momento deja de ser una auditoría y se convierte en control de calidad de sus agentes de IA.

¿Qué indicadores deberían acompañar a la tasa de deflexión?

No elimine la tasa de deflexión. Rodéela, para que no pueda leerse sola. Cuatro indicadores acompañantes hacen la mayor parte del trabajo, y todos se pueden obtener de datos que usted ya tiene.

  • El recontacto en los siete días posteriores a una deflexión. La mejor comprobación en relación valor/esfuerzo que existe. Es objetiva, no necesita encuestas, y un cliente que vuelve es la señal más clara disponible de que la primera respuesta no funcionó.
  • La calidad del escalamiento, no la tasa de escalamiento. Cuando el bot derivó, ¿fue la decisión correcta y llegó el caso con contexto? La tasa por sí sola es ambigua, porque un buen despliegue y uno malo pueden producir la misma. La calidad en la gestión del escalamiento es la versión legible.
  • La insatisfacción específicamente en las conversaciones deflectadas. Sepárela en lugar de dejar que se diluya en la cifra global, donde desaparece un pequeño volumen de interacciones automatizadas muy malas. La señal de insatisfacción (en inglés) es más útil aquí que la satisfacción, porque la población deflectada responde a las encuestas todavía menos que la general.
  • La tasa de resolución verificada. El resultado de la auditoría anterior. Es el número que hay que presentar a la dirección, y el único de la lista que exige que alguien haya leído una conversación.

Leer la población deflectada a mano es por donde se empieza, y también donde todo se atasca, porque el volumen es grande y la tasa base de fallos lo bastante baja como para que una revisión manual con una muestra del 3 % no la saque a la luz de forma fiable. El Auto QA de Kaizo evalúa las conversaciones gestionadas por IA y por personas con la misma rúbrica, que es lo que hace honesta la comparación, y mantiene el razonamiento asociado a cada conversación para que una respuesta señalada pueda comprobarse en lugar de aceptarse sin más. Es la cobertura del 100 % que revela tendencias que un muestreo del 3 % nunca podría mostrar, aplicada a la población que nunca ha estado en la muestra.

Si quiere el conjunto más amplio de métricas que lo rodea, medir el rendimiento de los agentes de IA cubre la capa operativa, y las métricas de IA en atención al cliente cubren lo que debe ir en un dashboard.

¿Por qué desconfiar de todos los benchmarks publicados para esta métrica?

Fíjese en quién publica los benchmarks de deflexión. Busque el término y los resultados están dominados por empresas que venden el agente de IA cuyo valor se expresa en deflexión. No es una conspiración, es un incentivo, y vale la pena nombrarlo porque condiciona cada cifra que va a encontrar.

Tres razones concretas por las que un benchmark publicado no es trasladable a su caso:

  • El denominador no está definido. ¿Incluye las visitas a páginas del centro de ayuda? ¿Los chats que se abrieron y cerraron en cuatro segundos? ¿Los contactos en canales que el bot no cubre? Mueva el denominador y puede mover la deflexión veinte puntos sin cambiar nada real.
  • La mezcla de contactos domina el resultado. Un equipo que atiende restablecimientos de contraseña y estados de pedido superará en deflexión a uno que atiende disputas de facturación por un margen que no dice nada sobre la calidad de ninguno de los dos despliegues. Comparar entre mezclas distintas no tiene sentido.
  • Nadie publica sus fallos. Los benchmarks salen de despliegues dispuestos a ser citados, que es por definición una población filtrada.

La comparación útil no es con una cifra del sector, sino con usted mismo. Su tasa de resolución verificada de este mes frente a la del mes pasado, con la misma mezcla de contactos y la misma rúbrica, le dice algo cierto. Un benchmark del sector le dice algo citable.

Preguntas frecuentes

¿Cuál es una buena tasa de deflexión?

No hay una respuesta trasladable, y cualquier cifra que se presente como tal debe tratarse con recelo. La deflexión depende casi por completo de su mezcla de contactos y de cómo se define el denominador, de modo que un equipo que gestiona estados de pedido mostrará una tasa muy superior a la de un equipo que gestiona disputas de facturación sin ninguna diferencia de calidad. La comparación con sentido es la de su propia tasa de resolución verificada mes a mes, con una mezcla de contactos estable.

¿Cuál es la diferencia entre tasa de deflexión y tasa de contención?

La deflexión pregunta si un contacto llegó a una persona. La contención pregunta si la conversación se quedó dentro del canal automatizado. Ninguna de las dos pregunta si se resolvió el problema del cliente, que es la resolución, y la resolución no se puede medir sin preguntar al cliente o leer la conversación. Una conversación contenida puede haber terminado mal igualmente.

¿Cómo sé si mi agente de IA está dando respuestas incorrectas?

Lea una muestra estratificada de las conversaciones que cerró sin escalar, que es la población que la mayoría de los programas de QA filtran. Empiece por las conversaciones deflectadas en las que el cliente volvió a contactar en un plazo de siete días, porque la tasa de fallos en ese grupo es mucho mayor que en la población general. Evalúelas por exactitud de los hechos y exhaustividad, no por el tono.

¿Una tasa de deflexión alta significa que mis clientes están satisfechos?

No, y puede significar lo contrario. La deflexión cuenta la ausencia de una persona, así que un cliente que se rindió, que cambió de canal o que aceptó una respuesta incorrecta dada con seguridad genera el mismo registro que uno al que se ayudó de verdad. Poner más difícil llegar a una persona sube la deflexión y baja la satisfacción, y por eso la métrica debe leerse junto con la tasa de recontacto.

¿Debo incluir las conversaciones gestionadas por IA en mi programa de QA?

Sí, y la mayoría de los programas hoy no lo hacen, porque las colas de revisión se construyeron en torno a los agentes y estas conversaciones no tienen ningún agente asociado. Si los tickets deflectados quedan fuera de su muestra, su visibilidad sobre la calidad tiene un hueco exactamente del tamaño de la carga de trabajo de su bot. Evalúelas con una rúbrica escrita para un sistema de respuesta automatizado en lugar de reutilizar la scorecard de los agentes humanos.

Términos relacionados

Descubra qué le compró realmente su tasa de deflexión

Traiga un mes de conversaciones que su agente de IA cerró por su cuenta. Las evaluaremos con la misma rúbrica que sus tickets gestionados por personas y le mostraremos la brecha entre deflectado y realmente resuelto.

Reservar una demo Descubrir Agentic Auto QA

En esta página

Véalo en sus propias conversaciones

Evaluaremos una muestra de sus tickets reales con sus propios estándares, para que el ejemplo sea el suyo.

La confianza de equipos de atención al cliente de todo el mundo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart