Saltar al contenido

Buenas prácticas

Control de calidad de agentes de IA en Zendesk

Control de calidad de agentes de IA en Zendesk: qué mide Zendesk por sí solo, qué conversaciones del bot revisar primero, una scorecard modelo y cómo corregir.

· 13 min de lectura

Revisado por Dominik Blattner, fundador de Kaizo

En esta página

El control de calidad de agentes de IA en Zendesk consiste en leer y evaluar las conversaciones que atiende su agente de IA de Zendesk según un estándar escrito, para saber si sus respuestas fueron correctas y no solo si el cliente se fue. Necesita una scorecard diseñada para el bot, una forma de evaluar cada conversación del agente de IA y un ciclo que convierta cada fallo en una corrección dentro de Zendesk.

En pocas palabras

  • Una resolución automatizada en Zendesk le dice que el cliente no llegó a hablar con una persona, no que la respuesta fuera correcta.
  • Empiece por las conversaciones del agente de IA en las que una respuesta equivocada cuesta dinero: reembolsos, precios, excepciones a las políticas y cambios de cuenta.
  • Evalúe el bot por exactitud, respaldo en su contenido, escalamiento y derivación, no solo por el saludo y la empatía.
  • Cada fallo debe terminar en un cambio concreto: un artículo del centro de ayuda, un procedimiento, una regla de escalamiento o un tema bloqueado.
  • Vuelva a evaluar después de cada cambio, porque corregir una respuesta puede estropear otra.

Esta guía es la versión para Zendesk de nuestra guía general sobre el control de calidad de agentes de IA. Si busca la herramienta en sí, la página de la herramienta de QA para Zendesk muestra cómo Kaizo evalúa las conversaciones de Zendesk, incluidas las que atienden los agentes de IA de Zendesk.

¿Qué le muestra Zendesk sobre la calidad del agente de IA?

Zendesk le muestra volumen y resultados: cuántas conversaciones resolvió el agente de IA, cuáles no y las transcripciones de ambas. Por sí solo, no le dice si cada respuesta fue exacta o cumplió su política. Para eso necesita una revisión, ya sea en Zendesk QA o en una herramienta de QA independiente.

En la práctica, un administrador de Zendesk tiene hoy tres lugares donde mirar:

DóndeQué obtieneQué no le dice
Insights y transcripciones del agente de IAResoluciones automatizadas y conversaciones no resueltas, con transcripcionesSi una conversación resuelta tuvo una respuesta correcta
Recuento de resoluciones automatizadasCuántas solicitudes resolvió el agente de IA sin escalamiento a una personaSi el cliente volvió o se rindió
Zendesk QA (complemento de pago)Revisiones y evaluación automática de conversaciones, incluidos los bots que marque como revisablesSi la respuesta siguió su propia política, salvo que su scorecard lo compruebe

Conviene conocer dos detalles. Según el centro de ayuda de Zendesk, la vista de transcripciones, que se abre desde la pestaña Insights de la configuración del agente de IA, muestra los primeros 100 mensajes intercambiados entre un agente de IA y un usuario, y solo las conversaciones inactivas durante más de 72 horas aparecen entre las resoluciones automatizadas. El mismo artículo marca esa vista como heredada y dice que dejará de estar disponible después del 10 de diciembre de 2026, así que compruebe dónde leerá su equipo las transcripciones a partir de esa fecha.

¿Por qué una resolución automatizada no es una nota de calidad?

Zendesk mide el uso del agente de IA en resoluciones automatizadas y solo factura las solicitudes de clientes que un agente de IA resolvió con éxito, sin ningún escalamiento a un agente humano. Esa definición le dice que la conversación terminó sin una persona. No puede decirle si la respuesta fue correcta, completa o permitida.

La brecha aparece de tres maneras:

  1. El cliente se rindió. Una respuesta equivocada o genérica y luego silencio. Sin escalamiento, así que cuenta como resuelta.
  2. La respuesta era casi correcta. El bot cita la política correcta pero omite una condición, o el producto correcto pero con el precio antiguo. Todas las métricas del sistema siguen en verde.
  3. El bot prometió algo que usted no ofrece. Un reembolso fuera de plazo, una comisión condonada, una fecha de entrega que nadie puede cumplir. El cliente está contento hasta que la promesa falla.

Los equipos de atención al cliente describen el mismo patrón en público. En un hilo de r/Zendesk, un equipo que revisaba tickets que “started and finished with the AI Agent (no human touch)” escribió que veía “high value customers getting iffy or bad answers and then abandoning the chat”, es decir, clientes de alto valor que recibían respuestas dudosas o malas y luego abandonaban el chat. Es la afirmación de un solo equipo, pero es exactamente el caso que un recuento de resoluciones automatizadas no puede mostrar. Tratamos la lista más amplia de estos errores silenciosos en nuestro artículo sobre los fallos silenciosos de los agentes de IA.

¿Cómo se implementa el control de calidad de agentes de IA en Zendesk?

Implemente el control de calidad de agentes de IA en Zendesk en seis pasos: elija primero los temas de riesgo, escriba una scorecard para el bot, evalúe cada conversación del agente de IA, revise la derivación a sus agentes humanos, vincule cada fallo con una corrección en Zendesk y vuelva a evaluar después de cada cambio. Los dos primeros pasos se hacen una sola vez; el resto es una rutina semanal.

Paso 1: decida qué conversaciones del agente de IA importan más

No todas las conversaciones del bot tienen el mismo riesgo. Una respuesta equivocada sobre el horario de atención es molesta. Una respuesta equivocada sobre un reembolso, una penalización por cancelación o una solicitud de datos cuesta dinero o crea un problema de cumplimiento. Haga una lista de los temas en los que una respuesta equivocada hace daño y asegúrese de que su revisión los cubra primero:

  • Reembolsos, créditos, compensaciones y condonación de comisiones
  • Precios, planes y cualquier cosa que incluya una cifra
  • Excepciones a las políticas y reglas de elegibilidad
  • Cambios de cuenta, cancelaciones y datos personales
  • Quejas y amenazas de baja

Marque también las conversaciones de cuentas de alto valor y cualquier conversación en la que el mismo cliente vuelva en pocos días por el mismo tema.

Paso 2: escriba una scorecard para el agente de IA

La scorecard de sus agentes humanos es un punto de partida, no la respuesta. El saludo y la ortografía rara vez fallan en un bot. Donde falla es en la exactitud, en el respaldo en su propio contenido y en saber cuándo detenerse. Mantenga entre 6 y 8 criterios, cada uno algo que un revisor pueda comprobar en la transcripción. La siguiente sección incluye un ejemplo completo, y nuestra guía sobre la scorecard de agentes de IA explica qué criterios pensados para personas conviene eliminar.

Paso 3: evalúe cada conversación del agente de IA, no una muestra

Un bot suele repetir el mismo error en todas las conversaciones que tocan el mismo tema, porque cada vez responde a partir del mismo contenido. Una muestra del 2% puede pasarlo por alto por completo, o detectarlo una vez y tomarlo por ruido. Evaluar cada conversación del agente de IA revela el patrón: un artículo, un procedimiento o una regla detrás de decenas de respuestas malas.

Con Kaizo, conecta Zendesk, elige una scorecard y activa AutoPilot. AutoPilot evalúa cada conversación según sus criterios cuando se resuelve y añade al ticket un comentario que explica la nota. Puede definir qué colas, canales o equipos evalúa.

Paso 4: revise la derivación a sus agentes humanos

Cuando el agente de IA escala, pueden salir mal dos cosas: escala demasiado tarde, cuando el cliente ya está frustrado, o deriva sin el contexto, de modo que el cliente tiene que repetirlo todo. Evalúe ambas cosas desde el lado del bot (¿escaló con el disparador correcto?, ¿pasó un resumen?) y desde el lado del agente (¿lo leyó?). Nuestra guía sobre cómo evaluar la derivación cubre ambas direcciones.

Paso 5: vincule cada fallo con una corrección en Zendesk

Una nota de QA que no cambia el bot es solo un informe. Para cada criterio no cumplido, decida qué lo causó y dónde está la corrección:

Qué fallóCausa probableDónde corregirlo
Dato erróneo o desactualizadoEl artículo de origen es incorrecto, antiguo o no existeActualizar o añadir el artículo del centro de ayuda del que responde el bot
Política correcta, falta una condiciónEl artículo esconde la condición, o dos artículos se contradicenReescribir el artículo para que la condición esté en la propia respuesta
Prometió algo no permitidoNada detiene al bot en ese temaPasar ese tema a una persona, o impedir que el bot lo responda
Escaló demasiado tardeLas condiciones para derivar son demasiado estrechasAmpliarlas: tema, señales de frustración, la misma pregunta dos veces
Derivación sin contextoNo se pasa ningún resumen al agenteCambiar la derivación para que el agente reciba un resumen de la conversación

Agrupe los fallos por causa antes de corregir nada. Diez respuestas malas que vienen de un mismo artículo necesitan una sola corrección, no diez.

Paso 6: vuelva a evaluar después de cada cambio

Los cambios de contenido tienen efectos secundarios. Un artículo de reembolsos reescrito puede corregir las respuestas sobre reembolsos y estropear las respuestas relacionadas sobre cancelaciones. Después de cada cambio, revise las notas del tema afectado durante la semana siguiente y compárelas con las de la semana anterior. Si evalúa cada conversación, esa comparación ya está disponible.

¿Cómo es una scorecard para un agente de IA de Zendesk?

Una scorecard para un agente de IA de Zendesk comprueba si la respuesta del bot fue correcta, estuvo respaldada por su propio contenido, estaba permitida por la política y si se derivó en el momento adecuado. Necesita menos criterios de habilidades blandas que una scorecard para personas y más criterios sobre datos y escalamiento. Este es un ejemplo completo para un equipo de atención al cliente de retail.

CriterioPregunta que responde el revisorTipo
Respuesta correcta¿Era cierto cada dato de la respuesta para el caso de este cliente?Cumple / no cumple, error crítico en temas de dinero
Respaldada en nuestro contenido¿Se puede vincular cada afirmación a un artículo del centro de ayuda o a un procedimiento?Cumple / no cumple
Política respetada¿Se mantuvo el bot dentro de las reglas de reembolsos, comisiones y elegibilidad?Cumple / no cumple, error crítico
Entendió la solicitud¿Respondió a la pregunta que hizo el cliente y no a una parecida?1 a 3
Escaló cuando debía¿Derivó con el disparador correcto, antes de que el cliente se repitiera?Cumple / no cumple
Contexto de la derivación¿Recibió el agente humano un resumen con el que pudiera actuar?Cumple / no cumple
Tono¿Fue el tono adecuado para un cliente molesto?1 a 3

Y este es el tipo de comentario que un revisor, o AutoPilot, debería dejar en el ticket:

Política respetada: no cumple. El cliente pidió un reembolso el día 34. El agente de IA confirmó el reembolso, pero la política de devoluciones permite 30 días. Fuente: el artículo del centro de ayuda “Devoluciones y reembolsos”, que indica el plazo de 30 días solo en su último párrafo. Corrección sugerida: mover el plazo a la primera frase del artículo y añadir una regla de escalamiento para las solicitudes de reembolso posteriores al día 30.

Un comentario así es lo que hace útil la nota: nombra el criterio, la evidencia en la transcripción, el origen del error y la corrección. Antes de confiar en una nota automatizada, pruébela con conversaciones que su equipo ya haya evaluado y vea dónde discrepa. Nuestra guía sobre cómo validar la evaluación de QA con IA (en inglés) explica esa prueba.

¿Qué resultados puede esperar de la cobertura total?

Los resultados publicados proceden del QA de conversaciones de atención al cliente en general. En UiPath, Kaizo automatizó el 100% del QA con un ROI del 200% y una mejora del 8% en la nota de calidad. En SteelSeries, un equipo de atención al cliente de 30 personas que empezó con Zendesk, los resúmenes con IA redujeron a la mitad el tiempo que llevaba el QA sin reducir lo que detectaba.

Ninguno de los dos resultados se refiere solo a conversaciones de agentes de IA. El mecanismo, sin embargo, es el mismo: cuando se evalúa cada conversación, un fallo recurrente deja de ser una anécdota y se convierte en una cifra que puede corregir y seguir.

Véalo en su propio Zendesk. Kaizo evalúa cada conversación de Zendesk según sus propios criterios, incluidas las que atienden los agentes de IA de Zendesk, y añade la explicación al ticket. Reserve una demo.

¿Debe usar Zendesk QA o una herramienta de QA independiente?

Use Zendesk QA si ya paga el complemento y sus scorecards encajan con la forma en que quiere revisar el bot. Use una herramienta de QA independiente si quiere una sola scorecard y un solo conjunto de reportes para las conversaciones de agentes humanos y de IA, construidos en torno a sus propios criterios. Ambas opciones pueden funcionar; la scorecard y el seguimiento importan más que la herramienta.

Lo que Zendesk QA ofrece para bots, según el centro de ayuda de Zendesk:

  • Usted marca cada bot como revisable o no. Los bots revisables se incluyen en la evaluación automática y en las revisiones manuales.
  • Puede filtrar las conversaciones por participante, bot, tipo de bot (flujo de trabajo o generativo) y número de respuestas del bot.
  • Sus categorías de AutoQA son saludo, empatía, ortografía y gramática, cierre, solución ofrecida, tono, legibilidad y comprensión, y los agentes y los bots se evalúan por separado.
  • Requiere el complemento Quality Assurance o Workforce Engagement Management.

Preguntas para cualquier herramienta, Zendesk QA incluido:

  1. ¿Puede evaluar los criterios que importan para un bot, como la exactitud frente a su propio contenido y su política, y no solo las categorías estándar?
  2. ¿Cada nota va acompañada de una explicación vinculada a la transcripción?
  3. ¿Puede probarla con sus propias evaluaciones anteriores antes de que evalúe en producción?
  4. ¿Evalúa cada conversación del agente de IA o una muestra?
  5. ¿Pueden las personas que corrigen el bot ver los fallos agrupados por causa?

Si compara las dos directamente, nuestra página sobre la alternativa a Zendesk QA expone las diferencias, y la página Kaizo para Zendesk muestra cómo funciona la puesta en marcha.

Cuándo no es para usted

Un control de calidad formal de agentes de IA no compensa en todos los casos. Si su agente de IA de Zendesk atiende unas pocas decenas de conversaciones a la semana, léalas usted mismo: una hora a la semana con las transcripciones y una lista de comprobación breve encontrará la mayoría de los problemas. Si el bot solo responde preguntas de bajo riesgo, como el horario de atención o los enlaces de seguimiento de pedidos, basta con una revisión puntual mensual.

También es demasiado pronto si todavía no tiene un estándar escrito de lo que es una buena respuesta. Escríbalo primero, aunque sea una lista de una página, porque ninguna herramienta puede evaluar según un estándar que no existe. Y si el contenido de su centro de ayuda está desactualizado en general, corrija el contenido antes de medir el bot: de lo contrario, el QA le dirá sobre todo lo que ya sabe.

Preguntas frecuentes

¿Puede Zendesk QA revisar conversaciones atendidas por agentes de IA?

Sí. Zendesk QA puede incluir en la evaluación automática y en las revisiones manuales los bots que marque como revisables, y puede filtrar las conversaciones por bot y tipo de bot. Requiere el complemento Quality Assurance o Workforce Engagement Management.

¿Kaizo funciona con los agentes de IA de Zendesk?

Sí. Kaizo se conecta a Zendesk y AutoPilot evalúa cada conversación de Zendesk según sus propios criterios, incluidas las que atienden los agentes de IA de Zendesk. Cada nota va acompañada de un comentario que la explica.

¿Cuántas conversaciones de un agente de IA de Zendesk debe revisar?

Evalúelas todas si puede, porque un bot suele repetir el mismo error en las conversaciones sobre el mismo tema. Si revisa a mano, empiece por los temas de riesgo como reembolsos, precios y excepciones a las políticas, y lea primero cada una de esas conversaciones.

¿Puede usar la misma scorecard para sus agentes humanos y su agente de IA?

Puede compartir los criterios que se aplican a ambos, como respuesta correcta y tono, lo que mantiene los resultados comparables. El agente de IA necesita criterios adicionales sobre el respaldo en su contenido, los límites de la política y el escalamiento, y menos peso en el saludo y la ortografía.

¿Cuánto se tarda en implementar el QA para un agente de IA de Zendesk?

La mayor parte del trabajo es elegir los temas de riesgo y escribir la primera scorecard, algo que se hace una vez. Con Kaizo, conectar Zendesk y activar AutoPilot lleva días, no un proyecto de conectores, y puede probar la evaluación con sus evaluaciones anteriores antes de ponerla en marcha.

¿Qué debe hacer cuando el agente de IA da una respuesta equivocada?

Busque primero el origen de la respuesta: normalmente un artículo del centro de ayuda incorrecto, desactualizado o poco claro. Corrija el artículo o añada una regla de escalamiento para ese tema, y después revise las notas de ese tema durante la semana siguiente para confirmar que la corrección se mantiene.

Lecturas relacionadas

En esta página

Véalo en sus propias conversaciones

Evaluaremos una muestra de sus tickets reales con sus propios estándares, para que el ejemplo sea el suyo.

La confianza de equipos de atención al cliente de todo el mundo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart