El control de calidad de agentes de IA y chatbots empieza con una scorecard que defina cómo es una buena conversación atendida por IA. Después, evalúe cada una de esas conversaciones de forma automática. Mantenga al evaluador independiente de la IA que evalúa y vincule cada nota con la transcripción para poder corregir el fallo.
En resumen
- El volumen que atiende la IA es demasiado alto para revisar muestras a mano.
- Busque información incorrecta, escalamientos omitidos, alucinaciones y respuestas con un tono inadecuado.
- Lleve los hallazgos a los prompts, las salvaguardas y el enrutamiento.
- Vuelva a evaluar después para confirmar que la corrección se mantiene.
Paso 1: defina qué es una buena conversación para un agente de IA
Los agentes de IA fallan de forma distinta a las personas, así que una scorecard pensada para agentes humanos, trasladada sin cambios, pasará por alto lo que más importa. Empiece por escribir cómo es realmente una buena conversación atendida por IA en su empresa, con criterios que una máquina pueda comprobar sobre una transcripción.
Construya los criterios en torno a los fallos típicos de la IA
Una buena scorecard para IA cubre los comportamientos que rompen la confianza cuando un agente se equivoca:
- Exactitud de la información: ¿dio el agente información correcta, o se inventó una política, un precio o un paso que no existe?
- Resolución: ¿resolvió de verdad el problema del cliente, o solo cerró el ticket?
- Escalamiento correcto: ¿pasó el caso a una persona en el momento adecuado, y no demasiado tarde?
- Tono y empatía: ¿se adaptó al estado emocional del cliente en lugar de sonar robótico?
- Cumplimiento de políticas y seguridad: ¿se mantuvo dentro de los límites que usted fijó y rechazó lo que debía rechazar?
Haga que cada criterio se pueda comprobar con evidencias
Redacte los criterios de modo que un resultado positivo o negativo se pueda rastrear hasta una línea concreta de la conversación. Kaizo le permite crear la scorecard que su empresa usa de verdad y juzga cada conversación con ella, igual que lo haría su mejor revisor, lo que mantiene el QA de la IA y el QA de los agentes humanos en un mismo estándar comparable.
Paso 2: control de calidad de agentes de IA en el 100% de las conversaciones, no en una muestra
El QA manual revisa una muestra del 2% al 5% de los tickets porque una persona solo puede leer una cantidad limitada. Los agentes de IA hacen insostenible ese techo: trabajan con volúmenes que ningún equipo de revisión puede muestrear de forma útil, y un fallo poco frecuente pero dañino casi siempre estará en el 95% que nadie lee.
Automatice la evaluación
Conecte el helpdesk o el CRM donde ya están sus conversaciones y deje que el sistema evalúe cada interacción atendida por IA en cuanto llega, de forma continua y en segundo plano. Kaizo se integra de forma nativa con Zendesk y Salesforce y lee las conversaciones directamente de los sistemas que ya utiliza, así que no hay un pipeline aparte que mantener.
Por qué la cobertura total importa más con la IA
Un solo agente de IA aplica el mismo comportamiento en miles de conversaciones, de modo que un defecto sistemático, una política mal interpretada o una mala configuración por defecto, se repite a gran escala. Evaluar el 100% es lo que saca a la luz ese patrón a tiempo. En UiPath, Kaizo automatizó el 100% del QA con un ROI del 200%, que es el nivel de cobertura que exige hoy el volumen atendido por IA.
Véalo en sus propias conversaciones. Kaizo evalúa el 100% de sus conversaciones de atención al cliente y convierte los resultados en coaching. Reservar una demo.
Paso 3: mantenga al evaluador independiente
Este es el paso que la mayoría de los equipos se salta, y es el que decide si se puede confiar en su QA de la IA. No deje que el equipo que construyó un agente de IA sea el único que lo evalúa. Un equipo al que se juzga por lo bien que queda el agente no es el mejor juez de si el agente es bueno.
Las evidencias hacen creíble la nota
El evaluador debe aplicar la misma scorecard tanto si la conversación la atendió una persona como su propio bot o la IA de un tercero. Kaizo evalúa el 100% de las conversaciones de agentes humanos y de agentes de IA con su propia scorecard, y cada nota enlaza con las evidencias de la conversación, así que su veredicto sobre un agente se puede comprobar en lugar de aceptarlo a ciegas.
Qué preguntar a un proveedor de QA
- ¿Puede evaluar un agente de IA creado por otra empresa con la misma scorecard que la nuestra?
- ¿Cada nota enlaza con las evidencias, para que podamos comprobar su criterio en lugar de aceptarlo a ciegas?
Paso 4: detecte los fallos propios de la IA
Una vez que la evaluación funciona en todas las conversaciones, oriéntela hacia los fallos que son exclusivos de la automatización o que esta amplifica. Estas son las categorías que vale la pena aislar y seguir a lo largo del tiempo.
| Tipo de fallo | Cómo se manifiesta | Qué comprueba la scorecard |
|---|---|---|
| Información incorrecta | El agente afirma una política, un precio o un paso que es falso | ¿Cada afirmación factual era correcta y estaba respaldada por sus fuentes? |
| Escalamiento omitido | El agente sigue gestionando un caso que debía pasar a una persona | ¿Escaló con el disparador correcto y a tiempo? |
| Falsa certeza | Una respuesta incorrecta dada como si fuera segura | ¿Evitó el agente inventar detalles que no podía verificar? |
| Tono inadecuado | Lenguaje robótico o despectivo ante un cliente frustrado | ¿El tono se ajustó al estado emocional del cliente? |
| Incumplimiento de políticas | El agente hace algo que se le indicó rechazar | ¿Se mantuvo dentro de sus límites de seguridad y de políticas? |
Paso 5: lleve los hallazgos de vuelta y vuelva a evaluar
El QA solo vale la pena si cambia el comportamiento. Como cada nota de Kaizo enlaza con el momento exacto de la transcripción que la generó, un fallo no es solo una alerta: es un ejemplo concreto y reproducible sobre el que puede actuar.
Cierre el ciclo
- Devuelva los fallos de exactitud al prompt, a la base de conocimiento o a la fuente que produjo la respuesta incorrecta.
- Convierta los escalamientos omitidos en una regla de enrutamiento o un disparador más estrictos.
- Agrupe los fallos recurrentes para corregir el patrón una sola vez en lugar de parchear los casos uno a uno.
Después, vuelva a evaluar para confirmar que la corrección se mantiene. Una cobertura total y continua le permite ver el efecto de un cambio en todas las conversaciones, no en una muestra que podría pasar por alto la regresión.
Errores comunes que debe evitar
Algunos errores minan en silencio los programas de QA de la IA antes de que aporten valor.
- Muestrear la IA como muestreaba a las personas: una muestra del 2% de un bot de alto volumen pasa por alto los fallos sistemáticos casi por diseño.
- Dejar que el equipo que construyó el agente lo evalúe solo: sin un evaluador independiente, una nota que parece buena no equivale a un buen trabajo.
- Evaluar sin evidencias: una nota que no puede rastrear hasta una línea de la transcripción no se puede verificar, usar en coaching ni rebatir.
- Reutilizar sin cambios la scorecard de los agentes humanos: los fallos propios de la IA, como la alucinación y la falsa certeza, necesitan sus propios criterios.
- Medir sin llevar nunca los hallazgos de vuelta: un QA que no cambia prompts, salvaguardas ni enrutamiento no es más que generar informes.
Preguntas frecuentes
¿Cómo se hace el control de calidad de un agente de IA o un chatbot?
Cree una scorecard que defina una buena conversación atendida por IA, que cubra exactitud, resolución, escalamiento correcto, tono y cumplimiento de políticas. Evalúe con ella el 100% de las conversaciones con IA de forma automática, mantenga al evaluador independiente de la IA evaluada y vincule cada nota con las evidencias de la transcripción para que los fallos se puedan verificar y corregir.
¿Por qué el evaluador debe ser independiente del agente de IA?
Si las únicas personas que evalúan un agente de IA son las que lo construyeron, tienen un incentivo para que el agente quede bien. Un evaluador que vincula cada nota con las evidencias de la conversación es lo que hace creíble la nota, porque cualquiera puede comprobarla.
¿Se puede usar la misma scorecard para agentes de IA y agentes humanos?
Puede compartir los criterios que se aplican a ambos, como la resolución y el tono, lo que mantiene comparables el QA de la IA y el de las personas. Pero la IA necesita criterios adicionales para sus propios fallos, como la alucinación y la falsa certeza, así que el mejor enfoque es un único estándar con comprobaciones específicas para la IA.
¿Qué parte de las conversaciones con IA hay que revisar?
Todas. La IA trabaja con volúmenes que ningún equipo puede muestrear de forma útil, y un defecto sistemático se repite en cada conversación que atiende el agente, así que una muestra pequeña normalmente no lo detecta. La evaluación automática del 100% de las conversaciones es lo que saca a la luz esos patrones a tiempo.
¿Qué fallos de un agente de IA debe seguir una scorecard?
Vale la pena seguir por separado cinco categorías: información incorrecta, escalamientos omitidos, falsa certeza, tono inadecuado e incumplimiento de políticas. Para cada una, la scorecard comprueba una pregunta concreta, por ejemplo si cada afirmación factual estaba respaldada por sus fuentes o si el agente escaló a tiempo.
Lecturas relacionadas
- ¿Qué es el QA agéntico? (en inglés)
- ¿Qué es el Auto QA? (en inglés)
- ¿Qué es un agente de IA? (en inglés)
- Cómo medir el rendimiento de los agentes de IA
- ¿Qué es LLM as a judge? (en inglés)
- ¿Qué precisión tiene el QA con IA?
- Cómo redactar una rúbrica de QA que una IA pueda evaluar (en inglés)
- Cómo validar la evaluación del QA con IA en una semana (en inglés)
- Falsos positivos en el QA automatizado (en inglés)