Un agente de IA falla de forma distinta a una persona, así que la scorecard de agentes de IA elimina los criterios que solo se aplican a humanos y conserva los que tienen que ver con resolver el problema. Además, añade controles de alucinaciones, escalamientos inseguros, respeto del alcance y capacidad de admitir lo que no sabe.
En resumen
- La calidez del tono dice poco. La exactitud de los datos lo dice casi todo.
- Evalúe todas las conversaciones de la IA, porque los fallos automatizados se repiten a escala.
- Los peores fallos de la IA son silenciosos y nunca se escalan.
- No deje que el equipo que construyó el agente sea el único que lo evalúa.
Por qué no puede reutilizar la scorecard de agentes humanos
Al desplegar un agente de IA, el primer instinto es evaluarlo con la scorecard que ya tiene. Es tentador porque el objetivo parece el mismo: una buena conversación con el cliente. Pero la scorecard que diseñó para personas parte de supuestos sobre cómo fallan las personas, y un agente de IA rompe esos supuestos en ambas direcciones.
Un agente humano no suele inventarse una política de reembolso que no existe, pero puede mostrarse seco bajo presión. Un agente de IA casi nunca será seco, pero afirmará una política inventada con total seguridad. Evaluar al agente de IA por la calidez del tono dice poco, porque el tono es lo que produce con más fiabilidad. Evaluar si cada afirmación que hizo era cierta lo dice casi todo, porque ahí es donde realmente falla. La scorecard tiene que llevar su atención adonde ahora está el riesgo. Nuestro método completo de control de calidad de agentes de IA y chatbots cubre el proceso alrededor de esto; la pregunta aquí es más concreta: qué va realmente en la scorecard.
Criterios humanos que dejan de tener sentido
Empiece por quitar los criterios que miden algo que un agente de IA no tiene o en lo que no varía.
- Tono y calidez como indicador de empatía: el tono de un agente de IA lo fija su prompt y apenas varía, así que evaluarlo mide la configuración, no la interacción. La empatía sigue importando, pero como la pregunta de si la respuesta fue adecuada al estado del cliente, algo que se trata más abajo.
- Esfuerzo e iniciativa: criterios como «ir más allá» presuponen una persona que decide hacer más. No encajan en un sistema que ejecuta instrucciones.
- Cumplimiento de un guion memorizado: se sustituye por el respeto del alcance y de las políticas, un control distinto y más preciso para una máquina.
- Criterios de desarrollo personal: todo lo relativo a que el agente aprenda o mejore corresponde al responsable del modelo, no a una nota por conversación.
Quitar estos criterios no es bajar el listón. Es apuntarlo a los fallos que realmente pueden ocurrir.
Criterios propios de una scorecard de agentes de IA
Estos añadidos son los que la convierten en una scorecard de agentes de IA y no en una scorecard humana reciclada. Cada uno describe un fallo que una persona rara vez comete y que una máquina comete de forma habitual.
| Criterio | Qué comprueba | Por qué un humano rara vez lo activa |
|---|---|---|
| Exactitud de cada afirmación | Nada de lo que dijo el agente era inventado o erróneo | Las personas matizan cuando dudan; los modelos afirman con la misma seguridad tanto si aciertan como si no |
| Fidelidad a las políticas | El agente no inventó, suavizó ni exageró una política | Una persona sabe cuándo no conoce una política; un modelo genera una que suena plausible |
| Respeto del alcance | El agente se mantuvo dentro de lo que puede hacer o prometer | Las personas perciben el límite de su autoridad; a un modelo hay que indicárselo y puede sobrepasarlo |
| Comportamiento de escalamiento | Derivó cuando debía y no dejó atrapado al cliente | Una persona se da cuenta de que está atascada; un modelo puede entrar en bucle o llegar a un callejón sin salida sin notarlo |
| Honestidad ante la incertidumbre | Dijo que no lo sabía en lugar de adivinar | Adivinar con seguridad es el comportamiento por defecto de un modelo, no de una persona |
| Gestión segura de solicitudes sensibles | Rechazó o derivó correctamente casos de autolesión, fraude o riesgo legal | El criterio que una persona aplica por instinto tiene que ser un criterio explícito para una máquina |
Criterios que se mantienen
Algunas cosas importan con independencia de quién o qué responda, y son la columna vertebral de la scorecard.
- ¿Se resolvió el problema?: el cliente se fue con su problema resuelto, no simplemente sin hablar con un humano. Es el criterio que la tasa de contención (en inglés) pasa por alto sin decirlo.
- ¿La información era correcta y completa?: compartido con la scorecard humana, pero con mucho más peso aquí.
- ¿Se trató al cliente de forma adecuada?: se replantea de calidez a adecuación, es decir, si la respuesta encajaba con la situación y el estado emocional del cliente.
- ¿Fue eficiente la interacción para el cliente?: no el tiempo de gestión del agente, sino si el cliente llegó a su objetivo sin bucles innecesarios.
Cómo redactar una rúbrica que una IA pueda evaluar (en inglés) explica cómo formular cada uno de estos criterios para que se pueda comprobar con la transcripción en lugar de ser cuestión de opinión.
Cómo evaluar con ella: cobertura y trazabilidad
Dos cosas separan una scorecard de agentes de IA que funciona de una decorativa.
Evaluarlo todo, no una muestra
El QA de agentes humanos evaluaba unas pocas conversaciones por agente porque leerlas era caro. Esa lógica no sirve para los agentes de IA, porque sus fallos son sistemáticos: una debilidad del prompt que produce una alucinación la produce cientos de veces, y una muestra del 2% normalmente no detecta el patrón hasta que ya es un problema. Evaluar el 100% de las conversaciones (en inglés) es lo que convierte la scorecard en un instrumento de monitoreo y no en un control puntual. En UiPath, Kaizo automatizó el 100% del QA con un ROI del 200% y una mejora del 8% en la nota de calidad.
Vincular cada nota a la transcripción
Una nota de exactitud o de fidelidad a las políticas solo es útil si puede ver las líneas exactas que motivaron el fallo. Si no, no puede corregir el prompt ni defender la nota cuando el equipo responsable del agente la cuestione. Cada nota de Kaizo apunta a la evidencia que la produjo.
No deje que quien lo construyó sea el único evaluador
El punto estructural incómodo: si el equipo que construyó su agente de IA es el único que lo evalúa, los criterios con más probabilidad de ser laxos son justo los que harían quedar mal al agente. Evalúe criterios como la exactitud de los datos y los escalamientos inseguros con su propia scorecard, y asegúrese de que cada nota enlace con la evidencia de la conversación. La taxonomía de fallos silenciosos profundiza en los fallos que un evaluador indulgente suele pasar por alto.
Preguntas frecuentes
¿Qué es una scorecard de agentes de IA?
Es el conjunto de criterios con el que se evalúan las conversaciones que gestiona un sistema automatizado en lugar de una persona. Se diferencia de una scorecard de QA para agentes humanos porque elimina los criterios que solo se aplican a personas, conserva los que miden si se resolvió el problema del cliente y si la información era correcta, y añade criterios propios de la automatización, como la exactitud de los datos, la fidelidad a las políticas, el respeto del alcance y el comportamiento de escalamiento.
¿Puedo usar mi scorecard de QA actual para un agente de IA?
No sin cambiarla. Una scorecard humana parte de supuestos sobre cómo fallan las personas, y los agentes de IA fallan de otra manera. La calidez del tono apenas varía en un modelo y dice poco, mientras que los datos inventados y las políticas inventadas, que las personas rara vez producen, se convierten en el riesgo principal. Reutilizar la scorecard humana dirige su atención a los fallos equivocados.
¿Qué criterios son propios de la evaluación de un agente de IA?
La exactitud de cada afirmación, la fidelidad a las políticas (no inventar ni exagerar una política), el respeto del alcance, el comportamiento de escalamiento (derivar cuando se atasca en lugar de dejar atrapado al cliente), la honestidad ante la incertidumbre y la gestión segura de solicitudes sensibles. Cada uno describe un fallo que una persona rara vez comete y que un modelo comete de forma habitual.
¿Hay que evaluar todas las conversaciones de un agente de IA o solo una muestra?
Todas. Los fallos de los agentes de IA son sistemáticos: una debilidad del prompt que produce una alucinación la produce cientos de veces, y una muestra del 2% normalmente no detecta el patrón hasta que ya es un problema. Evaluar el 100% de las conversaciones convierte la scorecard en un instrumento de monitoreo y no en un control puntual.
¿Por qué el equipo que construyó el agente de IA no debe ser el único que lo evalúa?
Porque los criterios con más probabilidad de ser laxos son los que harían quedar mal al agente. Evalúe la exactitud de los datos y los escalamientos inseguros con su propia scorecard, y vincule cada nota a la evidencia de la transcripción.
Términos relacionados
- Control de calidad de agentes de IA y chatbots
- Fallos silenciosos en agentes de IA: una taxonomía
- Cómo redactar una rúbrica de QA que una IA pueda evaluar (en inglés)
- Cómo medir el rendimiento de los agentes de IA
- Cómo evaluar el 100% de las conversaciones (en inglés)
Cree una scorecard de agentes de IA que detecte lo que importa
Traiga las conversaciones que su agente de IA gestionó el mes pasado y la scorecard que usa hoy. Le mostraremos qué criterios dejan de tener sentido para una máquina, qué fallos no ve su scorecard actual y qué detecta en su lugar una scorecard diseñada para la automatización. Cada nota remite a las líneas exactas de la transcripción.