Saltar al contenido

Buenas prácticas

Calidad en BPO: por qué una muestra del 2% no basta

Calidad en BPO: lo que deja sin leer una muestra evaluada por el propio proveedor, por qué la cobertura sola no lo resuelve y qué cambia una scorecard común.

· 15 min de lectura

Revisado por Dominik Blattner, fundador de Kaizo

En esta página

La calidad en BPO no se controla con una muestra del 2%: el proveedor lee entre el 2% y el 3% de sus propios tickets, evalúa su propio trabajo y deja sin leer entre el 97% y el 98%. Gobernar un BPO exige evaluar cada conversación y una scorecard que tanto la empresa cliente como el proveedor puedan auditar.

Parte 1 de 4 de la serie sobre la gobernanza del soporte externalizado. Escrito para responsables de atención al cliente, CX y gestión de proveedores.

En resumen

  • Las muestras pequeñas pasan por alto los fallos poco frecuentes que hacen perder clientes.
  • La cobertura total ya es lo habitual. Lo que marca la diferencia son notas trazables y que se puedan impugnar.
  • Con varios proveedores hace falta una scorecard común para compararlos o hacer cumplir un SLA.
  • Una scorecard común también ayuda al BPO a demostrar su calidad.

Ir a

  1. Qué significa hoy
  2. Cuánto se escapa en una muestra
  3. La cobertura es solo el principio
  4. Varios proveedores, una sola base
  5. Por qué el BPO también gana
  6. Cómo hacer el cambio
  7. La pregunta que conviene hacer

Qué significa hoy el control de calidad en BPO

Cuando una empresa de software en pleno crecimiento confía su atención de primer nivel a un socio de Business Process Outsourcing (BPO), la economía unitaria es convincente. La atención pasa a estar disponible las 24 horas del día. La plantilla crece sin necesidad de un proceso de contratación propio. El coste por contacto baja. Nada de eso está en duda, y las empresas que lo hacen no se equivocan.

Lo que a menudo no crece al mismo ritmo que la plantilla es la gobernanza. Las conversaciones de atención al cliente se van al extranjero, pero el sistema de medición que le dice si esas conversaciones son buenas suele quedarse exactamente como estaba cuando el equipo trabajaba en sus oficinas: una muestra de tickets, leída por una persona, evaluada en un formulario.

La diferencia es que la persona que las lee ahora trabaja para el proveedor al que se está midiendo.

Externalizar la plantilla es una decisión comercial sensata. Externalizar la scorecard es otra decisión, y la mayoría de las empresas la toman por accidente.

En un esquema típico, el BPO emplea a sus propios analistas de calidad. Esos analistas extraen una muestra de los tickets de la semana, los leen según una rúbrica, asignan notas y consolidan el resultado en un informe mensual para la empresa cliente. El informe llega en una hoja de cálculo. Normalmente dice que la calidad es alta.

No es que la cifra sea deshonesta. Es que nadie del lado de la empresa cliente puede comprobarla, porque los tickets que la respaldan los eligió la parte evaluada y el razonamiento detrás de cada nota nunca quedó registrado en ningún lugar que la empresa cliente pueda ver.

¿Cuánto se escapa realmente en una muestra del 2%?

Tomemos una operación de atención al cliente de tamaño medio que gestiona 15.000 conversaciones al mes a través de un socio de outsourcing. Con una muestra del 3%, el programa de calidad lee 450. Las 14.550 restantes no las evalúa nadie.

  • 450 conversaciones leídas al mes con una muestra del 3% de 15.000
  • 14.550 conversaciones que nadie evalúa, del mismo volumen
  • 1 de cada 50: una tasa de fallos que una muestra de 50 tickets normalmente no detecta en absoluto

El problema no es solo el tamaño del hueco. Es qué fallos viven dentro de él. El muestreo detecta bien lo que ocurre constantemente y mal lo que ocurre de vez en cuando, y los fallos que le cuestan dinero de verdad son casi siempre ocasionales.

Un problema de tono que aparece en una de cada tres conversaciones saldrá en cualquier muestra que tome. Una instrucción de migración que es incorrecta una vez cada quince días, dada al cliente que tenga la mala suerte de preguntar, no saldrá. La estadística de las muestras pequeñas (en inglés) es implacable en este punto, y ninguna diligencia del analista lo corrige.

El segundo problema del muestreo del que nadie habla

Una muestra solo es imparcial si se extrae al azar. En la práctica, la selección de tickets suele dejarse en manos del analista o responde a la comodidad: tickets recientes, tickets cortos, tickets de colas que el analista conoce bien. Cada uno de esos hábitos hace que la nota resultante sea menos representativa de lo que sugeriría el tamaño de la muestra. Cómo se seleccionan las conversaciones para revisión (en inglés) determina en silencio lo que significa la nota.

QA por muestreo evaluado por el proveedor frente a la evaluación de cada conversación:

QA por muestreo, evaluado por el proveedorQA con cobertura total en una scorecard común
Conversaciones evaluadasDel 2% al 3%, elegidas por la parte evaluadaCada conversación, no las elige nadie
De quién es la rúbricaCada proveedor mantiene la suyaUna sola rúbrica, aplicada igual a cada socio
Retraso en los reportesMensual o quincenal, a posterioriContinuo, visible para ambas partes a la vez
Fallos poco frecuentesEstadísticamente invisiblesAparecen como patrón en cuanto se repiten
Impugnar una notaDiscutir sobre una celda de una hoja de cálculoAbrir la conversación y leer la evidencia
Comparar dos proveedoresImposible, rúbricas distintasDirecto, mismo modelo y mismos criterios

Por qué la cobertura total es el punto de partida, no la respuesta

Sería cómodo cerrar el argumento aquí: evalúe cada conversación en lugar del 3% y el problema de gobernanza desaparece. Hace unos años era una afirmación defendible. Hoy ya no lo es.

Evaluar el 100% de las conversaciones (en inglés) se ha vuelto algo corriente. La mayoría de las plataformas serias de QA automatizado lo hacen, y quien compare proveedores escuchará la misma cifra de todos ellos. La cobertura es la condición previa para gobernar una operación externalizada. No es lo que hace que esa gobernanza sea fiable.

Cuando todos los proveedores afirman leer todas las conversaciones, la única pregunta que queda es si usted puede comprobar esa lectura.

Dos cosas lo deciden.

¿Puede rastrear la nota hasta la evidencia?

Una nota de calidad es una afirmación hasta que alguien puede abrirla y ver el momento concreto de la conversación que la produjo. Si a un agente del BPO se le penaliza por un incumplimiento normativo, el account manager debería poder hacer clic en el criterio y llegar a la frase que lo provocó. Sin eso, la empresa cliente solo ha cambiado una cifra no auditable por otra más rápida. La trazabilidad de la nota (en inglés) es lo que hace posible una conversación de gobernanza en lugar de un enfrentamiento.

¿Es el evaluador independiente del trabajo evaluado?

Este es el punto estructural. El proveedor no debería ser el único autor de su propia nota de calidad, por la misma razón por la que los auditores no trabajan para la empresa que auditan.

Cómo lo perciben los agentes

La cobertura total es fácil de presentar mal. Cuando se les dice que ahora se lee cada conversación, los agentes externalizados lo interpretan, con razón, como vigilancia, y los programas de QA que llegan sonando a monitoreo encuentran una resistencia que ningún dashboard resuelve. El planteamiento honesto es también el exacto: la cobertura elimina el sesgo de selección. Con una muestra del 3%, la mayor parte del buen trabajo era invisible y un solo ticket desafortunado podía definir un trimestre. Los programas en los que confían los agentes (en inglés) son los que plantean ese argumento primero.

Qué cambia una scorecard común cuando hay varios proveedores

Pocas empresas se quedan con un solo socio. Una operación madura puede tener un proveedor nocturno en una región, un socio bilingüe en otra y un equipo interno que gestiona escalamientos complejos de clientes enterprise. Cada uno llega con su propio sistema de calidad, su propia rúbrica y sus propios analistas.

El resultado son tres notas de calidad que no se pueden comparar. El proveedor A reporta un 94%, el proveedor B un 91%, y no hay forma de saber si esa diferencia es real o un artefacto de dos rúbricas ponderadas de forma distinta. Mientras tanto, el equipo interno se mide con un cuarto sistema, así que nadie puede responder la única pregunta que importa comercialmente: ¿cuál de ellos es realmente mejor, y a qué coste?

Poner a todos los socios en una misma scorecard cambia cuatro cosas a la vez.

  • La comparación se vuelve posible. Los mismos criterios, con la misma ponderación, aplicados por el mismo modelo a cada conversación de cada proveedor. Cómo ponderar los criterios pasa a ser una decisión que usted toma una vez, de forma deliberada, en lugar de una que cada proveedor toma por usted.
  • El cumplimiento del SLA gana una base probatoria. Un objetivo de calidad contractual solo es exigible si ambas partes aceptan la medición. Una nota trazable con cobertura total se puede defender en una revisión comercial, algo que no ocurre con una autoevaluación por muestreo.
  • El coaching se vuelve concreto. En lugar de una indicación genérica de mejorar el tiempo de resolución, puede ver que un grupo concreto falla un criterio concreto en un tipo de ticket concreto, que es el nivel de detalle que el coaching realmente necesita (en inglés).
  • Las decisiones de enrutamiento se apoyan en evidencia. Qué socio debe absorber el próximo aumento de volumen deja de ser una negociación de compras y se convierte en una pregunta de datos.

Vea su propia combinación de proveedores en una sola scorecard. Traiga las conversaciones del mes pasado de cada socio. Las evaluaremos con una única rúbrica y le mostraremos dónde difieren de verdad los proveedores. Reservar una demo

Por qué también es una buena noticia para el BPO

Es fácil escribir sobre la calidad externalizada como si el proveedor fuera el problema. Ese enfoque es popular, es de confrontación y en su mayor parte es erróneo. Los BPO no quieren ofrecer malas conversaciones. Dirigen un negocio cuyo argumento comercial se basa por completo en ofrecer un servicio que a la empresa cliente le costaría prestar a ese precio, y una empresa cliente que no puede ver la calidad solo renegocia en función del precio.

Un proveedor sin forma de demostrar su calidad solo puede competir en tarifa. La evidencia es lo que permite a un buen BPO defender algo mejor que la oferta más barata.

La hoja de cálculo mensual autoevaluada también es un mal negocio para el socio de outsourcing. Genera una desconfianza a la que no puede responder, convierte cada conversación sobre calidad en una negociación sobre metodología y no le da al proveedor ningún mecanismo para demostrar que su equipo es mejor que un competidor más barato. Una scorecard común y trazable sustituye todo eso por un registro que ambas partes leen de la misma manera.

No es teoría. EverHelp, un proveedor de outsourcing, puso su propia operación en QA automatizado y aumentó sus evaluaciones de QA un 270% mientras mantenía estable su puntaje de calidad interno, y redujo un 75% el tiempo que sus líderes dedicaban a preparar las sesiones de coaching. Es un proveedor que usa la evaluación como un activo comercial, no que se somete a una auditoría. La historia completa de EverHelp (en inglés) merece la lectura si usted está del lado del proveedor en esta relación.

Cómo es una buena relación vista desde ambos lados

  • La empresa cliente ve la calidad de forma continua en lugar de mensual, y puede explicar cualquier nota que cuestione.
  • El proveedor demuestra su rendimiento con evidencia y no con afirmaciones, y puede señalar el coaching concreto que realizó como respuesta.
  • Ambas partes discuten sobre las mismas conversaciones y no sobre qué rúbrica es más justa.
  • La calibración entre los revisores de la empresa cliente y los del proveedor se convierte en un ejercicio programado en lugar de una fuente de fricción. Organizar sesiones de calibración (en inglés) es la forma de que ambas partes sigan de acuerdo sobre lo que significan los criterios.

Cómo pasar un programa externalizado a una sola scorecard

No tiene por qué empezar como una renegociación del contrato. En la práctica, la secuencia que funciona es deliberadamente poco amenazante.

  1. Acuerde la rúbrica antes de medir nada. Redacte los criterios con el proveedor en la sala. Una rúbrica impuesta a un socio genera disputas; una rúbrica escrita en conjunto genera una base de referencia. Qué debe incluir una rúbrica es una pregunta más difícil de lo que parece.
  2. Empiece en modo sombra. Evalúe cada conversación sin asociar consecuencias al resultado y compárelo con las notas por muestreo que ya tiene el proveedor. El shadow scoring (en inglés) es la forma en que ambas partes ganan confianza en el evaluador antes de que algo dependa de él.
  3. Valide el evaluador con sus propias conversaciones. Tome un conjunto de tickets que su equipo ya haya evaluado a mano, páselos por el sistema y compruebe dónde discrepan ambos y por qué. Validar la evaluación con IA (en inglés) con un conjunto conocido es el paso que la mayoría de los programas se saltan y luego lamentan.
  4. Publique la vía de impugnación desde el primer día. Los agentes y los líderes de equipo necesitan una forma definida de impugnar una nota y ver cómo se revisa. Un proceso de impugnación que funcione (en inglés) es lo que separa una herramienta de gobernanza de una herramienta de vigilancia.
  5. Solo entonces vincúlelo a la revisión comercial. Cuando ambas partes confían en la medición, puede tener peso en el SLA.

¿Es auditable la gobernanza de su BPO? Nueve preguntas

Marque cada afirmación que pueda respaldar hoy con evidencia, no con una garantía del proveedor.

  • Sé qué porcentaje de mis conversaciones externalizadas se evaluó el mes pasado.
  • Sé quién seleccionó las conversaciones que se evaluaron.
  • Cada proveedor y cada equipo interno se evalúa con la misma rúbrica, con la misma ponderación.
  • Puedo abrir cualquier nota individual y ver la evidencia de la conversación que la produjo.
  • Podría impugnar una nota concreta en una revisión con el proveedor y resolverla a partir del registro.
  • Sé qué categoría de fallo me cuesta más, en todos los proveedores.
  • Los agentes del proveedor tienen una vía definida para impugnar una nota.
  • Mi medición de la calidad es independiente de la parte evaluada.
  • Podría decir hoy cuál de mis socios ofrece la mejor calidad por unidad de coste.

Seis marcas o menos significan que sus reportes de calidad son una afirmación y no un registro. Es el punto de partida normal, y se puede corregir sin cambiar de proveedor.

La pregunta que conviene hacer en la próxima revisión con el proveedor

De los clientes que se fueron el trimestre pasado, ¿cuántos tuvieron conversaciones gestionadas por un socio de outsourcing, y qué pasó en esas conversaciones?

La mayoría de las empresas no pueden responder, porque esas conversaciones formaban parte del 97% que nadie leyó. La respuesta no es volver a internalizar la atención al cliente. Es dejar de aceptar una autoevaluación por muestreo como gobernanza cuando el volumen, el valor del contrato y las relaciones con los clientes que están en juego merecen un registro.

UiPath automatiza hoy el 100% de su QA con Kaizo, mide un retorno del 200% frente a su propia línea de base y ha subido su nota de calidad 8 puntos, mientras sigue mejorándola trimestre a trimestre. Esa es la escala en la que medir la calidad deja de ser una tarea operativa y pasa a ser un insumo para dirigir el negocio.

Externalizar el trabajo fue la decisión correcta. Mantener el estándar es la parte que no se delega.

Preguntas frecuentes

¿Qué es el control de calidad en BPO?

El control de calidad en BPO es el proceso de evaluar la calidad de las conversaciones con clientes que gestiona un socio de outsourcing según un conjunto definido de criterios. Tradicionalmente lo realizan analistas de calidad empleados por el BPO, que revisan manualmente una muestra de entre el 2% y el 3% de los tickets y reportan las notas a la empresa cliente cada mes. Los programas modernos evalúan cada conversación de forma automática con una única rúbrica compartida por la empresa cliente y el proveedor, de modo que ambas partes leen el mismo registro.

¿Qué porcentaje de tickets revisa un programa de calidad típico de un BPO?

Entre el 2% y el 3% del volumen total de tickets es el rango habitual en el muestreo manual, lo que deja sin evaluar entre el 97% y el 98% de las conversaciones. Con un volumen de 15.000 conversaciones al mes, una muestra del 3% significa que se leen 450 conversaciones y 14.550 no. El tamaño de la muestra importa menos que el hecho de que los fallos que ocurren de vez en cuando, y no constantemente, difícilmente aparecerán en ella.

¿Por qué el QA por muestreo es un problema cuando la atención al cliente está externalizada?

Se suman dos razones. Primero, una muestra pequeña no puede detectar de forma fiable los fallos poco frecuentes, y los fallos poco frecuentes suelen ser los caros. Segundo, cuando el proveedor selecciona la muestra y la evalúa, la empresa cliente no tiene ninguna forma independiente de verificar el resultado. La nota puede ser perfectamente correcta, pero es una afirmación y no un registro, lo que dificulta actuar sobre ella en el plano comercial.

¿Basta con evaluar el 100% de las conversaciones para resolver la gobernanza de un BPO?

No. La cobertura total ya es lo habitual en las plataformas serias de QA automatizado, así que ya no distingue un enfoque de otro. Lo que importa es si cada nota puede rastrearse hasta la evidencia concreta de la conversación que la produjo, y si la parte que evalúa es independiente del trabajo evaluado. La cobertura es la condición previa; la trazabilidad y la independencia son lo que hace fiable la medición.

¿Cómo se comparan dos proveedores BPO de forma justa?

Ponga a ambos en la misma rúbrica, con idéntica ponderación, aplicada por el mismo modelo de evaluación a cada conversación de cada proveedor. Mientras cada socio mantenga su propio sistema de calidad, las notas reportadas no son comparables, porque la diferencia entre un 94% y un 91% puede explicarse por completo por cómo está construida cada rúbrica y no por ninguna diferencia en las conversaciones.

¿Este enfoque funciona para el BPO tanto como para la empresa cliente?

Sí, y suele ser un mejor negocio para un proveedor competente. Sin evidencia compartida, un BPO solo puede competir en tarifa, porque no tiene forma de demostrar que su servicio es mejor que una oferta más barata. Una scorecard trazable permite a un proveedor demostrar su calidad, enfocar el coaching con precisión y defender su posición en una revisión comercial. EverHelp, un proveedor de outsourcing, aumentó sus evaluaciones de QA un 270% con QA automatizado y redujo un 75% el tiempo de preparación del coaching.

¿Tenemos que cambiar de proveedor BPO para resolverlo?

Por lo general, no. La capa de medición se sitúa sobre la operación existente a través del helpdesk, en lugar de sustituir las herramientas del proveedor, así que los mismos socios siguen haciendo el mismo trabajo mientras ambas partes obtienen un registro compartido. La mayoría de los programas empiezan en modo sombra, evaluando conversaciones sin consecuencias comerciales, y solo vinculan el resultado a las revisiones del SLA cuando ambas partes confían en el evaluador.

¿Con qué helpdesks trabaja Kaizo en operaciones externalizadas?

Kaizo se integra de forma nativa con Zendesk y Salesforce Service Cloud. Como la integración es nativa y no un conector genérico, la capa de evaluación se sitúa directamente sobre las conversaciones que sus proveedores ya gestionan, y por eso el onboarding se mide en días y no en meses.

Lecturas relacionadas

Ponga a todos sus proveedores en la misma scorecard

Traiga un mes de conversaciones de cada uno de sus socios de outsourcing. Las evaluaremos todas con una única rúbrica y le mostraremos, con la evidencia adjunta, dónde difieren de verdad los proveedores.

Reservar una demo Kaizo para BPO

Preparado para el EU AI Act . Certificación SOC 2 e ISO 27001 . Integraciones nativas con Zendesk y Salesforce Service Cloud

En esta página

Véalo en sus propias conversaciones

Evaluaremos una muestra de sus tickets reales con sus propios estándares, para que el ejemplo sea el suyo.

La confianza de equipos de atención al cliente de todo el mundo

  • Foot Locker
  • SteelSeries
  • Canva
  • GetYourGuide
  • Instacart