Volver al blog

El modelo de IA más grande no siempre es el mejor para atención al cliente

Elegir un modelo de IA para atención al cliente no consiste simplemente en escoger el más potente o el que lidera los benchmarks. Su capacidad para completar procesos correctamente, la velocidad y el coste pueden ser más importantes que su inteligencia general.
Victoria Obrador
Sep 02, 2026
8 minutos leer

Los benchmarks generales dicen poco sobre la atención al cliente

La mayoría de los benchmarks de IA evalúan capacidades como programación, matemáticas, cultura general o razonamiento complejo. Son útiles para entender el potencial de un modelo, pero dicen poco sobre cómo se comportará como agente de IA en una conversación real con un cliente.

Porque los clientes rara vez formulan sus preguntas de forma perfecta. Pueden decir, por ejemplo: “Se suponía que mi pedido llegaría ayer, pero todavía no he recibido nada. ¿Podéis comprobar dónde está?”

A partir de ahí, el agente de IA tiene que entender qué necesita el cliente, localizar el pedido, comprobar su estado, determinar qué información puede compartir y ejecutar correctamente el siguiente paso.

No basta con acertar en la respuesta final. Todo el proceso tiene que funcionar.

Por qué hemos desarrollado CM-ServiceBench

CM-ServiceBench evalúa los modelos de IA a través de conversaciones completas de atención al cliente.

En lugar de analizar únicamente la respuesta final, examina cada paso del proceso: el razonamiento, el uso de las herramientas adecuadas, la correcta ejecución de los flujos de trabajo y el cumplimiento de los límites de seguridad.

Nos centramos en tres áreas fundamentales:

Elegir el camino correcto

Todo empieza por entender qué quiere realmente el cliente. Parece sencillo hasta que la petición llega de forma incompleta, ambigua o inesperada.

Un buen agente de IA debe identificar correctamente la intención y decidir qué pasos seguir. Si se equivoca al principio, puede ejecutar perfectamente todo lo demás y aun así llegar al resultado equivocado.

Ejecutar correctamente los flujos de trabajo

La mayoría de las consultas de atención al cliente requieren algo más que generar una respuesta.

Procesar una devolución, reprogramar una cita o consultar el estado de un pedido puede implicar identificar al cliente, recuperar sus datos, comprobar si cumple determinados requisitos, tomar una decisión y ejecutar una acción.

Y el orden importa. Si un agente completa correctamente cinco de seis pasos, el resultado puede seguir siendo incorrecto.

Ahí está una de las grandes diferencias entre generar una buena respuesta y resolver realmente una consulta: un agente de IA debe ser capaz de seguir y ejecutar todo el proceso de forma fiable.

Saber también qué no hacer

Un buen agente de IA no solo debe saber cómo actuar. También debe reconocer cuándo no hacerlo.

No debería inventar información, compartir instrucciones internas, mostrar datos que no corresponden al cliente ni ejecutar una acción cuando no dispone de información suficiente.

Cuando hablamos de un agente de IA en producción, ser útil no es suficiente. También tiene que ser predecible.

¿Cómo evaluamos una conversación?

Con CM-ServiceBench hacemos que los modelos gestionen cientos de conversaciones en diferentes situaciones e idiomas.

Una segunda IA adopta el papel del cliente, con su propio objetivo, contexto e información, y mantiene una conversación con el agente que estamos evaluando. Los escenarios se basan en patrones reales de atención al cliente.

Después analizamos la conversación completa: ¿entendió correctamente la intención?, ¿utilizó las herramientas adecuadas?, ¿ejecutó los pasos en el orden correcto?, ¿procesó bien la información?, ¿consiguió el resultado esperado?

Esta diferencia es importante. Un modelo puede dar una respuesta muy convincente y, al mismo tiempo, ejecutar incorrectamente el proceso.

Para el cliente, todo puede parecer correcto hasta que descubre que su cita nunca llegó a reprogramarse, que se consultaron datos equivocados o que su caso terminó en el departamento incorrecto.

¿Cómo mide CM-ServiceBench el rendimiento de los modelos de IA?

Una conversación puede funcionar razonablemente bien y, aun así, contener algún error. Por eso CM-ServiceBench mide los resultados utilizando dos criterios: parcial y estricto.

La puntuación parcial mide cuántas partes individuales de la conversación se han ejecutado correctamente.

El criterio estricto va más allá: solo considera que una conversación ha tenido éxito cuando todo el proceso se ha completado sin errores.

En atención al cliente, la diferencia es fundamental. Un modelo puede acertar en nueve de cada diez pasos y aun así ofrecer al cliente un resultado incorrecto.

Cuando cambiamos el criterio, cambia el ranking

Al evaluar los modelos de esta manera, la clasificación cambia considerablemente respecto a los benchmarks generales.

En nuestras pruebas, los modelos compactos de la familia GPT-5.6 se encuentran entre los que mejores resultados ofrecen en tareas de atención al cliente.

Modelo

Estricto

Parcial

GPT-5.6 Luna with thinking

71

92

GPT-5.6 Terra

69

91

GPT-5.6 Sol

66

90

GPT-5.6 Luna

63

88

Opus 4.6

63

90

GPT-5.5

61

88

Sonnet 5

58

86

Pero lo interesante no es simplemente qué modelo ocupa la primera posición.

Si comparamos GPT-5.6 Terra y Opus 4.6, por ejemplo, vemos que Opus 4.6 obtiene una puntuación elevada en el criterio parcial, pero inferior en el estricto. Es decir, suele avanzar correctamente durante buena parte del proceso, pero completa menos conversaciones de principio a fin sin errores.

En nuestras pruebas, GPT-5.6 Terra muestra una mayor consistencia al completar la tarea.

Y para el cliente, eso es lo que realmente importa: no lo brillante que haya sido el razonamiento durante el proceso, sino que su problema se haya resuelto.

Más grande no significa necesariamente más fiable

Esto no significa que los modelos más grandes sean peores. Están diseñados para abordar una enorme variedad de tareas complejas y esa capacidad puede ser muy valiosa cuando un agente debe tomar decisiones difíciles, procesar grandes cantidades de contexto o enfrentarse a situaciones imprevistas.

Pero no todas las tareas de atención al cliente necesitan ese nivel de complejidad.

En muchos procesos, la calidad depende de seguir las instrucciones de forma consistente, utilizar las herramientas adecuadas y no saltarse ningún paso. En esos casos, una mayor inteligencia general no se traduce automáticamente en mejores resultados.

Y podemos acabar pagando por una capacidad que esa tarea concreta no necesita, sin obtener a cambio una mejora en el rendimiento.

La velocidad del modelo también importa en atención al cliente

El rendimiento no es el único factor que importa.

Los agentes de IA interactúan directamente con personas y, por tanto, el tiempo de respuesta también influye en la experiencia. Si cada mensaje tarda varios segundos más en llegar, la conversación empieza a resultar lenta. En voz, donde cualquier retraso se percibe inmediatamente, este factor es todavía más importante.

CM-ServiceBench: rendimiento frente a velocidad

Rendimiento frente a velocidad de respuesta de los modelos evaluados con CM-ServiceBench

Cada punto representa un modelo. Cuanto más a la izquierda se sitúa, más rápido responde; cuanto más arriba, mayor es el número de conversaciones completadas sin errores.

El gráfico muestra por qué no existe un único ganador.

GPT-5.5 es el más rápido, con un tiempo medio de respuesta de 1,8 segundos por mensaje, pero no obtiene la puntuación estricta más alta. En el otro extremo, GPT-5.6 Luna with thinking alcanza la mejor puntuación de la prueba (71), pero responde más lentamente, con una media de 3,2 segundos.

GPT-5.6 Terra se sitúa en un punto intermedio: obtiene una puntuación estricta de 69 con un tiempo medio de respuesta de 2,8 segundos.

En la práctica, elegir un modelo significa precisamente eso: encontrar el equilibrio adecuado entre calidad y velocidad para cada tarea, no simplemente escoger el que consigue la puntuación más alta.

Y todavía falta una tercera variable: el coste.

Un modelo que consiga una puntuación ligeramente superior pero necesite mucha más capacidad de cálculo no tiene por qué ser la mejor opción para un proceso que se ejecuta miles de veces al día.

¿Cuál es el mejor modelo de IA para atención al cliente?

Preguntar “¿cuál es el mejor modelo de IA?” es demasiado genérico.

La pregunta realmente útil es:

¿Cuál es el mejor modelo para este agente y esta tarea concreta?

No existe un único mejor modelo de IA para atención al cliente. La elección depende de la tarea, la fiabilidad necesaria, la velocidad de respuesta y el coste. Un modelo compacto y rápido puede ser perfecto para un flujo de trabajo predecible. Un agente que deba tomar decisiones complejas o procesar grandes volúmenes de contexto puede beneficiarse de capacidades de razonamiento más avanzadas. Y cuando cada segundo cuenta, la velocidad puede pesar más que una pequeña diferencia en precisión.

Esto también significa que no es necesario utilizar un único modelo para todo el servicio de atención al cliente. Cada agente puede tener requisitos distintos. Incluso dentro del mismo agente, una tarea sencilla de clasificación puede necesitar un modelo diferente al utilizado para un análisis complejo o para ejecutar determinadas acciones.

La principal conclusión de CM-ServiceBench, por tanto, no es que exista un modelo ganador. Es que los modelos deben evaluarse en función del trabajo que realmente van a realizar.

Los benchmarks generales pueden servir como referencia. Pero para elegir un modelo para atención al cliente necesitamos saber algo mucho más concreto: con qué fiabilidad ejecuta nuestros procesos, a qué velocidad y a qué coste.

Cómo elegir el modelo de IA adecuado en HALO

HALO permite seleccionar el modelo de IA más adecuado en función de las necesidades de cada agente. También puedes asignar modelos diferentes a herramientas específicas, utilizando capacidades más avanzadas únicamente allí donde aportan valor.

Y esta decisión nunca es definitiva. Aparecen nuevos modelos, los existentes evolucionan y también cambian las relaciones entre rendimiento, velocidad y coste.

CM-ServiceBench nos permite evaluarlos continuamente utilizando las mismas tareas de atención al cliente para que la selección de modelos se base en datos reales y actualizados.

Elige el modelo adecuado para cada agente de IA

Descubre cómo HALO te permite utilizar el modelo de IA más adecuado para cada agente y tarea, equilibrando rendimiento, velocidad y coste.
¿Te gustó este artículo? ¡Compártelo!

Artículos relacionados

Ask HALO en HALO Studio para crear agentes, herramientas y analizar conversaciones AI

Ask HALO: el asistente de IA que crea, mejora y mantiene tus agentes de IA

Ask HALO es el asistente de IA de HALO Studio para crear, analizar y mejorar agentes de IA mediante lenguaje natural. Trabaja directamente con tus agentes, herramientas, conocimiento y conversaciones. Descubre cómo ya lo utilizan CheapCargo, Preston Palace, Winparts e Intergamma.

6 minutos leer Sep 02, 2026
halo-insurance CM.com

Qué es una empresa agéntica

Una empresa agéntica es aquella que integra agentes de IA autónomos para ejecutar procesos complejos en el núcleo de sus operaciones sin una constante intervención humana. Se diferencian de la automatización convencional porque utilizan sistemas que son capaces de aprender, razonar e incluso actuar con base en objetivos específicos. Todo gracias a soluciones como HALO: un software para la creación y gestión de agentes de IA que vuelve dinámicos los flujos de trabajo, permitiendo que la tecnología vaya más allá de una simple respuesta a consultas. La finalidad es que se resuelvan problemas del negocio mientras escala la experiencia del cliente y se optimiza la productividad.

5 minutos leer Mar 24, 2026
Agents of Agentic AI AI

¿Qué es RAG AI?

La generación aumentada por recuperación o RAG AI es una estructura de inteligencia artificial creada para optimizar la precisión de los modelos de lenguaje. Integra fuentes de datos externas en tiempo real y hace posible cosas que antes eran inimaginables. En comparación con sistemas convencionales, el RAG (Retrieval Augmented Generation) permite a los agentes inteligentes consultar información actualizada y específica antes de emitir una respuesta. Eliminando así las limitaciones derivadas del conocimiento estático. Dentro de nuestros servicios, la capacidad descrita es imprescindible a la hora de brindar soluciones conversacionales fiables. De hecho, cuando se combina la recuperación de datos verificados con la potencia generativa, las empresas alcanzan una comunicación más técnica y segura.

6 minutos leer Mar 24, 2026
Ai governance AI

La IA es cada vez más inteligente e independiente. ¿Cómo mantener el control?

Cada vez más empresas están implementando agentes de IA que van mucho más allá de generar contenido o responder preguntas simples. Estos agentes gestionan solicitudes de clientes, actualizan sistemas, activan flujos de trabajo e incluso completan transacciones. Esto aporta velocidad, eficiencia y alivio del trabajo manual y repetitivo. Pero una vez que la IA comienza a actuar en lugar de solo asistir, algo fundamental cambia. Necesitas más que una tecnología inteligente. Necesitas una forma clara de mantener el control sobre lo que hace, por qué lo hace y los límites dentro de los cuales puede operar. Aquí es donde entra en juego la gobernanza de la IA. No como una capa de cumplimiento burocrático, sino como una base práctica que mantiene la IA predecible, explicable y segura a medida que se vuelve más autónoma.

4 minutos leer Dec 16, 2025
blog-black-friday-customer-retention AI

De consumidores ocasionales a fans leales: Cómo fidelizar clientes después del Black Friday

El Black Friday es uno de los mayores eventos de compras, atrayendo a multitudes de compradores ansiosos por encontrar ofertas. Pero una vez que pasa la euforia, comienza el verdadero desafío: convertir a los compradores ocasionales en clientes recurrentes. La fidelización de clientes es vital para el éxito a largo plazo, y el periodo posterior al Black Friday es el momento ideal para transformar la emoción a corto plazo en relaciones duraderas. En este blog, aprenderás cómo mantener a los clientes comprometidos y lograr que vuelvan mucho después de que termine la temporada de compras.

6 minutos leer Nov 24, 2025
checklist de implementacion de agentes ia AI

Checklist de Implementación de Agentes IA

El panorama empresarial está cambiando gracias a la IA, la cual están adoptando tanto las empresas multinacionales como las más pequeñas. De hecho, la implementación de agentes IA ya es una necesidad estratégica que aporta una ventaja competitiva, esencial para la supervivencia empresarial. Desde CM.com te facilitamos una checklist de implementación para facilitar y agilizar el inicio del funcionamiento de las nuevas tecnologías que incluyen agentes IA en tu modelo empresarial.

5 minutos leer Aug 04, 2025
agentes ia para el desarrollo software AI

Agentes IA para el desarrollo software

La integración de los agentes IA para el desarrollo de software está cambiando el panorama empresarial. En muy poco tiempo, la IA ha pasado de ser una promesa a ser una herramienta esencial. En concreto, mejora los procesos y los agiliza, en especial en sectores como el tecnológico. Así, mediante esta herramienta, las empresas automatizan tareas complejas. También mejoran la toma de decisiones.

6 minutos leer Aug 01, 2025
Agents of Agentic AI AI

Calcula el ahorro de dinero con tus agentes IA

En este artículo te presentaremos los beneficios de incluir los Agentes de IA que utilizan Inteligencia Artificial, en tu negocio, juntamente con el papel que desempeñan. Calcula y controla tu ROI (el dinero neto que ganas con una inversión), para que te hagas una idea de cómo afectaría la integración del agente en tu empresa. Te explicamos cómo trabaja nuestra herramienta y descubre los casos de éxito de nuestros clientes y las ventajas únicas que han conseguido con los agentes de IA de CM.

6 minutos leer Jun 30, 2025
Is this region a better fit for you?
Go
close icon