Les benchmarks d'IA générale ne révèlent pas grand-chose sur le service client
Pour choisir un modèle d'IA, la logique semble simple : adopter le plus performant du marché, surtout s'il arrive en tête des benchmarks d'IA les plus connus. Cette logique ne s'applique pourtant pas toujours au service client.
De nombreux benchmarks d'IA populaires évaluent les performances dans des domaines tels que le code, les mathématiques, la culture générale et le raisonnement complexe. Si ces tests mettent en lumière les capacités générales d'un modèle, ils ne disent presque rien de son efficacité réelle en tant qu'Agent IA de service client.
En réalité, les clients formulent rarement leurs demandes de manière parfaite. Ils peuvent par exemple dire : « Ma commande devait arriver hier, mais je n'ai encore rien reçu. Pouvez-vous vérifier où elle se trouve ? »
L'Agent IA doit d'abord comprendre l'intention du client. Il doit ensuite rechercher la commande, vérifier son statut, déterminer les informations qu'il est autorisé à partager, puis prendre la bonne décision pour l'étape suivante.
Ainsi, ce n'est pas seulement la réponse finale qui doit être correcte, mais l'intégralité du processus.
Pourquoi nous avons développé CM-ServiceBench
CM-ServiceBench teste les modèles d'IA sur des conversations complètes de service client. Au-delà de la simple réponse finale, il évalue chaque étape du parcours : le raisonnement, l'utilisation des bons outils, l'exécution correcte des workflows et le respect des garde-fous.
Nous évaluons trois aspects essentiels :
Choisir le bon chemin
La première étape consiste à comprendre ce que souhaite réellement le client. Cela semble simple, jusqu'à ce qu'il s'exprime de façon incomplète, ambiguë ou inattendue.
Un bon Agent IA doit être capable d'identifier la bonne intention et de définir la marche à suivre. Une erreur en début de conversation peut fausser le résultat final, même si toutes les étapes suivantes sont techniquement correctes.
Exécuter correctement les workflows
La plupart des demandes clients nécessitent plus d'une simple réponse. Traiter un retour, reporter un rendez-vous ou vérifier le statut d'une commande implique plusieurs étapes : identifier le client, récupérer les données, vérifier l'éligibilité, prendre une décision et, enfin, exécuter l'action.
L'ordre de ces étapes a également son importance. Un Agent qui effectue correctement cinq étapes sur six peut tout de même aboutir à un mauvais résultat. C'est ce qui différencie fondamentalement le service client de la simple génération d'une réponse de qualité. Un Agent IA doit être capable de suivre et d'exécuter un processus de manière fiable.
Respecter les garde-fous
Un bon Agent IA doit aussi savoir ce qu'il ne doit pas faire. Il ne doit pas inventer d'informations, partager des consignes internes, divulguer des données non destinées au client, ni agir s'il ne dispose pas de suffisamment d'informations.
Pour un Agent IA en production, il ne s'agit pas d'une fonctionnalité optionnelle, mais d'une exigence fondamentale. Un Agent n'est viable que s'il se montre à la fois utile et prévisible.
Comment évaluer une conversation ?
Avec CM-ServiceBench, nous faisons tester aux modèles des centaines de conversations clients dans différents scénarios et langues. Une seconde IA joue le rôle du client, avec ses propres objectifs, son contexte et ses informations, pour mener la conversation avec l'Agent IA évalué.
Ces scénarios s'inspirent de situations réelles de service client. Nous évaluons ensuite l'intégralité de la conversation, et pas seulement la réponse finale. Le modèle a-t-il choisi le bon chemin ? A-t-il utilisé les bons outils et pris les bonnes décisions ? Les étapes ont-elles été exécutées dans le bon ordre ? Les informations ont-elles été traitées correctement ? Et la conversation a-t-elle abouti au résultat attendu ?
Cette distinction est essentielle. Un modèle peut formuler une réponse très convaincante tout en exécutant un mauvais processus en arrière-plan. Pour le client, l'échange semble réussi, jusqu'à ce qu'il se rende compte que son rendez-vous n'a jamais été reporté, que les informations récupérées sont incorrectes ou qu'il a été orienté vers le mauvais service.
Strict ou partiel : quand une conversation est-elle vraiment réussie ?
Une conversation peut globalement bien se dérouler tout en comportant une erreur de parcours. CM-ServiceBench mesure les résultats de deux manières : selon une évaluation partielle et une évaluation stricte.
La mesure partielle évalue le nombre d'étapes de la conversation correctement exécutées. La mesure stricte est plus exigeante : une conversation n'est considérée comme réussie que si l'intégralité de l'échange est irréprochable.
Cette distinction est capitale pour le service client. Un modèle qui réussit neuf étapes sur dix peut tout de même laisser le client avec un résultat erroné.
Le classement change alors du tout au tout
Évalués sous cet angle, les classements diffèrent sensiblement de ce que suggèrent les benchmarks d'IA générale. Lors de nos tests, les modèles compacts de la famille GPT-5.6 figurent en réalité parmi les plus performants pour ces tâches de service client.
Modèle | Strict | Partiel |
|---|---|---|
GPT-5.6 Luna avec thinking | 71 | 92 |
GPT-5.6 Terra | 69 | 91 |
GPT-5.6 Sol | 66 | 90 |
GPT-5.6 Luna | 63 | 88 |
Opus 4.6 | 63 | 90 |
GPT-5.5 | 61 | 88 |
Sonnet 5 | 58 | 86 |
Le constat le plus intéressant ne réside pas uniquement dans le nom du modèle en tête de liste. Comparez par exemple GPT-5.6 Terra et Opus 4.6. Opus 4.6 obtient un score élevé en évaluation partielle, mais plus faible en évaluation stricte. Cela signifie que le modèle va souvent loin dans le processus, mais qu'il finalise moins de conversations de manière totalement correcte.
Lors de nos tests, GPT-5.6 Terra s’est montré bien plus fiable pour mener les conversations à leur terme sans erreur. Pour le client, c'est la seule différence qui compte. Peu lui importe la qualité du raisonnement en cours de route : seul compte le fait que son problème soit effectivement résolu.
Un modèle plus grand n'est pas forcément plus fiable
Cela ne signifie pas que les modèles plus volumineux sont moins performants. Ils sont conçus pour gérer un large éventail de tâches complexes. Cette capacité supplémentaire s'avère précieuse lorsqu'un Agent doit prendre des décisions complexes, traiter un contexte étendu ou résoudre des problèmes imprévus.
Pourtant, toutes les tâches de service client ne requièrent pas un tel niveau de complexité. Pour de nombreux processus, la qualité consiste simplement à suivre scrupuleusement les instructions, à utiliser les bons outils et à ne sauter aucune étape. Dans ces cas-là, des capacités générales plus avancées ne garantissent pas nécessairement de meilleurs résultats.
Par conséquent, vous risquez de payer pour une capacité de modèle superflue sans constater d'amélioration des performances pour cette tâche spécifique.
La vitesse est également un critère de qualité
De plus, le score d'un benchmark ne dit pas tout. Comme les Agents IA interagissent avec des humains, le temps de réponse a un impact direct sur l'expérience utilisateur. Si un modèle met plusieurs secondes de plus à répondre à chaque message, la conversation semble vite laborieuse. C'est encore plus critique pour les applications vocales, où le moindre délai se remarque immédiatement.
CM-ServiceBench : performance et vitesse
Chaque point représente un modèle. Plus il est situé à gauche, plus le modèle répond rapidement. Plus il est haut, plus le nombre de conversations menées sans faute est élevé.
Le graphique montre bien qu'il n'y a pas de vainqueur unique et évident. GPT-5.5 est le plus rapide, avec un temps de réponse moyen de 1,8 seconde par message, mais il n'obtient pas le meilleur score strict. À l'autre extrémité, GPT-5.6 Luna avec thinking obtient le score le plus élevé du benchmark (71), mais affiche un temps de réponse moyen plus long de 3,2 secondes.
GPT-5.6 Terra se situe au milieu, avec un score strict élevé de 69 et un temps de réponse moyen de 2,8 secondes. Cela montre bien tout l'enjeu du choix d'un modèle en pratique : trouver le meilleur équilibre entre qualité et vitesse pour une tâche donnée, plutôt que de chercher uniquement à obtenir le score le plus élevé.
Un troisième facteur entre également en ligne de compte : le coût. Un modèle légèrement plus performant, mais qui nécessite beaucoup plus de puissance de calcul et coûte davantage n'est pas forcément le meilleur choix pour un processus exécuté des milliers de fois par jour.
Le meilleur modèle dépend de la tâche
Se demander « quel est le meilleur modèle d'IA ? » est une question trop vaste. Il est plus pertinent de se demander : quel est le meilleur modèle pour cet Agent et cette tâche en particulier ?
Un modèle compact et rapide peut être idéal pour un workflow prévisible. Pour un Agent mais plus complexe nécessitant des prises de décision nuancées ou le traitement d'un contexte volumineux, des capacités de raisonnement avancées apportent une réelle valeur ajoutée. En revanche, pour les processus où chaque seconde compte, un modèle plus rapide sera souvent préférable, même si un autre modèle obtient un score d'exactitude stricte légèrement supérieur.
Cela signifie également que vous n'avez pas besoin d'uniformiser votre service client autour d'un modèle unique. Les différents Agents IA ont des exigences distinctes. Même au sein d'un seul Agent, des tâches de classification simples peuvent nécessiter un modèle différent de celui utilisé pour des analyses complexes ou l'exécution d'actions.
La principale leçon de CM-ServiceBench n'est pas qu'un modèle particulier l'emporte sur les autres. Elle montre plutôt qu'il faut évaluer les modèles en fonction du travail réel qu'ils auront à accomplir. Si les benchmarks généraux sont intéressants, vous devez avant tout savoir quel modèle exécutera vos processus spécifiques de la manière la plus fiable, à une vitesse et à un coût adaptés à votre entreprise.
Sélection du modèle dans HALO
C'est pourquoi nous ne vous limitons pas à un seul modèle dans HALO. Vous pouvez choisir le modèle d'IA adapté à chaque Agent, et même attribuer différents modèles à des outils spécifiques. Vous pouvez ainsi réserver les modèles les plus avancés aux tâches qui en ont réellement besoin, plutôt que d’utiliser par défaut le modèle le plus puissant et le plus coûteux pour chaque processus.
Ces exigences vont également continuer à évoluer. À mesure que de nouveaux modèles apparaissent, que les modèles existants s'améliorent et que la dynamique des performances, de la vitesse et des coûts évolue, CM-ServiceBench nous permet de tester en continu les modèles par rapport aux mêmes tâches de service. Vos choix s'appuient ainsi toujours sur des données réelles et actualisées.