Terug naar blog

Het grootste AI-model is niet het beste voor je klantenservice.

Als je een AI-model kiest, lijkt de logica simpel: neem het slimste model dat beschikbaar is. Zeker als dat model bovenaan de bekende AI-benchmarks staat. Voor klantenservice blijkt die logica alleen niet altijd op te gaan.
Rutger de Ruiter
Aug 19, 2026
7 minutes read

Algemene AI-benchmarks vertellen maar een deel van het verhaal

Als je een AI-model kiest, lijkt de logica simpel: neem het slimste model dat beschikbaar is. Zeker als dat model bovenaan de bekende AI-benchmarks staat. Voor klantenservice blijkt die logica alleen niet altijd op te gaan.

Veel bekende AI-benchmarks meten hoe goed modellen zijn in taken als programmeren, wiskunde, kennisvragen en complexe redeneerproblemen. Dat zegt veel over de algemene capaciteiten van een model, maar veel minder over de vraag of dat model ook een goede AI Agent voor klantenservice is.

Een klant formuleert zijn vraag namelijk zelden perfect. Hij zegt bijvoorbeeld: “Mijn bestelling zou gisteren komen, maar ik heb nog niks. Kunnen jullie kijken waar hij blijft?”

De AI Agent moet vervolgens begrijpen wat de klant probeert te bereiken. Daarna moet hij misschien de bestelling opzoeken, de actuele status controleren, bepalen welke informatie gedeeld mag worden en de juiste vervolgstap uitvoeren.

Niet alleen het antwoord moet dus kloppen. Het hele proces moet kloppen.

Wat moet een goede AI Agent kunnen?

Binnen CM-ServiceBench kijken we grofweg naar drie onderdelen: routing, workflows en hygiëne.

De juiste route kiezen

De eerste stap is begrijpen wat een klant daadwerkelijk probeert te bereiken. Dat klinkt eenvoudig, totdat klanten dingen onvolledig, dubbelzinnig of op een onverwachte manier formuleren.

Een goede AI Agent moet dan alsnog de juiste intentie herkennen en bepalen wat er moet gebeuren. Een verkeerde keuze aan het begin van het gesprek kan ervoor zorgen dat alles wat daarna gebeurt technisch correct is, maar alsnog naar de verkeerde uitkomst leidt.

Een workflow correct uitvoeren

Veel klantvragen bestaan niet uit één antwoord. Een retour aanmelden, een afspraak wijzigen of de status van een bestelling controleren bestaat vaak uit meerdere stappen: de klant identificeren, gegevens ophalen, controleren of aan voorwaarden wordt voldaan, een keuze maken en uiteindelijk een actie uitvoeren.

Daarbij telt ook de volgorde. Een agent die vijf van de zes stappen goed uitvoert, kan alsnog een verkeerde uitkomst opleveren. Dat maakt klantenservice fundamenteel anders dan alleen een goed antwoord genereren. Een AI Agent moet een proces betrouwbaar kunnen volgen en uitvoeren.

Binnen de juiste grenzen blijven

Een goede AI Agent moet ook weten wat hij niet moet doen. Geen informatie verzinnen, geen interne instructies delen, geen gegevens tonen die niet voor de klant bedoeld zijn en geen acties uitvoeren wanneer daarvoor onvoldoende informatie beschikbaar is.

Voor een AI Agent in productie is dat geen extra feature. Het is een basisvoorwaarde. Een agent is pas bruikbaar wanneer hij niet alleen behulpzaam is, maar ook voorspelbaar.

Daarom meten we het hele gesprek

In CM-ServiceBench laten we modellen honderden klantgesprekken afhandelen in verschillende scenario’s en talen. Een tweede AI speelt daarbij de klant. Die krijgt een eigen doel, context en informatie mee en voert vervolgens een gesprek met de AI Agent die we testen.

De scenario’s zijn gebaseerd op patronen die we in echte klantenserviceprocessen tegenkomen. Vervolgens beoordelen we niet alleen het uiteindelijke antwoord, maar het volledige verloop van het gesprek. Heeft het model de juiste route gekozen? Zijn de juiste tools en acties gebruikt? Zijn stappen in de goede volgorde uitgevoerd? Is informatie correct verwerkt? En heeft het gesprek uiteindelijk de juiste uitkomst?

Dat onderscheid is belangrijk. Een model kan namelijk een overtuigend antwoord geven en toch achter de schermen het verkeerde proces uitvoeren. Voor de klant lijkt het gesprek dan goed te gaan, totdat blijkt dat de afspraak niet is gewijzigd, de verkeerde informatie is opgehaald of de klant alsnog bij de verkeerde afdeling terechtkomt.

Strict versus partial: wanneer is een gesprek echt goed?

CM-ServiceBench geeft ieder model twee scores: partial en strict.

De partial-score laat zien welk deel van een gesprek correct is uitgevoerd. Stel dat een agent een klant correct identificeert, de juiste gegevens ophaalt en bijna het volledige proces goed volgt, maar bij de laatste stap de verkeerde actie uitvoert. Dan krijgt het model bij partial nog gedeeltelijk krediet.

Dat is nuttige informatie, omdat het laat zien hoe dicht een model bij de juiste uitkomst komt. Maar voor de klant telt uiteindelijk vooral één ding: is mijn probleem opgelost?

Daarom kijken we vooral naar de strict-score. Een gesprek telt bij strict alleen als succesvol wanneer het van begin tot eind correct is uitgevoerd. De routing klopt, de juiste stappen zijn gevolgd, de juiste acties zijn uitgevoerd en de uiteindelijke uitkomst klopt.

Eén essentiële fout betekent dat het gesprek niet als volledig succesvol telt. Een gesprek dat voor 90 procent goed gaat, kan voor een klant nog steeds volledig mislukt zijn. Daarom is strict voor ons de belangrijkste maatstaf wanneer we modellen voor AI Agents vergelijken.

En dan krijg je een ander beeld van welk model het beste is

Wanneer we modellen op deze manier testen, ziet de ranglijst er anders uit dan je op basis van algemene AI-benchmarks misschien verwacht. In onze tests behoren juist compacte modellen uit de GPT-5.6-familie tot de sterkst presterende modellen voor deze servicetaken.

Model

Strict

Partial

GPT-5.6 Luna met thinking

71

92

GPT-5.6 Terra

69

91

GPT-5.6 Sol

66

90

GPT-5.6 Luna

63

88

Opus 4.6

63

90

GPT-5.5

61

88

Sonnet 5

58

86

Het interessante zit niet alleen in welk model bovenaan staat. Kijk bijvoorbeeld naar GPT-5.6 Terra en Opus 4.6. Opus 4.6 scoort sterk op partial, maar lager op strict. Het model komt dus vaak ver in het proces, maar rondt minder gesprekken volledig correct af.

GPT-5.6 Terra doet dat in onze tests vaker wel. Voor de klant is juist dat verschil relevant. Niet hoe indrukwekkend het redeneren onderweg is, maar of het probleem aan het einde daadwerkelijk is opgelost.

Groter is niet automatisch betrouwbaarder

Dat betekent niet dat grotere modellen slechter zijn. Grotere modellen zijn juist ontworpen om een breed scala aan complexe taken uit te voeren. Die extra capaciteit kan waardevol zijn wanneer een agent ingewikkelde afwegingen moet maken, veel context moet verwerken of minder voorspelbare problemen moet oplossen.

Maar niet iedere servicetaak vraagt daarom. Voor veel processen draait kwaliteit juist om consequent dezelfde instructies volgen, de juiste tools gebruiken en geen stappen overslaan. Meer algemene intelligentie levert daar niet automatisch een betere uitkomst op.

Je kunt daardoor betalen voor extra modelcapaciteit zonder dat dit voor die specifieke taak tot betere prestaties leidt.

Snelheid hoort ook bij kwaliteit

Een benchmarkscore vertelt bovendien niet het hele verhaal. Een AI Agent praat met mensen. Reactietijd is daardoor direct onderdeel van de ervaring. Als een model bij ieder bericht meerdere seconden langer nodig heeft, voelt een gesprek al snel traag. Bij voice wordt dat nog belangrijker, omdat iedere extra stilte direct merkbaar is.

Daarom kijken we binnen CM-ServiceBench naast betrouwbaarheid ook naar reactietijd.

CM-ServiceBench: prestatie versus snelheid

servicebench-prestatie-snelheid-wide

Elke stip is een model. Hoe verder naar links, hoe sneller het model reageert. Hoe hoger, hoe meer gesprekken volledig correct worden afgerond.

De grafiek laat zien waarom er niet één simpele winnaar is. GPT-5.5 reageert met gemiddeld 1,8 seconde per bericht het snelst, maar haalt niet de hoogste strict-score. GPT-5.6 Luna met thinking zit aan de andere kant: met een strict-score van 71 presteert het het best in deze benchmark, maar daar staat met gemiddeld 3,2 seconden wel meer reactietijd tegenover.

GPT-5.6 Terra zit daar tussenin. Het haalt een hoge strict-score van 69 bij een gemiddelde reactietijd van 2,8 seconden. Daarmee laat de benchmark goed zien waar modelkeuze in de praktijk om draait: niet alleen om de hoogste score, maar om de beste verhouding tussen kwaliteit en snelheid voor een specifieke taak.

En daar komt nog een derde factor bij: kosten. Een model dat iets beter scoort, maar structureel meer rekentijd en capaciteit gebruikt, hoeft niet automatisch de beste keuze te zijn voor een proces dat duizenden keren per dag wordt uitgevoerd.

Het beste model hangt af van de taak

De vraag “wat is het beste AI-model?” is daarom eigenlijk te algemeen. Een betere vraag is: wat is het beste model voor deze agent en deze taak?

Voor een voorspelbare workflow kan een compact en snel model de beste keuze zijn. Bij een complexere agent, waarin meerdere afwegingen nodig zijn of veel context moet worden verwerkt, kan extra reasoning juist waarde toevoegen. En bij processen waar iedere seconde telt, kan een sneller model interessanter zijn, ook als een ander model iets hoger scoort op strict.

Dat betekent ook dat je niet voor je hele klantenservice één model hoeft te kiezen. De ene AI Agent kan iets heel anders nodig hebben dan de andere. En zelfs binnen één agent kan een eenvoudige classificatie een andere modelkeuze vragen dan een complexe analyse of actie.

De belangrijkste les uit CM-ServiceBench is daarom niet dat één specifiek model wint. Het is dat je modellen moet beoordelen op het werk waarvoor je ze daadwerkelijk inzet. Algemene benchmarks zijn interessant, maar je wilt uiteindelijk weten welk model jouw proces het betrouwbaarst uitvoert tegen een snelheid en prijs die daarbij passen.

Modelkeuze in HALO

Binnen HALO werken we daarom niet met één vast model voor alles. Je bepaalt zelf welk AI-model je per agent gebruikt en kunt ook per tool een ander model inzetten. Zo gebruik je extra modelkracht waar die daadwerkelijk iets toevoegt, in plaats van standaard ieder proces door het grootste model te laten uitvoeren.

Die keuze blijft bovendien veranderen. Nieuwe modellen verschijnen, bestaande modellen worden verbeterd en verschillen in prestaties, snelheid en kosten verschuiven continu. Met CM-ServiceBench kunnen we modellen daarom steeds opnieuw testen op dezelfde servicetaken en keuzes blijven onderbouwen met actuele resultaten.

Wil je zien hoe dit in HALO werkt? Kom in contact met ons team voor een demo.

n HALO bepaal je zelf welk AI-model je per agent gebruikt. Zo kun je per use case kiezen voor de beste combinatie van kwaliteit, snelheid en kosten.
Was dit artikel interessant?
Deel het!

Laatste artikelen

Ask HALO AI

Nieuw: Ask HALO, de AI-assistent die je agents bouwt, verbetert en onderhoudt

Ask HALO bouwt, debugt en onderhoudt AI-agents vanuit HALO Studio, met volledige toegang tot je agents, tools en gespreksgeschiedenis. Ontdek hoe CheapCargo, Preston Palace, Winparts en Intergamma het gebruiken.

6 minutes read Aug 04, 2026
blog-interview-halo-customer-service AI

Waarom de leverancier achter je AI-agent net zo belangrijk is als de agent zelf

De inzet van AI-agents in klantenservice gaat razendsnel. Het aanbod van leveranciers groeit minstens even hard mee, en er zit veel echte innovatie tussen. Maar zodra AI-agents de stap maken van pilot naar productie, draait het succes minder om de technologie zelf en meer om de fundering eronder: wie zit er eigenlijk achter het platform?

4 minutes read Jul 02, 2026
live-blog-featured AI

Iedereen kan een festival app vibe coden. Maar het festivalweekend overleef je niet met een prompt.

AI heeft software bouwen drastisch makkelijker gemaakt. Schermen, workflows, integraties, complete mobiele applicaties - gegenereerd in een middag, met een handvol prompts.

5 minutes read Jun 29, 2026
Ai governance AI

AI wordt slimmer maar ook zelfstandiger. Hoe zorg je dat je de controle houdt?

Steeds meer organisaties zetten AI-agents in die méér doen dan teksten genereren of als zoekmachine dienen. Ze verwerken klantverzoeken, vullen systemen aan, starten processen op de achtergrond of handelen transacties af. Dat levert snelheid op, schaalbaarheid, én minder afhankelijkheid van handmatig werk. Maar zodra AI niet langer alleen advies geeft, maar ook acties uitvoert, verandert er iets belangrijks: je hebt niet alleen een slim systeem nodig, maar ook een manier om grip te houden op wat het doet, waarom het dat doet, en binnen welke grenzen het mag handelen. Dat is waar AI-governance begint. Niet als papieren compliance-laag, maar als concrete manier om AI voorspelbaar, uitlegbaar en beheersbaar te houden, ook wanneer het zelfstandig werkt.

4 minutes read Jan 07, 2026
AI-now and future HALO

De business impact van Agentic AI: nu en in de toekomst

Klantvragen die 24/7 worden beantwoord zonder wachttijd, automatische updates bij vertraagde bestellingen of volledig digitale shopping assistants die je helpen van oriëntatie tot conversie. Dit zijn slechts enkele voorbeelden van toepassingen die Agentic AI realiseert. In dit artikel delen Marketing Lead AI & SaaS Sander Harryvan en Product Marketer Tom Faas van CM.com hun visie op waar bedrijven nu staan in de adoptie van Agentic AI, hoe de volgende fase eruitziet, en waarom Agentic AI de komende jaren een enorme impact zal hebben op de manier waarop we business doen.

5 minutes read Oct 28, 2025
3 types of AI AI

De drie gezichten van AI in Customer Experience

Artificial Intelligence (AI) is al decennialang in ontwikkeling, maar de manier waarop we het vandaag gebruiken is ingrijpend veranderd. Met de komst van ChatGPT en andere toepassingen is AI ineens tastbaar geworden voor het brede publiek. Waar het vroeger vooral werd ingezet voor specifieke, vaak onzichtbare toepassingen (denk aan fraudedetectie bij banken of voorspellend onderhoud in de industrie), helpt het nu actief bij het ontwikkelen van content, het verbeteren van de klantbeleving en het efficiënter maken van processen. Binnen customer experience zijn drie vormen van AI relevant: generative, agentic en predictive AI. In dit artikel zetten we ze uiteen en leggen we uit hoe je ze benut.

4 minutes read Oct 15, 2025
halo-insurance AI

Van claims tot klantvragen: zo ontlasten AI-agents verzekeraars

De verzekeringswereld staat bekend om haar complexe processen en hoge administratieve druk. Door versnipperde communicatie, verouderde systemen en ingewikkelde voorwaarden kost het zoeken naar informatie en verwerken van wijzigingen vaak veel meer tijd dan nodig. AI-agents kunnen dat veranderen. Ze beantwoorden ingewikkelde vragen over polisvoorwaarden en persoonlijke situaties, halen data in real time op uit interne systemen en zetten processen moeiteloos in gang.

4 minutes read Oct 10, 2025
blog-halo-real-estate AI

AI-agents in vastgoed: zo stroomlijn je aanvragen en bied je kopers een betere ervaring

De Nederlandse woningmarkt staat onder hoge druk. Makelaarskantoren ontvangen dagelijks talloze aanvragen voor te koop staande woningen. Kopers verwachten snelle antwoorden over beschikbaarheid, prijzen en vervolgstappen — vaak ook buiten kantoortijden. Voor makelaars zorgt dit voor een enorme werkdruk: het beantwoorden van steeds terugkerende vragen, het inplannen van bezichtigingen en het afhandelen van kopers die vaak teleurgesteld moeten worden omdat een woning al verkocht is of simpelweg te veel belangstelling trekt. Zonder automatisering en slimme workflows lopen makelaars het risico om overspoeld te raken door aanvragen, waardoor de klantbeleving onder druk komt te staan en kansen voor waardevol contact verloren gaan. HALO, het AI-gedreven platform van CM.com, helpt dit proces te stroomlijnen. AI-agents werken 24/7, reageren menselijk en nemen routinetaken over. Zo krijgen makelaars meer ruimte om zich te focussen op waar hun expertise echt telt: persoonlijk advies en begeleiding van de juiste kopers.

4 minutes read Oct 02, 2025
Is this region a better fit for you?
Go
close icon