Hallucineert je AI-agent in de klantenservice, dan is het model zelden de echte oorzaak. De meeste verzonnen antwoorden ontstaan doordat de zoekstap de juiste passage mist, doordat content verouderd is of zichzelf tegenspreekt, of doordat de agent geen regel heeft om "dat weet ik niet" te zeggen. Los die drie op, test vóór livegang en kijk wekelijks terug. Grounding verkleint fouten flink, maar brengt ze nooit naar nul.
Hoe ziet een hallucinatie eruit in de klantenservice?
Een hallucinatie is een antwoord dat klopt lijkt, maar niet door jouw content wordt gedekt. De agent verzint een retourtermijn die je nooit hebt aangeboden, noemt een levertijd die je nooit hebt gepubliceerd of bevestigt een productfunctie die niet bestaat. De zin leest prima. Hij klopt alleen niet.
Bij een algemene chatbot is dat vervelend. In de klantenservice is het een risico. Een fout antwoord over een terugbetaling of garantie kost geld en vertrouwen, en de klant heeft geen reden om te twijfelen, want het kwam van jouw merk. Een zoekbalk zegt "geen resultaten". Een taalmodel geeft bijna altijd íets terug, ook als het nergens op kan bouwen.
Symptoom, oorzaak, oplossing: een diagnosetabel
Begin bij wat je in de gesprekken ziet. Elk symptoom wijst naar een andere oorzaak, en elke oorzaak vraagt een andere oplossing.
| Wat je ziet | Waarschijnlijke oorzaak | Oplossing | |---|---|---| | Verzint een beleid, prijs of functie die nergens in je content staat | Geen onderbouwende passage gevonden en geen regel om te stoppen | Eis een bronvermelding bij elk antwoord; weiger en zet door als die er niet is | | Antwoord klopt half, de rest is ingevuld | Zoekstap vond een verwante maar onvolledige passage | Splits lange artikelen, één vraag per artikel, antwoord in de eerste zin | | Noemt een beleid dat maanden geleden is gewijzigd | Verouderd artikel is nog gekoppeld | Werk het artikel bij of archiveer het; plan vaste controles voor beleidspagina's | | Haalt twee regels door elkaar in één antwoord | Twee artikelen spreken elkaar tegen | Eén bron van waarheid per beleid; archiveer het dubbele artikel | | Definitie klopt, voorwaarden niet | Tekst op een willekeurige plek geknipt, regel en voorwaarden gescheiden | Houd voorwaarden in dezelfde alinea als de regel; schrijf expliciete "als"-zinnen | | Beantwoordt vol vertrouwen vragen buiten je vakgebied | Geen afbakening | Leg vast waar de agent over mag antwoorden en weiger de rest | | Zegt "weet ik niet" terwijl het antwoord er wel is | Gemiste passage, vaak door een titel die niet aansluit bij de woorden van de klant | Herschrijf titels in klanttaal; neem veelgebruikte formuleringen op in het artikel | | Alleen fout in één taal | Het antwoord bestaat in één taal en wordt vrij vertaald | Controleer de vertaalde artikelen of koppel de brontaal expliciet |
De meeste teams merken dat twee of drie rijen bijna al hun slechte antwoorden verklaren. Pak die eerst aan.
Waarom houdt grounding hallucinaties niet helemaal tegen?
Grounding verbindt het model met je content, meestal via retrieval-augmented generation (RAG). In plaats van uit zijn geheugen te antwoorden, antwoordt het model op basis van passages uit je kennisbank. Dat is de juiste opzet. Een garantie is het niet.
Moveworks zegt het helder in een artikel over agentic RAG: grounding alleen lost niet op dat RAG-systemen geen ingebouwde manier hebben om waarheid af te dwingen. Hetzelfde stuk beschrijft hoe een mislukte zoekstap ertoe leidt dat het model onvolledige antwoorden geeft, informatie verzint om gaten te vullen of onnodig afhaakt. En tekst die op een willekeurige plek wordt geknipt, verbreekt de band tussen een definitie en de informatie die haar onderbouwt.
In de praktijk veroorzaken vier patronen de meeste hallucinaties ondanks grounding:
- Gemiste passages. De juiste passage bestaat, maar de zoekstap vindt hem niet. Het model antwoordt met wat het wel vond.
- Knippunten. De regel staat in het ene stuk tekst, de voorwaarden in het andere. Het model ziet de helft en vult de rest aan.
- Tegenstrijdige bronnen. Je FAQ zegt 14 dagen, je voorwaarden 30. Het model kiest er een, of mengt ze.
- Dun bewijs. Eén losjes verwante zin wordt een volledige, stellige alinea.
Welke AI-klantenserviceagents hallucineren het minst?
Dit is een van de meest gezochte vragen over AI in support. Het eerlijke antwoord: geen enkel openbaar cijfer beantwoordt hem voor jouw bedrijf.
Openbare benchmarks meten onderliggende modellen op algemene taken. Een bespreking uit 2026 van het Vectara Hallucination Evaluation Framework meldt dat vier modellen inmiddels onder de 1% hallucinaties scoren op de gestandaardiseerde feitentests, tegen 8% tot 12% van de vragen in 2024. Dat is echte vooruitgang in de modellen. Maar jouw retourtermijn, je verzenddeadlines en de eigenaardigheden van je producten staan in geen enkele benchmark. Hoe vaak een supportagent de fout ingaat, hangt vooral af van je content, de zoekinrichting en de weigerregels.
Wij kennen geen onafhankelijke benchmark die klantenservicetools vergelijkt op hetzelfde helpcenter. Claims van leveranciers over hallucinatiepercentages zijn gemeten op hun eigen testsets en dus niet vergelijkbaar. De betrouwbare manier om tools te vergelijken is ze zelf testen op je eigen vragen. Daar is de checklist hieronder voor. Stuur dezelfde testset door elke tool die je overweegt en tel de foute, niet-onderbouwde en ten onrechte geweigerde antwoorden.
Hoe schrijf je content waar de zoekstap echt iets mee kan?
Je content is je grootste hefboom. De meeste helpcenters zijn geschreven voor mensen die zelf context meebrengen. Ze scannen, vullen aan en kijken naar screenshots. Een agent doet dat allemaal niet.
- Eén vraag per artikel. Een pagina over drie onderwerpen komt bij alle drie boven en wordt tot één antwoord gemengd.
- Titels in klanttaal. "Hoe vraag ik een terugbetaling aan voor een sale-artikel?" zegt precies waar de pagina over gaat. "Aan de slag" zegt niets.
- Het antwoord eerst. Staat het antwoord in alinea vier, dan komt misschien de inleiding boven.
- Zeg wat je niet doet. "Geen uitzonderingen" en "we bieden geen telefonische support" zijn citeerbaar. Wat ontbreekt, is onzichtbaar.
- Geef content een datum en een eigenaar. Elk beleidsartikel heeft iemand nodig die het bijhoudt en een datum voor de volgende controle.
Meer hierover in onze gids over een kennisbank voor AI-supportagents en in zo train je een AI-agent op je helpcenter.
Waarom "dat weet ik niet" je beste oplossing is
Een stellig fout antwoord is altijd slechter dan "Dat weet ik niet zeker, ik haal er een collega bij." Weigergedrag betekent dat de agent duidelijke regels heeft over wanneer hij niet antwoordt:
- Geen onderbouwende passage. Vindt de zoekstap niets dat de vraag duidelijk dekt, dan waagt de agent geen poging.
- Buiten het vakgebied. Vragen over concurrenten, juridisch advies of onderwerpen buiten je bedrijf krijgen een vriendelijke weigering.
- Tegenstrijdig bewijs. Spreken bronnen elkaar tegen, dan zet de agent door in plaats van zelf te kiezen.
- Onderwerpen met veel op het spel. Terugbetalingen boven een drempel, juridische klachten of veiligheidskwesties gaan altijd naar een mens.
Een overzicht uit 2026 van technieken tegen hallucinaties raadt hetzelfde aan: laat het model alleen antwoorden als het zeker is en anders "ik weet het niet" zeggen, en beperk het tot een bron die jij aanlevert. Koppel elke weigering aan een nette overdracht van AI naar mens, zodat de klant altijd een volgende stap heeft.
Checklist voor de test vóór livegang
Loop dit door voordat de agent met één klant praat, en opnieuw na elke grote contentwijziging.
- Stel een testset samen van 50 tot 100 echte vragen uit recente tickets, in de woorden van de klant, verspreid over je meest voorkomende tickettypes.
- Schrijf per vraag het verwachte antwoord en het bronartikel op.
- Voeg 10 vragen toe die je content niet kan beantwoorden. Het juiste resultaat is een weigering met doorzetting, geen antwoord.
- Voeg 5 vragen buiten je vakgebied toe (prijzen van concurrenten, juridisch advies, niet-gerelateerde onderwerpen). Ook die moeten worden geweigerd.
- Voeg vragen toe over recent gewijzigd beleid om verouderde content te vangen.
- Voeg vraagparen toe die tegenstrijdige artikelen raken om tegenspraak te vinden.
- Test elke taal die je ondersteunt, niet alleen de taal waarin je de content schreef.
- Leg elk antwoord naast de geciteerde bron. Markeer het als juist, niet onderbouwd (beweert iets wat de bron niet zegt), fout of ten onrechte geweigerd.
- Pas de content aan en draai de hele set opnieuw. Plak geen losse promptregels over individuele antwoorden.
- Leg een lat voor livegang vast en houd je eraan. Bijvoorbeeld: nul niet-onderbouwde claims bij beleidsvragen, en elke onbeantwoordbare vraag geweigerd.
Voeg na livegang elke hallucinatie die je tegenkomt toe aan de testset, en bekijk elke week een steekproef van gesprekken. In onze gids over AI-antwoorden auditen staat een eenvoudige wekelijkse beoordelingslijst.
Hoe Keloa hiermee omgaat
De AI-agents van Keloa antwoorden vanuit jouw content, en elk antwoord bevat een bronvermelding naar de passage waarop het leunt. Zo kan je team nagaan wat de agent zei en waarom. Vindt de agent geen onderbouwende passage, dan zegt hij dat en zet hij het gesprek met context door naar een collega in je gedeelde inbox.
Die opzet verkleint de kans op verzonnen antwoorden. Hij haalt die kans niet weg, en we zouden op onze hoede zijn voor elke leverancier die beweert van wel. Daarom raden we de testset hierboven en een wekelijkse controle aan, welke tool je ook kiest.
Veelgestelde vragen
Waarom hallucineert mijn AI-agent in de klantenservice? Meestal omdat hij geen sterke onderbouwende passage vond en geen regel had om te stoppen, of omdat je content verouderd is of zichzelf tegenspreekt. Kijk in de diagnosetabel hierboven: het soort fout vertelt je welke oorzaak speelt.
Kan RAG of grounding hallucinaties volledig voorkomen? Nee. Grounding verkleint hallucinaties flink, maar gemiste passages, knippunten en tegenstrijdige bronnen kunnen nog steeds foute of gemengde antwoorden opleveren. Weigerregels, schone content en regelmatig testen dichten het grootste deel van de rest.
Welke AI-klantenserviceagent heeft het laagste hallucinatiepercentage? Voor zover wij weten bestaat er geen onafhankelijke, eerlijke vergelijking van supporttools op echte helpcenters. Modelranglijsten meten algemene taken. Test elke tool op dezelfde 50 tot 100 eigen vragen en vergelijk de uitkomst.
Hoe vaak moet ik de antwoorden van mijn AI-agent controleren? Een wekelijkse steekproef is een goed uitgangspunt. Bekijk elke week een reeks gesprekken die de AI afhandelde, vooral over onderwerpen waar je content dun is of net is gewijzigd. Vergroot de steekproef rond lanceringen, acties en beleidswijzigingen.
Wat is het verschil tussen een hallucinatie en een fout antwoord? Een hallucinatie is content die de agent heeft gegenereerd zonder enige bron. Een fout antwoord kan ook uit een verouderd artikel komen, en dat is een contentprobleem. Beide moet je oplossen, maar via een andere route.
Mag de AI-agent zeggen dat hij iets niet weet? Ja. Een eerlijke weigering met een snelle doorzetting is veel beter dan een stellig fout antwoord. Klanten vergeven "ik check het even bij het team". Een terugbetaling beloven die je niet kunt waarmaken, vergeven ze niet.