
Dit artikel samenvatten met AI
Een AI-hallucinatie is een antwoord van een AI-model dat overtuigend geformuleerd is en toch feitelijk onjuist. Denk aan een bron die niet bestaat, een cijfer dat in de genoemde bron nergens staat of een rechterlijke uitspraak die over iets heel anders gaat. Het model geeft geen seintje dat het twijfelt. Waar het vandaan komt, bij welke vragen de kans het grootst is en hoe je een hallucinatie vangt voordat hij in je eigen werk belandt, staat in dit artikel.
Wat is een AI-hallucinatie precies?
Een AI-hallucinatie is informatie die een taalmodel zoals ChatGPT, Gemini of Claude als feit presenteert, terwijl ze niet op betrouwbare data gebaseerd is. Het woord is geleend uit de psychiatrie, maar het mechanisme is heel anders. Een mens die hallucineert, neemt iets waar wat er niet is. Een taalmodel neemt niets waar. Het voorspelt welk woord er waarschijnlijk volgt, en soms levert die voorspelling een zin op die klopt qua vorm en niet qua inhoud.
In december 2025 werd "hallucineren" gekozen tot Van Dale Woord van het Jaar, specifiek in de AI-betekenis. De Dikke Van Dale omschrijft het nu als het verstrekken van informatie die niet op (betrouwbare) data gebaseerd is en daardoor onnauwkeurig of volstrekt onjuist is.
Het lastige zit in de toon. Een AI-hallucinatie klinkt precies even zeker als een juist antwoord. Er staat geen "volgens mij" bij, de opmaak is net zo verzorgd en vaak hangt er zelfs een bronvermelding aan.
Vier soorten hallucinaties die je in de praktijk tegenkomt
In wetenschappelijke literatuur wordt onderscheid gemaakt tussen hallucinaties die je eigen vraag tegenspreken en hallucinaties die de werkelijkheid tegenspreken. Voor dagelijks gebruik is een indeling naar wat je ziet handiger, omdat elke soort een eigen controle vraagt.
| Soort | Voorbeeld | Zo vang je hem |
|---|---|---|
| Verzonnen bron | Een onderzoek, boek of arrest met een titel en vindplaats die nergens bestaan | Zoek de exacte titel of het ECLI-nummer op. Geen treffer betekent geen bron. |
| Bestaande bron, verkeerde inhoud | Een echt arrest, maar het gaat over een ander onderwerp of heeft een andere datum | Open de bron en lees de passage waar de claim op zou steunen. |
| Verzonnen detail | Een verjaardag, jaartal, bedrag of percentage dat net niet klopt | Zoek het getal op de bronpagina terug met ctrl+F. |
| Fout tegen je eigen vraag | Letters tellen, een tekst samenvatten met een punt dat er niet in stond | Leg het antwoord naast je eigen invoer. |
De tweede soort is het verraderlijkst. Een controle op "bestaat deze bron?" levert dan een ja op, terwijl de bron de claim helemaal niet ondersteunt.
Waarom verzint AI feiten?
Op 4 september 2025 publiceerden drie onderzoekers van OpenAI en een hoogleraar van Georgia Tech het paper Why Language Models Hallucinate. Ze openen met een simpele test. Ze vroegen DeepSeek-V3 naar de verjaardag van hoofdauteur Adam Tauman Kalai, met de instructie om alleen te antwoorden als het model het wist. Drie pogingen gaven drie verschillende datums: 03-07, 15-06 en 01-01. Alle drie fout.
Bij de vraag naar de titel van Kalai's proefschrift ging het bij drie populaire modellen mis. ChatGPT noemde Carnegie Mellon en 2002, DeepSeek kwam met Harvard en 2005, Llama met MIT en 2007. Elk model gaf een andere titel, en geen van de drie was de juiste (de echte titel staat gewoon in het paper, voor wie nieuwsgierig is).
De verklaring zit in twee fases van de training.
Fase 1: zeldzame feiten zijn niet te leren
In de eerste fase leert een model taal uit enorme hoeveelheden tekst. Patronen die vaak terugkomen, zoals spelling of grammatica, pikt het goed op. Een verjaardag van een niet-beroemd persoon heeft geen patroon. Die staat ergens één keer, of nergens.
De onderzoekers laten zien dat het aandeel feiten dat precies één keer in de trainingsdata voorkomt een ondergrens vormt voor hoe vaak het model over dat soort feiten hallucineert. Hun voorbeeld: komt 20 procent van de verjaardagsfeiten maar één keer voor, dan verwacht je dat het basismodel bij minstens 20 procent van de verjaardagen de mist in gaat. Ook met foutloze trainingsdata.
Fase 2: gokken levert punten op
Daarna wordt een model bijgeschaafd en getest op benchmarks. De onderzoekers bekeken tien veelgebruikte benchmarks, waaronder MMLU-Pro, GPQA en SWE-bench. Negen van de tien keuren een antwoord als goed of fout en geven nul punten voor "ik weet het niet". De tiende, WildBench, geeft wel deelpunten, maar volgens de onderzoekers kan een eerlijk "weet ik niet" daar alsnog lager scoren dan een redelijk klinkend antwoord met een verzinsel erin.
Vergelijk het met een meerkeuzetoets zonder strafpunten. Wie gokt, scoort gemiddeld hoger dan wie een vraag openlaat. En een model dat op zulke toetsen geoptimaliseerd wordt, leert hetzelfde als een student: bij twijfel gewoon iets invullen, en dan liefst iets specifieks. De onderzoekers noemen het voorbeeld van "30 september" waar "ergens in de herfst" eerlijker was geweest.
Wat dit betekent voor Nederlandse vragen
Leg de twee bevindingen naast elkaar en er volgt iets uit wat in het paper niet staat. Hoe minder vaak een feit online staat, hoe groter de kans dat een model erover gokt. Nederlandse feiten staan per definitie minder vaak online dan Amerikaanse: een lokale regeling, een uitspraak van een Nederlandse rechtbank, het ledental van een Nederlandse vereniging, een cijfer van het CBS dat alleen in een Nederlandstalige tabel staat.
Daar komt bij dat een model door de training geleerd heeft om juist op die momenten een specifiek antwoord te geven. Een vraag over iets Nederlands en specifieks is dus precies het type vraag waarbij je het minst op het antwoord kunt bouwen. Een vraag over een breed gedeeld begrip, zoals wat inflatie is of hoe fotosynthese werkt, is veel veiliger terrein.
Een AI-hallucinatie bij de rechtbank in Groningen
Wat dat in het echt betekent, laat een vonnis van de Rechtbank Noord-Nederland zien van 19 november 2025. Twee erfgenamen wilden de verdeling van een nalatenschap laten vernietigen, omdat een werkplaats volgens hen te laag gewaardeerd was. Ter onderbouwing haalde hun advocaat jurisprudentie van de Hoge Raad aan.
De rechtbank ging die vindplaatsen na. In de aangehaalde arresten was de gestelde rechtsregel niet te vinden. Eén verwijzing, gepubliceerd als NJ 1996/273, bleek een arrest van 8 december 1995 te zijn en niet van 22 december, en ging over een Arubaanse zaak over de termijn voor het indienen van een memorie van grieven. Geen enkel verband met het verdelen van een erfenis.
Uit het vonnis, r.o. 4.5
"De rechtbank vermoedt dat de vindplaatsen via ChatGPT of een vergelijkbare zoekmachine zijn opgedoken en zonder controle in de processtukken zijn overgenomen."
Dit is de tweede soort uit de tabel hierboven. Het arrest bestaat, het vindplaatsnummer klopt, en wie alleen checkt of de bron er is, ziet niets vreemds.
Groningen staat niet alleen. De Franse jurist Damien Charlotin houdt een wereldwijde database van rechtszaken met AI-hallucinaties bij. Op 5 oktober 2026 stond de teller op 2.149 zaken.
| Uitsplitsing | Aantal zaken |
|---|---|
| Totaal in de database | 2.149 |
| Verenigde Staten | 1.473 |
| België | 8 |
| Nederland | 7 |
| Ingediend door een partij zonder advocaat | 1.233 |
| Ingediend door een advocaat | 854 |
| Afkomstig van een rechter | 33 |
| Met een volledig verzonnen bron | 1.764 |
Bron: AI Hallucination Cases database, Damien Charlotin, stand 5 oktober 2026. Een zaak kan in meer categorieën vallen.
Die 7 Nederlandse zaken zijn alleen de zaken waarin een rechter het opmerkte én in een gepubliceerde uitspraak benoemde. Hoeveel processtukken met een verzonnen of verkeerd aangehaalde bron er ongemerkt doorheen glippen, weet niemand. Maar het zijn er meer dan 7.
Bij welke vragen is de kans op een hallucinatie het grootst?
Met de twee oorzaken uit het paper in je achterhoofd kun je vooraf inschatten hoeveel controle een antwoord nodig heeft. Stel jezelf bij elke vraag één vraag: hoe vaak staat dit antwoord op internet?
| Risico | Type vraag | Voorbeeld |
|---|---|---|
| Hoog | Bronnen, citaten, vindplaatsen en DOI's | "Geef drie onderzoeken die aantonen dat..." |
| Hoog | Specifieke feiten over minder bekende personen, bedrijven of plaatsen | "Wanneer is de oprichter van [lokaal bedrijf] geboren?" |
| Hoog | Exacte cijfers uit Nederlandse statistieken of jaarverslagen | "Hoeveel leden had [vereniging] in 2024?" |
| Middel | Gebeurtenissen van na de trainingsdatum, zonder dat het model zoekt | "Wat besloot de Tweede Kamer vorige week over..." |
| Middel | Tellen en precies rekenen | "Hoeveel keer staat de letter D in DEEPSEEK?" |
| Laag | Uitleg van breed gedeelde begrippen | "Wat is het verschil tussen bruto en netto?" |
| Laag | Werk met tekst die je zelf aanlevert | "Maak deze alinea korter" |
Dat lettervoorbeeld komt ook uit het paper. DeepSeek-V3 antwoordde in tien pogingen "2" of "3", terwijl het er één is. Andere modellen kwamen zelfs op 6 en 7 uit. Een taalmodel leest tekst in stukjes van woorden (tokens), waardoor losse letters voor het model nauwelijks zichtbaar zijn. Tellen gaat dan snel mis.
Bij de laatste rij heb je het origineel ernaast en zie je direct wat er verandert. Bij de bovenste drie rijen moet je actief gaan zoeken.
Een prompt die gokken afremt
De onderzoekers stellen voor om in de vraag zelf te zeggen hoe zwaar een fout weegt. Een model weet dan dat "weet ik niet" beter is dan een gok. Dat idee kun je zelf gebruiken. Plak dit boven je vraag:
Kopieer en plak
Antwoord alleen als je voor minstens 75 procent zeker bent. Een fout antwoord kost 2 punten, een goed antwoord levert 1 punt op en "dat weet ik niet" levert 0 punten op. Geef bij elk feit aan of je het uit een bron haalt die je net hebt geopend of uit je eigen kennis. Noem geen bron die je niet zelf hebt geopend.
De verhouding komt rechtstreeks uit het paper: bij een zekerheidsdrempel van 75 procent hoort een strafpunt van 2. Onder die drempel is "weet ik niet" de slimste keuze. Het model kan zijn eigen zekerheid niet perfect inschatten, dus dit verlaagt het aantal gokken zonder het tot nul te brengen. Je krijgt vaker een eerlijk "dat weet ik niet", en dat is precies het signaal waar je mee verder kunt.
Hoe controleer je een AI-antwoord op hallucinaties?
Vier stappen, in deze volgorde. Bij een antwoord uit de rij "Laag" kun je ze overslaan. Bij een antwoord uit de rij "Hoog" doe je ze alle vier.
- 1Open elke bron. Een link die op een homepage of foutmelding uitkomt, telt niet. Bij een arrest zoek je het ECLI-nummer op uitspraken.rechtspraak.nl.
- 2Zoek de claim in de bron terug. Ctrl+F op het getal, de naam of een kernwoord. Zo vang je de bestaande bron met verkeerde inhoud, de soort die in Groningen door de eerste controle glipte.
- 3Stel dezelfde vraag nog een keer, in een nieuw gesprek. Krijg je een ander jaartal of een andere titel, dan gokt het model. Kalai's verjaardag leverde drie verschillende antwoorden op.
- 4Laat de tekst nakijken. De fact checker haalt alle losse claims uit een tekst, zodat je per bewering ziet wat er nog gecontroleerd moet worden.
Of ChatGPT in het algemeen betrouwbaar is en wat OpenAI zelf over verzonnen bronnen rapporteerde, lees je in is ChatGPT betrouwbaar?. Wil je snappen waarom een taalmodel zo werkt, begin dan bij wat een LLM is.
Veelgestelde vragen
Wat betekent hallucineren bij AI?
Hallucineren bij AI betekent dat een taalmodel informatie als feit presenteert die niet op betrouwbare data gebaseerd is. Het model voorspelt woorden die plausibel klinken, ook als het de feiten niet kent. Zo ontstaan verzonnen bronnen, verkeerde jaartallen en citaten die nergens staan. Van Dale nam deze betekenis in december 2025 op, toen "hallucineren" Woord van het Jaar werd.
Welke soorten AI-hallucinaties zijn er?
AI-hallucinaties komen in de praktijk in vier soorten voor: een verzonnen bron, een bestaande bron met verkeerde inhoud, een verzonnen detail zoals een datum of bedrag, en een fout tegen je eigen vraag, bijvoorbeeld bij letters tellen of samenvatten. Wetenschappers delen ze grover in, in hallucinaties die je vraag tegenspreken en hallucinaties die de werkelijkheid tegenspreken. Elke soort vraagt een eigen controle.
Hoe vaak hallucineert ChatGPT?
Hoe vaak ChatGPT hallucineert, hangt sterk af van het type vraag. Bij uitleg over bekende begrippen gaat het zelden mis. Bij zeldzame feiten ligt het risico veel hoger: volgens onderzoekers van OpenAI hallucineert een basismodel minstens zo vaak als het aandeel feiten dat maar één keer in de trainingsdata voorkomt. Vragen naar bronnen, exacte cijfers en minder bekende personen geven de meeste fouten.
Waarom zijn AI-hallucinaties gevaarlijk?
AI-hallucinaties zijn gevaarlijk doordat ze er precies zo uitzien als een juist antwoord, compleet met stellige toon en bronvermelding. Wie ze overneemt in een scriptie, rapport of processtuk, verspreidt een fout onder eigen naam. De database van Damien Charlotin telde op 5 oktober 2026 al 2.149 rechtszaken met AI-hallucinaties, waarvan 7 in Nederland.
Kun je AI-hallucinaties voorkomen?
Helemaal voorkomen lukt niet, maar de kans op AI-hallucinaties verklein je flink. Geef het model in je prompt expliciet toestemming om "dat weet ik niet" te zeggen en vertel dat een fout zwaarder weegt dan een eerlijk gat. Laat een model met zoekfunctie bronnen ophalen, en controleer cijfers, citaten en vindplaatsen altijd zelf in de oorspronkelijke bron.
Hoe herken je een AI-hallucinatie in een tekst?
Een AI-hallucinatie herken je aan details die niet terug te vinden zijn: een bron die niet bestaat, een getal dat niet op de genoemde pagina staat of een antwoord dat verandert als je de vraag opnieuw stelt. Extra opletten geldt bij erg specifieke cijfers over Nederlandse onderwerpen. De AI-Checker fact checker zet alle claims uit een tekst op een rij, zodat je ze een voor een kunt nalopen.
