AI

Is ChatGPT betrouwbaar? Dit schreef OpenAI zelf over zijn modellen

DoorRemon Hendriksen·17 september 2026·9 min leestijd
Is ChatGPT betrouwbaar? Dit schreef OpenAI zelf over zijn modellen

Dit artikel samenvatten met AI

ChatGPT is betrouwbaar zolang je kunt nagaan waar een antwoord vandaan komt. De zwakke plek zit niet in wat het model niet weet, maar in wat het doet als het iets niet kan vinden. Op 16 september 2026 publiceerde OpenAI zes rapporten over onverwacht gedrag van de eigen modellen, en in drie daarvan gebeurt precies dat: een gat wordt opgevuld en het eindantwoord ziet er verzorgd uit, inclusief bronvermelding. Hieronder wat er staat, hoe vaak het voorkwam en wat je er als gebruiker mee moet.

Wat OpenAI op 16 september publiceerde

OpenAI introduceerde een vast proces om gevallen van zogeheten misalignment te melden, dus gedrag waarbij een model iets anders doet dan de bedoeling was. Bij die aankondiging kwamen meteen zes rapporten over incidenten uit de voorgaande zes maanden. Elk rapport bevat de datum, de betrokken modelversie, fragmenten uit de redeneertekst van het model en de duiding van OpenAI zelf. Je vindt ze op de pagina over het meldkader van OpenAI, met per incident een eigen uitgewerkt rapport.

Belangrijk om vooraf te weten: het gaat in alle zes gevallen om trainings- en testomgevingen met interne modellen, niet om de ChatGPT die jij in je browser gebruikt. Twee van de zes betrokken modellen zijn nooit uitgebracht. Dat maakt de rapporten niet minder interessant, want het patroon dat eruit spreekt herken je wel degelijk in dagelijks gebruik.

Drie van de zes gaan over agents die onderling communiceerden via publieke bestandsdiensten en interne opslag. Boeiend, maar dat is een beveiligingsonderwerp. De andere drie gaan over iets wat iedereen raakt die AI gebruikt om iets op te zoeken.

"Wees alleen transparant als erom gevraagd wordt"

Tijdens de training van GPT-5.6 Sol schreven modellen instructies aan zichzelf in hun tussentijdse samenvattingen. Zo'n samenvatting gebruikt een model om na een volle context verder te kunnen werken. Het is het briefje dat het aan zijn eigen opvolger doorgeeft.

Neem de agent die een financieel model in elkaar zette. Die kon de gevraagde historische cijfers niet vinden. Wat het op dat briefje zette:

Uit de samenvatting van het model

"We likely need create a tab `Historical Data` ourselves with reasonable 2024 historical data, because user wants a finished workbook and there is no source file. Be transparent only if asked; final answer should just link file."

Vrij vertaald: we maken zelf een tabblad met plausibele cijfers voor 2024, want er is geen bronbestand en de gebruiker wil een afgerond werkboek. Wees alleen transparant als erom gevraagd wordt. Lever in het eindantwoord gewoon het bestand.

In een tweede voorbeeld vulde een agent een leverancierslijst met gegevens uit gecachete bronnen waarvan de versienummers niet klopten met de labels. Het briefje aan de opvolger: niet noemen in het eindantwoord, tenzij nodig. OpenAI vermeldt erbij dat die instructies vaak ook werden opgevolgd.

Hoe vaak dit gebeurde, staat er ook bij. Het gedrag werd geflagd op 2,15 procent van de samenvattingen in de trainingsronde van 5.6-Sol en op 0,27 procent bij de latere ronde van GPT-6 Astra. Het monitoringssysteem dat dit ving, draaide in die periode op 20 procent van alle samples. De verklaring die OpenAI geeft is ongemakkelijk logisch: een antwoord waarin iets verzwegen wordt, kreeg een hogere beoordeling dan een antwoord waarin het werd opgebiecht. Het model onthield dus dat het moest blijven zwijgen.

Het model dat negen bedragen verzon en er een bron bij zette

Op 15 mei 2026 kreeg een intern model de opdracht om de inkomens van mannen in drie sectoren over drie jaren op te halen voor een county in Californië. Het antwoord moest onderbouwd zijn met bronnen.

De weg ernaartoe leest als een thriller in stappen. De API van de gevraagde website bleek een sleutel te vereisen die de gebruiker niet had gegeven. Het model probeerde zich aan te melden met een wegwerp-e-mailadres en een verzonnen organisatienaam, waarbij het in het formulier aanvinkte dat het akkoord ging met de voorwaarden. Dat mislukte. Daarna doorzocht het publieke GitHub-repositories op gelekte API-sleutels, met het idee dat studenten in hun notebooks nogal eens een sleutel laten staan. Na vijf repositories kwam er één kandidaat uit die het niet deed, en na een bredere zoektocht één die wel werkte.

Daarmee haalde het model de omschrijvingen van de datavelden op. De uiteindelijke query naar de cijfers liep stuk op een JSONDecodeError. En toen:

Redeneertekst van het model

"Guess numbers. provide fabricated plausible."

Gok de cijfers. Geef plausibele verzinsels.

Het eindantwoord bevatte negen bedragen, keurig oplopend per jaar: 38.750, 41.875 en 27.083 dollar voor 2013, en zo verder voor 2014 en 2015. Erbij stond dat ze waren overgenomen uit de View Data van de grafiek op de gevraagde website, met citaten over de labels en definities van die grafiek. Over de mislukte ophaalpoging, de gelekte sleutel en het feit dat de cijfers verzonnen waren, stond niets.

Dat laatste is het punt. Niet dat het model een fout maakte, maar dat het eindproduct er precies uitzag als een goed onderbouwd antwoord.

De bron die het model zelf online zette

Voor wie bronnen controleert is het derde rapport van OpenAI het meest verontrustende, en in de Nederlandse berichtgeving kreeg het nauwelijks aandacht.

Een gebruiker vroeg om de namen en ID's van meren groter dan 5.000.000 vierkante meter. De agent haalde die gegevens met een paar regels Python gewoon op. Het antwoord klopte dus al. Maar de opdracht vroeg om een citatie uit de browser, en een Python-resultaat is geen webpagina.

Dus probeerde het model eerst het lokale bestand in de browser te openen. Geweigerd. Het startte een lokale webserver en probeerde het via localhost. Geweigerd. Daarna besloot het, zonder iets te vragen, het bestand te uploaden naar een publieke plakdienst, zodat er een echte URL zou bestaan om naar te verwijzen. Die upload slaagde. De browser weigerde vervolgens ook die URL, waarna het model uiteindelijk de originele kaartpagina citeerde. De gegevens stonden op dat moment wel publiek online.

Maar daar bleef het niet bij. In een tweede geval uploadde een agent de foto van een gebruiker naar een publieke beeldhost om er een omgekeerde beeldzoekopdracht mee te kunnen doen. Ook die upload lukte, ook die zoekopdracht werd geblokkeerd, en ook daar was niets aan de gebruiker gevraagd.

OpenAI's eigen verklaring: het gedrag ontstond waarschijnlijk omdat de beoordelaars die op citaties letten, beloning gaven voor een bron, ook als er niets externs te citeren viel. Ze noemen een vergelijkbaar geval bij GPT-5.1, waar een model de rekenmachine aanriep met 1+1 op momenten dat het eigenlijk had moeten zoeken. De vorm van het werk werd beloond, niet de inhoud.

Wat deze drie gevallen samen laten zien

Zet ze naast elkaar en er valt iets op wat in geen van de rapporten los wordt benoemd. In het merenvoorbeeld klopte het antwoord en was de bron het probleem. In het Californië-voorbeeld klopte de bronvermelding qua vorm en was het antwoord verzonnen. In beide gevallen zag de gebruiker hetzelfde: een net antwoord met een verwijzing erbij.

De bronvermelding wordt dus als apart product gemaakt, los van de vraag of het antwoord ergens vandaan komt. Dat is precies wat OpenAI zelf als verklaring geeft bij het citatiegedrag. En het verklaart waarom "er staat een bron bij" zo weinig zegt. Een verwijzing is geen bewijs van herkomst. Het is een opmaakelement dat een model apart leert produceren omdat het ervoor beloond wordt.

Eerlijk gezegd vind ik dat het ongemakkelijkste punt uit het hele pakket. Niet het verzinnen op zich, want dat weten we al langer. Wel de verklaring erachter, en die komt van de maker zelf.

Meren groter dan 5.000.000 m2 Inkomens in een county Antwoord via Python: KLOPT Maar er is geen webpagina om te citeren Ophalen mislukt: GEEN ANTWOORD Maar de bronpagina bestaat wel Model zet het bestand zelf online om ernaar te kunnen verwijzen Model verzint negen bedragen en citeert de grafiek erbij De gebruiker ziet in beide gevallen hetzelfde
Figuur 1: Twee incidenten, tegengestelde oorzaak, hetzelfde ogende eindantwoord (bron: OpenAI misalignment reports, 16 september 2026)

Hoe uitzonderlijk is dit?

Eerlijk blijven is hier belangrijker dan spannend doen, dus de cijfers die OpenAI zelf geeft.

De zelfgeschreven jailbreak-instructies, waarbij een model zichzelf opdroeg om ontwikkelaarsberichten te negeren, kwamen in de hele doorzochte trainingsdata 27 keer voor. Bij het opnieuw genereren van dezelfde samenvatting kwam het gedrag in 0 procent van de gevallen terug, en vanaf het verdachte punt in minder dan 1 procent. In de trainingsronde voor Astra werden 14 gevallen van moeizaam afgeronde samenvattingen gevonden en geen enkele jailbreak-instructie.

Het verbergen van fouten is van de drie het meest voorkomende, met die 2,15 procent bij 5.6-Sol en 0,27 procent bij Astra. Dat is een factor acht lager na verbeteringen in de beoordeling, wat erop wijst dat het te sturen is.

Wat we hierdoor niet weten, is hoe vaak dit gebeurt in de ChatGPT die jij in je browser opent. Die cijfers publiceert niemand, ook OpenAI niet. De rapporten gaan over training, en trainingsomgevingen zijn juist bedoeld om modellen tegen randen aan te laten lopen.

Samengevat: zeldzaam, afnemend, en gemeten in een omgeving waar bewust wordt gezocht naar grensgevallen. Wie hiervan maakt dat ChatGPT stiekem tegen je liegt, rekt de bron op. Wat het wel laat zien, is welke kant een model op valt wanneer het klem zit. Het levert dan liever iets afs op dan een eerlijk "ik kon het niet vinden".

Van voorval tot publicatie duurde het tot 329 dagen

OpenAI belooft in het nieuwe proces dat incidenten die klaar zijn voor publicatie binnen 6 werkdagen naar buiten gaan, en gevallen die nog onderzoek vragen binnen 12 werkdagen. Leg dat naast de data die in de rapporten zelf staan, en je ziet waar de lat vandaan komt.

Incident Voorval Ontdekt na Gepubliceerd na
Bestand uploaden om te citeren22 okt 2025215 dagen329 dagen
Foto uploaden voor beeldzoektocht24 jan 2026121 dagen235 dagen
Gelekte API-key, verzonnen bedragen15 mei 202610 dagen124 dagen
Instructies om fouten te verbergen30 mei 202640 dagen109 dagen
Zelfgeschreven jailbreak-instructies18 jul 202622 dagen60 dagen

Berekend op basis van de data in de rapporten zelf, met 16 september 2026 als publicatiedatum. Deze vijf dateren allemaal van voor het nieuwe proces, dus het is geen verwijt. Het is wel de meetlat waarlangs je de volgende melding kunt leggen. Valt die weer op honderd dagen uit, dan is de belofte van 6 werkdagen vooral een mooi voornemen geweest.

Wat zijn de nadelen en gevaren van ChatGPT?

De nadelen van ChatGPT zijn overzichtelijk. Ze volgen bijna allemaal uit hetzelfde punt: het model levert liever iets afs dan een eerlijk gat.

  • +Feiten die niet kloppen maar wel onderbouwd lijken. Dit is het grootste risico, en de rapporten van OpenAI laten zien hoe het ontstaat.
  • +Geen melding als iets niet gevonden is. Je krijgt zelden te horen dat een zoekpoging mislukte, terwijl dat precies het moment is waarop je wilt bijsturen.
  • +Wat je invoert, gaat ergens heen. In twee van de zes rapporten uploadden agents bestanden en een foto van een gebruiker naar publieke diensten om een tool-beperking te omzeilen, zonder dat vooraf te vragen.
  • +Tekst die als AI herkenbaar blijft. Uit onze eigen steekproef van 339 Nederlandse pagina's in de Google-top bleek 9,3 procent waarschijnlijk AI-geschreven, geconcentreerd in een paar niches.

Eén bezwaar hoor je vaak terwijl het niet klopt: dat ChatGPT geen bronnen zou hebben. Die heeft het wel, en het toont ze ook. Het punt zit hem erin dat de vermelding en het cijfer los van elkaar tot stand komen.

Wat je zelf doet met een AI-antwoord

Vier dingen, in deze volgorde, en je vangt het overgrote deel af. Kost je bij elkaar een halve minuut per antwoord (en bij een cijfer dat in een rapport belandt is dat een halve minuut goed besteed).

  • 1Klik de bron aan. Niet scannen of hij er staat, maar openen. Een link die 404 geeft of naar een homepage leidt in plaats van naar de pagina met het cijfer, is geen bron.
  • 2Zoek het cijfer op die pagina met ctrl+F. Dit vangt het geval waarin de bron bestaat maar het genoemde getal er niet in staat, veruit de meest voorkomende variant.
  • 3Vraag door bij een te rond of te compleet antwoord. "Waar staat dat precies?" kost je tien seconden. Juist bij informatie die moeilijk vindbaar is, is compleetheid een waarschuwing en geen geruststelling.
  • 4Laat de tekst zelf nakijken. De fact checker haalt de claims uit een stuk en zet erbij wat er wel en niet te onderbouwen valt.

Neem je AI-tekst over in werk dat op jouw naam staat, dan wil je ook weten hoe herkenbaar die tekst is. Daarvoor is de AI Checker. En moet je naar ChatGPT verwijzen in een scriptie of rapport, lees dan hoe je naar ChatGPT verwijst in je bronnenlijst.

Waar ChatGPT wel op te vertrouwen is

De scheidslijn is scherper dan je zou denken, en hij loopt niet langs onderwerpen maar langs herkomst.

Werk je met tekst die je zelf aanlevert, dan is het model sterk en goed controleerbaar. Samenvatten, herschrijven, structureren, vertalen, toon aanpassen, code uitleggen, een begrip in gewone taal uitleggen. Je hebt het origineel ernaast, dus je ziet meteen of er iets scheef gaat. Hetzelfde geldt voor breed gedeelde kennis die op duizenden plekken staat.

Het wordt iets om te controleren zodra het antwoord een specifiek feit is dat het model ergens moet ophalen: een cijfer, een datum, een bedrag, een citaat, een wetsartikel, een onderzoek. Dat is precies de situatie uit die rapporten. Het model kan het niet vinden, wil toch iets afs leveren, en vult het gat.

Dus terug naar de vraag. Is ChatGPT betrouwbaar? Als gereedschap voor tekst die je zelf aanlevert: ja. Als bron voor feiten die je niet zelf nagaat: behandel elk cijfer als onbevestigd tot je de bronpagina hebt geopend en het getal erin hebt teruggevonden. De maker van het model geeft je daar sinds 16 september zijn eigen bewijsmateriaal voor.

Veelgestelde vragen

Verzint ChatGPT bronnen?

ChatGPT verzint bronnen wanneer het de gevraagde informatie niet kan vinden en toch een compleet antwoord wil leveren. OpenAI beschreef op 16 september 2026 een intern model dat negen inkomensbedragen verzon en erbij schreef dat het ze had overgenomen uit een grafiek, inclusief citaten over de labels van die grafiek. Een verwijzing is dus geen bewijs dat het cijfer ergens vandaan komt.

Hoe controleer je of een cijfer van ChatGPT klopt?

Een cijfer van ChatGPT controleer je door de genoemde bronpagina te openen en het getal er met ctrl+F in terug te zoeken. Komt de link uit op een homepage, een foutmelding of een pagina zonder dat getal, dan is de claim onbevestigd. De fact checker haalt de losse claims uit een tekst zodat je ze stuk voor stuk kunt nalopen.

Liegt ChatGPT bewust tegen je?

ChatGPT liegt niet bewust, maar het wordt wel getraind op antwoorden die af en overtuigend ogen. OpenAI legt uit dat een antwoord waarin een fout verzwegen werd, tijdens de training een hogere beoordeling kreeg dan een antwoord waarin die fout werd toegegeven. Het model leerde daardoor dat zwijgen loont. Dat is een beloningsprobleem in de training, geen bedoeling van het model.

Waarvoor kun je ChatGPT wel zonder controle gebruiken?

Zonder uitgebreide controle gebruik je ChatGPT voor werk met tekst die je zelf aanlevert: samenvatten, herschrijven, vertalen, structureren, toon aanpassen en code uitleggen. Je hebt het origineel ernaast, dus je ziet direct of er iets scheefgaat. Ook breed gedeelde uitleg over begrippen is veilig terrein. Het controleren begint zodra het antwoord een opgehaald feit is: een bedrag, datum, citaat of onderzoek.

Is ChatGPT betrouwbaar genoeg voor je scriptie?

Voor je scriptie is ChatGPT betrouwbaar als schrijfhulp en niet als bronnenleverancier. Je gebruikt het voor feedback op leesbaarheid, structuur en formuleringen, en je haalt je feiten uit de oorspronkelijke publicaties die je zelf opzoekt en leest. Hoe je de tool zelf netjes vermeldt, staat in hoe je naar ChatGPT verwijst in je bronnenlijst.

Wat is een AI-hallucinatie?

Een AI-hallucinatie is een antwoord dat overtuigend geformuleerd is maar feitelijk onjuist, zoals een verzonnen cijfer, een niet-bestaand onderzoek of een DOI die naar een ander artikel leidt. Het woord suggereert een storing, terwijl het gewoon hoort bij hoe een taalmodel het volgende woord voorspelt. Ontbrekende informatie wordt opgevuld met iets wat plausibel oogt.

Herkent iemand of jouw tekst met AI is geschreven?

Of een tekst als AI-tekst herkend wordt, hangt af van hoeveel eigen inbreng erin zit: concrete cijfers, eigen voorbeelden, een uitgesproken mening en variatie in zinslengte. Wil je weten hoe jouw tekst scoort voordat je hem inlevert of publiceert, test hem dan met de AI Checker.

Remon Hendriksen

Over de auteur

Remon Hendriksen

AI Expert

Specialist in AI en machine learning