Kennisbank

Factualiteitsevaluatie: hoe controleer je of een AI de waarheid spreekt?

Bijgewerkt: 24 september 2026 · 5 min leestijd

Stel je voor dat je een heel slimme stagiair hebt die alles razendsnel kan opschrijven, maar die af en toe met volle overtuiging iets verzint. Hij noemt een jaartal dat niet klopt, een studie die niet bestaat, of een citaat dat nooit is uitgesproken — en dat allemaal in vloeiende, geloofwaardige zinnen. Dat is precies het probleem met veel AI-taalmodellen zoals ChatGPT, Gemini of Claude. Ze hallucineren soms: ze produceren tekst die er feitelijk uitziet, maar het niet is.

Factualiteitsevaluatie is het vakgebied dat zich bezighoudt met het meten van hoe vaak en op welke manier dat misgaat. Onderzoekers ontwikkelen tests, scoresystemen en zelfs andere AI-modellen die als 'controleur' fungeren, om te bepalen of de uitspraken van een taalmodel kloppen met de werkelijkheid. Het is te vergelijken met een eindredacteur die elke bewering in een artikel narekent voordat het gepubliceerd wordt — alleen dan op een schaal van miljoenen zinnen per dag.

Wat is het precies?

Factualiteitsevaluatie bestaat meestal uit een paar stappen. Eerst wordt de tekst die een AI-model heeft gegenereerd, opgesplitst in losse, controleerbare beweringen. Dit heet het maken van atomic facts (atomaire feiten): korte, op zichzelf staande claims zoals 'Napoleon werd geboren in 1769' in plaats van een hele alinea vol informatie.

Daarna wordt elke afzonderlijke bewering getoetst aan een betrouwbare bron. Dat kan Wikipedia zijn, een wetenschappelijke database, of live zoekresultaten van het internet. Sommige systemen geven het model zelf de opdracht om, net als een journalist, bewijs te zoeken voor zijn eigen uitspraken voordat ze worden goedgekeurd.

Een steeds populairdere methode is LLM-as-a-judge: je laat een ander (vaak krachtiger) taalmodel beoordelen of de uitspraken van het eerste model kloppen. Dat is snel en goedkoop vergeleken met menselijke factcheckers, maar het heeft een bekend nadeel: modellen hebben de neiging om teksten die op hun eigen schrijfstijl lijken, gunstiger te beoordelen. Dat heet self-preference bias, oftewel voorkeur voor het eigen soort.

Naast geautomatiseerde methoden blijft menselijke beoordeling belangrijk. Getrainde beoordelaars — soms professionele factcheckers — nemen steekproeven en scoren die handmatig. Dat is arbeidsintensief, maar wordt vaak gebruikt als 'gouden standaard' om te controleren of de automatische systemen zelf wel kloppen.

Wat wil men ermee bereiken?

Het uiteindelijke doel is vertrouwen. Als mensen AI-systemen gaan gebruiken voor medisch advies, juridische vragen of nieuwsoverzichten, moet duidelijk zijn hoe betrouwbaar de antwoorden zijn. Zonder goede factualiteitsevaluatie is er geen manier om verschillende modellen eerlijk met elkaar te vergelijken, of om vooruitgang te meten tussen de ene modelversie en de volgende.

Er is ook een commercieel belang: bedrijven als OpenAI, Google en Anthropic willen kunnen aantonen dat hun nieuwste model minder hallucineert dan de vorige versie of dan de concurrentie. Factualiteitsbenchmarks worden daardoor onderdeel van de marketing én van de technische verantwoording tegelijk.

Daarnaast speelt maatschappelijke veiligheid een rol. Overheden en toezichthouders — denk aan de Europese AI-verordening (AI Act) — vragen steeds vaker om aantoonbare kwaliteitscontrole van AI-systemen die publiek worden ingezet. Factualiteitsevaluatie is daarbij een van de meetbare bouwstenen, naast bijvoorbeeld veiligheid en privacy.

Tot slot hopen onderzoekers dat goede evaluatiemethoden ook helpen om hallucinaties daadwerkelijk te verminderen: als je precies kunt meten waar een model de fout ingaat, kun je gerichter bijsturen tijdens de training.

Voorbeelden uit de praktijk

TruthfulQA (2021) was een van de eerste bekende benchmarks, ontwikkeld door onderzoekers verbonden aan Oxford en OpenAI. De test bevat vragen die mensen vaak fout beantwoorden door wijdverbreide misvattingen (bijvoorbeeld over gezondheid of geschiedenis), om te zien of een taalmodel die misvattingen napraat of corrigeert.

FActScore (2023), ontwikkeld door onderzoekers van de University of Washington, splitst door AI geschreven biografieën op in losse feitjes en controleert elk feitje afzonderlijk tegen Wikipedia. De uitkomst is een percentage: hoeveel procent van de beweringen klopt.

SAFE (Search-Augmented Factuality Evaluator, 2024) van Google DeepMind gaat een stap verder: het systeem laat een taalmodel zelf zoekopdrachten formuleren en uitvoeren om elke bewering te verifiëren, vergelijkbaar met hoe een factchecker het web raadpleegt. Dit werd getest op de bijbehorende LongFact-benchmark, gericht op lange, uitgebreide antwoorden in plaats van korte quizvragen.

SimpleQA (2024) van OpenAI is juist gericht op korte, feitelijke vragen met één duidelijk correct antwoord, specifiek ontworpen om te meten hoe goed een model weet wanneer het iets niet zeker weet — een belangrijk aspect, want een model dat eerlijk 'ik weet het niet' zegt, is vaak nuttiger dan een model dat gokt.

Ook Stanford's HELM-project (Holistic Evaluation of Language Models), van het Center for Research on Foundation Models, neemt factualiteit op als een van de vele meetpunten waarop taalmodellen doorlopend en publiek worden vergeleken.

Hoe ver is de techniek?

Factualiteitsevaluatie is een jong maar snel groeiend onderzoeksveld: de meeste genoemde methoden dateren van 2021 tot 2024. De ontwikkeling gaat hard, mede doordat elke nieuwe generatie taalmodellen opnieuw getest moet worden.

Tegelijk kampt het veld met fundamentele obstakels. Ten eerste is 'waarheid' niet altijd zwart-wit: bij actuele gebeurtenissen, wetenschappelijke discussies of meningsverschillen tussen bronnen is het lastig om één correct antwoord vast te stellen. Ten tweede zijn de controlerende AI-modellen zelf niet feilloos — een systeem dat feiten checkt met een ander taalmodel, erft mogelijk ook diens fouten en vooroordelen. Ten derde is er het probleem van bewegende doelen: benchmarks die vandaag lastig zijn, worden soms binnen een jaar door nieuwe modellen 'opgelost', zonder dat duidelijk is of het onderliggende probleem écht is aangepakt of dat het model simpelweg is getraind op vergelijkbare voorbeelden.

Retrieval-Augmented Generation (RAG) — een techniek waarbij een model eerst relevante documenten opzoekt voordat het antwoordt, geïntroduceerd door onderzoekers van Meta AI in 2020 — wordt vaak genoemd als manier om hallucinaties te verminderen. Het helpt aantoonbaar, maar lost het probleem niet volledig op: een model kan nog steeds foutief citeren uit de juiste bron, of de verkeerde bron kiezen.

Kortom: de meetinstrumenten worden steeds verfijnder, maar er bestaat nog geen consensus over één standaardmethode, en volledige, betrouwbare automatische factchecking op elk kennisdomein is nog niet bereikt.

Wie werken eraan?

De grote AI-laboratoria — OpenAI, Google DeepMind, Anthropic en Meta AI (FAIR) — hebben allemaal eigen onderzoeksteams die zich specifiek richten op factualiteit en het verminderen van hallucinaties, vaak als onderdeel van bredere 'veiligheids'- of 'alignment'-teams.

Aan de academische kant spelen Amerikaanse universiteiten een grote rol: Stanford (met het CRFM en het HELM-project), de University of Washington (makers van FActScore) en instituten zoals het Allen Institute for AI (AI2) in Seattle, dat meerdere open benchmarks en open taalmodellen publiceert waarmee factualiteit onafhankelijk getest kan worden.

Verder zijn er initiatieven die AI-evaluatie proberen te verbinden met de journalistieke factcheckwereld, waarbij menselijke factcheckorganisaties als referentiepunt dienen voor wat 'correct gecontroleerd' betekent — al is dit terrein, vergeleken met de grote technische benchmarks, nog kleinschalig en versnipperd. Ook Europese onderzoeksgroepen en instanties zoals de EU (in de context van de AI Act) houden zich bezig met normen voor betrouwbaarheid van AI-output, al ligt de nadruk daar meer op regelgeving dan op technische benchmarks.

Verder lezen