Kennisbank

Zelfverificatie: waarom AI-systemen leren hun eigen antwoorden te controleren

Bijgewerkt: 22 september 2026 · 6 min leestijd

Stel je voor dat een rekenmachine niet alleen een uitkomst gaf, maar er ook zelf even bij stilstond om te checken: "klopt dit wel?" Dat is in de kern wat zelfverificatie is bij kunstmatige intelligentie. Het is een verzameling technieken waarbij een AI-systeem, meestal een taalmodel zoals ChatGPT of vergelijkbare systemen, zijn eigen redenering of antwoord nog eens naloopt vóórdat het dat antwoord definitief presenteert.

Een menselijke vergelijking: een leerling die een som heeft uitgerekend en die vervolgens terugrekent om te zien of het klopt, of een tekstschrijver die na het schrijven van een stuk terugleest en fouten eruit haalt. Taalmodellen deden dat lange tijd niet vanzelf; ze produceerden woord voor woord een antwoord en gingen daar niet meer op terug. Zelfverificatie probeert daar verandering in te brengen door het model een soort interne controlestap te geven.

Wat is het precies?

Om zelfverificatie te begrijpen, helpt het om eerst te weten hoe taalmodellen redeneren. Bij complexe vragen gebruiken moderne modellen vaak "chain-of-thought": ze schrijven tussenstappen uit, zoals een leerling die zijn rekenwerk op papier zet, in plaats van meteen met het eindantwoord te komen. Dat verbetert de nauwkeurigheid al aanzienlijk, maar het model kan nog steeds een foute tussenstap door laten glippen.

Zelfverificatie voegt daar een extra laag aan toe. In de praktijk zijn er verschillende varianten. Bij self-consistency, geïntroduceerd door onderzoekers van Google in 2022, laat men het model meerdere keren onafhankelijk over hetzelfde probleem nadenken en neemt men vervolgens het antwoord waar de meeste redeneerpaden op uitkomen, vergelijkbaar met een groep mensen die apart van elkaar een som maakt en dan gaat stemmen over de uitkomst.

Een andere aanpak, beschreven in het onderzoek "Large Language Models are Better Reasoners with Self-Verification", laat het model de eigen conclusie gebruiken om terug te redeneren naar de oorspronkelijke vraag, om te checken of dat consistent is. Weer een andere methode, Chain-of-Verification van onderzoekers bij Meta AI, laat het model na een eerste antwoord zelf kritische controlevragen bedenken, die apart beantwoorden, en op basis daarvan het antwoord bijstellen.

Bij de nieuwste generatie "redenerende" modellen, zoals OpenAI's o1-serie en DeepSeek-R1, zit zelfcontrole ingebakken in het denkproces zelf. Deze modellen genereren een uitgebreide interne redenering voordat ze een uiteindelijk antwoord geven, en tijdens dat proces lijken ze spontaan gedrag te vertonen dat lijkt op nadenken, twijfelen en jezelf corrigeren: "wacht, dat klopt niet, laat ik het anders proberen". Dat gedrag ontstaat niet omdat iemand het expliciet heeft geprogrammeerd, maar omdat het model tijdens training beloond wordt voor het vinden van het juiste eindantwoord, en zelfcorrectie blijkt daarbij te helpen.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is betrouwbaarheid. Taalmodellen staan bekend om "hallucinaties": ze presenteren soms met volle overtuiging informatie die feitelijk onjuist is, zonder dat ze zelf enig signaal van twijfel afgeven. Voor toepassingen als medisch advies, juridisch onderzoek, softwarecode of wiskundige bewijzen kan dat grote gevolgen hebben.

Zelfverificatie is een poging om die betrouwbaarheid te vergroten zonder dat er telkens een mens nodig is om alles te controleren. Het idee is dat een model dat zijn eigen werk kritisch naloopt, minder rekenfouten, feitelijke missers en logische kortsluitingen doorlaat naar de gebruiker.

Er is ook een technisch doel achter: het trainen van betere modellen. Onderzoekers gebruiken zelfverificatie niet alleen om eindgebruikers een beter antwoord te geven, maar ook als hulpmiddel tijdens de training zelf. Door een model te belonen voor het correct beoordelen van tussenstappen in een redenering, in plaats van alleen voor het uiteindelijke antwoord, hopen onderzoekers modellen te bouwen die niet toevallig het juiste antwoord raden maar er daadwerkelijk op een controleerbare manier naartoe redeneren. Dit onderscheid wordt in de vakliteratuur wel aangeduid met "process reward models", die elke tussenstap beoordelen, tegenover "outcome reward models", die alleen naar het eindresultaat kijken.

Voorbeelden uit de praktijk

Een aantal concrete voorbeelden laat zien hoe zelfverificatie inmiddels wordt toegepast:

  • Constitutional AI (Anthropic, 2022) — het bedrijf achter Claude ontwikkelde een methode waarbij een model zijn eigen antwoorden bekritiseert en herschrijft aan de hand van een vaste set geschreven principes, in plaats van dat een mens elk antwoord moet beoordelen. Dit werd gebruikt om modellen veiliger en behulpzamer te maken.
  • OpenAI's o1-model (vanaf september 2024) — dit was een van de eerste breed beschikbare modellen die opvallend meer tijd nemen om "na te denken" voordat ze antwoorden, met een intern redeneerproces waarin het model expliciet foutcorrectie en alternatieve aanpakken lijkt toe te passen.
  • DeepSeek-R1 (januari 2025) — dit Chinese, openbaar beschikbare model werd getraind met een vorm van reinforcement learning waarbij het model puur op basis van beloning voor correcte antwoorden leerde redeneren. Onderzoekers beschreven een opvallend "aha-moment" in de trainingslogs, waarbij het model tijdens het redeneren zelf terugkomt op een eerdere stap en die herziet, zonder dat dit gedrag expliciet was voorgeprogrammeerd.
  • AlphaProof (Google DeepMind, 2024) — bij wiskundige bewijzen combineerde DeepMind een taalmodel met het formele bewijssysteem Lean. Elke redeneerstap van het model wordt door Lean automatisch en met wiskundige zekerheid gecontroleerd, wat een veel sterkere vorm van verificatie oplevert dan een taalmodel dat zichzelf in gewone taal naloopt. Hiermee behaalde het systeem bij de Internationale Wiskunde Olympiade 2024 een score die gelijkstaat aan een zilveren medaille.
  • Chain-of-Verification (Meta AI, 2023) — onderzoekers testten deze methode onder meer op vraag-antwoordtaken en lieten zien dat het aantal feitelijke fouten in langere antwoorden merkbaar afnam wanneer het model eerst zelf controlevragen genereerde en beantwoordde.

Hoe ver is de techniek?

Zelfverificatie is geen afgerond onderzoeksgebied maar een snel bewegend front. De afgelopen twee á drie jaar is de ontwikkeling in een stroomversnelling geraakt, met name doordat grote AI-bedrijven zijn overgestapt van modellen die direct antwoorden naar modellen die eerst uitgebreid "redeneren". Dat heeft aantoonbaar betere resultaten opgeleverd op wiskunde-, programmeer- en logicatoetsen.

Toch zijn er stevige kanttekeningen. Onderzoek, onder meer van Google-onderzoekers, heeft laten zien dat taalmodellen zonder externe hulp vaak niet betrouwbaar hun eigen fouten kunnen opsporen: als een model geen extern controlemiddel heeft, zoals een rekenprogramma, een compiler, of in het geval van AlphaProof het formele systeem Lean, dan kan de "zelfcontrole" net zo goed zelf een hallucinatie zijn. Een model dat overtuigd is van een fout antwoord, kan bij het "verifiëren" daarvan alsnog concluderen dat het klopt.

Daarnaast kost uitgebreid redeneren en verifiëren aanzienlijk meer rekenkracht en tijd, wat de kosten van dit soort AI-systemen omhoog drijft. Er is dus een voortdurende afweging tussen betrouwbaarheid en snelheid of kosten. Vooralsnog werkt zelfverificatie het best in domeinen met een objectief controleerbaar antwoord, zoals wiskunde en programmeren, waar een extern hulpmiddel de uitkomst daadwerkelijk kan narekenen. Bij vage, feitelijke of meningsgevoelige vragen is de winst kleiner en minder goed gegarandeerd.

Wie werken eraan?

Het onderzoek naar zelfverificatie wordt gedreven door zowel grote techbedrijven als academische groepen. OpenAI (Verenigde Staten) heeft met de o1- en latere o-modellen redeneren en interne controle een centrale plek gegeven in zijn productlijn. Anthropic (Verenigde Staten), de maker van Claude, werkt met Constitutional AI aan zelfcontrole gericht op veiligheid en gedrag. Google DeepMind (Verenigd Koninkrijk/Verenigde Staten) combineert taalmodellen met formele verificatiesystemen, zoals te zien bij AlphaProof, en publiceert ook kritisch onderzoek naar de grenzen van zelfcorrectie. DeepSeek (China) heeft met het open-source model R1 laten zien dat zelfverificatie-achtig gedrag ook kan ontstaan bij een kleiner team met minder rekenkracht dan de Amerikaanse techreuzen. Meta AI (Verenigde Staten) heeft met Chain-of-Verification een invloedrijke methode gepubliceerd die breed door de onderzoeksgemeenschap wordt gebruikt. Daarnaast dragen universiteiten wereldwijd, met name in de VS en China, via publicaties op platforms als arXiv voortdurend nieuwe varianten en kritische evaluaties bij aan dit veld.

Verder lezen