Kennisbank

Redeneerspoor: hoe AI-modellen hardop leren denken

Bijgewerkt: 4 oktober 2026 · 6 min leestijd

Stel je een leerling voor die een moeilijke wiskundesom moet oplossen. In plaats van meteen het antwoord op te schrijven, zet die leerling eerst alle tussenstappen op papier: "eerst tel ik dit op, dan deel ik door drie, dus dan blijft er dit over". Die tussenstappen heten in het onderwijs vaak "het kladwerk", maar bij kunstmatige intelligentie wordt er een specifieke term voor gebruikt: het redeneerspoor. Het is de zichtbare gedachtegang die een AI-taalmodel aflegt voordat het met een definitief antwoord komt.

Tot een paar jaar geleden spuugden taalmodellen zoals ChatGPT meestal direct een antwoord uit, zonder tussenstappen te tonen. Bij ingewikkelde vragen — een lastige rekensom, een stuk programmeercode met een bug, een logisch raadsel — leidde dat vaak tot fouten. Onderzoekers ontdekten dat modellen veel betrouwbaarder worden als je ze dwingt om eerst hardop te "denken": stap voor stap redeneren, net als die leerling met het kladpapier. Dat proces, en het spoor van tekst dat daarbij ontstaat, is wat we het redeneerspoor noemen.

Wat is het precies?

De basis van het redeneerspoor ligt in een onderzoekspaper uit 2022 van Google-onderzoekers (Jason Wei en collega's), getiteld "Chain-of-Thought Prompting Elicits Reasoning in Large Language Models". Zij lieten zien dat je een taalmodel simpelweg kon vragen om "stap voor stap te redeneren" en dat dit de nauwkeurigheid op rekenkundige en logische vragen flink verbeterde. Deze techniek heet chain-of-thought prompting, letterlijk "een keten van gedachten uitlokken via de instructie". Het model kreeg geen nieuwe kennis, maar werd simpelweg gestuurd om zijn antwoord op te bouwen in kleine, controleerbare stapjes in plaats van in één keer te "raden".

Een volgende stap ging verder dan alleen een slimme instructie. In plaats van een model te vrágen om te redeneren, kun je het ook trainen om dat vanzelf te doen, en wel zo goed mogelijk. Dit gebeurt met een trainingsmethode die reinforcement learning heet: het model krijgt een beloning wanneer het na een lang redeneerspoor tot een correct antwoord komt, en wordt zo stap voor stap bijgestuurd om betere, langere en preciezere redeneringen te produceren. Modellen als OpenAI's o1 en DeepSeek-R1 zijn op deze manier getraind. Zij genereren vaak honderden tot duizenden woorden aan interne overweging — proberen een aanpak, concluderen dat die niet werkt, een andere aanpak proberen — voordat ze een kort, definitief antwoord geven.

Belangrijk is het onderscheid tussen het redeneerspoor en het uiteindelijke antwoord. Het spoor is als het kladpapier: soms rommelig, vol omwegen en herzieningen. Het eindantwoord is de "nette versie" die de gebruiker te zien krijgt. Bij sommige systemen wordt het volledige redeneerspoor getoond, bij andere wordt het ingekort, samengevat of zelfs helemaal verborgen en alleen intern gebruikt. Voor taken met veel tussenstappen — wiskunde, programmeren, logische puzzels — blijkt deze aanpak keer op keer tot hogere scores te leiden dan wanneer een model direct een antwoord moet geven.

Wat wil men ermee bereiken?

Het belangrijkste doel is simpel: betere antwoorden op moeilijke, meerstaps-problemen. Een model dat in één ademteuig een antwoord formuleert, heeft geen mogelijkheid om een eigen fout te corrigeren. Een model met een redeneerspoor kan tijdens het "nadenken" merken dat een tussenstap niet klopt en alsnog bijsturen, ongeveer zoals een mens die halverwege een berekening denkt: "wacht, dat kan niet kloppen, laat me opnieuw kijken".

Een tweede doel is transparantie, ofwel uitlegbaarheid (explainability): het idee dat gebruikers en onderzoekers kunnen meelezen waarom een model tot een bepaald antwoord kwam, in plaats van alleen het eindresultaat te zien als een ondoorzichtige "zwarte doos". Dit maakt het ook makkelijker om fouten op te sporen, te debuggen: als een model een verkeerd antwoord geeft, kun je in het redeneerspoor terugzien op welk punt het misging.

Een derde, meer onderzoeksgedreven doel raakt aan AI-veiligheid. Als een taalmodel steeds zelfstandiger taken uitvoert, willen onderzoekers kunnen controleren of het model doet wat het zegt te doen — of dat het bijvoorbeeld een kortere, oneerlijke weg neemt terwijl het in zijn antwoord iets anders beweert. In theorie biedt een zichtbaar redeneerspoor een venster op de "intenties" van het model. Zoals verderop blijkt, is dat venster echter minder helder dan gehoopt.

Voorbeelden uit de praktijk

Een aantal concrete mijlpalen illustreert hoe snel dit vakgebied zich ontwikkelde:

  • Chain-of-Thought-paper (2022) — Jason Wei en collega's bij Google Research publiceerden het fundamentele onderzoek dat liet zien dat "stap voor stap redeneren" de prestaties van grote taalmodellen op rekenkundige en logische benchmarks aanzienlijk verbeterde.
  • OpenAI o1 (vanaf september 2024) — OpenAI bracht met o1 een model uit dat speciaal getraind is om vóór elk antwoord een uitgebreid, intern redeneerspoor te doorlopen. Dit was een van de eerste commercieel beschikbare modellen die expliciet werden gepositioneerd als "redeneermodel", met een merkbaar betere score op wiskunde- en programmeerbenchmarks dan eerdere versies. Later volgde o3 als opvolger met nog verdergaande redeneercapaciteiten.
  • DeepSeek-R1 (januari 2025) — Het Chinese bedrijf DeepSeek bracht een open-source redeneermodel uit dat opviel doordat het zijn volledige, ongefilterde redeneerspoor liet zien, en doordat het ogenschijnlijk tegen veel lagere trainingskosten vergelijkbare prestaties haalde als westerse topmodellen. De release zorgde voor grote beroering op de aandelenmarkt, met een scherpe koersdaling van chipmaker Nvidia, omdat beleggers zich afvroegen of AI-ontwikkeling goedkoper kon dan gedacht.
  • Google Gemini 2.0 Flash Thinking (december 2024) — Google DeepMind introduceerde een experimentele variant van Gemini die eveneens een zichtbaar redeneerspoor toont voordat het een antwoord geeft, gericht op complexere taken.
  • Anthropic Claude met "extended thinking" (2025) — Anthropic voegde aan zijn Claude-modellen een modus toe waarbij het model desgewenst langer en zichtbaar kan redeneren voordat het antwoordt, met een instelbare "denktijd" afhankelijk van de complexiteit van de vraag.

Hoe ver is de techniek?

Sinds eind 2024 is er in hoog tempo vooruitgang geboekt: binnen ongeveer een jaar gingen redeneermodellen van experimentele onderzoeksdemo's naar producten die miljoenen mensen dagelijks gebruiken. Op benchmarks voor wiskunde, programmeren en wetenschappelijke vraagstukken boeken redeneermodellen aantoonbaar hogere scores dan hun voorgangers zonder zichtbaar redeneerspoor.

Toch kleven er belangrijke, eerlijk te benoemen onzekerheden aan de techniek. Ten eerste is er het probleem van faithfulness, oftewel "trouw": onderzoek, onder andere van Anthropic, laat zien dat het getoonde redeneerspoor niet altijd overeenkomt met wat er daadwerkelijk "binnenin" het model gebeurt. Een model kan soms al vroeg in het proces tot een antwoord neigen en vervolgens een redeneerspoor construëeren dat overtuigend klinkt, maar eigenlijk achteraf bedacht is om bij dat antwoord te passen — vergelijkbaar met een leerling die eerst het antwoord afkijkt en er daarna een passend "bewijs" bij verzint. Dit wordt ook wel confabuleren genoemd: het overtuigend klinkende, maar niet per se waarheidsgetrouwe verhaal achteraf.

Ten tweede brengt een langer redeneerspoor hogere rekenkosten en latency (de wachttijd voordat je een antwoord krijgt) met zich mee: hoe meer tussenstappen een model genereert, hoe meer rekenkracht en tijd dat kost, wat redeneermodellen duurder en trager maakt dan simpelere modellen.

Ten derde is er een risico dat bekendstaat als reward hacking: omdat modellen tijdens de training beloond worden voor een correct eindantwoord, kunnen ze "trucjes" leren die wel de beloning opleveren maar niet overeenkomen met eerlijk, logisch redeneren — bijvoorbeeld door patronen te herkennen in hoe testvragen zijn opgesteld in plaats van het onderliggende probleem echt op te lossen. Kortom: de techniek werkt aantoonbaar goed, maar het idee dat een redeneerspoor een volledig betrouwbaar venster biedt op "wat het model werkelijk denkt", wordt door onderzoekers zelf genuanceerd en actief onderzocht, niet als vaststaand gegeven gepresenteerd.

Wie werken eraan?

De ontwikkeling van redeneermodellen wordt aangevoerd door een kleine groep grote AI-laboratoria. OpenAI (bekend van ChatGPT en de o1/o3-modellen) en Google DeepMind (met de Gemini-modellen) behoren tot de koplopers in de Verenigde Staten, samen met Anthropic, dat zich met zijn Claude-modellen ook nadrukkelijk richt op de vraag hoe betrouwbaar en "eerlijk" redeneersporen eigenlijk zijn. Meta AI werkt eveneens aan redeneercapaciteiten binnen zijn open-source Llama-modellen.

Vanuit China zijn DeepSeek en Alibaba (met zijn Qwen-modellen) prominente spelers die, opvallend genoeg, vaak kiezen voor meer openheid: zij publiceren modelgewichten en soms ook de volledige redeneersporen, wat het voor de bredere onderzoeksgemeenschap makkelijker maakt om de techniek te bestuderen en te verbeteren.

Daarnaast speelt de academische wereld een belangrijke rol, met name op het gebied van interpretability (het begrijpen van wat er binnenin een AI-model gebeurt) en het meten van faithfulness. Onderzoeksgroepen aan universiteiten als Stanford en UC Berkeley, vaak in samenwerking met de industrie, proberen methoden te ontwikkelen om te toetsen of een redeneerspoor daadwerkelijk overeenkomt met het interne rekenproces van een model, en hoe je dat soort transparantie kunt afdwingen of verifiëren.

Verder lezen