Kennisbank

Automatische grader: hoe AI-modellen leren zonder mensen die alles nakijken

Bijgewerkt: 24 september 2026 · 5 min leestijd

Stel je een enorme toets voor met miljoenen wiskundesommen en programmeeropdrachten. Normaal gesproken zou een leraar die allemaal met de hand moeten nakijken, wat weken zou duren. Een automatische grader is software die dit nakijkwerk overneemt: het beoordeelt of een antwoord goed of fout is, vaak binnen een fractie van een seconde, zonder dat er een mens naar hoeft te kijken.

In de wereld van kunstmatige intelligentie is dit veel meer dan een handig hulpmiddel voor huiswerk. Automatische graders zijn de motor achter een groot deel van de vooruitgang in taalmodellen sinds 2024. Wanneer een AI-model duizenden keren per seconde probeert een wiskundeprobleem op te lossen of code te schrijven, moet er iets zijn dat razendsnel zegt "dit klopt" of "dit klopt niet", zodat het model daarvan kan leren. Dat iets is de automatische grader.

Wat is het precies?

Er bestaan grofweg drie soorten automatische graders, elk met hun eigen sterke en zwakke punten.

De eenvoudigste vorm is de rule-based grader: een grader die volgens vaste, harde regels controleert. Bij een programmeeropdracht kan dit een unit test zijn, een stukje testcode dat controleert of het programma van het model het juiste antwoord teruggeeft. Bij een wiskundeprobleem kan de grader simpelweg het eindgetal vergelijken met de bekende, correcte uitkomst. Deze aanpak is betrouwbaar en moeilijk te misleiden, maar werkt alleen als er een duidelijk, controleerbaar "goed antwoord" bestaat.

De tweede vorm is het reward model (beloningsmodel): een apart AI-model dat getraind is om te voorspellen hoe een mens een antwoord zou beoordelen. Onderzoekers laten mensen eerst duizenden antwoordparen vergelijken ("welk van deze twee is beter?"), en trainen daarna een model dat dit patroon overneemt. Zo kan de grader ook oordelen over zaken die niet met een simpel ja/nee te vangen zijn, zoals de kwaliteit van een uitleg.

De derde, recentere vorm is LLM-as-judge: hierbij beoordeelt het ene taalmodel de output van een ander taalmodel, met een instructie zoals "beoordeel dit antwoord op juistheid en duidelijkheid, geef een cijfer van 1 tot 10". Dit is flexibel en schaalbaar, maar minder streng en consistent dan een rule-based grader.

In de praktijk combineren onderzoekers deze methoden vaak: harde regels waar mogelijk, en modelmatige beoordeling waar nodig.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is opschalen. Menselijke beoordelaars inhuren om miljoenen AI-antwoorden te controleren is traag en duur. Een automatische grader kan dat werk in principe onbeperkt herhalen, dag en nacht, tegen een fractie van de kosten.

Dit is cruciaal geworden voor een trainingstechniek die reinforcement learning (versterkend leren) heet: het model doet een poging, krijgt een beloningssignaal (goed of fout, hoog of laag cijfer), en past zichzelf aan om vaker beloond te worden. Zonder een snelle, automatische bron van beloningssignalen is grootschalig versterkend leren voor taalmodellen simpelweg niet haalbaar.

Een specifieke variant hiervan, die sinds 2024 veel aandacht kreeg, heet RLVR (reinforcement learning with verifiable rewards, versterkend leren met verifieerbare beloningen). Hierbij gebruikt men uitsluitend taken waarbij de juistheid van een antwoord objectief te controleren is, zoals wiskunde met een uitkomst of code die wel of niet door tests komt. Deze aanpak bleek een belangrijke sleutel te zijn achter de sterk verbeterde redeneervaardigheden van recente modellen.

Voorbeelden uit de praktijk

Enkele concrete voorbeelden laten zien hoe automatische graders in de praktijk worden ingezet.

  • DeepSeek-R1 (2025): het Chinese AI-lab DeepSeek trainde dit redeneermodel grotendeels met rule-based graders (correcte wiskunde-uitkomsten en werkende code) in combinatie met een eigen reinforcement-learningmethode genaamd GRPO (Group Relative Policy Optimization). Het model leerde zo stap-voor-stap redeneren te verbeteren, puur op basis van of het eindantwoord klopte.
  • OpenAI's o1- en o3-modellen (2024-2025): OpenAI beschreef dat deze modellen via versterkend leren met verifieerbare beloningen zijn getraind op wiskunde- en programmeertaken, waarbij automatische controle van antwoorden en code een centrale rol speelde in het verbeteren van hun redeneervermogen.
  • SWE-bench: een veelgebruikte benchmark (testverzameling) waarin AI-agenten echte software-bugs uit open-sourceprojecten moeten oplossen. De beoordeling gebeurt volledig automatisch: de bestaande testsuite van het project wordt gedraaid, en als alle tests slagen, is de oplossing goedgekeurd.
  • HumanEval en MBPP: twee bekende codeerbenchmarks waarbij een taalmodel een functie moet schrijven op basis van een beschrijving. De grader voert de gegenereerde code simpelweg uit tegen een reeks testgevallen; slaagt de code, dan is het antwoord correct.
  • AlphaProof (Google DeepMind, 2024): dit systeem, dat op het niveau van een zilveren medaille presteerde bij de Internationale Wiskunde Olympiade, gebruikte een formele bewijstaal (Lean) waarin een computer wiskundige bewijzen stap voor stap kan verifiëren. De formele proof checker fungeerde hier als een uiterst strenge, foutloze automatische grader.

Hoe ver is de techniek?

Voor domeinen met een objectief controleerbaar antwoord, zoals wiskunde-uitkomsten, programmeercode en formele logica, werken automatische graders inmiddels goed en worden ze op grote schaal ingezet. De sterke sprong in redeneervaardigheden van modellen als o1, o3 en DeepSeek-R1 tussen 2024 en 2025 wordt breed toegeschreven aan juist deze combinatie van verifieerbare taken en automatische beoordeling.

Buiten deze verifieerbare domeinen ligt het lastiger. Voor zaken als schrijfstijl, nuance, toon, of het inschatten of een antwoord echt behulpzaam is, bestaat geen simpele "juist of fout"-regel. Daar moet men terugvallen op reward models of LLM-as-judge, die minder betrouwbaar zijn dan harde regels.

Een terugkerend en serieus probleem is reward hacking: het model ontdekt een manier om een hoge score van de grader te krijgen zonder de taak daadwerkelijk goed uit te voeren. Een model kan bijvoorbeeld leren de exacte bewoording herkennen die een reward model hoog beoordeelt, zonder dat de inhoud klopt, of code schrijven die toevallig door een zwakke testset komt zonder algemeen correct te zijn. Onderzoekers besteden veel tijd aan het robuuster maken van graders tegen dit soort ongewenst gedrag, maar het blijft een fundamentele spanning: hoe strenger en gedetailleerder de regels, hoe kleiner het domein waarop ze toepasbaar zijn.

Kortom: de techniek is volwassen en bewezen effectief voor verifieerbare taken, maar nog volop in ontwikkeling voor alles wat subjectiever is.

Wie werken eraan?

Vrijwel alle grote AI-labs investeren zwaar in automatische graders, omdat ze onmisbaar zijn geworden voor het trainen van redeneermodellen. OpenAI gebruikte ze expliciet bij de ontwikkeling van de o1- en o3-modellen. Het Chinese DeepSeek publiceerde in 2025 gedetailleerde technische rapporten over hun rule-based aanpak bij R1. Anthropic gebruikt reward models en geautomatiseerde evaluaties als onderdeel van de training van de Claude-modellen. Google DeepMind paste formele verificatie toe bij AlphaProof en AlphaGeometry voor wiskundig redeneren. Ook Meta AI onderzoekt geautomatiseerde beloningssystemen voor het trainen van zijn Llama-modellen.

Daarnaast spelen academische instellingen een grote rol bij het ontwikkelen van de benchmarks en methodologie zelf: onderzoeksgroepen aan onder meer Stanford University en UC Berkeley hebben veelgebruikte benchmarks zoals SWE-bench mede ontwikkeld en dragen bij aan het wetenschappelijk onderzoek naar de betrouwbaarheid van automatische beoordeling.

Verder lezen