Kennisbank

Benchmaxxing: waarom een hoge AI-score niet altijd is wat het lijkt

Bijgewerkt: 9 oktober 2026 · 6 min leestijd

Stel je een scholier voor die van de leraar per ongeluk de exacte proefwerkvragen te zien krijgt voordat de toets begint. Die scholier haalt een tien, maar heeft de stof niet per se beter begrepen dan een klasgenoot die een negen haalde zonder voorkennis. De score zegt dan iets anders dan wat hij lijkt te zeggen: niet "hoe goed begrijpt deze leerling de stof", maar "hoe goed kende deze leerling toevallig de antwoorden".

In de wereld van kunstmatige intelligentie speelt zich iets vergelijkbaars af, en daarvoor is een informele term ontstaan: benchmaxxing. Het woord is een samentrekking van "benchmark" (een gestandaardiseerde test waarmee de prestaties van een AI-model worden gemeten) en de internetslang-uitgang "-maxxing" (zoals in "looksmaxxing", het tot het uiterste optimaliseren van één meetbaar kenmerk). Benchmaxxen betekent dus: een AI-model zo trainen of inrichten dat het uitblinkt op specifieke testen, zonder dat dit noodzakelijkerwijs samenvalt met betere algemene bruikbaarheid.

Wat is het precies?

Om benchmaxxing te begrijpen, moet je eerst weten wat een benchmark in AI-land is. Het is een vaste set vragen of opdrachten waarmee onderzoekers de kwaliteit van taalmodellen vergelijken. Bekende voorbeelden zijn MMLU (duizenden meerkeuzevragen over uiteenlopende kennisgebieden), GSM8K (rekenopgaven voor basisschoolniveau) en HumanEval (programmeeropdrachten). Een hogere score zou moeten betekenen: een slimmer, capabeler model.

Het probleem ontstaat zodra die score zelf het doel wordt in plaats van een meetinstrument. Dat verschijnsel is honderd jaar oud in de wetenschap en staat bekend als de wet van Goodhart: "zodra een meetwaarde een doel wordt, stopt het een goede meetwaarde te zijn." Bij AI-modellen kan dit op verschillende manieren misgaan.

Ten eerste is er directe datacontaminatie: de vragen en antwoorden van een benchmark belanden, bewust of onbewust, in de enorme hoeveelheid tekst waarmee een model wordt getraind. Een model dat een opgave letterlijk al heeft gezien, "lost" die niet op maar herinnert zich het antwoord.

Ten tweede kan een ontwikkelaar trainen op materiaal dat sterk lijkt op een benchmark in stijl en vraagvorm, zonder de exacte vragen te gebruiken. Het model wordt dan heel goed in dat specifieke type opgave, terwijl de onderliggende vaardigheid breder zwak kan blijven.

Ten derde kan een bedrijf voor een leaderboard een andere, speciaal afgestelde versie van een model inleveren dan de versie die klanten daadwerkelijk krijgen. De testversie is dan geoptimaliseerd voor wat beoordelaars prettig vinden, terwijl het publieke product anders presteert.

Belangrijk om eerlijk te zijn: het is niet altijd kwaadaardig of opzettelijk. Trainingsdata van het hele internet bevat onvermijdelijk fragmenten van populaire benchmarks, simpelweg omdat die online staan. Het onderscheid tussen "legitieme vooruitgang" en "benchmaxxing" is daardoor in de praktijk vaak lastig hard te maken.

Wat wil men ermee bereiken?

Niemand ontwikkelt een AI-model met als expliciet doel "ik gaan benchmaxxen"; het is eerder een bijproduct van de enorme druk om hoog te scoren. AI-bedrijven concurreren in een snel bewegende markt waarin een paar procentpunten verschil op een bekende lijst direct vertaalt naar aandacht in de media, vertrouwen van investeerders en keuzes van ontwikkelaars die moeten bepalen welk model ze in hun eigen product gebruiken.

Omdat het voor een buitenstaander vrijwel onmogelijk is om de "echte" intelligentie van een taalmodel rechtstreeks te beoordelen, functioneren benchmarkscores als een soort schaduwprijs: een praktisch, zij het imperfect, hulpmiddel om modellen onderling te vergelijken. Juist omdat dat cijfer zoveel gewicht krijgt, ontstaat de prikkel om het cijfer zelf te sturen, ook als dat weinig met dagelijks gebruik te maken heeft.

Voor onderzoekers en benchmarkmakers is het doel juist het omgekeerde: betrouwbare, oneerlijk-moeilijk-te-foppen meetinstrumenten bouwen, zodat beweringen over vooruitgang in AI daadwerkelijk ergens op slaan. Dat heeft een eigen kleine industrie in gang gezet van mensen die voortdurend nieuwe, "schonere" testen ontwerpen zodra oude testen hun waarde verliezen.

Voorbeelden uit de praktijk

Het bekendste en best gedocumenteerde geval speelde zich af in april 2025, rond de release van Meta's Llama 4-modellen (Scout en Maverick). Op het populaire vergelijkingsplatform LMArena (destijds bekend als Chatbot Arena, voortgekomen uit onderzoek aan UC Berkeley) scoorde een versie van Llama 4 Maverick opvallend hoog. Later bleek, en Meta bevestigde dit zelf in de bijbehorende modeldocumentatie, dat het om een speciale "experimentele chatversie" ging die was afgestemd op de voorkeuren van menselijke beoordelaars, en die afweek van het model dat ontwikkelaars daadwerkelijk konden downloaden en gebruiken. Dit leidde tot flinke kritiek uit de onderzoeksgemeenschap en tot discussie bij LMArena zelf over strengere regels rond wat labs mogen inzenden.

Een tweede, breder voorbeeld betreft wetenschappelijk onderzoek naar datacontaminatie. Meerdere onafhankelijke studies hebben de afgelopen jaren laten zien dat delen van veelgebruikte benchmarks zoals GSM8K en MMLU terug te vinden zijn in de enorme webcorpora waarmee grote taalmodellen worden voorgetraind, simpelweg omdat die testvragen al jaren circuleren op fora, onderwijswebsites en samenvattingsblogs.

Als directe reactie op dit probleem is in 2024 LiveBench opgezet, een benchmark die specifiek is ontworpen om besmetting te bestrijden: de vragen worden periodiek vervangen door nieuwe, zodat een model ze tijdens training onmogelijk gezien kan hebben. Dat is een technische erkenning dat statische testen op termijn altijd hun geloofwaardigheid verliezen.

Een vierde voorbeeld is minder een incident dan een patroon: op het platform Hugging Face, waar open-source modellen met elkaar worden vergeleken via het zogeheten Open LLM Leaderboard, is herhaaldelijk te zien geweest dat kleinere, minder bekende modellen soms opvallend goed scoren op specifieke deeltests, terwijl gebruikers in de praktijk vinden dat ze tegenvallen in open gesprek of nieuwe taken. Dat verschil tussen leaderboardscore en gebruikerservaring wordt in de community vaak met de term benchmaxxing aangeduid, ook als niet hard te bewijzen is wat er precies in de trainingsdata zat.

Hoe ver is de techniek?

Benchmaxxing is geen technologie die "verder ontwikkeld" wordt in de zin van een uitvinding die beter wordt; het is eerder een kat-en-muisspel tussen twee kanten die zich allebei snel ontwikkelen. Aan de ene kant worden modellen en trainingsmethoden steeds geraffineerder, waardoor het makkelijker wordt om, bewust of onbewust, specifiek op bekende testen te presteren. Aan de andere kant worden ook de tegenmaatregelen steeds slimmer.

Voorbeelden van die tegenmaatregelen zijn benchmarks met continu vernieuwde vragen (zoals LiveBench), het achterhouden van een deel van de testset zodat niemand die kan zien voordat een model is ingevroren, en het toevoegen van verborgen "kanariewoorden" in testdata waarmee je achteraf kunt controleren of een model die tekst letterlijk heeft onthouden. Platforms zoals LMArena experimenteren met regels die vereisen dat de ingezonden modelversie identiek is aan wat gebruikers daadwerkelijk krijgen.

Toch blijft dit een onvolledige strijd. Zodra een benchmark populair en publiek toegankelijk is, is het vrijwel een kwestie van tijd voordat delen ervan in nieuwe trainingsdata terechtkomen, al was het maar omdat mensen erover schrijven en discussiëren op het open internet. Er bestaat geen algemeen erkende, sluitende methode om met zekerheid vast te stellen of een score het resultaat is van echte vooruitgang, van onbedoelde besmetting, of van gerichte optimalisatie. Dat maakt dit minder een technisch opgelost probleem en meer een permanente spanning in hoe de AI-sector zichzelf beoordeelt.

Wie werken eraan?

Aan de kant van de modelontwikkelaars staan vrijwel alle grote AI-labs in de schijnwerpers van dit debat, simpelweg omdat zij allemaal baat hebben bij hoge scores: Meta (bekend van het Llama 4-incident), OpenAI, Google DeepMind, Anthropic, xAI en het Chinese DeepSeek worden in de onderzoeksgemeenschap regelmatig kritisch gevolgd op de vraag of gepubliceerde scores representatief zijn voor werkelijke prestaties. Het is daarbij belangrijk eerlijk te zijn: behalve in het Llama 4-geval is er zelden hard, publiek bewijs van opzettelijk benchmaxxen bij een specifiek bedrijf; vaker gaat het om vermoedens, speculatie in de gemeenschap en onvermijdelijke dataoverlap.

Aan de kant van de controle en tegenmaatregelen spelen vooral academische en open samenwerkingsverbanden een rol. LMArena, ontstaan vanuit onderzoek aan UC Berkeley, verzamelt menselijke voorkeuroordelen over modellen en heeft na de Llama 4-kwestie opnieuw gekeken naar haar inzendregels. Hugging Face host met het Open LLM Leaderboard een van de meest gebruikte openbare vergelijkingen voor open-source modellen. Onderzoeksgroepen aan verschillende universiteiten publiceren doorlopend studies naar datacontaminatie, en initiatieven als LiveBench proberen structureel weerstand tegen besmetting in het ontwerp van de test zelf te bouwen.

Verder lezen