AI & computingAgentic AI & autonome agents

Onbekend 'stealth'-AI-model scoort verrassend hoog op programmeerbenchmark

· Bijgewerkt 16 augustus 2026, 05:17 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Een anoniem AI-model met de codenaam 'big-pickle' heeft op een zware programmeerbenchmark van Scale AI beter gescoord dan bekende modellen van OpenAI en bijna net zo goed als het duurdere Claude Opus. Een onafhankelijke ontwikkelaar publiceerde de volledige testresultaten, inclusief logboeken en instructies om de test na te doen.

Ontwikkelaar Phillip Chaffee testte het model 'big-pickle' op de SWE Atlas Codebase QnA-benchmark van Scale AI. Deze test bestaat uit 124 opdrachten waarbij een AI-model vragen moet beantwoorden over bestaande, complexe programmeercode: van het opsporen van de oorzaak van een bug tot het uitleggen van de architectuur van een systeem. Big-pickle loste 63 van de 124 taken correct op, goed voor een score van 50,8 procent.

Dat resultaat is opvallend omdat big-pickle een gratis, nog niet officieel aangekondigd model is dat via het platform OpenCode Zen wordt aangeboden. Wie het model precies heeft gebouwd, is niet bekend; technische sporen in de foutmeldingen wijzen mogelijk naar de Chinese AI-ontwikkelaar DeepSeek. Op de officiële ranglijst van de benchmark scoort big-pickle lager dan de nieuwste Claude-modellen van Anthropic, maar hoger dan alle andere modellen die met dezelfde eenvoudige agentic AI-opzet zijn getest, waaronder recente GPT-modellen van OpenAI.

Hoe werkt zo'n test?

Bij deze benchmark krijgt een taalmodel geen kant-en-klare chatinterface, maar moet het zelfstandig door codebestanden graven via een minimale opdrachtregel-omgeving, de zogeheten mini-swe-agent scaffold. Elke opdracht werd uitgevoerd in een afgeschermde testomgeving in de cloud, vergelijkbaar met een virtuele computer die na afloop weer wordt weggegooid. Een ander AI-model, Claude Opus 4.5, trad op als 'rechter' en beoordeelde de antwoorden aan de hand van een vaste checklist met vereisten per taak.

Kanttekeningen bij het resultaat

Chaffee benadrukt zelf dat de test niet één op één te vergelijken is met de officiële ranglijst. Zo voerde hij elke taak maar één keer uit in plaats van de gebruikelijke drie pogingen, wat de uitkomst statistisch minder betrouwbaar maakt. Ook kreeg het model minder rekenkracht per testomgeving dan het officiële protocol voorschrijft, al vond hij geen bewijs dat dit de score kunstmatig verhoogde. Verder is de proef niet gecontroleerd door Scale AI zelf, en bestaat het risico dat OpenCode de geteste vragen gebruikt om het model verder te trainen.

Toch is de exercitie een voorbeeld van hoe onafhankelijke ontwikkelaars steeds vaker zelf AI-modellen doorlichten, nu er wekelijks nieuwe en vaak ondoorzichtige modellen verschijnen. Door alle configuratiebestanden en tussentijdse resultaten openbaar te delen, kan iedereen de proef controleren of herhalen. Dat soort transparantie wordt belangrijker naarmate AI-modellen een grotere rol krijgen bij het schrijven en onderhouden van software.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Dit nieuws laat zien dat ook onbekende, gratis AI-modellen inmiddels kunnen wedijveren met dure marktleiders bij complexe programmeertaken. Voor softwarebedrijven betekent dit meer keuze en lagere kosten, maar ook meer onzekerheid over wie welk model eigenlijk bouwt en traint op welke data. Onafhankelijke, herhaalbare tests worden daardoor steeds belangrijker om AI-claims te kunnen checken.

Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen eerlijk met elkaar vergeleken kunnen worden.
Agentic AI
AI-systemen die niet alleen antwoorden, maar zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zoals code doorzoeken en aanpassen.
Large language model (taalmodel)
Een AI-systeem dat is getraind op enorme hoeveelheden tekst en daardoor mensachtige taal en code kan begrijpen en genereren.
Agentscaffold
De minimale software-omgeving die een taalmodel voorziet van basisgereedschap, zoals een opdrachtregel, zodat het zelfstandig taken kan uitvoeren.
Rubricverificatie
Een beoordelingsmethode waarbij een antwoord pas als correct geldt wanneer het voldoet aan een vooraf vastgestelde checklist met vereisten.
Stealth-model
Een AI-model dat nog anoniem of onder een codenaam wordt getest, zonder dat de maker officieel bekend is gemaakt.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents