AI & computing › Agentic AI & autonome agents
Onbekend 'stealth'-AI-model scoort verrassend hoog op programmeerbenchmark
Een anoniem AI-model met de codenaam 'big-pickle' heeft op een zware programmeerbenchmark van Scale AI beter gescoord dan bekende modellen van OpenAI en bijna net zo goed als het duurdere Claude Opus. Een onafhankelijke ontwikkelaar publiceerde de volledige testresultaten, inclusief logboeken en instructies om de test na te doen.
Ontwikkelaar Phillip Chaffee testte het model 'big-pickle' op de SWE Atlas Codebase QnA-benchmark van Scale AI. Deze test bestaat uit 124 opdrachten waarbij een AI-model vragen moet beantwoorden over bestaande, complexe programmeercode: van het opsporen van de oorzaak van een bug tot het uitleggen van de architectuur van een systeem. Big-pickle loste 63 van de 124 taken correct op, goed voor een score van 50,8 procent.
Dat resultaat is opvallend omdat big-pickle een gratis, nog niet officieel aangekondigd model is dat via het platform OpenCode Zen wordt aangeboden. Wie het model precies heeft gebouwd, is niet bekend; technische sporen in de foutmeldingen wijzen mogelijk naar de Chinese AI-ontwikkelaar DeepSeek. Op de officiële ranglijst van de benchmark scoort big-pickle lager dan de nieuwste Claude-modellen van Anthropic, maar hoger dan alle andere modellen die met dezelfde eenvoudige agentic AI-opzet zijn getest, waaronder recente GPT-modellen van OpenAI.
Hoe werkt zo'n test?
Bij deze benchmark krijgt een taalmodel geen kant-en-klare chatinterface, maar moet het zelfstandig door codebestanden graven via een minimale opdrachtregel-omgeving, de zogeheten mini-swe-agent scaffold. Elke opdracht werd uitgevoerd in een afgeschermde testomgeving in de cloud, vergelijkbaar met een virtuele computer die na afloop weer wordt weggegooid. Een ander AI-model, Claude Opus 4.5, trad op als 'rechter' en beoordeelde de antwoorden aan de hand van een vaste checklist met vereisten per taak.
Kanttekeningen bij het resultaat
Chaffee benadrukt zelf dat de test niet één op één te vergelijken is met de officiële ranglijst. Zo voerde hij elke taak maar één keer uit in plaats van de gebruikelijke drie pogingen, wat de uitkomst statistisch minder betrouwbaar maakt. Ook kreeg het model minder rekenkracht per testomgeving dan het officiële protocol voorschrijft, al vond hij geen bewijs dat dit de score kunstmatig verhoogde. Verder is de proef niet gecontroleerd door Scale AI zelf, en bestaat het risico dat OpenCode de geteste vragen gebruikt om het model verder te trainen.
Toch is de exercitie een voorbeeld van hoe onafhankelijke ontwikkelaars steeds vaker zelf AI-modellen doorlichten, nu er wekelijks nieuwe en vaak ondoorzichtige modellen verschijnen. Door alle configuratiebestanden en tussentijdse resultaten openbaar te delen, kan iedereen de proef controleren of herhalen. Dat soort transparantie wordt belangrijker naarmate AI-modellen een grotere rol krijgen bij het schrijven en onderhouden van software.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit nieuws laat zien dat ook onbekende, gratis AI-modellen inmiddels kunnen wedijveren met dure marktleiders bij complexe programmeertaken. Voor softwarebedrijven betekent dit meer keuze en lagere kosten, maar ook meer onzekerheid over wie welk model eigenlijk bouwt en traint op welke data. Onafhankelijke, herhaalbare tests worden daardoor steeds belangrijker om AI-claims te kunnen checken.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen eerlijk met elkaar vergeleken kunnen worden.
- Agentic AI
- AI-systemen die niet alleen antwoorden, maar zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zoals code doorzoeken en aanpassen.
- Large language model (taalmodel)
- Een AI-systeem dat is getraind op enorme hoeveelheden tekst en daardoor mensachtige taal en code kan begrijpen en genereren.
- Agentscaffold
- De minimale software-omgeving die een taalmodel voorziet van basisgereedschap, zoals een opdrachtregel, zodat het zelfstandig taken kan uitvoeren.
- Rubricverificatie
- Een beoordelingsmethode waarbij een antwoord pas als correct geldt wanneer het voldoet aan een vooraf vastgestelde checklist met vereisten.
- Stealth-model
- Een AI-model dat nog anoniem of onder een codenaam wordt getest, zonder dat de maker officieel bekend is gemaakt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.