AI & computingAgentic AI & autonome agents

GPT-6 Astra wint Pokémon in 18 uur, maar verdwaalt in Minecraft na één Creeper

· Bijgewerkt 18 september 2026, 01:26 · 2 min leestijd

Agentic AI & autonome agents
Beeld: The Decoder

Het nieuwe AI-model GPT-6 Astra van OpenAI verslaat games als Pokémon, Factorio en Fallout 3 sneller dan elk model voor hem. Toch liep de AI in Minecraft vast nadat een explosie van een Creeper zijn spullen vernietigde: urenlang deed Astra daarna niets anders dan aardappels verbouwen.

GPT-6 Astra, het nieuwste model van OpenAI, zet indrukwekkende prestaties neer in videogames. Volgens testorganisatie Vals AI werd het model kampioen in Pokémon FireRed in 18 uur en 12 minuten, waar het vorige model GPT-5.6 Sol er 96 uur over deed. In het complexe fabrieksspel Factorio: Space Age lanceerde Astra binnen tien uur zijn eerste raket, terwijl concurrerende modellen bleven steken bij de basisproductie. Ook Fallout 2, Fallout 3 en het puzzelspel Portal werden uitgespeeld.

De doorbraak wordt onderstreept door de resultaten op ARC-AGI-3, een test waarbij AI-modellen onbekende spelwerelden moeten doorgronden zonder uitleg vooraf. Astra scoorde daar 62,7 procent, tegenover 7,78 procent voor GPT-5.6 Sol en ruim 30 procent voor Claude Opus 5. Volgens ARC Prize, de organisatie achter de benchmark, komt dit doordat Astra onbekende spelmechanieken vertaalt naar compacte, zelfbedachte regels: het model observeert, leidt daar regels uit af en zet die om in concrete plannen.

Zelf spelen in plaats van geprogrammeerd worden

Wat deze aanpak bijzonder maakt, is dat Astra als computer-use agent werkt: het model bestuurt spellen via gewoon beeldscherm, muis en toetsenbord, zonder speciale programmeerkoppeling met de game. Dat is een verschil met eerdere projecten zoals Voyager uit 2023, waarbij GPT-4 in Minecraft werd gestuurd via directe toegang tot spelgegevens. Astra moet, net als een mens, alles uit het beeld zelf afleiden. In de Minecraft-marathon van Vals AI, die uiteindelijk na 141 uur werd afgebroken, bouwde het model op eigen kracht een Nether-portaal, versloeg het zombies en verzamelde het grondstoffen voor de eindstrijd van het spel.

De aardappelval na de Creeper

Toch liep het mis. Nadat Astra al zijn kostbare buit in een kist had opgeslagen, blies een Creeper de kist en het bed van het model op. Astra noteerde daarop voor zichzelf, deels in hoofdletters: nooit meer belangrijke spullen in een onbewaakte kist opslaan. Die zelfopgelegde regel bleek hardnekkig. De uren erna deed het model bijna niets anders dan aardappels verbouwen, uit angst om opnieuw iets te verliezen. Elk groen object werd wantrouwend bekeken, en zelfs de jacht op varkens voor voedsel werd gestaakt na een mislukte poging.

Dit gedrag toont volgens onderzoekers een keerzijde van agentic AI: systemen die zelfstandig taken uitvoeren, kunnen negatieve ervaringen omzetten in regels die te rigide worden toegepast. Wat in een gestructureerde testomgeving als ARC-AGI-3 juist helpt om spelregels snel te doorgronden, leidt in een open wereld als Minecraft tot overdreven voorzichtigheid. Toch blijft de sprong ten opzichte van oudere modellen groot. Voor onderzoekers naar AGI geldt de combinatie van planning, zelfcorrectie en algemene vaardigheid als een belangrijk signaal dat AI-systemen steeds beter worden in taken waarvoor ze niet specifiek zijn getraind.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? De prestaties van GPT-6 Astra laten zien dat AI-modellen steeds beter worden in het zelfstandig doorgronden van complexe, onbekende omgevingen, een vaardigheid die verder reikt dan videogames en relevant is voor robotica en digitale assistenten. Tegelijk laat het Creeper-incident zien dat zulke systemen nog moeite hebben om lessen uit één negatieve ervaring in de juiste proportie te houden, wat cruciaal wordt zodra AI-agents in de echte wereld taken gaan uitvoeren.

Agentic AI
Kunstmatige intelligentie die zelfstandig meerdere stappen onderneemt om een doel te bereiken, zonder telkens instructies te krijgen.
Computer-use agent
Een AI-model dat een computer bedient zoals een mens dat doet, via beeldscherm, muis en toetsenbord, in plaats van via een speciale programmeerkoppeling.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergeleken worden.
AGI
Kunstmatige algemene intelligentie: een AI die net als een mens in vrijwel elke taak goed zou presteren, in plaats van slechts in één specifiek gebied.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents