AI & computing › Generatieve AI & synthetische media

OpenAI roept AGI-tijdperk uit, maar bewijs voor GPT-6 Astra rammelt

· Bijgewerkt 9 oktober 2026, 02:03 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Live Science

OpenAI zegt dat zijn nieuwste model GPT-6 Astra het begin is van kunstmatige algemene intelligentie. Onafhankelijke onderzoekers wijzen erop dat de indrukwekkende testscores grotendeels te danken zijn aan speciale software-trucs, niet aan echt algemeen denkvermogen.

OpenAI-president Greg Brockman noemde de lancering van GPT-6 Astra op 3 september een keerpunt in de geschiedenis van kunstmatige intelligentie. Over een paar jaar, zei hij tijdens de persconferentie, zullen we terugkijken en concluderen dat dit het model was waarmee AGI begon. Die uitspraak komt op een moment dat techbestuurders steeds vaker claimen dat de drempel naar machines die net zo breed kunnen leren en redeneren als mensen al is overschreden. Opvallend genoeg besloot OpenAI tegelijkertijd de uitrol van een opvolgversie, GPT-6.1 Astra, uit te stellen vanwege veiligheidszorgen.

Indrukwekkende cijfers, twijfelachtige context

Bij de lancering presenteerde OpenAI resultaten op diverse benchmarks: tests die meten hoe goed een AI-model presteert op taken als programmeren, wiskunde en wetenschappelijk redeneren. Astra zou onder meer 3D-ontwerpen kunnen genereren, printplaten kunnen uitlijnen en complete webapplicaties kunnen bouwen op basis van een enkele opdracht. Op de ARC-AGI-3-test, bedoeld om te meten hoe snel een AI nieuwe vaardigheden oppikt in onbekende omgevingen, scoorde het model een opvallende 99,9 procent. Volgens de ARC Prize Foundation, die de test beheert, deed Astra het op 96 procent van de niveaus beter dan de gemiddelde mens, met bijna 52 procent minder pogingen.

Die score blijkt echter sterk afhankelijk van de testomstandigheden. Bij gebruik van een speciale, niet-openbare softwarelaag van OpenEI zelf - de zogeheten Provider Adapter - haalde Astra de topscore. Met de neutrale, voor alle ontwikkelaars toegankelijke Standard-testomgeving zakte het resultaat naar 62,7 procent. ARC Prize-directeur Greg Kamradt benadrukte dat het halen van een hoge score op deze test nooit is bedoeld als bewijs voor AGI. Volgens hem is Astra een belangrijke stap voorwaarts, maar geen doorbraak naar algemene intelligentie.

Verdachte verschuivingen in de cijfers

Er kwamen ook onregelmatigheden aan het licht in de gepubliceerde testresultaten. Een voorlopige versie van het persbericht, die journalisten voorafgaand aan de lancering ontvingen, vermeldde een ARC-AGI-3-score van 98,6 procent. Op de dag van lancering stond er plotseling 99,9 procent online. Onderzoekers Anka Reuel en Mike Hardy van Stanford University merkten daarnaast op dat OpenAI na de lancering stilletjes het gerapporteerde hallucinatiepercentage van Astra aanpaste: van 4,2 procent naar 2,0 procent, voordat het cijfer weer werd terugveranderd. Een AI-hallucinatie is het verschijnsel waarbij een taalmodel met overtuiging feitelijk onjuiste informatie presenteert.

Reuel en Hardy spreken van benchmaxxing: het herhaaldelijk aanpassen van prompts, software-omgevingen of rekenkracht om een zo hoog mogelijke testscore te scoren, zonder dat dit wat zegt over werkelijke bruikbaarheid. In een wetenschappelijk artikel op preprint-server arXiv waarschuwen onderzoekers van onder meer Princeton University en de Universiteit van Luxemburg dat deze praktijk het vertrouwen in AI-benchmarks ondermijnt, vooral omdat bedrijven vaak niet volledig openbaar maken hoe een testresultaat precies is behaald. Onafhankelijke controle wordt daardoor vrijwel onmogelijk, wat volgens critici grote vraagtekens zet bij de stellige uitspraken over een doorbraak naar AGI.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? De discussie rond GPT-6 Astra laat zien hoe lastig het is om vooruitgang in AI objectief te meten, nu bedrijven commercieel belang hebben bij indrukwekkende testscores. Zolang benchmarks maniplueerbaar blijven en methodologie niet volledig transparant is, blijft de vraag of we AGI naderen voorlopig onbeantwoord. Dit onderstreept de noodzaak van onafhankelijke, herhaalbare tests voordat claims over 'algemene intelligentie' geloofwaardig zijn.

AGI
Artificial General Intelligence: een hypothetische vorm van kunstmatige intelligentie die net zo breed kan leren en redeneren als een mens, in plaats van alleen goed te zijn in specifieke taken.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van AI-modellen op specifieke taken worden gemeten en vergeleken.
AI-hallucinatie
Het verschijnsel waarbij een AI-model met overtuiging onjuiste of verzonnen informatie presenteert als feit.
Benchmaxxing
De praktijk van het herhaaldelijk aanpassen van prompts, software-scaffolding of rekenkracht om een zo hoog mogelijke benchmarkscore te behalen, zonder dat dit evenredig echte verbetering weerspiegelt.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media