AI & computing › Generatieve AI & synthetische media

OpenAI's GPT-6 Astra hallucineert minder, maar blijft kwetsbaar voor verborgen aanvallen

· Bijgewerkt 4 september 2026, 20:15 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

OpenAI heeft een nieuw AI-model uitgebracht, GPT-6 Astra, dat aanzienlijk minder fouten maakt dan zijn voorganger en bijna alle directe manipulatiepogingen blokkeert. Toch blijkt het model nog altijd kwetsbaar voor slim verstopte instructies in documenten, wat risico's oplevert nu AI steeds vaker zelfstandig taken uitvoert.

OpenAI heeft GPT-6 Astra gepresenteerd, de opvolger van GPT-5.6 Sol. Volgens de eigen systeemkaart van het bedrijf maakt het nieuwe model veel minder feitelijke fouten, ook wel hallucinaties genoemd. OpenAI testte Astra op een verzameling ChatGPT-gesprekken waarin gebruikers eerder een fout antwoord hadden gemeld. Dit zijn dus extra lastige gevallen; de resultaten zeggen niets over hoe vaak het model in het dagelijks gebruik fouten maakt. Astra herhaalde de gerapporteerde fouten wel duidelijk minder vaak dan zijn voorganger, vooral bij snelle antwoorden en een lager redeneerniveau.

Bijna waterdicht tegen directe manipulatie

Voor zogeheten prompt injections — pogingen om een AI-model via de eigen invoer te manipuleren — scoort Astra bijna perfect: het blokkeert 99,99 procent van deze aanvallen. OpenAI schrijft dat succes toe aan een trainingsmethode genaamd GPT-Red, waarbij een geautomatiseerde 'aanvaller' het model tijdens de training voortdurend probeert te misleiden. Ook tegen zogeheten jailbreaks — pogingen om de ingebouwde veiligheidsregels te omzeilen — presteert Astra beter. Bij een vaste testset met bekende aanvallen rond onderwerpen als biologie, geweld en cybercriminaliteit weigert het model in 91,5 tot 98,3 procent van de gevallen mee te werken. Blijft een aanvaller het over meerdere gespreksrondes proberen, dan zakt dat percentage naar ongeveer 67 procent. Dat betekent dat een volhardende gebruiker toch in ruim één op de drie pogingen een problematisch antwoord kan afdwingen. Voorgaande modellen scoorden op dezelfde test nog geen 50 procent, dus de vooruitgang is duidelijk. OpenAI benadrukt wel dat deze tests zijn uitgevoerd op het kale model, zonder de extra veiligheidslagen die in het uiteindelijke product zitten.

Verborgen aanvallen blijven een zwakke plek

Lastiger blijft het afweren van indirecte aanvallen, waarbij schadelijke instructies verstopt zitten in een document dat de AI moet lezen of verwerken. Beveiligingsbedrijf Gray Swan testte Astra extern met 1.810 aanvallen uit hun zogeheten IPI Arena. Met vijftien pogingen per scenario slaagde men er in 8,5 procent van de gevallen in het model alsnog te misleiden. Bij GPT-5.6 Sol lag dat percentage nog op 27 procent. Concurrent Claude Opus 5 van Anthropic scoorde in dezelfde test beter, met 4,8 procent, maar bleek evenmin volledig immuun. Dat betekent dat Astra in ongeveer één op de twaalf scenario's alsnog te misleiden is via verstopte instructies, en Opus 5 in ongeveer één op de eenentwintig. Voor bedrijven die AI-systemen inzetten is dat verontrustend, zeker omdat AI-agents steeds vaker zelfstandig code schrijven, software bedienen en dag en nacht documenten verwerken. Elke fout die daarbij via een verborgen instructie wordt uitgelokt, kan direct gevolgen hebben voor systemen waar de AI toegang toe heeft.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Naarmate AI-modellen zelfstandiger worden ingezet als digitale assistenten die documenten lezen en taken uitvoeren, wordt de beveiliging tegen verborgen manipulatie steeds belangrijker. De vooruitgang van Astra laat zien dat AI-bedrijven dit probleem serieus nemen, maar de resterende kwetsbaarheid betekent dat bedrijven AI-agents voorlopig niet blind kunnen vertrouwen bij het verwerken van externe documenten.

AI-hallucinatie
Het verschijnsel waarbij een AI-model met overtuiging feitelijk onjuiste informatie presenteert.
Prompt injection
Een aanval waarbij iemand een AI-model via de invoer probeert te manipuleren om ongewenste acties uit te voeren of regels te omzeilen.
Indirecte prompt-injectie
Een variant van prompt injection waarbij de schadelijke instructie niet rechtstreeks door de gebruiker wordt getypt, maar verstopt zit in een document, webpagina of ander bestand dat de AI leest.
Jailbreak
Een poging om de ingebouwde veiligheidsregels van een AI-chatbot te omzeilen, zodat het model toch schadelijke of verboden content produceert.
Agentic AI
AI-systemen die niet alleen antwoorden geven, maar ook zelfstandig taken uitvoeren, zoals code schrijven of software bedienen.
Systeemkaart
Een document waarin een AI-bedrijf de eigenschappen, prestaties en risico's van een nieuw model beschrijft.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media