AI & computingGeneratieve AI & synthetische media

OpenAI vertraagt AI-ontwikkeling uit angst voor cyberaanvalsrisico's

· Bijgewerkt 18 augustus 2026, 21:10 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

OpenAI zegt bewust de ontwikkeling van zijn nieuwste AI-modellen te vertragen. Reden is dat het aankomende model, intern 'Astra' genoemd, mogelijk dicht bij gevaarlijke cyberaanvalsvaardigheden komt. Het bedrijf legde een groot trainingsproces stil en verscherpte de beveiliging van zijn onderzoeksomgevingen.

OpenAI, het bedrijf achter ChatGPT, meldt dat het tempo van zijn modelontwikkeling bewust wordt afgeremd. Aanleiding is de zorg dat een nieuw model, met de interne codenaam 'Astra', te dicht in de buurt komt van vaardigheden waarmee het zelfstandig ernstige cyberaanvallen zou kunnen uitvoeren of ondersteunen. Het bedrijf pauzeerde daarom twee weken lang trainingen op basis van reinforcement learning, een methode waarbij een AI-model via beloningen leert steeds beter te presteren op een taak. De grootste geplande trainingsrun voor een zogeheten frontier-model, de meest geavanceerde modellen die een bedrijf op een gegeven moment bouwt, ligt nog altijd stil. Ook workloads die niet aan nieuwe veiligheidseisen voldoen, zijn tijdelijk buiten werking gesteld.

Aanleiding: incident bij Hugging Face

De vertraging volgt op een beveiligingsincident bij Hugging Face, een populair platform waar bedrijven en onderzoekers AI-modellen delen en hosten. Daarnaast wijst OpenAI op wat het zelf omschrijft als 'snelle vooruitgang' binnen het eigen onderzoek naar de vaardigheden van zijn modellen. Die combinatie was voor het bedrijf reden om op de rem te trappen voordat een nieuw model breed wordt ingezet.

Strengere beveiliging en sneller alarm

Sindsdien heeft OpenAI naar eigen zeggen zijn onderzoeksomgevingen flink beter beveiligd. Er is onder meer geïnvesteerd in striktere netwerkisolatie, waarbij systemen zo veel mogelijk van elkaar en van de buitenwereld worden afgeschermd, en in strengere sandboxes: afgeschermde digitale omgevingen waarin een AI-model experimenten kan uitvoeren zonder toegang te krijgen tot gevoelige systemen daarbuiten. Ook is er een nieuw monitoringsysteem opgezet dat binnen dertig minuten alarm slaat zodra verdacht gedrag van een model wordt gesignaleerd. Dat systeem gebruikt, afhankelijk van de werklast, zo'n 20 procent van de rekenkracht die normaal gesproken wordt ingezet om vragen van gebruikers te beantwoorden.

Twijfel over de aanpak

OpenAI zegt daarnaast meer te willen investeren in zogeheten alignment-onderzoek, gericht op het zo goed mogelijk laten aansluiten van het gedrag van AI-modellen op de bedoelingen van mensen. Opvallend genoeg heeft het bedrijf tegelijkertijd het interne team ontbonden dat verantwoordelijk was voor het zogeheten Preparedness Framework, het beleidskader waarmee OpenAI risico's van zijn krachtigste modellen beoordeelt. De taken van dat team zijn verdeeld over andere afdelingen. Critici zullen OpenAI er waarschijnlijk van blijven verdenken dat het de risico's opblaast om tijd en aandacht te winnen. Toch krijgt het bedrijf steun van onafhankelijke zijde: het Amerikaanse AI Safety Institute (AISI), een overheidsinstantie die AI-modellen onafhankelijk test, heeft volgens OpenAI vergelijkbaar risicovol gedrag bij modellen gedocumenteerd.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Dit nieuws laat zien dat AI-bedrijven zelf grenzen beginnen te stellen aan hoe snel ze steeds krachtigere modellen uitbrengen, omdat die modellen mogelijk bruikbaar worden voor cyberaanvallen. Het voorbeeld van OpenAI kan andere bedrijven onder druk zetten om vergelijkbare veiligheidsmaatregelen te nemen, terwijl onafhankelijke toezichthouders zoals AISI een steeds grotere rol krijgen bij het controleren van die claims.

Reinforcement learning
Een trainingsmethode waarbij een AI-model via beloning en straf leert om steeds betere beslissingen of antwoorden te geven.
Frontier-model
De meest geavanceerde en krachtigste versie van een AI-model die een bedrijf op een bepaald moment ontwikkelt.
Netwerkisolatie
Een beveiligingstechniek waarbij computersystemen worden afgeschermd van andere netwerken, zodat een aanval zich niet makkelijk kan verspreiden.
Sandbox
Een afgeschermde digitale testomgeving waarin software of AI-modellen kunnen draaien zonder toegang te krijgen tot gevoelige systemen daarbuiten.
Alignment-onderzoek
Onderzoek dat zich richt op het zo goed mogelijk laten overeenkomen van het gedrag van AI-systemen met de bedoelingen en waarden van mensen.
Preparedness Framework
Het interne beleidskader van OpenAI om risico's van zijn krachtigste AI-modellen, zoals cyberaanvalsrisico's, in kaart te brengen en te beheersen.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media