AI & computing › Generatieve AI & synthetische media
OpenAI zet zwaarste beveiliging in na risico's rond AI-model Astra
OpenAI heeft een nog niet uitgebracht AI-model genaamd Astra ondergebracht in de zwaarste risicocategorie voor cyberbeveiliging die het bedrijf kent. Interne tests wijzen erop dat het model mogelijk zelfstandig geavanceerde hackaanvallen kan uitvoeren, wat OpenAI ertoe brengt de ontwikkeling flink af te schermen voordat het model ooit gebruikers bereikt.
OpenAI test AI-modellen voordat ze uitkomen op mogelijke risico's, via het zogeheten Preparedness Framework. Dit interne toetsingskader, geïntroduceerd eind 2023, deelt modellen in naar risiconiveau op gebieden als cyberbeveiliging en biologische veiligheid. Astra is het eerste model dat mogelijk de hoogste categorie 'Critical' bereikt op het gebied van cyberbeveiliging. Eerdere topmodellen van het bedrijf, waaronder GPT-5.6-Sol, bleven steken op het niveau daaronder, 'High'.
Wat maakt Astra zo gevaarlijk?
Volgens OpenAI's eigen definitie valt een model in de categorie Critical als het zelfstandig werkende zero-day-kwetsbaarheden kan vinden en uitbuiten in goed beveiligde systemen, of als het op basis van een breed omschreven doel zonder mensenhulp een verfijnde cyberaanval kan uitvoeren. Interne evaluaties, ondersteund door onafhankelijke experts, lieten grote sprongen zien in Astra's vermogen om zelfstandig code te schrijven en exploits te ontwikkelen. OpenAI benadrukt dat de tests nog niet zijn afgerond en dat nog niet vaststaat of Astra de drempel daadwerkelijk overschrijdt. Het bedrijf meldt ook dat Astra geen rol speelde bij de recente aanval op AI-platform Hugging Face.
Extra beveiliging en toezicht
OpenAI heeft de ontwikkelomgeving rond Astra flink aangescherpt. Engineers werken nu in geïsoleerde testsystemen met strengere netwerkbeperkingen, zwaardere versleuteling van modelgewichten en extra monitoring. Werkzaamheden aan Astra die nog niet aan deze nieuwe eisen voldoen, liggen voorlopig stil. Ook is er verscherpt toezicht op alle toepassingen waarin Astra zelfstandig taken uitvoert: monitoringsystemen lezen het redeneerproces van het model tijdens training en tests via chain-of-thought-monitoring, en kunnen ingrijpen zodra ze verdacht of riskant gedrag signaleren.
Voordat Astra ooit bij gebruikers terechtkomt, wil OpenAI het model laten testen door externe partijen, waaronder overheidsinstanties en onafhankelijke AI-veiligheidsorganisaties. Die krijgen aanbevolen beveiligingsmaatregelen mee voor het testen van een model met verhoogd risico. Deze aanpak volgt op een vergelijkbare stap die OpenAI in 2025 zette, toen modellen dicht bij de hoogste risicocategorie voor biologische dreigingen kwamen.
OpenAI stelt dat het einddoel ondanks de strenge maatregelen ongewijzigd blijft: een frontier-model bouwen dat de digitale verdediging juist versterkt. Cybersecurityprofessionals zouden zo geholpen worden kwetsbaarheden op te sporen en te repareren voordat kwaadwillenden ze kunnen misbruiken. Het bedrijf zegt Astra breed beschikbaar te willen maken zodra het aan alle veiligheidseisen voldoet.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit nieuws laat zien dat AI-modellen een punt naderen waarop ze zelfstandig geavanceerde cyberaanvallen kunnen uitvoeren, wat zowel offensieve dreigingen als krachtige verdedigingsmiddelen dichterbij brengt. Hoe bedrijven als OpenAI omgaan met dit soort grensgevallen, bepaalt mede hoe veilig toekomstige AI-systemen worden ingezet in de digitale wereld.
- Preparedness Framework
- Het interne toetsingskader van OpenAI waarmee het bedrijf AI-modellen beoordeelt op risico's zoals cyberaanvallen en biologische dreigingen.
- Zero-day-kwetsbaarheid
- Een beveiligingslek in software dat nog onbekend is bij de ontwikkelaar, waardoor er nog geen patch tegen bestaat.
- Exploit
- Een stuk code of techniek waarmee een kwetsbaarheid in software actief wordt misbruikt.
- Chain-of-thought-monitoring
- Het meelezen van de tussenstappen die een AI-model doorloopt tijdens het redeneren, om gevaarlijk of ongewenst gedrag vroegtijdig te signaleren.
- Frontier-model
- Een AI-model dat aan de uiterste grens van wat technisch mogelijk is opereert, met de nieuwste en krachtigste capaciteiten.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.