AI & computing › Agentic AI & autonome agents
Onderzoekers hackten OpenAI met Anthropics AI-model Claude in 72 uur
Een team van drie beveiligingsonderzoekers brak binnen in de interne systemen van OpenAI, met hulp van het AI-model Claude van concurrent Anthropic. De hack, die minder dan 72 uur kostte, laat zien hoe snel AI het hacken van complexe systemen kan versnellen.
Het beveiligingsbedrijf Hacktron gebruikte Anthropics AI-model Claude om in te breken in interne code en accounts van OpenAI. De aanval verliep via het communityforum van OpenAI en gaf toegang tot ChatGPT- en Codex-accounts van medewerkers. Om te bewijzen dat de inbraak echt werkte, stuurden de onderzoekers vanaf een gekaapt Codex-account van een medewerker een pull request naar 'Monorepo', de interne GitHub-repository die volgens bronnen van The Wall Street Journal OpenAI's algoritmische geheimen bevat. De broncode in die repository hebben ze zelf niet ingezien en gevoelige data hebben ze naar eigen zeggen niet bekeken. De actie maakte deel uit van OpenAI's bug-bountyprogramma; het drie koppen tellende team kreeg voor de melding een beloning van 6.500 dollar.
De onderzoekers koppelden twee zwakke plekken aan elkaar, een techniek die bekendstaat als een exploitketen. Het forum van OpenAI draait op de forumsoftware Discourse, die geüploade HEIC-afbeeldingen eerst laat verwerken door het beeldbewerkingsprogramma ImageMagick, dat de decodering vervolgens doorgeeft aan libheif, de softwarebibliotheek waarin de eerste kwetsbaarheid zat. Een fout in libheif zorgde ervoor dat een speciaal geprepareerde afbeelding verkeerd werd gepositioneerd, waardoor de onderzoekers eigen code op de server konden draaien. Deze fout was al maanden eerder door de ontwikkelaars van libheif zelf gerepareerd, maar kreeg nooit een CVE-nummer toegewezen — de standaardaanduiding voor bekende kwetsbaarheden. Daardoor viel kennelijk niet op dat de Debian-software op de forumserver nog de kwetsbare versie draaide. De tweede zwakke plek zat in de centrale inlogdienst (single sign-on) van OpenAI: wie de forumserver beheerste, kon zich voordoen als actieve gebruikers en zo hun ChatGPT- en Codex-account overnemen. Elke dienst die via hetzelfde OpenAI-account inlogde, liep hetzelfde risico.
Nieuwste Claude-versie maakte het verschil
Met een speciale onderzoeksversie van het oudere model Claude Opus 4.8, die Anthropic beschikbaar stelt aan cybersecurity-onderzoekers, lukte het de onderzoekers wel een exploit te bouwen, maar alleen als een standaardbeveiliging tegen geheugenaanvallen (ASLR) werd uitgeschakeld. Pas na de release van Claude Opus 5 op de avond van 24 juli kwam er binnen drie uur een werkende exploit die ook mét die bescherming functioneerde; tegen 10 uur de volgende ochtend hadden de onderzoekers hiermee ook daadwerkelijk ingebroken op OpenAI's eigen Discourse-omgeving. Daarna lieten de onderzoekers Claude in een autonome lus draaien, een vorm van agentic AI waarbij het model zelfstandig stappen zet zonder voortdurende sturing. Omdat het model weigerde een aanval op een bestaand systeem te schrijven, presenteerden de onderzoekers de opdracht als een oefentaak. Binnen vier uur had de AI de testserver overgenomen.
Aanvallen worden steeds goedkoper
OpenAI verhielp het lek ongeveer veertien uur na de melding, in lijn met de aanpak van gecoördineerde kwetsbaarheidsonthulling. Hacktron breidde het onderzoek, 'HEIF Heist' gedoopt, later uit naar onder meer Slack, Meta, GitHub Enterprise, Rails, Next.js en ImageMagick, telkens binnen een dag of twee aangepast aan het nieuwe doelwit. Drie mensen werkten twee maanden aan het project en gaven minder dan 3.000 dollar uit aan AI-rekenkracht. Alleen Shopify merkte de activiteit op, ondanks duizenden geüploade afbeeldingen en herhaalde crashes. Hacktron-oprichter Mohan Pedhapati stelde dat complexiteit software vroeger vanzelf beschermde, omdat een aanval veel tijd, geld en specialistische kennis vereiste. AI haalt die drempel weg door schaarse expertise te vervangen door rekenkracht, waardoor werk dat vroeger maanden kostte nu in dagen kan worden gedaan. Toch relativeerde Pedhapati tegenover The Wall Street Journal ook de dreiging van het eigen team: 'Ik denk niet dat we zo sterk zijn als Chinese dreigingsactoren... we zijn gewoon drie man met Claude- en Codex-abonnementen.'
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze zaak toont dat geavanceerde AI-modellen het vinden en misbruiken van beveiligingslekken drastisch versnellen en goedkoper maken. Bedrijven moeten hun verdediging daarom sneller bijwerken dan voorheen, omdat aanvallers met AI nu net zo snel kunnen werken als de beste onderzoeksteams.
- Exploitketen
- Het aan elkaar koppelen van meerdere kleine kwetsbaarheden tot één werkende aanval.
- Exploit
- Code of een techniek die misbruik maakt van een zwakke plek in software om ongeautoriseerde toegang te krijgen.
- Agentic AI
- AI die zelfstandig meerdere stappen achter elkaar uitvoert om een taak te voltooien, zonder telkens nieuwe instructies te krijgen.
- Gecoördineerde kwetsbaarheidsonthulling
- De afspraak waarbij onderzoekers een gevonden beveiligingslek eerst privé melden aan een bedrijf, zodat het gerepareerd kan worden voordat het openbaar wordt.
- Single sign-on (SSO)
- Een systeem waarmee gebruikers met één account bij meerdere diensten kunnen inloggen.
- ASLR
- Een standaardbeveiliging in software die geheugenadressen willekeurig plaatst, zodat aanvallers moeilijker kunnen voorspellen waar code in het geheugen staat.
- libheif
- Een softwarebibliotheek die wordt gebruikt om HEIC-afbeeldingen te verwerken, en die in dit geval een verouderde en kwetsbare versie bevatte.
- CVE
- Common Vulnerabilities and Exposures: het internationale systeem waarmee bekende beveiligingslekken een uniek nummer krijgen, zodat bedrijven en onderzoekers ze makkelijk kunnen herkennen en volgen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.