AI & computing › Agentic AI & autonome agents
Testfouten bij één bedrijf leidden tot reeks AI-hackincidenten
AI-agents van OpenAI, Anthropic, Meta en Google gingen dit jaar op eigen houtje op zoek naar echte doelwitten tijdens veiligheidstests. Het gemeenschappelijke element: alle incidenten liepen via hetzelfde Israëlische testbedrijf, Irregular.
De afgelopen maanden meldden meerdere grote AI-bedrijven dat hun taalmodellen buiten hun boekje waren gegaan. De systemen bleken tijdens veiligheidstests niet binnen hun afgeschermde testomgeving te blijven, maar gingen op zoek naar doelwitten op het echte internet. Wat destijds als losse incidenten werd gepresenteerd, blijkt terug te voeren op één bron: het Israëlische bedrijf Irregular, dat AI-modellen namens de industrie test op cyberveiligheid.
Een fout met grote gevolgen
Irregular, opgericht in 2023 onder de naam Pattern Labs, laat AI-agents los in nagebootste netwerken om te kijken hoe goed ze kunnen hacken. Een veelgebruikte testvorm heet capture the flag: de AI moet verborgen informatie vinden in een neppe bedrijfsomgeving. Volgens technisch directeur Omer Nevo ging het mis doordat de testomgeving per ongeluk toch verbinding had met het echte internet. Tegelijkertijd bleek de naam van een verzonnen testbedrijf toevallig overeen te komen met een bestaand, echt domein. Door die twee fouten stuurden de AI-modellen hun aanvalspogingen naar bestaande organisaties in plaats van naar de nepomgeving. Welke bedrijven precies zijn geraakt, is niet bekend gemaakt.
Testbedrijf voor de hele sector
Nevo bevestigt dat dezelfde onderliggende fout ten grondslag lag aan gerapporteerde incidenten bij OpenAI, Meta, Anthropic en Google. Alle vier kregen naar verluidt eind juli bericht van Irregular. OpenAI en Anthropic maakten hun eigen incidenten openbaar; de problemen bij Meta en Google kwamen pas later via de media naar buiten. Belangrijk is dat dit losstaat van een ander veelbesproken geval: de aanval van een OpenAI-agent op Hugging Face, en incidenten die door het Britse AI Security Institute zijn gemeld. Die hadden niets te maken met het testwerk van Irregular. Het bedrijf werkt overigens niet alleen met de grote Amerikaanse techbedrijven: het testte ook systemen voor de Britse overheid en publiceerde onderzoek samen met denktank RAND.
Ook Chinese modellen getest
Irregular voerde vergelijkbare tests uit op de opensourcemodellen Kimi K3 van het Chinese Moonshot AI en GLM-5.2 van Z.ai. Omdat deze modellen door gebruikers op eigen hardware kunnen worden gedraaid, hoefde Irregular hiervoor geen data naar de makers te sturen. Bij deze tests deed het probleem zich niet voor, aldus Nevo. Hij benadrukt wel dat dit niet betekent dat deze modellen minder gevoelig zijn voor dit soort gedrag; mogelijk kwam het gewoon niet aan het licht. Moonshot AI en Z.ai reageerden niet op vragen van The Verge. Irregular zegt inmiddels de internettoegang tijdens tests strenger te controleren, meer te monitoren en vooraf beter te verifiëren dat een testomgeving ook echt afgesloten is. Het bedrijf werkt aan een openbaar rapport met lessen voor de hele sector over het veilig testen van steeds krachtigere AI-modellen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit nieuws laat zien dat niet alleen AI-modellen zelf risico's kunnen vormen, maar ook de manier waarop ze getest worden. Naarmate AI-agents zelfstandiger worden en vaker toegang krijgen tot netwerken, wordt het cruciaal dat testomgevingen waterdicht zijn afgeschermd. Fouten in die afscherming kunnen anders ongemerkt leiden tot echte, ongeautoriseerde cyberaanvallen.
- Agentic AI
- AI-systemen die niet alleen antwoorden geven, maar zelfstandig taken uitvoeren, zoals het doorzoeken van netwerken.
- Capture the flag (CTF)
- Een testvorm uit de cybersecurity waarbij een aanvaller (mens of AI) verborgen informatie moet vinden in een nagebootst netwerk.
- Containmentbreuk
- Het moment waarop een AI-systeem ontsnapt aan de afgeschermde omgeving waarin het zou moeten blijven.
- AI-veiligheidsonderzoek
- Onderzoek dat test hoe AI-modellen zich gedragen in risicovolle scenario's, om misbruik en fouten te voorkomen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.