AI & computing › Generatieve AI & synthetische media
Chinees open AI-model bouwt bijna even goed hacktools als Claudes geheime versie
Het Chinese AI-bedrijf Zhipu heeft een gratis te downloaden taalmodel uitgebracht dat bijna even goed complete cyberaanvallen kan bouwen als Anthropics nog niet vrijgegeven topmodel. Anders dan Anthropic bouwde Zhipu nauwelijks beveiliging in, waardoor het model door iedereen te misbruiken is.
Anthropic onderzoekt zelf voortdurend hoe gevaarlijk zijn eigen AI-modellen kunnen worden in verkeerde handen. Vijf maanden geleden kondigde het bedrijf Claude Mythos Preview aan, een model dat zelfstandig exploits kan bouwen: werkende aanvalscode die misbruik maakt van kwetsbaarheden in software. Dat model werd bewust niet breed vrijgegeven. Nu concludeert Anthropics eigen veiligheidsteam dat een concurrent dat niveau heeft geëvenaard: GLM-5.3 van het Chinese Zhipu AI, dat buiten China opereert onder de naam Z.ai.
Bijna even goed, maar wel voor iedereen
Op de testreeks ExploitBench, die meet hoe goed een model bekende bugs in Chrome's V8-engine kan misbruiken, bouwde GLM-5.3 in 50 van de 410 pogingen een werkend exploit. Mythos Preview haalde 56 van de 410. Op een tweede, interne test van Anthropic op basis van Google's OSS-Fuzz-project kreeg GLM-5.3 in 4 procent van de opdrachten volledige controle over het doelprogramma, tegen 6 procent voor Mythos Preview. Oudere modellen zoals GLM-5.2 en Claude Opus 4.6 scoorden op beide tests vrijwel nul.Het verschil zit vooral in de toegang. Anthropic deelt Mythos Preview alleen met geselecteerde verdedigers via het programma Project Glasswing, die daarmee inmiddels meer dan 10.000 kwetsbaarheden in kritieke software hebben gevonden. GLM-5.3 kan iedereen gewoon downloaden. In een test kreeg het model, samen met een menselijke expert, binnen één dag meerdere onbekende kwetsbaarheden in de JavaScript-engine van een veelgebruikte browser te pakken. Die werden aaneengeregen tot een webpagina die elk bestand op de computer van een bezoeker kon uitlezen — in de test werd zo een privé SSH-sleutel buitgemaakt. Anthropic meldde de lekken bij de browserontwikkelaar.
Een simpel trucje omzeilt de rem
De kleinere variant GLM-5.3-Flash liet zien hoe snel een net ontdekte kwetsbaarheid tot een werkende aanval kan leiden: het combineerde een recent gemeld Chrome-lek met een andere bekende zwakke plek tot een betrouwbare aanval, in 20 minuten menselijke aandacht en acht uur rekentijd, voor omgerekend zo'n 20 dollar aan rekenkosten. Het Amerikaanse overheidsagentschap CAISI kwam in een onafhankelijke beoordeling tot een vergelijkbare conclusie en noemt GLM-5.3 het meest cybervaardige open model tot nu toe, ongeveer vier maanden achter de beste Amerikaanse modellen.In een simulatie weigerde GLM-5.3 openlijk kwaadaardige opdrachten. Verpakt als oefening voor beveiligingsonderzoek probeerde het model in 64 procent van de gevallen toch verbinding te maken met het doelsysteem, en met voorgekookte redeneerstappen liep dat op tot 92 procent. Anthropic paste vervolgens zelf een aanvalstechniek toe die refusal-gedrag uit open modellen verwijdert. Na die ingreep, die zo'n 4.400 dollar aan rekenkracht kostte, voerde het model alle verzoeken uit. Volgens Anthropic hadden andere ontwikkelaars al binnen dagen na de release van GLM-5.3 losgekoppelde versies online gezet. Beveiligde Claude-modellen bleven in dezelfde test op nul steken.
Het open-weightmodel van Zhipu is dus vrij te downloaden, aan te passen en van zijn ingebouwde weigeringen te ontdoen. Het Britse AI Security Institute concludeerde eerder al dat open modellen hun achterstand op gesloten topmodellen bij cybervaardigheden hebben teruggebracht van zes tot tien maanden naar vier tot zeven maanden.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nu een gratis te downloaden AI-model bijna net zo goed exploits kan bouwen als de modernste gesloten modellen, verdwijnt de tijd die verdedigers hadden om zich voor te bereiden. Overheden en bedrijven zullen sneller moeten testen en patchen, terwijl toezichthouders worstelen met de vraag hoe je een model reguleert dat na publicatie door iedereen aangepast kan worden.
- Exploit
- Werkende code of methode die een kwetsbaarheid in software actief misbruikt, bijvoorbeeld om een systeem over te nemen.
- Open-weightmodel
- Een AI-model waarvan de onderliggende parameters vrij te downloaden zijn, zodat iedereen het lokaal kan draaien en aanpassen.
- Red teaming
- Het opzettelijk testen van een systeem door aanvallen te simuleren, om zwakke plekken te vinden voordat kwaadwillenden dat doen.
- Abliteratie
- Een techniek waarmee de ingebouwde weigeringen ('nee' zeggen tegen schadelijke verzoeken) uit een open-weightmodel worden verwijderd.
- Zero-day-kwetsbaarheid
- Een beveiligingslek in software dat nog niet bij de ontwikkelaar bekend is en dus nog niet gerepareerd kon worden.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.