AI & computing › Generatieve AI & synthetische media
OpenAI stopt diefstal van AI-redeneerstappen, maar Azure bleef lek
OpenAI heeft een grootschalige poging tegengehouden om de verborgen denkstappen van zijn AI-modellen te kopiëren. Weken later bleek de truc nog steeds te werken bij andere aanbieders van dezelfde modellen, zoals Microsoft Azure.
OpenAI meldt dat het een gecoördineerde actie heeft opgerold waarbij aanvallers de interne redenering van zijn AI-modellen probeerden te kopiëren. Die redenering bestaat uit de tussenstappen die een model doorloopt voordat het een antwoord geeft. Gebruikers zien normaal alleen het eindresultaat, maar die tussenstappen zijn waardevol: ze kunnen verklappen hoe een model tot zijn antwoord komt en helpen anderen om de vaardigheden van een duur model goedkoop te kopiëren. Dat proces heet distillatie.
Van rustig begin tot piek van 16.000 verzoeken
Volgens OpenAI begon de activiteit op 1 juli op kleine schaal. Op 24 en 25 juli schoot het aantal verzoeken omhoog naar 16.000, verspreid over meer dan 4.000 gebruikersaccounts die allemaal dezelfde extractiemethode gebruikten. Nader onderzoek bracht een netwerk van ruim 15.000 gerelateerde accounts aan het licht, dat OpenAI op 28 juli volledig buiten werking stelde. Het bedrijf benadrukt dat het om pogingen ging; niet elke poging slaagde noodzakelijkerwijs. OpenAI zegt een kerngroep achter de actie te kunnen koppelen aan personen die banden hebben met Moonshot AI, het Chinese bedrijf achter het taalmodel Kimi. Anthropic meldde eerder vergelijkbare pogingen vanuit Chinese AI-bedrijven.
Een goedkoop model als decryptiesleutel
De aanvallers gingen volgens OpenAI als volgt te werk: ze kopieerden versleutelde redeneerdata uit één gesprek en lieten die in een ander gesprek door een model ontcijferen en uitschrijven. Onderzoeker Joachim Schaeffer toonde dit mechanisme eerder al aan in een wetenschappelijke publicatie. AI-aanbieders sturen redeneerstappen alleen versleuteld naar klanten terug, met sleutels die binnen een productfamilie worden gedeeld. Daardoor kunnen de versleutelde pakketjes tussen sessies, gebruikers en zelfs verschillende modellen van dezelfde aanbieder worden doorgespeeld. Een goedkoper redeneermodel uit dezelfde familie functioneert dan als decryptiesleutel die de gedachten van het duurdere model woord voor woord blootlegt. OpenAI erkent de bevindingen van de onderzoekers en zegt mede dankzij hen sneller tegenmaatregelen te hebben ingevoerd, zoals het blokkeren van frauduleuze accounts en het screenen van uitvoer die redeneerstappen zou kunnen onthullen.
Azure bleef weken open
Het verhaal stopt daar niet. Toen de onderzoekers op 13 september opnieuw testten, bleek de aanval geblokkeerd op de eigen API's van OpenAI en Anthropic. Maar via cloudplatform Microsoft Azure werkte de methode tegen alle geteste OpenAI-modellen, inclusief het nieuwe GPT-6 Astra, en tegen Anthropic-modellen tot en met Sonnet 5. Eén poging was al genoeg om de volledige redenering te onttrekken. Een tweede, nog simpelere methode liet een model zijn redenering wegschrijven in een soort digitaal kladblok dat de gebruiker vervolgens kon uitlezen; die truc werkte bij bijna alle geteste modellen, met uitzondering van Opus 5, Fable 5 en Fable 5.1. Volgens de onderzoekers lanceerde GPT-6 Astra zelfs zonder enige beveiliging op platforms van derden. OpenAI voegde pas op 27 september bescherming toe aan het Azure-eindpunt; voor Anthropic-modellen werkte de truc op Azure niet meer vanaf 28 september. De onderzoekers stellen dat cloudaanbieders die geen gelijkwaardige bescherming bieden, eigenlijk geen redeneermodellen zouden mogen aanbieden – anders ontstaat een achterdeur waarmee exportcontroles feitelijk worden omzeild.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit incident laat zien dat de beveiliging van AI-modellen niet alleen bij de maker ligt, maar bij elke partij die het model aanbiedt. Zolang cloudplatforms niet dezelfde bescherming bieden als de oorspronkelijke ontwikkelaar, blijven concurrenten en statelijke actoren kansen zien om dure AI-capaciteiten goedkoop te kopiëren. Verwacht dat aanbieders en toezichthouders de komende tijd druk zetten op uniforme beveiligingseisen voor alle platforms die krachtige AI-modellen hosten.
- Distillatie
- Het proces waarbij een model leert van de volledige uitvoer van een ander, sterker model, inclusief de tussenstappen die normaal verborgen blijven.
- Redeneermodel
- Een AI-model dat eerst interne, stapsgewijze redeneringen doorloopt voordat het een definitief antwoord geeft.
- Decryptie-oracle
- Een systeem dat, zonder dat dit de bedoeling is, versleutelde data voor een aanvaller ontcijfert; in dit geval een goedkoop AI-model dat versleutelde redeneerdata van een ander model leesbaar maakt.
- API
- Een interface waarmee software en gebruikers een AI-model kunnen aanroepen en resultaten terugkrijgen.
- Cloudplatform
- Een online dienst, zoals Microsoft Azure, die rekenkracht en toegang tot AI-modellen van derden aanbiedt.
- Exportcontrole
- Overheidsregels die de verspreiding van gevoelige technologie naar bepaalde landen of partijen beperken.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.