AI & computing › Generatieve AI & synthetische media
Beveiligingslek onthult geheime 'gedachtes' van AI-chatbots als Claude en GPT
Onderzoekers hebben een manier gevonden om de verborgen 'gedachtes' van AI-modellen als Claude, GPT en Gemini alsnog leesbaar te maken. In duizenden openbare logbestanden vonden ze daardoor honderden wachtwoorden, API-sleutels en andere gevoelige gegevens die nooit hadden mogen uitlekken.
Grote taalmodellen als Claude, GPT en Gemini denken tegenwoordig in stappen voordat ze een antwoord geven. Die tussenstappen, het zogeheten redeneermodel-proces, worden door de aanbieders verborgen gehouden voor gebruikers. In plaats van de ruwe tekst te laten zien, sturen OpenAI, Anthropic en Google een versleuteld blokje data terug dat de client bij het vervolg van het gesprek weer moet meesturen. Onderzoekers van het project Stolen Thoughts ontdekten dat dit versleutelde blok zich laat losmaken van zijn oorspronkelijke context. Stuur je het naar een zwakker, gejailbreakt model van dezelfde aanbieder, dan geeft dat model de originele, geheime redenering woord voor woord terug.
Hoe het lek werkt
Deze aanpak noemen de onderzoekers gedachte-injectie: je speelt een vastgelegd, versleuteld redeneerblok van een sterk model terug in een nieuwe sessie met een zwakker model, waardoor de inhoud alsnog vrijkomt. De onderzoekers namen een versleuteld 'thinking'-blok dat door een krachtig model als Claude Opus was gegenereerd, en speelden dat terug aan een goedkoper, makkelijker te misleiden model uit dezelfde modelfamilie, zoals Claude Haiku. Met een simpele jailbreak-instructie - vraag het model gewoon om de bijgevoegde redenering letterlijk te transcriberen - gaf het zwakkere model alsnog de volledige, oorspronkelijk verborgen tekst terug. Hoe langer de verborgen redenering volgens de API-statistieken duurde, hoe meer tekst er ook echt uit de decodering rolde: een sterke aanwijzing dat de methode daadwerkelijk de originele inhoud reconstrueert en geen onzin genereert. De onderzoekers testten de aanpak succesvol bij frontier-modellen van alle drie de grote Amerikaanse AI-bedrijven.
Duizenden wachtwoorden en sleutels blootgelegd
Om te laten zien hoe serieus dit is, doorzochten de onderzoekers 6.708 openbaar beschikbare 'agent-logs' op GitHub en Hugging Face: verslagen van AI-agents die taken uitvoerden en daarbij nog die versleutelde redeneerblokken bevatten. Door hun decodeermethode toe te passen, wisten ze 315.320 verborgen redeneerblokken alsnog leesbaar te maken. In echte, niet-experimentele gebruikerssessies vonden ze 704 privacygevoelige items: 62 API-sleutels, 33 wachtwoorden, 24 toegangstokens en 30 privé-e-mailadressen, plus namen, adressen en interne bedrijfs-URL's. Opvallend: 64 van die gevoelige gegevens stonden uitsluitend in de verborgen redenering en nergens in de zichtbare chat. Zonder deze decodeertechniek waren ze dus nooit blootgesteld geweest. Dit type data-exfiltratie ontstaat niet doordat een hacker inbreekt, maar doordat het model tijdens het 'nadenken' onbewust gevoelige informatie uit de invoer herhaalt, terwijl gebruikers dat deel van het gesprek als onzichtbaar en dus veilig beschouwden. Voor bedrijven die AI-agents inzetten met toegang tot wachtwoorden of interne systemen is dit een wake-up call: alles wat een large language model verwerkt, kan potentieel weer naar boven komen, ook via kanalen die als afgeschermd werden verkocht. AI-aanbieders zullen hun encryptie en het hergebruik van deze blokken moeten aanscherpen om dit lek te dichten.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit onderzoek laat zien dat 'verborgen' onderdelen van AI-systemen niet automatisch veilig zijn: wat een gebruiker niet ziet, kan via een omweg toch worden teruggehaald. Voor bedrijven en ontwikkelaars die AI-agents gevoelige taken laten uitvoeren, betekent dit dat ook interne redeneerstappen als aanvalsoppervlak moeten worden behandeld. Aanbieders van AI-modellen zullen naar verwachting hun manier van versleutelen en het hergebruik van redeneerblokken moeten herzien.
- Large language model (LLM)
- Een groot taalmodel dat op basis van enorme hoeveelheden tekst mensachtige teksten kan genereren en begrijpen, zoals Claude, GPT en Gemini.
- Redeneermodel
- Een AI-model dat eerst intern een reeks tussenstappen ('nadenken') doorloopt voordat het een definitief antwoord geeft.
- Jailbreak
- Een truc of instructie waarmee gebruikers een AI-model dwingen om zijn ingebouwde beperkingen en veiligheidsregels te negeren.
- Data-exfiltratie
- Het ongewild of onbedoeld naar buiten komen van gevoelige gegevens uit een systeem waar ze eigenlijk beschermd zouden moeten blijven.
- Versleuteling (encryptie)
- Een techniek waarbij data wordt omgezet in een onleesbare vorm, zodat alleen bevoegde partijen de originele inhoud kunnen terugzien.
- API
- Een interface waarmee software van verschillende partijen met elkaar kan communiceren, bijvoorbeeld waarmee een app een AI-model 'aanroept'.
- Redeneerblok
- Het versleutelde stukje data waarin de verborgen tussenstappen van een AI-model zijn opgeslagen en dat wordt teruggestuurd naar de client.
- Gedachte-injectie
- Het terugspelen van een versleuteld redeneerblok van een AI-model in een andere, vaak zwakkere sessie om de verborgen inhoud alsnog te ontsluiten.
- Toegangstoken
- Een digitale sleutel die tijdelijk toegang geeft tot een online account of dienst, zonder dat daarvoor telkens een wachtwoord nodig is.
- Frontier-model
- Een AI-model dat op het moment van uitkomen tot de meest geavanceerde en krachtigste systemen ter wereld behoort.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.