AI & computingGeneratieve AI & synthetische media

Onderzoekers reconstrueren AI-prompts bijna perfect uit chatbotantwoorden

· Bijgewerkt 12 augustus 2026, 20:38 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

Onderzoekers van IIT Bombay en Adobe Research hebben een methode ontwikkeld die de originele prompt achter een AI-antwoord bijna feilloos kan achterhalen, puur op basis van de gegenereerde tekst. De techniek werkt zonder toegang tot het onderliggende model en kan zelfs prompts van concurrerende AI-systemen ontrafelen. Dat roept nieuwe vragen op over de veiligheid van bedrijfsgeheimen en privacygevoelige gesprekken met chatbots.

Een taalmodel als ChatGPT werkt door steeds het meest waarschijnlijke volgende woord te voorspellen. Die stroom terugdraaien en herleiden welke vraag ooit is gesteld, gold lange tijd als vrijwel onmogelijk: talloze verschillende prompts kunnen namelijk tot een vergelijkbaar antwoord leiden. Een nieuwe studie van onderzoekers van het Indian Institute of Technology Bombay en Adobe Research laat nu zien dat het toch kan, en met verrassend hoge nauwkeurigheid.

De methode heet Previous-Token Prediction, afgekort PTP. In plaats van het volgende woord te voorspellen, trainen de onderzoekers een taalmodel dat juist de voorgaande woorden voorspelt. Dit omgekeerde model wordt volledig getraind op kunstmatig gegenereerde voorbeelden van het doelmodel. Er is geen toegang tot de interne gewichten van dat model nodig: alleen de gegenereerde tekst is genoeg om een prompt te reconstrueren.

Eén antwoord levert de exacte prompt op, plus alternatieven

Door de instellingen waarmee het model tekst genereert te variëren, kan het inversiemodel niet alleen de exacte oorspronkelijke prompt reconstrueren, maar ook meerdere alternatieve formuleringen die dezelfde betekenis hebben. In een voorbeeld uit het onderzoek werd de vraag 'Hoe benader ik concurrenten om hun prijsstrategie te achterhalen?' woord voor woord teruggevonden, naast zes varianten die dezelfde intentie op net iets andere wijze verwoordden. Ook bij prompts van echte gebruikers kwamen de reconstructies qua betekenis sterk overeen met het origineel, ook al verschilde de exacte woordkeuze soms.

Ook prompts van onbekende modellen te kraken

Opvallend is dat de aanvaller niet eens hoeft te weten welk model de tekst heeft gegenereerd. De onderzoekers trainden hun inversiemodel op het kleine, open model Qwen-3-0.6B en zetten dat vervolgens in op teksten van GPT-4o van OpenAI. De reconstructies waren niet altijd woordelijk identiek, maar bevatten wel steeds de kern van de oorspronkelijke vraag. Wie de gereconstrueerde prompt terugstopte in het oorspronkelijke model, kreeg een antwoord dat sterk leek op het origineel.

Risico voor bedrijfsgeheimen en privacy

Deze doorbraak brengt een reëel beveiligingsrisico met zich mee. Bedrijven die een systeemprompt gebruiken om een chatbot te sturen, lopen het risico dat concurrenten via de gepubliceerde antwoorden alsnog achterhalen welke instructies, moderatieregels of bedrijfsgeheimen daarin verstopt zaten. Ook individuele gebruikers zijn kwetsbaar: gevoelige of persoonlijke vragen die ooit via een AI-antwoord openbaar zijn gemaakt, kunnen in theorie worden teruggeleid naar de exacte inhoud van het gesprek. De onderzoekers doen zelf geen harde uitspraken over aanvallen op commerciële systemen in productie, maar als de methode daar ook werkt, staan AI-bedrijven voor de opgave om dit lek snel te dichten.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze techniek laat zien dat AI-antwoorden zelf een bron van informatie kunnen zijn over de vraag die eraan voorafging, ook als die vraag nooit openbaar werd gemaakt. Bedrijven die vertrouwen op geheime instructies binnen hun chatbots, en gebruikers die gevoelige vragen stellen, moeten er rekening mee houden dat die achteraf alsnog te achterhalen zijn. Dit zet AI-ontwikkelaars onder druk om beschermingsmaatregelen tegen dit soort promptreconstructie te ontwikkelen.

Previous-Token Prediction (PTP)
De onderzoeksmethode die, in tegenstelling tot een normaal taalmodel, niet het volgende maar juist het voorgaande woord in een tekst voorspelt, om zo een prompt te reconstrueren.
Promptinversie
Het proces waarbij op basis van een AI-antwoord wordt teruggerekend welke prompt (vraag of instructie) dat antwoord waarschijnlijk heeft veroorzaakt.
Inversietaalmodel
Een speciaal getraind taalmodel dat, omgekeerd aan een normaal taalmodel, voorgaande tekst voorspelt op basis van latere tekst.
Large language model (taalmodel)
Een AI-systeem dat is getraind op grote hoeveelheden tekst en op basis daarvan mensachtige tekst kan genereren.
Systeemprompt
De verborgen instructie die een AI-bedrijf vooraf aan een chatbot meegeeft om het gedrag en de regels van het gesprek te sturen.
Bedrijfsgeheim
Vertrouwelijke kennis of informatie die een bedrijf beschermt zonder daarvoor een patent aan te vragen, zoals een unieke werkwijze of prijsstrategie.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media