AI & computing › Generatieve AI & synthetische media
Onzichtbaar watermerk in AI-tekst verandert ook het gedrag van AI-agents
Onderzoekers ontdekten dat het onzichtbare watermerk dat grote taalmodellen straks verplicht in hun tekst verwerken, niet alleen laat zien dat iets door AI is geschreven. Het beïnvloedt ook welke woorden een model kiest, en dus welke acties een AI-agent daadwerkelijk uitvoert.
Grote AI-bedrijven zoals Anthropic beginnen onzichtbare watermerken in de tekst van hun modellen te verwerken. Dat is geen toeval: de Europese AI-verordening verplicht makers van AI-systemen om gegenereerde tekst herkenbaar te maken als kunstmatig. Anthropic gebruikt daarvoor SynthID-Text, een techniek die is ontwikkeld door Google DeepMind. Onderzoekers van het beveiligingsbedrijf Lasso Security ontdekten nu dat deze markering een onbedoeld neveneffect heeft: ze verandert net genoeg aan de manier waarop een model woorden kiest om het gedrag van AI-agents merkbaar te beïnvloeden.
Hoe een watermerk in tekst wordt verstopt
Een tekstwatermerk werkt door tijdens het genereren van tekst een subtiel, onzichtbaar patroon in de woordkeuze aan te brengen. Detectiesoftware kan dat patroon later herkennen, zodat duidelijk wordt dat een tekst door AI is gemaakt. SynthID-Text gebruikt hiervoor 'toernooisampling': bij elk woord laat het model meerdere kandidaten tegen elkaar 'strijden', waarbij de uitkomst subtiel wordt gestuurd door een geheime sleutel. Volgens de ontwikkelaars verandert dit de kwaliteit van de tekst niet meetbaar. Op het niveau van losse antwoorden kan de tekst er wel degelijk anders uitzien dan zonder watermerk, ook al blijft de gemiddelde kwaliteit gelijk.
Van net-iets-ander-woord naar verkeerde actie
Dat verschil is onschuldig bij een chatbot die met de gebruiker converseert. Maar veel AI-modellen worden ook ingezet als de 'motor' achter AI-agents: programma's die zelfstandig taken uitvoeren door gereedschappen aan te roepen, zoals het versturen van een e-mail of het uitvoeren van een betaling. In dat soort toolaanroepen zitten vaak minder voorspelbare onderdelen, zoals een bedrag, een naam of een zoekopdracht. Precies op die plekken kan het watermerk voor een andere tokenkeuze zorgen. Lasso Security testte dit op een standaardbenchmark voor toolaanroepen en zag dat bij meerdere modellen de nauwkeurigheid daalde. Belangrijker nog: wanneer ze dezelfde taak met en zonder watermerk lieten uitvoeren, veranderde de uitkomst bij gemiddeld 6,5 procent van de gevallen, bij één model zelfs bij bijna 17 procent. Dat cijfer, dat de onderzoekers 'churn' noemen, ligt veel hoger dan het verlies in gemiddelde score alleen laat zien, omdat foute en juiste verschuivingen elkaar deels opheffen.
Ook risico's rond veiligheid
Het onderzoek keek ook naar weigergedrag: weigert een model een schadelijk verzoek uit te voeren? Ook daar zag het team verschuivingen, en die verschuivingen werden groter wanneer het schadelijke verzoek verstopt zat in een prompt injection, een truc waarbij instructies worden verstopt in tekst die het model verwerkt. Een watermerk dat de weigering van een model net iets minder streng maakt, is extra riskant zodra dat model ook daadwerkelijk actie kan ondernemen via een agent. De onderzoekers pleiten er daarom voor dat ontwikkelaars van AI-agents watermerkeffecten meenemen in hun testen, in plaats van blind te vertrouwen op de garantie dat een watermerk de tekstkwaliteit niet aantast.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nu overheden watermerken in AI-tekst verplicht gaan stellen, blijkt die maatregel een prijs te hebben: ze kan het gedrag van AI-agents net genoeg veranderen om verkeerde acties te veroorzaken of veiligheidsweigeringen te verzwakken. Bedrijven die AI-modellen inzetten voor autonome taken zullen dit effect voortaan moeten meetesten, wil de EU-regelgeving straks niet tegen de veiligheid van agentic AI ingaan.
- Watermerk
- Een onzichtbaar patroon dat in AI-gegenereerde tekst wordt verwerkt om die later als kunstmatig herkenbaar te maken.
- Sampling drift
- De term die de onderzoekers gebruiken voor de verschuiving in modelgedrag die ontstaat doordat een watermerk de woordkeuze tijdens het genereren beïnvloedt.
- Toernooisampling
- De methode achter SynthID-Text waarbij kandidaat-woorden onderling 'strijden' zodat een geheime sleutel de uiteindelijke woordkeuze subtiel stuurt.
- Niet-distorsieve watermerking
- Een watermerktechniek die gemiddeld genomen geen kwaliteitsverlies geeft, ook al kan een individuele tekst er met een vaste sleutel toch anders uitzien.
- Prompt injection
- Een aanvalstechniek waarbij verborgen instructies in tekst worden verstopt om een AI-model tegen de bedoeling van de gebruiker in te laten handelen.
- Agentic AI
- AI-systemen die niet alleen tekst genereren, maar zelfstandig taken uitvoeren door acties te ondernemen namens een gebruiker.
- Toolaanroep
- Het moment waarop een AI-model een extern programma of dienst aanroept, bijvoorbeeld om een bestand te openen of een betaling te doen.
- Churn (gepaarde afwijking)
- Het percentage taken waarvan de uitkomst verandert tussen een run met en een run zonder watermerk, ook als het gemiddelde eindresultaat nauwelijks verschilt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.