AI & computing › Generatieve AI & synthetische media
Anthropic legt uit hoe watermerken in Claude straks werken
Anthropic geeft meer details over de watermerken die het binnenkort aan tekst van chatbot Claude gaat toevoegen. Het bedrijf legt uit hoe de techniek werkt, wat er gebeurt bij bewerkingen en hoe het zit met code.
Anthropic publiceerde vrijdag een blogpost met antwoorden op vragen die leven onder gebruikers van chatbot Claude. Het bedrijf gaat namelijk tekst die Claude genereert voorzien van een watermerk. Dat is nodig om te voldoen aan de Transparency Code van de Europese AI-verordening, die AI-bedrijven verplicht om AI-gegenereerde content herkenbaar te maken. Het nieuws leidde tot onrust: op Reddit spraken gebruikers van een 'complot', en volgens Business Insider zeggen tientallen mensen op X hun Claude-abonnement te hebben opgezegd.
Hoe werkt het watermerk?
Het principe zit in kleine, onopvallende keuzes die Claude maakt tijdens het schrijven. Als het model bijvoorbeeld moet kiezen tussen de woorden 'bewolkt' en 'grijs' om het weer te beschrijven, kan het een patroon aanbrengen dat voor een lezer volledig onzichtbaar is, maar wel te herkennen is voor wie een digitale sleutel heeft die dat patroon ontcijfert. Anthropic benadrukt dat dit de kwaliteit van de tekst niet aantast: een gewatermerkt antwoord is voor een lezer niet te onderscheiden van een antwoord zonder watermerk.
Het bedrijf gebruikt hiervoor de methode SynthID-Text, ontwikkeld door Google DeepMind in 2024, en komt met een detectie-API waarmee derden kunnen checken of een tekst het watermerk bevat. Dit is iets anders dan bestaande AI-tekstdetectors van bedrijven als Pangram, die juist zoeken naar typische schrijfpatronen van AI. Een watermerk controleren is volgens Anthropic 'fundamenteel anders' dan het herkennen van zulke stijlkenmerken.
Kan je het watermerk wegpoetsen?
Een lichte redactieslag op een AI-tekst haalt het watermerk vermoedelijk niet volledig weg, meldt Anthropic. Herschrijf je elk woord, dan verdwijnt het patroon wel — maar dan is de vraag of zo'n tekst nog wel 'AI-gegenereerd' te noemen is. Ook als Claude alleen tekst nakijkt of licht bewerkt, blijft er weinig over om een watermerk aan te hechten, omdat het grootste deel van de tekst dan door een mens is geschreven.
En hoe zit het met programmeercode?
Bij code ligt dit anders. Werkende code laat het model weinig ruimte om tussen gelijkwaardige alternatieven te kiezen, waardoor er minder plek is voor een watermerk. Alleen bij onderdelen met vrije keuze, zoals commentaarregels in de code, kan het watermerk wel worden toegepast. Op de functionaliteit van de code zelf heeft dit volgens Anthropic geen merkbaar effect.
Claude is niet de enige chatbot die op deze manier gemerkt gaat worden: andere aanbieders van grote taalmodellen die de Europese gedragscode hebben ondertekend, voeren naar eigen zeggen vergelijkbare watermerken in.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Watermerken in AI-tekst maken het makkelijker om te controleren of content door een mens of een machine is geschreven, wat relevant is voor onderwijs, journalistiek en desinformatiebestrijding. Tegelijk laat deze uitleg zien dat de techniek grenzen heeft: bij grondige herschrijvingen of technische code werkt detectie nauwelijks. Verwacht dat meer AI-aanbieders vergelijkbare systemen invoeren nu de EU dit via regelgeving afdwingt.
- Watermerk
- Een onzichtbaar patroon dat in AI-gegenereerde tekst wordt verwerkt, herkenbaar met een speciale digitale sleutel of detectietool.
- AI-tekstdetector
- Software die probeert te herkennen of een tekst door AI is geschreven, meestal door te zoeken naar typische stijlkenmerken in plaats van een watermerk.
- SynthID-Text
- De watermerktechniek van Google DeepMind uit 2024, die Anthropic nu ook gebruikt voor Claude.
- Transparency Code
- Onderdeel van de Europese AI-verordening (AI Act) dat AI-bedrijven verplicht AI-gegenereerde content herkenbaar te maken.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.