AI & computing › Generatieve AI & synthetische media
Claude gaat tekst 'watermerken' door bewust bepaalde woorden te kiezen
AI-bedrijf Anthropic gaat alle tekst die chatbot Claude genereert voorzien van een onzichtbaar watermerk, om te voldoen aan Europese regelgeving. Uit een technische toelichting blijkt dat het model daarvoor bewust net iets vaker bepaalde woorden kiest boven andere — een ingreep die critici zien als een aantasting van de tekst zelf.
Anthropic, het bedrijf achter taalmodel Claude, kondigde deze week aan dat alle Claude-modellen wereldwijd voortaan een watermerk aanbrengen in gegenereerde tekst. De maatregel moet Claude laten voldoen aan een Europese verordening die vereist dat AI-content herkenbaar is als kunstmatig gegenereerd. In eerste instantie liet Anthropic in het midden hoe die techniek precies werkt. Techcolumnist John Gruber van Daring Fireball noemde de aankondiging zelfs ronduit ontoereikend, omdat het bijbehorende document geen enkel technisch detail bevatte.
Een dag later publiceerde Anthropic alsnog een uitleg. Daaruit blijkt dat het watermerk niet bestaat uit onzichtbare tekens, zoals aanvankelijk gedacht, maar uit een subtiele sturing van de woordkeuze van het model zelf.
Groene en rode woorden
De techniek werkt als volgt. Telkens wanneer Claude het volgende woord of woorddeel — een zogeheten token — moet kiezen, verdeelt een geheim algoritme de mogelijke opties in een 'groene' en een 'rode' lijst. Die verdeling wordt op dat moment berekend, op basis van een geheime sleutel en de voorgaande tekst, en verandert dus voortdurend. Het model krijgt vervolgens een lichte voorkeur om iets vaker een woord van de groene lijst te kiezen dan van de rode. Dat betekent niet dat rode woorden nooit meer voorkomen, maar de kans erop ligt net iets lager dan bij een volledig neutrale keuze.
Wie de geheime sleutel bezit — in dit geval alleen Anthropic — kan achteraf tellen hoeveel woorden in een tekst uit de groene lijst komen. Wijkt dat aandeel significant af van wat toeval zou opleveren, dan is de tekst vermoedelijk door Claude geschreven. Hoe langer de tekst, hoe betrouwbaarder die inschatting wordt, vergelijkbaar met het herkennen van een valse munt: bij een paar worpen is weinig te zeggen, bij honderden worpen wel. Belangrijk is dat dit systeem alleen binnen één bedrijf werkt: Claude kan geen watermerk van concurrent Gemini herkennen, en andersom evenmin, omdat elke partij zijn eigen geheime sleutel gebruikt.
Kritiek op 'onzichtbaar zonder gevolgen'
Anthropic claimde in zijn eerste communicatie dat het watermerk 'onzichtbaar' is en de betekenis, kwaliteit of leesbaarheid van tekst niet verandert. Critici, onder wie Gruber, zetten daar vraagtekens bij. Synoniemen zijn namelijk zelden volledig identiek in betekenis of gevoelswaarde. Als een taalmodel structureel net iets vaker het ene woord kiest boven het andere — niet omdat het de beste keuze is, maar omdat het toevallig op de groene lijst staat — dan verschuift daarmee volgens hen wel degelijk de precisie van de tekst, hoe klein het effect ook is. De maatregel geldt overigens alleen voor teksten van meer dan ongeveer 150 woorden; kortere antwoorden blijven ongemoeid, simpelweg omdat daar te weinig woorden in zitten om een betrouwbaar watermerk te herkennen.
De discussie raakt een bredere vraag die met de opkomst van generatieve AI steeds vaker opduikt: hoe herken je of tekst, beeld of geluid door een computer is gemaakt, zonder de kwaliteit van het resultaat op te offeren? Tools als een AI-tekstdetector proberen dat achteraf te bepalen, maar zijn vaak onbetrouwbaar. Een ingebouwd watermerk moet die onzekerheid wegnemen — al blijkt uit de kritiek dat de gekozen methode zelf ook niet zonder compromissen is.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-teksten moeilijker te onderscheiden zijn van menselijk werk, groeit de druk om herkomst aantoonbaar te maken. Watermerken zoals dat van Anthropic kunnen helpen bij het bestrijden van desinformatie en examenfraude, maar de discussie laat zien dat herkenbaarheid en tekstkwaliteit soms met elkaar botsen. Dit soort afwegingen zal vaker terugkeren naarmate meer AI-bedrijven onder wetgeving als de Europese AI-verordening vallen.
- Watermerk
- Een verborgen kenmerk in digitale content waarmee de herkomst — bijvoorbeeld AI-generatie — achteraf kan worden aangetoond.
- Token
- Het kleinste tekstfragment (vaak een woord of woorddeel) dat een taalmodel bij het genereren van tekst één voor één kiest.
- Taalmodel (LLM)
- Een AI-systeem dat is getraind om tekst te begrijpen en te genereren door steeds het meest waarschijnlijke volgende woord te voorspellen.
- AI-tekstdetector
- Software die probeert te herkennen of een tekst door een mens of door AI is geschreven, vaak met beperkte betrouwbaarheid.
- Steganografie
- De techniek om informatie verborgen in andere content te verstoppen, zodanig dat de aanwezigheid ervan niet direct opvalt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.