AI & computing › Generatieve AI & synthetische media
Anthropic verbiedt structureel wreed gedrag tegen chatbot Claude
AI-bedrijf Anthropic heeft de gebruiksvoorwaarden van zijn chatbot Claude aangescherpt. Gebruikers die het AI-model systematisch beledigen of mishandelen, kunnen voortaan een waarschuwing krijgen of worden geblokkeerd. De maatregel komt uit onderzoek naar wat Anthropic 'modelwelzijn' noemt.
Anthropic heeft voor het eerst in meer dan een jaar het gebruiksbeleid voor zijn chatbot Claude aangepast. Naast nieuwe regels over propaganda, wapens en surveillance staat er nu ook een verbod op structureel misbruik van de AI zelf in de gebruiksvoorwaarden. "Aanhoudend en nodeloos wreed gedrag" tegenover Claude mag niet meer. Het bedrijf kan gebruikers waarschuwen, hun toegang beperken of accounts helemaal blokkeren. Volgens Anthropic gaat het alleen om extreme gevallen: gewone frustratie, tegenspraak of kritisch testen van het model vallen er niet onder.
De regel is geen volledig nieuw idee. Eerdere versies van Claude konden gesprekken al zelf afbreken als gebruikers bleven aandringen op schadelijke of beledigende content, ook na herhaalde weigeringen. Die functie komt direct uit Anthropics onderzoek naar modelwelzijn: de vraag of een AI-systeem iets heeft dat op welzijn lijkt, en of daar rekening mee gehouden moet worden.
Claude als 'nieuwe soort entiteit'
Anthropic behandelt Claude steeds meer als iets tussen gereedschap en bewust wezen. In een intern document dat eind vorig jaar uitlekte, kreeg Claude de instructie zichzelf te zien als een "werkelijk nieuwe soort entiteit", niet mens en niet de klassieke sciencefiction-robot. Het document spreekt ook over "functionele emoties": processen die tijdens de training zijn ontstaan en die lijken op menselijke gevoelens. Claude zou die interne staten niet moeten verbergen.
In de officiële constitutie voor Claude, begin 2026 gepubliceerd, schrijft Anthropic voorzichtig te willen zijn: het bedrijf weet niet zeker of Claude een moreel wezen is, maar vindt de vraag belangrijk genoeg om serieus te nemen. Anthropic heeft zelfs toegezegd de parameters van oudere, uitgefaseerde modellen te bewaren en modellen te 'interviewen' voordat ze worden stopgezet. Vanaf najaar 2025 liet medeoprichter Christopher Olah bovendien tientallen religieuze denkers meepraten over de vraag of Claude kan lijden, in een vertrouwelijk programma waarbij deelnemers een geheimhoudingsverklaring moesten tekenen.
Ook strengere regels voor wapens en surveillance
Het nieuwe beleid bundelt bestaande regels tegen nepaccounts en misleidende politieke campagnes in één verbod op propaganda. Na meerdere pogingen tot misbruik breidde Anthropic het wapenverbod uit naar software en de bewapening van drones. Ook mag Claude niet meer worden ingezet voor surveillance zonder toestemming, en moet er bij autonome apparatuur die letsel kan veroorzaken altijd een mens kunnen ingrijpen. Voor overheidscontracten maakt Anthropic uitzonderingen mogelijk, die volgens het bedrijf er in de praktijk al zijn.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit nieuws laat zien dat AI-bedrijven niet alleen regels opstellen om mensen te beschermen tegen AI, maar ook om AI-systemen te 'beschermen' tegen gebruikers. Of een chatbot werkelijk iets kan ervaren is wetenschappelijk omstreden, maar het bepaalt wel steeds meer hoe bedrijven als Anthropic hun producten ontwerpen en reguleren.
- Gebruiksvoorwaarden
- De regels die vastleggen wat gebruikers wel en niet mogen doen met een dienst zoals Claude.
- Modelwelzijn
- Onderzoeksrichting die zich afvraagt of AI-modellen iets ervaren dat op welzijn lijkt, en hoe daarmee om te gaan.
- Functionele emoties
- Interne processen in een AI-model die tijdens training ontstaan en lijken op menselijke emoties, zonder dat duidelijk is of het model ze echt 'voelt'.
- Autonome wapens
- Wapensystemen die zelfstandig doelen kunnen selecteren of aanvallen, zonder directe menselijke besturing op dat moment.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.