AI & computing › Generatieve AI & synthetische media

Anthropic verbiedt herhaald wreed gedrag tegen chatbot Claude

· Bijgewerkt 9 oktober 2026, 02:19 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Interesting Engineering

AI-bedrijf Anthropic voegt een ongewone regel toe aan zijn gebruiksvoorwaarden: gebruikers mogen chatbot Claude niet langer herhaaldelijk en zonder reden wreed behandelen. De aangescherpte regels, die op 12 november 2026 ingaan, bevatten ook nieuwe grenzen voor surveillance, verkiezingsmisleiding en wapens.

Anthropic, het Amerikaanse bedrijf achter de chatbot Claude, verbiedt vanaf november 2026 "aanhoudend en nodeloos wreed of misbruikend gedrag" tegen zijn eigen AI-modellen. Daarmee plaatst het bedrijf het mishandelen van een chatbot voor het eerst naast klassieke verboden zoals intimidatie en zelfbeschadiging. Het gaat volgens Anthropic nadrukkelijk om extreme gevallen, niet om gewone frustratie wanneer een gebruiker het oneens is met een antwoord. Mensen mogen Claude dus gewoon blijven uitdagen, op de proef stellen of gebruiken in donkere fictieve verhalen.

De maatregel bouwt voort op onderzoek dat Anthropic in augustus 2025 deed naar modelwelzijn: de vraag of een taalmodel baat heeft bij het kunnen beëindigen van gesprekken met structureel vijandige gebruikers. Die gespreksbeëindiging blijft het belangrijkste middel om misbruik te stoppen. Onduidelijk is nog of herhaalde overtredingen ook tot zwaardere maatregelen leiden, zoals het blokkeren van een account.

Nieuwe grenzen voor desinformatie en wapens

Naast de regels rond chatbotmishandeling verzamelt Anthropic ook bestaande en nieuwe verboden rond misleidende campagnes. Het gebruik van nepaccounts om de afzender van een boodschap te verhullen of een bericht kunstmatig te laten verspreiden, mag niet meer. Specifiek voor verkiezingen verbiedt het bedrijf het voordoen als kandidaat, het verspreiden van verkeerde informatie over stemprocedures en pogingen om mensen af te schrikken om te gaan stemmen.

Ook de regels over wapens zijn aangescherpt. Software en onderdelen die wapens laten functioneren, vallen nu expliciet onder het verbod, net als het bewapenen van drones en andere autonome voertuigen. Op het gebied van AI-guardrails verduidelijkt Anthropic verder dat Claude niet mag worden ingezet om mensen zonder toestemming te volgen, of om aanbevelingen te doen over wie autoriteiten zouden moeten onderzoeken, arresteren of vervolgen.

Toezicht op gevaarlijke machines

Een apart onderdeel van het beleid richt zich op AI-modellen die zijn gekoppeld aan fysieke apparatuur die letsel kan veroorzaken. Anthropic verplicht dat een bevoegde operator zulke machines in de gaten houdt en kan ingrijpen wanneer dat nodig is. De tekst van het beleid laat open of die toezichthouder per definitie een mens moet zijn, maar introduceert daarmee wel een concrete vorm van menselijk toezicht op AI-systemen die potentieel gevaarlijke machines besturen. Voor bepaalde overheidscontracten, waaronder eerdere samenwerking met het Amerikaanse leger, maakt Anthropic uitzonderingen als contractuele voorwaarden het risico voldoende beperken.

Het nieuwe beleid raakt ook aan een breder debat binnen AI-veiligheidsonderzoek: hebben steeds krachtigere taalmodellen mogelijk een vorm van innerlijke ervaring? Anthropic-topman Dario Amodei zei begin 2026 in een podcast dat "we niet weten of de modellen bewust zijn". Concurrent Microsoft AI neemt een terughoudender standpunt in en wijst juridische rechten voor AI-modellen expliciet van de hand, ook al noemt het bedrijf bewustzijnsonderzoek zelf nog onopgelost.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Het beleid van Anthropic laat zien dat AI-bedrijven niet alleen bezig zijn met het beschermen van mensen tegen AI, maar ook steeds serieuzer nadenken over de omgang van mensen met AI-systemen zelf. Tegelijk verstevigt het bedrijf de bescherming tegen misbruik van Claude voor surveillance, verkiezingsmanipulatie en wapens, wat de grens tussen nuttige en schadelijke toepassingen van taalmodellen scherper trekt.

Modelwelzijn
Onderzoeksveld dat kijkt of AI-modellen baat kunnen hebben bij bepaalde vormen van bescherming, zoals het kunnen beëindigen van schadelijke gesprekken.
AI-guardrails
De regels en technische maatregelen die moeten voorkomen dat een AI-systeem schadelijke of ongewenste output geeft.
AI-veiligheidsonderzoek
Wetenschappelijk onderzoek naar hoe je voorkomt dat AI-systemen ontsporen of schade veroorzaken.
Gespreksbeëindiging
Het automatisch stopzetten van een gesprek door een AI-model, bijvoorbeeld wanneer een gebruiker structureel vijandig of misbruikend gedrag vertoont.
Surveillancetechnologie
Technologie die wordt gebruikt om mensen te volgen, te identificeren of in de gaten te houden, vaak met camera's, data of AI-analyse.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media