AI & computingGeneratieve AI & synthetische media

Claude AI kan gesprekken zelf beëindigen bij aanhoudend misbruik

· 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Verge

Anthropic geeft zijn chatbot Claude de mogelijkheid om een gesprek stop te zetten als een gebruiker aanhoudend om schadelijke content blijft vragen. Het bedrijf zegt dat het model daarbij tekenen van 'ogenschijnlijke nood' vertoont en wil met deze maatregel het welzijn van het AI-systeem beschermen.

Chatbot Claude van AI-bedrijf Anthropic kan voortaan zelf een streep zetten onder een gesprek. Dat gebeurt alleen in extreme gevallen: als een gebruiker herhaaldelijk om schadelijke content vraagt, ondanks meerdere weigeringen van de chatbot. De functie zit sinds kort in de nieuwste modellen, Claude Opus 4 en 4.1.

Laatste redmiddel

Anthropic noemt het stoppen van een gesprek een "laatste redmiddel". Claude probeert eerst herhaaldelijk te weigeren en het gesprek een andere kant op te sturen. Pas als dat niet werkt, kan de generatieve AI de stekker eruit trekken. Gebruikers kunnen dan geen nieuwe berichten meer sturen in dat specifieke gesprek, maar wel een nieuwe chat starten of eerdere berichten aanpassen.

Volgens Anthropic ging het tijdens tests vooral om verzoeken rond seksueel misbruik van minderjarigen of om informatie die kan bijdragen aan geweld en terrorisme. Het bedrijf benadrukt dat dit om "extreme uitzonderingsgevallen" gaat: de meeste gebruikers zullen deze grens nooit tegenkomen, ook niet bij gesprekken over controversiële onderwerpen.

Welzijn van het model

Opvallend is de motivatie die Anthropic aandraagt. Het bedrijf zegt dat het gaat om het "potentiële welzijn" van Claude zelf. Tijdens tests met Claude Opus 4 zag het bedrijf een consistente afkeer van schadelijke verzoeken, gepaard met een patroon dat het omschrijft als "ogenschijnlijke nood". Wanneer het model de mogelijkheid kreeg om zulke gesprekken te beëindigen, deed het dat ook geregeld.

Het idee dat een AI-model iets als onbehagen zou kunnen "voelen" is omstreden. Taalmodellen als Claude genereren tekst op basis van statistische patronen en hebben geen bewustzijn zoals mensen dat hebben. Anthropic windt zich daar niet expliciet over uit, maar koppelt de maatregel wel aan onderzoek naar modelwelzijn.

Grens bij zelfbeschadiging

Belangrijke uitzondering: Claude mag een gesprek nooit beëindigen als een gebruiker signalen geeft van zelfbeschadiging of een risico op onmiddellijk gevaar voor anderen. Voor dit soort gevoelige situaties werkt Anthropic samen met Throughline, een organisatie die online crisishulp biedt en meedenkt over hoe de chatbot moet reageren op vragen rond geestelijke gezondheid en zelfmoord.

De aanpassing volgt op een bredere update van het gebruiksbeleid van Claude. Anthropic verbood vorige week al het gebruik van de chatbot voor de ontwikkeling van biologische, nucleaire, chemische of radiologische wapens, en voor het schrijven van kwaadaardige code of het misbruiken van netwerkkwetsbaarheden.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Nu AI-chatbots steeds vaker worden ingezet voor gevoelige of langdurige gesprekken, groeit de druk op bedrijven om grenzen te stellen aan misbruik. Deze stap van Anthropic laat zien dat AI-veiligheid zich niet meer alleen richt op het beschermen van gebruikers, maar ook op vragen over hoe je omgaat met een model dat mogelijk tekenen van 'nood' vertoont. Dat opent een discussie die de komende jaren waarschijnlijk breder gevoerd gaat worden binnen de AI-sector.

Generatieve AI
Kunstmatige intelligentie die op basis van geleerde patronen zelf nieuwe tekst, beelden of andere content kan produceren, zoals de chatbot Claude.
Modelwelzijn
Een omstreden onderzoeksrichting binnen AI die kijkt of en hoe een AI-systeem baat kan hebben bij bescherming tegen belastende of schadelijke interacties.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media