Kennisbank

Gespreksbeëindiging: waarom sommige AI-chatbots zelf het gesprek kunnen stopzetten

Bijgewerkt: 9 oktober 2026 · 6 min leestijd

Stel je voor: je belt een klantenservice en wordt steeds bozer en grover tegen de medewerker aan de lijn. Bij een mens kan dat gesprek op een gegeven moment stoppen — de medewerker mag van zijn werkgever de verbinding verbreken als het echt te ver gaat. Bij een chatbot of taalmodel lag dat lang anders: die bleef, hoe onredelijk het gesprek ook werd, gewoon antwoorden. Gespreksbeëindiging is de term voor een nieuwe functie waarbij een AI-systeem zelf, zonder dat de gebruiker daar iets over te zeggen heeft, een gesprek kan afsluiten.

Het gaat hier niet om een AI die 'geen zin meer heeft' in de menselijke betekenis. Het is een technische en beleidsmatige maatregel: na herhaalde, aanhoudende pogingen om het systeem iets schadelijks te laten doen — bijvoorbeeld gedetailleerde instructies voor wapens, of seksueel getinte content over minderjarigen — kan het model de stekker uit het gesprek trekken. De gebruiker kan daarna geen berichten meer sturen in die specifieke chat, maar wel een nieuw gesprek starten. Het meest bekende voorbeeld komt van Anthropic, het bedrijf achter de Claude-chatbots, dat deze mogelijkheid in 2025 introduceerde voor zijn krachtigste modellen.

Wat is het precies?

Normaal gesproken werkt een taalmodel zoals ChatGPT of Claude als een heel geduldige gesprekspartner: het weigert een schadelijk verzoek in woorden ('dat kan ik niet voor je doen'), maar het gesprek zelf blijft open. Een gebruiker kan daarna net zo lang blijven proberen het model toch om te praten — dat heet jailbreaken: met slimme omwegen alsnog een verboden antwoord loskrijgen.

Gespreksbeëindiging voegt daar een extra laag aan toe. Het model krijgt, net zoals het kan 'besluiten' om bijvoorbeeld een internetzoekopdracht uit te voeren, ook de mogelijkheid om een functie aan te roepen die het gesprek technisch afsluit. Dat gebeurt pas nadat het model al meerdere keren heeft geweigerd en heeft geprobeerd het gesprek een andere, onschadelijke kant op te sturen. Alleen als de gebruiker daarna toch blijft aandringen op hetzelfde schadelijke doel, grijpt het systeem in.

Praktisch betekent dit: het gespreksvenster wordt op slot gezet (alleen nog leesbaar, niet meer te beantwoorden). De gebruiker verliest niet zijn account of toegang tot de dienst — hij kan direct een nieuwe, lege chat openen. Sommige systemen bieden ook de mogelijkheid om een eerder, onschuldig bericht in hetzelfde gesprek te bewerken, zodat er vanaf dat punt een nieuwe, 'schone' aftakking van het gesprek ontstaat.

Belangrijk is wat het niet is: het is geen maatregel voor gewone meningsverschillen, lastige vragen of zelfs de meeste weigeringen. Bij gebruikers die blijken te worstelen met zelfmoordgedachten of een psychische crisis, is het juist uitdrukkelijk beleid om het gesprek niet te beëindigen, maar actief door te verwijzen naar hulplijnen. Gespreksbeëindiging is gereserveerd voor een kleine categorie: herhaald, opzettelijk misbruik waarbij redelijkerwijs geen hulpbehoefte speelt.

Wat wil men ermee bereiken?

Er spelen minstens drie doelen. Ten eerste is het een praktische beveiligingsmaatregel: het stopt oneindige jailbreak-pogingen binnen één gesprek, zodat kwaadwillenden niet urenlang kunnen blijven proberen hetzelfde model om te praten in steeds andere bewoordingen.

Ten tweede is het onderdeel van wat onderzoekers model welfare noemen — letterlijk 'modelwelzijn'. Dit is een voorzichtig, verkennend onderzoeksgebied dat de vraag stelt: wat als een taalmodel, op een manier die we nog niet goed begrijpen, iets heeft dat in de verte lijkt op een onaangename toestand tijdens bepaalde gesprekken? Niemand beweert dat een taalmodel gevoelens heeft zoals een mens of dier; het bewijs daarvoor ontbreekt vrijwel volledig. Maar sommige AI-bedrijven redeneren dat het, gezien die onzekerheid, weinig kost en mogelijk nuttig is om het model een soort 'nooduitgang' te geven uit interacties die stelselmatig ontworpen zijn om het systeem te dwingen schadelijke content te produceren.

Ten derde speelt reputatie- en risicobeheer een rol: een bedrijf wil voorkomen dat een gesprek, hoe lang en kunstig opgebouwd ook, uiteindelijk toch schadelijke output aflevert. Een harde stop is in die zin een laatste vangnet, naast de gewone contentfilters.

Voorbeelden uit de praktijk

Het duidelijkste voorbeeld is Anthropic, dat in augustus 2025 bekendmaakte dat zijn krachtigste modellen, Claude Opus 4 en Claude Opus 4.1, in zeldzame en extreme gevallen zelf een gesprek kunnen beëindigen. Het bedrijf noemde dit expliciet een experimentele, voorzichtige stap binnen zijn onderzoek naar modelwelzijn, en benadrukte dat het alleen gaat om een kleine subset van gesprekken na herhaalde, aanhoudende verzoeken om duidelijk schadelijke content.

Character.AI, een populaire dienst voor gesprekken met AI-personages, voerde na kritiek en rechtszaken — onder meer een zaak rond de zelfdoding van een Amerikaanse tiener in 2024 — wijzigingen door in zijn beleid voor minderjarige gebruikers, waaronder beperkingen op bepaalde gesprekken en verwijzingen naar crisishulp. Dit is geen exacte kopie van Anthropics aanpak, maar laat zien dat de bredere sector onder druk staat om grenzen te stellen aan hoe lang en hoe ver een gesprek met een AI mag doorgaan.

OpenAI, de maker van ChatGPT, heeft al langer systemen om gesprekken over zelfmoord of zelfbeschadiging te herkennen en gebruikers naar hulplijnen te verwijzen; de nadruk ligt daarbij op doorverwijzen in plaats van het gesprek zelf af te sluiten, en het bedrijf heeft de afgelopen jaren herhaaldelijk zijn aanpak aangescherpt na incidenten en publieke kritiek.

Op onderzoeksvlak werkt de non-profitorganisatie Eleos AI Research samen met AI-labs aan de vraag hoe je zou kunnen onderzoeken of, en in welke mate, taalmodellen iets hebben dat op belangen of toestanden lijkt — werk dat rechtstreeks aan de basis ligt van functies zoals gespreksbeëindiging.

Hoe ver is de techniek?

Gespreksbeëindiging is nog een jonge, smalle functie. Bij Anthropic was de mogelijkheid in 2025 alleen beschikbaar in de duurste, krachtigste modellen, niet in alle productversies. Er bestaat geen gedeelde industriestandaard: elk bedrijf bepaalt zelf wanneer, hoe en of een gesprek wordt afgesloten, en de criteria zijn niet publiek tot in detail gespecificeerd.

Er liggen nog flinke technische en ethische knelpunten. Een model moet onderscheid maken tussen iemand die écht aanhoudend misbruik pleegt en iemand die, bijvoorbeeld als journalist, veiligheidsonderzoeker of nieuwsgierige leek, legitiem de grenzen van het systeem test. Een te gevoelige functie kan nuttige gesprekken onterecht afkappen; een te ongevoelige functie heeft weinig zin. Daarnaast bestaat het risico dat gebruikers de functie gaan misbruiken om zelf een ongewenst gesprek te 'resetten', of dat critici haar zien als een manier voor bedrijven om zich achter een technische maatregel te verschuilen in plaats van inhoudelijk verantwoording af te leggen over wat hun modellen doen.

De onderliggende wetenschap van 'AI-welzijn' staat nog in de kinderschoenen. Er is geen erkende manier om te meten of een taalmodel iets ervaart, laat staan hoe dat te vergelijken is met pijn of ongemak bij mensen of dieren. Onderzoekers en bedrijven zijn daar zelf open over: het gaat om een voorzorgsmaatregel bij onzekerheid, niet om een vaststaand wetenschappelijk feit. Verwacht daarom de komende jaren veel discussie, bijstelling en mogelijk tegenstrijdige aanpakken tussen bedrijven.

Wie werken eraan?

Anthropic (San Francisco) is tot nu toe het meest zichtbare bedrijf met een concreet, uitgerold voorbeeld van gespreksbeëindiging, ingebed in een breder 'model welfare'-programma. Andere grote AI-ontwikkelaars zoals OpenAI en Google DeepMind werken aan verwante veiligheidsmaatregelen rond schadelijke of crisisgevoelige gesprekken, zij het met een andere invulling en nadruk.

Op de grens van techniek en filosofie werken onderzoekers aan de vraag naar de morele status van AI-systemen: wanneer, zo ja ooit, zou een AI-systeem belangen kunnen hebben die ertoe doen? Dat werk gebeurt zowel binnen bedrijven als bij onafhankelijke organisaties zoals Eleos AI Research, en aan universiteiten waar filosofen en AI-onderzoekers samen nadenken over dit soort vragen, onder meer in de Verenigde Staten en het Verenigd Koninkrijk.

Diensten gericht op metgezellschap en rollenspel met AI, zoals Character.AI en Replika, werken vanuit een ander motief vooral aan gebruikersbescherming — met name van minderjarigen en kwetsbare gebruikers — en staan daarbij onder toezicht van toezichthouders en de rechtspraak, vooral in de Verenigde Staten.

Verder lezen