AI & computing › Generatieve AI & synthetische media
Vrouw schrijft dreigement in AI-dagboek, Anthropic waarschuwt politie
Een vrouw uit Florida gebruikte de chatbot Claude als persoonlijk dagboek en schreef daarin dat ze een aanslag op een politiebureau overwoog. Het veiligheidssysteem van ontwikkelaar Anthropic pikte de tekst op, een menselijke beoordelaar nam het serieus en schakelde de politie in. De vrouw staat nu terecht voor een ernstig misdrijf.
Carli Michelle Heller uit Bonita Springs typte op 26 september een bericht in Claude, de chatbot van het Amerikaanse bedrijf Anthropic. Ze gebruikte de dienst al langer als een soort digitaal dagboek, schreef ze later aan agenten. In die tekst kondigde ze aan dat ze het kantoor van de plaatselijke sheriff onder vuur wilde nemen. Dat bleef niet onopgemerkt: de ai-guardrails van Claude, de ingebouwde veiligheidsfilters die het systeem controleren op gevaarlijke inhoud, markeerden het bericht automatisch.
Van chatbot naar politiebureau
Na die melding greep een medewerker van Anthropic in. Bij dit soort gevallen van contentmoderatie beoordeelt eerst een geautomatiseerd systeem of een gesprek risicovol is, waarna een mens de uiteindelijke beslissing neemt. Dit proces, waarbij een persoon als laatste check boven op de techniek staat, heet ook wel human-in-the-loop. De beoordelaar van Anthropic schatte de dreiging als geloofwaardig in en besloot de politie te waarschuwen. Agenten van de Lee County Sheriff's Office spoorden Heller op en hielden haar zonder incidenten aan. Een rechercheur van de inlichtingenafdeling nam de zaak daarna over. Heller wordt vervolgd onder de Florida Statute 836.10, die het versturen van een schriftelijke of digitale dreiging met dodelijk geweld, een schietpartij of terrorisme bestempelt als een misdrijf van de tweede graad. Anthropic laat weten dat het in uitzonderlijke noodsituaties gegevens van gebruikers kan delen als het bedrijf denkt dat daarmee een dodelijk of zwaar gewond slachtoffer kan worden voorkomen.
Niet de eerste keer dat AI een rol speelt bij dreigingen
Het incident staat niet op zichzelf. Zo wordt OpenAI, de maker van ChatGPT, momenteel aangeklaagd door de Canadese provincie British Columbia, die stelt dat het bedrijf een schietpartij had kunnen voorkomen. De schutter in die zaak, een achttienjarige oud-leerling, was eerder al opgevallen bij OpenAI's veiligheidsteam vanwege gesprekken over wapengeweld, maar het bedrijf schakelde destijds geen politie in omdat de gesprekken niet aan de juridische drempel voor een melding voldeden. Ook de staat Florida klaagde OpenAI eerder dit jaar aan, naar aanleiding van een schietpartij op Florida State University. Dergelijke zaken raken aan de vraag naar ai-aansprakelijkheid: wie is verantwoordelijk als een chatbot signalen van geweld niet doorgeeft, of juist wel? Het voorval laat ook zien dat gesprekken met een chatbot nooit volledig privé zijn. Eerder bleek al dat menselijke contractmedewerkers die de beeldbewerkingstool van Microsoft Copilot controleren, inzage hebben in de prompts, geüploade foto's en AI-bewerkingen van gebruikers, soms met seksueel getinte of verontrustende inhoud. Voor gebruikers van AI-chatbots betekent dit vooral dat voorzichtigheid geboden is: wat je aan een chatbot toevertrouwt, kan in bepaalde gevallen alsnog bij instanties terechtkomen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit incident toont dat AI-bedrijven steeds vaker een actieve rol spelen in de openbare veiligheid, door gesprekken te monitoren en in uitzonderlijke gevallen door te geven aan autoriteiten. Dat roept vragen op over privacy en verantwoordelijkheid: hoe ver mag een chatbot gaan in het beoordelen van menselijk gedrag, en wie controleert die beoordelaars? Naarmate meer mensen AI-chatbots als dagboek of vertrouwenspersoon gebruiken, zal de discussie over de grens tussen veiligheid en privacy alleen toenemen.
- AI-guardrails
- Ingebouwde veiligheidsfilters in een AI-systeem die gevaarlijke, illegale of schadelijke inhoud proberen te herkennen en tegen te houden.
- Contentmoderatie
- Het proces waarbij berichten, afbeeldingen of ander materiaal op een platform worden gecontroleerd en zo nodig geblokkeerd of doorgestuurd naar een mens voor beoordeling.
- Human-in-the-loop
- Een werkwijze waarbij een mens de uiteindelijke beslissing neemt nadat een geautomatiseerd systeem een situatie heeft beoordeeld, als extra controle op de techniek.
- AI-aansprakelijkheid
- De juridische en maatschappelijke vraag wie verantwoordelijk is wanneer een AI-systeem schade veroorzaakt of niet op tijd ingrijpt bij een risicovolle situatie.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.