Toxiciteitsclassificator: hoe algoritmes online giftige taal proberen te herkennen
Stel je een gigantische redactie voor die dag en nacht elke reactie op elk nieuwsartikel, elke tweet en elke forumpost zou moeten lezen om te bepalen of iemand beledigend, dreigend of vernederend is. Geen mens kan dat werk aan bij de huidige hoeveelheden online tekst. Een toxiciteitsclassificator is een computerprogramma dat dit werk overneemt: het is een AI-model dat een stukje tekst inschat op een schaal van 'onschuldig' tot 'giftig' (toxic), gebaseerd op patronen die het heeft geleerd uit miljoenen eerdere voorbeelden.
Denk aan zo'n classificator als een zeer snelle, maar niet altijd even wijze stagiair. Geef je een zin als "jij bent een idioot" of "ga toch dood", dan herkent het model die vrijwel altijd als toxisch. Maar bij sarcasme, ironie, of scheldwoorden die mensen onderling als grapje gebruiken, gaat het weleens mis. De techniek wordt inmiddels op grote schaal ingezet door nieuwssites, sociale platforms en gamebedrijven om reacties te filteren voordat een moderator er ooit naar hoeft te kijken.
Wat is het precies?
Een toxiciteitsclassificator is een toepassing van natural language processing (NLP), het vakgebied binnen kunstmatige intelligentie dat zich bezighoudt met het automatisch verwerken van menselijke taal. Het proces verloopt in een paar stappen.
Eerst wordt de tekst omgezet in getallen. Computers kunnen namelijk niet rechtstreeks met woorden rekenen; woorden worden daarom vertaald naar zogeheten embeddings, lange rijen getallen die de betekenis en context van een woord representeren. Woorden met een vergelijkbare betekenis krijgen getalreeksen die dicht bij elkaar liggen.
Vervolgens verwerkt een taalmodel die getallen. De meeste moderne classificatoren zijn gebaseerd op de zogeheten transformer-architectuur, dezelfde onderliggende technologie als achter ChatGPT. Bekende voorbeelden van zulke modellen zijn BERT en RoBERTa, ontwikkeld door Google en Meta. Deze modellen zijn eerst getraind op enorme hoeveelheden algemene tekst, zodat ze grammatica en betekenis begrijpen.
Daarna volgt fine-tuning: het model krijgt duizenden tot miljoenen voorbeeldzinnen te zien die door mensen zijn beoordeeld als 'toxisch' of 'niet toxisch' (soms met fijnmazigere categorieën zoals bedreiging, seksueel getinte inhoud of identiteitsgerelateerde haat). Het model leert de statistische patronen die samenhangen met die menselijke oordelen. Het resultaat is geen wet, maar een kansscore: bijvoorbeeld "87% kans dat deze reactie als toxisch ervaren wordt".
Belangrijk om te beseffen: het model 'begrijpt' de tekst niet zoals een mens dat doet. Het herkent statistische patronen in taalgebruik die vaak samenhangen met toxiciteit, maar het heeft geen besef van intentie, context buiten de zin, of culturele nuance.
Wat wil men ermee bereiken?
De belangrijkste drijfveer is schaal. Grote platforms ontvangen dagelijks miljoenen reacties; menselijke moderatie alleen is te traag en te kostbaar om dat bij te benen. Een classificator kan binnen milliseconden een eerste selectie maken: duidelijk giftige berichten meteen blokkeren of verbergen, twijfelgevallen doorsturen naar een mens, en onschuldige berichten meteen doorlaten.
Een tweede doel is het beschermen van het gesprek zelf. Onderzoek naar online discussieplatforms laat consistent zien dat vroege, grove reacties andere gebruikers afschrikken en de kwaliteit van het gesprek verlagen — een fenomeen dat soms 'the nasty effect' wordt genoemd. Door de ergste reacties eruit te filteren, hopen platforms een constructiever klimaat te behouden.
Een derde motief is juridisch en commercieel. In de Europese Unie verplicht de Digital Services Act (DSA) grote platforms om illegale en schadelijke content sneller aan te pakken. Adverteerders willen bovendien niet dat hun merk naast haatdragende content verschijnt (brand safety). Classificatoren helpen platforms om aan die eisen te voldoen zonder elk bericht handmatig te controleren.
Voorbeelden uit de praktijk
Perspective API (Google Jigsaw, sinds 2017) is wellicht de bekendste toxiciteitsclassificator. Jigsaw, de technologie-incubator van Google, ontwikkelde de tool in samenwerking met de Wikimedia Foundation als onderdeel van het zogeheten 'Wikipedia Detox'-project, dat onderzocht hoe agressieve reacties het aantal actieve Wikipedia-redacteuren beïnvloedde. Perspective API wordt sindsdien gratis aangeboden aan nieuwsredacties en discussieplatforms om reacties te scoren op toxiciteit.
De Kaggle 'Toxic Comment Classification Challenge' (2018), georganiseerd door Jigsaw's onderzoeksgroep Conversation AI, daagde duizenden data-analisten wereldwijd uit om betere classificatiemodellen te bouwen op basis van een dataset van Wikipedia-overlegpagina's. Deze wedstrijd versnelde de ontwikkeling van open-source detectiemodellen aanzienlijk en de dataset wordt tot op heden gebruikt als standaard-benchmark in onderzoek.
Detoxify (Unitary AI, 2020) is een open-source bibliotheek gebouwd op BERT- en RoBERTa-modellen, vrij beschikbaar op GitHub. Het werd getraind op onder meer de Jigsaw-datasets en wordt door ontwikkelaars en onderzoekers gebruikt als laagdrempelig startpunt om toxiciteitsdetectie in eigen toepassingen in te bouwen.
OpenAI Moderation API is een classificatiedienst die OpenAI aanbiedt naast zijn taalmodellen. Het beoordeelt tekst (en inmiddels ook afbeeldingen) op categorieën als haat, geweld, seksuele inhoud en zelfbeschadiging, en wordt onder meer gebruikt om input en output van ChatGPT te controleren op schadelijke content.
HateBERT, ontwikkeld door onderzoekers van de Universiteit Bocconi (Caselli e.a.), is een academisch model dat specifiek is na-getraind op teksten uit Reddit-community's die vanwege haatzaaiende inhoud zijn verwijderd. Het dient als onderzoeksbasis voor verdere studies naar haatspraakdetectie.
Hoe ver is de techniek?
Toxiciteitsclassificatoren zijn inmiddels volwassen genoeg om op grote schaal te draaien: platforms als YouTube, Reddit en diverse nieuwssites gebruiken ze dagelijks als eerste filter. Voor evident grove taal — expliciete scheldwoorden, directe bedreigingen — is de nauwkeurigheid hoog.
De grootste hindernis blijft context. Sarcasme, ironie, en woorden die door een gemeenschap zijn 'heroverd' (reclaimed slurs) worden vaak verkeerd geclassificeerd. Een bekend en veelgeciteerd probleem is bias: onderzoek van onder meer Sap en collega's (2019) toonde aan dat classificatoren tekst in African American Vernacular English (AAVE) systematisch vaker als toxisch bestempelden dan vergelijkbare tekst in standaard-Engels, simpelweg omdat de trainingsdata die associatie bevatte. Dit soort scheve resultaten wordt actief onderzocht, maar is nog niet opgelost.
Een ander obstakel is meertaligheid: voor het Engels bestaan de grootste en best gelabelde datasets, waardoor classificatoren voor het Nederlands en andere kleinere talen doorgaans minder nauwkeurig zijn. Ook evolueert taal snel — nieuwe scheldwoorden, memes en codewoorden ontstaan sneller dan modellen bijgewerkt kunnen worden, wat leidt tot een voortdurende kat-en-muisspel tussen gebruikers die filters proberen te omzeilen en ontwikkelaars die modellen bijwerken.
Er is geen wetenschappelijke consensus over wanneer classificatoren 'goed genoeg' zijn; de acceptabele foutmarge hangt sterk af van de toepassing. Voor het voorsorteren van commentaar op een nieuwssite is 90% nauwkeurigheid bruikbaar; voor het automatisch verwijderen van berichten zonder menselijke controle ligt de lat veel hoger, en de meeste platforms houden daarom een mens in de lus bij twijfelgevallen.
Wie werken eraan?
Google Jigsaw (Verenigde Staten) is met Perspective API een van de meest gebruikte publieke aanbieders. OpenAI integreert moderatietechnologie in zijn eigen productlijn. Meta (Facebook, Instagram) en Reddit ontwikkelen intern classificatiemodellen voor contentmoderatie op hun platforms, hoewel de exacte werking daarvan doorgaans niet openbaar wordt gemaakt.
Unitary AI, een Brits AI-bedrijf, is verantwoordelijk voor het open-source Detoxify-project. Op academisch vlak dragen onderzoeksgroepen aan universiteiten bij, waaronder de Universiteit Bocconi (HateBERT) en diverse onderzoekers verbonden aan de Association for Computational Linguistics (ACL), het belangrijkste internationale wetenschappelijke genootschap voor taaltechnologie, dat jaarlijks tientallen studies over haatspraak- en toxiciteitsdetectie publiceert.
Op beleidsniveau speelt de Europese Unie een sturende rol via de Digital Services Act, die platforms verplicht transparanter te zijn over hun moderatiesystemen — wat indirect ook onderzoek naar en toepassing van toxiciteitsclassificatoren stimuleert.