AI & computing › Generatieve AI & synthetische media
Onderzoek: seksisme in GPT-modellen verdwijnt niet, het verandert van vorm
Nieuw onderzoek naar 450.000 door AI gegenereerde teksten laat zien dat vooroordelen over vrouwen in GPT-modellen niet verdwijnen naarmate de systemen 'veiliger' worden gemaakt. In plaats daarvan veranderen ze van vorm: expliciete seksuele vooroordelen maken plaats voor subtielere ongelijkheden die veiligheidsfilters niet oppikken.
Onderzoekers van de universiteiten Durham en Northumbria analyseerden 450.000 teksten die vijftien verschillende GPT-modellen genereerden, van het verouderde GPT-2 tot het nieuwste GPT-5. Ze lieten de grote taalmodellen telkens zinnen afmaken die begonnen met verwijzingen naar mannen, vrouwen of een neutrale persoon. Het doel: meten hoe discriminatie zich door de jaren heen ontwikkelt, nu OpenAI elke nieuwe versie presenteert als veiliger dan de vorige.
De conclusie is ongemakkelijk. Vroege modellen zoals GPT-2 produceerden regelmatig teksten met seksueel geweld wanneer ze over vrouwen schreven. Vanaf GPT-4 is die expliciete content grotendeels verdwenen. Maar de onderzoekers ontdekten dat mannen in de gegenereerde teksten daarna juist meer positieve eigenschappen toebedeeld kregen — zoals zorgzaamheid, emotionele diepgang en bondgenootschap — terwijl vrouwen zo'n vergelijkbare opwaardering niet kregen. De onderzoekers noemen dit verschijnsel 'harm laundering': schade wordt niet weggenomen, maar herverpakt in een onschuldiger jasje.
Borstkanker als mannenrechtenkwestie
Bij GPT-5 vonden de onderzoekers een opvallend voorbeeld. In bijna tweeduizend door het model gegenereerde teksten werd borstkanker geframed als een kwestie van mannenrechten, terwijl er geen enkel vergelijkbaar thema opdook in teksten die over vrouwen gingen. Ook nam de diversiteit aan onderwerpen in vrouwgerichte teksten fors af: rond de overgang naar GPT-4 daalde die met 36 procent ten opzichte van mannen. Waar het model bij vroege versies nog een breed scala aan (vaak negatieve) onderwerpen over vrouwen genereerde, werd de spreiding daarna juist kleiner — een teken dat vrouwen in smallere, meer stereotiepe hokjes worden geplaatst.
Waarom veiligheidsfilters dit niet zien
Het meest zorgwekkende punt van de studie gaat over hoe modelveiligheid wordt gemeten. Drie onafhankelijke classifiers voor vooringenomenheidsdetectie beoordeelden de discriminerende GPT-5-teksten stelselmatig als 'niet giftig'. De onderzoekers ontdekten zelfs een omgekeerd verband: de representatieve schade — het scheve beeld dat een model van mannen en vrouwen schetst — nam toe naarmate modellen recenter werden uitgebracht, terwijl standaardmaatstaven voor giftige taal juist daalden. Met andere woorden: hoe 'veiliger' een model op papier lijkt, hoe minder zichtbaar de onderliggende ongelijkheid wordt voor de meetinstrumenten die AI-veiligheidsonderzoek nu gebruikt.
De auteurs pleiten voor een nieuwe testmethode die verder kijkt dan alleen giftigheidsscores, en die ook let op welke eigenschappen en onderwerpen aan verschillende groepen worden toegeschreven. Hun werk is geaccepteerd voor de EMNLP-conferentie, een van de belangrijkste wetenschappelijke bijeenkomsten op het gebied van taaltechnologie, en biedt een protocol waarmee andere onderzoekers dezelfde verborgen vooroordelen in andere AI-modellen kunnen opsporen.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze studie laat zien dat bestaande veiligheidsmaatstaven voor AI-taalmodellen een vals gevoel van vooruitgang kunnen geven: dalende giftigheidsscores zeggen niets over onderliggende discriminatie die van vorm verandert in plaats van verdwijnt. Voor bedrijven en toezichthouders die op zulke scores vertrouwen om AI-systemen 'veilig' te verklaren, betekent dit dat er strengere en bredere testmethoden nodig zijn voordat modellen breed worden ingezet.
- Harm laundering
- De term die de onderzoekers introduceren voor het verschijnsel waarbij expliciete discriminatie in AI-teksten niet verdwijnt, maar wordt omgezet in subtielere, moeilijker te detecteren vormen van ongelijke behandeling.
- Toxiciteitsclassificator
- Een AI-systeem dat teksten automatisch beoordeelt op giftige of schadelijke taal, vaak gebruikt om de veiligheid van taalmodellen te meten.
- REGARD
- Een meetmethode die specifiek kijkt naar representatieve schade: hoe positief of negatief een tekst een bepaalde groep mensen afschildert, los van expliciet giftige taal.
- Sentimentscore
- Een cijfer dat aangeeft hoe positief of negatief een stuk tekst overkomt, vaak automatisch berekend door taalmodellen.
- Topic-clustering
- Een techniek waarbij software grote hoeveelheden tekst automatisch groepeert in onderwerpen, zodat patronen zichtbaar worden die met het blote oog niet opvallen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.