AI & computingGeneratieve AI & synthetische media

Onderzoek: ruim derde van nieuwe webpagina's sinds ChatGPT door AI geschreven

· Bijgewerkt 20 augustus 2026, 20:43 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: TechCrunch

Sinds de lancering van ChatGPT vertoont ruim een derde van alle nieuwe Engelstalige webpagina's tekenen van AI-auteurschap, blijkt uit onderzoek van Pew Research. Steeds meer content op internet wordt dus geschreven door machines in plaats van mensen, en veel daarvan wordt ook weer door bots gelezen in plaats van door mensen.

Pew Research publiceerde donderdag een studie waaruit blijkt dat 35 procent van de webpagina's die na de release van ChatGPT zijn gepubliceerd, tekenen van AI-auteurschap vertoont. Het onderzoek bevestigt eerdere signalen dat een groeiend deel van het internet niet meer door mensen, maar door generatieve AI wordt geschreven of zwaar bewerkt. De publicatie komt kort nadat internetbedrijf Cloudflare meldde dat bot-webverkeer het menselijke webverkeer inmiddels heeft overtroffen, eerder dan het bedrijf zelf had verwacht. Waar Cloudflare vooral keek naar wie er surft, richt Pew zich op wat er gelezen wordt. De uitkomst: veel van dat webverkeer bestaat inmiddels uit bots die pagina's lezen die door andere bots zijn geschreven.

Hoe het onderzoek werkte

Voor de studie doorzocht Pew het Common Crawl-webarchief, een publiek toegankelijk webarchief dat al jaren miljoenen webpagina's verzamelt. Onderzoekers haalden er bijna een half miljoen Engelstalige pagina's uit, verspreid over de afgelopen vijf jaar, van ruim voor tot ruim na de lancering van ChatGPT in november 2022. Met detectietechnologie van het bedrijf Open Pangram, een AI-tekstdetector, beoordeelden ze per pagina hoe waarschijnlijk het is dat de tekst door AI is geschreven of substantieel bewerkt. In een willekeurige steekproef van 10.000 pagina's uit juli 2026 gaf ongeveer 10 procent significante signalen van AI-auteurschap. Maar zo'n steekproef bevat ook veel oudere pagina's van vóór het bestaan van AI-schrijftools, die dus onmogelijk door AI gemaakt konden zijn. Filterden de onderzoekers die oudere pagina's eruit en keken ze alleen naar content gepubliceerd na de ChatGPT-lancering, dan liep het aandeel op tot 35 procent.

Grote verschillen tussen soorten websites

Pew vond ook grote verschillen tussen typen websites. Op .com-domeinen kwam AI-geschreven tekst ongeveer tien keer zo vaak voor als op .edu- en .gov-domeinen, die beide rond de 1 procent bleven steken. Non-profitdomeinen met de extensie .org zaten daar met 4,6 procent tussenin. Dat wijst erop dat commerciële sites, die vaak op zoekverkeer en advertentie-inkomsten draaien, sneller AI inzetten om grote hoeveelheden content te produceren dan overheids- en onderwijsinstellingen. De onderzoekers benadrukken wel dat de meting niet waterdicht is: detectietools zoals die van Pangram kunnen pagina's onterecht als AI-geschreven bestempelen. Op grote schaal is de uitkomst volgens Pew echter waarschijnlijk wel richtinggevend correct. Als extra aanwijzing keek Pew naar stijlkenmerken die vaak met large language models worden geassocieerd, zoals opvallend veel gedachtestreepjes, Oxford-komma's en zinsconstructies als "het is niet X, het is Y". Ook die kenmerken kwamen de afgelopen jaren steeds vaker voor op het web.

Risico van een zichzelf voedende cyclus

De groei van AI-geschreven content roept een lastige vraag op voor de AI-industrie zelf. Nieuwe taalmodellen worden getraind op enorme hoeveelheden tekst van het open internet. Als een steeds groter deel van die trainingsdata zelf al door AI is gegenereerd, kunnen fouten en eigenaardigheden zich opstapelen in opeenvolgende modelgeneraties. Onderzoekers noemen dit risico modelcollaps: de geleidelijke kwaliteitsafname die kan ontstaan wanneer AI-systemen steeds meer leren van andermans AI-output in plaats van van oorspronkelijk menselijk werk. Gecombineerd met de groeiende hoeveelheid botverkeer, waarbij geautomatiseerde systemen elkaars pagina's afstruinen en verwerken zonder dat er ooit een mens naar kijkt, ontstaat zo een steeds groter deel van het web dat volledig buiten menselijke waarneming om functioneert.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Nu een groeiend deel van het internet door AI wordt geschreven én gelezen, wordt het voor gebruikers en zoekmachines lastiger om betrouwbare, door mensen gecontroleerde informatie te onderscheiden van massaal geproduceerde AI-content. Voor AI-bedrijven zelf ontstaat bovendien het risico dat toekomstige modellen trainen op de output van eerdere modellen, wat de kwaliteit van nieuwe AI-systemen op termijn kan aantasten.

AI-tekstdetector
Software die met taalkundige patronen inschat of een tekst door een mens of door kunstmatige intelligentie is geschreven.
Large language model
Een groot taalmodel, de technologie achter chatbots zoals ChatGPT, getraind op enorme hoeveelheden tekst om mensachtige taal te produceren.
Generatieve AI
Kunstmatige intelligentie die zelfstandig nieuwe tekst, beeld of ander materiaal kan produceren op basis van een instructie.
Trainingsdata
De verzameling teksten en voorbeelden waarmee een AI-model wordt getraind om patronen in taal te herkennen en na te bootsen.
Webarchief
Een doorzoekbare, publieke verzameling van gearchiveerde momentopnames van webpagina's, zoals het Common Crawl-archief dat Pew gebruikte.
Modelcollaps
De geleidelijke kwaliteitsafname van AI-modellen die ontstaat wanneer ze steeds meer worden getraind op door AI gegenereerde content in plaats van oorspronkelijk menselijk materiaal.
Botverkeer
Websitebezoek dat wordt gegenereerd door geautomatiseerde programma's in plaats van door menselijke bezoekers.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media