AI & computingGeneratieve AI & synthetische media

Microsoft: Copilot herhaalt bijna nooit tekst uit NYT-artikelen

· Bijgewerkt 4 september 2026, 18:13 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Verge

Microsoft heeft in de rechtszaak met The New York Times nieuwe cijfers vrijgegeven over zijn chatbot Copilot. Van 8,2 miljoen onderzochte gesprekken bevatte minder dan 1 procent zinnen die sterk lijken op teksten van de krant. Het techbedrijf gebruikt de cijfers om te bewijzen dat trainen op auteursrechtelijk beschermd materiaal onder 'fair use' valt.

Microsoft ligt al enige tijd overhoop met The New York Times, andere nieuwsuitgevers en een groep boekenauteurs. Zij klagen het techbedrijf en OpenAI aan omdat hun chatbots zouden zijn getraind op auteursrechtelijk beschermde teksten, zonder daarvoor te betalen. Erger nog: de chatbots zouden soms letterlijke stukken uit artikelen en boeken teruggeven aan gebruikers, waardoor mensen de bron niet meer hoeven te bezoeken.

Om zich te verdedigen, leverde Microsoft in het kader van het proces 8,2 miljoen gesprekslogs van zijn chatbot Copilot aan bij een onafhankelijke deskundige die door de nieuwsuitgevers was ingehuurd. Het ging niet om een willekeurige steekproef: Microsoft koos bewust gesprekken die trefwoorden bevatten die wijzen op gebruik van content van de aanklagende partijen. Juist in die selectie, zo blijkt nu uit gerechtelijke stukken, bleek in slechts 59.545 gesprekken minstens zestien woorden overlap te zitten met teksten waarop het onderliggende taalmodel is getraind. Dat is ruim minder dan 1 procent van het totaal.

Weinig overlap, ook bij boeken en onderzoeksjournalistiek

Ook voor andere partijen in de zaak vielen de cijfers laag uit. Een expert die werkt voor het Center for Investigative Reporting (CIR), een Amerikaanse organisatie voor onderzoeksjournalistiek, vond in dezelfde dataset 51 gevallen van wat Microsoft omschrijft als 'substantiële overlap' met werk van CIR. In de aparte rechtszaak van een groep boekenauteurs telde een deskundige van de aanklagers slechts 24 Copilot-reacties met minstens dertig overeenkomende woorden, verdeeld over 212 onderzochte boeken. Bij maar tien van die boeken werd überhaupt een match gevonden.

The New York Times, CIR en de belangenorganisatie Authors Guild hebben nog niet gereageerd op de nieuwe cijfers. De reacties, of het uitblijven daarvan, kunnen van belang zijn omdat de zaak nog volop loopt.

Argument voor 'fair use'

Microsoft gebruikt de lage percentages als bewijs dat het trainen van AI-modellen op auteursrechtelijk materiaal moet worden gezien als eerlijk gebruik. Het bedrijf erkent dat systemen als Copilot leunen op grote hoeveelheden trainingsdata, waaronder mogelijk beschermde teksten, maar stelt dat het eindresultaat een wezenlijk ander doel dient dan het origineel. Volgens Microsoft doet het incidenteel terugkeren van tekstfragmenten niets af aan het 'transformatieve' karakter van het trainingsproces.

De stukken werden vrijdag ingediend als onderdeel van een verzoek om een zogeheten summary judgment: een uitspraak van de rechter die de zaak in een vroeg stadium zou kunnen beëindigen, zonder dat er een volledig proces nodig is. Opvallend is dat ook de regering-Trump deze week een standpunt indiende in de aparte zaak van The New York Times tegen OpenAI, waarin ze OpenAI steunt. Wijst de rechter het verzoek van de nieuwsuitgevers en auteurs af, dan gaat de juridische strijd gewoon door.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? De uitkomst van deze rechtszaak kan bepalend worden voor de vraag of techbedrijven auteursrechtelijk beschermde content mogen gebruiken om AI-modellen te trainen. Valt dit onder 'fair use', dan krijgen bedrijven als Microsoft en OpenAI meer ruimte om vrijwel elke tekst op internet te gebruiken; wordt dat afgewezen, dan kunnen uitgevers en auteurs voortaan compensatie of expliciete toestemming eisen.

Large language model
Een AI-taalmodel dat op basis van enorme hoeveelheden tekst leert taal te begrijpen en te genereren; Copilot draait op zo'n model.
Trainingsdata
De teksten, afbeeldingen of andere data waarmee een AI-model wordt 'gevoed' om patronen en kennis te leren.
Summary judgment
Een Amerikaanse juridische procedure waarbij een rechter een zaak kan beslechten zonder volledig proces, als de feiten voldoende duidelijk zijn.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media