AI & computing › Generatieve AI & synthetische media
Onderzoek: open AI-model Qwen lijkt sterk te leunen op redeneringen van GPT-5.5 Pro
Een onafhankelijke onderzoeker heeft een slimme test bedacht om te zien of AI-bedrijven elkaars modellen kopiëren. De resultaten wijzen erop dat het Chinese model Qwen3.8 verrassend sterk lijkt op GPT-5.5 Pro van OpenAI, terwijl eerder onderzoek nog een link met Anthropic's Opus suggereerde.
AI-bedrijven trainen hun modellen het liefst op eigen, unieke data. Toch bestaat binnen de sector al langer het vermoeden dat sommige partijen stiekem meeliften op het werk van concurrenten, door hun eigen taalmodel te trainen op antwoorden van een duurder, geavanceerder model. Die techniek heet modeldistillatie en is normaal gesproken legitiem, zolang het gebeurt met toestemming. Onderzoeker wsxiaoys, actief onder die naam op ontwikkelaarsplatform GitHub, ontwikkelde een methode om zulke overeenkomsten bloot te leggen en publiceerde de resultaten in een gist die op nieuwssite Hacker News veel aandacht kreeg.
Hoe werkt de test?
De onderzoeker liet vier modellen, waaronder DeepSeek V4 Flash, Kimi K3 en Qwen3.8 A95B, telkens twee keer dezelfde 45 opgaven oplossen: 15 uit exacte vakken, 15 algemene vragen en 15 puzzels. De eerste keer moesten de modellen zelfstandig nadenken. De tweede keer kregen ze een klein duwtje: de eerste 1 procent van het redeneerproces van GPT-5.5 Pro, het krachtige redeneermodel van OpenAI dat als 'leraar' fungeerde. Vervolgens werd gemeten hoeveel woorden, woordparen en woorddrietallen uit het uiteindelijke antwoord van GPT-5.5 Pro terugkwamen in de eerste honderd woorden van elk model. Als een model door dat kleine duwtje ineens veel meer op de leraar gaat lijken, is dat een aanwijzing dat het eerder al met soortgelijke data is getraind.Qwen springt eruit
Bij de meeste modellen veranderde er weinig. DeepSeek V4 Flash daalde zelfs licht, van 27,3 naar 26,1 procent overlap. Kimi K3 had zowel zonder als met de hint al de meeste overlap met GPT-5.5 Pro, wat weinig extra informatie geeft. Qwen3.8 A95B viel echter sterk op: de overlap steeg van 16,8 naar bijna 35 procent, een sprong van ruim 18 procentpunten. Bij de exacte-vakkenvragen liep dit zelfs op tot 27 procentpunten. Opvallend is dat dezelfde onderzoeker Qwen eerder al testte met Opus van Anthropic als leraarmodel, en toen nauwelijks een effect zag. Dat suggereert dat Qwen eerder trainingsdata deelt met GPT-5.5 Pro dan met Opus.Wat betekent dit?
De test is geen keihard bewijs. Een grote overlap kan ook ontstaan doordat modellen simpelweg vergelijkbaar zijn getraind op internetteksten, zonder dat er sprake is van doelbewuste distillatie. Toch voegt dit soort onderzoek een nieuw instrument toe aan de discussie over herkomst van trainingsdata, een onderwerp dat steeds gevoeliger wordt nu AI-bedrijven miljarden investeren in eigen modellen en tegelijk argwanend toekijken of concurrenten daarvan meeprofiteren zonder ervoor te betalen.Achtergrond & begrippen
Wat betekent dit voor de toekomst? Naarmate AI-modellen elkaar sneller opvolgen, groeit de behoefte aan onafhankelijke methodes om te controleren of bedrijven zich aan de regels houden bij het trainen van nieuwe modellen. Technieken zoals deze kunnen in de toekomst gebruikt worden om te achterhalen wie werkelijk baanbrekend onderzoek doet en wie vooral leunt op het werk van anderen, wat gevolgen kan hebben voor licenties, vertrouwen tussen bedrijven en zelfs juridische geschillen over intellectueel eigendom.
- Modeldistillatie
- Het trainen van een kleiner of goedkoper AI-model op de antwoorden van een groter, geavanceerder model, zodat het diens kennis en stijl overneemt.
- Large language model (taalmodel)
- Een AI-systeem dat is getraind op grote hoeveelheden tekst en daardoor mensachtige antwoorden kan genereren.
- Redeneermodel
- Een AI-model dat eerst stapsgewijs 'nadenkt' voordat het een antwoord geeft, vaak zichtbaar als een apart redeneerproces.
- Trainingsdata
- De teksten en voorbeelden waarmee een AI-model tijdens de ontwikkeling wordt getraind.
- Redeneer-prefill
- Een testmethode waarbij een stukje redenering van het ene AI-model wordt ingevoegd in het denkproces van een ander model, om te zien hoe sterk dat de uitkomst beïnvloedt.
- N-gram-overlapanalyse
- Een meetmethode die telt hoeveel losse woorden, woordparen en woorddrietallen twee teksten gemeenschappelijk hebben, gebruikt om tekstuele gelijkenis vast te stellen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.