AI & computing › Generatieve AI & synthetische media
Anthropic: Chinese AI-labs kopieerden Claude via massale distillatie-aanvallen
AI-bedrijf Anthropic meldt dat het bijna 200 miljoen verdachte gesprekken met zijn chatbot Claude heeft geregistreerd, verspreid over vijf campagnes. Chinese techbedrijven zouden op grote schaal proberen om Claude's redeneervaardigheden te kopiëren voor hun eigen modellen. De grootste en agressiefste poging komt volgens het rapport van techgigant Alibaba.
Anthropic, het bedrijf achter de chatbot Claude, heeft donderdag een rapport gepubliceerd over wat het 'distillatiecampagnes' noemt. Daarbij proberen buitenstaanders op grote schaal de kennis en vaardigheden van een geavanceerd AI-model te kopiëren, om daarmee een eigen, goedkoper model te trainen. Volgens Anthropic ging het de afgelopen maanden om bijna 200 miljoen verdachte uitwisselingen, verdeeld over vijf afzonderlijke campagnes. De aanvallers zouden het vooral gemunt hebben op Claude's sterkste kanten: zelfstandig taken uitvoeren, programmeren, data analyseren en logisch redeneren.
Het gaat om een vorm van modeldistillatie, een techniek waarbij een kleiner AI-model leert van de antwoorden van een groter, duurder model. Normaal gebeurt dat met toestemming, bijvoorbeeld om een lichtere versie van een model te maken. Bij de campagnes die Anthropic beschrijft gebeurde dit echter zonder toestemming en via omwegen. De aanvallers waren vooral geïnteresseerd in het zogeheten redeneerblok van Claude: de stappen die het model intern doorloopt voordat het een antwoord geeft. Anthropic toont gebruikers normaal alleen een samenvatting van dat denkproces, niet de volledige tekst. Toch vonden de aanvallers trucs om het model die informatie alsnog te laten prijsgeven. In één voorbeeld deed een gebruiker zich voor als vertaler en vroeg hij Claude om zijn 'werkgeheugen' rechtstreeks te vertalen naar het Japans.
Alibaba grootste boosdoener
Het grootste deel van de pogingen schrijft Anthropic toe aan een campagne die gelinkt wordt aan Alibaba. Het bedrijf noemt het de omvangrijkste poging tot grootschalige distillatie die het ooit heeft waargenomen. Tussen mei en juli van dit jaar registreerde Anthropic 151 miljoen uitwisselingen, met pieken van bijna drie miljoen per dag. De aanvragen kwamen van 3.500 verschillende accounts, maar deelden allemaal dezelfde vaste prompt om de redeneerketen te ontfutselen. Daardoor kon Anthropic ze herleiden tot één gecoördineerde poging om trainingsmateriaal te verzamelen voor Alibaba's eigen taalmodel-familie Qwen.
Verzoeken vanuit het Chinese leger
Een tweede opvallende campagne wordt toegeschreven aan Moonshot AI, de maker van chatbot Kimi. Volgens Anthropic leken sommige verzoeken rechtstreeks afkomstig van het Chinese leger. Zo vroeg één verzoek Claude om bewakingsbeelden te beoordelen en te bepalen of de persoon op de beelden 'abnormaal gedrag' vertoonde. Over een periode van tien dagen registreerde Anthropic bijna 300.000 van dit soort verzoeken, via een netwerk van 5.000 accounts. De aanvallen richtten zich vooral op Opus, het krachtigste model van Anthropic dat vaak wordt ingezet voor complexe, agentic taken.
Het is niet de eerste keer dat een groot AI-bedrijf zulke beschuldigingen uit. Anthropic waarschuwde al in februari voor distillatie-aanvallen en noemde toen specifieke bedrijven. Ook branchegenoot OpenAI meldde eerder vergelijkbare praktijken, die het destijds specifiek toeschreef aan DeepSeek. De nieuwe bevindingen van Anthropic zijn volgens het bedrijf zelf wel groter en geraffineerder dan wat eerder werd waargenomen, wat duidt op een verharding van de concurrentiestrijd tussen Amerikaanse en Chinese AI-bedrijven.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Dit nieuws laat zien hoe fel de strijd om AI-dominantie tussen de Verenigde Staten en China is geworden. Bedrijven investeren miljarden in het trainen van topmodellen, en pogingen om die kennis via achterdeurtjes te kopiëren ondermijnen dat verdienmodel. Verwacht dat AI-bedrijven hun beveiliging verder aanscherpen, wat ook gevolgen kan hebben voor hoeveel gewone gebruikers straks nog te zien krijgen van het denkproces achter een AI-antwoord.
- Modeldistillatie
- Een techniek waarbij een kleiner AI-model leert van de antwoorden van een groter model, waardoor het diens vaardigheden deels overneemt tegen lagere kosten.
- Redeneerketen (chain of thought)
- De interne, stapsgewijze redenering die een AI-model doorloopt voordat het een antwoord formuleert.
- Supervised fine-tuning
- Een trainingsmethode waarbij een AI-model wordt bijgeschaafd met voorbeelddata, in dit geval de afgekeken redeneerstappen van een ander model.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen kunnen uitvoeren om een taak te voltooien, zonder telkens nieuwe instructies van een gebruiker nodig te hebben.
- Tool use
- Het vermogen van een AI-model om externe programma's of hulpmiddelen aan te roepen, zoals een rekenmachine of zoekmachine, om een taak beter uit te voeren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.