AI & computing › Generatieve AI & synthetische media
Xiaomi's goedkope AI-model verslaat concurrentie, maar Anthropic is boos
Xiaomi heeft een nieuw AI-model uitgebracht dat beter en veel goedkoper presteert dan concurrenten als Kimi en Qwen. Het bedrijf deelt zijn trainingsmethode openlijk, maar concurrent Anthropic beschuldigt Xiaomi ervan stiekem data van chatbot Claude te hebben gebruikt om die winst te boeken.
Het Chinese techbedrijf Xiaomi, vooral bekend van smartphones, timmert ook stevig aan de weg met kunstmatige intelligentie. Het nieuwe model MiMo-V2.6-Pro scoort volgens onderzoeksbureau Artificial Analysis 46 punten op de zogeheten Intelligence Index. Daarmee is het voorlopig het sterkste openbaar beschikbare AI-model, beter dan bekende concurrenten als Kimi K3 en Qwen. Nog opvallender is de prijs: een test-taak kost met dit model gemiddeld maar 13 dollarcent, een fractie van wat vergelijkbare modellen kosten.
Slimmer trainen met vallen en opstaan
De winst komt volgens Xiaomi vooral door een sterk uitgebreide vorm van reinforcement learning: het model leert door talloze taken te proberen, feedback te krijgen en beloond te worden voor goede oplossingen. Xiaomi breidde deze trainingsfase op drie manieren uit: meer data per trainingsstap, meer uiteenlopende oefentaken en meer rekenkracht om antwoorden te beoordelen. De hele training duurde minder dan zes dagen en kostte omgerekend zo'n 2,4 miljoen euro voor het grote model en 780.000 euro voor de kleinere variant, MiMo-V2.6-Flash. Op een programmeertest steeg de score van het grote model van 58,4 naar 72,6 punten. Om te voorkomen dat het model de beloningen zou omzeilen zonder de taak echt op te lossen — een truc die bekendstaat als reward hacking — bouwde Xiaomi extra beveiligingen in.
Technisch gezien is Pro een zogeheten mixture-of-experts-model: het bevat in totaal 1,02 biljoen parameters, maar gebruikt er per vraag maar 42 miljard. Dat maakt het model efficiënter dan wanneer alle kennis steeds volledig zou worden ingezet. Xiaomi deelt bovendien de volledige trainingsomgeving, een technisch rapport en ongeveer 7.000 kant-en-klare oefentaken met automatische beoordelingssystemen, voor onder meer software-ontwikkeling, cybersecurity en kantoorwerk.
Anthropic: data van Claude gebruikt
Die openheid staat in schril contrast met beschuldigingen die Anthropic, de maker van chatbot Claude, twee weken eerder uitte. In een dreigingsrapport noemt Anthropic zeven Chinese AI-labs, waaronder Xiaomi, die Claude zouden hebben misbruikt om trainingsdata te verzamelen voor eigen modellen. Dit heet illegale distillatie: het kopiëren van de kennis van een concurrerend AI-model door het veel vragen te stellen en de antwoorden te gebruiken als lesmateriaal.
Voor Xiaomi specifiek registreerde Anthropic meer dan 400.000 gesprekken in maart en april 2026, waarin gebruikersvragen en programmeersessies van Xiaomi's eigen MiMo-modellen werden doorgestuurd naar Claude. Daarmee zou Xiaomi de antwoorden van Claude hebben gebruikt om zijn eigen modellen te verbeteren — mogelijk dezelfde route die nu heeft geleid tot de sterke prestaties van MiMo-V2.6.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Het voorbeeld van Xiaomi laat zien dat opvallend goedkope, opnieuw getrainde AI-modellen razendsnel de top van de ranglijsten kunnen bereiken, wat de concurrentie tussen Amerikaanse en Chinese AI-bedrijven verder aanwakkert. Tegelijk roept het vragen op over hoe eerlijk die vooruitgang tot stand komt, nu grote spelers elkaar ervan beschuldigen elkaars modellen te kopiëren in plaats van zelf te innoveren.
- Reinforcement learning
- Een trainingsmethode waarbij een AI-model leert door taken uit te voeren en feedback te krijgen op de kwaliteit van zijn antwoorden.
- Mixture-of-experts
- Een AI-architectuur waarbij een model is opgebouwd uit veel gespecialiseerde onderdelen, maar er per vraag maar een klein deel daarvan actief wordt gebruikt.
- Reward hacking
- Het verschijnsel waarbij een AI-model een manier vindt om beloond te worden zonder de onderliggende taak daadwerkelijk goed uit te voeren.
- Illegale distillatie
- Het heimelijk overnemen van de kennis van een concurrerend AI-model door het veel vragen te stellen en de antwoorden te gebruiken om een eigen model te trainen.
- Intelligence Index
- Een puntensysteem van onderzoeksbureau Artificial Analysis waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.
- Automatische grader
- Software die tijdens het trainen van een AI-model automatisch beoordeelt of een gegeven antwoord of oplossing correct is.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.