AI & computing › Neuromorfe & fotonische chips
Chinees AI-model GLM-5.3-Flash evenaart topmodellen zonder Nvidia-chips
Het Chinese AI-bedrijf Z.ai heeft met GLM-5.3-Flash een taalmodel uitgebracht dat bijna even goed presteert als zijn grote broer, maar ruim zeven keer goedkoper is. Opvallend: het model draaide tijdens tests volledig op Chinese chips in plaats van op hardware van Nvidia.
Z.ai, de maker van de GLM-modellenreeks, presenteert GLM-5.3-Flash als een goedkoper alternatief voor zijn eigen topmodel GLM-5.3. Het model telt 320 miljard parameters, waarvan er dankzij een mixture-of-experts-opzet maar 18 miljard tegelijk actief zijn. Dat scheelt rekenkracht zonder dat de prestaties veel inleveren. Het model is open-weight onder een MIT-licentie en de gewichten staan op Hugging Face. Ook de contextvenster-grootte is fors: één miljoen tokens, genoeg om lange documenten in één keer te verwerken.
Bijna net zo slim, veel goedkoper
Op de Intelligence Index van onderzoeksbureau Artificial Analysis scoort GLM-5.3-Flash 57 punten, tegen 60 voor het grotere GLM-5.3. Daarmee evenaart het model prestaties van GPT-5.6 Terra en Muse Spark 1.2. Het prijsverschil is groter dan het prestatieverschil: een taak kost via de index gemiddeld 0,09 dollar, tegen 0,68 dollar bij GLM-5.3. Dat is ruim zeven keer goedkoper. Via de eigen API van Z.ai betaal je 0,15 dollar per miljoen invoertokens en 0,50 dollar per miljoen uitvoertokens, nog geen tiende van de prijs van het grote model. Op praktijkgerichte taken, gemeten met de GDPval-AA v2-benchmark, haalt het model een Elo-score van ongeveer 1770. Dat is gelijk aan GLM-5.3 en Grok 4.6, en alleen Claude Opus 5 scoort hoger. Een kanttekening: het model is minder zuinig met tokens. Volgens Artificial Analysis gaat ongeveer 90 procent van de gegenereerde tokens op aan redeneerstappen.
Getest onder de radar, gedraaid zonder Nvidia
Voor de officiële lancering testte Z.ai het model anoniem onder de naam "ox-alpha" op de platforms OpenCode en OpenRouter, waar het uitgroeide tot het populairste model van de week. Al dat verkeer liep volgens Z.ai volledig op Chinese AI-chips. Analysebureau SemiAnalysis meldt dat het model dagelijks 100 biljoen tokens verwerkte, een schaal die tot nu toe alleen bij de grootste Amerikaanse AI-labs mogelijk leek. Z.ai claimt dat de efficiëntie en kosten per token van deze Chinese chips inmiddels in de buurt komen van gangbare Nvidia-GPU's.
Druk op het Nvidia-monopolie
Die claim raakt aan wat wel de "CUDA-moat" wordt genoemd: het bijna twintig jaar oude softwarelaagje waarmee Nvidia AI-programma's met zijn eigen grafische chips laat praten dankzij GPU-acceleratie. Vrijwel elk AI-framework is op die laag ingericht, waardoor overstappen naar andere chips normaal veel herprogrammeerwerk kost. Z.ai omzeilde dat obstakel door eigen serversoftware te bouwen bovenop het bestaande project SGLang, waarbij verwerkingsstappen los van elkaar kunnen opschalen. Dat verdrievoudigde de verwerkingssnelheid ten opzichte van de eerste poging op dezelfde hardware. Opvallend detail: een AI-agent gebaseerd op GLM-5.3 hielp zelf mee aan die optimalisatie. SemiAnalysis noemt het resultaat een nieuwe aanwijzing dat Nvidia's softwarevoorsprong onder druk staat, na eerdere signalen rond een nieuwe chip van OpenAI.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als Chinese AI-chips en zelfgebouwde software echt kunnen concurreren met Nvidia-hardware, wordt de dominantie van Nvidia in AI-rekenkracht minder vanzelfsprekend. Dat kan de kosten van AI-toepassingen wereldwijd verlagen en landen minder afhankelijk maken van één leverancier, al blijft onafhankelijke bevestiging van de claims voorlopig beperkt.
- Mixture of experts
- Een architectuur waarbij een AI-model uit veel gespecialiseerde onderdelen bestaat, maar per taak maar een klein deel daarvan wordt ingeschakeld. Dat bespaart rekenkracht ten opzichte van een model dat altijd al zijn parameters gebruikt.
- Contextvenster
- De hoeveelheid tekst die een AI-model in één keer kan 'onthouden' en verwerken, gemeten in tokens.
- Open-weightmodel
- Een AI-model waarvan de getrainde parameters (gewichten) openbaar beschikbaar zijn, zodat anderen het model kunnen downloaden en zelf draaien.
- Intelligence Index
- Een benchmark van onderzoeksbureau Artificial Analysis die de algemene prestaties van AI-modellen samenvat in één score.
- Elo-score
- Een puntensysteem, oorspronkelijk uit het schaken, dat aangeeft hoe goed een AI-model presteert ten opzichte van andere modellen.
- CUDA
- De programmeerlaag van Nvidia die AI-software laat communiceren met Nvidia-grafische chips. Bijna alle AI-frameworks zijn hierop afgestemd, wat overstappen naar andere hardware lastig maakt.
- GPU-acceleratie
- Het gebruik van grafische chips (GPU's) om rekenwerk voor AI te versnellen ten opzichte van gewone processoren.
- Tokens
- De kleine tekstbrokjes waarin AI-taalmodellen tekst opdelen om te lezen en te genereren; de hoeveelheid tokens bepaalt vaak ook de kosten van een AI-taak.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.