AI & computing › Generatieve AI & synthetische media
Nieuw AI-model Qwen3.8 Max scoort beter, maar is duurder dan concurrent
Alibaba's nieuwste AI-taalmodel Qwen3.8 Max scoort een stuk beter op onafhankelijke tests dan zijn voorganger en evenaart daarmee Claude Opus 4.8 van Anthropic. Toch verliest het model het van het goedkopere Kimi K3 van Moonshot AI, blijkt uit onderzoek van benchmarkbureau Artificial Analysis. De hogere score heeft een prijs: Qwen3.8 Max werkt trager, kost meer en verzint vaker antwoorden die niet kloppen.
Alibaba brengt zijn AI-taalmodellen uit onder de naam Qwen. De nieuwste versie, Qwen3.8 Max, scoort 56 punten op de Intelligence Index van Artificial Analysis, een index die de resultaten van tientallen tests samenvat in één cijfer. Dat is 10 punten meer dan voorganger Qwen3.7 Max, die op 46 punten bleef steken. Met die score sluit Qwen3.8 Max aan bij Claude Opus 4.8 van het Amerikaanse Anthropic en laat het GLM-5.2 van branchegenoot Zhipu AI (51 punten) achter zich. Alleen Kimi K3 van Moonshot AI doet het met 57 punten net iets beter, en dat voor 25 procent minder geld per taak.
Grondiger, maar trager en duurder
Op de benchmark GDPval-AA, die meet hoe goed een model realistische werktaken aankan, boekt Qwen3.8 Max wel een grote sprong: van 1.271 naar 1.739 punten op de Elo-schaal, een puntensysteem dat oorspronkelijk uit het schaken komt en aangeeft hoe modellen onderling presteren. Daarmee passeert het model Kimi K3 (1.685 punten). Alleen Claude Opus 5, de nieuwste versie van Anthropic, scoort met 1.852 punten hoger.
Die vooruitgang komt niet vanzelf. Qwen3.8 Max heeft gemiddeld 64 tussenstappen nodig om een taak af te ronden, tegenover 14 bij de vorige versie. Bij elke stap stuurt het systeem de volledige gespreksgeschiedenis opnieuw mee, waardoor het aantal invoertokens vertienvoudigt tot wel vervijftienvoudigt. Een token is een stukje tekst waarmee een taalmodel rekent: hoe meer tokens een model verwerkt, hoe hoger de rekenkosten. Dat het model zoveel geschiedenis moet herlezen, laat ook zien hoe zwaar het beroep is dat het doet op zijn contextvenster, het deel van het geheugen waarin een model tekst kan vasthouden tijdens een gesprek.
Alibaba verlaagde de prijs per miljoen tokens wel: invoer ging van 2,50 naar 2,00 dollar, uitvoer van 7,50 naar 6,00 dollar en cache-treffers van 0,50 naar 0,25 dollar. Toch stijgen de totale kosten flink, omdat het model simpelweg veel meer tokens verstookt. Eén taak in de Intelligence Index kost nu gemiddeld 1,14 dollar, meer dan het dubbele van de 0,53 dollar bij Qwen3.7 Max. Kimi K3 scoort een punt hoger voor 0,86 dollar per taak, en GLM-5.2 blijft steken op 0,57 dollar. Van de vergeleken modellen heeft Qwen3.8 Max daarmee de slechtste prijs-prestatieverhouding.
Meer gokwerk, minder eerlijke antwoorden
Niet alle resultaten zijn positief. Op AA-LCR, een test die meet of een model informatie correct combineert uit lange teksten, zakt Qwen3.8 Max twee punten. Opvallender is de achteruitgang op AA-Omniscience, een test die nagaat of een model kennisvragen goed beantwoordt of eerlijk toegeeft het antwoord niet te weten. Die score daalt tien punten. De nauwkeurigheid blijft ongeveer gelijk, rond de 31 procent, maar het aandeel hallucinaties springt van 23 naar 40 procent. Een hallucinatie is een antwoord dat overtuigend klinkt maar feitelijk onjuist is. Qwen3.8 Max gokt dus vaker in plaats van een vraag onbeantwoord te laten, wat het risico op verkeerde informatie vergroot.
De resultaten laten zien hoe lastig het is om in de race om steeds krachtigere frontier-AI, de verzamelnaam voor de nieuwste generatie geavanceerde AI-modellen, tegelijk beter, sneller én betrouwbaarder te worden. Alibaba wint terrein op prestaties, maar betaalt daarvoor met snelheid, kosten en betrouwbaarheid, een afweging die ontwikkelaars van AI-toepassingen straks zelf moeten maken.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze vergelijking laat zien dat AI-bedrijven steeds moeilijker tegelijk kunnen scoren op prestaties, snelheid, kosten én betrouwbaarheid. Wie een model grondiger laat nadenken, betaalt daarvoor met hogere rekenkosten en soms met meer verzonnen antwoorden. Voor bedrijven die AI inzetten wordt de keuze voor een model daardoor steeds meer een afweging tussen kwaliteit, prijs en risico op fouten, in plaats van simpelweg 'het beste' model kiezen.
- Taalmodel
- Een AI-systeem dat getraind is om tekst te begrijpen en te genereren, de basis achter chatbots zoals Qwen en Claude.
- Intelligence Index
- Een samengestelde score van Artificial Analysis die de resultaten van meerdere AI-benchmarks combineert tot één vergelijkbaar cijfer.
- Elo-schaal
- Een puntensysteem, oorspronkelijk uit het schaken, dat aangeeft hoe goed iets presteert ten opzichte van andere deelnemers.
- Token
- Een stukje tekst waarmee een taalmodel rekent; hoe meer tokens verwerkt worden, hoe hoger de rekenkosten.
- Contextvenster
- Het deel van het geheugen van een taalmodel waarin het tekst kan vasthouden tijdens een gesprek of taak.
- Hallucinatie
- Een antwoord van een AI-model dat overtuigend klinkt maar feitelijk onjuist of verzonnen is.
- Frontier-AI
- Verzamelnaam voor de nieuwste, krachtigste generatie AI-modellen die de grens van wat mogelijk is verleggen.
- GDPval-AA, AA-LCR en AA-Omniscience
- Specifieke deelbenchmarks van Artificial Analysis die respectievelijk werktaken, het combineren van informatie uit lange teksten, en eerlijke kennisbeantwoording testen.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.