AI & computing › Generatieve AI & synthetische media
Alibaba lanceert Qwen3.8-Flash-Next: bijna gratis AI die grotere modellen verslaat
Het Chinese techbedrijf Alibaba heeft een nieuw AI-taalmodel uitgebracht dat opvallend goedkoop is en toch beter presteert dan veel duurdere concurrenten. Qwen3.8-Flash-Next gebruikt slechts een fractie van zijn rekenkracht per vraag, maar verslaat op meerdere tests modellen van DeepSeek en zelfs Anthropic. Het model dient ook als voorproefje van architectuurtrucs die in de volgende grote Qwen-versie moeten verschijnen.
Alibaba's AI-afdeling Qwen heeft Qwen3.8-Flash-Next gepresenteerd, een taalmodel dat opvalt door zijn efficiëntie. Het model telt in totaal 125 miljard parameters, de instelbare rekenwaarden waarmee een AI-model kennis opslaat. Toch gebruikt het er bij elke vraag maar 6 miljard van. Dat komt doordat het een zogeheten mixture-of-experts-architectuur heeft: het model bestaat uit veel gespecialiseerde onderdelen, waarvan er per taak maar een klein deel wordt ingeschakeld. Dat scheelt enorm in rekenkosten, zonder dat de kwaliteit daaronder lijdt.
Een woordenboek in het geheugen
Opvallend is een nieuw onderdeel dat Alibaba de N-gram embedding-laag noemt. Deze laag bevat 51 miljard parameters en slaat veelgebruikte woordgroepen op als losse bouwstenen, een soort ingebouwd zinsnede-woordenboek. Het bijzondere: deze laag hoeft niet op de dure en schaarse GPU-chips te draaien, maar kan in gewoon systeemgeheugen (RAM) blijven. Dat maakt het toevoegen van deze extra kennis relatief goedkoop. Volgens Alibaba is dit een testversie van een innovatie die straks standaard in Qwen4 moet zitten, de opvolger van de huidige modellenreeks.
Het model heeft daarnaast een groot contextvenster, het werkgeheugen waarmee een AI-model bijhoudt wat er eerder in een gesprek of document is gezegd. Standaard verwerkt Qwen3.8-Flash-Next 262.144 tokens tegelijk, de tekstfragmenten waarin AI-modellen taal opdelen. Met een truc genaamd YaRN kan dat oplopen tot een miljoen tokens, genoeg voor een compleet boek aan invoer in één keer.
Goedkoper dan de concurrentie
De productieversie, Qwen3.8-Flash, is te gebruiken via het cloudplatform van Alibaba voor 0,16 dollar per miljoen inputtokens en 0,47 dollar per miljoen outputtokens. Dat is extreem laag vergeleken met vergelijkbare modellen. Op diverse benchmarks, gestandaardiseerde tests om AI-prestaties te vergelijken, verslaat het model zowel DeepSeek-V4-Flash als het veel duurdere Claude Opus 4.6 van Anthropic. Vooral op taken voor agentic AI, waarbij een model zelfstandig bugs opspoort en oplost in software, en op kantoortaken is de voorsprong groot. Op de test CoWorkBench scoort Flash-Next 73,9 punten tegen 45,1 voor DeepSeek. Alleen op Humanity's Last Exam, een test met extreem lastige multidisciplinaire vraagstukken, wint Claude Opus 4.6 nog nipt.
Alibaba presenteerde begin augustus al zijn vlaggenschipmodel Qwen3.8-Max, dat moet concurreren met de nieuwste modellen van OpenAI, Anthropic en Google. Flash-Next presteert daar net iets onder, maar kost circa twaalf keer minder. Die prijsdruk voelen ook Amerikaanse aanbieders: OpenAI verlaagde onlangs al de prijzen van zijn GPT-5.6-modellen. Voor gebruikers is dat goed nieuws, voor de omzetgroei van AI-bedrijven een stuk lastiger.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Steeds krachtigere AI-modellen worden tegelijk steeds goedkoper, wat drempels voor bedrijven en ontwikkelaars verlaagt. Doordat Alibaba efficiëntietrucs als de N-gram-laag en mixture-of-experts openlijk deelt, versnelt dit ook de concurrentie tussen Chinese en Amerikaanse AI-bedrijven. Dat kan leiden tot een prijzenoorlog waarin kwaliteit toeneemt terwijl kosten voor gebruikers dalen.
- Mixture-of-experts
- Een AI-architectuur waarbij een model is opgebouwd uit meerdere gespecialiseerde onderdelen, waarvan er per taak maar een deel wordt geactiveerd. Dit bespaart rekenkracht zonder in te leveren op prestaties.
- N-gram embedding-laag
- Een nieuw onderdeel dat veelvoorkomende woordgroepen opslaat als losse bouwstenen, vergelijkbaar met een ingebouwd woordenboek. Het kan in gewoon computergeheugen draaien in plaats van op dure GPU-chips.
- Contextvenster
- De hoeveelheid tekst die een AI-model tegelijk kan verwerken en onthouden binnen één gesprek of taak.
- YaRN
- Een techniek waarmee het contextvenster van een taalmodel achteraf wordt vergroot, zodat het veel meer tekst in één keer kan verwerken dan waarvoor het oorspronkelijk is getraind.
- Token
- Een klein stukje tekst, zoals een woord of woorddeel, waarin AI-taalmodellen taal opdelen om die te kunnen verwerken.
- Modelparameter
- Een instelbare waarde in een AI-model die bepaalt hoe het model informatie verwerkt en welke kennis het heeft opgeslagen.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zoals het opsporen en oplossen van fouten in software zonder voortdurende menselijke sturing.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.