AI & computing › Generatieve AI & synthetische media
xAI lanceert Grok 4.7 spotgoedkoop, maar model blijft ver achter concurrentie
xAI heeft Grok 4.7 gelanceerd, het nieuwste AI-model van Elon Musks bedrijf voor programmeren en kenniswerk. Het model is opvallend goedkoop, maar onafhankelijke tests laten zien dat het flink achterblijft bij topmodellen als Claude Fable 5.1 en GPT-6.
xAI presenteert Grok 4.7 als zijn krachtigste model tot nu toe. Het bedrijf van Elon Musk zegt dat het model is gebouwd op een groter basismodel, langer is getraind met reinforcement learning en beter in staat is zijn eigen antwoorden te controleren voordat het ze presenteert. Grok 4.7 is te gebruiken via de Grok API, de programmeertool Cursor en xAI's eigen platform Grok Build.
Prijs dicht bij Chinese modellen
Opvallend is de prijsstelling: xAI rekent 2 dollar per miljoen tokens aan invoer en 6 dollar per miljoen tokens aan uitvoer. Tokens zijn de tekstfragmenten waarmee een taalmodel rekent; hoe meer tokens een vraag en antwoord kosten, hoe hoger de rekening voor bedrijven die het model gebruiken. Deze tarieven liggen dicht bij die van Chinese aanbieders en veel lager dan wat Westerse concurrenten vragen. Dat is waarschijnlijk niet toevallig, want de prestaties van Grok 4.7 blijven duidelijk achter.
Middenmoot op de ranglijst
Op de onafhankelijke Artificial Analysis Intelligence Index, een benchmark die tien verschillende tests combineert, scoort Grok 4.7 een 46. Daarmee belandt het model in de middenmoot. Claude Fable 5.1 en GPT-6 voeren de ranglijst aan met beide een score van 53. Ook de twee hoogste redeneerniveaus van Grok 4.7 presteren nauwelijks beter dan elkaar, wat erop wijst dat extra rekentijd het model niet veel slimmer maakt.
Het verschil wordt nog groter bij taken waarbij AI zelfstandig moet programmeren, ook wel agentic coderen genoemd. Op de test Terminal-Bench 4.0, waarbij een AI-model autonoom opdrachten in een computerterminal moet uitvoeren, haalt Grok 4.7 slechts 26 procent. GPT-6 Astra scoort 60 procent en Claude Fable 5.1 haalt 55 procent. Zelfs het goedkopere Chinese model DeepSeek V4.1 Flash doet met 27 procent net iets beter dan Grok 4.7.
De cijfers zetten vraagtekens bij de strategie van xAI. Het bedrijf lijkt met de lage prijs vooral marktaandeel te willen veroveren bij ontwikkelaars en bedrijven die grote hoeveelheden AI-verzoeken verwerken, ook als de kwaliteit nog niet gelijk opgaat met de duurdere concurrentie van OpenAI en Anthropic.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? De lancering laat zien dat de concurrentie in AI-modellen niet alleen om intelligentie draait, maar ook om prijs. Voor bedrijven die AI op grote schaal inzetten kan een goedkoper maar minder capabel model soms toch aantrekkelijker zijn dan een duurder topmodel. Tegelijk toont het gat in agentic coderen dat er nog flinke verschillen bestaan in hoe goed AI-modellen echt zelfstandig taken kunnen uitvoeren.
- Reinforcement learning
- Een trainingsmethode waarbij een AI-model leert door beloningen te krijgen voor goede antwoorden, vergelijkbaar met hoe een dier een truc leert door beloning.
- Token
- Een klein tekstfragment waarmee taalmodellen rekenen; de prijs van AI-diensten wordt vaak per miljoen tokens berekend.
- Benchmark
- Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling vergelijkbaar worden gemaakt.
- Agentic coderen
- Een vorm van programmeren waarbij een AI-model zelfstandig, zonder voortdurende menselijke sturing, taken in een computeromgeving uitvoert.
- Redeneerniveau
- Een instelling waarmee een AI-model meer of minder rekentijd krijgt om over een antwoord na te denken voordat het reageert.
- Zelfverificatie
- Het vermogen van een AI-model om de eigen uitkomst te controleren op fouten voordat het antwoord wordt gepresenteerd.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.