AI & computing › Neuromorfe & fotonische chips
Nvidia claimt vier keer snellere AI-chip dan Cerebras, maar vergelijking rammelt
Nvidia heeft zijn nieuwe AI-chip Groq 3 LPX in productie genomen en presenteert een recordsnelheid voor tekstgeneratie. Concurrent Cerebras zou daarmee vier keer verslagen zijn, maar experts wijzen erop dat Nvidia veel meer chips nodig heeft om dat resultaat te halen.
Op de chipconferentie Hot Chips 2026 maakte Nvidia bekend dat de Groq 3 LPX in volledige productie is. De chip is speciaal ontworpen om razendsnel tekst te genereren voor AI-agents: computerprogramma's die zelfstandig taken uitvoeren, zoals code schrijven of bestanden doorzoeken. Nvidia noemt de chip een "interactieve AI-inferentieversneller" en positioneert hem als uitbreiding van zijn Vera Rubin-platform. De chip moet later dit jaar operationeel worden.
De ontwikkeling volgt op de overname van Groq eind vorig jaar, waarbij Nvidia zo'n 20 miljard dollar betaalde voor een licentie op de technologie. Oprichter Jonathan Ross en president Sunny Madra kwamen daarbij ook aan boord. Groq bouwt al jaren processoren die niet zijn gemaakt om AI te trainen, maar om getrainde modellen zo snel mogelijk te laten antwoorden: inferentiechips, ook wel LPU's genoemd.
Snelheid telt bij AI-agents
Voor agentic AI is snelheid cruciaal. Een AI-agent doorloopt vaak honderden tot duizenden stappen om een taak te voltooien: bestanden checken, code schrijven, resultaten testen. Hoe sneller een systeem tekst produceert, hoe meer van die stappen passen binnen de tijd die een gebruiker bereid is te wachten. Nvidia claimt dat dit codeertaken kan terugbrengen van uren naar minuten.
Een onafhankelijke test van analysebureau Artificial Analysis moet de snelheid onderbouwen. Op het open AI-model Gemma 4 31B, met een geheugen van 100.000 tokens (tekstfragmenten), haalde een volledig rek met Groq-chips 3.400 tokens per seconde. Dat is het hoogste cijfer ooit gemeten voor dit model en volgens Nvidia vier keer sneller dan het beste alternatief van Cerebras, dat op 882 tokens per seconde bleef steken.
Appels met peren vergelijken
Techsite The Register plaatst kritische kanttekeningen bij die vergelijking. De Groq-architectuur werkt met chips die elk maar 500 MB geheugen hebben, 576 keer minder dan een Rubin-GPU met 288 GB. Om een groot taalmodel te draaien, moeten de chips daarom worden samengevoegd: één rek herbergt tot 256 LPU's, verbonden via Ethernet. GPU's verwerken daarbij de rekenintensieve eerste fase, de LPU's de fase waarin het model daadwerkelijk tekst genereert.
Voor die opstelling is Gemma 4 31B een gunstig testmodel: het past precies in één rek. Hoe de aanpak standhoudt bij grotere modellen die uit meerdere gespecialiseerde onderdelen bestaan, is onduidelijk. Voor het model DeepSeek V3 zouden bijvoorbeeld 1.342 chips nodig zijn, ruim vijf rekken vol. Bovendien draait Cerebras zijn taken op één of twee chips tegenover minstens 64 voor Nvidia, en ontbreekt in de vergelijking Cerebras' nieuwste CS-4-generatie. Cloudbedrijf Nebius wil de Nvidia-chip als eerste aanbieden via zijn platform Token Factory; Groq zelf behoort tot de eerste gebruikers.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? De strijd om de snelste AI-inferentiechip bepaalt hoe snel en goedkoop AI-agents straks complexe taken kunnen uitvoeren. Dit nieuws laat zien dat benchmarks in de chipindustrie vaak minder eenduidig zijn dan de marketing suggereert: het aantal chips en de architectuur spelen minstens zo'n grote rol als de kale snelheid.
- Inferentiechip
- Een chip die is geoptimaliseerd om een al getraind AI-model razendsnel antwoorden te laten genereren, in plaats van om het model te trainen.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zoals code schrijven of informatie opzoeken.
- LPU
- Language Processing Unit: een gespecialiseerde chip van Groq, ontworpen om taalmodellen extreem snel tekst te laten genereren.
- Token
- Een klein tekstfragment (vaak een woorddeel) waarmee AI-taalmodellen tekst verwerken en genereren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.