AI & computingGeneratieve AI & synthetische media

Nieuw AI-model van Nvidia is extreem snel, maar niet de slimste

· Bijgewerkt 11 augustus 2026, 18:14 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: The Decoder

Chipmaker Nvidia heeft een nieuw open AI-taalmodel uitgebracht dat vooral uitblinkt in snelheid. Nemotron 3.5 Lightning haalt bijna hetzelfde intelligentieniveau als een model van OpenAI, met een kwart van de rekenkracht en veruit de hoogste verwerkingssnelheid in zijn klasse. Nvidia wil daarmee bewijzen dat kleinere, snellere modellen net zo goed taken kunnen uitvoeren als veel grotere en duurdere systemen.

Nvidia heeft Nemotron 3.5 Lightning gelanceerd, het eerste model in een nieuwe reeks taalmodellen die het bedrijf Nemotron 3.5 noemt. Het model is de opvolger van Nemotron 3 Nano 30B A3B en gebruikt dezelfde hybride Mamba-Transformer-architectuur: een combinatie van twee verschillende technieken om tekst te verwerken. Het model heeft in totaal 31,6 miljard parameters, de instelbare knoppen waarmee een AI-model kennis opslaat, maar zet er bij elke berekening maar 3,6 miljard van in. Daardoor blijft het rekenwerk licht, terwijl het model toch kan putten uit een grote hoeveelheid opgeslagen informatie.

Compacte omvang, grote sprong in prestaties

Volgens het onafhankelijke testplatform Artificial Analysis scoort Lightning 24 punten op de Intelligence Index, een verzamelscore die meet hoe goed een AI-model uiteenlopende taken oplost. Dat is een sprong van negen punten ten opzichte van zijn voorganger, die op 15 punten bleef steken. Met die score evenaart Lightning het model gpt-oss-120b van OpenAI, en blijft het net achter Nvidia's eigen Nemotron 3 Super, dat ongeveer vier keer zoveel actieve rekenkracht gebruikt. De slimste modellen in dezelfde gewichtsklasse, zoals Qwen3.6 35B A3B en Meta's Muse Glimmer, scoren nog altijd duidelijk hoger. Waar Lightning zich onderscheidt, is de snelheid: het model verwerkt bijna 670 tokens per seconde, de tekstfragmenten waarin AI-modellen taal opdelen. Dat is bijna twee keer zo snel als Google's Gemini 3.5 Flash-Lite. Een gemiddelde testtaak die Lightning in ongeveer dertig seconden afrondt, kost concurrent Qwen3.6 35B A3B ruim drieënhalve minuut en het model Gemma 4 van Google bijna zes minuten.

Vooral sterke prestaties bij zelfstandig werkende AI

De grootste vooruitgang boekt Lightning op zogeheten agentic benchmarks: tests die meten hoe goed een AI zelfstandig meerstaps-taken uitvoert, zoals coderen of het bedienen van software. Op de test GDPval-AA v2 haalt het model een Elo-rating van 824 punten, een score die aangeeft hoe goed het model presteert ten opzichte van andere modellen. Dat is 334 punten meer dan zijn voorganger en hoger dan zowel gpt-oss-120b (800) als het veel grotere Nemotron 3 Super (698). Op de programmeertest Terminal-Bench schiet de score omhoog van 7 naar 24,3 procent, vlak bij de 26,2 procent van gpt-oss-120b. Nvidia werkte voor de training samen met partners als CodeRabbit en Harvey om het model extra te trainen op praktische toepassingen.

Vrij te downloaden en breed inzetbaar

Nvidia brengt Nemotron 3.5 Lightning uit onder de vrije OpenMDW-1.1-licentie, waardoor iedereen het model mag downloaden, aanpassen en commercieel gebruiken. Het model is beschikbaar in twee varianten: de volledig nauwkeurige BF16-versie en de compactere NVFP4-versie, die nauwelijks kwaliteitsverlies oplevert. Lightning verwerkt alleen tekst, geen beeld of geluid, en heeft een contextvenster van maar liefst een miljoen tokens, genoeg om zeer lange documenten in één keer te lezen. Cloudpartijen als DeepInfra, Fireworks, FriendliAI, CoreWeave, Nebius en Crusoe bieden het model al aan voor directe inzet. Nvidia onderbouwt de lancering met een eigen onderzoek uit 2025, waarin het bedrijf stelde dat modellen onder de tien miljard actieve parameters de meeste taken van AI-agents net zo goed kunnen uitvoeren als modellen van 70 tot 175 miljard parameters, tegen een fractie van de kosten. Met Lightning levert Nvidia daar volgens Artificial Analysis het duidelijkste praktijkbewijs voor tot nu toe.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Nemotron 3.5 Lightning laat zien dat compacte, energiezuinige AI-modellen steeds vaker het werk van veel grotere en duurdere systemen kunnen overnemen. Dat maakt AI-agents die zelfstandig taken uitvoeren goedkoper en toegankelijker, wat de opmars van agentic AI in bedrijven kan versnellen. Omdat het model open en gratis te gebruiken is, kunnen ook kleinere partijen ermee experimenteren zonder afhankelijk te zijn van dure clouddiensten.

Mamba-Transformer-architectuur
Een hybride bouwwijze voor AI-modellen die twee technieken combineert: de snelle, geheugenzuinige Mamba-aanpak en de krachtige Transformer-aanpak die de meeste huidige taalmodellen gebruiken.
Actieve parameters
Het deel van de miljarden instelbare rekenwaarden van een AI-model dat daadwerkelijk wordt gebruikt bij het verwerken van één vraag, ook wel een Mixture of Experts-opzet genoemd.
Intelligence Index
Een verzamelscore van testplatform Artificial Analysis die de algemene intelligentie van AI-modellen meet aan de hand van meerdere benchmarks.
Tokens per seconde
De snelheid waarmee een AI-model tekstfragmenten (tokens) genereert; hoe hoger dit getal, hoe sneller een model antwoord geeft.
Elo-rating
Een puntensysteem, oorspronkelijk uit het schaken, dat aangeeft hoe goed een AI-model presteert in vergelijking met andere modellen.
Agentic benchmarks
Tests die meten hoe goed een AI-model zelfstandig meerstaps-taken uitvoert, zoals programmeren of het bedienen van software, in plaats van alleen losse vragen beantwoorden.
Open-weight-licentie
Een licentievorm waarbij de volledige, getrainde versie van een AI-model vrij gedownload en gebruikt mag worden, in tegenstelling tot gesloten modellen die alleen via een dienst toegankelijk zijn.
Contextvenster
De hoeveelheid tekst die een AI-model tegelijk kan 'onthouden' en verwerken tijdens een gesprek of opdracht, gemeten in tokens.
BF16 en NVFP4
Twee manieren om de rekenwaarden van een AI-model op te slaan; BF16 is nauwkeuriger maar zwaarder, NVFP4 is compacter en sneller met vrijwel hetzelfde resultaat.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media