AI & computingAgentic AI & autonome agents

Nvidia lanceert sneller AI-model voor routinetaken van AI-agents

· Bijgewerkt 12 augustus 2026, 00:13 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Interesting Engineering

Chipmaker Nvidia heeft een nieuw, compact AI-model uitgebracht dat is gemaakt voor het saaie, herhalende werk van AI-agents: taken uitvoeren, resultaten checken, commando's draaien. Nemotron 3.5 Lightning moet dat tot vier keer sneller doen dan vergelijkbare modellen, terwijl het gratis en open beschikbaar is voor ontwikkelaars.

Autonome AI-agents worden steeds vaker ingezet om zelfstandig taken uit te voeren: een tool aanroepen, een resultaat controleren, een opdracht doorsturen naar de volgende stap. Voor dat soort kleine, herhaalde acties is meestal geen zwaar AI-model nodig. Toch gebruiken veel systemen daarvoor hetzelfde grote model als voor complexe planning, wat rekenkracht en tijd kost. Nvidia wil dat probleem aanpakken met een nieuw model: Nemotron 3.5 Lightning.

Klein model, groot takenpakket

Nemotron 3.5 Lightning telt in totaal 30 miljard parameters, de instelbare rekenwaarden waarmee een AI-model is getraind. Bij elke berekening worden daarvan slechts 3 miljard daadwerkelijk gebruikt. Dat komt door een mixture-of-experts-architectuur: het model bestaat uit meerdere gespecialiseerde onderdelen, en voor elke taak wordt alleen het relevante stukje geactiveerd. Zo combineert het model de kennis van een groot systeem met de snelheid en het lage energieverbruik van een veel kleiner model. Nvidia positioneert Lightning nadrukkelijk als uitvoerder, niet als planner: grote redeneermodellen blijven verantwoordelijk voor complexe beslissingen, terwijl Lightning het routinewerk van agentic AI-systemen overneemt.

Vier keer sneller door slimme trucs

Volgens Nvidia haalt het model tot vier keer de uitvoersnelheid van vergelijkbaar grote modellen. Op de testreeks PinchBench behaalde Lightning 86 procent nauwkeurigheid en rondde het tienduizend taken 30 procent sneller af dan concurrent Qwen3.6 35B, bij een vergelijkbare nauwkeurigheid. Een deel van die winst komt door speculatief decoderen: het model stelt alvast meerdere volgende woorden voor, die vervolgens in één keer worden gecontroleerd in plaats van stap voor stap. Nvidia leverde daarvoor twee extra hulpmodellen mee, DSpark en DFlash, die als eerste gok fungeren voordat het hoofdmodel het antwoord bevestigt.

Werk verdelen over meerdere modellen

Lightning is getraind met populaire agent-omgevingen zoals OpenClaw en Hermes Agent, zodat het beter leert omgaan met tools en opdrachten uit de praktijk. Het model draait lokaal op Nvidia's eigen hardware, waaronder de DGX Spark, Jetson-systemen en GeForce RTX 5090-videokaarten, maar is ook te gebruiken in datacenters. Nvidia brengt het model volledig open uit: de gewichten, trainingsdata en trainingsrecepten zijn vrij beschikbaar onder de OpenMDW 1.1-licentie, en ontwikkelaars kunnen het zelf verder trainen met Nvidia's NeMo-tools.

Onderdeel van de lancering is ook NeMo Switchyard, een systeem voor modelroutering dat automatisch bepaalt welk model een taak moet oppakken: een ingewikkelde vraag naar een groot model, een simpele herhaaltaak naar Lightning. Dat moet de rekenkosten drukken van agents die dag en nacht actief blijven en duizenden kleine acties uitvoeren. Het model is te downloaden via Hugging Face en ModelScope, en te gebruiken via platforms als Ollama, LM Studio, Amazon SageMaker JumpStart, Google Cloud, Microsoft Foundry, Oracle Cloud Infrastructure en OpenRouter.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Door zware en lichte AI-modellen te combineren, kunnen bedrijven autonome AI-agents laten draaien zonder de torenhoge rekenkosten van steeds een groot model. Dat maakt AI-agents die continu actief zijn, van klantenservice tot softwareonderhoud, betaalbaarder en sneller. Het onderstreept ook een bredere trend: niet één allesomvattend AI-model, maar teams van gespecialiseerde modellen die samenwerken.

Mixture-of-experts
Een AI-architectuur waarbij een model is opgedeeld in gespecialiseerde onderdelen, waarvan er per taak maar een paar worden gebruikt. Dat bespaart rekenkracht zonder aan kennis in te boeten.
Parameters
De instelbare rekenwaarden die een AI-model tijdens training leert en die samen bepalen hoe het model reageert op een vraag.
Agentic AI
AI-systemen die niet alleen antwoorden geven, maar zelfstandig meerdere stappen uitvoeren, tools aanroepen en taken afhandelen.
Speculatief decoderen
Een techniek waarbij een AI-model alvast meerdere woorden vooruit voorstelt, die daarna in één keer worden gecontroleerd, wat het antwoord versnelt.
Draftmodel
Een klein, snel hulpmodel dat bij speculatief decoderen alvast een eerste gok doet, waarna een groter model die gok controleert of aanpast.
Modelroutering
Software die automatisch bepaalt welk AI-model het beste past bij een specifieke taak, zodat zware modellen alleen worden ingezet als dat nodig is.
Open-weightmodel
Een AI-model waarvan de getrainde parameters (gewichten) openbaar zijn, zodat ontwikkelaars het vrij kunnen gebruiken en aanpassen.
Fine-tuning
Het verder trainen van een bestaand AI-model op specifieke data, om het beter te laten presteren op een bepaalde taak.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen onderling worden vergeleken.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents