AI & computingAgentic AI & autonome agents

NVIDIA brengt supersnel open AI-model uit voor lokale agents

· Bijgewerkt 11 augustus 2026, 15:32 · 2 min leestijd

Agentic AI & autonome agents
Beeld: NVIDIA blog

NVIDIA introduceert Nemotron 3.5 Lightning, een open AI-model dat tot vier keer sneller tekst genereert dan vergelijkbare modellen en volledig op de eigen computer draait. Het bedrijf presenteert ook NeMo Switchyard, software die automatisch de goedkoopste en snelste combinatie van AI-modellen kiest. Samen moeten ze lokale, autonome AI-assistenten praktischer en betaalbaarder maken.

NVIDIA breidt zijn familie open AI-modellen uit met Nemotron 3.5 Lightning, een nieuw taalmodel gebouwd voor razendsnelle, altijd actieve AI-assistenten. Het model draait volledig lokaal, op een gewone pc of laptop, en is tot vier keer sneller dan vergelijkbare open modellen. Tegelijk introduceert het bedrijf NeMo Switchyard, software die automatisch de goedkoopste en snelste AI-optie kiest voor elke stap binnen een AI-agent.

Dertig miljard parameters, vier keer zo snel

Nemotron 3.5 Lightning telt 30 miljard parameters, de instelbare rekenwaarden waarmee een AI-model taal leert begrijpen en genereren. Het model gebruikt een zogeheten mixture-of-experts-architectuur: in plaats van steeds het volledige model te gebruiken, schakelt het per vraag alleen de meest geschikte deelnetwerken in. Dat maakt het model zuiniger en sneller dan modellen van vergelijkbare omvang. NVIDIA claimt tot vier keer snellere tekstgeneratie en dertig procent kortere responstijd dan concurrerende open modellen in dezelfde gewichtsklasse.

Zelf bijtrainen op smaak en vakgebied

Omdat Nemotron 3.5 Lightning een open-weightmodel is, kunnen ontwikkelaars en hobbyisten de onderliggende gewichten downloaden en zelf aanpassen. Door het model te fine-tunen met eigen voorbeelden, leert het bijvoorbeeld schrijven in een vaste huisstijl, het jargon van een specifiek vakgebied begrijpen, of code schrijven volgens de conventies van een bepaald team. Gekoppeld aan toegang tot bestanden en andere programma's op de computer, kan zo'n bijgeschoold model uitgroeien tot een persoonlijke assistent: van een hulp die e-mail en agenda beheert, tot een slimme-huisassistent of een programmeerhulp die meekijkt in de eigen codebase.

Van laptop tot datacenter

NVIDIA werkte samen met de makers van veelgebruikte lokale AI-software zoals vLLM, Ollama, llama.cpp en LM Studio om het model makkelijk op eigen apparatuur te laten draaien. Het model is beschikbaar in twee compacte formaten, NVFP4 en GGUF, waardoor het ook op minder zware hardware past. AI-bedrijf Unsloth levert vanaf dag één geoptimaliseerde versies. Nemotron 3.5 Lightning draait op NVIDIA RTX-pc's, de DGX Spark en vergelijkbare GB10-systemen van andere fabrikanten, en op de kleine Jetson-computers voor apparaten en robots. Voor zwaardere taken schaalt hetzelfde model op naar RTX PRO-werkstations, DGX Station-systemen en volledige datacenters, met ondersteuning van hardwaremakers als Dell, HP, Lenovo, ASUS en Supermicro.

Slimmer schakelen tussen AI-modellen bespaart geld

Naast het nieuwe model lanceert NVIDIA ook NeMo Switchyard, een opensource-bibliotheek die autonome AI-agents helpt kiezen welk AI-model elke stap in een taak het beste uitvoert. Het systeem weegt automatisch nauwkeurigheid, snelheid en kosten tegen elkaar af, en verdeelt werk over verschillende modellen en aanbieders. Volgens interne tests van NVIDIA hield deze aanpak het prestatieniveau van de duurste AI-modellen overeind, terwijl de rekenkosten daalden tot ongeveer een derde van wat het draaien op alleen het topmodel Opus 4.8 zou kosten. Voor bedrijven die steeds meer AI-agents inzetten, kan dat een flinke besparing betekenen naarmate het gebruik van taalmodellen toeneemt.

Nemotron 3.5 Lightning is te vinden via OpenRouter, als NIM-microservice op build.nvidia.com en bij een reeks cloudpartners. NeMo Switchyard staat als opensourceproject op GitHub, zodat ontwikkelaars het direct kunnen inbouwen in eigen AI-toepassingen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Doordat krachtige AI-modellen steeds efficiënter lokaal draaien, hoeven gebruikers niet meer afhankelijk te zijn van dure clouddiensten voor persoonlijke AI-assistenten. Slimme routering tussen modellen, zoals NeMo Switchyard laat zien, kan bedrijven helpen de kosten van agentic AI in de hand te houden naarmate het gebruik groeit. Dat opent de deur voor meer betaalbare, op maat gemaakte AI-hulpjes op alledaagse apparaten.

Mixture-of-experts (MoE)
Een AI-architectuur waarbij een model per taak alleen de meest relevante deelnetwerken activeert, wat rekenkracht bespaart.
Open-weightmodel
Een AI-model waarvan de getrainde parameters vrij te downloaden en aan te passen zijn.
Fine-tunen
Het bijtrainen van een kant-en-klaar AI-model met eigen voorbeelden, zodat het beter past bij een specifieke taak of stijl.
Agentic AI
AI-systemen die zelfstandig meerdere stappen uitvoeren om een taak te voltooien, zonder dat een mens telkens tussentijds hoeft in te grijpen.
Modelroutering
Een techniek waarbij software automatisch bepaalt welk AI-model een taak het beste, snelste of goedkoopste kan uitvoeren.
GGUF-formaat
Een compact bestandsformaat voor AI-modellen, veel gebruikt om taalmodellen efficiënt op gewone computers te laten draaien.
NVFP4
Een compact getalformaat waarmee een AI-model met minder geheugen en rekenkracht kan draaien, met een beperkt verlies aan nauwkeurigheid.
Parameters
De instelbare rekenwaarden binnen een AI-model die samen bepalen hoe het taal verwerkt en genereert.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents