AI & computing › Agentic AI & autonome agents
Nvidia lanceert zuiniger AI-model voor razendsnelle autonome taken
Nvidia breidt zijn open Nemotron-familie uit met Nemotron 3.5 Lightning, een compact AI-model dat volgens het bedrijf tot vier keer sneller werkt dan vergelijkbare modellen. Tegelijk introduceert Nvidia NeMo Switchyard, software die automatisch het juiste AI-model kiest voor elke taak binnen een groter systeem van samenwerkende AI-agents.
Steeds meer bedrijven zetten AI niet meer alleen in als chatbot, maar als agentic AI: systemen die zelfstandig taken uitvoeren, van het beantwoorden van facturen tot het controleren van programmeercode. Voor dat soort continu draaiende taken presenteert Nvidia nu Nemotron 3.5 Lightning, een open en aanpasbaar model met 30 miljard parameters. Het bedrijf noemt het model het meest efficiënte in zijn klasse voor langdurige, herhaalde AI-taken.
Nemotron 3.5 Lightning is een zogeheten mixture-of-experts-model. Dat betekent dat het niet bij elke vraag zijn volledige rekenkracht inzet, maar alleen de onderdelen activeert die nodig zijn voor de specifieke taak. Dat maakt het model sneller en goedkoper in gebruik dan een even groot model dat altijd volledig 'aan' staat. Volgens Nvidia voltooit het model agentachtige taken tot 30 procent sneller dan concurrerende modellen van vergelijkbare omvang, terwijl de nauwkeurigheid op het niveau van grotere, duurdere modellen blijft.
Kleine specialist naast grote denker
Het idee achter Nemotron 3.5 Lightning is dat grote AI-systemen straks niet uit één alleskunnend model bestaan, maar uit meerdere gespecialiseerde modellen die samenwerken. Een groot 'redeneermodel' bedenkt de aanpak en verdeelt het werk, terwijl kleinere modellen zoals Lightning de concrete deeltaken uitvoeren: code nakijken, beveiligingswaarschuwingen beoordelen of klantvragen over facturen afhandelen. Bedrijven als CrowdStrike, Harvey en CodeRabbit hebben het model al aangepast voor hun eigen toepassingen in cybersecurity, juridisch advies en softwareontwikkeling. Omdat het model open is, kunnen organisaties het zelf verder trainen op eigen data via post-training, en lokaal laten draaien op eigen servers, workstations of pc's voor meer privacy en controle.
Een verkeersleider voor AI-modellen
Naast het nieuwe model brengt Nvidia ook NeMo Switchyard uit, een open source hulpmiddel voor modelroutering. Grote AI-systemen gebruiken vaak meerdere modellen naast elkaar: één is goed in programmeren, een ander in redeneren, weer een ander is juist snel en goedkoop. Zonder automatische routering moeten ontwikkelaars zelf handmatig bepalen welk model welke taak krijgt, wat tijd kost en fouten oplevert. NeMo Switchyard stuurt elk verzoek automatisch naar het meest geschikte model, op basis van eisen als snelheid, kosten of nauwkeurigheid.
Uit interne tests van Nvidia blijkt dat deze aanpak de kosten van taken kan terugbrengen tot ongeveer een derde vergeleken met het gebruik van alleen een groot topmodel, zonder dat de kwaliteit merkbaar daalt. Ook partners melden winst: softwarebedrijf Boomi stuurde in tests 59 procent van het verkeer naar een vijf keer sneller fijngestemd model, en betaalplatform Ramp bespaarde 58 procent op kosten en 33 procent op rekentijd bij het testen van programmeertaken. Nemotron 3.5 Lightning is beschikbaar via onder meer Hugging Face en Nvidia's eigen platform, NeMo Switchyard staat op GitHub.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Deze release laat zien dat de toekomst van bedrijfsmatige AI niet draait om één almachtig model, maar om teams van gespecialiseerde AI-systemen die automatisch samenwerken en elkaar aansturen. Dat maakt AI-toepassingen goedkoper, sneller en beter te controleren, wat de drempel verlaagt voor bedrijven om autonome AI-agents op grote schaal in te zetten.
- Agentic AI
- AI-systemen die zelfstandig taken plannen en uitvoeren, zonder dat een mens elke stap aanstuurt.
- Mixture-of-experts
- Een AI-modelarchitectuur die alleen de benodigde onderdelen van het model activeert per taak, wat rekenkracht en kosten bespaart.
- Modelroutering
- Het automatisch doorsturen van een taak naar het AI-model dat daar het beste en goedkoopst voor geschikt is.
- Post-training
- Het verder trainen van een kant-en-klaar AI-model op specifieke, eigen data om het beter te maken in een bepaalde taak.
- Open model
- Een AI-model waarvan de bouwstenen (en vaak trainingsdata) openbaar zijn, zodat organisaties het zelf kunnen aanpassen en lokaal draaien.
- Tokenomics
- De kosten- en efficiëntiebalans van AI-gebruik, uitgedrukt in hoeveel 'tokens' (tekstfragmenten) een taak verbruikt.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.