AI & computingAgentic AI & autonome agents

Nvidia's nieuwe AI-chip Vera Rubin doet tot 30 keer meer werk per watt

· Bijgewerkt 24 augustus 2026, 18:16 · 2 min leestijd

Agentic AI & autonome agents
Beeld: NVIDIA blog

Nvidia claimt een forse efficiëntiesprong voor kunstmatige intelligentie die zelfstandig taken uitvoert. Het nieuwe chipsysteem Vera Rubin NVL72 levert volgens gemeten testresultaten tot dertig keer meer rekenwerk per megawatt dan de huidige generatie GB300 NVL72, specifiek bij taken voor agentic AI. Voor datacenters die tegen stroomlimieten aanlopen, betekent dat evenveel werk met een fractie van de energie.

Agentic AI: waarom een taak ineens duizenden stappen kost

Een gewone chatvraag aan een taalmodel is voor een computer een simpele klus. Een AI-agent die zelfstandig een taak uitvoert, is dat niet. Volgens cijfers van dataplatform OpenRouter verbruiken dit soort taken gemiddeld vijftien keer zoveel tokens, de tekstfragmenten waarmee taalmodellen rekenen, als een simpel gesprek.

Dat komt door de manier waarop agents werken. Stel dat een AI-agent onderzoek moet doen naar een bedrijf voor een investeringsbeslissing. De agent doorzoekt financiële databases en nieuwsberichten, roept een hulp-agent aan om concurrenten te vergelijken en waarderingen te berekenen, en voegt alles samen tot een advies. Elke stap levert nieuwe tekst op die weer als invoer dient voor de volgende stap. Daardoor stapelt de hoeveelheid tekst die verwerkt moet worden zich snel op, tot honderdduizenden tokens per sessie. Hetzelfde patroon speelt bij softwareontwikkeling, klantenservice en onderzoekstaken. Nu bedrijven dit soort AI-agents op grote schaal inzetten, moet de onderliggende hardware die groeiende vraag efficiënt kunnen bijbenen.

Hoe Nvidia de winst boekt

Nvidia testte de Vera Rubin NVL72-systemen met een benchmark van analysebureau SemiAnalysis, genaamd AgentX. Die bootst echte programmeersessies van AI-agents na, inclusief groeiende tekstcontext, tool-aanroepen en het inschakelen van hulp-agents. Op dat soort realistische taken presteert Vera Rubin tot dertig keer beter per megawatt dan het huidige GB300-systeem, bij het AI-model DeepSeek V4 Pro. Dat vertaalt zich ook in de portemonnee: tot vijfendertig keer lagere kosten per miljoen verwerkte tokens.

Die winst komt niet uit één truc, maar uit een stapeling van technische aanpassingen. Zo splitst het systeem het lezen van de invoer en het genereren van een antwoord in twee aparte fases die onafhankelijk van elkaar kunnen opschalen, een aanpak die bekendstaat als prefill-decode disaggregatie. Het geheugen met eerder verwerkte tekst, de kv-cache, wordt verdeeld over meerdere chips en deels overgeheveld naar opslag zodra het minder actief wordt, zodat niets dubbel hoeft te worden berekend. Rekenmodellen die uit meerdere gespecialiseerde onderdelen bestaan, worden slim verdeeld over de beschikbare chips via expertparallellisme. Daarnaast comprimeert de chip modelgewichten naar een compacter rekenformaat, wat geheugen bespaart zonder dat de kwaliteit van de antwoorden merkbaar daalt.

Nvidia's eigen energiebeheersysteem verdeelt bovendien het beschikbare vermogen slimmer over chips en rekken in het scale-up-domein, waardoor tot veertig procent meer chips binnen hetzelfde energiebudget passen. Vera Rubin NVL72 bestaat uit zeven soorten chips, waaronder een eigen processor, netwerkchips en de opvolger van de huidige generatie grafische chips, en draait inmiddels in volledige productie bij verschillende partners.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als AI-agents efficiënter draaien, kunnen datacenters meer autonome taken uitvoeren binnen dezelfde energiegrens, wat de opmars van agentic AI in bedrijven versnelt en de kosten per taak verlaagt. Tegelijk groeit de energiehonger van AI in absolute zin verder, ook al daalt het verbruik per taak.

Agentic AI
Kunstmatige intelligentie die zelfstandig meerdere stappen uitvoert om een taak te voltooien, zoals onderzoek doen of code schrijven, zonder dat een mens elke stap aanstuurt.
Token
Een klein tekstfragment waarmee taalmodellen rekenen; hoe meer tokens een taak verwerkt, hoe meer rekenkracht en energie dat kost.
Megawatt
Eenheid van vermogen; datacenters worden vaak begrensd door hoeveel megawatt aan stroom ze beschikbaar hebben, niet door het aantal chips.
KV-cache
Het tijdelijke geheugen waarin een AI-model eerder verwerkte tekst bewaart, zodat het die niet steeds opnieuw hoeft te berekenen.
Prefill-decode disaggregatie
Een techniek waarbij het inlezen van de vraag en het genereren van het antwoord op aparte chips gebeuren, zodat beide onderdelen apart kunnen worden opgeschaald.
Expertparallellisme
Een methode waarbij een AI-model, opgebouwd uit meerdere gespecialiseerde deelnetwerken, over veel chips tegelijk wordt verdeeld om sneller te rekenen.
Scale-up-domein
Een groep van tientallen chips die via snelle verbindingen als één groot rekensysteem samenwerkt, in plaats van los van elkaar te functioneren.
Kv-cache-offloading
Het verplaatsen van minder actief gebruikte cachegegevens naar goedkopere opslag, om geheugenruimte op de dure rekenchips vrij te maken.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents