AI & computing › Neuromorfe & fotonische chips
Nvidia lanceert speciale chip om AI-agents sneller te laten reageren
Chipgigant Nvidia presenteert een nieuwe versnellerchip die specifiek is gemaakt om zelfstandig handelende AI-systemen sneller te laten reageren. De chip, Groq 3 LPX genaamd, werkt samen met Nvidia's Vera Rubin-platform en moet de vertraging tussen vraag en antwoord flink verkleinen. Grote clouddiensten als Nebius en CoreWeave nemen de nieuwe technologie als eerste in gebruik.
Van pratende chatbot naar handelende AI
Kunstmatige intelligentie verschuift langzaam van simpele chatbots naar zogeheten agentic AI: systemen die zelfstandig meerdere stappen uitvoeren, gereedschappen aanroepen en met andere AI-systemen samenwerken om een taak af te ronden. Voor dat soort taken is snelheid cruciaal. Een AI-agent bouwt zijn antwoord op uit losse woordstukjes, ook wel tokens genoemd, die één voor één worden gegenereerd. Bij een keten van meerdere stappen telt elke kleine vertraging op, waardoor een agent traag en onhandig aanvoelt als de techniek daarachter niet snel genoeg is.
Chipmaker Nvidia presenteerde deze week op de Hot Chips-conferentie in Palo Alto een nieuwe chip die dat probleem moet oplossen: de Groq 3 LPX. Dit is een zogeheten inferentiechip, gespecialiseerd in het razendsnel produceren van tokens, in plaats van het trainen van AI-modellen. In een onafhankelijke test van Artificial Analysis haalde de chip 3.400 tokens per seconde bij een contextvenster van 100.000 tokens, vergelijkbaar met een gesprek van honderdduizenden woorden dat de AI in één keer moet onthouden. Dat is volgens Nvidia vier keer sneller dan het snelste alternatief op de markt.
Honderden chips als één machine
De Groq 3 LPX werkt niet los, maar als uitbreiding op Nvidia's Vera Rubin NVL72, een compleet rek vol rekenchips dat bedrijven gebruiken om AI-diensten op grote schaal te draaien. In dat rek doen gewone grafische chips (gpu's) het zware rekenwerk om lange teksten te verwerken, terwijl de nieuwe LPX-chips zich richten op het snel wegschrijven van het antwoord, woord voor woord. Een volledige opstelling bestaat uit 256 van deze chips, die via directe verbindingen met elkaar praten en zo als één grote machine functioneren. Volgens Nvidia verdwijnt daardoor de traditionele afweging tussen snelheid en volume: bedrijven kunnen zowel snel antwoord geven als veel gebruikers tegelijk bedienen.
Cloudbedrijven en SpaceXAI stappen in
Een aantal grote partijen omarmt de nieuwe technologie meteen. Cloudbedrijf Nebius is de eerste aanbieder die de Groq 3 LPX inzet, om ontwikkelaars snellere en interactievere AI-toepassingen te laten bouwen. Branchegenoot CoreWeave gebruikt inmiddels Nvidia's netwerktechnologie Spectrum-X Multiplane, die de Vera Rubin-rekken onderling verbindt via meerdere parallelle schakelpaden. Dat voorkomt dat bedrijven een extra, kostbare laag aan hun netwerk moeten toevoegen wanneer ze willen opschalen, wat normaal gepaard gaat met meer vertraging en hogere kosten.
Ook SpaceXAI, de AI-tak van het ruimtevaartbedrijf van Elon Musk, kondigde een samenwerking aan. Het bedrijf gaat Nvidia's Vera-processoren gebruiken voor taken achter de schermen van AI-agents, zoals planning, het aansturen van andere programma's en simulaties, zowel in datacenters op aarde als straks mogelijk in satellieten. Nvidia positioneert zich met deze aankondigingen als leverancier van een compleet pakket: rekenchips, geheugen, netwerkapparatuur en gespecialiseerde versnellers die samen een 'AI-fabriek' vormen, gebouwd om zo veel mogelijk tokens tegen zo laag mogelijke kosten te produceren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Doordat AI-agents straks veel sneller en met minder vertraging kunnen reageren, worden toepassingen zoals digitale assistenten, coding-hulpjes en geautomatiseerde klantenservice praktischer en prettiger in gebruik. De strijd om snellere en efficiëntere inferentiechips laat zien dat de AI-industrie zich richt op het verlagen van de kosten per antwoord, wat AI op termijn toegankelijker en goedkoper kan maken.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen uitvoeren en beslissingen nemen om een taak te voltooien, in plaats van simpelweg één vraag te beantwoorden.
- Token
- Een klein stukje tekst, vaak een woord of woorddeel, waarmee taalmodellen tekst opbouwen en lezen.
- Contextvenster
- De hoeveelheid tekst die een AI-model tegelijk kan 'onthouden' en gebruiken tijdens het genereren van een antwoord.
- Inferentiechip
- Een computerchip die is geoptimaliseerd om een al getraind AI-model te gebruiken en antwoorden te genereren, in plaats van het model te trainen.
- LPU
- Een gespecialiseerde chip, ontworpen om tekst razendsnel, token voor token, te genereren.
- Decodelatentie
- De vertraging die optreedt bij het genereren van elk volgend token in een AI-antwoord; hoe lager, hoe vlotter een AI-agent reageert.
- GPU
- Een grafische chip die door zijn vermogen om veel berekeningen tegelijk uit te voeren, is uitgegroeid tot het belangrijkste rekenonderdeel voor AI.
- Rack-scale systeem
- Een complete serverkast vol onderling verbonden chips die samen als één grote rekenmachine functioneert.
- Ethernet-netwerk
- Een veelgebruikte netwerktechnologie waarmee computers en chips onderling data uitwisselen; in datacenters aangepast voor extreem hoge snelheden.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.