AI & computing › Generatieve AI & synthetische media
De CPU is terug: waarom AI-agents niet alles aan de GPU overlaten
Drie jaar lang gold de grafische chip als de onbetwiste motor achter AI-taalmodellen. Nu blijkt de gewone processor, de CPU, weer belangrijker te worden nu AI-systemen steeds vaker zelfstandig taken uitvoeren en met meerdere kleine modellen tegelijk werken. Chipgigant Intel signaleert een fundamentele verschuiving in hoe datacenters voor kunstmatige intelligentie worden ingericht.
Wie de afgelopen jaren over AI-hardware las, kreeg steevast hetzelfde verhaal: de GPU doet het zware werk, de CPU is bijzaak. Dat klopte voor de klassieke chatbot, waarbij één model één vraag beantwoordt. Maar AI-toepassingen zijn veranderd. Steeds vaker roept een taalmodel onderweg externe tools aan, redeneert het in meerdere stappen, en schakelt het tussen kleinere, gespecialiseerde modellen. Die verschuiving verandert de rekenkundige balans tussen CPU en GPU ingrijpend, schrijven onderzoekers van chipfabrikant Red Hat in een technische analyse.
Van simpele chatbot naar zelfstandige AI-agent
Bij een traditionele chatbot stelt een gebruiker een vraag en genereert het model in één keer een antwoord. Daarbij is de GPU koning: de duizenden rekenkernen van zo'n chip zijn perfect toegesneden op de matrixvermenigvuldigingen die de kern vormen van elk taalmodel. Maar bij agentic AI, waarbij een AI-systeem zelfstandig meerdere stappen doorloopt om een taak te volbrengen, komt er veel meer bij kijken. Denk aan een AI-assistent die eerst een zoekopdracht uitvoert, vervolgens de resultaten interpreteert, daarna een berekening laat maken door een gespecialiseerd rekenmodel en pas dan een antwoord formuleert. Al die tussenstappen - het orkestreren van tools, het combineren van kleinere modellen, het bijhouden van de voortgang - vragen relatief weinig van de zware parallelle rekenkracht van een GPU, maar wel veel van de snelle, flexibele verwerkingskracht van een CPU.
Intel ziet de verhouding drastisch verschuiven
Intel becijfert dat de verhouding tussen CPU- en GPU-capaciteit in datacenters daardoor sterk kantelt. Bij het trainen van AI-modellen, waarbij een systeem leert op basis van enorme hoeveelheden data, ligt die verhouding doorgaans op ongeveer één CPU per acht GPU's. Bij inferentie, het daadwerkelijke gebruik van een getraind model om antwoorden te genereren, verschuift dat naar een verhouding van 1:1. In agentic toepassingen, waar meerdere modellen en tools met elkaar samenwerken, ziet Intel de verhouding zelfs omslaan naar vier CPU's per GPU. Dat is een opmerkelijke ommekeer voor een sector die de afgelopen jaren vrijwel uitsluitend investeerde in steeds krachtigere grafische chips.
Wat dit betekent voor datacenters
Voor bedrijven die AI-infrastructuur bouwen, is dit meer dan een technisch detail. Datacenters die alleen op GPU-capaciteit zijn ingericht, lopen het risico dat hun dure grafische chips werkeloos wachten op CPU's die orkestratietaken niet snel genoeg aankunnen. Dat verspilt kostbare en schaarse GPU-capaciteit. Chipmakers en cloudaanbieders herzien daarom hun architecturen: niet langer domineert de GPU alles, maar wordt gezocht naar de juiste balans tussen beide typen chips, afgestemd op het soort AI-taak. Voor de gebruiker verandert er in eerste instantie weinig, maar de manier waarop bedrijven als Intel, Nvidia en cloudproviders hun toekomstige datacenters ontwerpen, staat wel degelijk op de schop.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Nu AI-systemen steeds vaker zelfstandig meerdere stappen doorlopen en met meerdere modellen tegelijk werken, wordt de balans tussen CPU en GPU in datacenters opnieuw doordacht. Dit kan leiden tot efficiëntere en goedkopere AI-infrastructuur, omdat dure GPU's niet langer worden ingezet voor taken waar een gewone processor beter geschikt voor is.
- CPU
- De centrale processor van een computer, geschikt voor flexibele en opeenvolgende taken zoals besturing en orkestratie.
- GPU
- Een grafische chip met duizenden rekenkernen die uitblinkt in het gelijktijdig uitvoeren van dezelfde bewerking op grote hoeveelheden data, essentieel voor AI-training en -inferentie.
- Agentic AI
- AI-systemen die zelfstandig meerdere stappen doorlopen, tools aanroepen en beslissingen nemen om een taak te volbrengen, in plaats van slechts één vraag te beantwoorden.
- Large language model (taalmodel)
- Een AI-model dat is getraind op grote hoeveelheden tekst en daardoor mensachtige taal kan begrijpen en genereren.
- Matrixvermenigvuldiging
- Een wiskundige bewerking waarbij getallenreeksen (matrices) met elkaar worden vermenigvuldigd; dit vormt de rekenkundige kern van elk modern taalmodel.
- Inferentie
- Het daadwerkelijke gebruik van een al getraind AI-model om op basis van nieuwe input een antwoord of resultaat te genereren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.