AI & computingGeneratieve AI & synthetische media

vLLM: de motor die AI-chatbots sneller en goedkoper maakt

· Bijgewerkt 7 augustus 2026, 01:34 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Hacker News frontpage

Elke keer dat je een vraag stelt aan een chatbot als ChatGPT, moet er op de achtergrond razendsnel gerekend worden op dure GPU-servers. Het open-source systeem vLLM zorgt ervoor dat die servers veel meer gebruikers tegelijk kunnen bedienen, tegen lagere kosten. Een uitgebreide technische analyse van ontwikkelaar Aleksa Gordić laat zien hoe dat precies werkt.

Grote taalmodellen zoals die achter ChatGPT of Claude draaien niet zomaar op een laptop. Ze hebben clusters van dure grafische chips (GPU's) nodig, en elke seconde rekentijd kost geld. Hoe efficiënter een bedrijf die GPU's benut, hoe goedkoper en sneller het zijn AI-dienst kan aanbieden. Daar komt vLLM in beeld: een open-source softwaresysteem dat is uitgegroeid tot een van de populairste manieren om large language models op schaal te draaien. Techneut Aleksa Gordić dook in de broncode en beschrijft in detail hoe het systeem onder de motorkap werkt.

Het geheugenprobleem van AI-modellen

Een taalmodel genereert tekst woord voor woord, of eigenlijk token voor token. Voor elk token dat het produceert, moet het model tussentijdse rekenresultaten onthouden in het geheugen van de GPU, de zogeheten KV-cache. Bij lange gesprekken of meerdere gebruikers tegelijk loopt dat geheugengebruik snel op. Vroeger reserveerden systemen voor elk gesprek alvast een groot blok geheugen, ook als dat grotendeels leeg bleef. Dat verspilde kostbare GPU-capaciteit.

vLLM lost dit op met een techniek die de onderzoekers paged attention noemen, geïnspireerd op hoe besturingssystemen van computers hun werkgeheugen indelen in kleine, herbruikbare blokjes. In plaats van één groot blok per gebruiker te reserveren, knipt vLLM het geheugen op in stukjes van bijvoorbeeld zestien tokens. Die stukjes worden pas aangemaakt zodra ze nodig zijn en direct weer vrijgegeven zodra een gesprek stopt. Daardoor past een server veel meer gelijktijdige gebruikers in hetzelfde geheugen.

Nooit stilstaan: continu nieuwe verzoeken invoegen

Een tweede pijler is continuous batching. Traditionele systemen verwerkten verzoeken in vaste groepen: pas als een hele groep klaar was, mocht er een nieuwe groep starten. Dat betekent dat een GPU soms wacht tot de langzaamste gebruiker in een groep klaar is, terwijl de rest allang een antwoord heeft. vLLM voegt in plaats daarvan na elke rekenstap direct nieuwe verzoeken toe aan de lopende berekening. Zo blijft de GPU vrijwel continu volledig belast, zonder wachttijd.

Achter dit alles zit een planner, de scheduler, die per rekenstap bepaalt welke gebruikersverzoeken aan de beurt zijn. Die planner houdt bij welke gesprekken nog moeten beginnen (prefill, het verwerken van de oorspronkelijke vraag) en welke al bezig zijn met het genereren van een antwoord (decode). Voor extra snelheid legt vLLM veelgebruikte rekenpatronen ook vast in zogeheten CUDA-graphs: kant-en-klare routes door de GPU-chip die herhaald worden afgespeeld, zodat de chip minder tijd kwijt is aan het opstarten van nieuwe rekenopdrachten.

Waarom dit ertoe doet

Dit soort optimalisaties klinkt technisch, maar heeft directe gevolgen voor de gebruiker: snellere antwoorden en lagere kosten per vraag. Voor AI-bedrijven die miljoenen verzoeken per dag verwerken, kan een efficiëntere inzet van GPU's het verschil maken tussen winst en verlies. Gordić benadrukt dat dit artikel nog maar het topje van de ijsberg is: vervolgstukken gaan dieper in op technieken als speculatief decoderen en het opschalen naar honderden GPU's tegelijk.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Efficiëntere software zoals vLLM bepaalt mede hoe snel en betaalbaar AI-diensten worden voor gewone gebruikers. Naarmate meer bedrijven en overheden AI-modellen zelf willen draaien, wordt dit soort onderliggende infrastructuur net zo belangrijk als het taalmodel zelf. Het verklaart ook waarom vraag naar krachtige GPU's wereldwijd blijft stijgen, ondanks efficiëntieverbeteringen.

vLLM
Een open-source softwaresysteem dat grote taalmodellen efficiënt op GPU's laat draaien, zodat meerdere gebruikers tegelijk snel antwoord krijgen.
GPU
Een grafische chip die van oorsprong voor games werd gebruikt, maar inmiddels de rekenkracht levert achter AI-modellen.
KV-cache
Het geheugen op een GPU waarin een taalmodel tussentijdse rekenresultaten opslaat tijdens het genereren van tekst.
Paged attention
Een techniek die het GPU-geheugen opdeelt in kleine, herbruikbare blokjes, zodat er minder geheugen verspild wordt.
Continuous batching
Een methode waarbij nieuwe gebruikersverzoeken doorlopend worden toegevoegd aan een lopende berekening, zodat de GPU nooit stilstaat.
Token
Een stukje tekst, vaak een woord(deel), dat de kleinste eenheid vormt waarmee een taalmodel rekent.
CUDA-graph
Een vooraf vastgelegde reeks rekenstappen op een GPU die herhaald kan worden afgespeeld om tijd te besparen.
Prefill
De fase waarin een taalmodel de oorspronkelijke vraag of prompt in één keer verwerkt, voordat het begint met antwoorden.
Decode
De fase waarin een taalmodel woord voor woord het antwoord genereert.
Scheduler
Het onderdeel van het systeem dat bepaalt welke gebruikersverzoeken op elk moment door de GPU worden verwerkt.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media