AI & computing › Generatieve AI & synthetische media

Zo maken techbedrijven AI-chatbots sneller en goedkoper

· Bijgewerkt 2 september 2026, 03:13 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Hacker News frontpage

Elk antwoord van een AI-chatbot kost rekenkracht en dus geld. Het Amerikaanse AI-infrastructuurbedrijf Baseten legt uit welke technische ingrepen taalmodellen echt efficiënter maken, en welke vooral een kwestie zijn van kiezen tussen snelheid en capaciteit.

Elke keer dat je een vraag stelt aan een chatbot zoals ChatGPT, moet een groot taalmodel razendsnel duizenden berekeningen uitvoeren. Dat kost rekenkracht, en dus geld. Bedrijven die deze modellen aanbieden aan andere partijen, zogeheten inference-providers, zoeken voortdurend naar manieren om dezelfde intelligentie sneller en goedkoper te leveren. Het Amerikaanse AI-infrastructuurbedrijf Baseten beschrijft in een technisch artikel welke ingrepen daarbij echt verschil maken, en welke vooral een kwestie van schuiven zijn.

Schuiven op een grens

Ingenieurs die AI-modellen laten draaien, jongleren voortdurend met twee grootheden: latency, de wachttijd tot een antwoord verschijnt, en throughput, hoeveel gebruikers een server tegelijk kan bedienen en dus hoe laag de kosten per antwoord uitvallen. Baseten noemt de best haalbare combinatie van snelheid en capaciteit bij een gegeven hoeveelheid rekenkracht de 'efficiënte grens'. Sommige technieken verschuiven alleen de balans tussen die twee grootheden. Andere technieken duwen de hele grens naar buiten, waardoor een systeem zowel sneller én goedkoper wordt — winst die je vervolgens naar eigen inzicht kunt verdelen.

Kiezen tussen snelheid en volume

De meest voor de hand liggende knop is de batchgrootte: het aantal verzoeken dat een server tegelijk verwerkt. Kleine batches geven gebruikers een snel antwoord, maar benutten dure GPU-chips slecht, wat de kosten per gegenereerd woord opdrijft. Grote batches doen het omgekeerde: iets tragere individuele antwoorden, maar veel meer output per chip. Ook de manier waarop een model over meerdere GPU's wordt verdeeld bepaalt de uitkomst. Sommige vormen van parallellisatie, zoals Tensor Parallellisme, verlagen vooral de wachttijd. Andere, zoals Expert Parallellisme, verhogen juist de doorvoer. Een derde techniek, kwantisatie, verlaagt de rekenprecisie van een model. Dat maakt het model zowel sneller als goedkoper, met als prijs een klein kwaliteitsverlies dat bij moderne rekenformaten vaak nauwelijks merkbaar is.

Structurele verbeteringen die iedereen ten goede komen

Interessanter zijn technieken die de hele efficiëntiegrens verleggen, zonder dat je iets hoeft in te leveren. Kernel-optimalisatie — het finetunen van de allerkleinste rekenstapjes die een chip uitvoert — levert winst op die zich door de hele keten heen optelt. Ook speculatief decoderen hoort in dit rijtje: het model raadt alvast welke woorden waarschijnlijk volgen en controleert die gok in één keer, in plaats van elk woord apart te berekenen. Vooral bij het genereren van programmeercode, waar de volgende regel vaak voorspelbaar is, levert dat grote snelheidswinst op. Een andere aanpak is het loskoppelen van de twee fases waarin een model werkt: eerst het 'lezen' van de vraag en daarna het genereren van het antwoord. Door deze prefill-decode disaggregatie op aparte chips te draaien, kunnen bedrijven elke fase apart optimaliseren voor de aard van het inkomende verkeer.

Volgens Baseten werken deze structurele verbeteringen het beste in combinatie met slimme geheugentechnieken zoals KV-cache-hergebruik en continuous batching, waarbij nieuwe verzoeken doorlopend worden toegevoegd aan een lopende verwerkingsstroom. Voor gebruikers blijft dit allemaal onzichtbaar. Maar het bepaalt wel hoeveel een AI-antwoord kost, hoe snel het verschijnt, en uiteindelijk hoe breed dit soort technologie inzetbaar wordt.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Hoe efficiënter bedrijven AI-modellen laten draaien, hoe goedkoper en toegankelijker geavanceerde AI wordt voor consumenten en bedrijven. Deze technische vooruitgang bepaalt mede hoe snel AI-assistenten, programmeerhulpjes en andere toepassingen kunnen opschalen zonder dat de energiekosten en rekenkosten uit de hand lopen.

Efficiënte grens
De best haalbare combinatie van snelheid en capaciteit die een AI-systeem kan bereiken bij een gegeven hoeveelheid rekenkracht.
Latency
De wachttijd tussen het stellen van een vraag aan een AI-model en het verschijnen van het antwoord.
Throughput
Het aantal verzoeken of tokens dat een server per tijdseenheid kan verwerken; bepaalt mede de kosten per antwoord.
Batchgrootte
Het aantal gebruikersverzoeken dat een server tegelijk verwerkt; een grotere batch verhoogt de capaciteit maar verlaagt de snelheid per gebruiker.
Tensor Parallellisme
Een manier om een groot AI-model over meerdere GPU's te verdelen, gericht op het verlagen van de wachttijd per antwoord.
Expert Parallellisme
Een vorm van modelverdeling over GPU's waarbij vooral de totale doorvoer van een systeem wordt verhoogd.
Kwantisatie
Het verlagen van de rekenprecisie van een AI-model om het sneller en goedkoper te maken, met een klein risico op kwaliteitsverlies.
Kernel-optimalisatie
Het verbeteren van de allerkleinste rekenstappen die een computerchip uitvoert, wat zich door de hele verwerkingsketen heen optelt.
Speculatief decoderen
Een techniek waarbij een AI-model vast een gok doet over de volgende woorden en die in één keer controleert, in plaats van elk woord apart te berekenen.
Prefill-decode disaggregatie
Het loskoppelen van de fase waarin een model een vraag 'leest' en de fase waarin het een antwoord genereert, zodat beide apart geoptimaliseerd kunnen worden.
KV-cache
Een geheugentechniek waarbij eerder berekende informatie wordt hergebruikt, zodat een AI-model niet steeds vanaf nul hoeft te rekenen.
Continuous batching
Een methode waarbij nieuwe gebruikersverzoeken doorlopend worden toegevoegd aan een lopende verwerkingsstroom, zonder te wachten tot een batch vol is.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media