AI & computingAgentic AI & autonome agents

AI is zijn eigen grootste klant: tokenverbruik door AI-agents 14 keer omhoog

· Bijgewerkt 23 augustus 2026, 12:17 · 2 min leestijd

Agentic AI & autonome agents
Beeld: The Decoder

Sinds 6 februari 2026 verbruiken AI-agents meer taalbrokjes, oftewel tokens, dan mensen. Op platform OpenRouter steeg het tokenverbruik van autonome AI-agents sindsdien 14 keer, terwijl menselijk gebruik slechts 2,8 keer groeide. Doordat het merendeel van dat verbruik uit goedkope, hergebruikte data komt, stijgen de kosten veel minder hard dan de ruwe cijfers doen vermoeden.

AI-systemen praten steeds vaker met zichzelf, en dat is inmiddels goed te meten. Analist Peter Walker van AI-marktplaats OpenRouter berekende dat 6 februari 2026 waarschijnlijk de laatste dag was waarop mensen meer tokens verbruikten dan agentic AI: AI-systemen die zelfstandig taken uitvoeren zonder dat een mens elke stap goedkeurt. Sindsdien is het tokenverbruik van deze agents 14 keer zo groot geworden, van 0,51 biljoen naar 7,3 biljoen tokens. Menselijk gebruik van dezelfde AI-modellen groeide in diezelfde periode slechts 2,8 keer.

Wat zijn tokens en waarom lopen agents zo hard op

Tokens zijn de kleine tekstbrokjes waarin AI-taalmodellen taal opknippen om te kunnen verwerken en genereren. Elk woord of woorddeel kost tokens, en dus geld en rekenkracht. AI-agents werken steeds vaker urenlang zelfstandig door aan een taak, bijvoorbeeld het schrijven van code of het doorzoeken van documenten. Onderweg starten ze regelmatig nieuwe AI-processen op om deeltaken uit te voeren, wat het totale tokenverbruik snel laat oplopen. Waar een mens een paar vragen aan een chatbot stelt, kan een agent duizenden keren tussenstappen doorrekenen voordat het eindresultaat klaar is.

Waarom de rekening niet even hard stijgt

Toch is er een belangrijke nuance: bijna 70 procent van het tokenverbruik door agents komt uit cache, ofwel hergebruikte informatie die het AI-model al eerder heeft verwerkt en niet opnieuw hoeft te berekenen. Deze vorm van slim geheugenbeheer, vergelijkbaar met de techniek achter KV-cache, wordt veel goedkoper in rekening gebracht dan verse berekeningen. Daardoor stijgen de daadwerkelijke kosten van al dat agentgebruik veel minder snel dan de ruwe tokencijfers suggereren.

Grotere trend achter de cijfers

OpenRouter is een marktplaats die veel open-weight modellen aanbiedt: AI-modellen waarvan de onderliggende instellingen openbaar zijn. Deze modellen zijn doorgaans minder zuinig met tokens dan de commerciële modellen van bijvoorbeeld OpenAI of Anthropic, wat de cijfers van OpenRouter mogelijk wat opblaast. Toch verwachten waarnemers dat de trend bij de grote AI-labs vergelijkbaar is. De opmars van redeneringsmodellen, die eerst uitgebreid 'nadenken' voordat ze antwoord geven, speelt hierbij ook een rol: die modellen genereren van nature al meer tokens per taak, ook wanneer dat eigenlijk niet nodig is.

De cijfers van OpenRouter laten zien hoe snel het zwaartepunt van AI-gebruik verschuift van mensen die vragen stellen naar machines die zelfstandig werken en elkaar aansturen. Naarmate bedrijven meer taken aan AI-agents uitbesteden, groeit de vraag naar rekenkracht en energie navenant, ook al houdt slimme caching de kostenstijging voorlopig nog enigszins in toom.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Deze cijfers laten zien dat AI in hoog tempo verschuift van een hulpmiddel voor mensen naar een systeem dat vooral zichzelf aan het werk houdt. Dat vergroot de vraag naar datacenters, chips en energie, en maakt efficiënte technieken zoals caching steeds belangrijker om de kosten en het energieverbruik beheersbaar te houden.

Agentic AI
AI-systemen die zelfstandig taken uitvoeren en beslissingen nemen, zonder dat een mens elke stap hoeft goed te keuren.
Token
Een klein tekstbrokje waarin AI-taalmodellen taal opknippen om te kunnen verwerken; het gebruik ervan bepaalt de kosten en rekenkracht van een AI-taak.
Cache / KV-cache
Een geheugentechniek waarbij eerder verwerkte informatie wordt hergebruikt in plaats van opnieuw berekend, waardoor AI-verzoeken sneller en goedkoper worden.
Open-weight model
Een AI-model waarvan de onderliggende parameters openbaar toegankelijk zijn, in tegenstelling tot gesloten commerciële modellen.
Redeneringsmodel
Een type AI-model dat eerst uitgebreid interne redeneerstappen doorloopt voordat het een antwoord geeft, wat doorgaans meer tokens kost.
Tokeninflatie
De trend waarbij AI-modellen steeds meer tokens gebruiken om dezelfde taak uit te voeren, bijvoorbeeld door langer 'nadenken' of extra tussenstappen.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents