Kennisbank

Promptcaching: hoe AI-modellen sneller en goedkoper antwoorden door werk te onthouden

Bijgewerkt: 23 september 2026 · 6 min leestijd

Stel je een advocaat voor die voor elke nieuwe vraag over een dik contract het hele document opnieuw van kaft tot kaft moet doorlezen, ook al betreft het details die hij tien minuten eerder ook al bekeek. Dat kost tijd en energie. Een slimmere advocaat legt aantekeningen en markeringen klaar, zodat hij bij de volgende vraag niet weer bij pagina één hoeft te beginnen. Promptcaching doet iets vergelijkbaars voor kunstmatige intelligentie: het laat een taalmodel het rekenwerk dat het al deed voor een deel van een gesprek of document onthouden, zodat het dat stuk niet telkens opnieuw hoeft te verwerken.

De term duikt steeds vaker op in nieuws over AI-chatbots en de programmeerkoppelingen (API's, de "loketten" waarmee ontwikkelaars software laten praten met een taalmodel) die daarachter zitten. Promptcaching is geen doorbraak in wat AI kan begrijpen of bedenken, maar een technische optimalisatie: dezelfde soort vraag wordt sneller en goedkoper beantwoord, vooral wanneer een gebruiker herhaaldelijk terugvalt op dezelfde lange instructie, hetzelfde document of dezelfde gespreksgeschiedenis. Voor grote AI-bedrijven is het inmiddels een standaardonderdeel van hun dienstverlening geworden.

Wat is het precies?

Een taalmodel als Claude, GPT-4o of Gemini leest tekst niet als een mens, maar knipt die op in stukjes die tokens heten (ruwweg een woorddeel per token). Voor elk token berekent het model, laag voor laag, wiskundige waarden die bepalen hoe dat token zich verhoudt tot alle andere tokens in de tekst. Dat proces heet attention (aandacht), en de tussenresultaten ervan worden opgeslagen in wat onderzoekers de KV-cache noemen (key-value cache).

Normaal gesproken wordt die berekening bij elke nieuwe aanvraag helemaal opnieuw uitgevoerd, ook als het grootste deel van de tekst identiek is aan de vorige keer. Denk aan een chatbot die bij elk bericht de hele gespreksgeschiedenis plus een lange systeeminstructie meestuurt: zonder caching herberekent het model die hele geschiedenis telkens weer, terwijl alleen de laatste zin nieuw is.

Promptcaching zorgt ervoor dat die tussenresultaten na de eerste keer bewaard blijven, doorgaans een paar minuten tot enkele uren. Komt er een nieuwe aanvraag binnen met exact hetzelfde begin (de "prefix"), dan haalt het systeem de opgeslagen berekeningen op en verwerkt het alleen het nieuwe, unieke stuk aan het eind. Verandert er iets middenin de tekst, dan vervalt de cache vanaf dat punt, omdat de berekeningen van latere tokens afhankelijk zijn van alles wat daarvoor kwam.

Sommige aanbieders laten ontwikkelaars zelf aangeven welk deel van een prompt gecachet moet worden (expliciete caching), andere doen dit automatisch zodra een prompt lang genoeg is. Beide varianten bestaan inmiddels naast elkaar.

Wat wil men ermee bereiken?

Het belangrijkste doel is snelheid en kosten. Het herberekenen van tokens vergt rekenkracht op dure, energie-intensieve chips (GPU's). Door dat werk niet te herhalen, kan een antwoord sneller verschijnen — vooral het allereerste stukje tekst, de zogeheten time to first token — en wordt de rekening voor ontwikkelaars lager, omdat aanbieders gecachete tokens tegen een fors gereduceerd tarief aanrekenen.

Dat is geen bijzaak. Naarmate AI-toepassingen groeien, worden prompts steeds langer: een programmeerassistent die een hele codebase meestuurt, een juridische tool die een compleet contract analyseert, of een AI-agent die tientallen keren per taak dezelfde toolbeschrijvingen en instructies herhaalt. Zonder caching zouden zulke toepassingen onwerkbaar traag en duur worden.

Er is ook een bredere reden: naarmate modellen "langere geheugens" krijgen (contextvensters van honderdduizenden tot miljoenen tokens), wordt het praktisch onmogelijk om al die informatie bij elke vraag opnieuw te verwerken zonder caching. De techniek is daarmee een randvoorwaarde geworden om lange documenten en langlopende gesprekken bruikbaar te houden. Aanbieders wijzen soms ook op een lager energieverbruik doordat rekenwerk niet dubbel wordt uitgevoerd, al is dat effect lastig onafhankelijk te controleren.

Voorbeelden uit de praktijk

Anthropic voerde promptcaching medio 2024 in voor zijn Claude-modellen. Ontwikkelaars konden zelf aangeven welk deel van een prompt — bijvoorbeeld een lang document of een uitgebreide systeeminstructie — in de cache moest, met aanvankelijk een bewaartijd van vijf minuten; later kwam daar een optie van een uur bij. Anthropic meldde dat dit de kosten voor dat soort toepassingen fors kon verlagen en de reactietijd merkbaar kon versnellen.

OpenAI introduceerde eind 2024 automatische caching voor langere prompts bij GPT-4o en verwante modellen. Ontwikkelaars hoeven hier niets voor te configureren: het systeem herkent zelf herhaalde prefixen en rekent voor het gecachete deel een aanzienlijk lagere prijs dan voor nieuw verwerkte tokens.

Google bracht in 2024 "context caching" uit voor zijn Gemini-modellen, bedoeld voor toepassingen met zeer lange invoer, zoals het herhaaldelijk bevragen van een lange video, een grote codebase of een omvangrijk documentenarchief. Hier betaalt de ontwikkelaar een aparte, relatief lage opslagprijs per uur voor het bewaren van de cache, naast een verlaagd tarief per gecachet token.

Het Chinese DeepSeek maakte in de zomer van 2024 bekend caching niet alleen in het dure GPU-geheugen te bewaren, maar ook op goedkopere schijfopslag ("context caching on disk"). Dit droeg bij aan de opvallend lage prijzen van DeepSeeks API en kreeg extra aandacht toen het bedrijf begin 2025 met het model DeepSeek-R1 wereldwijd in het nieuws kwam vanwege zijn efficiëntie.

Ook buiten de grote commerciële aanbieders is de techniek doorgedrongen: open source-projecten als vLLM (ontwikkeld door onderzoekers aan UC Berkeley) en SGLang (van LMSYS Org, bekend van de Chatbot Arena-ranglijst) bieden "automatische prefix-caching" en een variant genaamd RadixAttention, waarmee ook organisaties die hun eigen taalmodellen draaien van vergelijkbare voordelen kunnen profiteren.

Hoe ver is de techniek?

Promptcaching is, ruim een jaar na de eerste brede uitrol, geen experimentele niche meer maar een standaardvoorziening bij vrijwel alle grote taalmodel-API's. Het tempo waarin het zich verspreidde was hoog: binnen enkele maanden na de eerste brede introducties in 2024 volgden de meeste grote aanbieders met eigen varianten.

Toch is de techniek niet af. Aanbieders verschillen sterk in hoe lang een cache bewaard blijft, wat het kost en of caching automatisch of handmatig werkt — standaardisatie ontbreekt vooralsnog. Onderzoekers werken verder aan slimmere manieren om te bepalen wat wél en niet de moeite waard is om te bewaren (cache-eviction), aan het combineren van caching met andere efficiëntietechnieken zoals kwantisering (het verkleinen van de getallen die een model intern gebruikt), en aan het uitbreiden van caching naar schijf- en netwerkopslag om grotere hoeveelheden data goedkoper te kunnen bewaren, zoals DeepSeek liet zien.

Een minder besproken obstakel is privacy en beveiliging: gecachete prompts blijven, zij het tijdelijk, op de servers van de aanbieder staan. Voor gevoelige toepassingen — denk aan medische of juridische documenten — roept dat vragen op over dataretentie die niet altijd eenduidig door de voorwaarden van elke aanbieder worden beantwoord. Onafhankelijke, publiek geverifieerde cijfers over de daadwerkelijke kosten- en energiebesparing in de praktijk zijn bovendien schaars; de meeste gepubliceerde percentages zijn afkomstig van de aanbieders zelf en dus niet volledig onafhankelijk gecontroleerd.

Wie werken eraan?

Aan de commerciële kant zijn Anthropic, OpenAI en Google DeepMind de grootste namen, met elk hun eigen implementatie in respectievelijk Claude, de GPT-modellen en Gemini. Het Chinese DeepSeek geldt als voorloper op het gebied van goedkope, schijfgebaseerde caching. Cloudplatforms als Amazon Web Services (via Bedrock) en Microsoft Azure bieden caching aan als onderdeel van hun gehoste versies van deze modellen.

Aan de onderzoekskant spelen universitaire en open source-initiatieven een grote rol: het onderzoeksteam achter vLLM aan UC Berkeley en LMSYS Org (bekend van SGLang en de Chatbot Arena) publiceren openlijk over hun cachingtechnieken, zodat ook kleinere bedrijven en onderzoeksgroepen er gebruik van kunnen maken. Bredere academische publicaties over efficiënte transformer-inferentie verschijnen geregeld op vakconferenties als NeurIPS en MLSys, vaak in samenwerking tussen universiteiten en de grote AI-bedrijven.

Verder lezen