Kennisbank

Lokale AI-inferentie: kunstmatige intelligentie zonder de cloud

Bijgewerkt: 3 oktober 2026 · 5 min leestijd

Als je een vraag stelt aan ChatGPT of een andere chatbot, gaat die vraag meestal over het internet naar een enorm datacenter, waar krachtige computers het antwoord berekenen en terugsturen. Bij lokale AI-inferentie gebeurt dat laatste deel — het daadwerkelijke 'nadenken' van het AI-model — niet in zo'n datacenter, maar op het apparaat dat je zelf in handen hebt: je laptop, je telefoon of een klein kastje op je bureau. Het model staat dan letterlijk op je eigen toestel opgeslagen en rekent daar ook alles zelf uit.

Een vergelijking: stel je wilt een document laten vertalen. Je kunt het opsturen naar een vertaalbureau dat het voor je regelt (dat is de cloud-aanpak), of je kunt een vertaler inhuren die bij jou op kantoor komt zitten en direct ter plekke werkt, zonder dat er iets de deur uit hoeft (dat is lokale inferentie). Dat laatste is vaak trager klaar te spelen met evenveel kwaliteit, maar niemand buiten het pand hoeft ooit te weten wat er in dat document stond.

Wat is het precies?

Om te begrijpen wat lokale inferentie is, moet je eerst het verschil kennen tussen 'trainen' en 'inferentie'. Trainen is het proces waarbij een AI-model leert van miljarden voorbeelden — dat kost enorm veel rekenkracht en gebeurt vrijwel altijd in grote datacenters. Inferentie is wat er gebeurt ná het trainen: het moment dat het al-getrainde model daadwerkelijk een antwoord genereert op jouw vraag. Dat tweede deel kan, in tegenstelling tot trainen, ook op veel bescheidener hardware.

Een AI-model bestaat in de kern uit een enorm bestand met getallen (parameters) die bepalen hoe het model reageert op invoer. Grote taalmodellen hebben miljarden van die parameters, wat al snel tientallen gigabytes aan opslag en geheugen vergt. Om zo'n model op een telefoon of laptop te laten draaien, passen ontwikkelaars een truc toe die 'kwantisatie' heet: de precisie van de getallen wordt verlaagd (bijvoorbeeld van 16-bits naar 4-bits getallen), waardoor het model veel kleiner wordt en sneller rekent, ten koste van een beetje nauwkeurigheid.

Daarnaast is gespecialiseerde hardware belangrijk. Naast de gewone processor (CPU) en grafische chip (GPU) hebben recente telefoons en laptops vaak een NPU (Neural Processing Unit) — een chip die specifiek is ontworpen om de wiskundige bewerkingen van AI-modellen efficiënt en energiezuinig uit te voeren. Software zoals llama.cpp, ONNX Runtime of Apple's Core ML zorgt ervoor dat een model optimaal gebruikmaakt van deze chips.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is privacy. Wanneer een model lokaal draait, hoeven persoonlijke gegevens — zoals de inhoud van je e-mails, foto's of spraakopnames — nooit het apparaat te verlaten. Dat is aantrekkelijk voor gebruikers die niet willen dat gevoelige informatie bij een techbedrijf op een server belandt, en voor organisaties die wettelijk verplicht zijn data binnen hun eigen muren te houden, zoals ziekenhuizen of advocatenkantoren.

Een tweede motivatie is snelheid en betrouwbaarheid: een lokaal model hoeft niet te wachten op een internetverbinding en kent geen vertraging door een overbelast datacenter. Dat maakt toepassingen mogelijk die ook werken in een vliegtuig, een kelder zonder bereik, of in landen met onstabiele netwerken.

Ten derde spelen kosten een rol. Elke vraag die in de cloud wordt beantwoord, kost het bedrijf dat de dienst aanbiedt geld aan serverrekenkracht en elektriciteit. Als het model op het toestel van de gebruiker draait, verschuiven die kosten naar de hardware die de klant toch al heeft. Voor bedrijven die AI-functies aan miljoenen gebruikers aanbieden, is dat een aanzienlijke besparing.

Voorbeelden uit de praktijk

Llama.cpp (2023) is een project van de Bulgaarse ontwikkelaar Georgi Gerganov dat het mogelijk maakte om Meta's Llama-taalmodellen op een gewone laptop te laten draaien, zonder dure serverchips. Het bracht een stroomversnelling op gang in de hobbyistische en open-source AI-wereld en ligt aan de basis van veel latere lokale-AI-tools.

Apple Intelligence (aangekondigd in 2024) draait voor een flink deel van zijn functies — zoals tekstsamenvattingen en schrijfhulp — rechtstreeks op de Neural Engine van recente iPhones, iPads en Macs. Alleen bij complexere taken wordt (met toestemming) teruggevallen op Apples servers, via een systeem dat het bedrijf 'Private Cloud Compute' noemt.

Google Gemini Nano (vanaf 2023/2024) is een verkleinde versie van Googles Gemini-model die op Pixel-telefoons draait voor functies als het samenvatten van gesprekken of het opstellen van antwoorden in apps, zonder dat de inhoud naar Google-servers hoeft.

Microsoft Copilot+ PC's (2024) zijn laptops met een verplichte NPU die krachtig genoeg is om lokale AI-taken uit te voeren, zoals het doorzoeken van je schermactiviteit (de omstreden 'Recall'-functie) of live beeldbewerking.

Ollama (sinds 2023) is een populaire, gratis tool waarmee particulieren en ontwikkelaars met één commando open-source taalmodellen zoals Llama, Mistral of Gemma lokaal kunnen downloaden en draaien, zonder programmeerkennis.

Hoe ver is de techniek?

De vooruitgang gaat snel, maar er zijn duidelijke grenzen. Kleine modellen die lokaal draaien — met typisch 1 tot 8 miljard parameters — zijn de afgelopen twee jaar flink verbeterd. Modellen als Microsoft's Phi-3, Google's Gemma en Meta's Llama 3.2 (1B en 3B varianten, uitgebracht in 2024) presteren op veel taken verrassend goed voor hun formaat. Toch blijven ze over het algemeen minder capabel dan de allergrootste cloud-modellen (zoals GPT-4 of Gemini Ultra), zeker bij complex redeneren of gespecialiseerde kennis.

Een belangrijk obstakel blijft geheugen en energie: zelfs een gekwantiseerd model van een paar miljard parameters vraagt al snel enkele gigabytes aan werkgeheugen, wat op budgettelefoons of oudere laptops knelt. Batterijduur is een tweede zorg, al maken NPU's dit stuk efficiënter dan rekenen op een gewone processor. Ook de ondersteunende software-ecosystemen (zoals ONNX Runtime, Core ML en Qualcomms AI Engine) zijn nog in ontwikkeling en niet altijd onderling compatibel, wat het voor ontwikkelaars lastig maakt één model overal te laten draaien.

Opvallend is dat sommige bedrijven een hybride aanpak kiezen: eenvoudige taken lokaal, complexere taken alsnog naar de cloud — precies zoals Apple dat doet. Dat relativeert het beeld dat 'lokaal' en 'cloud' twee gescheiden werelden zijn; in de praktijk groeien ze naar elkaar toe.

Wie werken eraan?

Grote techbedrijven als Apple, Google, Microsoft en Meta investeren fors in kleinere, efficiëntere modellen die geschikt zijn voor lokale inferentie, naast hun grotere cloud-modellen. Chipmakers als Qualcomm, Apple (met zijn eigen Neural Engine) en Intel/AMD (met NPU's in hun nieuwste laptopchips) ontwikkelen de hardware die dit mogelijk maakt.

Op de open-source kant speelt de gemeenschap rond Georgi Gerganov's llama.cpp een grote rol, net als het Franse Mistral AI, dat compacte maar krachtige modellen uitbrengt die vaak gericht zijn op lokaal of eigen-server-gebruik (belangrijk voor Europese privacywetgeving). Hugging Face, een platform waar duizenden open-source AI-modellen worden gedeeld, fungeert als centrale ontmoetingsplek voor deze ontwikkelingen.

Academisch onderzoek naar efficiëntere AI-modellen (model compression, kwantisatie, distillatie) vindt plaats aan onder meer Stanford University, MIT en diverse Europese universiteiten, vaak in samenwerking met de genoemde bedrijven.

Verder lezen