AI & computing › Generatieve AI & synthetische media

WebLLM laat AI-taalmodellen volledig lokaal in de browser draaien

· Bijgewerkt 2 september 2026, 17:39 · 2 min leestijd

Generatieve AI & synthetische media
Beeld: Hacker News frontpage

Een groep ontwikkelaars van het MLC-project heeft WebLLM uitgebracht: software waarmee grote taalmodellen als Llama 3 en Mistral rechtstreeks in de webbrowser draaien, zonder dat er een externe server aan te pas komt. De techniek gebruikt de grafische kaart van de gebruiker en belooft chatbots die volledig privé blijven.

Normaal gesproken werkt een chatbot als ChatGPT via een server ergens in een datacenter: je typt een vraag, die gaat over internet naar een krachtige computer, en het antwoord komt terug. WebLLM draait dat om. De open source software laat het taalmodel volledig op het apparaat van de gebruiker rekenen, binnen de webbrowser zelf. Er wordt niets naar een server gestuurd en er is geen internetverbinding nodig zodra het model eenmaal is gedownload.

Hoe werkt het?

WebLLM maakt gebruik van GPU-acceleratie via WebGPU, een relatief nieuwe webstandaard waarmee browsers rechtstreeks bij de grafische chip van een computer kunnen om zware berekeningen te versnellen. Voorheen was dat voorbehouden aan native apps of servers met dure AI-chips. Doordat het rekenwerk plaatsvindt op de eigen laptop of telefoon, ontstaat een vorm van large language model-gebruik waarbij gevoelige gesprekken het apparaat nooit verlaten. Dat is aantrekkelijk voor bedrijven of gebruikers die niet willen dat hun data bij een externe AI-aanbieder terechtkomt.

Om dit haalbaar te maken, zijn de modellen fors gecomprimeerd. WebLLM ondersteunt onder meer Meta's Llama 3, Microsofts Phi 3, Google's Gemma, Mistral en de Chinese Qwen-modellen, allemaal in verkleinde varianten die met minder rekenkracht toe kunnen. Eenmaal gedownload, worden de modelbestanden opgeslagen in de cache van de browser, zodat ze bij een volgend bezoek niet opnieuw hoeven te worden opgehaald.

Compatibel met bestaande software

Een belangrijk voordeel is dat WebLLM dezelfde API gebruikt als OpenAI, het bedrijf achter ChatGPT. Ontwikkelaars die al software hebben gebouwd rond de OpenAI-interface, kunnen die met minimale aanpassingen laten draaien op een lokaal model via WebLLM. Functies als het stap voor stap tonen van antwoorden (streaming) en het afdwingen van gestructureerde output in JSON-formaat werken op vergelijkbare wijze.

Het project is een uitloper van MLC LLM, een bredere inspanning om taalmodellen op uiteenlopende hardware te laten draaien, van smartphones tot laptops. Ontwikkelaars kunnen WebLLM als kant-en-klaar softwarepakket installeren en er hun eigen chatbot, browserextensie of webapp mee bouwen. Een voorbeeldtoepassing, WebLLM Chat, laat zien hoe zo'n interface er in de praktijk uitziet.

Grenzen van de techniek

De aanpak heeft ook beperkingen. Grote, krachtige modellen als GPT-4 zijn te omvangrijk om soepel in een browser te draaien; WebLLM richt zich vooral op kleinere, geoptimaliseerde varianten. Ook is niet elke browser en videokaart even goed toegerust voor WebGPU. Toch laat het project zien dat serverloze AI, waarbij intelligentie letterlijk in het apparaat van de gebruiker zit, technisch steeds haalbaarder wordt.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als AI-modellen goed genoeg worden om zonder server in een browser te draaien, verschuift macht en kosten van grote clouddiensten naar de apparaten van gebruikers zelf. Dat kan privacygevoelige toepassingen mogelijk maken, van medische chatbots tot offline hulpmiddelen, zonder dat gevoelige data een bedrijfsserver bereikt. Tegelijk blijft de rekenkracht van gewone laptops en telefoons een beperkende factor voor hoe krachtig zulke lokale modellen kunnen worden.

WebGPU
Een webstandaard waarmee browsers rechtstreeks gebruikmaken van de grafische kaart van een computer voor zware berekeningen, zoals AI-inferentie.
WebAssembly
Een technologie waarmee snelle, compacte programmacode in de browser kan draaien, vergelijkbaar met de snelheid van native software.
Kwantisatie
Het comprimeren van een AI-model door de precisie van de gebruikte getallen te verlagen, waardoor het minder geheugen en rekenkracht nodig heeft.
Open source
Software waarvan de broncode vrij beschikbaar is, zodat iedereen deze kan inzien, gebruiken en aanpassen.
Browsercache
Tijdelijke opslag in de webbrowser waarin bestanden, zoals een gedownload AI-model, worden bewaard zodat ze niet steeds opnieuw hoeven te worden opgehaald.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Generatieve AI & synthetische media