AI & computing › Generatieve AI & synthetische media
Redis-bedenker lanceert tool om zware AI-modellen thuis te draaien
De Italiaanse programmeur Salvatore Sanfilippo, bekend als de bedenker van de populaire database Redis, heeft een nieuw programma uitgebracht waarmee gebruikers torenhoge AI-taalmodellen op hun eigen Mac of pc kunnen draaien. DwarfStar 4, kortweg ds4, comprimeert modellen met honderden miljarden parameters zodat ze passen op gewone high-end hardware in plaats van dure clouddiensten.
Grote AI-taalmodellen zoals DeepSeek, GLM en Qwen draaien normaal gesproken op clusters van gespecialiseerde serverchips bij clouddiensten. Dat kost geld, vereist een internetverbinding en betekent dat gebruikers hun data naar een extern bedrijf sturen. Sanfilippo's nieuwe open source-programma ds4 pakt dat probleem aan: het laat deze modellen rechtstreeks op iemands eigen Mac, Nvidia-werkstation of AMD-machine draaien, zonder tussenkomst van een clouddienst.
Een gigantisch model passend maken
Het grootste ondersteunde model, DeepSeek V4 Flash, telt 284 miljard parameters: de instelbare knoppen die bepalen hoe een AI-model reageert. Zulke modellen zijn vaak opgebouwd volgens het mixture-of-experts-principe, waarbij alleen een deel van het model wordt geraadpleegd per vraag. Ds4 maakt gebruik van een techniek die modelkwantisatie wordt genoemd: de precisie van de getallen waarmee het model rekent, wordt drastisch verlaagd. Bij ds4 gebeurt dat asymmetrisch: vooral de aparte 'expert'-onderdelen van het model worden agressief gecomprimeerd naar slechts 2 bit per waarde, terwijl de kritieke, gedeelde onderdelen van het model preciezer blijven. Zo blijft het model bruikbaar, ook op machines met 'slechts' 64 tot 128 gigabyte werkgeheugen in plaats van de honderden gigabytes die clouddiensten gebruiken.
Een tweede slimmigheid zit in het geheugen van lopende gesprekken. Taalmodellen bouwen tijdens een gesprek een zogeheten KV-cache op: een soort werkgeheugen dat onthoudt wat er al is 'gelezen', zodat het model niet steeds vanaf nul moet herrekenen. Ds4 slaat die cache op de harde schijf op, gekoppeld aan een digitale vingerafdruk van de tekst. Start je het programma na een herstart opnieuw met hetzelfde gesprek, dan wordt die cache van schijf geladen in plaats van opnieuw berekend. Dat scheelt kostbare rekentijd.
Drie manieren om het model te gebruiken
Ds4 bestaat uit één programma met drie gezichten. Via de opdrachtregel (./ds4) kun je direct chatten met het model. Met ./ds4-server start je een lokale server die dezelfde soort interfaces aanbiedt als grote AI-bedrijven, zodat bestaande software zoals codeerassistenten zonder aanpassing met het eigen model kan praten. En met ./ds4-agent krijg je een zelfstandig werkende coding-assistent die, net als cloudgebaseerde varianten, langere tijd aan een programmeertaak kan doorwerken. Alle drie delen hetzelfde model en dezelfde cache.
Volgens de door Sanfilippo gepubliceerde benchmarks haalt een Apple M5 Max met 128 gigabyte geheugen ongeveer 40 gegenereerde tokens per seconde bij een kort gesprek, en ruim 27 tokens per seconde bij een gesprek van 65.000 tokens lang. Dat is aanzienlijk trager dan een clouddienst met honderden gespecialiseerde chips, maar voor persoonlijk gebruik, privacygevoelige toepassingen of simpelweg onafhankelijkheid van een externe AI-leverancier is het een aantrekkelijk alternatief. De broncode staat vrij beschikbaar onder de MIT-licentie op GitHub.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Tools als ds4 maken het mogelijk om AI-modellen die voorheen alleen via dure clouddiensten te gebruiken waren, lokaal en privé te draaien. Dat vermindert de afhankelijkheid van grote AI-bedrijven, verlaagt de drempel voor ontwikkelaars en bedrijven met gevoelige data, en versnelt de verspreiding van zogeheten open-weightmodellen buiten de grote techbedrijven om.
- Mixture-of-experts
- Een AI-architectuur waarbij een model uit meerdere gespecialiseerde deelnetwerken ('experts') bestaat en per vraag maar een deel daarvan wordt gebruikt, wat rekenwerk bespaart.
- Modelkwantisatie
- Een techniek waarbij de precisie van de rekenwaarden in een AI-model wordt verlaagd, zodat het model minder geheugen nodig heeft en sneller draait.
- KV-cache
- Een tussengeheugen van een AI-taalmodel dat eerder verwerkte tekst onthoudt, zodat die niet steeds opnieuw berekend hoeft te worden.
- Open source
- Software waarvan de broncode vrij beschikbaar is, zodat iedereen die kan bekijken, gebruiken en aanpassen.
- MIT-licentie
- Een veelgebruikte, zeer vrije softwarelicentie die hergebruik en aanpassing van code met weinig beperkingen toestaat.
- API
- Een gestandaardiseerde manier waarop verschillende softwareprogramma's met elkaar kunnen communiceren, bijvoorbeeld om een AI-model aan te roepen.
- Parameters
- De instelbare rekenwaarden binnen een AI-model die samen bepalen hoe het model reageert op een vraag.
- Tokens per seconde
- Een maat voor hoe snel een AI-model tekst genereert, waarbij een token ongeveer een woorddeel is.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.