AI & computingAgentic AI & autonome agents

Needle 2: AI-model van 14 megabyte laat goedkope apparaten zelf taken uitvoeren

· Bijgewerkt 10 augustus 2026, 23:19 · 2 min leestijd

Agentic AI & autonome agents
Beeld: Hacker News frontpage

Het Amerikaanse bedrijf Cactus heeft een kunstmatig-intelligentiemodel gebouwd dat slechts 14 megabyte groot is, maar toch opdrachten kan uitvoeren zonder internetverbinding of zware chips. Needle 2 moet slimme functies brengen naar goedkope smartphones, wearables, huisapparaten en kleine robots die te zwak zijn voor de grote AI-modellen uit de cloud. Het model draait al in een spraakgestuurde ring van wearable-pionier Pebble.

De meeste kunstmatige intelligentie draait tegenwoordig in enorme datacenters, op krachtige grafische chips. Maar het grootste deel van de apparaten in de wereld heeft die rekenkracht helemaal niet. Cactus, het bedrijf achter Needle 2, wijst erop dat er wereldwijd zo'n 21 miljard apparaten zijn aangesloten op internet, tegenover ongeveer 1,5 miljard pc's. Denk aan budgettelefoons, smartwatches, kleine robots en slimme thuisapparaten: goedkope hardware zonder grafische chip (GPU) of AI-chip (NPU), met hooguit een paar honderd megabyte werkgeheugen. Voor die categorie apparaten is Needle 2 ontworpen.

Klein genoeg voor een spraakloze ring

Needle 2 telt 45 miljoen parameters, de instelbare rekenwaarden die bepalen hoe een AI-model reageert. Ter vergelijking: grote taalmodellen als ChatGPT hebben er honderden miljarden. Toch hoeft dat voor dit doel geen nadeel te zijn. Het model is namelijk niet gebouwd om te kletsen, maar om opdrachten te vertalen naar acties: toolaanroepen op maat, zoals een lamp aanzetten, een e-mailadres uit een zin halen of een robotarm drie bewegingen laten maken. Dat is precies het soort werk dat agentic AI doet: een AI-systeem dat zelfstandig stappen zet om een taak te voltooien. Omdat het model geen algemene wereldkennis nodig heeft, is een klein model genoeg. Wearable-fabrikant Pebble gebruikt Needle 2 al in zijn Index-ring: een apparaat zonder scherm, dat gesproken opdrachten direct moet omzetten in actie, ook zonder wifi of 4G.

Extreme compressie zonder kwaliteitsverlies

Om op zulke kleine apparaten te passen, is Needle 2 al tijdens het trainen voorbereid op compressie. Normaal gesproken worden AI-modellen na het trainen achteraf verkleind, een proces dat vaak ten koste gaat van de nauwkeurigheid. Cactus koos voor het omgekeerde: het model is van begin tot eind getraind met de uiteindelijke compressie in het achterhoofd, een aanpak die vergelijkbaar is met wat vakmensen kwantisatiebewuste training noemen. Het resultaat is gekwantiseerd tot gemiddeld twee bits per gewicht, waardoor het volledige model in een bestand van 14 megabyte past en zo'n 28 megabyte werkgeheugen gebruikt tijdens gebruik. Ook de architectuur zelf is aangepast: het geheugen van het model is begrensd door een vast "schuifvenster" van 256 tokens, zodat het nooit meer geheugen opeist dan een apparaat kan missen, en systeeminstructies blijven daarbij altijd bewaard.

Grens tussen apparaat en cloud

Een model van deze omvang kan niet alles. Daarom geeft Needle 2 bij elk antwoord een betrouwbaarheidsscore mee. Valt die te laag uit, dan stuurt het systeem de vraag alsnog door naar een groter model in de cloud, of vraagt het om verduidelijking. Omdat het merendeel van de opdrachten aan een slim apparaat routinematig is, blijft die uitwijk naar de cloud volgens Cactus zeldzaam, en verloopt de standaardroute lokaal, privé en zonder vertraging. Op een Raspberry Pi 5 haalt het model naar eigen zeggen snelheden van honderden tokens per seconde, ruim voldoende voor directe reacties op gesproken of getypte opdrachten. Cactus stelt de broncode en een Python-pakket beschikbaar waarmee bedrijven het model zelf kunnen bijtrainen op de eigen apparaten en functies.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Als kleine, gespecialiseerde AI-modellen net zo goed taken kunnen uitvoeren als grote modellen in de cloud, kunnen ook goedkope apparaten zonder internetverbinding slimme functies krijgen. Dat maakt spraakbediening, automatisering en dataverwerking toegankelijker voor miljarden apparaten die nu te zwak of te afgelegen zijn voor clouddiensten, en vermindert de afhankelijkheid van dure serverinfrastructuur.

Large language model (LLM)
Een AI-model dat getraind is op grote hoeveelheden tekst om taal te begrijpen en te genereren.
Agentic AI
Kunstmatige intelligentie die zelfstandig stappen onderneemt om een taak te volbrengen, in plaats van alleen te antwoorden op een vraag.
Toolaanroep
Het moment waarop een AI-model een externe functie of dienst aanspreekt, bijvoorbeeld om een lamp te bedienen of gegevens op te halen.
Modelkwantisatie
Een techniek waarbij de precisie van de rekenwaarden in een AI-model wordt verlaagd, zodat het model kleiner en sneller wordt.
Modelparameter
Een instelbare rekenwaarde in een AI-model; het aantal parameters zegt iets over de omvang en complexiteit van het model.
Kwantisatiebewuste training
Een trainingsmethode waarbij een AI-model al tijdens het leerproces rekening houdt met de compressie die het later moet ondergaan, in plaats van pas achteraf te worden verkleind.
Schuifvenster-attentie
Een architectuurtruc waarbij een AI-model alleen een vast aantal recente woorden 'onthoudt', zodat het geheugengebruik nooit ongecontroleerd groeit.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents