Kennisbank

Actiemodel: de AI die niet praat, maar doet

Bijgewerkt: 11 oktober 2026 · 6 min leestijd

Een actiemodel is een kunstmatige-intelligentiesysteem dat niet is getraind om tekst te genereren, maar om te handelen. Waar een taalmodel als ChatGPT een vraag beantwoordt met woorden, zet een actiemodel diezelfde intelligentie om in concrete stappen: een muisklik, een formulier invullen, een robotarm die een kopje oppakt. Het verschil zit in de uitkomst, niet in de onderliggende techniek — vaak is het dezelfde soort neurale netwerken, maar dan getraind op een andere taal: de taal van handelingen.

Vergelijk het met het verschil tussen een reisgids en een chauffeur. De reisgids (het taalmodel) kan je tot in detail uitleggen hoe je van Amsterdam naar Rotterdam rijdt: welke afslagen, welke snelweg, hoelang het duurt. De chauffeur (het actiemodel) stapt gewoon in en rijdt. Hij 'begrijpt' de route niet per se beter, maar hij zet kennis om in een reeks concrete bewegingen van stuur, gas en rem. Actiemodellen doen dat voor digitale taken — zoals het boeken van een vlucht op een website — of voor fysieke taken, zoals een robot die was opvouwt.

Wat is het precies?

Technisch gezien bouwen actiemodellen voort op dezelfde architectuur als grote taalmodellen: het zogeheten transformer-model, een neuraal netwerk dat patronen leert uit enorme hoeveelheden data. Bij een taalmodel bestaat die data uit teksten; het model leert voorspellen welk woord waarschijnlijk op het vorige volgt. Bij een actiemodel bestaat de data uit opeenvolgingen van toestanden en acties: 'de cursor stond hier, toen werd er geklikt', of 'de robotarm stond in deze positie, toen bewoog het gewricht zo'.

Er zijn grofweg twee families. De eerste richt zich op de digitale wereld: zogeheten Large Action Models (LAM's) of 'computer-use'-agenten. Die krijgen een opdracht in gewone taal ('boek een hotel in Utrecht voor dit weekend') en zetten die om in een reeks muisklikken, toetsaanslagen en navigatiestappen binnen een scherm. Ze 'zien' het scherm via schermafbeeldingen en beslissen, net als een mens, waar ze moeten klikken.

De tweede familie werkt in de fysieke wereld en heet meestal een Vision-Language-Action-model, afgekort VLA. Zo'n model combineert drie soorten informatie: camerabeelden (vision), een taalinstructie (language) en motoraansturing (action). De robot krijgt bijvoorbeeld de instructie 'leg het rode blokje op het blauwe blokje', ziet via een camera waar die blokjes liggen, en het model berekent direct welke bewegingen de motoren in de robotarm moeten maken om dat te realiseren.

Beide varianten worden getraind met een combinatie van twee methodes. Bij imitatieleren (imitation learning) krijgt het model duizenden voorbeelden te zien van mensen die de taak uitvoeren — denk aan video's van mensen die op een scherm klikken, of opnames van een robotarm die met de hand wordt bestuurd. Het model leert die patronen nabootsen. Bij versterkend leren (reinforcement learning) krijgt het model in plaats daarvan een beloning wanneer een taak slaagt, en leert het via veel vallen en opstaan welke acties tot succes leiden. In de praktijk worden beide methodes vaak gecombineerd: eerst imiteren om een basis te leggen, daarna verfijnen met beloningen.

Wat wil men ermee bereiken?

De drijfveer achter actiemodellen is een praktisch probleem: software en robots moeten traditioneel voor elke taak apart geprogrammeerd worden. Een robot die blokjes stapelt, moet met expliciete code vertellen hoe diep hij moet grijpen en onder welke hoek. Een stukje software dat een formulier invult, moet precies weten op welke pixelcoördinaten welke knop staat. Verandert de website of de vorm van het object, dan werkt de code niet meer.

Actiemodellen beloven generalisatie: één model dat, net als een mens, nieuwe situaties kan inschatten zonder opnieuw geprogrammeerd te worden. Een robot die geleerd heeft een kop op te pakken, zou — in theorie — ook een ongeziene mok moeten kunnen oppakken, omdat hij de onderliggende vaardigheid 'grijpen' heeft geleerd in plaats van één specifieke beweging te hebben nagebootst.

Voor de digitale kant is de belofte vergelijkbaar: een AI-assistent die niet alleen uitlegt hoe je iets doet, maar het ook daadwerkelijk uitvoert, zonder dat ontwikkelaars voor elke website of app een speciale koppeling (API) hebben moeten bouwen. Dat zou veel repetitief werk — van het invullen van declaraties tot het plannen van reizen — kunnen automatiseren voor mensen die daar nu nog veel tijd aan besteden.

Op de langere termijn hopen onderzoekers dat actiemodellen voor robotica dezelfde sprong maken die taalmodellen maakten: van smalle, taakspecifieke systemen naar brede, aanpasbare 'generalisten' die met wat extra training allerlei verschillende fysieke klussen kunnen leren.

Voorbeelden uit de praktijk

Een aantal projecten laat zien hoe dit zich in de praktijk ontwikkelt. RT-2, gepresenteerd door Google DeepMind in 2023, was een van de eerste grote vision-language-action-modellen: het combineerde een al bestaand beeld-taalmodel met robotbesturing, waardoor de robot taken kon uitvoeren die niet letterlijk in de trainingsdata voorkwamen, zoals het weggooien van afval in de juiste bak op basis van algemeen wereldbegrip.

π0 (pi-zero), ontwikkeld door het Amerikaanse bedrijf Physical Intelligence en gepresenteerd in 2024, is een VLA-model dat is getraind op data van meerdere soorten robots tegelijk, met als doel een 'algemeen' basismodel voor robotbesturing te bouwen — te vergelijken met hoe GPT-modellen als basis dienen voor allerlei taalgerelateerde toepassingen.

Rabbit R1, een los apparaatje dat in 2024 veel aandacht kreeg, beloofde met een 'Large Action Model' apps namens de gebruiker te bedienen, zoals het bestellen van een maaltijd. Het apparaat kreeg na lancering veel kritiek omdat het achter de schermen vooral op eenvoudigere scripts en scraping bleek te leunen, en minder op een werkelijk algemeen actiemodel dan aangekondigd — een waarschuwend voorbeeld van de kloof tussen marketing en techniek in dit veld.

Claude's 'computer use'-functie, die Anthropic vanaf 2024 beschikbaar maakte, laat een AI-model een virtuele computer bedienen: het model 'kijkt' naar schermafbeeldingen en bepaalt zelf waar te klikken en wat te typen om een taak te volbrengen, zoals het invullen van een webformulier.

Ook ACT-1 van het (inmiddels door Amazon overgenomen) bedrijf Adept, aangekondigd in 2023, was een vroeg voorbeeld van een model dat getraind was om browsertaken uit te voeren op basis van natuurlijke taal.

Hoe ver is de techniek?

Actiemodellen zijn nog volop in ontwikkeling en moeten eerlijk gezegd worden: de demo's zijn vaak indrukwekkender dan de dagelijkse betrouwbaarheid. Digitale actiemodellen struikelen regelmatig over ongebruikelijke website-indelingen, pop-ups of meerstaps-aanmeldprocedures. Fysieke VLA-modellen presteren goed in gecontroleerde laboratoriumomgevingen, maar hebben nog altijd moeite met ongeziene objecten, onverwachte verlichting of taken die fijne motoriek en kracht tegelijk vereisen.

Een belangrijk obstakel is data: terwijl taalmodellen konden profiteren van de enorme hoeveelheid tekst op het internet, bestaat er veel minder voorhanden data van robots die taken uitvoeren of van mensen die exact bijhouden welke handeling bij welke schermtoestand hoort. Onderzoekers werken daarom aan manieren om data te verzamelen via teleoperatie (mensen die robots op afstand besturen om trainingsdata te genereren) en aan simulaties waarin robots virtueel kunnen oefenen voordat ze iets in de echte wereld proberen.

Veiligheid is een tweede obstakel, vooral bij digitale actiemodellen: een model dat zelfstandig op internet klikt en typt, kan in theorie ook ongewenste acties uitvoeren, zoals iets kopen of verzenden dat niet de bedoeling was. Bedrijven bouwen daarom begrenzingen in, zoals bevestigingsstappen voor gevoelige acties. Precieze, betrouwbare benchmarks om de voortgang van actiemodellen te meten staan ook nog in de kinderschoenen, waardoor het moeilijk is om verschillende modellen eerlijk te vergelijken of harde uitspraken te doen over hoe snel het veld werkelijk vooruitgaat.

Wie werken eraan?

Op het gebied van robotica en VLA-modellen lopen Google DeepMind (met de RT-reeks) en het Amerikaanse start-up Physical Intelligence (opgericht door voormalige onderzoekers van onder meer Google en Stanford) voorop. Ook Covariant, een bedrijf gericht op robotarmen in de logistiek, en academische labs zoals het Robot Learning Lab van Stanford University en het Berkeley Artificial Intelligence Research (BAIR) Lab dragen belangrijk onderzoek bij.

Op het gebied van digitale actiemodellen zijn Anthropic (met de computer-use-functionaliteit van Claude), OpenAI en Google actief, naast kleinere spelers zoals het eerder genoemde Adept (nu onderdeel van Amazon) en Rabbit. China investeert ook zwaar in robotica-AI, met onder meer onderzoeksgroepen verbonden aan grote techbedrijven als Baidu en universiteiten die werken aan vergelijkbare 'embodied AI'-modellen (AI die via een lichaam, zoals een robot, met de wereld interacteert). Daarnaast financieren overheidsinstanties zoals het Amerikaanse National Science Foundation en Europese onderzoeksprogramma's robotica-onderzoek dat raakt aan actiemodellen.

Verder lezen