Kennisbank

Agentic besturingssysteem: wanneer de computer zelf de muis bedient

Bijgewerkt: 23 september 2026 · 6 min leestijd

Een gewoon besturingssysteem zoals Windows, macOS of Android is in de kern een wachtende assistent: het opent programma's, beheert bestanden en verdeelt rekenkracht, maar doet niets totdat jij klikt, typt of tikt. Een agentic besturingssysteem voegt daar een kunstmatige-intelligentielaag aan toe die zelf die muisklikken en toetsaanslagen uitvoert. In plaats van te wachten op jouw input, krijgt de AI een opdracht in gewone taal — "boek een hotel onder de 100 euro voor volgend weekend" — en probeert die vervolgens zelfstandig uit te voeren door schermen te lezen, knoppen aan te klikken en formulieren in te vullen, precies zoals een mens dat zou doen.

Een bruikbare vergelijking is die tussen cruise control en een zelfrijdende auto. Cruise control (vergelijkbaar met een klassiek automatiseringsscript) volgt een vast, vooraf ingesteld gedrag: het houdt een snelheid aan, verder niets. Een zelfrijdende auto daarentegen observeert voortdurend de omgeving en neemt op basis daarvan nieuwe beslissingen. Een agentic AI werkt op dezelfde manier: het kijkt naar wat er op het scherm gebeurt, denkt na over de volgende stap, en past zich aan als er iets onverwachts gebeurt — een pop-up, een foutmelding, een ander menu dan verwacht. Dat maakt het fundamenteel anders dan de "macro's" en scripts die al decennia bestaan.

Wat is het precies?

De motor achter een agentic besturingssysteem is meestal een large language model (LLM), het type AI-model dat ook chatbots als ChatGPT en Claude aandrijft. Zo'n model is getraind om taal te begrijpen en te genereren, maar recente versies zijn ook getraind om afbeeldingen — zoals een schermafbeelding van een computerscherm — te interpreteren en om beslissingen te nemen over welke actie daarop moet volgen.

Het systeem doorloopt daarbij steeds een cyclus die onderzoekers vaak de observeer-denk-handel-lus noemen (in de vakliteratuur ook wel een "ReAct"-aanpak genoemd, naar het Engelse "reasoning and acting"). Eerst neemt de AI de huidige staat van het scherm waar: via een schermafbeelding, of via de zogeheten accessibility tree, een soort technische plattegrond van alle knoppen, velden en menu's die besturingssystemen al gebruiken om schermen voorleesbaar te maken voor slechtzienden. Daarna redeneert het model in tekst over wat de volgende logische stap is om het doel te bereiken. Ten slotte voert het die stap uit: een muisklik op specifieke coördinaten, tekst typen in een veld, of — waar mogelijk — een directe aanroep van de software zelf (een zogeheten API, een soort achterdeur waarmee programma's rechtstreeks met elkaar kunnen praten zonder de knoppen aan te raken). Deze lus herhaalt zich totdat de taak voltooid is, de AI vastloopt, of een mens ingrijpt.

Dit onderscheidt agentic systemen van twee bekendere zaken. Ten eerste van klassieke automatisering zoals RPA (robotic process automation): software die een vaste reeks stappen op precies dezelfde plek herhaalt, en die breekt zodra een website er anders uitziet. Ten tweede van gewone chatbots, die alleen tekst teruggeven maar zelf niets op je computer doen. Omdat een AI die zelfstandig handelt ook fouten kan maken of misbruikt kan worden, bouwen ontwikkelaars veiligheidsmaatregelen in: de agent draait vaak in een sandbox (een afgeschermde, geïsoleerde omgeving zonder toegang tot de rest van het systeem) en vraagt bij gevoelige stappen — zoals een betaling — expliciet om bevestiging van de gebruiker.

Wat wil men ermee bereiken?

De belangrijkste drijfveer is dat de meeste software helemaal niet gemaakt is om door AI bediend te worden. Bedrijven kunnen wel aparte technische koppelingen (API's) bouwen voor specifieke apps, maar dat is duur en moet voor elke website of app opnieuw. Een AI die gewoon leert klikken en typen zoals een mens, kan in theorie elke bestaande website of applicatie bedienen zonder dat die daarvoor aangepast hoeft te worden. Dat is de grote belofte: één systeem dat overal werkt, in plaats van duizenden losse integraties.

Daaruit vloeit een bredere visie voort van AI als digitale persoonlijke assistent: iemand die niet alleen advies geeft, maar ook daadwerkelijk mails beantwoordt, tickets boekt, formulieren invult of onderzoek doet op internet, terwijl jij iets anders doet. Voor mensen met een motorische beperking kan dit soort technologie bovendien de drempel tot digitale diensten verlagen. Voor bedrijven ligt de aantrekkingskracht vooral bij het automatiseren van repetitief "digitaal werk" dat nu nog mensuren kost.

Het is eerlijk om daarbij meteen te zeggen dat de praktijk nog fors achterblijft bij deze belofte. Bedrijven presenteren agentic AI graag als bijna-af, terwijl onafhankelijke tests (zie hieronder) laten zien dat de technologie voor veel taken nog onbetrouwbaar is. De spanning tussen marketing en werkelijke prestaties is een terugkerend thema in dit veld.

Voorbeelden uit de praktijk

Anthropic, het bedrijf achter de Claude-modellen, introduceerde eind 2024 een functie genaamd "computer use": ontwikkelaars konden Claude toegang geven tot een virtueel scherm, waarna het model zelf de muis bewoog, klikte en typte om taken in gewone desktopsoftware uit te voeren.

OpenAI lanceerde begin 2025 "Operator", een op de browser gerichte agent die zelfstandig kon winkelen, reserveren of formulieren invullen door websites te bedienen zoals een mens dat doet, met tussentijdse bevestigingen bij gevoelige acties zoals betalen.

Google DeepMind kondigde eind 2024 "Project Mariner" aan, een experimentele Chrome-browserextensie waarmee een AI-agent webpagina's kon lezen en bedienen om taken namens de gebruiker uit te voeren.

Een vroeg en veelbesproken voorbeeld is Adept AI, dat in 2022 het model ACT-1 presenteerde — een van de eerste modellen die expliciet getraind waren om softwarehandelingen (klikken, typen, navigeren) uit te voeren in plaats van alleen tekst te genereren. In 2024 werd een groot deel van het Adept-team overgenomen door Amazon, wat illustreert hoe grote techbedrijven talent op dit gebied naar zich toe trekken.

Ook buiten de grote Amerikaanse AI-labs wordt hieraan gewerkt: het Chinese Zhipu AI presenteerde in 2024 AutoGLM, een systeem gericht op het bedienen van telefoon-apps namens de gebruiker, wat laat zien dat dit geen exclusief Amerikaans onderzoeksgebied is.

Hoe ver is de techniek?

Om agentic AI objectief te beoordelen, gebruiken onderzoekers benchmarks: gestandaardiseerde testsets met realistische computertaken. Twee bekende voorbeelden zijn OSWorld en WebArena, beide mede ontwikkeld door onderzoekers van Carnegie Mellon University. Deze benchmarks laten AI-agenten en mensen dezelfde taken uitvoeren — bijvoorbeeld een bestand hernoemen en verplaatsen, of via een winkelwebsite een bestelling plaatsen — en vergelijken vervolgens de slagingspercentages.

De uitkomst is behoorlijk consistent: mensen ronden dit soort realistische taken doorgaans in de overgrote meerderheid van de gevallen succesvol af, terwijl AI-agenten daar nog duidelijk bij achterblijven, al verbeteren de scores van generatie op generatie merkbaar. Agenten lopen nog geregeld vast in lussen, klikken op het verkeerde element, of raken "de weg kwijt" wanneer een interface afwijkt van wat ze verwachtten.

Een praktisch obstakel is snelheid en kosten: elke stap in de observeer-denk-handel-cyclus vereist een aanroep van een zwaar AI-model, wat merkbaar trager en duurder is dan een simpele muisklik van een mens. Een ander, serieuzer probleem is veiligheid. Onderzoekers waarschuwen voor prompt injection: kwaadwillenden kunnen verborgen instructies verstoppen in een webpagina of document, die een langslopende AI-agent misleiden tot ongewenste acties — bijvoorbeeld gegevens versturen naar een onbekend adres — zonder dat de gebruiker dit doorheeft. Dit is een van de redenen waarom sandboxing en bevestigingsstappen belangrijk blijven zolang de betrouwbaarheid niet aantoonbaar hoog is.

Kortom: de richting van de vooruitgang is duidelijk en snel, maar een volledig betrouwbaar, algemeen inzetbaar "agentic besturingssysteem" dat zonder toezicht willekeurige taken op je computer uitvoert, bestaat op dit moment nog niet.

Wie werken eraan?

De ontwikkeling wordt momenteel gedomineerd door een kleine groep grote AI-bedrijven in de Verenigde Staten: Anthropic, OpenAI, Google (via DeepMind) en Microsoft, dat via zijn nauwe samenwerking met OpenAI en zijn eigen Copilot-functies in Windows eveneens agentic mogelijkheden in zijn besturingssysteem probeert te integreren. Amazon versterkte zijn positie door de kernploeg van Adept AI over te nemen.

Daarnaast speelt academisch onderzoek een belangrijke rol bij het onafhankelijk meten van voortgang: instellingen als Carnegie Mellon University ontwikkelden met OSWorld en WebArena de benchmarks waarmee claims van bedrijven getoetst kunnen worden. Buiten de Verenigde Staten is vooral China actief op dit terrein, met bedrijven als Zhipu AI die aan vergelijkbare technologie werken voor met name mobiele apparaten. Al met al is dit een veld waarin een handvol goed gefinancierde bedrijven het tempo bepalen, terwijl universiteiten de rol van onafhankelijke scheidsrechter vervullen.

Verder lezen