Kennisbank

Taakdecompositie: hoe AI-agents grote opdrachten opsplitsen in behapbare stappen

Bijgewerkt: 2 oktober 2026 · 6 min leestijd

Stel je een cateraar voor die gevraagd wordt een bruiloft te verzorgen voor honderd gasten. Niemand pakt zo'n klus in één keer aan. De cateraar splitst het op: boodschappen doen, voorgerechten voorbereiden, de keuken inrichten, het hoofdgerecht op tijd serveren, nagerechten koelen. Elke deeltaak is overzichtelijk, controleerbaar en kan apart worden bijgestuurd als er iets misgaat. Dit principe — een grote, complexe opdracht opdelen in kleinere, behapbare stappen — heet taakdecompositie.

In de wereld van kunstmatige intelligentie duikt deze term steeds vaker op bij zogeheten AI-agents: systemen gebouwd rond een groot taalmodel (large language model, LLM, zoals GPT-4 of Claude) die niet alleen een vraag beantwoorden, maar ook zelfstandig meerdere stappen uitvoeren om een doel te bereiken. Een agent die bijvoorbeeld de opdracht krijgt "plan een reis naar Lissabon" moet eerst vluchten zoeken, dan hotels vergelijken, een route uitstippelen en ten slotte alles samenvatten. Taakdecompositie is de manier waarop zo'n systeem die ene grote opdracht intern opknipt in een reeks kleinere, uitvoerbare stappen.

Wat is het precies?

Een taalmodel werkt in de kern door tekst te voorspellen: gegeven een stuk tekst, wat is het meest waarschijnlijke vervolg? Dat werkt uitstekend voor het beantwoorden van één vraag, maar complexe opdrachten vereisen meerdere stappen, tussentijdse beslissingen en soms het gebruik van externe hulpmiddelen (zogeheten tools, zoals een zoekmachine, een rekenmachine of een stuk programmeercode). Taakdecompositie is de aanpak waarbij het systeem eerst een plan maakt — een lijst van subtaken — en die vervolgens stap voor stap afwerkt.

Een vroege en invloedrijke techniek hierbij is Chain-of-Thought prompting (letterlijk: gedachteketen-aansturing), geïntroduceerd door onderzoekers van Google in 2022. Hierbij wordt het model aangemoedigd om hardop te "denken" in tussenstappen voordat het een eindantwoord geeft, in plaats van direct met een antwoord te komen. Dit verbetert de nauwkeurigheid bij rekenkundige en logische vraagstukken aanzienlijk.

Een volgende stap is ReAct (een samentrekking van "Reasoning" en "Acting"), gepresenteerd in 2022 door onderzoekers van Princeton University en Google Research. ReAct laat een model afwisselend redeneren en handelen: het model denkt na over wat de volgende stap moet zijn, voert die stap uit (bijvoorbeeld een zoekopdracht), bekijkt het resultaat, en herhaalt dit totdat de opdracht is afgerond. Dit principe vormt de basis van vrijwel alle moderne AI-agents.

Nog complexere varianten zijn Tree of Thoughts (boom van gedachten), waarbij een model meerdere mogelijke denkpaden tegelijk verkent en de beste kiest, en zogeheten planner-executor architecturen. Bij die laatste aanpak is er een apart onderdeel (de "planner") dat alleen de grote lijnen uitstippelt, en een ander onderdeel (de "executor") dat de afzonderlijke stappen daadwerkelijk uitvoert — vergelijkbaar met een projectmanager die het werk verdeelt over specialisten.

Taakdecompositie is deels een noodzaak, geen luxe. Taalmodellen hebben een beperkt contextvenster: het aantal woorden of tekstfragmenten dat ze tegelijk kunnen "onthouden" tijdens één berekening. Een lange, complexe opdracht past daar vaak niet in één keer in. Door op te knippen in stappen, hoeft het model telkens maar een deel van de informatie te verwerken. Bovendien maakt decompositie het makkelijker om fouten te ontdekken en te corrigeren: als stap drie misgaat, hoeft niet de hele opdracht opnieuw, maar alleen dat onderdeel.

Wat wil men ermee bereiken?

De centrale belofte van taakdecompositie is dat AI-systemen zelfstandiger en betrouwbaarder complexe, meerstaps taken kunnen uitvoeren, zonder dat een mens bij elke tussenstap moet ingrijpen. In plaats van een chatbot die één vraag per keer beantwoordt, ontstaat een agent die een doel krijgt en zelf uitzoekt welke stappen nodig zijn om dat doel te bereiken.

Dit opent de deur naar toepassingen die verder gaan dan simpele vraag-antwoordinteracties: het automatisch samenstellen van onderzoeksrapporten, het schrijven en testen van programmacode, het afhandelen van klantenservicevragen die meerdere systemen raadplegen, of het coördineren van administratieve taken op kantoor. Het achterliggende idee is dat veel kenniswerk in de praktijk ook uit een reeks deeltaken bestaat — en dat een AI-systeem dat die structuur kan herkennen en volgen, bruikbaarder wordt dan een systeem dat alleen één losse vraag kan beantwoorden.

Een tweede doelstelling is betrouwbaarheid. Door een taak op te splitsen en elke stap te kunnen controleren (en eventueel te laten herhalen als iets misgaat), hopen onderzoekers de kans op grove fouten te verkleinen. Dat is belangrijk, want taalmodellen staan erom bekend soms met overtuiging onjuiste informatie te presenteren — een fenomeen dat in de sector hallucinatie wordt genoemd.

Voorbeelden uit de praktijk

Een aantal concrete projecten illustreert hoe taakdecompositie zich de afgelopen jaren heeft ontwikkeld:

  • ReAct (2022) — het hierboven genoemde raamwerk van Princeton University en Google Research liet voor het eerst op overtuigende wijze zien hoe een taalmodel redeneerstappen kan afwisselen met concrete acties, zoals het raadplegen van Wikipedia, om een vraag te beantwoorden.
  • AutoGPT en BabyAGI (2023) — twee van de eerste open-source experimenten waarin een taalmodel zelfstandig een doel kreeg (bijvoorbeeld "onderzoek de markt voor elektrische fietsen") en vervolgens zelf een lijst van subtaken genereerde, uitvoerde en bijstelde. Deze projecten trokken in het voorjaar van 2023 veel aandacht, maar bleken in de praktijk vooral interessante proof-of-concepts: ze liepen regelmatig vast in eindeloze lussen of verloren de oorspronkelijke opdracht uit het oog, en waren niet geschikt voor productiegebruik.
  • HuggingGPT (2023) — onderzoekers van Microsoft Research en Zhejiang University ontwikkelden een systeem waarbij ChatGPT fungeert als "controller": het ontleedt een complexe gebruikersvraag in deeltaken en verdeelt die vervolgens over gespecialiseerde AI-modellen op het platform Hugging Face, bijvoorbeeld één model voor beeldherkenning en een ander voor spraak-naar-tekst.
  • Agentische coding-assistenten (2024-2025) — tools zoals Claude Code van Anthropic splitsen een programmeeropdracht op in subtaken: eerst relevante bestanden opzoeken, dan code lezen, vervolgens aanpassingen schrijven, en ten slotte tests uitvoeren om te controleren of de wijziging werkt. Dit is een directe toepassing van taakdecompositie op software-ontwikkeling.

Hoe ver is de techniek?

De techniek heeft de afgelopen drie jaar grote sprongen gemaakt, maar is nog geen opgeloste zaak. Voor middelgrote, goed afgebakende taken — zoals het doorzoeken van documentatie, het uitvoeren van een specifieke programmeeropdracht, of het beantwoorden van een vraag die meerdere zoekopdrachten vereist — werken moderne agents inmiddels behoorlijk betrouwbaar.

Het grootste obstakel blijft wat onderzoekers error compounding noemen: foutopstapeling. Als een agent een lange keten van tien of twintig stappen moet doorlopen en bij elke stap een kleine kans op een fout heeft, groeit de kans dat de hele opdracht uiteindelijk misgaat snel. Een foutpercentage van vijf procent per stap klinkt onschuldig, maar leidt bij twintig opeenvolgende stappen tot een kans van ruim zestig procent dat er ergens iets misgaat.

Om de voortgang objectief te meten, zijn er benchmarks ontwikkeld. Een bekend voorbeeld is SWE-bench, een testverzameling van onderzoekers verbonden aan Princeton en Stanford, waarbij AI-agents worden gevraagd om echte, bestaande software-problemen van GitHub op te lossen. De resultaten op zulke benchmarks zijn de afgelopen twee jaar flink verbeterd, maar zelfs de beste systemen lossen nog niet alle problemen correct op.

Eerlijkheidshalve: volledig autonome agents die zonder enige menselijke controle kritieke taken uitvoeren — denk aan financiële transacties of medische beslissingen — worden door vrijwel alle grote onderzoekslaboratoria nog als te onbetrouwbaar beschouwd. De gangbare praktijk is dan ook dat mensen toezicht houden, tussentijdse resultaten controleren, en bij twijfel kunnen ingrijpen.

Wie werken eraan?

Taakdecompositie en agentic AI zijn een actief onderzoeksveld waarin zowel grote techbedrijven als universiteiten een rol spelen. Tot de belangrijkste commerciële partijen behoren OpenAI (maker van GPT en ChatGPT), Anthropic (maker van Claude), Google DeepMind en Microsoft Research. Ook Meta AI publiceert regelmatig onderzoek op dit gebied.

Op academisch vlak zijn instituten als Princeton University, Stanford University en UC Berkeley belangrijke bijdragers geweest aan fundamentele technieken zoals ReAct en Tree of Thoughts. Veel van dit onderzoek wordt gepubliceerd als voorpublicatie ("preprint") op arXiv, een online archief waar wetenschappers hun bevindingen delen nog voordat ze formeel zijn beoordeeld door vakgenoten (peer review). Dat betekent dat niet elk gepubliceerd resultaat al definitief is bevestigd — iets om in gedachten te houden bij het lezen van nieuws over doorbraken op dit gebied.

Verder lezen