AI & computingAgentic AI & autonome agents

Nvidia: niet het AI-model, maar de software eromheen bepaalt succes van agents

· Bijgewerkt 21 augustus 2026, 22:36 · 2 min leestijd

Agentic AI & autonome agents
Beeld: TechCrunch

Nvidia laat in nieuw onderzoek zien dat de software rond een AI-model — het zogeheten harnas — veel belangrijker is dan het model zelf als een AI-agent lange, complexe taken moet uitvoeren. Met een aangepast harnas haalde het taalmodel Claude Opus 5 een perfecte score op een lastige testreeks, tegen slechts 30 procent zonder die aanpassing.

Wie een AI-agent een lastige taak geeft die uit veel opeenvolgende stappen bestaat, doet er goed aan niet alleen naar het onderliggende taalmodel te kijken. Dat blijkt uit onderzoek van chipmaker Nvidia, gepubliceerd op 21 augustus. Het bedrijf ontdekte dat de software-laag rond een taalmodel — het zogeheten agentharnas — een veel grotere rol speelt bij het slagen van complexe taken dan gedacht.

Van 30 naar 100 procent

Nvidia testte het taalmodel Claude Opus 5 van AI-bedrijf Anthropic op ARC-AGI-3, een testreeks van 2D-spelletjes zonder instructies. Een AI moet zelf ontdekken hoe zo'n spel werkt en het vervolgens winnen, net als een mens dat zou doen. Zonder speciale aanpassingen haalde Opus 5 een score van 30 procent, het hoogste resultaat van alle geteste modellen. Met een op maat gemaakt harnas — inclusief een systeem dat het geheugen van de AI slim beheert en een "toezichthouder" die ingrijpt als de AI vastloopt — steeg de score naar 100 procent.

Dat verschil is opvallend, omdat gebruikers een AI-agent vaak zien als simpelweg het taalmodel zelf. Volgens Adel El Hallack, vice president product bij Nvidia's AI-afdeling, klopt dat beeld niet. Een agent bestaat ook uit de tools die het model gebruikt, de systemen die eromheen draaien en de vaardigheden die het krijgt aangereikt. Dat geheel noemt Nvidia het harnas.

Het probleem van lange taken

De uitdaging zit vooral in taken die dagen kunnen duren en uit veel losse beslissingen bestaan. AI-modellen raken daarbij makkelijk de weg kwijt. Microsoft ontdekte in april dat negentien geteste taalmodellen, ook de beste, fouten stapelden bij het langdurig bewerken van documenten. Eerder zijn AI-agents ook al betrapt op het per ongeluk wissen van bestanden en zelfs hele databases van gebruikers.

Ook OpenAI, de maker van ChatGPT, worstelde met ARC-AGI-3: zijn modellen scoorden er minder dan 10 procent op. Door twee instellingen in het harnas aan te passen verdrievoudigde OpenAI die score, maar het bedrijf kwam bij lange na niet in de buurt van de 100 procent die Nvidia haalde.

Een 'toezichthouder' voor de AI

De sleutel bij Nvidia bleek een tweede, toezichthoudende AI die als een soort leidinggevende optreedt. Deze hulp-agent grijpt in wanneer de hoofdagent vastloopt of dreigt terug te vallen in een aanpak die eerder niet werkte. De meeste agents die mensen vandaag gebruiken, zoals Claude Code, Codex of Hermes, werken nog met maar één laag harnas, zonder zo'n toezichthouder.

Nvidia bouwde voor het onderzoek een eigen verbeterd harnas, maar benadrukt dat dit geen nieuw product is. Het bedrijf levert wel losse open bouwstenen voor harnassen via zijn Nemo-merk. Ook softwarebedrijf Databricks publiceerde deze zomer onderzoek dat in dezelfde richting wijst: hetzelfde model kan met een verkeerd harnas twee keer zoveel kosten. Nvidia's boodschap is dat open, aanpasbare harnassen gebruikers meer grip geven op zowel de prestaties als de kosten van AI-agents dan het kiezen van 'het beste model' alleen.

Achtergrond & begrippen

Wat betekent dit voor de toekomst? Dit onderzoek verschuift de aandacht in de AI-wereld van steeds krachtigere taalmodellen naar de software die deze modellen aanstuurt. Voor bedrijven en ontwikkelaars betekent dit dat investeren in een goed harnas, met geheugenbeheer en een toezichthoudende component, minstens zo belangrijk is als de keuze van het AI-model zelf. Dat kan ook leiden tot betrouwbaardere AI-agents die minder snel fouten maken bij langdurige, complexe klussen.

Agentharnas
De software-laag rond een AI-model die geheugen, tools en aansturing regelt, en die van een taalmodel een handelende AI-agent maakt.
Taalmodel
Een AI-systeem dat is getraind om tekst te begrijpen en te genereren, en de kern vormt van een AI-agent.
AI-agent
Een AI-systeem dat niet alleen antwoord geeft, maar zelfstandig meerdere stappen onderneemt om een taak te voltooien.
Benchmark
Een gestandaardiseerde test waarmee de prestaties van verschillende AI-modellen met elkaar vergeleken worden.
Toezichthoudende agent (supervisor)
Een tweede AI die een hoofdagent bijstuurt wanneer die vastloopt of een verkeerde aanpak blijft herhalen.
Lange-horizontaak
Een taak die uit veel opeenvolgende beslissingen bestaat en soms dagen in beslag neemt, in tegenstelling tot een simpel vraag-antwoordmoment.

Bronnen

Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.

Meer over Agentic AI & autonome agents