AI & computing › Agentic AI & autonome agents
Nvidia halveert tokenverbruik van AI-codeeragents met slimmere besturingslaag
Nvidia-onderzoekers hebben een systeem ontwikkeld dat de besturingslaag van AI-codeeragents automatisch optimaliseert. Het systeem, SoL-Pi, laat het tokenverbruik met bijna de helft dalen terwijl de prestaties nauwelijks achteruitgaan. Dat scheelt aanzienlijk in de rekenkosten van agents zoals Codex en Claude Code.
AI-agents die zelfstandig code schrijven, worden duurder naarmate ze langer doorwerken. Elke stap in een lange keten van redeneren, tools aanroepen en feedback verwerken kost tokens, de rekeneenheden waarin AI-modellen tekst verwerken en die per stuk geld kosten. Nvidia-onderzoekers pakken dit probleem nu niet aan bij het AI-model zelf, maar bij de agentharnas: de softwarelaag die bepaalt hoe een agent zijn omgeving waarneemt, acties uitvoert en feedback verwerkt. Systemen als Codex, Claude Code en OpenClaw draaien allemaal op zo'n harnas.
Een AI die de besturingslaag van een andere AI verbetert
Het optimaliseren van een harnas is lastig omdat onderdelen als toolgebruik, geheugenbeheer en foutafhandeling sterk met elkaar verweven zijn. Verander je iets om tokens te besparen, dan kan dat ergens anders juist fouten veroorzaken. Normaal gesproken vlooien mensen lange uitvoeringslogs door om zulke patronen met de hand te verhelpen. Het nieuwe systeem, SoL-Pi, automatiseert dat proces: een 'onderzoeks-AI' bekijkt de logs van een werkende agent, stelt aanpassingen voor en test die in voorbereide testomgevingen. Alleen wijzigingen die zowel kosten besparen als de prestaties op peil houden, overleven de selectie. De onderzoekers noemen dit een vorm van recursieve zelfverbetering: AI die de gereedschappen van AI verbetert.
Om te voorkomen dat het systeem zichzelf voor de gek houdt, hielden de onderzoekers de uiteindelijke testset, EdgeBench, volledig gescheiden van het zoekproces. Van de 51 openbare taken werden er 11 gebruikt om tussentijds te controleren en 40 puur voor de eindbeoordeling, waarvan de resultaten nooit teruglekten naar de zoekfase. In totaal doorzocht het systeem 152 verschillende aanpassingen, verdeeld over 535 testomgevingen, goed voor ruim 3.000 testruns en meer dan 60.000 interacties tussen agent en omgeving.
Vier trucs om tokens te besparen
De zoektocht leverde vier concrete mechanismen op. Action Fusion voegt twee opeenvolgende stappen samen, zoals een code-aanpassing gevolgd door een testrun, waardoor een hele aanroep van het taalmodel wegvalt. Online Context Compact ruimt na elke planningsstap overbodige informatie op zonder belangrijke details te verliezen, een vorm van contextcompactie. ObservationPack vervangt lange tooluitvoer door een korte samenvatting in plaats van steeds de volledige tekst opnieuw te versturen. De Evidence-Preserving Reducer stuurt omvangrijke foutlogs naar een goedkoper model dat de kern eruit filtert, met een controlestap die cruciale details opvangt.
Tot 49 procent minder tokens, wisselend resultaat elders
Op EdgeBench presteert de meest zuinige combinatie van alle vier mechanismen ongeveer even goed als het originele Pi-harnas, met 49 procent minder tokenverbruik en 93,7 procent van de oorspronkelijke score. Wie liever op prestaties inzet, kan met slechts één mechanisme zelfs 5,3 procent beter scoren dan Pi, met nog altijd fors minder tokens. In dollars omgerekend daalden de kosten van 1.339 naar 894 dollar per taak, en de onderzoekers schatten besparingen tot 13,50 dollar per uur ten opzichte van de standaardharnassen van Codex en Claude Code.
Buiten EdgeBench is het beeld gemengder. Op de zwaardere Terminal-Bench-taken loste SoL-Pi minder taken op dan Codex en Pi, al bleven de totale kosten wel lager. Bij wiskundige bewijsopgaven en een test met een zwerm van 20 samenwerkende agents presteerde het systeem juist weer sterk. Dat past bij een breder patroon: volgens platform OpenRouter is het tokenverbruik van AI-agents sinds februari 2026 vertienvoudigd, wat de druk op efficiëntere harnassen alleen maar groter maakt.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-agents zichzelf goedkoper kunnen maken door hun eigen besturingssoftware te optimaliseren, wordt langdurig autonoom werken door AI betaalbaarder en dus aantrekkelijker voor bedrijven. Tegelijk laat het onderzoek zien dat zulke geautomatiseerde optimalisaties niet vanzelfsprekend overal even goed werken, wat vraagt om zorgvuldige tests voordat ze breed worden ingezet.
- Agentharnas
- De softwarelaag tussen een AI-taalmodel en zijn omgeving, die bepaalt hoe de agent waarneemt, handelt en feedback verwerkt.
- Token
- De kleine tekstbrokjes waarin AI-taalmodellen taal verwerken; elk token kost rekenkracht en dus geld.
- Contextcompactie
- Het proces waarbij een AI-systeem overbodige of oude informatie uit zijn werkgeheugen verwijdert om efficiënter te blijven werken.
- Recursieve zelfverbetering
- Een aanpak waarbij een AI-systeem wordt ingezet om een ander AI-systeem (of zichzelf) stap voor stap te verbeteren.
- Benchmark
- Een gestandaardiseerde testset waarmee de prestaties van AI-systemen onderling vergelijkbaar worden gemaakt.
- Sub-agent
- Een hulp-AI die door een hoofdagent wordt ingezet om een deeltaak zelfstandig uit te voeren.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.