AI & computing › Agentic AI & autonome agents
Google DeepMind laat AI-agents dromen om sneller de beste oplossing te vinden
Onderzoekers van Google DeepMind hebben een methode ontwikkeld die AI-agents helpt efficiënter te zoeken naar oplossingen voor lastige taken, zoals snellere code of betere algoritmes. De techniek, Dream-RSI genaamd, laat een agent 'dromen' over eerdere zoekpogingen om nieuwe strategieën te testen zonder dure herberekeningen. Bij tests vond het systeem betere oplossingen met tot honderd keer minder pogingen dan concurrerende methodes.
Onderzoekers van Google en DeepMind hebben een methode ontwikkeld waarmee AI-agents sneller de beste aanpak vinden voor complexe zoekopdrachten, zoals het ontwerpen van efficiëntere code of wiskundige oplossingen. De techniek heet Dream-RSI en laat een agent 'dromen' over eerdere pogingen, zodat hij nieuwe strategieën kan uitproberen zonder telkens opnieuw dure berekeningen te maken.
Te veel wegen, te weinig rekentijd
Zelflerende AI-systemen die algoritmes, code of wiskundige oplossingen bedenken, werken volgens een vast patroon: ze stellen een oplossing voor, testen die, leren van het resultaat en proberen het opnieuw. Na duizenden pogingen ontstaat zo een steeds beter resultaat. Bij ingewikkelde taken groeit het aantal mogelijke aanpakken echter enorm. De agent moet voortdurend kiezen welke sporen hij verder volgt, welke hij naast elkaar uitprobeert en welke hij laat vallen. Die afweging bepaalt vaak of de zoektocht slaagt of dat kostbare rekentijd verloren gaat aan doodlopende paden. Bestaande oplossingen schieten hierin tekort: een vaste zoekstrategie leert niets van eerdere fouten, terwijl een strategie die zich tijdens het zoeken aanpast juist erg duur is, omdat elke nieuwe aanpak in de praktijk moet worden getest.
Dromen over de eigen zoektocht
Het team omschrijft de aanpak met een herkenbaar voorbeeld: wie voor het eerst door een onbekende buurt loopt, verdwaalt en moet omkeren. Zodra je een mentale plattegrond hebt, kun je een nieuwe route uitstippelen zonder alles opnieuw te belopen. Dream-RSI past dat principe toe op de zoekgeschiedenis van een AI-agent. Tijdens elke zoekpoging legt het systeem alle keuzes en resultaten vast in een zogeheten zoekboom. Wil de agent daarna een andere strategie uittesten, dan hoeft hij die niet in een nieuwe, dure zoekronde te proberen. In plaats daarvan speelt hij duizenden alternatieve strategieën af tegen de al opgeslagen resultaten, zonder het onderliggende taalmodel opnieuw aan te roepen. Zo ontdekt de agent welke aanpak het beste werkt, voordat hij die inzet in een echte, kostbare zoekronde. Dit proces herhaalt zich in een lus: na elke live zoekactie verbetert de agent zijn strategie op basis van dromen, en past hij die verbeterde versie toe in de volgende ronde.
Minder pogingen, hetzelfde of beter resultaat
De onderzoekers testten Dream-RSI met de taalmodellen Gemini 3.1 Pro en Gemini 3.7 Flash op acht taken uit drie vakgebieden, in een benchmark tegen een vaste zoekstrategie als uitgangspunt. Bij een opdracht om zo snel mogelijke code te schrijven voor een statistische berekening die veel wordt gebruikt in genomica en financiële analyse, versloeg de door Dream-RSI geschreven code de gevestigde softwarebibliotheken sklearn en glmnet op alle zes testdatasets. Met Gemini 3.1 Pro daalde de gemiddelde rekentijd van 3.587 naar 2.931 milliseconden, terwijl het aantal benodigde pogingen terugliep van 550 naar 317. Een concurrerend systeem, SimpleTES, had voor een vergelijkbaar resultaat maar liefst 51.200 pogingen nodig. Ook bij wiskundige optimalisatietaken en het schrijven van efficiënte GPU-kernels boekte de methode vergelijkbare of betere resultaten tegen veel lagere rekenkosten: op sommige taken daalde het aantal benodigde pogingen tot 2,43 keer, op andere steeg de prestatie tot 2,09 keer bij hetzelfde rekenbudget. Interessant genoeg werkte een alternatieve aanpak, waarbij zoekgeschiedenis werd omgezet in expliciete instructies voor de agent, juist averechts op één van de GPU-taken: te specifieke aanwijzingen bleken de zoekruimte te veel te beperken.
De ontwikkeling past in een bredere trend rond recursieve zelfverbetering van AI-systemen. Eerder introduceerde Google DeepMind AlphaEvolve, dat met een vergelijkbaar principe werkt maar zich richt op het verbeteren van code zelf. Dream-RSI opereert een niveau hoger, door niet de oplossingen maar de zoekstrategie te optimaliseren.
Achtergrond & begrippen
Wat betekent dit voor de toekomst? Als AI-systemen zichzelf efficiënter kunnen verbeteren zonder telkens dure herberekeningen nodig te hebben, wordt onderzoek naar nieuwe algoritmes, medicijnen of materialen potentieel veel goedkoper en sneller. Dat kan de ontwikkeling van zelflerende AI-agents die autonoom wetenschappelijke doorbraken najagen een flinke stap dichterbij brengen, al blijft menselijk toezicht op zulke systemen belangrijk.
- Dream-RSI
- De methode van Google en DeepMind waarbij een AI-agent zijn eigen opgeslagen zoekgeschiedenis hergebruikt om goedkoop nieuwe zoekstrategieën te testen, in plaats van dure nieuwe zoekrondes uit te voeren.
- Zoekstrategie
- De manier waarop een AI-agent beslist welke oplossingen hij verder onderzoekt, welke hij naast elkaar probeert en welke hij laat vallen tijdens een zoekproces.
- Zoekboom
- De verzameling van alle geprobeerde oplossingen en hun resultaten tijdens een zoekproces, opgeslagen zodat die later opnieuw doorzocht kan worden zonder nieuwe berekeningen.
- Exploratie
- Het proces waarbij een AI-agent afweegt welke onderzoeksrichtingen de moeite waard zijn om verder te volgen, cruciaal bij taken met een enorme hoeveelheid mogelijke oplossingen.
- GPU-kernel
- Een stukje programmacode dat specifiek is geschreven om razendsnel te worden uitgevoerd op een grafische chip (GPU), vaak gebruikt voor zware rekentaken in AI.
- Recursieve zelfverbetering
- Het idee dat een AI-systeem zichzelf, of zijn eigen manier van werken, steeds verder optimaliseert zonder daarbij telkens menselijke aansturing nodig te hebben.
Bronnen
Dit artikel is met behulp van AI geschreven op basis van bovenstaande bronnen en is geen letterlijke vertaling. Zo werkt onze redactie.